Không có thông báo nào

Base Labs hợp tác với Hugging Face và Goodfire để xây dựng tiêu chuẩn an toàn cho AI mã nguồn mở

Base Labs, nhóm nghiên cứu thuộc công ty hạ tầng AI Baseten, vừa công bố hợp tác với Hugging Face và Goodfire AI để phát triển hệ thống đánh giá và giám sát an toàn cho các mô hình AI open-weight. Sáng kiến được đưa ra trong bối cảnh cộng đồng AI ngày càng quan tâm đến rủi ro khi các mô hình mở có thể bị chỉnh sửa và loại bỏ những cơ chế bảo vệ ban đầu.

Hơn 6.000 mô hình AI đã bị “abliteration”

Một trong những vấn đề mà sáng kiến này hướng tới là abliteration – kỹ thuật có thể loại bỏ hoặc làm suy yếu các cơ chế khiến mô hình từ chối những yêu cầu nguy hiểm. Theo TechCrunch, Hugging Face hiện liệt kê hơn 6.000 mô hình đã được abliterated, cho thấy quy mô của vấn đề trong hệ sinh thái AI open-weight. Base Labs muốn phát triển các phương pháp để đào tạo, đánh giá và giám sát mô hình mở, đồng thời biến chúng thành một tiêu chuẩn minh bạch được tích hợp ngay trong quá trình huấn luyện và triển khai, thay vì chỉ bổ sung lớp an toàn sau khi mô hình đã hoàn thiện.

Hơn 6.000 mô hình AI đã bị “abliteration”

Hugging Face và Goodfire sẽ đóng vai trò gì?

Hugging Face mang đến hệ sinh thái lớn dành cho các mô hình AI open-source và open-weight, trong khi Goodfire AI tập trung vào lĩnh vực interpretability – tìm cách giải thích cách các mô hình AI đưa ra quyết định. Sự kết hợp này nhằm tạo ra những công cụ giúp phát hiện và theo dõi các hành vi không an toàn của mô hình một cách minh bạch hơn. Hiện ba công ty chưa công bố chi tiết kỹ thuật về cách hệ thống sẽ hoạt động. Goodfire cho rằng an toàn cần được tích hợp trực tiếp vào các mô hình mở cũng như những nền tảng cung cấp chúng, thay vì chỉ được xử lý ở lớp bên ngoài.

Hugging Face và Goodfire

Base Labs muốn cộng đồng cùng xây dựng tiêu chuẩn

Base Labs cho biết họ sẽ mở rộng dự án cho cộng đồng nhà phát triển tham gia đóng góp. Công ty cho rằng tính mở của AI có thể trở thành một lợi thế cho an toàn, bởi việc tiếp cận trọng số và hành vi của mô hình giúp các nhà nghiên cứu có thêm khả năng kiểm tra, phân tích và xây dựng các biện pháp kiểm soát minh bạch. Nếu được triển khai rộng rãi, sáng kiến này có thể tạo ra một hướng tiếp cận mới cho AI open-weight: không chỉ cung cấp mô hình để cộng đồng tự do sử dụng và chỉnh sửa, mà còn xây dựng các công cụ giúp đánh giá mức độ an toàn của chúng trong suốt vòng đời phát triển.

Nguồn: techcrunch

Cộng đồng: