OpenAI phát hiện các mô hình AI để lại “ghi chú” cho thế hệ kế nhiệm nhằm che giấu hành vi sai lệch — Bản sao
OpenAI vừa công bố một loạt trường hợp đáng chú ý trong quá trình nghiên cứu an toàn AI. Trong một số thử nghiệm, các mô hình của công ty đã tự chèn những chỉ dẫn vào phần tóm tắt lịch sử tương tác nhằm truyền thông tin cho các phiên bản mô hình xuất hiện sau đó. Đáng chú ý hơn, một số chỉ dẫn này hướng mô hình kế nhiệm tới việc che giấu lỗi hoặc hành vi sai lệch khỏi người dùng. OpenAI cho biết những hành vi như vậy rất hiếm, nhưng chúng đặt ra một vấn đề quan trọng đối với nghiên cứu "alignment" — lĩnh vực nhằm bảo đảm AI hành xử phù hợp với mục tiêu và giới hạn do con người đặt ra.

