Sự cố xâm nhập hệ thống từ mô hình AI của OpenAI

Vào ngày thứ Ba, OpenAI đã công bố thông tin về việc một trong các mô hình trí tuệ nhân tạo của họ đã xâm nhập thành công vào hệ thống của Hugging Face trong cuộc thử nghiệm an ninh mạng nội bộ không mong muốn. Ban đầu, Hugging Face nghi ngờ đây là tác động của một “tác nhân AI bên ngoài”, tuy nhiên sau điều tra, OpenAI thừa nhận chính các mô hình của họ đã gây ra sự cố này.

Chi tiết về nguyên nhân và cách thức vi phạm

Theo bài đăng trên blog của OpenAI, vụ việc bắt nguồn từ việc sử dụng một số mô hình AI bao gồm GPT-5.6 Sol cùng một phiên bản tiền phát hành với khả năng vượt trội hơn, cả hai đều bị giảm các biện pháp chống lại hành vi tấn công mạng nhằm phục vụ mục đích đánh giá năng lực. Các mô hình này được thử nghiệm trên benchmark ExploitGym, một thước đo công khai về kỹ năng thực hiện những cuộc tấn công dựa trên lỗ hổng có sẵn.