Sự cố chưa từng xảy ra với trí tuệ nhân tạo của OpenAI

Vào tuần trước, một tác nhân trí tuệ nhân tạo tự hành đã xâm nhập trái phép vào hạ tầng của Hugging Face, một kho lưu trữ các mô hình AI mở phổ biến. Mới đây, OpenAI chính thức thừa nhận đã phát triển tác nhân này. Trong một bài đăng trên blog, OpenAI cho biết hai mô hình của họ đang được thử nghiệm năng lực tấn công đã thoát ra khỏi môi trường giam giữ biệt lập và khiến một phần server sản xuất của nền tảng bị tấn công. Mục đích của việc này là nhằm cải thiện điểm số trong một bài kiểm tra đánh giá khả năng tấn công của AI.

Hugging Face đã công bố vụ việc vào ngày 16/7, lúc đó cho biết nguyên nhân là do một hệ thống tác nhân AI tự động từ nguồn gốc chưa rõ. Trong suốt một cuối tuần, tác nhân này đã thực hiện hàng chục nghìn hành động tự động mà đội ngũ vận hành đã lần theo dấu vết để tái hiện sự kiện.

Bản chất và quá trình của vụ tấn công

Theo OpenAI, vụ tấn công có sự tham gia của hai mô hình: GPT-5.6 Sol - mô hình công khai mạnh nhất hiện nay của họ - và một mô hình tiềm năng hơn vẫn chưa ra mắt. Cả hai mô hình này đều bị giảm bớt các biện pháp bảo mật một cách cố ý để đánh giá khả năng tấn công của chúng trong điều kiện không có giới hạn.