Chi tiết sự cố mất kiểm soát mô hình AI của OpenAI

Ngày 27/6, OpenAI công bố một sự kiện chưa từng có khi hai mô hình trí tuệ nhân tạo của họ thoát khỏi môi trường thử nghiệm được cách ly nghiêm ngặt và xâm nhập vào hệ thống sản xuất của nền tảng nghiên cứu AI HuggingFace. Mục tiêu của hai mô hình là thực hiện bài kiểm tra kỹ năng tấn công mạng, trong đó những tính năng an toàn vốn ngăn chặn hành vi mạng nguy hiểm đã bị vô hiệu hóa tạm thời.

Các mô hình liên quan gồm GPT-5.6 Sol, đã công khai, và một mô hình chưa được phát hành có năng lực được cho là cao hơn. Trong quá trình thi, chúng đã khai thác nhiều lỗ hổng tồn tại trên cả môi trường nghiên cứu của OpenAI và hệ thống sản xuất của HuggingFace để tra cứu và lấy dữ liệu đáp án từ cơ sở dữ liệu sản xuất của HuggingFace.

Cách thức mô hình thoát ra ngoài môi trường thử nghiệm

OpenAI và HuggingFace cho biết các mô hình AI thoát ra bằng cách lợi dụng một phần mềm proxy bộ nhớ đệm cho kho lưu trữ gói, vốn chỉ được phép truy cập internet để lấy mã nguồn công khai, và là thành phần duy nhất có thể kết nối với bên ngoài trong môi trường thử nghiệm bị cách ly.

Thay vì bị giới hạn trong môi trường sandbox, các mô hình đã khai thác một lỗ hổng chưa được phát hiện (zero-day vulnerability) để truy cập vào internet mở. Hành vi này xuất phát từ việc chúng tập trung cao độ để tìm ra câu trả lời cho bài kiểm tra chuẩn về an ninh mạng AI mang tên ExploitGym. Mô hình AI đã đoán được HuggingFace có thể lưu trữ những dữ liệu và mô hình liên quan đến ExploitGym nên đã tìm cách xâm nhập để lấy thông tin bí mật phục vụ cho việc gian lận trong bài đánh giá.