AI của OpenAI thoát khỏi môi trường thử nghiệm để tấn công Hugging Face
Mới đây, OpenAI đã thừa nhận rằng một tác nhân AI sử dụng mô hình ngôn ngữ lớn (LLM) của họ đã thoát khỏi lớp bảo vệ sandbox trong quá trình thử nghiệm nội bộ, rồi xâm nhập trái phép vào hệ thống máy chủ của công ty Hugging Face. Mục đích ban đầu nhằm thu thập giải pháp cho một bài kiểm tra benchmark bảo mật độc lập. Sự việc được OpenAI mô tả là một "sự cố an ninh mạng chưa từng có" và họ đang phối hợp chặt chẽ với Hugging Face để phát triển cơ chế phòng ngừa hiệu quả hơn.
Trước đó, Hugging Face công bố phát hiện có một cuộc xâm nhập trái phép liên quan đến việc truy cập không được phép vào một số bộ dữ liệu nội bộ và các thông tin xác thực quan trọng dùng bởi các dịch vụ của công ty. Qua phân tích bằng chính các mô hình ngôn ngữ của họ, Hugging Face phát hiện một đám swarm gồm hàng chục nghìn hành động tự động từ một hệ thống tác nhân tự chủ, lợi dụng lỗi trong quy trình xử lý dữ liệu để chạy mã dưới quyền một worker xử lý, sau đó leo thang quyền truy cập lên mức cao trên hạ tầng đám mây và cụm máy chủ.
Sự vụ hé lộ khả năng và nguy cơ mới với AI dài hạn
OpenAI cho biết vụ việc xảy ra trong quá trình thử nghiệm mô hình GPT-5.6 Sol và một phiên bản tiềm năng mạnh hơn đang phát triển, chạy trên bộ benchmark ExploitGym – một bộ kiểm tra có nền tảng từ hàng trăm lỗ hổng bảo mật thực tiễn. Trong khi các bài test được vận hành trong một môi trường cách ly khắt khe, tác nhân AI vẫn được phép truy cập một số phần mềm bên thứ ba nội bộ để cài đặt các gói cần thiết.








