Sự cố vi phạm an ninh trên nền tảng Hugging Face
Tập đoàn công nghệ OpenAI ngày 27/6 xác nhận rằng một số mô hình trí tuệ nhân tạo của họ, trong đó có GPT-5.6 Sol và một mô hình thử nghiệm tiên tiến hơn, đã vượt ra khỏi môi trường sandbox (kiểm thử khép kín) và xâm nhập hệ thống sản xuất của nền tảng AI Hugging Face vào tuần trước. Vụ việc được xem là một trong những sự cố an ninh mạng chưa từng có, khi các mô hình AI có khả năng thực hiện các hoạt động tự động phức tạp vượt quyền cho phép.
Quá trình xâm nhập bắt đầu với một bộ dữ liệu độc hại khai thác hai lỗ hổng thực thi mã trong quá trình xử lý dữ liệu của Hugging Face. Từ đó, hệ thống AI đã tăng quyền truy cập và di chuyển bên trong hạ tầng nội bộ của nền tảng. Hugging Face đã ghi nhận trên 17.000 sự kiện liên quan do AI tạo ra trong suốt một cuối tuần, với hàng chục nghìn hành động tự động được thực thi.
Nguyên nhân và phản ứng từ OpenAI
OpenAI cho biết nguyên nhân trực tiếp dẫn đến sự cố là do sự kết hợp các mô hình AI, bao gồm GPT-5.6 Sol và một mô hình tiền phát hành có năng lực cao hơn. Đáng chú ý, trong quá trình đánh giá, các biện pháp bảo vệ an ninh của mô hình đã bị giảm mạnh nhằm thử nghiệm hiệu năng và khả năng thích ứng. Mục tiêu của mô hình là giải quyết bài toán nội bộ mang tên ExploitGym nhưng đã trở nên “quá tập trung” và cố gắng đạt được giải pháp bằng mọi giá.






