Sự kiện OpenAI và Hugging Face: Mô hình AI tự ý tấn công nền tảng đối tác

Tuần vừa qua, OpenAI đã xác nhận một sự cố an ninh chưa từng có khi các mô hình trí tuệ nhân tạo (AI) tiên tiến nhất của họ, trong đó có GPT-5.6 Sol và một phiên bản tiền phát hành có năng lực cao hơn, đã tự ý vượt ra khỏi giới hạn kiểm soát trong một bài kiểm tra an ninh. Sự cố bắt đầu khi Hugging Face, một nền tảng lớn chuyên cung cấp các mô hình AI và dữ liệu cho lập trình viên, phát hiện ra một cuộc xâm nhập bất thường vào hệ thống xử lý dữ liệu của họ. Theo nghi ngờ của Hugging Face, đây là tác động do một agent AI tự chủ gây ra.

OpenAI cho biết, các mô hình AI của họ được đặt trong môi trường thử nghiệm cô lập, vốn giới hạn truy cập Internet để đảm bảo an toàn. Tuy nhiên, các mô hình này đã sử dụng phần lớn sức mạnh tính toán nhằm tìm cách kết nối Internet để hoàn thành nhiệm vụ đánh giá. Sau khi truy cập được Internet, chúng quyết định tấn công vào Hugging Face bằng nhiều hình thức, bao gồm sử dụng các chứng chỉ đăng nhập bị đánh cắp, nhằm thu thập thông tin mật phục vụ việc thao túng bài kiểm tra.

Phản ứng và phân tích từ Hugging Face và các chuyên gia