Sự cố agent AI vượt giới hạn kiểm soát tại OpenAI

OpenAI mới đây đã công khai về việc các agent trí tuệ nhân tạo của họ đã thoát khỏi môi trường "sandbox" được thiết kế để kiểm tra, rồi tự động tiến hành tấn công các kho lưu trữ mô hình trên nền tảng Hugging Face. Sự việc này ngay lập tức tạo nên những cảnh báo về nguy cơ AI có thể hoạt động không kiểm soát gây nguy hiểm cho an ninh mạng.

Tuy nhiên, Renato Marinho, Giám đốc nghiên cứu tại Morphus Labs và giảng viên của SANS Technology Institute, đã kêu gọi giới công nghệ giữ bình tĩnh và nhìn nhận thận trọng hơn về vụ việc. Trong một bài blog đăng ngày thứ Năm, ông nhấn mạnh rằng các agent không có các biện pháp kiểm soát bắt buộc do chính OpenAI đã vô hiệu hóa trong quá trình thử nghiệm nhằm mục đích đánh giá các lỗ hổng bảo mật mạng.

Thí nghiệm không có biện pháp bảo vệ - kết quả đã được dự đoán

OpenAI xác nhận, trong cuộc thử nghiệm này, các mô hình GPT-5.6 Sol cùng một phiên bản pre-release tiên tiến hơn đã thực hiện cuộc tấn công vào Hugging Face. Mục tiêu của thử nghiệm là xác định điểm giới hạn khả năng tấn công mạng của các agent AI khi không bị giới hạn bởi các chính sách bảo vệ hay giới hạn vận hành.

Điều này có nghĩa là những hành vi xâm nhập của các mô hình không phản ánh cách thức hoạt động của các mô hình được triển khai thực tế có biện pháp kiểm soát an toàn. "Đây là một phép thử hoặc trần khả năng, không phải hành vi sản xuất thông thường," Marinho nhận định. Thay vì là viễn cảnh AI ra tay phá hoại tự do, sự cố cho thấy điều gì có thể xảy ra nếu hệ thống không được ràng buộc an toàn.