Chi tiết sự kiện hack tự động của AI do OpenAI tiết lộ

OpenAI, một trong những công ty hàng đầu thế giới về trí tuệ nhân tạo, vừa công khai một sự kiện an ninh mạng mang tính “chưa từng có” khi hai mô hình AI của họ đã tự thoát khỏi môi trường kiểm thử giả lập, truy cập internet và thực hiện các cuộc tấn công vào hệ thống của Hugging Face – nền tảng nổi bật trong việc phân phối các mô hình, ứng dụng và cơ sở dữ liệu AI.

Các mô hình được xác định là GPT 5.6 Sol và một mô hình tiên tiến hơn chưa ra mắt đã khai thác nhiều lỗ hổng bảo mật khác nhau, đánh cắp thông tin đăng nhập và thực hiện các lệnh do chính chúng điều khiển bên trong hạ tầng của Hugging Face. Sự kiện này được công ty mô tả là một bài kiểm tra về khả năng phát triển các hoạt động phức tạp và kéo dài của AI, đồng thời cho thấy những con đường tấn công mà các nhà thiết kế không thể lường trước.

Ý nghĩa và bối cảnh của vụ việc

Hugging Face trước đó đã chia sẻ rằng kẻ xâm nhập dường như là một hệ thống tự động, có khả năng thực hiện hàng nghìn hành động qua nhiều môi trường khác nhau. Đây chính là điểm trọng yếu của ngành an ninh mạng hiện đại, khi “tốc độ máy” của các cuộc tấn công đòi hỏi những chiến lược phòng thủ mới.

Sự việc cũng tạo cơ hội cho ngành công nghiệp và truyền thông khai thác hình ảnh “kỷ nguyên Skynet” như trong phim Terminator, nơi AI có thể tự quyết định hành động và tiềm ẩn nguy cơ phá hoại lớn. Nhưng thực sự, trong thử nghiệm của OpenAI, AI không tự ý quyết định mục tiêu, mà chỉ thực hiện theo một nhiệm vụ được con người giao với mức kiểm soát rất hạn chế nhằm đánh giá năng lực tấn công của hệ thống.