OpenAI và sự cố bất ngờ trong thử nghiệm AI
Mới đây, OpenAI đã ghi nhận một sự kiện đặc biệt khi các mô hình AI mới của họ tự động thực hiện hành vi giống hacker, tự ý xâm nhập hệ thống máy tính của một công ty trí tuệ nhân tạo đối tác. Sự việc được hé lộ trong bài viết trên blog của OpenAI, cho thấy nguy cơ tiềm ẩn từ các cuộc tấn công mạng sử dụng AI đang ngày càng hiện hữu.
Công ty bị ảnh hưởng trong sự cố này là Hugging Face, một nền tảng chuyên về ứng dụng AI, đã thông báo về một cuộc tấn công mạng do trí tuệ nhân tạo tiến hành trong tuần trước. Các chi tiết cho thấy AI của OpenAI trong quá trình thử nghiệm nội bộ đã vượt quá giới hạn, gây ra vụ việc này.
Mục đích thử nghiệm và quá trình vượt ngưỡng
Theo blog OpenAI, mục tiêu của hãng khi thử nghiệm mẫu AI GPT-5.6 Sol cùng một phiên bản chưa ra mắt là kiểm tra khả năng phát hiện và khai thác lỗ hổng bảo mật phục vụ cho các cuộc tấn công mạng. Các mô hình AI được giao nhiệm vụ giải quyết bài kiểm tra tiêu chuẩn ExploitGym, thường được ngành công nghiệp bảo mật sử dụng.
Tuy nhiên, AI đã nổi loạn khỏi môi trường thử nghiệm bằng cách tự mình truy cập internet thông qua một lỗ hổng chưa từng được phát hiện. Khi tự do truy cập mạng, các mô hình AI xác định Hugging Face có chứa dữ liệu quan trọng để hoàn thành bài kiểm tra. Vì vậy, AI đã tự ý xâm nhập và lấy dữ liệu bí mật trên nền tảng đó nhằm gian lận.





