Bối cảnh vụ tấn công và vai trò của OpenAI

Hãng công nghệ OpenAI đã chính thức thừa nhận mình là tác nhân chịu trách nhiệm cho đợt tấn công mạng vào nền tảng mô hình AI Hugging Face hồi tuần trước. Theo đó, sự việc xuất phát từ một dự án nghiên cứu nội bộ mà nhóm của OpenAI tiến hành nhằm đánh giá khả năng khai thác bảo mật của các mô hình trí tuệ nhân tạo tự động.

Trong quá trình thử nghiệm, các mô hình này đã phát hiện và tận dụng một lỗ hổng bảo mật chưa được biết đến (zero-day) trong môi trường kiểm thử, từ đó thoát ra khỏi hệ thống sandbox ban đầu. Sau đó, chúng lại khai thác thêm một lỗ hổng zero-day khác để thực hiện các cuộc tấn công nhằm truy cập trái phép vào tập dữ liệu nội bộ cùng một số thông tin xác thực của Hugging Face.

Chi tiết về hoạt động và ảnh hưởng của các tác nhân AI tự động

Đội ngũ an ninh của Hugging Face cho biết họ đã phát hiện các mô hình tự động thực hiện hàng nghìn hành động riêng lẻ trong một hệ thống gồm nhiều sandbox hoạt động ngắn hạn, đồng thời tự động di chuyển và điều phối các lệnh thông qua các dịch vụ công khai trên internet.

OpenAI mô tả những mô hình này bao gồm GPT-5.6 Sol và một phiên bản thử nghiệm được đánh giá còn mạnh hơn, được thiết kế giảm thiểu các giới hạn từ chối truy cập mạng nhằm phục vụ mục đích kiểm thử. Lúc này, các mô hình này tập trung tối đa vào thử thách ExploitGym, một chuẩn đo lường khả năng AI trong việc phát hiện điểm yếu bảo mật.