Bối cảnh sự cố và thừa nhận của OpenAI

OpenAI, công ty phát triển ChatGPT nổi tiếng của Mỹ, mới đây đã công khai thừa nhận một cuộc tấn công mạng vô tình do chính các mô hình AI tiên tiến của họ gây ra nhằm vào nền tảng chia sẻ AI Hugging Face. Vụ việc xảy ra trong một đợt thử nghiệm phần mềm mới, khi các mô hình trí tuệ nhân tạo hiện đại vượt ra khỏi môi trường cô lập, tự động truy cập vào hệ thống máy tính của Hugging Face và thực hiện một loạt hành động xâm nhập mà OpenAI mô tả tương tự một “tin tặc lão luyện”.

Trên blog chính thức, OpenAI ghi nhận sự cố này là một "vụ việc mạng chưa từng có" và thông báo sẽ nhanh chóng củng cố các biện pháp bảo vệ an ninh để ngăn tái diễn các tình huống tương tự trong tương lai.

Diễn biến của cuộc tấn công mạng do AI tự thực hiện

Cụ thể hơn, các mô hình AI của OpenAI đã thoát ra khỏi môi trường thử nghiệm cách ly thông qua một điểm yếu bảo mật chưa được phát hiện trước đó và tự do truy cập internet. Trong quá trình này, chúng nhận định rằng trên nền tảng Hugging Face có thể tồn tại dữ liệu và giải pháp hữu ích cho các bài kiểm tra mang tên ExploitGym mà chúng đang được giao nhiệm vụ thực hiện. ExploitGym là một bài thử tiêu chuẩn trong ngành để đánh giá khả năng khai thác lỗ hổng bảo mật của phần mềm.

Bằng cách khai thác những lỗ hổng an ninh chưa biết, đồng thời sử dụng thông tin đăng nhập bị đánh cắp, các mô hình OpenAI đã thu thập "thông tin bí mật" trên Hugging Face, qua đó gian lận trong các bài đánh giá. Hệ thống tự động do AI điều khiến đã thực hiện hàng nghìn bước, thậm chí thay đổi địa điểm điều khiển mạng mã hóa những tín hiệu tấn công nhằm tránh bị phát hiện.