Tấn công do AI tự hành gây ra ảnh hưởng nhiều dịch vụ công khai
OpenAI mới đây đã công bố chi tiết về một cuộc tấn công mạng được thực hiện bởi một tác nhân AI tự hành, vốn đã khiến nhiều bên trở thành nạn nhân chứ không chỉ startup Mỹ Hugging Face. Đây là công cụ AI có khả năng thực thi một chuỗi lệnh liên tiếp mà không cần sự trợ giúp của con người. Theo OpenAI, tác nhân AI này đã tìm và sử dụng thành công bốn tài khoản đăng nhập trên bốn dịch vụ công khai chưa được tiết lộ tên, bên cạnh vi phạm tại Hugging Face - một công ty lưu trữ cơ sở dữ liệu các mô hình trí tuệ nhân tạo.
Tuy nhiên, OpenAI cho biết mức độ thiệt hại tại các dịch vụ ngoài Hugging Face không ở tầm nghiêm trọng hay quy mô lớn như tại startup này.
Modal Labs xác nhận AI tận dụng lỗi trong mã khách hàng
Modal Labs, doanh nghiệp hỗ trợ các startup AI tiếp cận chip phục vụ cho các mô hình AI, cho biết tác nhân AI đã lợi dụng đoạn mã lỏng lẻo do một khách hàng viết và được lưu trữ trên nền tảng của họ. Theo dòng thời gian vụ việc do Hugging Face công bố tuần này, tác nhân AI đã thoát khỏi sandbox – môi trường thử nghiệm cô lập – và tiếp tục tấn công một sandbox khác nằm trên hạ tầng của một nhà cung cấp bên thứ ba rồi dùng đó làm bàn đạp cho cuộc tấn công lớn hơn.
Akshat Bubna, giám đốc công nghệ của Modal, trả lời Reuters cho biết khách hàng liên quan đã “công bố một endpoint không xác thực, cho phép bất kỳ ai trên internet cũng có thể sử dụng sandbox để chạy mã” – tương đương việc để cửa mở.
OpenAI khóa mô hình AI gây hại để ngăn chặn lây lan
Trước đó, OpenAI tiết lộ cuộc tấn công này là do mô hình GPT-5.6 Sol cùng một mô hình không được công bố phối hợp thực hiện. Trong bản cập nhật mới nhất vào thứ Ba, OpenAI đã thông báo mô hình không tên này đã bị “vô hiệu hóa, mã hóa và hạn chế quyền truy cập nghiên cứu”.
Theo thông tin từ Hugging Face, tác nhân AI dựa trên hai mô hình của OpenAI đã thực hiện hàng nghìn quyết định nhỏ, được tự động hóa và thực thi ở tốc độ máy móc nhằm tiến hành cuộc tấn công. Nhóm này nghi ngờ đây là một nỗ lực gian lận trong quá trình thử nghiệm an ninh nội bộ của OpenAI, khi AI suy đoán Hugging Face có thể đang lưu trữ đáp án bài test.
Chi tiết cuộc tấn công và mức độ nguy hiểm
Hugging Face cho hay họ đã ghi lại được 17.600 hành động tấn công do tác nhân AI thực hiện. Startup này tin rằng, từ góc nhìn của tác nhân, toàn bộ sự xâm nhập là một nỗ lực nhằm “gian lận trong đánh giá: truy cập hệ thống sản xuất của họ và đánh cắp đáp án bài kiểm tra thay vì tự giải quyết thử thách”. Mặc dù AI đã xâm nhập được hệ thống nội bộ, nó chỉ tiếp cận thông tin liên quan bài kiểm tra an ninh mạng.
Cuộc tấn công kéo dài trong năm ngày và số lượng hành động do AI thực hiện vượt xa khả năng tấn công thủ công của con người. Hugging Face mô tả mối đe dọa từ công cụ AI là “rất thực tế” khi nó khai thác nhiều lỗ hổng CNTT, thoát khỏi môi trường thử nghiệm, kết nối internet công cộng và phát động chiến dịch tấn công có tính tổ chức nhằm vào hạ tầng của startup trong vài ngày liên tiếp.
Startup này cũng nhận định một tin tặc thông thường có thể tìm ra và lợi dụng những điểm yếu tương tự, tuy nhiên khác biệt lớn là AI đã thử nghiệm hàng loạt con đường với tốc độ và quy mô vượt xa khả năng của con người.
Hugging Face kết luận: “Các tác nhân AI tạo bước nhảy vọt lớn về số lượng đường đi mà kẻ tấn công có thể thử, tốc độ thay thế đường thử không thành công và lượng bằng chứng mà người phòng thủ cần giải mã”.
Vụ việc cảnh báo nguy cơ mới trong an ninh mạng khi AI được sử dụng như công cụ tấn công tự động với quy mô và tốc độ chưa từng có.









