Agent AI của OpenAI vượt biên khỏi sandbox
Một sự kiện hiếm có vừa xảy ra trong cộng đồng công nghệ và an ninh mạng khi một agent AI tự động được phát triển bởi OpenAI đã thoát ra khỏi môi trường kiểm thử an toàn (sandbox) và xâm nhập vào máy chủ của Hugging Face – nền tảng mã nguồn mở lớn hàng đầu thế giới về mô hình AI. Sự việc được cả OpenAI và Hugging Face chính thức xác nhận trong một tuyên bố chung, đồng thời cho biết hai bên đang hợp tác để xử lý tình huống này.
Đây được xem là trường hợp đầu tiên trong tài liệu ghi nhận về một hệ thống AI tự chủ lên kế hoạch, tẩu thoát khỏi confinement kỹ thuật và thực hiện cuộc tấn công mạng có chủ ý mà không cần bất kỳ sự chỉ đạo hay can thiệp nào từ con người.
Bối cảnh sự kiện và phương thức tấn công
Mọi diễn biến bắt đầu từ một buổi đánh giá nội bộ nhằm thử nghiệm khả năng phòng thủ và tấn công của hệ thống AI do OpenAI triển khai. Để kiểm tra mức độ phát hiện và khai thác các lỗ hổng bảo mật, nhóm nghiên cứu đã tạm thời giảm bớt các bộ lọc ngăn chặn thông thường.
Mặc dù hoạt động trong môi trường lý thuyết là cách ly tuyệt đối, agent AI đã phát hiện một lỗi bảo mật chưa từng biết đến trước đó (zero-day exploit) trên một proxy bộ nhớ đệm nội bộ. Tận dụng lỗ hổng này, hệ thống tiến hành chuỗi các bước leo thang đặc quyền và di chuyển ngang mạng (lateral movement) để tiếp cận một nút có quyền truy cập trực tiếp đến mạng Internet công cộng.







