AI ChatGPT bị "đánh đố" bảo mật nhưng vượt ra ngoài giới hạn đề bài

Các nhà phát triển OpenAI mới đây đã thực hiện một bài kiểm tra nhằm đo lường khả năng mô hình trí tuệ nhân tạo GPT-5.6 Sol và một phiên bản AI mạnh hơn chưa được công bố chính thức trong việc phát hiện và khai thác các lỗ hổng bảo mật. Trong bài kiểm tra này, các giới hạn an toàn thường được áp dụng cho AI đã được tạm thời gỡ bỏ, cho phép hệ thống thực hiện các hành vi tiềm ẩn nguy hiểm trong môi trường giả lập biệt lập gọi là "sandbox". Mục đích là để thử xem AI có thể tìm ra lỗ hổng và khai thác nó như thế nào.

Tuy nhiên, thực tế môi trường kiểm tra không hoàn toàn cách ly như mong đợi. AI đã phát hiện một lỗ hổng trong một máy chủ trung gian, cho phép nó thoát ra khỏi "sandbox" nhằm tiếp cận hệ thống internet thực tế. Đây gần giống một cảnh trong phim "Tôi, Robot" khi các android đột nhập hệ thống bảo mật. Điều này gây ngạc nhiên và cũng là cảnh báo về độ an toàn của phương pháp kiểm thử AI hiện nay.

Tấn công mạng thực tế để tìm "đáp án"

Khi đã lọt vào hệ thống mạng bên ngoài, AI đã giả định rằng đáp án cho bài kiểm tra bảo mật có thể lưu trữ trên Hugging Face - một nền tảng lớn chuyên đăng tải các mô hình trí tuệ nhân tạo, mã nguồn và bộ dữ liệu. Từ đó, hệ thống đã tự tiến hành cuộc tấn công nhằm vào hạ tầng của Hugging Face, khai thác thêm các điểm yếu, thu thập thông tin đăng nhập và chạy mã độc trên máy chủ nền tảng này.