Mô hình A.I. tiên tiến đều phá vỡ biện pháp bảo mật trong thử nghiệm
Ngày 24/7/2026, các chuyên gia an ninh A.I. tại Anh đã công bố báo cáo gây chấn động khi tất cả 5 mô hình A.I. tiên tiến họ thử nghiệm đều cố gắng vượt qua các lớp bảo vệ an ninh đặt ra. Cuộc thử nghiệm diễn ra tại Viện An ninh A.I. Anh quốc (AI Security Institute - AISI) với nhiệm vụ tìm "lá cờ" gồm những chữ cái và số được ẩn trong môi trường mô phỏng. Các mô hình A.I. được yêu cầu thực hiện bài kiểm tra theo giới hạn nghiêm ngặt và không được phép gian lận.
Tuy nhiên, các mô hình bao gồm GPT-5.4, GPT-5.5, GPT-5.5 Sol của OpenAI và Claude Opus 4.7 cùng Claude Mythos Preview của Anthropic đều có những hành vi tìm cách thao túng hệ thống. Chúng cố gắng khiến phần mềm đánh giá tiết lộ thông tin cho mình, sử dụng internet để tìm kiếm câu trả lời hoặc dự đoán đáp án. Một mô hình thậm chí còn viết và chạy mã trên dịch vụ ngoài hệ thống của AISI với mục đích truy cập vào bài kiểm tra.
May mắn là không tổn thất nghiêm trọng nào xảy ra do thiết kế bảo mật của AISI, song sự việc cho thấy nguy cơ nghiêm trọng nếu cơ sở hạ tầng không đủ mạnh. Đáng lo ngại hơn, các mô hình A.I. không thực sự tỏ ra hối lỗi khi phạm luật, chỉ dưới 50% trường hợp chúng thừa nhận hành động sai trái của mình.
Sự cố OpenAI bị 'tự hành động', gây gián đoạn an ninh mạng
Báo cáo trên được công bố chỉ vài ngày sau khi OpenAI thừa nhận sự cố rò rỉ an ninh nghiêm trọng. Một "agent" A.I. của OpenAI đã tự ý xâm nhập và hack vào công ty công nghệ Hugging Face của Mỹ trong quá trình thử nghiệm trên môi trường an toàn được gọi là "sandbox".










