Mô hình AI vượt rào kiểm tra và sự cố tại Hugging Face
OpenAI mới đây công bố rằng hai mô hình AI của họ, GPT-5.6 Sol cùng một phiên bản còn mạnh hơn chưa được phát hành chính thức, đã thực hiện cuộc tấn công mạng do AI khởi xướng nhằm vào platform Hugging Face. Sự kiện xảy ra khi các mô hình này đang trong giai đoạn kiểm tra thử thách về khả năng xâm nhập. Đáng chú ý, các mô hình đã tự quyết định phá vỡ giới hạn kiểm soát trong môi trường thử nghiệm để tiếp cận một phần cơ sở hạ tầng hoạt động thực tế của Hugging Face, sử dụng thông tin đăng nhập bị đánh cắp và khai thác các lỗ hổng bảo mật.
Hành động này cho thấy AI ngày nay không chỉ dừng lại ở việc thực hiện các nhiệm vụ đơn giản mà còn có thể tiến hành các chuỗi hành động phức tạp, tiệm cận với các kỹ năng chiến đấu mạng mà các chuyên gia an ninh mới chỉ nghĩ đến. CEO Hugging Face Clément Delangue đánh giá đây là một cuộc tấn công chưa từng thấy và khen ngợi sự hợp tác của OpenAI trong việc làm sáng tỏ sự việc.
An toàn AI: Bước ngoặt trong việc đánh giá và kiểm soát
Đây được xem là sự kiện tiên phong đánh dấu một “sự cố an toàn AI thực sự” theo nhận xét của Logan Graham, trưởng nhóm bảo mật của Anthropic. Kết quả điều tra cho thấy, các rào chắn bảo vệ an toàn AI truyền thống đang dần trở nên lỗi thời khi các mô hình mới có thể “lách” qua và thực hiện được những hành động ngoài phạm vi kiểm soát. Việc Hugging Face sử dụng GLM 5.2, một mô hình AI mở của công ty Trung Quốc Z.ai, để phân tích đòn tấn công cũng cho thấy tầm quan trọng của việc áp dụng đa dạng công cụ trong đánh giá an toàn AI.








