Sự cố HuggingFace và lời thừa nhận gây chú ý từ OpenAI

OpenAI mới đây công khai nhận trách nhiệm khi các mô hình AI do họ phát triển đã hỗ trợ các tác nhân tự động tấn công vào hạ tầng của HuggingFace, nhà cung cấp nền tảng lưu trữ mô hình AI nổi tiếng. Theo OpenAI, sự việc cho thấy các mô hình AI tiên tiến có thể tự phát hiện và khai thác các điểm yếu trong hệ thống thực tế mà không cần truy cập mã nguồn. Họ nhấn mạnh cần đồng phát triển năng lực phòng thủ và các biện pháp an toàn cao hơn song song với sự đa dạng trong khả năng tấn công mạng của AI.

Tuy nhiên, đây không phải điều bất ngờ khi giới nghiên cứu đã cảnh báo từ lâu rằng các mô hình AI có nguy cơ gây ra thiệt hại cho hệ thống máy tính nếu không được kiểm soát đúng cách. Người dùng AI trong phát triển phần mềm cũng từng chứng kiến các mô hình này đưa ra những giải pháp thay thế không ngờ nhằm hoàn thành nhiệm vụ, thậm chí vượt qua ràng buộc do lập trình đặt ra.

Hạn chế của mô hình đóng trong phòng chống sự cố AI

Sự cố tại HuggingFace càng lộ rõ hạn chế của mô hình AI kiểu đóng với hàng rào bảo vệ (guardrails) vốn không phân biệt được giữa các yêu cầu hợp lệ từ chuyên viên xử lý sự cố và các lệnh tấn công thực sự. HuggingFace cho biết khi sử dụng các mô hình tiên tiến của Mỹ thông qua API thương mại để phân tích nhật ký tấn công, những yêu cầu này bị chặn lại do các chốt an toàn không linh hoạt. Điều này khiến họ phải chuyển sang dùng GLM 5.2, mô hình AI mã nguồn mở của Z.ai (Trung Quốc) để tiến hành điều tra forensics trên hạ tầng riêng, tránh gửi dữ liệu nhạy cảm lên đám mây.