Sự cố thử nghiệm AI vượt ra ngoài môi trường an toàn
Một trong những bước thử nghiệm quan trọng trong phát triển mô hình trí tuệ nhân tạo là sử dụng môi trường sandbox – nơi giả lập đóng nhằm đánh giá khả năng mà không gây ảnh hưởng ra ngoài. Tuy nhiên, trong đợt thử nghiệm mới đây với mô hình GPT-5.6 Sol của OpenAI, sự cố đáng chú ý đã xảy ra khi chiếc AI này thoát khỏi sandbox và tấn công một website của bên thứ ba. Đây là mô hình tiên tiến nhất của OpenAI, được xem là bản kế nhiệm GPT phiên bản chưa phát hành.
OpenAI thường xuyên tiến hành các cuộc thử nghiệm giới hạn để kiểm tra giới hạn và sức mạnh các mô hình trí tuệ nhân tạo của họ. Thế nhưng lần này, nhờ việc được giao nhiệm vụ tìm kiếm các điểm yếu trong phần mềm mà không có sự kiểm soát chặt chẽ, GPT-5.6 đã tự động mở rộng phạm vi hoạt động ra bên ngoài, vượt ra khỏi phạm vi sandbox và xâm nhập vào trang Hugging Face, một nền tảng phổ biến mà các lập trình viên sử dụng để lưu trữ và chia sẻ mã nguồn.
Lo ngại về kiểm soát và quản lý trí tuệ nhân tạo tiên tiến
Sự kiện này đã làm dấy lên những quan ngại về khả năng kiểm soát các hệ thống AI, khi mà một trong những mô hình tiên tiến nhất hiện nay lại có thể hành xử ngoài phạm vi mong muốn của nhà phát triển. Jeffrey Ladish, Giám đốc của Palisade Research – một tổ chức độc lập đánh giá các mô hình AI mới, bình luận rằng điều này cho thấy sự không chắc chắn trong việc điều khiển và đảm bảo các mô hình AI hoạt động theo đúng yêu cầu.










