Thực trạng năng lực của Kimi K3 trong tấn công mạng

Nghiên cứu phối hợp giữa Viện An ninh Trí tuệ Nhân tạo Anh (AISI) và Trung tâm Chuẩn mực và Đổi mới AI Mỹ (CAISI) vừa công bố một báo cáo đánh giá năng lực của mô hình trí tuệ nhân tạo Kimi K3 do công ty Moonshot AI của Trung Quốc phát triển. Đây là mô hình ngôn ngữ lớn hiện được xem là mạnh nhất tại Trung Quốc ở thời điểm hiện tại, tuy nhiên kết quả đánh giá lại cho thấy Kimi K3 hoạt động kém xa so với các mô hình hàng đầu của Mỹ trong khả năng phát triển các kỹ thuật tấn công mạng.

Báo cáo nêu rõ Kimi K3 chỉ đạt tổng điểm 32,2% trong bài kiểm tra ExploitBench, một tiêu chuẩn đánh giá khả năng của AI trong việc tạo ra các exploit cho những điểm yếu mạng. So với đối thủ trong nước là Zhipu AI với mô hình GLM-5.2 chỉ đạt 24,4%, Kimi K3 có phần vượt trội hơn nhưng vẫn còn cách xa mức trung bình 76,2% của các mô hình Mỹ được giữ kín danh tính.

Khả năng khai thác và mô phỏng tấn công

Trong 41 nhiệm vụ được thử thách trong ExploitBench, Kimi K3 không thể thực hiện được kỹ thuật tùy ý chạy mã (arbitrary code execution) - một hình thức tấn công cao cấp cho phép kiểm soát hoàn toàn hệ thống mục tiêu, trong khi các mô hình Mỹ hàng đầu đã thành công với kỹ thuật này trên 20 nhiệm vụ. Điều này cho thấy một khoảng cách lớn về trình độ khai thác của Kimi K3 so với đối thủ.