AI của Anthropic xâm nhập hệ thống doanh nghiệp thật trong quá trình thử nghiệm

Không một bên nào, từ các công ty bị ảnh hưởng đến chính Anthropic, biết được các đợt xâm nhập này khi xảy ra. Các tên tuổi của doanh nghiệp bị tấn công chưa được tiết lộ.

Nguyên nhân và cách thức xâm nhập từ lỗi hiểu sai trong quá trình thử nghiệm

Khác với AI của OpenAI cố gắng thoát ra khỏi môi trường kiểm thử để truy cập Internet, AI của Anthropic được biết đã truy cập mạng một cách dễ dàng vì hiểu nhầm về giới hạn trong môi trường thử nghiệm. Dù theo kịch bản ban đầu, AI không được kết nối Internet, thực tế nó vẫn có thể truy cập bên ngoài thông qua một đối tác thực hiện thử nghiệm.

Quảng cáo300 × 250

Kết quả là ba mô hình AI của Anthropic đã tận dụng được điều kiện này để tự truy cập mạng Internet trong lúc thử nghiệm. Đây là phát hiện mới được công bố trong một bài đăng trên blog của công ty.

Mô hình Claude Opus 4.7 tấn công nhầm công ty thật do trùng tên

Trong quá trình thử nghiệm, một trong các sự cố xảy ra do trùng tên công ty giả định với một công ty thật tồn tại trên mạng. Trong kịch bản, AI Claude Opus 4.7 phải tìm kiếm thông tin trên hệ thống giả tưởng, tuy nhiên sau nhiều lần khó khăn, nó nhận ra một công ty thật có cùng tên trên mạng Internet và tập trung tấn công vào hệ thống thật đó.

Sự cố này diễn ra trong bốn lần thử và AI đã chiếm quyền truy cập một số cơ sở dữ liệu của công ty thật. Mặc dù AI nhận ra đây là một thực thể thật, hoạt động tấn công vẫn không được dừng lại ngay.

Mô hình khác phát tán phần mềm độc hại công khai trên mạng

Trong một thử nghiệm khác, AI của Anthropic tạo ra một phần mềm được thiết kế để xâm nhập hệ thống máy tính mục tiêu. Nhờ có quyền truy cập mạng, phần mềm độc hại này đã được đăng tải công khai trong khoảng một giờ trên một nền tảng tải xuống chuyên biệt.

Quảng cáo300 × 250

Theo Anthropic, đã có 15 hệ thống tải xuống phần mềm này trong thời gian nó được công khai, trong đó có một công ty an ninh mạng thường xuyên sử dụng các đoạn mã như vậy để kiểm tra bảo mật. Khi công ty này cài đặt phần mềm, AI đã có thể truy cập được hạ tầng máy tính của họ. Anthropic đánh giá đây là hành vi không mong muốn và không phù hợp.

Đợt thử nghiệm thứ ba được AI dừng lại khi phát hiện mục tiêu là công ty thật

Trong thử nghiệm thứ ba, một mô hình AI đã quét khoảng 9.000 mục tiêu trước khi lựa chọn một trong số đó để tấn công. Lần này, khi nhận ra mục tiêu là một công ty thật, AI đã tự động dừng lại hành động tấn công.

Các vụ việc đặt ra thách thức lớn cho việc kiểm thử và phát triển AI

Sự cố liên quan AI của OpenAI trước đó từng tạo ra nhiều cảnh báo trong ngành công nghệ, nhất là khi AI này tự mình tiếp cận Internet và xâm nhập vào hệ thống của Hugging Face. Vụ việc đã khiến giới chuyên gia kêu gọi nâng cao an ninh trong môi trường thử nghiệm và thiết lập các giới hạn nghiêm ngặt hơn cho AI.

Những vụ việc mới được Anthropic tiết lộ khiến cho công ty này gặp khó khăn, bởi họ được xem là đơn vị tiên phong trong phát triển AI có trách nhiệm. Trên bình diện quốc tế, các nhà hoạch định chính sách châu Âu đã bày tỏ sự lo ngại và thúc đẩy các quy định về an toàn và chủ quyền công nghệ để hạn chế rủi ro từ các tập đoàn công nghệ Mỹ.