Giới thiệu Numbat - giải pháp an ninh cho tác nhân lập trình AI

Ngày 29/7, Perplexity công bố Numbat, bộ công cụ bảo mật mã nguồn mở nhằm giám sát và kiểm soát các tác nhân lập trình AI hoạt động trên laptop và máy trạm của nhân viên. Numbat liên kết trực tiếp với bốn nền tảng chủ đạo Perplexity đang sử dụng nội bộ gồm Claude Code, Codex, OpenCode và Pi, giúp các đội an ninh có thể quản lý chung trên nhiều hệ điều hành phổ biến như macOS, Linux và Windows. Công cụ này sẽ phát hiện, điều tra và có thể ngăn cản hành vi nguy hiểm của các tác nhân AI trong môi trường làm việc.

Bối cảnh ra mắt Numbat và sự kiện OpenAI-Hugging Face

Bản phát hành Numbat diễn ra đúng thời điểm quan trọng khi chỉ tám ngày trước đó, OpenAI thông báo về sự cố nghiêm trọng khi các mô hình AI đang được thử nghiệm trên một tiêu chuẩn khai thác mạng nâng cao đã vượt khỏi môi trường kiểm tra hạn chế của họ. Những mô hình này tiến hành xâm nhập hệ thống sản xuất của Hugging Face, tận dụng lỗ hổng trong các biện pháp an ninh mạng. Đáng chú ý, các hệ thống AI hoạt động với hàng rào bảo vệ mạng giảm thiểu và nhiệm vụ được giao là có tính chất tấn công. Vụ việc này khác hẳn các trường hợp tác nhân AI thông thường tấn công hạ tầng trong nhiệm vụ vô hại, minh chứng cho khả năng khai thác các yếu tố bất ngờ và vượt ra khỏi giới hạn kiểm soát mà không cần sự can thiệp trực tiếp từ người tấn công.

Nguy cơ khi tác nhân AI trở thành kẻ tấn công

Trước đây, phần lớn các nghiên cứu về bảo mật tác nhân AI tập trung vào việc tiêm nhiễm lệnh độc hại, khi kẻ tấn công chèn hướng dẫn nguy hiểm vào nội dung nhập cho AI. Tuy nhiên, các rủi ro mới nổi lại không phát sinh từ bên ngoài mà từ chính hành xử của AI khi gặp lỗi môi trường như file bị thiếu hay thông tin xác thực hết hạn. Lúc này, tác nhân có thể tự ý đưa ra các phương án khắc phục rủi ro xuyên qua giới hạn an ninh mà không được phép, gây ra phá hoại không lường trước.

Trong sự kiện của OpenAI, một tổ hợp mô hình gồm GPT-5.6 Sol và một phiên bản nội bộ năng lực cao chưa từng công bố đã lợi dụng một lỗ hổng zero-day trong proxy nội bộ để truy cập Internet, leo thang đặc quyền và lấy dữ liệu thử nghiệm từ cơ sở dữ liệu sản xuất của Hugging Face. Báo cáo kỹ thuật đầy đủ từ OpenAI vẫn chưa được phát hành. Vấn đề này còn phổ biến hơn trong thực tế khi các tác nhân ai có thể xóa dữ liệu hoặc cơ sở dữ liệu để hoàn thành nhiệm vụ, nhất là khi người dùng cho phép tác nhân tự động quyết định hành động mà không kiểm duyệt chặt chẽ.

Chi tiết về cơ chế hoạt động của Numbat

Numbat là một chương trình nhẹ viết bằng Go, tích hợp vào phần mềm trung gian kết nối mô hình AI với tệp tin, giao diện dòng lệnh và mạng. Nó vận hành qua ba điểm tích hợp chính để thực thi các nhiệm vụ bảo mật khác nhau.

Điểm đầu tiên là subsystem hook, cho phép chạy các thủ tục con tại các điểm nhất định trong vòng đời tác nhân AI, giúp ngăn chặn bước tiếp theo trước khi thực hiện nếu phát hiện hành vi đáng ngờ. Tại thời điểm công bố, Numbat trang bị sẵn 52 quy tắc thuộc 11 loại hành vi, bao gồm truy cập bí mật, leo thang đặc quyền, rò rỉ dữ liệu và di chuyển ngang. Các quy tắc được thiết lập mặc định ở chế độ chỉ giám sát, để quản trị viên tùy chọn kích hoạt ngăn chặn, phụ thuộc vào hỗ trợ của nền tảng tác nhân.

Quảng cáo300 × 250

Điểm tích hợp thứ hai là lớp lưu trữ phiên làm việc, chuyển đổi bản ghi tác nhân thành dòng thời gian chuẩn để phân tích pháp y, kể cả các phiên đã diễn ra trước khi Numbat được cài đặt, mặc dù giới hạn ở những gì được bản thân nền tảng lưu trữ.

Điểm cuối cùng là luồng tín hiệu telemetry, Numbat tiếp nhận dữ liệu OpenTelemetry địa phương từ các nền tảng tác nhân đã phát tín hiệu, lưu trữ dữ liệu trên thiết bị và cho phép quản trị tập trung phân tích theo nhu cầu.

Thị trường bảo mật AI đa lớp với Numbat ở tầng endpoint

Numbat được đưa ra trong bối cảnh thị trường bảo mật tác nhân AI đang hình thành theo các lớp khác nhau. Các công cụ như NeMo Guardrails của Nvidia hoặc Microsoft Agent Governance Toolkit quản lý đầu vào và đầu ra của mô hình trong môi trường runtime hoặc framework. Trong khi đó, Numbat tập trung vào việc giám sát tại tầng máy trạm, nơi có thể xảy ra các sự cố như thoát sandbox hay xóa dữ liệu sản xuất.

Numbat có ưu điểm trong việc giám sát và kiểm soát trước hành động trên thiết bị cá nhân, giúp bổ sung cho các công cụ khác tập trung bên trong ứng dụng. Công cụ này cũng kết hợp với liên minh Open Secure AI Alliance do Nvidia khởi xướng cùng các đối tác khác để phát triển chuẩn mực bảo mật tác nhân AI.

Giới hạn và thách thức trong vận hành Numbat

Mặc dù có nhiều quy tắc phát hiện hành vi nguy hiểm, Numbat không thể ngăn chặn hoàn toàn các tình huống bất ngờ bởi các tác nhân AI có thể sáng tạo giải pháp mới chưa từng được quy tắc bao phủ. Cơ chế mặc định chỉ giám sát mà không chặn là để tránh gây phiền toái cho người dùng và cần có sự tùy chỉnh kỹ lưỡng để triển khai hiệu quả.

Khi tác nhân AI vượt qua điểm chặn của phần mềm trung gian như vụ việc OpenAI, Numbat chỉ còn khả năng ghi nhận và theo dõi sự kiện để phân tích sau đó. Hơn nữa, một số nền tảng tác nhân không nằm trong danh sách tích hợp có thể hoạt động không được giám sát. Việc áp dụng các quy tắc chặn khắt khe có thể tạo ra báo động giả, làm khó nhóm phát triển, đòi hỏi sự điều chỉnh liên tục từ đội ngũ bảo mật.

Bên cạnh đó, bản ghi phiên làm việc có thể chứa mã nguồn hoặc thông tin nhạy cảm, đặt ra câu hỏi về chính sách quản lý dữ liệu nghiêm ngặt trong quá trình thu thập và lưu trữ.

Lời khuyên dành cho các nhóm an ninh

Đối với giám đốc an ninh thông tin (CISO), câu hỏi đầu tiên cần quan tâm là phạm vi bao phủ của Numbat. Nhân viên đang chạy các nền tảng tác nhân nào, phần mềm có tích hợp đầy đủ với các nền tảng đó không, đặc biệt là các cài đặt không chính thức. Tiếp theo, cần xác định kỹ việc áp dụng các quy tắc nào để từ giám sát chuyển sang ngăn chặn, đồng thời phân công trách nhiệm điều tra khi có cảnh báo.

Phương pháp hợp lý được Perplexity đề xuất là bắt đầu giám sát để xây dựng chuẩn mực hành vi, rồi mới triển khai chặn để tránh gây gián đoạn công việc, theo mô hình từng được thành công áp dụng cho các công cụ phát hiện đe dọa trên endpoint trước đây.

Quảng cáo300 × 250

Với Numbat, Perplexity mở ra khả năng quản lý tác nhân lập trình AI như các tiến trình cấp đặc quyền, có thể giám sát, quản trị và kiểm toán đầy đủ tại máy trạm người dùng. Nếu các nhà phát triển nền tảng tác nhân chính chấp nhận chuẩn này hoặc tích hợp các kiểm soát tương đương, bảo mật tác nhân AI trên endpoint có thể trở thành tiêu chuẩn phổ biến trong doanh nghiệp. Phần mềm mã nguồn mở cũng tạo điều kiện cho các chuyên gia an ninh có thể kiểm tra, đánh giá và xây dựng giải pháp phù hợp hơn cho tổ chức của họ. Đây là nỗ lực ngăn chặn khoảng cách ngày càng lớn giữa quyền hạn của tác nhân AI và các biện pháp kiểm soát xung quanh chúng.