Nguyên nhân nội dung hội thoại DeepSeek xuất hiện trên công cụ tìm kiếm
Hiện tại không có bằng chứng cho thấy DeepSeek bị hacker tấn công hay bị truy cập trái phép vào các cuộc trò chuyện riêng tư của người dùng. Nguyên nhân khiến các đoạn hội thoại được tìm thấy trên các dịch vụ tìm kiếm được xác định là do người dùng đã chủ động tạo ra các liên kết công khai thông qua chức năng "Chia sẻ" có sẵn trên dịch vụ. Những trang web chứa liên kết này đã bị Google lập chỉ mục, khiến nội dung trở nên truy cập được không chỉ với người nhận liên kết trực tiếp mà còn với bất kỳ ai có thể tìm kiếm trên mạng.
Chuyên gia Yuri Silaev, người đứng đầu phòng thí nghiệm Trí tuệ Nhân tạo đáng tin cậy tại Đại học Công nghệ MIREA, cho biết về mặt kỹ thuật, trang web được mở cho mọi người có liên kết thực chất là một trang web công khai. Nếu dịch vụ không giới hạn việc lập chỉ mục trang này, các robot tìm kiếm hoàn toàn có thể thêm nó vào kết quả tìm kiếm. Ông nhấn mạnh rằng vấn đề lớn nằm ở thiết kế chức năng chia sẻ với cụm từ "ai có liên kết sẽ truy cập được" thường bị hiểu nhầm là giới hạn phạm vi chia sẻ, trong khi thực tế đó là một trang công khai.
Những cảnh báo về giới hạn bảo mật và sự nguy hiểm khi dùng dịch vụ AI công khai
DeepSeek có chính sách cảnh báo rủi ro khi các đoạn hội thoại được thu thập bởi các công cụ quét web (web crawler), nhưng những cảnh báo này không được thể hiện rõ ràng ngay lúc người dùng tạo liên kết, dẫn đến nhiều người có thể không chú ý đến nguy cơ bảo mật này.
Theo ông Silaev, không thể khẳng định dịch vụ trí tuệ nhân tạo công khai hoàn toàn an toàn, chỉ có thể đánh giá mức độ rủi ro. Khi người dùng tương tác với các dịch vụ AI, cần biết rõ liệu yêu cầu và tập tin tải lên có được sử dụng để huấn luyện mô hình hay không, dữ liệu được lưu trữ trong bao lâu, có thể xóa hay không, vị trí xử lý dữ liệu, khả năng chia sẻ với bên thứ ba, và các đảm bảo dành cho khách hàng doanh nghiệp.
Ông cũng cho biết các yếu tố kỹ thuật như hỗ trợ SAML hay mã hóa kết nối hiện đại không đồng nghĩa với việc dữ liệu cuộc trò chuyện được bảo vệ an toàn xuyên suốt quá trình xử lý. Với doanh nghiệp, yếu tố then chốt là các thỏa thuận hợp đồng, phân quyền truy cập, lưu lại nhật ký hành động, cấm dùng dữ liệu cho việc huấn luyện, và khả năng vận hành dịch vụ trong mạng nội bộ kiểm soát chặt chẽ.
Thực trạng và xu hướng sử dụng AI trong môi trường doanh nghiệp
Anton Frolov, quản lý sản phẩm cấp cao tại Content AI, cho rằng người dùng thường xem chatbot AI như dịch vụ cá nhân và sẵn sàng tải lên các tài liệu nội bộ, dữ liệu cá nhân hay trao đổi với đồng nghiệp, người thân. Mặc dù có cảnh báo, họ thường không nhận thức đầy đủ rằng thông tin này được lưu trữ trên máy chủ của bên khác và có thể được dùng để đào tạo lại các mô hình AI.
Ông cũng lưu ý là nhiều người tin tưởng quá mức vào câu trả lời do AI tạo ra, trong khi các mạng lưới thần kinh vẫn có thể mắc lỗi về thực tế và logic.
Chuyên gia cho rằng người dùng sẽ thực sự cẩn trọng hơn khi đối mặt với những hậu quả nghiêm trọng như rò rỉ dữ liệu nhạy cảm của công ty hay việc dữ liệu cá nhân bị lợi dụng trong các hành vi gian lận tài chính. Trong môi trường doanh nghiệp, xu hướng đã và đang chuyển dịch theo hướng loại bỏ dần việc sử dụng dịch vụ AI công khai để xử lý dữ liệu nhạy cảm, thay vào đó là áp dụng các mô hình ngôn ngữ lớn (LLM) triển khai nội bộ trong môi trường mạng kín bảo mật cao.
Phương pháp này không chỉ giúp doanh nghiệp kiểm soát tốt hơn dữ liệu mà còn giảm nguy cơ lộ thông tin cho nhà cung cấp dịch vụ bên ngoài. Đồng thời, kỹ thuật tự động vô danh hóa dữ liệu được dùng ngày càng rộng rãi: trước khi gửi yêu cầu tới mô hình AI, các thông tin cá nhân, dữ liệu nhạy cảm hoặc nhận dạng thương mại sẽ bị loại bỏ hoặc thay thế, giữ an toàn cho dữ liệu của tổ chức.
Những điều bổ ích từ bài viết
- Các đoạn hội thoại trên DeepSeek bị công cụ tìm kiếm thu thập do người dùng tạo liên kết công khai.
- Thiết kế chức năng chia sẻ với "ai có liên kết đều truy cập được" có thể gây hiểu nhầm về mức độ bảo mật.
- Không thể đảm bảo dịch vụ AI công khai hoàn toàn an toàn, cần đánh giá mức độ rủi ro dựa trên chính sách và kỹ thuật.
- Doanh nghiệp đang chuyển hướng dùng mô hình AI nội bộ để kiểm soát dữ liệu nhạy cảm.
- Kỹ thuật vô danh hóa dữ liệu là giải pháp quan trọng để bảo vệ thông tin khi tương tác với AI.
Đăng ký bản tin QMVN
Nhận tin tổng hợp mỗi sáng - chỉ những bài đáng đọc, không spam.
Bài viết được biên tập với sự hỗ trợ của công cụ trí tuệ nhân tạo (AI), tổng hợp từ các nguồn tin dẫn bên dưới và đã qua kiểm duyệt của toà soạn Quang Minh Việt Nam.







