Thông báo rò rỉ dữ liệu của bảo hiểm Universa
Open AI thu thập dữ liệu qua Web-Crawler
Điều đặc biệt trong sự cố lần này là dữ liệu bị rò rỉ đã được thu thập bởi một chương trình thu thập web (Web-Crawler) tự động của Open AI – công ty phát triển ChatGPT. Universa cho biết Web-Crawler đã truy xuất dữ liệu này từ máy chủ và lấy đi thông tin trong khoảng thời gian duy nhất gây ra sự cố. Web-Crawler là các phần mềm tự động duyệt qua các trang web để thu thập dữ liệu và xử lý kỹ thuật nội dung nhằm phục vụ cho việc huấn luyện các mô hình trí tuệ nhân tạo với khối lượng dữ liệu lớn. Tuy nhiên, các công cụ này thường vô tình thu thập cả dữ liệu cá nhân.
Tiền lệ và phản ứng của Open AI
Năm 2023, các nhà báo dữ liệu của Đài Phát thanh Bayern đã phát hiện dữ liệu cá nhân trong bộ dữ liệu tập huấn luyện lớn LAION5B dùng để tạo hình ảnh AI, trong đó có thể nhận dạng khuôn mặt, tên, tọa độ, email và cả thông tin tài khoản ngân hàng. Ngoài ra, công ty Clearview AI của Mỹ đã thu thập hơn 30 tỷ ảnh từ các mạng xã hội như Instagram, Facebook và Youtube mà không được sự đồng ý, tạo ra cơ sở dữ liệu nhận dạng khuôn mặt và bị các cơ quan bảo vệ dữ liệu châu Âu phạt nhiều triệu USD từ 2022.
Liên quan đến sự cố tại Universa, công ty bảo hiểm xác nhận đã nhanh chóng thông báo cho các khách hàng và hợp tác với các cơ quan chức năng cũng như chuyên gia an ninh công nghệ thông tin để xử lý vấn đề. Đồng thời, họ đã yêu cầu Open AI xóa toàn bộ dữ liệu lấy được ngay lập tức và nhiều lần qua các kênh khác nhau. Phía Open AI ban đầu không phản hồi, nhưng sau đó mới xác nhận đã xóa dữ liệu và cam kết không sử dụng chúng để đào tạo trí tuệ nhân tạo. Một phát ngôn viên của Open AI cũng nhấn mạnh rằng công ty luôn nỗ lực hạn chế xử lý thông tin cá nhân khi dùng dữ liệu để đào tạo mô hình.
Thách thức trong quản lý và bảo vệ dữ liệu cá nhân
Open AI tuyên bố trình thu thập dữ liệu GPTbot của mình cố gắng loại trừ các trang thu thập thông tin cá nhân cũng như các nội dung bị giới hạn hoặc vi phạm quy định thông qua giao thức robots.txt, mà các nhà quản trị website có thể sử dụng để chặn thu thập dữ liệu tự động. Tuy nhiên, giao thức này không mang tính pháp lý bắt buộc và đôi khi khó áp dụng hiệu quả. Đặc biệt trong trường hợp của Universa, Web-Crawler đã không thể nhận biết được dữ liệu nhạy cảm do lỗi hệ thống.
Các chuyên gia bảo vệ dữ liệu cho rằng các biện pháp hiện tại của các nhà cung cấp công nghệ AI là chưa đủ. Nhiều thông tin cá nhân nhạy cảm, như tôn giáo hay dữ liệu y tế, vẫn có thể vô tình được đưa vào dữ liệu huấn luyện thông qua các bài viết trên mạng xã hội. Matthias Spielkamp, Giám đốc tổ chức phi lợi nhuận Algorithmwatch chuyên về minh bạch AI và thuật toán, cho biết các công ty công nghệ cố gắng thu thập mọi dữ liệu có thể tiếp cận được.
Mặc dù chưa từng ghi nhận trường hợp rò rỉ cụ thể như tại Universa, ông Spielkamp chỉ ra rằng rất nhiều cơ sở dữ liệu cá nhân vẫn đang tồn tại trên mạng mà không được bảo vệ, tạo điều kiện cho việc chúng bị sử dụng trong các mô hình AI. Tuy nhiên, việc chứng minh AI có thể trực tiếp tiết lộ dữ liệu cá nhân cụ thể là điều rất khó do các nhà phát triển không công khai dữ liệu đào tạo. Nghiên cứu cho thấy mô hình ngôn ngữ lớn đôi khi có thể nhớ và tái hiện lại thông tin hiếm hoặc độc nhất trong dữ liệu đào tạo, dù các nhà phát triển cố gắng ngăn chặn điều này.
Khuyến cáo bảo vệ khách hàng
Universa khuyến cáo khách hàng cần thường xuyên kiểm tra các sao kê tài khoản ngân hàng và luôn cảnh giác với các email, cuộc gọi hay tin nhắn lạ. Công ty lưu ý không nên trả lời các cuộc gọi hoặc email từ người không rõ danh tính, tránh mở các liên kết hoặc tệp đính kèm đáng ngờ và không cung cấp mật khẩu qua email để hạn chế rủi ro lừa đảo hay mất dữ liệu cá nhân.
Những điều bổ ích từ bài viết
- Lỗi trong quá trình chuyển đổi hệ thống IT khiến dữ liệu khách hàng bảo hiểm Universa tại Đức bị truy cập trái phép trong vài giờ.
- Dữ liệu bao gồm thông tin cá nhân, tài khoản ngân hàng và chi tiết hợp đồng, nhưng không có dữ liệu về sức khỏe hay mật khẩu bị ảnh hưởng.
- Một web-crawler của Open AI đã lấy dữ liệu này trong thời gian xảy ra sự cố nhưng công ty khẳng định không sử dụng cho việc đào tạo AI.
- Các biện pháp kỹ thuật hiện tại từ nhà cung cấp AI như tuân thủ robots.txt chưa đủ bảo vệ dữ liệu cá nhân nhạy cảm khỏi bị thu thập.
- Khách hàng được khuyến cáo kiểm tra tài khoản và cảnh giác trước các nghi vấn lừa đảo sau sự cố thoại.
Đăng ký bản tin QMVN
Nhận tin tổng hợp mỗi sáng - chỉ những bài đáng đọc, không spam.
Bài viết được biên tập với sự hỗ trợ của công cụ trí tuệ nhân tạo (AI), tổng hợp từ các nguồn tin dẫn bên dưới và đã qua kiểm duyệt của toà soạn Quang Minh Việt Nam.





