Thông báo rò rỉ dữ liệu của bảo hiểm Universa

Open AI thu thập dữ liệu qua Web-Crawler

Điều đặc biệt trong sự cố lần này là dữ liệu bị rò rỉ đã được thu thập bởi một chương trình thu thập web (Web-Crawler) tự động của Open AI – công ty phát triển ChatGPT. Universa cho biết Web-Crawler đã truy xuất dữ liệu này từ máy chủ và lấy đi thông tin trong khoảng thời gian duy nhất gây ra sự cố. Web-Crawler là các phần mềm tự động duyệt qua các trang web để thu thập dữ liệu và xử lý kỹ thuật nội dung nhằm phục vụ cho việc huấn luyện các mô hình trí tuệ nhân tạo với khối lượng dữ liệu lớn. Tuy nhiên, các công cụ này thường vô tình thu thập cả dữ liệu cá nhân.

Tiền lệ và phản ứng của Open AI

Năm 2023, các nhà báo dữ liệu của Đài Phát thanh Bayern đã phát hiện dữ liệu cá nhân trong bộ dữ liệu tập huấn luyện lớn LAION5B dùng để tạo hình ảnh AI, trong đó có thể nhận dạng khuôn mặt, tên, tọa độ, email và cả thông tin tài khoản ngân hàng. Ngoài ra, công ty Clearview AI của Mỹ đã thu thập hơn 30 tỷ ảnh từ các mạng xã hội như Instagram, Facebook và Youtube mà không được sự đồng ý, tạo ra cơ sở dữ liệu nhận dạng khuôn mặt và bị các cơ quan bảo vệ dữ liệu châu Âu phạt nhiều triệu USD từ 2022.