Thâm nhập web đen tiếng Trung bằng trí tuệ nhân tạo
Khu vực web đen vốn ít người biết đến, nổi tiếng với các giao tiếp được mã hóa và kỹ thuật định tuyến ẩn danh khiến hoạt động người dùng gần như không thể truy dấu, đã trở thành nơi ẩn náu cho nhiều hoạt động phi pháp và giao dịch dữ liệu bất hợp pháp. Trong thời gian qua, các nhà nghiên cứu tại Trung Quốc đã có những bước tiến đáng kể trong việc phân tích nội dung trên web đen, đặc biệt tập trung vào toàn bộ ngữ liệu tiếng Trung - một lĩnh vực trước đây chưa được khai thác nhiều.
Vào tháng 5 năm nay, nhóm nghiên cứu thuộc Đại học Cảnh sát Điều tra Hình sự Trung Quốc đã công bố một nghiên cứu trên tạp chí Journal of Chinese Computer Systems, tập trung vào mô hình AI được huấn luyện chuyên biệt để dịch và đánh giá nội dung trên web đen tiếng Trung.
Chiến lược thu thập dữ liệu vượt qua biện pháp bảo vệ
Bước đầu tiên đặt ra cho nhóm nghiên cứu là làm sao xâm nhập vào các trang web đen để thu thập dữ liệu. Họ nhận thấy mỗi nền tảng có cách yêu cầu đăng nhập khác nhau và trình thu thập dữ liệu truyền thống thường xuyên gặp khó khăn với các yếu tố xác thực Captcha cùng các chiến thuật chống quét dữ liệu thay đổi liên tục.





