Thách thức trong việc tiếp cận dữ liệu dark web tiếng Trung
Dark web là khu vực trên mạng sử dụng các giao thức mã hóa và ẩn danh nhằm che giấu hoạt động người dùng, thường được các đối tượng phạm pháp và buôn bán dữ liệu bất hợp pháp sử dụng. Việc tiếp cận và phân tích nội dung trong môi trường này luôn là một thách thức vì các trang web thường yêu cầu đăng nhập và áp dụng nhiều biện pháp phòng chống thu thập dữ liệu như captcha và thay đổi kỹ thuật để ngăn chặn các trình thu thập tự động.
Nhóm nghiên cứu thuộc Đại học Cảnh sát Hình sự Trung Quốc đã phát triển một hệ thống riêng biệt nhằm xử lý các tác vụ khác nhau từ việc đăng nhập, lập danh sách đến tải hình ảnh, đồng thời điều phối tần suất truy cập để tránh bị phát hiện. Hệ thống này đã thu thập thành công trên 10.000 mẫu dữ liệu từ tám trang web và diễn đàn giao dịch tiếng Trung trên dark web.
Chuyển đổi hình ảnh và huấn luyện mô hình AI phân loại nội dung
Sau khi thu thập dữ liệu, các nội dung văn bản và hình ảnh, bao gồm cả hình ảnh chứa thông tin thẻ ngân hàng, được chuyển đổi thành mô tả văn bản thống nhất bằng một mô hình khác do nhóm nghiên cứu phát triển. Tiếp theo, các nhà nghiên cứu thủ công gán nhãn cho 1.800 mẫu dữ liệu làm “hạt giống” để đào tạo mô hình phân loại ban đầu.








