ĐẶC TẢ NGHIỆP VỤ: THỰC THI VÀ TRÍCH XUẤT (SCRAPING & EXECUTION)#
Tài liệu này quy định các logic nghiệp vụ diễn ra tại Worker Node, bao gồm quản trị tiến trình trình duyệt và các kỹ thuật trích xuất thông tin tự động hóa.
1. Quản trị Tài nguyên Trình duyệt (Browser Session Pool)#
Hoạt động mở Chrome chiếm dụng lượng lớn RAM. Do đó, Worker Node phải tuân thủ các quy tắc quản trị bộ nhớ nghiêm ngặt:Khống chế Đa luồng (Throttling): Biến môi trường BROWSER_LIMIT thiết lập giới hạn cứng cho số lượng trình duyệt (Browser Instance) được phép mở đồng thời. Khi chạm ngưỡng này, các tác vụ mới nhận từ Master sẽ bị kẹt lại ở hàng đợi cục bộ của Worker chờ xử lý.
Giải phóng Tài nguyên: Ngay sau khi hoàn thành quy trình quét (thành công hoặc thất bại), Worker buộc phải đóng hoàn toàn Tab (Page) và Phiên làm việc (Session).
Dọn dẹp Dữ liệu rác: Khi Worker khởi động lại, kịch bản khởi tạo sẽ tiến hành xóa toàn bộ thư mục cấu hình trình duyệt tạm (tmp/user-data) để tránh việc lấp đầy dung lượng đĩa cứng SSD.
2. Kỹ thuật Ẩn danh và Chống phát hiện (Anti-Detect & Stealth)#
Mục tiêu thu thập dữ liệu yêu cầu Worker phải mô phỏng chính xác hành vi duyệt web của con người để vượt rào cản Anti-bot.Mô phỏng Môi trường (Device Fingerprinting): Worker linh hoạt thay đổi các chỉ số nhận diện như User-Agent, Viewport và thông số WebGL dựa trên yêu cầu của tác vụ (Giả lập Desktop PC hoặc Mobile Device).
Mô phỏng Thao tác (Ghost Cursor): Hệ thống ứng dụng thuật toán tạo ra các chuyển động chuột không tuyến tính (Non-linear movement), mô phỏng thao tác cuộn và nhấp chuột ngẫu nhiên trên trang.
Ẩn danh Mạng (Proxy Injection): Toàn bộ lưu lượng mạng của trình duyệt phải đi qua IP Proxy. Nếu tiến trình xin cấp phát Proxy thất bại, hoặc IP được cấp bị liệt vào danh sách chặn (Blacklist), tác vụ phải tự động hủy và báo cáo ngoại lệ.
3. Quy tắc Trích xuất Thông tin (Data Parsing Rules)#
Việc phân tích cấu trúc DOM (Document Object Model) sau khi trang tải hoàn tất dựa trên ba luồng dữ liệu chính:Quảng cáo Trả phí (Ads): Hệ thống nhận diện các khối kết quả có gắn thẻ "Được tài trợ" (Sponsored) hoặc "Ads". Dữ liệu bóc tách bao gồm URL đích và Vị trí hiển thị (Rank).
Thứ hạng Tự nhiên (Organic SEO): Bóc tách danh sách các kết quả tìm kiếm không trả phí. Dữ liệu bắt buộc thu thập gồm: Tiêu đề trang (Title), Mô tả ngắn (Meta Description), URL và Vị trí hiển thị.
Liên kết Nội dung (Anchor Text): Worker điều hướng trực tiếp vào trang đích được chỉ định. Tại đây, hệ thống rà soát toàn bộ cấu trúc thẻ <a>. Nếu nhãn văn bản (Text content) khớp với Từ khóa chỉ định, Worker ghi nhận URL hiện tại và trích xuất đoạn mã HTML chứa liên kết đó làm bằng chứng.
Ngày cập nhật 2026-03-30 10:53:17