Crawl dữ liệu Shopee sản phẩm
Budget: $250 – $750 USD
Tôi đang cần một đoạn script tự động thu thập “Thông tin và giá sản phẩm” từ Shopee nhưng chỉ trong một vài danh mục cụ thể (tôi sẽ gửi danh sách chi tiết ngay sau khi bắt đầu dự án).
Mục tiêu
– Lấy đầy đủ tên sản phẩm, giá hiện tại, giá gốc (nếu có), thuộc tính chính, tên shop, lượt bán, lượt thích, điểm rating và đường dẫn ảnh.
– Crawler phải đi hết các trang trong danh mục, không bỏ sót, không trùng dữ liệu.
– Kết quả xuất ra CSV / Excel; cột nào ra cột nấy, tiếng Việt không lỗi font.
Yêu cầu kỹ thuật
– Ưu tiên Python sử dụng Scrapy, Requests + BeautifulSoup hoặc Selenium nếu cần vượt qua cơ chế chống bot của Shopee.
– Code sạch, chú thích ngắn gọn, dễ đọc; tôi cần toàn bộ source kèm hướng dẫn chạy trên Windows (có thể bằng file README).
– Bố trí sẵn biến để tôi tự thay đổi hoặc thêm danh mục trong tương lai.
Tiêu chí nghiệm thu
1. Chạy script, nhập danh mục, crawl xong và lưu đúng định dạng.
2. Dữ liệu ngẫu nhiên kiểm tra khớp 100 % với trang Shopee tại thời điểm thu thập.
3. Không bị giới hạn IP quá sớm; nếu cần dùng proxy hoặc delay hợp lý hãy cấu hình sẵn.
Bạn có thể đề xuất phương án tối ưu hơn, miễn đáp ứng các đầu mục trên. Rất mong hợp tác!
Mục tiêu
– Lấy đầy đủ tên sản phẩm, giá hiện tại, giá gốc (nếu có), thuộc tính chính, tên shop, lượt bán, lượt thích, điểm rating và đường dẫn ảnh.
– Crawler phải đi hết các trang trong danh mục, không bỏ sót, không trùng dữ liệu.
– Kết quả xuất ra CSV / Excel; cột nào ra cột nấy, tiếng Việt không lỗi font.
Yêu cầu kỹ thuật
– Ưu tiên Python sử dụng Scrapy, Requests + BeautifulSoup hoặc Selenium nếu cần vượt qua cơ chế chống bot của Shopee.
– Code sạch, chú thích ngắn gọn, dễ đọc; tôi cần toàn bộ source kèm hướng dẫn chạy trên Windows (có thể bằng file README).
– Bố trí sẵn biến để tôi tự thay đổi hoặc thêm danh mục trong tương lai.
Tiêu chí nghiệm thu
1. Chạy script, nhập danh mục, crawl xong và lưu đúng định dạng.
2. Dữ liệu ngẫu nhiên kiểm tra khớp 100 % với trang Shopee tại thời điểm thu thập.
3. Không bị giới hạn IP quá sớm; nếu cần dùng proxy hoặc delay hợp lý hãy cấu hình sẵn.
Bạn có thể đề xuất phương án tối ưu hơn, miễn đáp ứng các đầu mục trên. Rất mong hợp tác!
Related categories:
Python
Data Processing
Excel
Web Scraping
Scrapy
Data Extraction
BeautifulSoup
Selenium