Web Scraping / Scrapping

€ 30.00 — 250.00 EUR
Dans le cadre du développement d'un logiciel, nous sommes amenés à récupérer de manière automatisée (scraping) l'ensemble des pdf disponibles sur des sites Internet institutionnels fournissant des données publiques.
Cependant, la diversité des sites visités fait que, dans certains cas, nous manquons une partie des documents.
Un diagnostic nous a permis d'identifier ces ratés et nous souhaitons les corriger.

A ce stade, nous ne disposons pas d'une typologie précise de la cause de ces échecs.
Nous savons que sur certains sites, les pdf ne sont accessibles que via un moteur de recherche.
Dans d'autres cas, il est possible que le site concerné soit une "Single Page application", que notre scraper ne prend pas bien en compte.

L'objectif de la mission est double.
D'une part, il s'agit de récupérer l'ensemble des pdf disponibles sur les sites qu'on vous aura spécifiés et, d'autre part, nous fournir le code que vous avez utilisé pour effectuer cette récupération.
Nous l'intègrerons alors à notre base de code pour pouvoir effectuer une veille sur les sites concernés.

D'un point de vue pratique, les choses se dérouleront de la manière suivante :
- Lorsque nous avons votre email, nous vous ajoutons comme contributeurs au dépôt de code qui contient le code de notre scraper (https://bitbucket.org/projetlmp/crawler-worker-externe/src/master/).
- Vous pouvez alors cloner le dépôt.
Il est exécutable en local, et vous pouvez ainsi tester le scrapper directement sur votre machine.
Le README.md fourni une explication détaillée de comment faire.
Vous pourrez ainsi tester, sur le site sur lequel vous devez effectuer des corrections, comment se comporte la version actuelle du scraper et observer l'output dans les fichiers (visited_urls.txt, et output_urls.txt).
- Vous pouvez alors créer une branche, avec le nom scrapper_NOM_COLLECTIVITE, sur laquelle vous allez pouvoir effectuer votre contribution.
En pratique, ces contributions doivent être limitées à deux fichiers :
o api/helpers/spiders/custom/nom_collectivité.py => fichier que vous devez créer qui contiendra la custom_spider permettant de scrapper la collectivité concernées.
o api/helpers/spiders/custom/__init__.py => dans lequel il faut ajouter votre custom_spider.
- Vous pouvez refaire tourner le scrapper sur la collectivité concernée, et extraire d’output_urls.txt les documents trouvés.
Cela vous permettra de voir si vous en avez plus.
- Quand vous pensez avoir fini :
o Ouvrez une Pull Request de votre branche sur develop
o Envoyez par email la liste de document que le scrapper récupère désormais sur la collectivité concernée, suite à vos modifications.

Il faut maîtriser Python, le package Scrapy et également Git.

Comme nous ignorons les causes exactes des problèmes, nous ne savons pas combien de temps cela vous prendra pour les régler.
C'est pour cela que nous souhaitons vous engager pour une journée de travail.
Nous vous soumettrons suffisamment d'URL problématiques pour remplir votre journée.
Le nombre de cas que vous aurez traités nous servira de référence pour renouveler la mission selon des modalités restant à préciser.

En effet, nous estimons le nombre total de sites à corriger à plusieurs centaines.
S'il s'avère que cette mission est un succès, elle pourra donc déboucher sur de nombreuses autres.
Cela doit vous conduire à envisager cette journée de travail pour nous (et le coût d'entrée qu'elle représente) comme un investissement pour la suite (sous réserve bien entendu que vous souhaitiez renouveler ce type de missions).

Nous espérons que cette mission marquera le début d'une longue et fructueuse collaboration avec nous !

Similar Freelance jobs:

Zamaso Inc
I need scripts from textnow or any wesbsite of sending free sms With this script i need to send bulk sms
Full Description of Zamaso inc
I Want To Build A Tool Using Hap.py Benchmarking (nist) To Validate Any Vcf File By Running The File
The inputs to hap.py are two VCF files (a "truth" and a "query" file), the truth file is found here https://www.nature.com/articles/sdata201625/tables/3 which includes extensive genome sequencing for 1 person. So we can validate any VCF file by comparing our VCF with the truth VCF and the outcome will include a table with TP FP TN FN and precision with the sensitivity you can read more about it on this page: https://github.com/RealTimeGenomics/rtg-tools https://github.com/Illumina/hap.py/blob/master/doc/happy.md#working-with-genome-vcfs
Full Description of I want to build a tool using Hap.py…
Api & Web App For Interactive Brokers
I need an API & web app for Interactive brokers that will buy and sale stocks based on settable criteria in the API. The trades will be based on stock information received from a 3rd party data scraping service. The API must be able to trade three separate types of signals. See attached notes and UI layout for details of the project.
Full Description of API & Web App for Interactive Brokers
Secure Link Topology Architecture For Software Defined Networking (sdn)
I'm a researcher in Computer Networks, whose areas of interest in Software Defined Networks. 1.The project is to re-implement the attached file on SLDP: A secure and lightweight link discovery protocol in software defined networking and get the actual results with the use of Mininet emulator and Ryu controller. Also identify the weaknesses of the work 2. After the re-implementation, the weaknesses are to be strengthen 3. propose a secure and distributed link discovery protocol for software defined networking 4.…
Full Description of Secure Link Topology Architecture for Software Defined Networking…
Build An Sram Memory Compiler Based On "openram" Project.
A configurable SRAM compiler written in Python to tile the bit cells and address decoder blocks, extract the Verilog and parasitic RC models, and generate the GDS2 block database. The project should leverage the "openRAM" open source code as much as possible to achieve the above objectives.
Full Description of Build an SRAM memory compiler based on "openRAM"…
Webscraping Real Estate
Hi, I'm working in real estate and I want to keep track of new opportunities on certain websites. These websites are real estate sites or platforms. Now I do this all manually, with a clipper from Airtable, where my data is stored. I would like to automate the most I can. The first part would be to check the new opportunities en load all the data in Airtable. The second part would be that there is a check if the…
Full Description of Webscraping real estate
Create A Script To Collect Information -- 2
I would like to create a script to automate some repettive task on Excel and to collect some info on Google and a Website
Full Description of Create a script to collect information -- 2
Statistical Tts & Stt Desktop Softwar Engine Which Will Work With Jaws
Desktop voice is desktop-based software that is installed as X-language voice on a computer with Windows operating system. This software engine after installation is used by the operating system to synthesize words in X-Language. This software engine can be used by other application programs such as voice, e.g. in JAWS screen reader this software/voice can be selected so that the words synthesized by JAWS are synthesized in X-Language. Also, this voice can be used by other programs that require the…
Full Description of Statistical TTS & STT Desktop softwar engine which…
Python Program
It is a project for RPA (Robotic Process Automation).
Full Description of Python Program
Maquetador En Odoo
Se Busca desarrollador en Odoo con experiencia maqueando paginas desde cero. Maquetar paginas del sitio web. Maquetar plantillas de correo electrónico
Full Description of Maquetador en odoo
© 2006 — 2026 hirelancer.com is an affiliate website, listing the freelance projects. We are collaborating with other sites like getFreelancer.com. Feel free to bid on any project and good luck! You will need register first, before bidding or posting projects. Basic memberhsip is always free. We might earn commissions from referring you. You will never ever pay additional fees for we referred you.