Automatisation Veille Presse Multi-Formats

Job ID: 39759083

Budget: €8 – €30 EUR

J’ai déjà posé les bases d’un outil de veille qui collecte la presse écrite, mais il reste à achever et fiabiliser l’ensemble du workflow. L’objectif final est simple : chaque jour, récupérer les éditions locale, régionale, nationale et internationale, analyser leur contenu (PDF, HTML ou tout autre format pérenne), puis me livrer un rapport qui ne retient que les articles contenant les mots-clés que je définis moi-même et en propose un résumé clair.

Ce qu’il manque aujourd’hui :
• un connecteur robuste (Python, Scrapy, BeautifulSoup ou autre) qui télécharge automatiquement chaque journal dès sa parution, quel que soit son support ;
• un pipeline d’OCR et de nettoyage pour les PDF scannés (Google ou autre ;
• une extraction du texte homogène entre PDF et pages HTML ;
• une recherche par mots-clés dynamiques, modifiables depuis une mini-interface (déjà existante) ;
• un module de synthèse (par exemple spaCy, gensim, transformers ou simplement par IA) générant un condensé par article (en rapport avec le mot clé) et un récapitulatif global ;
• une planification (cron, Airflow ou équivalent) afin que tout s’exécute sans intervention manuelle ;
• affiché le résumé de l’article et son lien et autres infos pertinentes sur la mini-interface

Je fournis : l’arborescence du projet existant, quelques scripts partiellement fonctionnels et la liste des titres à surveiller. Ton rôle est de revoir l’architecture, optimiser le code, documenter l’installation et valider le résultat sur plusieurs jours de publication consécutifs. Si tu as déjà mis en place des solutions similaires ou que tu maîtrises bien les bibliothèques de NLP et de scraping, je serai ravi de collaborer avec toi.


Ne pas tenir compte du prix
Fourchette flexible
Pas plus de 100/150€
Il s’agit juste de connecter différents systèmes entre eux merci