Scraping diario SEACE a CSV
Budget: $10 – $30 USD
Necesito automatizar la extracción de toda la información pública disponible en el buscador de contrataciones de SEACE (https://prod6.seace.gob.pe/buscador-publico/contrataciones). En el archivo adjunto detallo los campos y la estructura deseada, pero en resumen quiero cada registro completo, sin omitir columnas.
La herramienta debe ejecutarse todos los días sin intervención manual, generar un único CSV consolidado y sobrescribirlo o versionarlo según prefieras. Acepto que trabajes en Node.js con puppeteer/cheerio o en Python con requests/selenium/BeautifulSoup, siempre que el resultado sea estable.
Si el portal devuelve errores temporales, el script tiene que reintentar automáticamente hasta completarse. No necesito notificaciones por correo ni archivos de log extensos, solo un mecanismo de re‐intento robusto.
Entregables esperados:
• Código fuente bien comentado.
• Archivo requirements.txt o package.json con instrucciones claras de instalación.
• Script o job scheduler (cron, PM2, etc.) que ejecute el scraping diario.
• Primer CSV generado como muestra, con todos los campos solicitados.
• Breve README que explique cómo desplegar y cómo ajustar la frecuencia si fuera necesario.
Acepto sugerencias para optimizar tiempos de ejecución o estructura de datos, siempre que el CSV final conserve todas las columnas originales.
Se adjunta archivo para mayor detalle.
La herramienta debe ejecutarse todos los días sin intervención manual, generar un único CSV consolidado y sobrescribirlo o versionarlo según prefieras. Acepto que trabajes en Node.js con puppeteer/cheerio o en Python con requests/selenium/BeautifulSoup, siempre que el resultado sea estable.
Si el portal devuelve errores temporales, el script tiene que reintentar automáticamente hasta completarse. No necesito notificaciones por correo ni archivos de log extensos, solo un mecanismo de re‐intento robusto.
Entregables esperados:
• Código fuente bien comentado.
• Archivo requirements.txt o package.json con instrucciones claras de instalación.
• Script o job scheduler (cron, PM2, etc.) que ejecute el scraping diario.
• Primer CSV generado como muestra, con todos los campos solicitados.
• Breve README que explique cómo desplegar y cómo ajustar la frecuencia si fuera necesario.
Acepto sugerencias para optimizar tiempos de ejecución o estructura de datos, siempre que el CSV final conserve todas las columnas originales.
Se adjunta archivo para mayor detalle.
Related categories:
JavaScript
Python
Data Processing
Web Scraping
Node.js
Data Extraction
Selenium
Automation