Optimizar Descargas Spark para TXT

Job ID: 40383978

Budget: $30 – $250 USD

Trabajo con archivos .txt que pesan entre 1 GB y 10 GB y necesito acelerar su descarga y análisis en Apache Spark; después, esos datos se consultarán desde mis procesos de Spring Batch.

Busco a alguien que revise mi flujo actual, identifique cuellos de botella y proponga mejoras (particionamiento, paralelismo, tuning de cluster, uso de cachés, compresión, etc.). La tarea incluye implementar un job de Spark que lea los textos, realice un análisis de datos básico (conteos, filtros, validaciones sencillas) y deje el resultado preparado para que Spring Batch lo consuma sin cambios adicionales.

Al finalizar espero:
• Código y scripts listos para producción (Scala o PySpark, lo que domines).
• Guía breve de configuración y buenas prácticas aplicadas.
• Prueba de rendimiento antes vs. después que muestre la optimización lograda.

Si ya has afinado lecturas masivas de TXT en Spark y conoces cómo integrarlo con Spring Batch, cuéntame tu enfoque y tiempo estimado.