Optimizar Descargas Spark para TXT
Budget: $30 – $250 USD
Trabajo con archivos .txt que pesan entre 1 GB y 10 GB y necesito acelerar su descarga y análisis en Apache Spark; después, esos datos se consultarán desde mis procesos de Spring Batch.
Busco a alguien que revise mi flujo actual, identifique cuellos de botella y proponga mejoras (particionamiento, paralelismo, tuning de cluster, uso de cachés, compresión, etc.). La tarea incluye implementar un job de Spark que lea los textos, realice un análisis de datos básico (conteos, filtros, validaciones sencillas) y deje el resultado preparado para que Spring Batch lo consuma sin cambios adicionales.
Al finalizar espero:
• Código y scripts listos para producción (Scala o PySpark, lo que domines).
• Guía breve de configuración y buenas prácticas aplicadas.
• Prueba de rendimiento antes vs. después que muestre la optimización lograda.
Si ya has afinado lecturas masivas de TXT en Spark y conoces cómo integrarlo con Spring Batch, cuéntame tu enfoque y tiempo estimado.
Busco a alguien que revise mi flujo actual, identifique cuellos de botella y proponga mejoras (particionamiento, paralelismo, tuning de cluster, uso de cachés, compresión, etc.). La tarea incluye implementar un job de Spark que lea los textos, realice un análisis de datos básico (conteos, filtros, validaciones sencillas) y deje el resultado preparado para que Spring Batch lo consuma sin cambios adicionales.
Al finalizar espero:
• Código y scripts listos para producción (Scala o PySpark, lo que domines).
• Guía breve de configuración y buenas prácticas aplicadas.
• Prueba de rendimiento antes vs. después que muestre la optimización lograda.
Si ya has afinado lecturas masivas de TXT en Spark y conoces cómo integrarlo con Spring Batch, cuéntame tu enfoque y tiempo estimado.
Related categories:
Scala
Parallel Processing
Data Analysis
PySpark
Apache Spark
Spring Boot
Spring Data
Spring JPA
Batch Normalization