Proyecto: Sistema OCR + IA para extracción estructurada de cartas de menú -- 3

Job ID: 39700037

Budget: $2 – $8 USD

Proyecto: Sistema OCR + IA para extracción estructurada de cartas de menú

Presupuesto estimado: USD $100
Tiempo de entrega: 4 días
Tipo de proyecto: Entrega única



Descripción general

Se requiere el desarrollo de un script o módulo en Python capaz de:
1. Procesar archivos PDF, JPG, PNG o JPEG que contengan cartas de menú de restaurantes.
2. Aplicar OCR con Google Cloud Vision para extraer el contenido textual con alta precisión (incluso en imágenes con baja calidad o perspectiva).
3. Usar post-procesado con GPT-4o o Gemini 1.5 para interpretar y estructurar el texto automáticamente, reconociendo:
• Categoría (ej.: Desayunos, Entrantes, Bebidas)
• Título del plato
• Descripción del plato (si existe)
• Alérgenos mencionados
• Precios:
• Si hay un único precio, se guarda directamente.
• Si hay varios precios para un plato, también se guardan los títulos de precio (ej.: Barra, Mesa, Delivery) junto con sus valores.
• Suplemento por terraza (si aparece)
4. Exportar los datos estructurados a Excel, CSV o JSON.
5. Implementar un control de uso que limite el sistema a un máximo de 5 subidas mensuales por usuario, identificado por IP o por token simple.
6. El sistema no requiere interfaz gráfica: puede ejecutarse desde línea de comandos, carpeta de archivos o integrarse posteriormente a un panel web externo.



Tecnologías requeridas
• OCR: Google Cloud Vision API
• Post-procesado IA: GPT-4o (OpenAI) o Gemini 1.5 (Google)
• Lenguaje: Python (preferido)
• Librerías sugeridas:
• google-cloud-vision (OCR)
• openai o SDK de Gemini (IA)
• pandas (manejo de datos)
• openpyxl (exportación a Excel)
• regex (procesamiento adicional de texto si es necesario)



Entregables
1. Código fuente completo, funcional y documentado.
2. Archivo README con instrucciones de instalación y uso.
3. Ejemplos reales de exportaciones (Excel, CSV y JSON).
4. Implementación funcional del límite de uso mensual (5 subidas por usuario/IP o token).
5. Procesamiento y exportación exactamente con el formato de datos especificado.



Requisitos del programador
• Experiencia comprobable en OCR y procesamiento de lenguaje natural (NLP).
• Experiencia con Google Cloud Vision API y modelos LLM (GPT/Gemini).
• Entrega en máximo 4 días.
• Comunicación clara y orientada a resultados.



Ejemplo de lo que espero que haga el OCR

Quiero que el sistema pueda tomar una carta en PDF o imagen, reconocer su contenido y devolverlo estructurado de esta manera:

Categoría: Desayunos
• Tostadas con aguacate
• Descripción: Pan integral tostado con aguacate fresco, tomate y un toque de limón.
• Alérgenos: gluten
• Precio: 150
• Omelette de jamón y queso
• Descripción: Huevos batidos rellenos de jamón cocido y queso cheddar, servidos con pan.
• Alérgenos: huevo, lácteos, gluten
• Precios:
• Barra: 130
• Mesa: 150
• Delivery: 160
• Yogur con frutas
• Descripción: Yogur natural con mezcla de frutas de temporada y granola casera.
• Alérgenos: lácteos, frutos secos
• Precio: 120