Procesamiento Inteligente de Documentos y Scraping
Budget: $30 – $250 USD
Buscamos un desarrollador Python con experiencia en procesamiento de lenguaje natural (NLP), machine learning y web scraping, para construir un microservicio que:
Reciba documentos (PDF, Word).
Extraiga y estructure datos clave del texto
Permita optimizar el contenido textual incorporando palabras clave externas.
Realice scraping de sitios web para extraer descripciones de productos.
Aplique modelos de IA (por ejemplo, con TensorFlow o scikit-learn) para analizar compatibilidad entre perfil y oferta, o clasificar el tipo de CV.
Exponga todo como una API REST interoperable con una plataforma web.
⚙️ Requisitos Técnicos:
Python 3.9+ con entorno virtual bien estructurado.
Librerías recomendadas:
NLP: spaCy, NLTK, transformers (opcional).
Procesamiento de documentos: python-docx, PyMuPDF o pdfminer.
Scraping: requests, BeautifulSoup, Selenium o Scrapy (dependiendo de los sitios).
IA: TensorFlow o PyTorch (modelos simples de clasificación o embeddings).
API REST: FastAPI o Flask con documentación Swagger/OpenAPI.
Respuesta en formato JSON estructurado para consumo externo.
Pruebas básicas unitarias y documentación mínima.
Preprocesamiento y vectorización de texto para modelos de ML/IA.
Conocimiento de scraping ético, manejo de cabeceras, proxies, y detección de cambios de estructura HTML.
Capacidad de encapsular todo como un microservicio desplegable (ideal con Docker).
Reciba documentos (PDF, Word).
Extraiga y estructure datos clave del texto
Permita optimizar el contenido textual incorporando palabras clave externas.
Realice scraping de sitios web para extraer descripciones de productos.
Aplique modelos de IA (por ejemplo, con TensorFlow o scikit-learn) para analizar compatibilidad entre perfil y oferta, o clasificar el tipo de CV.
Exponga todo como una API REST interoperable con una plataforma web.
⚙️ Requisitos Técnicos:
Python 3.9+ con entorno virtual bien estructurado.
Librerías recomendadas:
NLP: spaCy, NLTK, transformers (opcional).
Procesamiento de documentos: python-docx, PyMuPDF o pdfminer.
Scraping: requests, BeautifulSoup, Selenium o Scrapy (dependiendo de los sitios).
IA: TensorFlow o PyTorch (modelos simples de clasificación o embeddings).
API REST: FastAPI o Flask con documentación Swagger/OpenAPI.
Respuesta en formato JSON estructurado para consumo externo.
Pruebas básicas unitarias y documentación mínima.
Preprocesamiento y vectorización de texto para modelos de ML/IA.
Conocimiento de scraping ético, manejo de cabeceras, proxies, y detección de cambios de estructura HTML.
Capacidad de encapsular todo como un microservicio desplegable (ideal con Docker).