Script en Python para armar un corpus recuperando textos de discusiones parlamentarias
Budget: $10 – $30 USD
Hola,
Para un proyecto académico, necesito obtener un script en Python para armar un Corpus a partir de los textos taquigráficos de discusiones parlamentarias (carpeta de archivos en PDF y HTML) para una persona específica (SEÑOR XXX), ingresando el nombre de esa persona.
Todos los textos están formateados de la misma manera:
SEÑOR AAA (NOMBRE de una persona): « texto taquigráfico sobre lo hablado en la sesión »
SEÑOR BBB (NOMBRE de otra persona que responde): « texto taquigráfico sobre la respuesta en la sesión »
SEÑOR AAA etc…
Adjunto algunos archivos como ejemplo.
Resumen: necesito recuperar de una carpeta de archivos todo lo que dijo una persona (SEÑOR XXX) de diferentes archivos texto y guardarlo en un archivo separado de texto.
Para un proyecto académico, necesito obtener un script en Python para armar un Corpus a partir de los textos taquigráficos de discusiones parlamentarias (carpeta de archivos en PDF y HTML) para una persona específica (SEÑOR XXX), ingresando el nombre de esa persona.
Todos los textos están formateados de la misma manera:
SEÑOR AAA (NOMBRE de una persona): « texto taquigráfico sobre lo hablado en la sesión »
SEÑOR BBB (NOMBRE de otra persona que responde): « texto taquigráfico sobre la respuesta en la sesión »
SEÑOR AAA etc…
Adjunto algunos archivos como ejemplo.
Resumen: necesito recuperar de una carpeta de archivos todo lo que dijo una persona (SEÑOR XXX) de diferentes archivos texto y guardarlo en un archivo separado de texto.