Script en Python para armar un corpus recuperando textos de discusiones parlamentarias

Job ID: 30818194

Budget: $10 – $30 USD

Hola,

Para un proyecto académico, necesito obtener un script en Python para armar un Corpus a partir de los textos taquigráficos de discusiones parlamentarias (carpeta de archivos en PDF y HTML) para una persona específica (SEÑOR XXX), ingresando el nombre de esa persona.

Todos los textos están formateados de la misma manera:
SEÑOR AAA (NOMBRE de una persona): « texto taquigráfico sobre lo hablado en la sesión »
SEÑOR BBB (NOMBRE de otra persona que responde): « texto taquigráfico sobre la respuesta en la sesión »
SEÑOR AAA etc…

Adjunto algunos archivos como ejemplo.

Resumen: necesito recuperar de una carpeta de archivos todo lo que dijo una persona (SEÑOR XXX) de diferentes archivos texto y guardarlo en un archivo separado de texto.
Related categories: Python Regular Expressions