Web scrapping de normas
Budget: $30 – $250 USD
Objetivo: ao final, carregar conteúdo normativo para uma base SQL postgres, incluindo informações de contexto.
Origem: URLs para normas, decisões e enunciados, tanto em pdf quanto em html. Arquivos fornecidos, planalto.gov., cnj, stf e stj.
Destino: em um primeiro projeto, um texto preprocessado .txt UTF8. Em um segundo momento, se evoluirmos, carga em uma base de dados estruturada SQL.
Tecnologia: primeiro momento python, pyPDF2, beautifulsoup ou selenium, regex, anaconda. segundo momento psycopg2.
Etapas: obtenção da fonte de dados bruta, exclusoes, verificação da condificação (ansi, asc, utf, etc), remocoes e exclusoes de caracteres, marcação com hashes.
Origem: URLs para normas, decisões e enunciados, tanto em pdf quanto em html. Arquivos fornecidos, planalto.gov., cnj, stf e stj.
Destino: em um primeiro projeto, um texto preprocessado .txt UTF8. Em um segundo momento, se evoluirmos, carga em uma base de dados estruturada SQL.
Tecnologia: primeiro momento python, pyPDF2, beautifulsoup ou selenium, regex, anaconda. segundo momento psycopg2.
Etapas: obtenção da fonte de dados bruta, exclusoes, verificação da condificação (ansi, asc, utf, etc), remocoes e exclusoes de caracteres, marcação com hashes.