Raspador Diário Sites Imobiliários
Budget: $30 – $250 USD
Quero automatizar a coleta de anúncios em quatro sites imobiliários que não exigem login. O objetivo é extrair diariamente as seguintes informações de cada anúncio:
• Preço e localização
• Detalhes do imóvel — número de quartos, banheiros e metragem
Depois da extração, preciso que o script agrupe os registros em lotes (o tamanho deve ser configurável e facil de modificar) e envie cada lote para a minha API REST já existente, utilizando o endpoint e o formato JSON que vou fornecer.
Escopo que imagino:
1. Fazer as buscas usando os filtros minimos de cada site. Possivelmente será necessário realizar 1 busca para cada cidade. E logo os resultados podem estar paginados ou podem aparecer por scroll infinito, terá que navegar todas as paginas ou fazer scroll ate o finao. Mapear as páginas de listagem e de detalhe dos quatro portais.
2. Criar o scraper em Python integrado com Firecrawl usando Prompt
3. Implementar mapeamento e normalização dos dados, deduplicação básica e detecção de anúncios já atualizados.
4. Envio em lotes para a API com manejo de erros e re-tentativas exponenciais.
5. Agendamento diário via cron, systemd timer ou similar.
6. Logs claros em arquivo e console, além de alertas simples em caso de falha (por exemplo, e-mail ou Slack webhook).
7. Entrega do código-fonte comentado, requirements.txt (ou package.json) e um pequeno README para implantação. Opcionalmente, aceito Dockerfile.
Aceito propostas que tragam melhorias, como testes unitários ou painel simples de monitoramento.
• Preço e localização
• Detalhes do imóvel — número de quartos, banheiros e metragem
Depois da extração, preciso que o script agrupe os registros em lotes (o tamanho deve ser configurável e facil de modificar) e envie cada lote para a minha API REST já existente, utilizando o endpoint e o formato JSON que vou fornecer.
Escopo que imagino:
1. Fazer as buscas usando os filtros minimos de cada site. Possivelmente será necessário realizar 1 busca para cada cidade. E logo os resultados podem estar paginados ou podem aparecer por scroll infinito, terá que navegar todas as paginas ou fazer scroll ate o finao. Mapear as páginas de listagem e de detalhe dos quatro portais.
2. Criar o scraper em Python integrado com Firecrawl usando Prompt
3. Implementar mapeamento e normalização dos dados, deduplicação básica e detecção de anúncios já atualizados.
4. Envio em lotes para a API com manejo de erros e re-tentativas exponenciais.
5. Agendamento diário via cron, systemd timer ou similar.
6. Logs claros em arquivo e console, além de alertas simples em caso de falha (por exemplo, e-mail ou Slack webhook).
7. Entrega do código-fonte comentado, requirements.txt (ou package.json) e um pequeno README para implantação. Opcionalmente, aceito Dockerfile.
Aceito propostas que tragam melhorias, como testes unitários ou painel simples de monitoramento.