Treinar IA para Triagem de Textos -- 2
Budget: $10 – $30 USD
Preciso que você treine uma inteligência artificial offline (Ollama ou equivalente), para funcionar no servidor próprio e intranet da empresa. O requisito é triagem de unicidade de textos em português brasileiro. Todos os dias o modelo deve comparar cerca da 10 textos (de 1000 a 1500 caracteres) com uma base de 5 a 8 mil textos de mesmo tamanho, cuja escrita não segue nenhum padrão pré-definido, assegurando unicidade de todos os textos a serem adicionados a base. O modelo deve definir um score de similaridade, exibindo para cada texto comparado sobre a base o score e os top5 textos da base mais similares ao de entrada.
A comparação é semântica, então, se for pre processar (e devemos discutir orçamento disso) recomendaria: (1) Normalização leve (opcional): minúsculas, remoção de ruído; evite stem pesado que pode distorcer termos técnicos. Se precisar de stemming para PT-BR, o RSLP é o padrão. (2) Embeddings de sentenças para similaridade: calcule vetores e compare por cosine. Priorize modelos robustos em PT/multilíngue (e.g., variantes SBERT ou USE multilíngue; SimCSE quando disponível). (3) Clusterização/temas: agrupe embeddings para descobrir tópicos de ideias; complemente com tópicos (LDA) e keyphrases (TextRank/YAKE) para rótulos interpretáveis. (4) Híbrido para busca: para encontrar ideias “parecidas” dentro de um acervo grande, use BM25 para recall + re-rank neural (cross-encoder/bi-encoder). (5) Avaliação: adote métricas inspiradas em STS (correlação Spearman entre julgamentos humanos e scores) ou avaliações humanas com escala 0–5 de similaridade semântica.
Não necessariamente precisa fazer isso tudo, discutamos preço, prazo e eficiência do que vc achar melhor e mais cabível.
A comparação é semântica, então, se for pre processar (e devemos discutir orçamento disso) recomendaria: (1) Normalização leve (opcional): minúsculas, remoção de ruído; evite stem pesado que pode distorcer termos técnicos. Se precisar de stemming para PT-BR, o RSLP é o padrão. (2) Embeddings de sentenças para similaridade: calcule vetores e compare por cosine. Priorize modelos robustos em PT/multilíngue (e.g., variantes SBERT ou USE multilíngue; SimCSE quando disponível). (3) Clusterização/temas: agrupe embeddings para descobrir tópicos de ideias; complemente com tópicos (LDA) e keyphrases (TextRank/YAKE) para rótulos interpretáveis. (4) Híbrido para busca: para encontrar ideias “parecidas” dentro de um acervo grande, use BM25 para recall + re-rank neural (cross-encoder/bi-encoder). (5) Avaliação: adote métricas inspiradas em STS (correlação Spearman entre julgamentos humanos e scores) ou avaliações humanas com escala 0–5 de similaridade semântica.
Não necessariamente precisa fazer isso tudo, discutamos preço, prazo e eficiência do que vc achar melhor e mais cabível.