RECONHECIMENTO DE DOCUMENTOS ATRAVÉS DE "DEEP LEARNING" E OCR
Budget: $25 – $50 USD
RECONHECIMENTO DE DOCUMENTOS ATRAVÉS DE "DEEP LEARNING" E OCR
Utilizar inteligência artificial para identificar se uma imagem contém um documento válido (documentos do tipo carteira de habilitação, documento de identificação pessoal, documento de licenciamento de veículo, etc), e extrair o seu conteúdo para validação de autenticidade.
Quando estamos falando de documentos, precisamos destacar uma área de interesse dentro da imagem que contenha somente o conteúdo a ser extraído. Dessa maneira, o software deverá aprender a identificar o documento atraves de rotinas de "DEEP LEARNING". O treinamento do "DEEP LEARNING" deverá ser feito através do fornecimento de diversas amostras de documentos, onde através desta rotina, poderemos delimitar a área a ser analisada pela IA, selecionando as coordenadas dentro da imagem do documento, que chamaremos de "bounding box". A "bounding box" deve ter um limiar de confiança mínimo de 70% (imagem chamada "bouding-box.gif" em anexo).
Atraves desses procedimentos que citei, atraves de uma rotina de software, criaremos um "dataset" de documentos contendo exemplos de documentos a serem detectados. Para o treinamento da IA, cada imagem do "dataset" deve estar acompanhada de um arquivo XML que descreve as coordenadas do bounding box. Este também deve identificar qual classe esse objeto pertence (imagem sugerida de estrutura do dataset em anexo com o nome "dataset.png").
Uma vez que o documento identificado, é hora de extrair o texto para validações com o uso de OCR.
Toda imagem que entrar na rotina de OCR precisa antes passar por um tratamento para alinhamento do texto em 90o graus, baseado no alinhamento de linhas paralelas encontradas na imagem, e precisa ser ajustada a perpectiva calculando o tamanho dos objetos retangulares dentro da imagem e tratando os angulos entre as arestas ("skew" e "four point transform" confirme imagem em anexo chamada "skew_and_four-point-transform.png"). É desta forma que tentamos garantir que a imagem que chegar ao OCR será nítida. Caso algum dos tratamentos falhar, há grandes chances da imagem recebida ser gerar erros pelo algoritmo de OCR.
Com o Bouding Box, dataset e documento alinhado, é hora de executar o algoritmo de OCR na imagem.
O algoritmo OCR deverá retornar as coordenadas delimitadoras dos textos detectados e a cadeia de caracteres de cada uma delas. Com isso ele deve ser inserido numa estrutura de chave e valor para conseguir separar as informações, por exemplo, "Data de nascimento" (chave) e "01/01/1999" (valor). Veja o anexo chamado "estrutura-chave-valor.png".
Utilizar inteligência artificial para identificar se uma imagem contém um documento válido (documentos do tipo carteira de habilitação, documento de identificação pessoal, documento de licenciamento de veículo, etc), e extrair o seu conteúdo para validação de autenticidade.
Quando estamos falando de documentos, precisamos destacar uma área de interesse dentro da imagem que contenha somente o conteúdo a ser extraído. Dessa maneira, o software deverá aprender a identificar o documento atraves de rotinas de "DEEP LEARNING". O treinamento do "DEEP LEARNING" deverá ser feito através do fornecimento de diversas amostras de documentos, onde através desta rotina, poderemos delimitar a área a ser analisada pela IA, selecionando as coordenadas dentro da imagem do documento, que chamaremos de "bounding box". A "bounding box" deve ter um limiar de confiança mínimo de 70% (imagem chamada "bouding-box.gif" em anexo).
Atraves desses procedimentos que citei, atraves de uma rotina de software, criaremos um "dataset" de documentos contendo exemplos de documentos a serem detectados. Para o treinamento da IA, cada imagem do "dataset" deve estar acompanhada de um arquivo XML que descreve as coordenadas do bounding box. Este também deve identificar qual classe esse objeto pertence (imagem sugerida de estrutura do dataset em anexo com o nome "dataset.png").
Uma vez que o documento identificado, é hora de extrair o texto para validações com o uso de OCR.
Toda imagem que entrar na rotina de OCR precisa antes passar por um tratamento para alinhamento do texto em 90o graus, baseado no alinhamento de linhas paralelas encontradas na imagem, e precisa ser ajustada a perpectiva calculando o tamanho dos objetos retangulares dentro da imagem e tratando os angulos entre as arestas ("skew" e "four point transform" confirme imagem em anexo chamada "skew_and_four-point-transform.png"). É desta forma que tentamos garantir que a imagem que chegar ao OCR será nítida. Caso algum dos tratamentos falhar, há grandes chances da imagem recebida ser gerar erros pelo algoritmo de OCR.
Com o Bouding Box, dataset e documento alinhado, é hora de executar o algoritmo de OCR na imagem.
O algoritmo OCR deverá retornar as coordenadas delimitadoras dos textos detectados e a cadeia de caracteres de cada uma delas. Com isso ele deve ser inserido numa estrutura de chave e valor para conseguir separar as informações, por exemplo, "Data de nascimento" (chave) e "01/01/1999" (valor). Veja o anexo chamado "estrutura-chave-valor.png".
Related categories:
Copywriting
Translation
Spanish Translator
Castilian Spanish Translator
English (US) Translator