Você digitaliza um formulário em papel que alguém preencheu à mão. O texto impresso no formulário é claro. As respostas manuscritas nas caixas são confusas, mas legíveis para um ser humano. Você executa o OCR na digitalização, na esperança de tornar o formulário pesquisável e as respostas manuscritas extraíveis como texto. O resultado do OCR para o texto impresso é quase perfeito. O resultado do OCR para a caligrafia é algo sem sentido. O mecanismo de reconhecimento, treinado em fontes impressas, não consegue entender as formas variáveis e irregulares da caligrafia humana.
Documentos contendo texto digitado e manuscrito apresentam um duplo desafio para os mecanismos OCR PDF. O texto impresso precisa de OCR padrão, que funciona bem. A caligrafia necessita de reconhecimento de caligrafia especializado, que é menos preciso e requer configurações diferentes. Lidar com ambos em um único documento requer uma estratégia que trate cada tipo de conteúdo de forma adequada.

Por que a escrita à mão é muito mais difícil para mecanismos de OCR
O OCR de texto impresso funciona combinando formas de caracteres com padrões de fontes conhecidos. A letra "a" em Times New Roman de 12 pontos parece quase idêntico sempre que aparece. O mecanismo de OCR armazena um modelo da aparência das letras Times New Roman e compara-as com esse modelo. A caligrafia não tem esse modelo. Cada pessoa é "um" parece diferente. Até mesmo o "a" varia de uma ocorrência para outra, dependendo das letras ao redor, da velocidade de escrita, do ângulo da caneta e da fadiga. Não existe um padrão fixo para combinar.
O reconhecimento de escrita manual usa modelos de aprendizado de máquina treinados em milhares ou milhões de amostras de escrita manual. Esses modelos aprendem os padrões estatísticos de como as letras manuscritas variam e podem reconhecer caracteres mesmo quando eles se desviam significativamente de qualquer modelo único. A precisão do reconhecimento de escrita manual melhorou dramaticamente com o aprendizado profundo, mas ainda fica atrás do reconhecimento de texto impresso por uma margem significativa. Um benchmark de 2025 da PDF Association encontrou precisão de OCR de texto impresso acima de 97% em digitalizações limpas. A precisão do reconhecimento de escrita no mesmo benchmark foi de aproximadamente 80% a 85%, o que significa que aproximadamente uma em cada cinco a seis palavras manuscritas contém um erro (PDF Association, "OCR Accuracy Benchmark Report", 2025).
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Estratégias para OCR em documentos mistos digitados e manuscritos
A estratégia mais eficaz é separar o documento em regiões digitadas e regiões manuscritas e processar cada uma com o mecanismo de reconhecimento apropriado. Essa separação pode ser feita manualmente cortando ou mascarando o documento em seções, ou automaticamente por um mecanismo de reconhecimento que detecta o tipo de conteúdo por região.
A ferramenta OCR de WukongPDF detecta se cada região de texto da página é impressa ou manuscrita e aplica o modelo de reconhecimento apropriado. Em um formulário com etiquetas impressas e respostas manuscritas, as etiquetas são reconhecidas com o modelo de texto impresso com alta precisão. As respostas manuscritas são processadas com o modelo de caligrafia com a precisão que a qualidade da caligrafia permitir. A saída é uma única camada de texto que combina os dois resultados de reconhecimento.
Melhorando a precisão do OCR de caligrafia por meio de uma melhor digitalização
A qualidade da digitalização tem um impacto maior no reconhecimento de manuscrito do que no reconhecimento de texto impresso. Digitalize com no mínimo 300 DPI. Uma resolução mais alta dá ao mecanismo de reconhecimento mais pixels por caractere para analisar. Use tons de cinza ou modo colorido em vez de preto e branco puro. As sutis variações de cinza em um traço manuscrito carregam informações sobre formatos de letras que o limiar em preto e branco puro descarta. Um "e" onde o loop é parcialmente preenchido pode ser reconhecível em tons de cinza, mas se torna uma bolha indistinguível quando limitado a preto e branco.
Certifique-se de que a caligrafia seja o mais escura e consistente possível. A caligrafia a lápis é mais difícil de reconhecer do que a caneta porque o grafite produz uma linha mais tênue e variável. Tinta azul ou preta em papel branco produz o melhor contraste. Tinta vermelha, tinta verde ou papel colorido reduzem o contraste e a precisão. Se você controla o processo de preenchimento de formulários, especifique que os formulários devem ser preenchidos com tinta preta para obter melhores resultados de OCR. Esta pequena instrução no próprio formulário pode melhorar a precisão da extração de dados em 10 a 15 pontos percentuais.
Revisar e corrigir saída de OCR de caligrafia
Após o OCR, a camada de texto PDF digitalizado terá erros concentrados nas regiões manuscritas. O texto impresso ficará quase perfeito. Concentre sua revisão nas respostas manuscritas. Abra o PDF e pesquise erros comuns de OCR de caligrafia. O número 1 é frequentemente reconhecido como a letra l. O número 0 é frequentemente reconhecido como a letra O. A combinação de letras "th" é frequentemente reconhecido como "+h" porque a barra transversal do t se mistura com o h.
Para dados de formulário que precisam ser extraídos para um banco de dados ou planilha, a revisão manual dos campos manuscritos é essencial. O mecanismo de reconhecimento fornece a melhor estimativa. Um ser humano deve verificar essa suposição em relação à caligrafia original. Esta etapa de verificação é onde a economia de tempo do OCR é parcialmente compensada pela necessidade de controle de qualidade humano. A poupança líquida depende do volume. Para 10 formulários, a entrada manual de dados pode ser mais rápida que o OCR mais revisão. Para 500 formulários, o OCR mais a revisão é dramaticamente mais rápido porque a etapa de revisão é limitada aos campos onde a confiança do OCR é baixa. A saída de OCR do WukongPDF inclui uma pontuação de confiança para cada bloco de texto reconhecido, permitindo classificar por confiança e revisar apenas os resultados de baixa confiança.
Para formulários que serão processados em grandes volumes, como formulários de admissão médica, solicitações de seguros ou solicitações governamentais, o próprio design do formulário pode melhorar a precisão do OCR da caligrafia. Projete o formulário com caixas de caracteres separadas, uma caixa por letra, em vez de uma única linha longa para um nome ou endereço. Caixas de caracteres individuais forçam o escritor a separar suas letras, o que melhora drasticamente a precisão do reconhecimento porque o mecanismo de OCR pode isolar cada caractere antes de tentar o reconhecimento. Este é o mesmo princípio utilizado pelos formulários fiscais e documentos de imigração em todo o mundo. As caixas são um pouco inconvenientes para a pessoa que preenche o formulário, mas permitem a extração automatizada de dados em grande escala, que é a compensação que o processamento de formulários em alto volume exige.
Um ponto de verificação de qualidade prático após o OCR em documentos mistos: execute uma pesquisa por padrões comuns de erros de OCR que indicam que o mecanismo confundiu a escrita manual com o texto impresso. Procure por "cl" e verifique se não deveria ser "d." Procure por "0" e verifique se cada instância é realmente um zero e não um O maiúsculo. Procure por "1" e verifique se é um e não um L minúsculo ou I maiúsculo. Essas três pesquisas detectam a maioria dos erros de OCR em nível de caractere no reconhecimento impresso e manuscrito. Corrija os erros encontrados e execute mais uma pesquisa por nomes, números ou datas específicos que sejam essenciais para a finalidade do documento. Um formulário onde as instruções impressas apresentam erros de digitação é irritante. Uma forma em que a dosagem manuscrita do medicamento está errada é perigosa.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
