Abra um PDF digitalizado e você poderá selecionar, copiar e pesquisar o texto como se fosse um documento digital nativo. Esse texto não veio da digitalização original. O scanner produziu uma imagem da página, uma grade de pixels sem nenhum dado de texto. O texto que você está selecionando e pesquisando é texto OCR, gerado por software de reconhecimento óptico de caracteres que analisou a imagem da página e converteu padrões de pixels em caracteres. Mas nem todo texto selecionável em um PDF é texto OCR. Alguns PDFs contêm texto incorporado que foi criado digitalmente, nunca passando por um scanner ou mecanismo de reconhecimento. Compreender a diferença entre texto OCR e texto incorporado explica por que alguns PDFs pesquisam perfeitamente enquanto outros produzem resultados distorcidos.

O que é texto OCR e como ele entra em um PDF
O texto OCR é gerado por máquina. Um mecanismo OCR PDF examina cada formato de caractere em uma imagem de página digitalizada, compara-o com um banco de dados de padrões de caracteres conhecidos e gera o caractere correspondente mais provável junto com sua posição na página. O texto reconhecido é então incorporado ao PDF como uma camada invisível posicionada precisamente sobre os caracteres da imagem original. Ao selecionar e copiar texto de um PDF digitalizado, você copia dessa camada invisível de OCR, não da imagem visível. Se o mecanismo de OCR interpretar mal um caractere, o texto copiado conterá esse erro, mesmo que a imagem visível pareça correta.
A qualidade do texto OCR depende de vários fatores: a resolução e clareza da digitalização original, a fonte usada no documento original, o idioma do texto e a sofisticação do mecanismo de OCR. Uma digitalização limpa de 300 DPI de um documento em inglês impresso a laser e processado por um mecanismo de OCR moderno produz um texto quase perfeito. Uma digitalização de 150 DPI de um documento impresso em matriz de pontos em uma linguagem com formatos de caracteres complexos processados por um mecanismo básico de OCR produz um texto repleto de erros. O texto OCR é tão preciso quanto o mecanismo de reconhecimento e a qualidade da digitalização permitirem.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
O que é texto incorporado e como ele entra em um PDF
O texto incorporado é de autoria, não reconhecido. Quando um processador de texto, um aplicativo de editoração eletrônica ou uma biblioteca de criação de PDF gera um PDF, ele grava o texto diretamente no fluxo de conteúdo do PDF. Cada caractere é armazenado como um código específico que é mapeado para um glifo em uma fonte. Não há etapa de reconhecimento porque o texto nunca foi uma imagem. O aplicativo que criou o PDF sabia exatamente quais caracteres estavam sendo escritos e os registrou com precisão. Ao selecionar e copiar texto de um PDF criado digitalmente, você copia exatamente os caracteres digitados pelo autor.
O texto incorporado carrega informações de formatação que normalmente faltam no texto OCR. Os nomes das fontes, os estilos de negrito e itálico e o espaçamento entre caracteres são preservados no texto incorporado porque foram especificados pelo autor no documento de origem. O texto OCR pode reconstruir parte dessa formatação, mas ela é inferida a partir da aparência visual dos caracteres, em vez de ser armazenada como metadados explícitos. Uma comparação Formato PDF entre uma página digitalizada e depois OCRed e uma página digital nativa revela essa diferença. A versão OCR pode permitir a seleção de texto, mas relata todos os caracteres como a mesma fonte e com o mesmo peso. A versão digital preserva as distinções de fontes pretendidas pelo autor.
Como saber se o texto em um PDF é OCR ou incorporado
A maneira mais confiável de determinar se o texto em um PDF é gerado por OCR ou incorporado é verificar as propriedades do documento, especificamente a lista de fontes. Abra o PDF em um visualizador que possa exibir informações de fonte. Adobe Acrobat mostra a lista de fontes em Arquivo, Propriedades do documento, Fontes. Se a lista de fontes mostrar fontes com nomes que incluem OCR ou se as fontes estiverem listadas como desconhecidas ou como um tipo genérico sem um nome específico, o texto provavelmente será gerado por OCR. Se a lista de fontes mostrar fontes nomeadas específicas, como Arial, Times New Roman ou Calibri, com subtipos como Negrito ou Itálico, o texto quase certamente é incorporado de uma fonte digital.
Outro teste prático é procurar um padrão comum de erro de OCR. Pesquise no PDF erros comuns de substituição de OCR, como a combinação de letras rn, que os mecanismos de OCR frequentemente interpretam erroneamente como a única letra m. Se a pesquisa encontrar ocorrências de celeiro se tornando bam ou milho se tornando com, o texto será gerado por OCR. O texto incorporado não contém esses erros de substituição porque os caracteres nunca foram visualmente ambíguos. A qualidade PDF pesquisável de um documento depende se o texto subjacente, OCR ou incorporado, representa com precisão o conteúdo visível.
Quando o texto OCR e o texto incorporado coexistem no mesmo PDF
Um único PDF pode conter texto OCR e texto incorporado em páginas diferentes ou até mesmo na mesma página. Um pacote de contrato pode incluir o corpo do contrato de autoria digital, que contém texto incorporado, e uma página de assinatura digitalizada e processada por OCR, que contém texto OCR. Um relatório de pesquisa pode combinar páginas de texto criadas digitalmente com fotografias digitalizadas e processadas por OCR de recortes históricos de jornais. O texto na página três é um texto incorporado com pixels perfeitos. O texto na página sete é um texto OCR que pode conter erros de reconhecimento.
Este cenário de conteúdo misto cria uma armadilha sutil para quem pesquisa ou extrai texto do PDF. Os resultados da pesquisa nas páginas de texto incorporadas serão precisos. Os resultados da pesquisa nas páginas de texto de OCR podem perder ocorrências em que o mecanismo de OCR leu uma palavra incorretamente ou podem retornar correspondências falsas em que o mecanismo de OCR substituiu uma palavra semelhante. Ao trabalhar com PDFs de conteúdo misto, verifique qualquer texto extraído das páginas de OCR antes de confiar nele. A abordagem mais segura é verificar visualmente a imagem da página correspondente sempre que o texto extraído de uma página OCR for usado para uma finalidade crítica.
Melhorando a qualidade do texto OCR após o fato
Quando um PDF contém texto OCR de baixa qualidade, as opções para melhorá-lo são limitadas pelo fato de que a digitalização original e o processo de OCR já foram concluídos. Você não pode melhorar retroativamente a qualidade da digitalização. O que você pode fazer é refazer o OCR do PDF com um mecanismo melhor. Extraia as imagens da página do PDF na resolução mais alta disponível e execute-as por meio de um mecanismo de OCR moderno que pode produzir resultados mais precisos do que a passagem de OCR original. Substitua a camada de texto OCR antiga pela nova.
Alguns editores de PDF permitem corrigir manualmente erros de OCR diretamente na camada de texto. Abra o PDF em um modo de edição que revele o texto OCR invisível. Clique em uma palavra reconhecida incorretamente e digite a correção. Este processo de correção manual é prático para alguns erros em algumas páginas. Não é prático para um documento de 200 páginas onde cada parágrafo contém erros de reconhecimento. Para problemas de qualidade de OCR em grande escala, refazer o OCR de todo o documento com um mecanismo melhor é a abordagem mais eficiente.
Escolhendo entre OCR e texto incorporado para criação de documentos
Ao criar um PDF que será pesquisado, indexado ou arquivado, a escolha entre digitalização e OCR versus geração de um PDF digital nativo tem consequências a longo prazo. Um PDF digital nativo com texto incorporado é menor, pesquisa mais rapidamente e preserva perfeitamente a precisão do texto. Um PDF digitalizado e processado por OCR preserva a aparência original do documento em papel, mas apresenta a possibilidade de erros de reconhecimento que aumentam com o tempo à medida que o PDF é copiado, citado e referenciado.
Para projetos de arquivo, a prática recomendada é preservar ambos os formatos. Mantenha a digitalização de alta resolução como mestre de arquivamento para fidelidade visual. Gere uma versão digital nativa, seja por redigitação ou aplicação de OCR de alta precisão com correção manual, para pesquisa e análise de texto. Essa abordagem de formato duplo proporciona a autenticidade da digitalização original e a usabilidade do texto pesquisável. WukongPDF suporta o processamento OCR PDF para converter documentos digitalizados em PDFs pesquisáveis, e a camada de texto OCR resultante fornece a funcionalidade de pesquisa e cópia que torna os documentos digitalizados utilizáveis em fluxos de trabalho digitais.
A lacuna de confiabilidade de longo prazo entre OCR e texto incorporado
Os PDFs OCR envelhecem de maneira diferente dos PDFs de autoria digital. Um PDF de autoria digital aberto vinte anos após a criação exibe seu texto perfeitamente, porque os códigos dos caracteres são inequívocos e as fontes estão incorporadas. Um PDF OCR aberto vinte anos após a criação depende da qualidade da digitalização original e da precisão do mecanismo de OCR disponível no momento. Erros de reconhecimento que eram quase imperceptíveis quando o documento era recente tornam-se obstáculos significativos quando o documento original em papel não está mais disponível para verificação.
Para documentos destinados à preservação a longo prazo, o texto incorporado de uma fonte digital é sempre preferível ao texto OCR. Se um documento existir apenas em papel e precisar ser digitalizado, invista na digitalização e no processamento de OCR da mais alta qualidade disponível no momento e preserve o documento original em papel pelo maior tempo possível. O original em papel é o backup definitivo contra erros de OCR que só podem se tornar aparentes anos depois.
Um teste prático para distinguir texto OCR PDF de texto incorporado: amplie um parágrafo em 300 por cento ou mais e observe as bordas dos caracteres. O texto OCR geralmente mostra um leve desalinhamento entre a imagem visível do caractere e a camada de texto invisível. O texto incorporado é renderizado com alinhamento perfeito porque as formas e posições dos caracteres vêm do mesmo programa de fonte.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
