
O que o OCR faz com um PDF digitalizado
O reconhecimento óptico de caracteres transforma um PDF digitalizado, que é uma coleção de imagens de páginas, em um documento pesquisável.
O processo OCR PDF analisa cada imagem da página, identifica as formas dos caracteres e cria uma camada de texto invisível atrás da imagem da página. Após o OCR, você pode pesquisar palavras no documento, selecionar e copiar texto e usar leitores de tela para ler o documento em voz alta.
OCR transforma uma imagem passiva de texto em um documento ativo e pesquisável que suporta seleção de texto e leitores de tela.
A precisão do OCR depende diretamente da qualidade da digitalização original, com digitalizações limpas de 300 DPI produzindo os melhores resultados.
Um PDF digitalizado sem OCR é como um álbum de fotos com texto. Você pode olhar para as palavras, mas não pode interagir com elas. Você não pode pesquisar um termo específico. Você não pode copiar um parágrafo para citá-lo. Você não pode usar um leitor de tela. OCR adiciona recursos interativos que tornam os documentos digitais úteis além da simples visualização.
A precisão do OCR depende da qualidade da digitalização original. Uma digitalização limpa e de alta resolução a 300 DPI com iluminação uniforme e foco nítido produz uma precisão de OCR acima de 99% para texto impresso padrão. Uma digitalização de baixa resolução, uma fotografia de um documento tirada em ângulo ou uma digitalização de um original amassado ou manchado produz menor precisão. A qualidade da digitalização determina diretamente a qualidade da saída do OCR.
A camada de texto PDF pesquisável adicionada por OCR é separada da imagem da página. A aparência visual do PDF não muda após o OCR. A página ainda parece uma imagem digitalizada. Por trás dessa imagem, o texto reconhecido existe como dados de caracteres invisíveis que podem ser acessados por mecanismos de pesquisa, leitores de tela e ferramentas de seleção de texto.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Como executar o OCR em um PDF digitalizado em diferentes dispositivos
No Windows, o Adobe Acrobat Pro pode executar OCR em PDFs digitalizados. Abra o PDF, selecione a ferramenta Digitalizar e OCR e escolha Reconhecer Texto. O Acrobat processa cada página, reconhece o texto e adiciona a camada de texto pesquisável. Salve o arquivo. O PDF agora suporta pesquisa e seleção de texto. O Acrobat Pro oferece o OCR mais preciso no Windows.
No Mac, o aplicativo Preview integrado não inclui OCR. Várias ferramentas Mac PDF de terceiros oferecem capacidade de OCR. O PDF Expert e o PDFpen incluem mecanismos de OCR que processam PDFs digitalizados e adicionam camadas de texto pesquisáveis. A qualidade do OCR é comparável às ferramentas do Windows para documentos padrão.
A ferramenta de OCR baseada em navegador WukongPDF funciona em qualquer sistema operacional. Carregue o PDF digitalizado, selecione o idioma do documento para o mecanismo de OCR e execute o reconhecimento. Baixe o PDF pesquisável quando o processamento for concluído. A abordagem baseada em navegador torna o OCR acessível sem instalação de software.
Para iPhone e Android, os aplicativos de scanner que incluem OCR processam a digitalização durante a captura. Adobe Scan, Microsoft Lens e o scanner integrado no aplicativo iPhone Notes executam OCR automaticamente ao digitalizar documentos. O PDF resultante pode ser pesquisado imediatamente após a digitalização, sem uma etapa separada de processamento de OCR.
Melhorando a precisão do OCR para documentos desafiadores
Selecione o idioma correto do documento antes de executar o OCR. O mecanismo de OCR usa dicionários específicos do idioma e dados de frequência de caracteres para resolver caracteres ambíguos. Executar o OCR em um documento francês com a configuração do idioma francês produz melhores resultados do que usar a configuração do inglês. Para documentos multilíngues, selecione o idioma principal e corrija manualmente os erros nas passagens do idioma secundário.
Alinhe as páginas digitalizadas antes do OCR. As páginas digitalizadas que são levemente giradas, mesmo que em um ou dois graus, reduzem a precisão do OCR porque o mecanismo de OCR espera que as linhas de texto sejam horizontais. A maioria dos softwares de digitalização inclui um recurso de alinhamento automático. Se a digitalização não foi desequilibrada durante a captura, desvie as páginas do PDF antes de executar o OCR.
Aumente a resolução da digitalização para documentos com texto pequeno ou layouts complexos. Texto abaixo de 10 pontos requer resolução de digitalização mais alta para OCR preciso. Uma digitalização a 300 DPI é suficiente para a maioria dos documentos. Para documentos com texto de 8 pontos ou menor, digitalize a 400 ou 600 DPI para fornecer ao mecanismo de OCR dados de pixel suficientes para distinguir caracteres individuais.
Para documentos com tipos de conteúdo mistos, como páginas que combinam texto com fotografias ou ilustrações, o mecanismo de OCR deve ser configurado para reconhecer somente zonas de texto. A tentativa de reconhecer texto de áreas de imagem produz caracteres inúteis. A maioria das ferramentas de OCR inclui um recurso de seleção de zona que permite especificar quais áreas da página contêm texto.
Verificar e corrigir saída de OCR
Após a conclusão do OCR, verifique a saída pesquisando algumas palavras que você pode ver na página. Se a pesquisa os encontrar, o OCR foi bem-sucedido. Se a pesquisa perder palavras óbvias, a precisão do OCR poderá ser insuficiente para a fonte, o layout ou a qualidade de imagem específicos dessa página.
Para documentos onde a precisão do OCR é crítica, como registros legais ou médicos que devem ser totalmente pesquisáveis, revise manualmente o texto reconhecido. Algumas ferramentas de PDF permitem visualizar e editar a camada de texto oculta. Corrija erros de reconhecimento, especialmente em nomes próprios, números e termos técnicos que o mecanismo de OCR tem maior probabilidade de reconhecer incorretamente.
Os erros de OCR mais comuns envolvem confusão de caracteres. A letra le o número 1 parecem semelhantes em muitas fontes. As letras rn juntas podem parecer a letra m.
As letras cl podem se parecer com a letra d. Essas confusões de caracteres produzem palavras visualmente semelhantes às originais, mas textualmente erradas. A revisão manual de seções críticas detecta esses erros.
Após verificar a saída do OCR, salve o documento com um nome de arquivo que indique que ele foi processado com OCR. Um nome de arquivo como Report-OCR.pdf ou Report-Searchable.pdf distingue a versão pesquisável da digitalização original apenas de imagem.
O benefício prático de um PDF digitalizado pesquisável torna-se aparente na primeira vez que você precisa encontrar uma informação específica em um documento grande. Um contrato digitalizado de 200 páginas sem OCR requer a leitura manual de cada página para encontrar uma cláusula específica. Uma versão pesquisável encontra a cláusula em segundos. Para qualquer documento que você espera consultar mais de uma vez, o investimento em OCR se paga.
Os PDFs processados por OCR também são acessíveis a leitores de tela, tornando-os utilizáveis por pessoas com deficiência visual que dependem de tecnologia assistiva para ler documentos. Um PDF digitalizado sem OCR é completamente inacessível aos leitores de tela porque não há texto para ler em voz alta. Adicionar OCR torna o documento acessível, o que é exigido pelos padrões de acessibilidade, incluindo a Seção 508 e as WCAG.
Para documentos em idiomas diferentes do inglês, selecione o idioma de OCR correto antes do processamento. Os mecanismos de OCR usam modelos de reconhecimento de caracteres específicos do idioma. Um documento em japonês reconhecido com o modelo japonês produz resultados muito melhores do que o mesmo documento reconhecido com um modelo inglês.
OCR também permite a extração de texto para reutilização em outros documentos. Quando você precisa citar um trecho de um documento digitalizado em seu próprio relatório, o OCR torna o texto copiável. Sem o OCR, você precisaria redigitar manualmente a passagem. O tempo economizado ao copiar e colar documentos processados por OCR aumenta significativamente.
Para documentos digitalizados que serão arquivados, o OCR é uma etapa essencial de preservação. Um PDF digitalizado apenas com imagem arquivado hoje não oferece capacidade de pesquisa para futuros pesquisadores. Um PDF pesquisável fornece acesso ao conteúdo do documento por meio de pesquisa de texto, aumentando drasticamente a utilidade do documento para futuros usuários.
O tamanho do arquivo PDF não muda significativamente após o OCR. Os dados de OCR adicionam uma pequena quantidade de dados de texto a cada página, normalmente alguns quilobytes por página. As imagens da página original permanecem inalteradas. O aumento do tamanho do arquivo é insignificante para a melhoria funcional que a camada de texto pesquisável oferece.
A camada de texto pesquisável adicionada pelo OCR é separada da imagem visual da página. Quando você pesquisa uma palavra em um PDF processado por OCR, a pesquisa corresponde à camada de texto, não à imagem. O resultado da pesquisa destaca a área da imagem da página onde o texto foi encontrado.
Os PDFs processados por OCR suportam a leitura de texto para fala, tornando-os acessíveis a pessoas com deficiência visual e a qualquer pessoa que prefira ouvir documentos em vez de lê-los. Esse recurso de acessibilidade é um benefício significativo do OCR além da simples pesquisa.
Para grandes projetos de OCR que envolvem centenas ou milhares de páginas digitalizadas, o processamento de OCR em lote economiza um tempo significativo. Defina as configurações de OCR uma vez e aplique-as a todo o lote de documentos. Revise uma amostra de páginas para verificar a precisão, em vez de revisar todas as páginas.
A camada de texto OCR pode ser exportada como um arquivo de texto simples, permitindo que o conteúdo do documento seja utilizado em outras aplicações. Exporte o texto reconhecido, abra-o em um editor de texto ou processador de texto e use-o como base para um novo documento.
O valor a longo prazo de um PDF processado por OCR é percebido sempre que você precisa encontrar informações no documento. Um PDF pesquisável de um contrato, manual ou documento de referência torna-se um recurso que você pode consultar, em vez de um arquivo estático que deve ser lido manualmente.
A implementação do OCR como uma etapa padrão no fluxo de trabalho de digitalização de documentos garante que todos os documentos digitalizados possam ser pesquisados a partir do momento em que entram na sua biblioteca digital. Os poucos segundos extras de processamento de OCR durante a digitalização rendem dividendos sempre que você precisa encontrar informações em qualquer documento que já digitalizou.
Para quem gerencia uma biblioteca de documentos digitais, o OCR é a etapa de processamento mais impactante que você pode aplicar a PDFs digitalizados. Ele transforma arquivos de imagem passivos em documentos ativos, pesquisáveis e acessíveis.
Experimente o OCR de PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
