Tips & Tricks

Como transformar a foto de uma página impressa em texto editável e pesquisável usando OCR

Você tira uma foto de um documento impresso com seu telefone. Talvez seja uma página de um livro na biblioteca, uma apostila de uma reunião, um recibo de um relatório de despesas ou uma placa que você viu com informações importantes. A foto é nítida o suficiente para ser lida, mas é apenas uma imagem. Você não pode procurar palavras nele. Você não pode copiar e colar texto dele. Você não pode editá-lo. É uma fotografia de texto, não o texto em si.

O reconhecimento óptico de caracteres pode converter essa foto em texto editável e pesquisável, e as ferramentas para fazer isso estão disponíveis no seu telefone e no seu navegador. O processo tira uma foto de uma página impressa e produz um documento onde você pode pesquisar, selecionar, copiar e editar cada palavra como se você mesmo tivesse digitado.

How to Turn a Photo of a Printed Page Into Editable, Searchable Text Using OCR

Obtendo a melhor foto possível para OCR

A precisão do OCR depende muito da qualidade da imagem de entrada. Uma foto bem iluminada e bem focada de uma página plana terá OCR com precisão de 95% a 99%. Uma foto mal iluminada, borrada e distorcida de uma página curva pode fazer OCR com precisão de 70%, o que significa que aproximadamente uma em cada três ou quatro palavras contém um erro. O tempo gasto para obter uma boa foto é retornado muitas vezes com esforço reduzido de correção.

Coloque o documento sobre uma superfície plana e bem iluminada. A luz natural é ideal porque é difusa e sem sombras. A iluminação suspensa do escritório funciona se você se posicionar de forma que a sombra não caia na página. Segure o telefone diretamente acima da página, paralelo a ela, e não em ângulo. Use as duas mãos ou apoie os cotovelos em uma superfície para manter o telefone estável. Preencha a moldura com a página, deixando uma pequena margem nas bordas. Toque na tela para focar no texto. Se o seu telefone tiver um modo de digitalização de documentos, use-o. No iPhone, o aplicativo Notas inclui um recurso Digitalizar Documentos que detecta automaticamente as bordas da página, corrige a perspectiva e melhora o contraste. No Android, o recurso de verificação do Google Drive faz o mesmo.

Se a página for de um livro encadernado e não puder ficar plana, pressione a lombada suavemente para reduzir a curva e aceite que a precisão do OCR será menor perto da medianiz, onde a página se curva para longe da câmera. Para textos críticos próximos à lombada, tire uma segunda foto focando especificamente nessa área, com o telefone mais próximo da página para maximizar a resolução do texto curvo.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Executando OCR em uma foto usando as ferramentas integradas do seu telefone

Os iPhones incluem Live Text, um recurso de OCR integrado que funciona diretamente no aplicativo Câmera, no aplicativo Fotos e no Safari. Aponte a câmera para o texto e um ícone de Texto Dinâmico aparecerá no canto do visor. Toque nele e o telefone reconhecerá o texto em tempo real. Você pode selecionar, copiar e colar imediatamente. Para uma foto que já está na sua biblioteca, abra-a no aplicativo Fotos e procure o ícone do Live Text. Toque nele para destacar todo o texto reconhecido. Você pode copiar partes selecionadas ou tudo. O Live Text funciona inteiramente no dispositivo, sem necessidade de conexão com a Internet.

Os telefones Android têm o Google Lens integrado ao Google Fotos e ao Google app. Abra a foto no Google Fotos e toque no ícone Lens. O Google Lens identifica o texto na imagem e permite selecioná-lo, copiá-lo, traduzi-lo ou pesquisá-lo. Assim como o Live Text da Apple, o Google Lens funciona offline para reconhecimento de texto em dispositivos recentes. Para ambas as plataformas, o OCR integrado foi projetado para passagens curtas, algumas frases ou parágrafos, e não para documentos de várias páginas. Extrai o texto, mas não produz um documento formatado.

Convertendo uma foto em um PDF pesquisável usando ferramentas OCR PDF

Para uma foto que precisa se tornar um documento adequado, um PDF com uma camada de texto pesquisável e ferramentas de OCR baseadas em navegador cuidam de todo o pipeline. WukongPDF aceita upload de fotos em JPEG, PNG, HEIC e outros formatos comuns. Carregue a foto. A ferramenta o processa, reconhece o texto e gera um PDF com a foto original como página visível e o texto reconhecido como uma camada pesquisável invisível atrás dela. A saída é exatamente igual à foto, mas agora você pode pesquisar palavras, selecionar e copiar texto, e o arquivo se comporta como qualquer outro PDF.

Se você tiver várias fotos de páginas consecutivas, carregue-as juntas. A ferramenta processa cada um deles e você pode combiná-los em um único PDF pesquisável de várias páginas. Este é o fluxo de trabalho para digitalizar um documento curto com seu telefone: fotografe cada página, carregue o lote, execute o OCR e baixe um único PDF pesquisável de todo o documento. O processo leva alguns minutos para um documento de 10 páginas e produz um resultado funcionalmente equivalente a um PDF digitalizado em um scanner de mesa.

Limpar saída de OCR de fotos

Fotos tiradas com um telefone, mesmo as boas, produzem menor precisão de OCR do que digitalizações de mesa a 300 DPI. Uma foto de telefone de uma página impressa normalmente é OCR com precisão de 90% a 95%, o que significa que aproximadamente uma em cada 20 palavras terá um erro. Os erros se aglomeram em locais previsíveis: perto das bordas da página onde a lente da câmera introduz distorção, em fontes pequenas abaixo de 10 pontos e em áreas com sombras ou iluminação irregular.

Depois de converter um PDF digitalizado de uma foto, abra o PDF e procure por erros comuns de OCR. Procure por "cl" que é frequentemente reconhecido como "d," "rn" que é frequentemente reconhecido como "m," e "1" que é frequentemente reconhecido como "l." Leia o texto e corrija os erros que encontrar. O tempo necessário para a limpeza depende do comprimento do documento e da qualidade da foto. Um documento de uma única página leva de 5 a 10 minutos para ser revisado. Um documento de 20 páginas leva uma hora ou mais. A etapa de limpeza é o que separa um resultado de OCR desleixado de um documento profissional e polido.

Quando uma foto supera um scanner

Uma foto de telefone não substitui um scanner de mesa quando a qualidade é a principal prioridade. Mas uma foto de telefone é infinitamente melhor do que um scanner que não está com você quando você precisa. A melhor câmera é aquela que você tem. Para capturar texto de livros de biblioteca, apostilas de conferências, notas de quadro branco, recibos, placas, menus e qualquer material impresso que você encontrar fora de sua mesa, uma foto de telefone seguida de OCR transforma um encontro visual fugaz em texto permanente, pesquisável e editável. O pipeline Imagem para PDF de WukongPDF conecta uma foto de telefone a um PDF finalizado em menos de um minuto, fechando a lacuna entre ver o texto no mundo e tê-lo disponível como um documento que você pode usar.

Uma limitação que vale a pena entender: fotos telefônicas de documentos de texto geralmente produzem tamanhos de arquivo maiores do que digitalizações de mesa equivalentes, porque as câmeras dos telefones capturam informações coloridas mesmo para documentos em preto e branco. Uma foto de telefone de uma única página de texto pode ter de 3 a 5 MB como JPEG, enquanto uma digitalização de mesa da mesma página no modo preto e branco pode ter 200 KB. Se você estiver digitalizando muitas páginas com seu telefone, converta as fotos em tons de cinza antes de executar o OCR. Isso reduz o tamanho do arquivo em 60% a 80% e geralmente melhora a precisão do OCR porque a conversão da escala de cinza elimina ruídos de cores e sombras que confundem o mecanismo de reconhecimento. A maioria dos aplicativos de edição de fotos, incluindo o aplicativo Fotos integrado no iPhone e no Android, inclui um filtro em escala de cinza ou monocromático que faz isso com um toque por foto.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →