Tips & Tricks

Como fazer OCR de um PDF e exportar o texto reconhecido como um arquivo Markdown

Você faz o OCR de um PDF e o texto reconhecido aparece em uma caixa de texto dentro do seu editor de PDF. Você pode ler. Você pode copiar e colar. Mas o que você realmente deseja é o texto em um arquivo Markdown, com títulos formatados como hashes, listas como asteriscos, links como pares colchetes e parênteses e parágrafos separados por linhas em branco. Markdown é a língua franca de desenvolvedores, escritores técnicos, blogueiros e qualquer pessoa que precise de texto limpo e portátil que possa ser colocado em um gerador de site estático, um aplicativo de anotações ou um repositório de código.

Passar de um PDF digitalizado para um arquivo Markdown é um processo de duas etapas: o OCR reconhece o texto e, em seguida, uma etapa de formatação converte esse texto reconhecido na sintaxe Markdown. Cada etapa possui opções de ferramentas que afetam a qualidade do resultado final.

How to OCR a PDF and Export the Recognized Text as a Markdown File

Etapa 1: OCR do PDF para extrair texto reconhecido

A etapa de OCR é igual a tornar qualquer PDF pesquisável. Use uma ferramenta OCR PDF para processar as páginas digitalizadas. A ferramenta adiciona uma camada de texto a cada página. Para exportação Markdown, você deseja a saída do OCR em um formato que preserve o máximo de informações estruturais possível: qual texto é um título, qual texto é o corpo, qual texto faz parte de uma lista ou tabela. Os mecanismos de OCR padrão geram texto simples, que perde todas as informações estruturais. Um título e um parágrafo do corpo tornam-se blocos de texto indistinguíveis, separados por quebras de linha.

Para obter melhores resultados, use um mecanismo de OCR que suporte extração de texto com reconhecimento de layout. Esses mecanismos analisam a organização espacial do texto na página e podem distinguir entre títulos, corpo do texto, legendas e notas de rodapé com base no tamanho da fonte, posição e proximidade de outros elementos. Quanto mais informações estruturais o mecanismo de OCR capturar, mais limpa será a conversão do Markdown. O recurso Exportar para do Adobe Acrobat Pro inclui uma opção "Texto com formatação" opção que preserva algumas sugestões estruturais. O mecanismo de OCR preserva o tamanho da fonte e os metadados de posição que as ferramentas de conversão downstream podem usar para inferir níveis de título e quebras de parágrafo.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Etapa 2: Converter o texto reconhecido em Markdown

Uma vez que o PDF possui uma camada de texto, a conversão para Markdown pode ocorrer por vários caminhos. O mais simples é uma exportação direta de um editor de PDF que suporta Markdown como formato de saída. As opções de exportação de WukongPDF incluem Markdown como formato de destino quando o PDF foi processado por OCR. Selecione Markdown como formato de saída e a ferramenta gera um arquivo .md com o texto reconhecido formatado de acordo com as convenções do Markdown: linhas que começam com fontes maiores tornam-se títulos com prefixo hash, linhas recuadas tornam-se itens de lista e parágrafos regulares são separados por linhas em branco.

Se uma exportação Markdown direta não estiver disponível, o pipeline é: exportar o texto reconhecido para um formato rich text que preserva a formatação, como RTF ou HTML, e depois converter esse formato intermediário em Markdown usando uma ferramenta de conversão. Pandoc, o conversor universal de documentos, lida bem com esse pipeline. Exporte o texto do PDF como HTML e execute: pandoc input.html -f html -t markdown -o output.md. Pandoc traduz tags de cabeçalho HTML em hashes Markdown, tags de lista HTML em marcadores de lista Markdown e tags de link HTML em sintaxe de link Markdown. A qualidade da saída depende da qualidade da exportação HTML do PDF. Se a exportação de PDF produzir HTML limpo e bem estruturado, o Pandoc produzirá Markdown limpo. Se a exportação produzir HTML confuso com estilos embutidos e tags não semânticas, o Markdown será correspondentemente confuso.

Limpando erros de OCR na saída Markdown

Erros de OCR no texto reconhecido passam para a saída do Markdown inalterados. Erros comuns incluem caracteres confusos como "cl" reconhecido como "d," "rn" reconhecido como "m," e "1" reconhecido como "l," especialmente em tamanhos de fonte menores ou digitalizações de qualidade inferior. Uma revisão do arquivo Markdown para detectar esses erros é essencial se o texto for publicado ou compartilhado.

A maioria dos editores de código e editores Markdown incluem funcionalidade de verificação ortográfica que destaca palavras não reconhecidas, facilitando a detecção de erros de OCR. Trabalhe nas palavras destacadas e corrija-as em relação ao PDF original. Preste atenção especial aos nomes próprios, termos técnicos e números, que têm maior probabilidade de serem reconhecidos incorretamente e também os mais prejudiciais se publicados incorretamente. Um relatório financeiro onde o OCR reconheceu "US$ 123.000" como "$ 128.000" contém um erro material que a verificação ortográfica automatizada não detectará porque ambos são formatos numéricos válidos. A verificação manual de valores críticos em relação ao documento de origem é a única salvaguarda confiável.

Preservando imagens e tabelas na conversão Markdown

Markdown lida com imagens referenciando arquivos externos: ![alt text](path/to/image.png). Ao converter um PDF em Markdown, as imagens do PDF precisam ser extraídas e salvas como arquivos separados e os links de referência inseridos no texto do Markdown nas posições corretas. PDF Export para Markdown de WukongPDF inclui extração de imagem como parte da conversão. Cada imagem no PDF é salva como um arquivo PNG ou JPEG em uma pasta ao lado do arquivo Markdown, e o texto do Markdown contém as tags de referência de imagem apropriadas.

As tabelas são mais desafiadoras. As tabelas Markdown usam uma sintaxe de barra vertical e traço que é fácil de ler para humanos, mas difícil para conversores automatizados gerarem a partir de dados de tabela PDF porque os PDFs não armazenam tabelas como dados estruturados. Eles armazenam caracteres em posições. O conversor deve fazer engenharia reversa da grade da tabela a partir de posições de caracteres, o que produz resultados imperfeitos para tabelas complexas com células mescladas, conteúdo de células com várias linhas ou larguras de coluna desiguais. Tabelas de grade simples com colunas uniformes e conteúdo de célula de linha única são convertidas de maneira confiável. Tabelas complexas podem precisar de reestruturação manual na saída do Markdown. Se uma tabela não tiver uma boa conversão, considere exportá-la como uma imagem separada em vez de uma sintaxe de tabela Markdown. Uma imagem legível de uma tabela complexa é mais útil do que Markdown ilegível que é renderizado como colunas desalinhadas.

Colocando o arquivo Markdown em uso

O arquivo Markdown resultante abre em qualquer editor de texto, aplicativo de anotações como Obsidian ou Notion, gerador de site estático como Hugo ou Jekyll ou editor de código como VS Code. A partir do Markdown, você pode gerar HTML para um site, PDF para distribuição, DOCX para processamento de Word ou simplesmente manter o texto em um formato de texto simples pesquisável e com versão controlável que poderá ser lido por décadas.

O valor deste pipeline é mais evidente com material de arquivo. Relatórios antigos digitalizados, documentos históricos, publicações esgotadas, todos se tornam não apenas pesquisáveis, mas também transformáveis. Um relatório digitalizado de 2005 torna-se um arquivo Markdown que pode ser editado em um editor moderno, convertido em um site, citado em uma postagem de blog ou analisado programaticamente. O Formato PDF que bloqueou o texto dentro de uma imagem por 20 anos não restringe mais a forma como o conteúdo pode ser usado.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →