Others

Por que a conversão de um PDF para Excel às vezes produz células em branco onde os dados deveriam estar

Você converte uma tabela PDF em Excel, abre o resultado e olha para uma planilha com células vazias onde deveriam estar os números. O PDF original continha claramente dados nessas posições. Você pode ver isso na tela. Mas o arquivo Excel apresentou lacunas, valores ausentes ou linhas inteiras reduzidas a espaços em branco. Este é um dos resultados mais frustrantes da conversão de PDF para Excel porque não é óbvio o que deu errado ou como consertar.

A causa raiz geralmente não é a ferramenta de conversão em si. É uma incompatibilidade entre como o PDF armazena os dados da tabela e o que o mecanismo de conversão espera encontrar. Compreender as razões específicas das células em branco torna o problema solucionável em vez de misterioso.

Why Does Converting a PDF to Excel Sometimes Produce Blank Cells Where Data Should Be

O PDF contém uma imagem de uma tabela, e não dados reais da tabela

Este é o motivo mais comum para células em branco após a conversão de PDF para Excel. Se o PDF foi criado a partir de uma digitalização, captura de tela ou impressão em PDF de um aplicativo que rasterizou sua saída, a tabela que você vê na página é uma imagem plana. Não há células de dados subjacentes, nem estruturas de linhas e colunas, nem fluxos de texto que uma ferramenta de conversão possa analisar.

Quando uma ferramenta de conversão encontra uma tabela baseada em imagem, ela tem duas opções: executar o OCR para tentar reconhecer o texto e reconstruir a estrutura da tabela ou ignorar completamente a imagem porque não consegue analisá-la. Muitos conversores básicos de PDF para Excel seguem o segundo caminho. Eles extraem os dados reais que podem encontrar e deixam de fora o conteúdo baseado em imagens. O resultado é uma planilha com células em branco onde estava a imagem da tabela. A solução é usar um Conversor de PDF que inclua OCR, como WukongPDF, que reconhece texto em imagens e reconstrói a grade da tabela. A conversão não será perfeita em pixels, mas os dados aparecerão nas células em vez de desaparecerem no espaço em branco.

WukongPDF

Experimente PDF para Excel

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

O layout da tabela usa células complexas mescladas ou aninhadas

Mesmo quando uma tabela é composta de dados de texto reais, a forma como o aplicativo original a estruturou pode derrotar um mecanismo de conversão. Aplicativos como Microsoft Excel, Planilhas Google e software de relatórios geralmente criam tabelas com células mescladas, onde um único cabeçalho abrange várias colunas, tabelas aninhadas, onde uma célula contém outra minitabela dentro dela, ou cabeçalhos de vários níveis com agrupamentos de colunas pai e filho.

O PDF não foi projetado para representar estruturas de tabelas. Ele foi projetado para colocar caracteres em coordenadas x,y específicas em uma página. Um PDF armazena uma tabela como milhares de comandos independentes de posicionamento de caracteres. O mecanismo de conversão deve fazer engenharia reversa da estrutura da tabela analisando o arranjo espacial desses caracteres. As células mescladas complicam enormemente esta análise. O que parece ser uma célula lógica para um leitor humano parece para o mecanismo de conversão como um texto abrangendo uma área ambígua que pode ser uma célula larga ou várias células estreitas. Quando o mecanismo adivinha errado, os dados acabam nas colunas erradas, divididos entre células ou omitidos porque o mecanismo não conseguiu resolver a ambiguidade.

Não existe uma solução universal perfeita para isso porque a estrutura original da tabela foi perdida quando o documento foi convertido para PDF. Se você tiver acesso ao arquivo original, exportar diretamente do Excel ou Planilhas Google para o formato .xlsx, em vez da conversão de PDF para Excel, preserva perfeitamente a estrutura da tabela. Se o PDF for sua única cópia, uma ferramenta de conversão com detecção avançada de tabela, que permite definir manualmente os limites das colunas ou ajustar as regiões detectadas da tabela, oferece a melhor chance de recuperar os dados de forma limpa.

Informações do delimitador inconsistentes ou ausentes

Os mecanismos de conversão detectam os limites das colunas analisando os espaços horizontais entre grupos de caracteres. Se duas colunas estiverem muito próximas, o mecanismo poderá fundi-las em uma. Se uma coluna contiver células com quantidades de texto muito variadas, o mecanismo poderá dividir a coluna em várias colunas nos pontos estreitos. Ambos os erros produzem células em branco, seja porque os dados que deveriam preencher duas colunas separadas foram amontoados em uma, deixando a outra coluna vazia, ou porque a coluna fantasma quebra células criadas onde não existem dados.

Tabelas com células em branco no documento original criam uma variação particularmente complicada deste problema. Se a tabela original tiver células intencionalmente vazias, o mecanismo de conversão verá lacunas maiores e poderá alterar a detecção do limite da coluna, desalinhando cada linha abaixo da lacuna. Uma única célula em branco na linha 3 pode prejudicar todo o mapeamento de colunas das linhas 4 a 50, produzindo uma cascata de dados desalinhados que parece uma falha de conversão, mas na verdade é uma ambiguidade estrutural no documento de origem.

Como minimizar células em branco na sua próxima conversão

Vários ajustes práticos melhoram significativamente sua taxa de sucesso de conversão. Primeiro, sempre use uma ferramenta que suporte a detecção de estrutura de tabela, em vez de um conversor genérico de PDF para texto. Ferramentas projetadas especificamente para Extrair dados de PDF usam algoritmos treinados em layouts de tabelas e produzem resultados dramaticamente melhores do que a extração de texto de uso geral. A conversão de PDF para Excel do WukongPDF inclui detecção de estrutura de tabela que lida com layouts comuns, incluindo células mescladas, cabeçalhos de vários níveis e tabelas com tipos de dados mistos.

Segundo, verifique o PDF antes de converter. Se você puder selecionar e copiar células ou colunas de texto individuais da tabela usando o visualizador de PDF, a tabela será composta de dados de texto reais e será convertida razoavelmente bem. Se você clicar na tabela e tudo for destacado como um único bloco, ou se a seleção de texto não funcionar, a tabela é uma imagem e precisa de conversão baseada em OCR.

Terceiro, esteja preparado para limpar a saída. Até as melhores ferramentas de conversão produzem planilhas que precisam de alguns ajustes manuais. Verifique as primeiras linhas de cada coluna para verificar os valores colocados nas colunas corretas. Procure colunas totalmente em branco quando você puder ver os dados do PDF original nessa posição. Estes são sinais de que a ferramenta identificou incorretamente os limites da coluna. A correção do mapeamento de colunas nas primeiras linhas geralmente transmite correções em cascata pelo restante da planilha.

O que fazer quando a conversão continua produzindo células em branco

Se você tentou várias ferramentas e a conversão produz consistentemente células em branco em posições específicas, o problema provavelmente está no próprio PDF, não nas ferramentas. Os dados da tabela podem ser armazenados como um gráfico vetorial, onde os números são desenhados como formas em vez de codificados como caracteres de texto. Isso acontece com mais frequência com PDFs gerados por softwares CAD mais antigos, ferramentas de relatórios especializadas ou alguns sistemas de planejamento de recursos empresariais que renderizam a saída em PDF por meio de comandos de desenho gráfico em vez de posicionamento de texto. Nesses casos, o OCR é a única opção, e você deve revisar e corrigir manualmente a saída porque o OCR de dados tabulares desenhados por vetores é inerentemente sujeito a erros.

A alternativa mais produtiva quando a conversão automatizada falha repetidamente é fazer uma captura de tela da tabela em alta resolução, executá-la por meio de uma ferramenta de OCR dedicada especializada em reconhecimento de tabela e exportá-la para Excel. Este processo de duas etapas, captura de tela e depois OCR, ignora totalmente a representação de dados internos do PDF e trata a tabela como uma imagem pura, o que ironicamente pode ser mais confiável para certos tipos de PDFs malformados do que tentar analisar dados de texto corrompidos ou não padrão.

WukongPDF

Experimente PDF para Excel

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →