Others

Por que a conversão de uma tabela PDF em Excel às vezes mescla colunas numéricas adjacentes em uma única célula

Você converte uma tabela PDF formatada de forma limpa para Excel, abre a saída e descobre que o que eram duas colunas separadas de números no PDF se tornou uma única coluna com valores como "1.2503.780" em cada célula. Dois valores numéricos de colunas adjacentes foram concatenados em uma sequência de texto e os dados agora são inúteis para cálculo. Esta é a reclamação mais comum sobre a conversão de PDF para Excel e acontece porque o conversor calculou mal onde termina uma coluna e começa a próxima.

A detecção de limites de coluna em tabelas PDF é um problema fundamentalmente difícil porque os PDFs não contêm estrutura de tabela. Uma tabela PDF é apenas um texto posicionado em coordenadas específicas, com linhas horizontais e verticais desenhadas próximas ao texto. O conversor deve inferir os limites das colunas a partir do espaçamento entre os blocos de texto, do alinhamento do texto nas linhas ou da posição das linhas desenhadas. Quando as colunas numéricas são estreitas e os números nas colunas adjacentes estão próximos, o conversor pode mesclá-los em uma única coluna mais larga, lendo ambos os números como uma sequência de texto. O conversor vê uma sequência horizontal contínua de números e não consegue dizer onde estava a quebra de coluna no layout original.

Why Does Converting a PDF Table to Excel Sometimes Merge Adjacent Numeric Columns Into a Single Cell

Por que colunas numéricas adjacentes são especialmente vulneráveis à mesclagem

As colunas numéricas nas tabelas PDF tendem a ser estreitas porque os números são curtos. Uma coluna de valores monetários pode conter entradas como "1.250,00" ou "42,50" raramente excedendo 12 caracteres. Duas colunas numéricas estreitas lado a lado, como "Preço unitário" e "Preço Estendido" geralmente têm apenas alguns pontos de espaço em branco entre eles. Se o algoritmo de divisão de colunas do conversor usar um limite mínimo de intervalo maior que o intervalo real entre as colunas, ele verá as duas colunas como uma só e concatenará seus valores.

O problema é agravado por números alinhados à direita. Em uma tabela PDF bem formatada, as colunas numéricas são alinhadas à direita, de modo que os números em cada linha terminam na mesma posição horizontal. O espaço entre o final de um número alinhado à direita na coluna A e o início de um número alinhado à esquerda na coluna B pode ser de apenas alguns pontos. A inspeção visual do PDF mostra uma lacuna clara, mas o algoritmo do conversor pode exigir uma lacuna maior para identificar com segurança o limite de uma coluna, tratando o espaço estreito como espaçamento normal entre palavras, em vez de um separador de coluna.

Um problema relacionado ocorre com números negativos e notação de parênteses. Um valor exibido como "(1.250,00)" inclui um parêntese e uma vírgula, que um conversor pode interpretar como vários tokens separados. O parêntese de abertura é associado à coluna anterior, a parte numérica é colocada na coluna atual e o parêntese de fechamento é descartado ou anexado à próxima coluna. O resultado é uma célula contendo dados parciais que requerem uma limpeza manual extensiva. Tabelas que usam formatação de números europeia, onde a vírgula é um separador decimal e o ponto final é um separador de milhares, confundem ainda mais os conversores que assumem a formatação de números dos EUA.

WukongPDF

Experimente PDF para Excel

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Como identificar tabelas problemáticas antes da conversão

Antes de converter, abra o PDF e amplie a área da tabela. Procure colunas onde o espaço entre o caractere mais à direita de uma coluna e o caractere mais à esquerda da coluna seguinte seja visualmente pequeno, menos de aproximadamente um caractere de largura. Estas são as colunas com maior probabilidade de serem mescladas durante a conversão. Se você vir tabelas com esses espaçamentos de colunas estreitos, planeje a correção manual após a conversão ou considere um método de extração alternativo.

Verifique também se há tabelas que usam pontos iniciais, linhas de períodos conectando um nome de item alinhado à esquerda a um preço alinhado à direita. Os pontos iniciais ficam no espaço entre as colunas e são frequentemente mal interpretados como dados, e não como formatação visual. Um conversor que trata os pontos iniciais como conteúdo produzirá uma coluna contendo apenas pontos ou dividirá a tabela incorretamente porque não consegue distinguir os pontos iniciais dos dados. Tabelas com células de cabeçalho mescladas abrangendo várias colunas são outro ponto problemático. O conversor vê um bloco de texto largo na linha do cabeçalho e pode não mapeá-lo corretamente para as colunas de dados mais estreitas abaixo.

Para dados críticos onde a precisão é importante, a extração Extrair dados PDF usando software de reconhecimento de tabela especializado é mais confiável do que a conversão de PDF para Excel de uso geral. O software de extração de dados projetado especificamente para tabelas usa vários sinais, posição do texto, métricas de fonte, posição da linha e consistência de alinhamento entre linhas para construir um modelo de coluna mais preciso. O custo extra de um software de extração especializado se justifica quando a alternativa são horas de limpeza manual do Excel para cada tabela convertida.

Estratégias de correção manual para colunas mescladas

Quando colunas mescladas são inevitáveis, o recurso Texto para Colunas do Excel é a ferramenta de correção mais rápida. Selecione a coluna mesclada, abra Dados, Texto para Colunas e escolha Delimitado. Se os valores mesclados forem consistentemente separados por um espaço, escolha Espaço como delimitador. Se eles estiverem separados por um número variável de espaços, escolha Largura Fixa e coloque manualmente a linha de quebra de coluna entre os dois valores. O Excel visualiza a divisão antes de aplicá-la, para que você possa ajustar a posição da quebra até que a divisão esteja correta para todas as linhas.

Para valores que foram mesclados sem qualquer delimitador, como "12503780" onde a divisão deve estar entre "1250" e "3780" Texto para colunas não pode ajudar porque não há delimitador para dividir. Você precisa saber a largura esperada de cada coluna. Se a primeira coluna sempre contiver quatro dígitos e a segunda sempre contiver quatro dígitos, use as funções ESQUERDA e DIREITA do Excel com as contagens de caracteres conhecidas para extrair os valores em colunas separadas. Essa abordagem funciona apenas quando as larguras das colunas são fixas e consistentes, o que é comum em tabelas exportadas de sistemas de banco de dados com larguras de campo fixas.

WukongPDF converte tabelas PDF em Excel com detecção de colunas que analisa o alinhamento do texto, o espaçamento e a posição das linhas para identificar os limites das colunas, mesmo em tabelas numéricas pouco espaçadas. A conversão preserva a formatação numérica para que os valores extraídos possam ser imediatamente utilizados para cálculo, sem limpeza manual. Para tabelas complexas que resistem à detecção automatizada de colunas, considere usar uma abordagem baseada em OCR como caminho alternativo. Capture uma captura de tela da tabela PDF, execute-a por meio de uma ferramenta de OCR com recursos de reconhecimento de tabela e exporte a tabela reconhecida para o Excel. Os mecanismos de OCR modernos que incluem detecção de estrutura de tabela costumam ser mais confiáveis na separação de colunas do que os conversores tradicionais de PDF para Excel porque analisam o layout visual diretamente.

WukongPDF

Experimente PDF para Excel

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →