Others

Por que as tabelas PDF trocam linhas e colunas durante a conversão do Excel

A extração de dados de tabela de um PDF para Excel deve produzir uma planilha onde as linhas e colunas correspondem à tabela original. Mas às vezes a saída é transposta. As linhas tornam-se colunas, as colunas tornam-se linhas e os dados são embaralhados. Este não é um erro aleatório. Tem causas específicas relacionadas à forma como o mecanismo de conversão PDF para Excel interpreta o layout visual da tabela. Entender por que a transposição acontece ajuda você a escolher configurações de conversão que produzem resultados orientados corretamente.

Principais conclusões

A transposição de PDF para Excel ocorre quando o mecanismo de conversão identifica incorretamente a direção de leitura da tabela, geralmente devido a células mescladas, larguras de colunas inconsistentes ou texto visualmente alinhado em linhas, mas armazenado no PDF na ordem das colunas. A correção depende da causa. Ajustar as configurações de conversão, pré-processar o PDF para esclarecer a estrutura da tabela ou pós-processar a saída do Excel para transpor os dados de volta para a orientação correta, todos abordam diferentes causas raízes.

Why Do PDF Tables Swap Rows and Columns During Excel Conversion

Por que os dados da tabela PDF são transpostos durante a extração

As tabelas que usam pontos iniciais ou outros conectores visuais entre colunas, como um índice com pontos conectando títulos de capítulos a números de páginas, têm quase garantia de transposição porque os pontos iniciais criam uma linha visual contínua que o algoritmo de detecção interpreta como um separador de linhas. Remova os pontos iniciais do documento de origem antes de criar o PDF se a tabela for convertida posteriormente de volta para Excel.

A estrutura interna do PDF é tão importante quanto o layout visual. Uma tabela que parece perfeitamente alinhada na tela pode ser armazenada como objetos de texto em uma ordem que não corresponde à ordem de leitura visual. O software criador de PDF determina a ordem dos objetos de texto. Alguns aplicativos escrevem objetos de texto na ordem em que foram adicionados ao documento, que pode ser coluna por coluna, em vez de linha por linha. É por isso que dois PDFs que parecem idênticos podem produzir resultados de conversão diferentes: a ordem interna dos objetos de texto é diferente.

Uma tabela PDF não é armazenada como tabela no arquivo. Ele é armazenado como objetos de texto individuais posicionados em coordenadas específicas na página. O mecanismo de conversão deve observar essas coordenadas e inferir quais objetos de texto pertencem a quais linhas e colunas. O algoritmo de inferência usa o alinhamento horizontal e vertical do texto para agrupá-lo em linhas e colunas. Quando o alinhamento é ambíguo, o algoritmo pode agrupar o texto primeiro por alinhamento vertical, produzindo colunas que deveriam ser linhas.

Células mescladas são o gatilho mais comum para transposição. Uma tabela com uma linha de cabeçalho que abrange várias colunas cria uma estrutura visual onde a linha superior não se alinha com os limites das colunas abaixo dela. O mecanismo de conversão vê o cabeçalho mesclado e as colunas individuais abaixo dele como dois padrões de alinhamento diferentes. Ele pode interpretar o cabeçalho mesclado como uma linha com várias colunas ou pode interpretar as colunas abaixo como dados com várias linhas, e a ambiguidade leva à transposição. As tabelas em que a primeira coluna contém células mescladas que abrangem várias linhas são igualmente problemáticas porque a mesclagem vertical interrompe o alinhamento de linhas que o mecanismo usa para agrupar dados horizontalmente.

WukongPDF

Experimente PDF para Excel

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Ajuste as configurações de conversão para evitar transposição

Se a tabela PDF tiver sido gerada a partir de uma página da Web usando a função de impressão do navegador, a estrutura da tabela no PDF poderá ser menos estruturada do que uma tabela de um aplicativo de relatório dedicado. Os PDFs gerados pelo navegador geralmente têm um alinhamento mais frouxo entre os elementos de texto, o que torna a detecção de tabelas significativamente mais difícil. Quando possível, exporte tabelas para PDF a partir do aplicativo original em vez de imprimir a partir de um navegador para obter resultados de conversão mais confiáveis.

Algumas tabelas PDF usam cores de linhas alternadas como auxílio visual para os leitores. Essas cores alternadas podem confundir o algoritmo de detecção de tabela porque ele vê linhas de cores diferentes como pertencentes a diferentes seções da tabela. Remover as cores de fundo do PDF antes da conversão, ou converter primeiro para escala de cinza, elimina essa fonte de confusão e melhora a consistência da detecção da estrutura da tabela.

Se a ferramenta de conversão incluir um modo de detecção de tabela, habilite-o. A detecção de tabela informa ao mecanismo para procurar linhas de grade, sombreamento de fundo e padrões de alinhamento de texto consistentes que indiquem uma estrutura de tabela. Este modo aplica análise extra além da extração de texto padrão e tem maior probabilidade de identificar corretamente a orientação de linha e coluna. Algumas ferramentas também oferecem uma opção "Saída de transposição" caixa de seleção especificamente para lidar com casos em que a extração padrão produz dados transpostos. Se sua saída for transposta e a ferramenta tiver essa opção, marcá-la em uma segunda tentativa de conversão produzirá a orientação correta.

Para Extrair dados PDF de tabelas digitalizadas, execute o OCR especificamente no modo de tabela. Os mecanismos de OCR projetados para reconhecimento geral de texto podem não preservar as relações espaciais entre os blocos de texto. Um mecanismo de OCR no modo tabela preserva a estrutura de linhas e colunas na saída reconhecida. O conversor de PDF para Excel do WukongPDF inclui detecção automática de estrutura de tabela que identifica relacionamentos de linhas e colunas com base no alinhamento visual e em padrões de conteúdo, reduzindo a probabilidade de transposição em comparação com a extração de texto genérico.

Correção pós-conversão: transpor os dados do Excel para trás

Após a transposição, verifique os tipos de dados em cada coluna. O Excel pode ter interpretado uma coluna de números como texto após a transposição porque os dados transpostos incluíam um rótulo de cabeçalho na mesma coluna. Selecione cada coluna e verifique se o tipo de dados corresponde ao conteúdo. Os números formatados como texto não serão calculados corretamente e as datas formatadas como texto não serão classificadas cronologicamente. Corrija os tipos de dados após a transposição para garantir que a planilha esteja totalmente funcional.

Se a saída for transposta e a reconversão não for prática, o Excel poderá transpor os dados com apenas alguns cliques. Selecione o intervalo de dados transposto, copie-o, clique com o botão direito em um novo local e, em Opções de colagem, selecione “Transpor”. As linhas e colunas são trocadas, restaurando a orientação original. Isso funciona perfeitamente para tabelas simples onde o único problema é a reversão de linha/coluna. Para tabelas complexas com células mescladas, a transposição no Excel não trata as células mescladas corretamente e pode produzir um layout diferente do original de maneiras piores.

Antes de transpor, compare a tabela PDF original com a saída do Excel para confirmar se a transposição é o único problema. Se a saída também contiver células desalinhadas, dados ausentes ou células mescladas incorretamente, a transposição não resolverá esses problemas. Nesses casos, é necessária a reconstrução ou reconversão manual dos dados com configurações diferentes. A correção de transposição é uma solução de um clique para o caso específico em que os dados estão completos e alinhados corretamente, mas orientados incorretamente.

Pré-processamento do PDF para extração de tabela mais limpa

Se a tabela PDF tiver sido criada por um aplicativo específico, como SAP, Oracle Reports ou um sistema mainframe herdado, pesquise on-line problemas de conversão conhecidos com a saída PDF desse aplicativo específico. Os sistemas de relatórios corporativos geralmente geram PDFs com peculiaridades previsíveis na estrutura da tabela, e outros usuários podem ter documentado as configurações de conversão ideais para essa fonte específica. Uma pesquisa direcionada evita a tentativa e erro de testar múltiplas abordagens de conversão.

Se um determinado PDF produzir consistentemente resultados transpostos em diversas tentativas de conversão, pré-processe o PDF antes de converter. Use um editor de PDF para remover qualquer sombreamento de fundo, linhas de grade ou elementos decorativos que possam confundir o algoritmo de detecção de tabela. Uma tabela limpa com texto preto sobre fundo branco e linhas de grade finas e consistentes converte de forma mais confiável do que uma tabela com cores de linhas alternadas, bordas grossas e ícones incorporados. A remoção do ruído visual antes da conversão melhora a capacidade do mecanismo de conversão de identificar corretamente a estrutura da tabela.

Para tabelas digitalizadas, ajuste a digitalização para ficar perfeitamente reta. Uma tabela digitalizada mesmo em um ângulo de um grau faz com que cada linha se incline ligeiramente, e o mecanismo de conversão pode interpretar a inclinação como um alinhamento de coluna. A maioria dos softwares de digitalização inclui uma opção de enquadramento que endireita automaticamente a página. Ative esta opção antes de digitalizar ou use uma ferramenta de enquadramento no PDF digitalizado antes da conversão. Linhas retas são essenciais para a detecção correta de linhas e colunas.

Perguntas Frequentes

Converter uma tabela PDF para CSV em vez de Excel evita o problema de transposição? A conversão CSV usa o mesmo algoritmo de detecção de tabela da conversão Excel. Se o algoritmo transpor os dados, a saída CSV também será transposta. O formato de saída não afeta a lógica de detecção. O CSV tem a vantagem de ser mais fácil de inspecionar em um editor de texto, o que torna a transposição imediatamente visível quando você abre o arquivo e vê que as 5 colunas esperadas passaram a ser 20.

A transposição acontece mais com certos tipos de tabelas PDF?

Sim. Tabelas com células de cabeçalho mescladas, tabelas com números inconsistentes de colunas por linha e tabelas em que a primeira coluna usa orientação de texto vertical têm maior probabilidade de serem transpostas. Tabelas com estruturas de grade simples e uniformes raramente são transpostas. Quanto mais regular for a tabela, mais confiável será a conversão.

Posso automatizar a detecção e correção da saída Excel transposta?

Comparar o número de colunas na saída do Excel com o número esperado da tabela original é uma verificação simples e automatizada. Se a tabela PDF tiver 5 colunas e 20 linhas, mas a saída do Excel tiver 20 colunas e 5 linhas, os dados serão transpostos. Um script pode detectar essa incompatibilidade e transpor os dados ou sinalizar o arquivo para revisão manual. Essa verificação de qualidade automatizada detecta a transposição antes que os dados entrem nos fluxos de trabalho posteriores.

Por que a mesma tabela PDF é convertida corretamente em uma tentativa e transposta em outra?

Isso geralmente ocorre devido ao uso de configurações de conversão ligeiramente diferentes nas duas tentativas ou à ferramenta de conversão que usa um caminho de processamento interno diferente com base no tamanho do arquivo ou nos limites de complexidade. Se você encontrar resultados inconsistentes, documente as configurações exatas que produzem a saída correta e use essas configurações para todas as conversões futuras de tabelas semelhantes.

WukongPDF

Experimente PDF para Excel

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →