Tips & Tricks

Como reparar um PDF que abre com texto distorcido ou embaralhado

Um PDF que exibe texto ilegível, símbolos aleatórios, linhas de quadrados em branco ou sequências de caracteres sem sentido pode parecer um arquivo corrompido que está além da possibilidade de recuperação prática. O documento abre sem mensagens de erro, a contagem de páginas parece correta e todas as imagens ou gráficos são exibidos normalmente, mas as próprias palavras foram substituídas por algo completamente ilegível. Esse padrão normalmente sinaliza um problema de codificação de fonte em vez de corrupção estrutural de arquivo, o que é uma boa notícia porque os problemas de fonte geralmente podem ser corrigidos sem ferramentas especializadas de recuperação de dados ou serviços forenses de reparo de arquivos. O conteúdo subjacente ainda pode estar presente no arquivo, codificado de uma forma que o visualizador de PDF não consegue interpretar devido a dados de fonte ausentes ou incompatíveis.

How to Repair a PDF That Opens With Garbled or Scrambled Text

Diagnosticando codificação de fonte versus corrupção real de arquivo

A primeira etapa do diagnóstico é determinar se o problema se origina na codificação da fonte ou na própria estrutura do arquivo PDF. Um problema de codificação de fonte produz distorções sistemáticas e consistentes em todo o documento. Cada instância da letra A pode se tornar um quadrado vazio ou todo o texto aparece consistentemente como caracteres aleatórios acentuados de um alfabeto diferente, mas o padrão se repete de maneira previsível. A verdadeira corrupção de arquivos produz comportamento inconsistente: páginas que não são renderizadas, mensagens de erro ao tentar abrir o arquivo ou seções do documento que ficam totalmente em branco enquanto outras seções são exibidas corretamente. Páginas que renderizam imagens perfeitamente, mas mostram texto distorcido, apontam fortemente para problemas de fonte, e não para danos estruturais.

Abra o PDF em pelo menos dois visualizadores diferentes para confirmar o diagnóstico. Se o arquivo for exibido corretamente no Adobe Acrobat Reader, mas não em um visualizador baseado em navegador, como Chrome ou Edge, o visualizador do navegador provavelmente não oferece suporte ao formato de fonte incorporado específico usado no PDF. Se o arquivo for exibido corretamente no Chrome, mas não no Preview do Mac, o Preview pode não ter suporte para um esquema de codificação de fonte específico. Se o arquivo exibir texto ilegível em todos os visualizadores testados em diferentes sistemas operacionais, os dados da fonte no próprio PDF estarão danificados ou ausentes e será necessária uma operação Reparar PDF que aborde os recursos de fonte.

WukongPDF

Experimente reparar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Reincorporando fontes ausentes ou danificadas

Quando um PDF faz referência a uma fonte que não está incorporada no arquivo e não instalada no sistema de visualização, o visualizador de PDF é forçado a substituir uma fonte diferente que tenha disponível. Essa substituição freqüentemente desalinha os caracteres porque a fonte substituta tem larguras de caracteres, métricas de espaçamento e posições de glifo diferentes da fonte original. O texto aparece como símbolos confusos ou aleatórios porque os códigos de caracteres armazenados no PDF são mapeados para glifos completamente diferentes na fonte substituta daqueles pretendidos pelo autor do documento. A solução é incorporar novamente as fontes corretas ao PDF para que o visualizador não precise mais adivinhar.

Abra o PDF em uma ferramenta que possa inspecionar e modificar recursos de fontes no nível do documento. Verifique o inventário de fontes para ver quais fontes o documento faz referência e se cada uma está totalmente incorporada, parcialmente incorporada como um subconjunto contendo apenas os caracteres usados ou listada como não incorporada. Se uma fonte aparecer como não incorporada, você precisará instalar essa fonte exata em seu sistema e salvar novamente o PDF com a opção incorporar todas as fontes habilitada ou usar uma ferramenta PDF Fix PDF que pode localizar e incorporar os dados de fonte necessários de sua própria biblioteca de fontes licenciada. Fontes de sistema comuns como Arial, Times New Roman, Helvetica e Courier estão disponíveis na maioria das bibliotecas de fontes e podem ser incorporadas sem restrições de licenciamento.

Usando a técnica de impressão em PDF para recuperação rápida

Se o texto ilegível for causado por uma codificação de fonte que um visualizador específico manipula corretamente enquanto outros não, a solução prática mais rápida tira proveito desse único visualizador funcional. Abra o PDF em qualquer visualizador que renderize o texto corretamente na tela. Pressione Ctrl-P ou Command-P para abrir a caixa de diálogo de impressão e escolha Microsoft Imprimir em PDF ou Salvar como PDF como impressora de destino. O pipeline de impressão rasteriza ou recodifica o texto conforme ele aparece na tela e o incorpora em um PDF totalmente novo usando fontes padrão universalmente suportadas e codificação que todo visualizador de PDF moderno entende sem a necessidade de manipulação especial de fontes.

Este método produz uma cópia Repair PDF com texto limpo e legível que é exibido de forma consistente em todos os lugares, mas há uma compensação importante a ser entendida antes de se comprometer com isso. O PDF impresso normalmente perde a capacidade de seleção de texto, de pesquisa e quaisquer elementos interativos do formulário. O texto torna-se efetivamente parte da imagem da página. Para um documento que só precisa ser lido na tela e talvez impresso uma vez, esta é uma solução perfeitamente aceitável que leva segundos. Para um documento que precisa permanecer pesquisável, selecionável ou editável após o reparo, tente primeiro a abordagem de incorporação de fonte e reserve a impressão em PDF como alternativa.

Convertendo o PDF através de um formato intermediário

Quando a incorporação de fontes não resolve o problema e a impressão em PDF perde muita funcionalidade do documento, a conversão do PDF por meio de um formato intermediário pode eliminar a codificação quebrada e, ao mesmo tempo, preservar o texto como texto real. Exporte o PDF para um documento do Word usando um conversor de PDF para Word. O processo de conversão lê o fluxo de conteúdo do PDF e gera o texto reconhecido em um novo formato que usa o tratamento e codificação de fontes do próprio Word, completamente independente de tudo o que foi quebrado no PDF original. Abra o arquivo Word resultante, confirme se o texto é lido corretamente, faça as pequenas correções de formatação necessárias e, em seguida, exporte-o de volta para PDF com a incorporação de fonte habilitada.

A viagem de ida e volta pelo Word substitui a codificação quebrada por uma limpa e compatível com os padrões, mas layouts complexos com múltiplas colunas, posicionamento preciso ou gráficos vetoriais incorporados podem não sobreviver perfeitamente à conversão. A tabela abaixo compara as três abordagens de reparo em relação aos fatores que importam na escolha do método a ser aplicado:

MétodoTexto selecionávelLayout preservadoVelocidade
Incorporar fontes novamenteSimSimModerado
Imprimir em PDFNãoSimRápido
PDF para Word para PDFSimParcialLento

Lidando com problemas de codificação de fontes Unicode e CID

PDFs criados em scripts não latinos, como chinês, japonês, coreano, árabe ou cirílico, às vezes exibem texto distorcido, especificamente quando a fonte usa codificação CID (Identificador de Caractere) e o visualizador não consegue mapear os CIDs numéricos de volta aos caracteres Unicode correspondentes. Isso é comum com PDFs mais antigos produzidos por software de digitalização ou sistemas de publicação herdados que incorporavam fontes usando tabelas de codificação pré-Unicode projetadas antes do Unicode se tornar o padrão universal. Um PDF de um scanner japonês de 2005, por exemplo, pode usar uma fonte CID que os visualizadores modernos não conseguem interpretar sem o arquivo CMAP original específico do fornecedor.

Ferramentas especializadas PDF Fix PDF que suportam explicitamente o mapeamento CID para Unicode podem reconstruir as associações corretas de caracteres. Essas ferramentas leem os códigos CID brutos dos dados da fonte e da tabela CMAP incorporada, se presente, para reconstruir o mapeamento Unicode. O processo é automatizado em ferramentas projetadas para reparo de fontes PDF, sendo necessário apenas fazer o upload do arquivo e baixar a versão corrigida. Para PDFs contendo idiomas do Leste Asiático, escolha uma ferramenta de reparo que liste explicitamente o suporte a fontes CJK em seu conjunto de recursos, uma vez que ferramentas genéricas de reparo de fontes projetadas principalmente para scripts latinos podem não incluir os dados CMAP ou os modelos de reconhecimento de glifos para esses sistemas de escrita.

Evitando texto ilegível em PDFs que você cria

Se você cria regularmente PDFs que chegam aos destinatários com texto distorcido, a causa raiz é quase sempre as configurações de incorporação de fonte no software que gera o PDF. Ao exportar do Word, PowerPoint, InDesign ou uma ferramenta de design, localize a caixa de diálogo de opções de exportação ou salvamento de PDF e marque a caixa denominada Incorporar fontes ou Incorporar todas as fontes. Alguns aplicativos oferecem uma caixa de seleção adicional para Incorporar apenas os caracteres usados no documento, o que cria um arquivo menor subdividindo as fontes, mas pode causar problemas de exibição se o PDF for editado posteriormente ou mesclado com outro conteúdo. Para máxima compatibilidade entre plataformas, incorpore a fonte completa em vez de um subconjunto sempre que o aumento do tamanho do arquivo for aceitável.

Plataformas como WukongPDF lidam com a conversão do formato PDF com incorporação abrangente de fontes habilitada por padrão, evitando os problemas de codificação que surgem de dependências de fontes específicas do sistema que só funcionam no computador do criador. Ao enviar um PDF que deve ser exibido corretamente em diferentes sistemas operacionais, dispositivos e aplicativos de visualização, um teste de validação rápido é abrir o arquivo em um visualizador de PDF baseado em navegador, uma vez que esses visualizadores não têm acesso às fontes do sistema instaladas localmente e revelarão imediatamente quaisquer problemas de incorporação de fontes que, de outra forma, passariam despercebidos até que um destinatário reportasse texto ilegível.

Quando aceitar que um PDF não pode ser reparado

Apesar das melhores técnicas de reparo, alguns PDFs sofreram danos que não podem ser recuperados na prática. Se você tentou incorporar novamente fontes, imprimir em um novo PDF a partir de todos os visualizadores disponíveis e fazer a conversão de ida e volta por meio do Word, e o texto permanecer ilegível, o arquivo pode ter danos estruturais no próprio fluxo de conteúdo, em vez de apenas um problema de codificação de fonte. Neste ponto, o curso mais produtivo geralmente é localizar o documento de origem original e gerar um novo PDF a partir dele.

Guarde o arquivo danificado para referência, pois as imagens e a estrutura da página podem ainda estar parcialmente intactas mesmo quando o texto não puder ser recuperado. Se o documento tiver origem em um scanner, a nova digitalização do documento original em papel produzirá um PDF limpo com codificação de texto correta. Se o documento foi criado a partir de um arquivo do Word ou de um aplicativo de design, peça ao autor original para reexportá-lo com a incorporação de fontes explicitamente habilitada. Uma nova exportação do documento de origem contorna todos os problemas de codificação presentes na cópia danificada e produz um arquivo limpo em menos tempo do que tentativas de reparos adicionais.

WukongPDF

Experimente reparar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →