Others

Por que meu PDF mostra símbolos aleatórios ou jargões em vez de texto normal quando eu o abro

Você abre um PDF que estava perfeitamente legível ontem. Hoje, cada página exibe símbolos aleatórios em vez de texto. As letras foram substituídas por caixas quadradas, pontos de interrogação, sinais de adição ou sequências de caracteres completamente não relacionados, como "%$#@!" onde as sentenças deveriam estar. A estrutura do documento está intacta. As páginas estão lá. As imagens estão boas. Mas cada palavra em cada página foi transformada em algo sem sentido.

Esta é uma falha na codificação da fonte e um dos problemas mais alarmantes do PDF porque parece que o arquivo foi corrompido sem possibilidade de recuperação. Na maioria dos casos, o conteúdo está intacto. O PDF usa códigos de caracteres que o visualizador não consegue mapear para os formatos de letras corretos. A correção geralmente envolve reparar a codificação da fonte, instalar a fonte ausente ou renderizar novamente o PDF por meio de um mecanismo que resolva a codificação corretamente.

Why Does My PDF Show Random Symbols or Gibberish Instead of Normal Text When I Open It

As três causas mais comuns de texto sem sentido em PDFs

Causa um: fontes ausentes sem substituto incorporado. O PDF foi criado usando uma fonte que não estava incorporada no arquivo e seu sistema não possui essa fonte instalada. O visualizador de PDF tenta substituir uma fonte diferente, mas o substituto usa uma codificação de caracteres diferente. O código de caracteres que significava "A" na fonte original significa outra coisa na fonte substituta. O visualizador reproduz fielmente o caractere substituto, e é por isso que cada letra da página é substituída por um símbolo diferente.

Causa dois: dados de fonte corrompidos no PDF. A fonte está incorporada, mas os dados da fonte incorporada estão danificados. Isso pode acontecer quando um PDF é baixado parcialmente, transferido por meio de um sistema de e-mail que modifica dados binários ou armazenado em um dispositivo de armazenamento com defeito. Os dados da fonte estão presentes, mas contêm erros que fazem com que o mecanismo de renderização interprete mal os códigos de caracteres. O texto parece aleatório, mas na verdade é um resultado determinístico de uma entrada corrompida. Cada vez que você abre o arquivo, o mesmo texto aparece como o mesmo texto sem sentido porque a corrupção está nos dados de fonte armazenados, e não em um erro de renderização transitório.

Causa três: codificação incorreta de caracteres especificada no PDF. O PDF contém uma entrada /Encoding que informa ao visualizador como mapear códigos de caracteres para glifos, mas a codificação especificada não corresponde à forma como o texto foi realmente escrito. Isso acontece com mais frequência com PDFs criados por softwares mais antigos ou não padrão que escreveram o texto usando uma codificação, mas declararam uma codificação diferente nos metadados do arquivo. O visualizador aplica a codificação declarada e produz algo sem sentido. Se, em vez disso, aplicasse a codificação real usada pelo criador, o texto seria renderizado corretamente. Essa incompatibilidade entre a codificação declarada e a real é a mais corrigível das três causas porque os dados do texto estão intactos. Apenas as instruções de mapeamento estão erradas.

WukongPDF

Experimente reparar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Como diagnosticar qual problema seu PDF apresenta

Um rápido conjunto de testes restringe a causa. Primeiro, abra o PDF em um visualizador diferente. Se ele for exibido corretamente no Adobe Acrobat, mas mostrar algo sem sentido no seu navegador, o problema é o renderizador de PDF do navegador, não o arquivo. Instale a fonte ausente ou use um visualizador diferente. Se o PDF mostrar algo sem sentido em todos os visualizadores, o problema está no próprio arquivo.

Segundo, verifique a lista PDF Fonts nas propriedades do documento. No Acrobat, vá para Arquivo, Propriedades, Fontes. Se a lista de fontes mostrar fontes marcadas como não incorporadas e essas fontes não estiverem instaladas em seu sistema, você terá um problema de fonte ausente. Instale a fonte ou abra o arquivo em um sistema que a possua. Se a lista de fontes mostrar fontes incorporadas, mas o texto ainda estiver sem sentido, os dados da fonte incorporada provavelmente estão corrompidos.

Terceiro, tente selecionar e copiar o texto sem sentido. Cole-o em um editor de texto. Se o texto colado for o texto original correto, os caracteres serão armazenados corretamente no PDF, mas o mapeamento de exibição será interrompido. Isto indica uma incompatibilidade de declaração de codificação. Os dados do texto são bons. O visualizador está apenas exibindo errado. Se o texto colado também estiver sem sentido, os próprios dados dos caracteres serão corrompidos, o que é um problema mais profundo.

Como corrigir um PDF que mostra símbolos aleatórios

Para fontes ausentes, instale a fonte necessária em seu sistema. O nome da fonte está listado nas propriedades do documento. Muitas fontes estão disponíveis para download gratuito e fontes comerciais podem ser adquiridas e instaladas. Depois que a fonte estiver instalada, reabra o PDF. O texto deve ser renderizado corretamente. Se a instalação da fonte não for prática, abra o PDF em um visualizador que tenha uma melhor substituição de fontes, como o Adobe Acrobat, em vez de um visualizador de navegador, ou use WukongPDF para renderizar novamente o PDF com fontes incorporadas. O processo de nova renderização resolve todas as referências de fontes e incorpora as formas reais dos caracteres, produzindo um PDF independente que será exibido corretamente em qualquer sistema.

Para fontes incorporadas corrompidas, a solução é reparar ou substituir os dados da fonte. A ferramenta PDF Repair de WukongPDF pode detectar fluxos de fontes corrompidos e tentar reconstruí-los a partir dos dados sobreviventes. Se a fonte for parcialmente recuperável, a ferramenta extrai as partes intactas e reconstrói um subconjunto funcional de fontes. Isso nem sempre é bem-sucedido. Se a corrupção for extensa, o texto pode ficar parcial ou totalmente irrecuperável e o único recurso é localizar o documento de origem original e recriar o PDF.

Para incompatibilidades de codificação, a solução mais confiável em todos os casos é imprimir o PDF em um novo PDF. Abra o arquivo em qualquer visualizador que o exiba corretamente, mesmo que apenas um visualizador em um computador específico o renderize corretamente, e use a função Imprimir em PDF para criar um novo arquivo. O processo de impressão renderiza novamente cada caractere usando a renderização de fonte atual do sistema, inserindo efetivamente as formas corretas dos caracteres no novo PDF como dados de fonte incorporados. A incompatibilidade de codificação foi resolvida porque o novo PDF usa uma codificação padrão com fontes incorporadas. Essa correção preserva a aparência visual do texto, mas pode perder a codificação de caracteres subjacente, o que é importante se o texto precisar ser pesquisável ou extraível posteriormente. Para documentos onde a capacidade de pesquisa é importante, use uma ferramenta dedicada Fix PDF que repara a codificação enquanto preserva a camada de texto.

Evitando problemas de codificação de fontes em PDFs que você cria

Sempre incorpore fontes ao criar PDFs. Essa configuração única evita a grande maioria dos problemas de texto sem sentido. Em todo aplicativo que exporta para PDF, Word, InDesign, Illustrator, PowerPoint, existe a opção de incorporar fontes. Encontre-o. Habilite-o. O PDF resultante será um pouco maior, normalmente de 50 KB a 200 KB por fonte, mas será exibido corretamente em todos os sistemas e em todos os visualizadores, agora e no futuro.

Use codificações padrão. Evite codificações de caracteres personalizadas, a menos que você tenha um motivo específico e entenda as implicações. A codificação padrão de PDF, WinAnsiEncoding para scripts latinos e Identity-H para Unicode, é compreendida por todos os visualizadores de PDF. As codificações personalizadas podem ser compreendidas pelo software que as criou e nada mais. Uma codificação padrão com fontes incorporadas é a combinação mais portátil e confiável para texto PDF que permanece legível em todas as plataformas e ao longo do tempo.

Se você encontrar texto sem sentido em um PDF que foi criado por um aplicativo mais antigo ou especializado, como um gerador de relatórios de mainframe, um sistema de contabilidade legado ou um módulo de saída de instrumento científico, o problema de codificação pode estar na tabela de mapeamento de caracteres do PDF, e não nas fontes ausentes. Às vezes, esses sistemas produzem PDFs onde o texto é armazenado usando uma codificação de símbolo personalizada que mapeia códigos de caracteres para posições de glifos em uma fonte, em vez de valores Unicode. Quando um visualizador moderno tenta extrair o texto como Unicode, o mapeamento falha e os resultados são confusos. A correção para esses arquivos é usar uma ferramenta de reparo de PDF que pode detectar codificações não padrão e substituí-las por mapeamentos Unicode padrão ou extrair o texto como códigos de caracteres brutos e reconstruir a codificação a partir dos dados da fonte. Esta é uma operação de reparo especializada além do que as ferramentas PDF de uso geral realizam e normalmente requer uma ferramenta com suporte explícito para reparo de codificação legada.

WukongPDF

Experimente reparar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →