Achatar um PDF mescla todas as anotações, campos de formulário e conteúdo em camadas em uma única camada de imagem estática. Depois de nivelado, a camada de texto original que existia antes do nivelamento desaparece. Os caracteres de texto que antes eram selecionáveis, pesquisáveis e extraíveis tornam-se pixels na imagem achatada. Reparo de PDF para um documento nivelado pergunta se a camada de texto original pode ser recuperada da saída nivelada.
A resposta curta depende se o PDF foi achatado com ou sem retenção da camada de texto. Algumas operações de nivelamento preservam o texto original atrás da imagem nivelada como conteúdo oculto. Outras operações de nivelamento descartam totalmente o texto, substituindo-o pela imagem renderizada. A recuperação é possível no primeiro caso e impossível no segundo.
As ferramentas de recuperação PDF do WukongPDF podem detectar e extrair camadas de texto preservadas de documentos PDF nivelados.

Como funciona o nivelamento de PDF e o que ele remove
O nivelamento combina todas as camadas visíveis de uma página PDF em uma única imagem renderizada. Anotações incluindo destaques, notas adesivas e marcações de desenho são mescladas com o conteúdo da página. Os campos do formulário são convertidos de elementos interativos em representações visuais estáticas de seus valores preenchidos. Os efeitos de transparência são resolvidos em pixels opacos. O resultado é uma página que parece idêntica à original, mas não possui estrutura interativa ou em camadas.
Na prática, o processo de nivelamento pode ou não preservar a camada de texto original atrás da imagem nivelada. Quando o nivelamento é executado por meio da Visualização do nivelador do Acrobat Pro ou da ferramenta Preflight com determinadas configurações, o texto original pode ser retido como uma camada invisível. Quando o nivelamento é realizado por meio de Imprimir em PDF ou de ferramentas de terceiros, a camada de texto normalmente é totalmente descartada.
Um teste rápido determina se o texto foi preservado. Abra o PDF nivelado e tente selecionar o texto em uma página. Se o texto puder ser selecionado e copiado, a camada de texto sobreviveu ao nivelamento. Se clicar no texto não seleciona nada ou seleciona a página inteira como imagem, a camada de texto foi descartada e apenas a aparência visual permanece.
Experimente reparar PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
Método 1: Verificando uma camada de texto oculta atrás da imagem achatada
No Acrobat Pro, abra o PDF nivelado e vá em Ferramentas, Edição de conteúdo, Editar texto e imagens. Clique em uma área de texto visível. Se o Acrobat exibir uma caixa delimitadora ao redor do texto e permitir a edição, existirá uma camada de texto atrás da imagem achatada. O texto está presente nos dados do arquivo, embora possa não estar visível como texto selecionável durante a visualização normal.
Se o texto estiver presente, extraia-o usando o recurso Exportar PDF para texto do Acrobat Pro. O texto extraído pode conter o conteúdo original mesmo que a página visual pareça achatada. Copie o texto extraído e compare-o com uma amostra do conteúdo original. Se o texto corresponder, a camada de texto original foi recuperada com êxito do arquivo nivelado.
Olhando de forma ampla, em cenários reais, se o Acrobat não conseguir encontrar texto editável, a camada de texto será descartada durante o nivelamento. O texto visual na página é composto por pixels na imagem achatada, não por códigos de caracteres. A recuperação através da extração de texto não é possível porque não há dados de texto para extrair.
Método 2: Usando OCR para recriar a camada de texto perdida
Quando a camada de texto original foi descartada durante o nivelamento, o OCR fornece um caminho para recriá-la. Execute o OCR no PDF nivelado usando o recurso Reconhecer texto do Acrobat Pro. O mecanismo de OCR analisa a imagem em pixels de cada página, identifica formatos de caracteres e cria uma nova camada de texto com os caracteres reconhecidos.
Considerando isto de forma ampla, na prática, a camada de texto recriada pelo OCR não é o texto original. O OCR introduz erros de reconhecimento, especialmente com texto pequeno, fontes incomuns ou texto sobre fundos complexos. O texto recriado terá aproximadamente 95 a 99 por cento de precisão para documentos limpos e padrão, e menos preciso para documentos com tipografia ou layout desafiadores.
Após o OCR, compare o texto reconhecido com uma amostra conhecida do conteúdo original, se disponível. Corrija erros de OCR manualmente ou aceite a camada de texto recriada como uma aproximação do original. A saída do OCR pode ser usada para pesquisa e extração de texto, mas pode conter erros que exigem verificação antes de confiar no texto para fins legais, financeiros ou regulatórios.
Verificação de texto na estrutura do arquivo PDF
Para uma verificação definitiva se existem dados de texto em um PDF nivelado, examine a estrutura bruta do arquivo. Abra o PDF em um editor de texto que possa lidar com arquivos binários, como VS Code ou Notepad++. Pesquise sequências de texto reconhecíveis no conteúdo original do documento. Se cadeias de texto forem encontradas nos dados do arquivo, a camada de texto existirá mesmo que não esteja acessível por meio da interface do leitor de PDF.
Esta abordagem requer alguma familiaridade com a estrutura interna do PDF. O texto em um PDF é armazenado nos marcadores BT e ET, que indicam o início e o fim dos objetos de texto. Entre esses marcadores, os códigos de caracteres são listados com comandos de posicionamento. Encontrar marcadores BT e ET contendo texto reconhecível indica que os dados do texto sobreviveram ao achatamento.
Visto de um ponto de vista prático, em cenários reais, se nenhuma sequência de texto for encontrada nos dados do arquivo, a operação de nivelamento rasterizou completamente o conteúdo. As páginas são imagens e não contêm informações de texto recuperáveis. OCR é o único caminho disponível para criar uma camada de texto.
Prevenindo a perda da camada de texto em futuras operações de nivelamento
Ao nivelar um PDF que precisa manter sua camada de texto, use configurações que preservem o texto oculto. No Acrobat Pro, a ferramenta Flattener Preview inclui uma caixa de seleção para reter informações de impressão sobreposta e cores exatas, o que ajuda indiretamente a preservar os dados do texto. A ferramenta Preflight oferece correções de nivelamento que retêm explicitamente o texto.
A abordagem mais segura é salvar uma cópia não nivelada do PDF antes de nivelá-lo. A cópia não nivelada retém todos os elementos interativos, anotações e camadas de texto. Distribua a versão achatada. Arquive o original não nivelado. Se a recuperação for necessária, o original fornece os dados de origem completos.
Tendo uma visão mais ampla, em fluxos de trabalho de documentos, para documentos críticos, teste as configurações de nivelamento em uma cópia antes de aplicá-las ao original. Verifique se o texto permanece recuperável após o nivelamento. Ajuste as configurações se a recuperação falhar. A etapa de teste adiciona minutos ao fluxo de trabalho e evita a perda permanente de texto.
Usando o Preflight para detectar e extrair camadas de texto ocultas
A ferramenta Acrobat Pro Preflight inclui perfis projetados especificamente para analisar a estrutura do conteúdo de PDF. O relatório Inventário lista todos os objetos de texto presentes no arquivo, incluindo aqueles que não são visíveis durante a visualização normal. A execução deste relatório em um PDF nivelado revela se os dados de texto sobreviveram ao processo de nivelamento.
Se o relatório Preflight identificar objetos de texto, use a correção Exportar todo o texto para extraí-los para um arquivo separado. O texto extraído pode então ser comparado com o conteúdo visível da página para determinar quanto do texto original foi preservado e se é preciso e completo.
Recuperando texto de PDFs parcialmente nivelados
Algumas operações de nivelamento afetam apenas elementos específicos da página, deixando outros intactos. Os campos do formulário podem ser nivelados enquanto o texto do corpo permanece como caracteres selecionáveis. As anotações podem ser niveladas enquanto o texto da página subjacente sobrevive. Examine cada tipo de elemento de forma independente para determinar o que foi achatado e o que foi preservado.
De um ângulo amplo, em fluxos de trabalho de documentos, para documentos parcialmente nivelados, extraia o texto remanescente das partes não niveladas e combine-o com a saída de OCR das partes niveladas. A abordagem híbrida maximiza a recuperação de texto usando o texto original quando disponível e texto reconstruído por OCR onde o original foi perdido.
Quando aceitar que a recuperação não é possível
Caso isso aconteça, se não existirem dados de texto na estrutura do arquivo, se o Acrobat não conseguir encontrar texto editável e se o OCR produzir resultados inaceitavelmente imprecisos, a camada de texto original não poderá ser recuperada. Aceite esta conclusão e passe a preservar o que resta, em vez de investir mais tempo em tentativas de recuperação.
Documente a tentativa de recuperação e seu resultado. Observe as ferramentas utilizadas, os métodos experimentados e a conclusão alcançada. A documentação serve aos futuros custodiantes de documentos que podem ter acesso a melhores ferramentas de recuperação e devem compreender o que foi tentado antes.
Estratégia de arquivamento de longo prazo para documentos nivelados
PDFs nivelados geralmente são criados especificamente para fins de arquivamento porque removem dependências interativas. Ao arquivar documentos nivelados, armazene o original não nivelado junto com a versão nivelada sempre que possível. O original preserva a estrutura completa do documento. A versão achatada fornece um formato de arquivamento estável.
Para documentos onde existe apenas a versão nivelada, execute o OCR para criar uma camada de texto e incorporá-la no PDF. O texto OCR pode não ser perfeito, mas permite pesquisas futuras e extração de texto que de outra forma seriam impossíveis. A camada OCR é uma ponte entre a imagem achatada e as necessidades futuras de análise de documentos.
Detecção automatizada de nivelamento para coleções de documentos
As organizações que gerenciam grandes coleções de documentos se beneficiam da detecção automatizada de PDFs nivelados. Um script que abre cada PDF, verifica a presença de texto selecionável e sinaliza arquivos onde o texto está ausente, identifica documentos que precisam de processamento de OCR. A digitalização automatizada evita que documentos achatados entrem silenciosamente no arquivo sem camadas de texto pesquisáveis.
Integre a detecção de nivelamento ao fluxo de trabalho de ingestão de documentos. Quando um novo PDF entra no sistema, verifique a presença de texto. Se o texto estiver ausente, encaminhe o documento para uma fila de processamento de OCR antes de chegar ao arquivo. A detecção e correção automatizadas garantem que todos os documentos arquivados possam ser pesquisados.
Experimente reparar PDF
Nenhuma instalação necessária. Funciona diretamente no seu navegador.
