Others

Por que alguns PDFs são mais rápidos de pesquisar do que outros

Dois PDFs ficam lado a lado em uma pasta. Ambos têm a mesma contagem de páginas. Ambos foram criados no mesmo ano. Você digita o mesmo termo de pesquisa em ambos. Um retorna resultados quase instantaneamente. O outro faz uma pausa, mostra um indicador de progresso giratório e leva alguns segundos para informar que o termo foi encontrado na página doze. A diferença na velocidade de pesquisa entre esses dois PDFs não é aleatória. É determinado pela forma como o PDF foi criado, se o texto é incorporado ou gerado por OCR, como as fontes são codificadas e se a estrutura do documento inclui recursos de otimização de pesquisa. Entender por que alguns documentos PDF pesquisáveis são mais rápidos de pesquisar do que outros ajuda a criar PDFs que pesquisam com eficiência e diagnosticam documentos de pesquisa lenta que precisam de atenção.

Why Are Some PDFs Faster to Search Through Than Others

Como a pesquisa de PDF realmente funciona

Ao pesquisar um PDF, o visualizador não verifica as imagens visíveis da página em busca de formatos de caracteres. Ele consulta os fluxos de conteúdo de texto incorporados no arquivo PDF. Cada página contém um ou mais fluxos de conteúdo que listam os caracteres da página, suas posições e as fontes usadas para exibi-los. A função de pesquisa lê esses fluxos de conteúdo sequencialmente, caractere por caractere, procurando correspondências com o termo de pesquisa. A velocidade dessa varredura sequencial depende de como os dados do texto estão organizados.

Um PDF com fluxos de conteúdo bem estruturados, onde o texto aparece em ordem de leitura lógica com codificação consistente, pode ser pesquisado tão rápido quanto o visualizador consegue ler os dados do disco. Um PDF com fluxos de conteúdo fragmentados, onde o texto de um único parágrafo está espalhado por vários objetos de fluxo em ordem não sequencial, força a função de pesquisa a saltar entre diferentes partes do arquivo, remontando o texto na memória antes que ele possa ser pesquisado. A estrutura Formato PDF dos fluxos de conteúdo é o principal determinante da velocidade de pesquisa.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Texto incorporado versus texto OCR no desempenho de pesquisa

O texto incorporado, texto criado em um processador de texto ou aplicativo de layout e escrito diretamente no PDF, é armazenado como uma sequência de códigos de caracteres. Cada personagem ocupa uma posição conhecida no fluxo de conteúdo. A função de pesquisa lê o fluxo linearmente e encontra correspondências de forma eficiente. O texto OCR PDF, texto gerado por reconhecimento óptico de caracteres a partir de uma imagem de página digitalizada, é armazenado de forma diferente. O mecanismo de OCR coloca cada palavra reconhecida em sua posição aproximada na página, mas as palavras podem não estar em ordem de leitura estrita no fluxo de conteúdo.

O texto OCR também pode conter erros de reconhecimento. Um caractere que foi mal interpretado pelo mecanismo de OCR como um caractere diferente não corresponderá ao termo de pesquisa, mesmo que o caractere visível na página pareça correto. Uma pesquisa por contrato não encontrará contrato, mesmo que o mecanismo de OCR produza esse reconhecimento incorreto e o coloque no fluxo de conteúdo. A função de pesquisa não vê a imagem da página. Ele vê apenas o texto OCR. Erros nesse texto se traduzem diretamente em falhas de pesquisa.

Codificação de fontes e seu efeito na pesquisa

As fontes em PDFs podem ser codificadas de diversas maneiras, e a codificação afeta a velocidade de pesquisa. Uma fonte com codificação padrão, como WinAnsiEncoding ou MacRomanEncoding, mapeia códigos de caracteres diretamente para glifos padrão. A função de pesquisa pode processar esse texto rapidamente porque o mapeamento é direto. Uma fonte com codificação personalizada, em que os códigos de caracteres são atribuídos arbitrariamente pelo designer da fonte, exige que a função de pesquisa procure cada código na tabela de codificação de fontes para determinar qual caractere ele representa. Esta pesquisa adiciona sobrecarga a cada comparação de caracteres.

As fontes CID, usadas para conjuntos de caracteres do Leste Asiático, usam uma codificação de dois níveis que mapeia códigos de caracteres para valores CID e, em seguida, mapeia valores CID para Unicode. A pesquisa de texto em uma fonte codificada por CID requer a resolução desse mapeamento de dois níveis para cada caractere. Um PDF contendo texto em chinês, japonês ou coreano em uma fonte codificada por CID será pesquisado mais lentamente do que um PDF contendo texto em inglês em uma fonte codificada padrão, apenas por causa da etapa adicional de resolução de codificação. A escolha de codificação de fontes PDF feita quando o PDF é criado afeta o desempenho da pesquisa durante toda a vida do documento.

O papel da árvore da estrutura da página na pesquisa

Um PDF marcado inclui uma estrutura em árvore que organiza o conteúdo do documento em elementos lógicos, como seções, parágrafos e figuras. A árvore de estrutura fornece à função de pesquisa um roteiro do documento. Em vez de verificar os fluxos de conteúdo linearmente desde o início do arquivo, a função de pesquisa pode navegar na árvore de estrutura para localizar o texto em seções específicas do documento. Uma pesquisa em um PDF marcado pode ser mais rápida porque a árvore de estrutura fornece a indexação que falta em um fluxo de conteúdo simples.

PDFs não marcados, que constituem a maioria dos PDFs em circulação, não possuem essa árvore de estrutura. A função de pesquisa não tem escolha a não ser verificar os fluxos de conteúdo sequencialmente. Para documentos curtos, a diferença é insignificante. Para documentos com centenas ou milhares de páginas, a presença ou ausência de uma árvore de estrutura pode fazer a diferença entre resultados de pesquisa quase instantâneos e um atraso perceptível. A criação de PDFs marcados é uma prática recomendada de acessibilidade que também beneficia o desempenho do PDF pesquisável.

Índices de pesquisa incorporados em PDFs

Algumas ferramentas de criação de PDF podem incorporar um índice de pesquisa diretamente no arquivo PDF. Este índice é uma tabela de pesquisa pré-construída que mapeia palavras para as páginas onde elas aparecem. Um PDF com um índice incorporado pode ser pesquisado quase instantaneamente, porque a função de pesquisa consulta o índice em vez de verificar os fluxos de conteúdo. A pesquisa de índice retorna os números das páginas onde a palavra aparece e o visualizador vai diretamente para essas páginas.

Índices incorporados são incomuns em PDFs de uso geral porque aumentam o tamanho do arquivo e o tempo de criação do índice. Eles são mais comumente encontrados em grandes PDFs de referência, manuais técnicos e coleções de documentos onde a velocidade de pesquisa é uma prioridade. A maioria dos fluxos de trabalho de criação de PDF não inclui a geração de índice por padrão. A ausência de um índice incorporado é a norma. Quando você encontra um PDF que pesquisa visivelmente mais rápido do que outros de tamanho semelhante, provavelmente o motivo é um índice incorporado.

O que você pode fazer para melhorar a velocidade de pesquisa

Se você criar PDFs que serão pesquisados com frequência, gere-os como PDFs marcados com codificações de fonte padrão. Evite codificações de fontes personalizadas, a menos que os requisitos de design não possam ser atendidos de outra forma. Se o PDF contiver texto não latino, teste o desempenho da pesquisa em uma amostra antes de adotar a abordagem de codificação do documento completo. Um pequeno investimento nas configurações de criação compensa na busca mais rápida de cada pessoa que utiliza o documento.

Para PDFs existentes cuja pesquisa é lenta, considere refazer o OCR do texto gerado por OCR com um mecanismo moderno que produza fluxos de conteúdo mais limpos. Execute o PDF por meio de uma ferramenta de análise de estrutura que pode adicionar marcação se o documento não estiver marcado no momento. WukongPDF suporta reprocessamento OCR PDF e marcação de documentos que podem melhorar o desempenho de pesquisa em PDFs existentes sem recriá-los a partir de documentos de origem.

A data de criação do PDF e a versão do software usada para criá-lo podem explicar as diferenças na velocidade de pesquisa. Um PDF criado por uma versão 2024 de uma biblioteca de PDF moderna provavelmente terá fluxos de conteúdo mais limpos e uma codificação de texto mais eficiente do que um PDF criado por uma versão 2008 de uma ferramenta legada. O formato PDF evoluiu e as ferramentas de criação mais recentes produzem arquivos mais bem estruturados.

Para PDFs pesquisados com frequência como parte de um fluxo de trabalho de gerenciamento de documentos, considere extrair o texto e criar um índice de pesquisa externo. Um sistema de gerenciamento de documentos com um índice de pesquisa de texto completo consulta o índice, não os fluxos de conteúdo do PDF. A velocidade de pesquisa torna-se independente da estrutura interna do PDF.

O número de fontes usadas em um PDF afeta a velocidade de pesquisa porque cada alteração de fonte exige que a função de pesquisa carregue uma nova tabela de codificação. Um PDF que usa duas fontes pesquisa mais rápido do que um PDF que usa vinte fontes, sendo todos os outros fatores iguais.

O desempenho PDF pesquisável de um documento é determinado no momento da criação por escolhas sobre codificação de fonte, organização do fluxo de conteúdo, marcação de documento e incorporação de índice. Essas opções são invisíveis para o autor do documento, mas imediatamente aparentes para qualquer pessoa que pesquise o documento.

Para coleções de documentos que serão pesquisadas com frequência, o investimento na criação de PDFs bem estruturados e marcados com codificações de fontes padrão compensa sempre que um usuário digita uma consulta e recebe resultados quase instantâneos.

Este artigo aborda as principais técnicas e considerações para trabalhar com PDFs neste cenário específico. Os métodos descritos aqui se aplicam a diferentes ferramentas e plataformas, dando aos leitores a flexibilidade de escolher a abordagem que melhor se adapta ao seu fluxo de trabalho e ambiente técnico.

As etapas práticas descritas fornecem um caminho claro desde o desafio inicial até uma solução funcional. Cada técnica foi selecionada por sua confiabilidade e acessibilidade, garantindo que os leitores possam obter resultados consistentes, independentemente de sua experiência anterior com ferramentas PDF.

As diferenças na velocidade de pesquisa descritas neste artigo são o resultado direto das escolhas feitas durante a criação do PDF. A compreensão desses fatores capacita os criadores de documentos a produzir PDFs que proporcionam uma melhor experiência de pesquisa.

As ferramentas e técnicas descritas neste artigo fornecem um caminho prático desde a pergunta inicial até uma solução funcional que pode ser aplicada em diversos documentos e cenários.

WukongPDF

Experimente o OCR de PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →