Others

Por que não consigo editar texto no meu PDF

Why Cannot I Edit Text in My PDF

Por que um PDF que se parece com texto pode não ser editável

Você abre um PDF, vê palavras na tela e presume que pode editá-las. Quando você clica no texto e nada acontece, ou quando você tenta digitar e o cursor não aparece, você descobre que o PDF que se parece com um documento de texto não é, na verdade, um documento editável. Essa experiência é frustrantemente comum porque os PDFs podem conter texto em formas fundamentalmente diferentes, das quais apenas algumas são editáveis.

A execução do OCR em um PDF digitalizado adiciona uma camada de texto pesquisável e editável atrás de cada imagem de página do documento.

A conversão de PDF para um formato editável e vice-versa é uma alternativa confiável quando a edição direta não é possível.

Um editor de PDF pode modificar o texto que existe como objetos de texto reais no PDF, com cada caractere representado como um código de caractere selecionável e modificável. Isso é chamado de texto nativo ou ativo. Um Formato PDF também pode conter texto que existe apenas como uma imagem, como um documento digitalizado onde o texto faz parte da fotografia da página. O texto baseado em imagem não pode ser selecionado, pesquisado ou editado porque o PDF não contém dados de caracteres, apenas pixels que formam o formato de letras. Antes de saber se um PDF é editável, você precisa saber que tipo de texto ele contém.

O teste mais rápido é tentar selecionar o texto no PDF. Clique e arraste sobre uma palavra. Se o texto for destacado conforme você arrasta, é um texto nativo e pode ser editado. Se nada for realçado e o cursor não mudar, o texto é baseado em imagem e não pode ser editado diretamente. Se o texto for realçado, mas o realce for irregular, selecionando algumas palavras, mas ignorando outras, o PDF tem uma mistura de texto nativo e texto que existe apenas como elementos visuais, uma situação comum em PDFs criados por software mais antigo ou pela combinação de vários documentos de origem.

WukongPDF

Experimente Editar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Razões Comuns pelas quais seu texto PDF não pode ser editado

O motivo mais comum é que o PDF é um documento digitalizado. Um PDF criado pela digitalização de páginas de papel com um scanner de mesa ou um aplicativo de câmera de telefone contém imagens de texto, e não caracteres de texto reais. Embora você possa ler as palavras na tela, o arquivo PDF não contém dados de texto editáveis. Para tornar um PDF digitalizado editável, você deve primeiro executar o OCR para reconhecer o texto nas imagens e criar uma camada de texto invisível atrás de cada imagem da página. Após o OCR, o texto torna-se pesquisável e, em muitos editores de PDF, editável como se fosse texto nativo.

Restrições de senha ou permissão são outra barreira comum à edição. Um PDF protegido por uma senha de permissão pode ser aberto e visualizado, mas as permissões podem bloquear a edição, cópia ou impressão. Se você conseguir abrir o PDF e ver o texto, mas as ferramentas de edição estiverem esmaecidas ou exibirem uma mensagem de erro, verifique as configurações de segurança do documento. Na maioria dos visualizadores de PDF, o painel Propriedades do documento ou Segurança mostra quais permissões são restritas. Se a edição for restrita e você tiver a senha de permissão, poderá remover as restrições e ativar a edição.

O PDF pode conter texto que foi convertido em contornos ou curvas durante a criação. Os designers gráficos às vezes convertem texto em contornos em aplicativos como o Adobe Illustrator antes de criar um PDF para garantir que as fontes sejam exibidas corretamente, independentemente de o destinatário ter essas fontes instaladas. O texto convertido em contornos parece visualmente idêntico ao texto nativo, mas consiste em formas vetoriais em vez de dados de caracteres. Nenhuma ferramenta Editar PDF] pode editar texto contornado como texto porque as informações do caracter foram descartadas durante a conversão para contornos.

Problemas de codificação de fonte podem tornar o texto não editável mesmo quando o PDF contém caracteres de texto nativos. Alguns PDFs usam codificações de fontes personalizadas que mapeiam códigos de caracteres para glifos de maneiras não padronizadas. A ferramenta de edição vê os códigos de caracteres, mas não consegue determinar quais caracteres eles representam, por isso se recusa a editá-los para evitar corromper o texto. Esse problema é mais comum em PDFs gerados por software especializado, sistemas legados ou documentos que usam scripts não latinos com tratamento de fontes personalizado. A reexportação do PDF do aplicativo original com a incorporação de fontes habilitada geralmente resolve o problema de codificação.

Como tornar um PDF digitalizado editável usando OCR

O reconhecimento óptico de caracteres é o processo que converte imagens de texto em texto editável real. A moderna tecnologia OCR é altamente precisa para digitalizações limpas e bem iluminadas de texto impresso em fontes comuns e tamanhos típicos. A execução do OCR em um PDF digitalizado adiciona uma camada de texto oculta atrás de cada imagem da página que contém os caracteres reconhecidos. Após a conclusão do OCR, você poderá pesquisar texto no documento e, na maioria dos editores de PDF, editar o texto reconhecido como se fosse originalmente nativo.

A qualidade da saída do OCR depende da qualidade das imagens digitalizadas. Uma digitalização de alta resolução a 300 DPI com iluminação uniforme, páginas planas e foco nítido produz uma precisão de OCR acima de 99% para texto impresso padrão. Uma digitalização de baixa resolução a 150 DPI com sombras, páginas curvas de um livro encadernado ou áreas fora de foco produz menor precisão e requer mais correção manual após o OCR. Digitalizar documentos com OCR em mente, ou seja, páginas planas, boa iluminação e resolução adequada, torna o processo de edição significativamente mais suave.

A maioria dos editores de PDF que suportam OCR inclui a seleção de idioma como parte das configurações de reconhecimento. A seleção do idioma correto melhora a precisão porque o mecanismo de OCR usa dicionários específicos do idioma e dados de frequência de caracteres para resolver caracteres ambíguos. Um documento em francês reconhecido com a configuração do idioma francês produz melhores resultados do que o mesmo documento reconhecido com a configuração do idioma inglês. Para documentos multilíngues, selecione o idioma principal e corrija manualmente quaisquer erros nas passagens do idioma secundário.

A ferramenta OCR PDF de WukongPDF processa documentos digitalizados no navegador e retorna um PDF com uma camada de texto pesquisável e editável. O mecanismo OCR oferece suporte a vários idiomas e lida com tipos de documentos comuns, incluindo cartas, formulários, recibos e artigos. Após o OCR, o PDF digitalizado anteriormente não editável torna-se editável, com o texto reconhecido disponível para seleção, pesquisa e modificação.

Abordagens alternativas quando a edição direta de PDF não é possível

Quando um PDF não pode ser editado diretamente, seja porque é um documento digitalizado sem acesso ao OCR ou porque tem restrições de segurança que você não pode remover, fluxos de trabalho alternativos permitem obter o mesmo resultado por um caminho diferente. Converta o PDF em um formato editável como Word ou Google Docs, faça alterações nesse formato e converta o documento editado novamente em PDF. A viagem de ida e volta através de um formato editável leva mais tempo do que a edição direta, mas funciona para qualquer PDF que possa ser aberto e visualizado.

Para documentos que precisam apenas de pequenas correções, como corrigir um erro de digitação em um único parágrafo, usar as ferramentas de anotação do PDF para cobrir o texto incorreto com um retângulo branco e digitar o texto corrigido na parte superior é uma solução pragmática. Este método não edita verdadeiramente o texto subjacente e a estrutura do documento, portanto a correção baseada em anotações é invisível para ferramentas de pesquisa e acessibilidade, mas para correções visuais rápidas em um documento que será impresso ou visualizado como uma imagem, produz resultados aceitáveis.

Para documentos que exigem edição extensa e não podem ser editados diretamente, a abordagem mais confiável é retornar ao documento de origem original, se estiver disponível.

O documento Word, Google Doc ou arquivo InDesign usado para criar o PDF contém texto editável que pode ser modificado e reexportado para um novo PDF. Entrar em contato com o criador do documento para obter o arquivo de origem ou localizar o arquivo de origem em seus próprios registros costuma ser mais rápido do que lutar para editar um PDF não cooperativo.

Alguns PDFs que parecem conter texto nativo, na verdade, têm o texto armazenado de uma forma que as ferramentas de edição não podem modificar, mesmo que o texto seja pesquisável e selecionável. Essa situação ocorre quando um PDF tem uma camada de texto correta, que permite pesquisa e seleção, mas a codificação de fonte subjacente impede que a ferramenta de edição mapeie os caracteres editados de volta aos glifos visuais corretos. A ferramenta de edição pode ler o texto, mas não pode gravar alterações no documento sem corromper potencialmente o mapeamento de caracteres. Esta defesa contra a edição às vezes é intencional por parte do criador do documento.

A proliferação de ferramentas de edição de PDF tornou mais fácil do que nunca a edição de PDFs, mas também criou confusão sobre o que constitui edição. Adicionar uma anotação de texto no topo de uma página PDF não é o mesmo que editar o texto subjacente. Substituir uma imagem em uma página PDF não é o mesmo que editar o texto que descreve a imagem. Compreender a diferença entre alterações baseadas em anotações, que sobrepõem novo conteúdo na página existente, e edição de texto real, que modifica o conteúdo real do texto dentro da estrutura do PDF, ajuda você a escolher a ferramenta certa e a abordagem certa para cada tarefa de edição.

Para documentos que resistem a todas as tentativas de edição e contêm informações críticas para atualização, a opção nuclear é recriar o documento do zero. Utilize o PDF como referência visual e redigite o conteúdo em um processador de texto ou aplicativo de design, fazendo suas edições durante o processo de recriação. Essa abordagem exige muito trabalho, mas produz um documento limpo e totalmente editável, sem problemas residuais de formatação, problemas de fonte ou artefatos de conversão. Recriar um documento a partir de um PDF leva um tempo proporcional ao tamanho e à complexidade do documento e, para documentos curtos que precisam de edição significativa, pode ser mais rápido do que lidar com ferramentas de edição de PDF não cooperativas.

WukongPDF

Experimente Editar PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →