Tips & Tricks

Como dividir um PDF e salvar cada página com um nome de arquivo personalizado diferente

A divisão de um PDF de 50 páginas em páginas individuais produz 50 arquivos denominados page-1.pdf a page-50.pdf. Os nomes são tecnicamente precisos pela posição física da página e completamente inúteis pelo conteúdo. A página 7 pode conter o contrato Smith com assinatura e condições de pagamento. A página 23 pode ser a fatura de Jones com itens de linha e total. Renomear todos os 50 arquivos abrindo cada um individualmente para descobrir o que ele contém e, em seguida, digitando um nome de arquivo descritivo, leva quase tanto tempo quanto a divisão do PDF e apresenta o risco de erros de nomenclatura que tornam os arquivos impossíveis de serem encontrados posteriormente.

A operação de divisão real leva segundos. O trabalho de renomeação a seguir leva minutos ou horas, dependendo da contagem de arquivos e se você possui um método para derivar nomes do conteúdo. Automatizar a etapa de nomenclatura é o que transforma a divisão de PDF de uma tarefa tediosa em um fluxo de trabalho realmente eficiente.

Dividir um Dividir PDF e salvar cada arquivo com um nome personalizado significativo significa configurar um padrão de nomenclatura antes da divisão que deriva nomes da estrutura do documento, como marcadores, ou usar uma ferramenta de renomeação em lote após a divisão que lê o texto de cada arquivo e gera um nome descritivo do conteúdo. As ferramentas de divisão PDF Pages de WukongPDF suportam nomenclatura personalizada com base no texto do marcador, e os métodos abaixo cobrem tanto a abordagem estruturada pré-divisão quanto a abordagem pós-divisão de extração de conteúdo.

How to Split a PDF and Save Each Page With a Different Custom File Name

Derivar nomes de arquivos da estrutura do documento antes da divisão

Quando o PDF tem uma hierarquia de marcadores bem organizada, onde cada marcador de nível superior corresponde a uma seção lógica com um título descritivo, a divisão baseada em marcadores produz arquivos de saída que herdam automaticamente o texto do marcador como seu nome de arquivo. Um PDF de relatórios mensais de clientes em que cada marcador de nível superior é um nome de cliente dividido em arquivos com os nomes de cada cliente, Smith-Corp.pdf, Jones-LLC.pdf, Acme-Inc.pdf, sem nenhuma renomeação manual. O texto do marcador deve ser seguro para o sistema de arquivos, o que significa que não pode conter caracteres que os sistemas operacionais proíbem em nomes de arquivos, como dois pontos, barras, barras invertidas, asteriscos ou pontos de interrogação.

Quando marcadores estiverem presentes, mas seu texto não for adequado como nome de arquivo, for muito longo, contiver caracteres inválidos ou usar formatação inconsistente, edite o texto do marcador antes de dividi-lo. No Adobe Acrobat, abra o painel Marcadores, clique com o botão direito em cada marcador, selecione Renomear e digite o nome do arquivo desejado. A etapa de edição dos marcadores leva alguns minutos para um documento com dezenas de seções, mas o tempo investido em marcadores limpos é recompensado instantaneamente quando a operação de divisão produz arquivos com nomes perfeitos, sem nenhuma intervenção adicional.

WukongPDF

Experimente dividir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Extração de nomes baseados em conteúdo após divisão com nomes genéricos

Quando a nomenclatura baseada em marcadores não estiver disponível porque o PDF não possui marcadores ou o texto do marcador não captura identificadores de conteúdo significativos, primeiro divida o documento com nomes sequenciais genéricos e, em seguida, renomeie cada arquivo de saída com base no texto extraído de seu conteúdo. Uma ferramenta de renomeação em lote ou um script Python lê as primeiras linhas de texto da primeira página de cada arquivo dividido, procura um padrão conhecido, como um nome de cliente que aparece após o rótulo Cliente: ou um número de fatura após o número da fatura, e usa o texto correspondente como o novo nome de arquivo.

A abordagem de extração de conteúdo funciona melhor para documentos estruturados onde cada seção dividida compartilha um formato consistente com a identificação do texto em uma posição previsível. Uma pasta de faturas mensais onde a primeira linha de cada página diz Fatura # seguida por um número e a segunda linha diz Cliente: seguida por um nome pode ser renomeada em lote por um script que extrai ambos os campos e constrói um nome de arquivo como Fatura-1234-Acme-Corp.pdf. O script aplica a mesma lógica de extração e nomenclatura a todos os arquivos do lote, eliminando o tempo e a taxa de erros da renomeação manual.

Criando scripts do fluxo de trabalho de divisão e nome para tarefas recorrentes

Um trabalho dividido e nomeado que se repete de acordo com uma programação, a mesma estrutura de relatório mensal dividida nas mesmas seções nomeadas para a mesma lista de distribuição a cada mês, justifica a construção de um script permanente em vez de repetir o processo manual a cada ciclo. Grave os intervalos de páginas e os nomes dos arquivos de saída correspondentes em um arquivo de configuração uma vez. O script lê a configuração, divide o PDF de acordo com os intervalos especificados e nomeia cada arquivo de saída com seu nome designado. A cada mês, atualize apenas o nome do arquivo PDF de entrada na configuração. O script lida com todo o resto de forma idêntica em cada ciclo.

Controle de versão do script e do arquivo de configuração. Quando a estrutura do relatório for alterada, uma seção for adicionada, removida ou reorganizada, atualize a configuração para corresponder. A lógica do script permanece constante. Essa separação da lógica de processamento, capturada no script, dos dados específicos do documento, capturados na configuração, torna o fluxo de trabalho sustentável ao longo do tempo. A pessoa que executa a divisão mensal não precisa entender ou modificar o script. Eles editam o arquivo de configuração simples e executam o script.

Método de nomenclaturaPré-requisitosCiente de conteúdo?Melhor para
Divisão baseada em favoritosMarcadores bem estruturados com texto limpoSim, nomes derivados da estrutura do documentoDocumentos com hierarquias de títulos
Script de extração de conteúdoPadrões de texto consistentes em cada seçãoSim, nomes derivados do conteúdo do documentoFormulários estruturados, faturas, relatórios
Divisão e nome com scriptArquivo de configuração com intervalos e nomesSim, totalmente personalizávelTrabalhos recorrentes de estrutura idêntica

Tratamento de conflitos de nome de arquivo e caracteres inválidos

Duas páginas ou seções divididas que produzem o mesmo nome extraído, duas faturas do mesmo cliente sem número distintivo, criam um conflito de nome de arquivo onde o segundo arquivo não pode ser salvo porque já existe um arquivo com esse nome. Resolva conflitos anexando um sufixo diferenciador, um número de sequência, uma data ou qualquer campo que distinga os dois documentos. Invoice-1234-Acme-Corp.pdf e Invoice-1235-Acme-Corp.pdf são diferenciados pelo número da fatura. Quando nenhum campo distintivo estiver disponível, anexe um contador de sequência: Acme-Corp-1.pdf e Acme-Corp-2.pdf.

O texto extraído usado como nomes de arquivos deve ser limpo de caracteres proibidos pelo sistema operacional. Remova ou substitua dois pontos, barras, barras invertidas, asteriscos, pontos de interrogação, colchetes angulares e barras verticais por hífens ou sublinhados. Apare espaços e pontos iniciais e finais. A etapa de limpeza é mundana, mas essencial. Um nome de arquivo não limpo que contém um caractere ilegal faz com que a operação de renomeação falhe com um erro do sistema operacional, e diagnosticar qual dos 50 arquivos desencadeou a falha é muito mais demorado do que limpar todos os nomes de arquivos preventivamente.

WukongPDF

Experimente dividir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →