Tips & Tricks

Como dividir um PDF em lote digitalizado para que cada documento físico se torne seu próprio arquivo separado

Você coloca uma pilha de cinquenta faturas em um scanner de documentos com alimentador automático de documentos. O scanner produz um único PDF contendo todas as cinquenta páginas em sequência. Agora você precisa de cada fatura como um arquivo PDF separado nomeado pelo número da fatura. Dividir manualmente um PDF de cinquenta páginas em cinquenta arquivos individuais, abrir cada um deles e salvá-los com o nome correto, leva uma hora de trabalho tedioso. Uma ferramenta de divisão em lote que detecta limites de documentos e nomeia os arquivos de saída faz automaticamente o mesmo trabalho em segundos.

O desafio Split PDF com lotes digitalizados é que o scanner vê páginas individuais, não documentos individuais. Uma fatura de dez páginas se parece exatamente com dez faturas separadas de uma página para o scanner. A ferramenta de divisão deve analisar o conteúdo da página para determinar onde termina um documento e começa o próximo. Esta análise utiliza padrões de conteúdo de página, páginas separadoras em branco, códigos de barras ou contagens de páginas consistentes para identificar os limites do documento.

How to Split a Scanned Batch PDF So Each Physical Document Becomes Its Own Separate File

Como os scanners em lote produzem PDFs com vários documentos

Os alimentadores automáticos de documentos processam as páginas sequencialmente. Cada página passa pelo scanner e é anexada a um único PDF de saída. O scanner não sabe nem se importa que as páginas de um a três sejam a fatura A, as páginas de quatro a cinco sejam a fatura B e as páginas de seis a oito sejam a fatura C. Ele apenas produz as páginas de um a oito em um único arquivo.

Alguns scanners suportam folhas separadoras, páginas em branco inseridas entre documentos que sinalizam ao scanner para iniciar um novo PDF. Mas a maioria dos fluxos de trabalho de digitalização ignora as folhas separadoras porque elas retardam o processo de digitalização. O resultado é um único arquivo PDF Lote contendo vários documentos concatenados.

Este método transforma horas de trabalho manual em segundos de processamento automatizado.

O problema aumenta com a digitalização frente e verso. Um documento de dez páginas digitalizado duplex produz vinte páginas PDF, com cada página física se tornando duas páginas PDF. A ferramenta de divisão deve compreender que as páginas um e dois pertencem ao mesmo documento, mesmo que apareçam como páginas PDF separadas.

WukongPDF

Experimente dividir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →

Métodos para detectar limites de documentos em lotes digitalizados

A consistência da contagem de páginas é o método de detecção mais simples. Se todos os documentos do lote tiverem o mesmo número de páginas, a ferramenta de divisão dividirá a contagem total de páginas pela contagem de páginas do documento e dividirá nesses limites. As faturas do mesmo fornecedor geralmente têm contagens de páginas consistentes. Este método não requer análise de conteúdo.

A detecção de páginas em branco identifica páginas separadoras que foram inseridas intencionalmente entre documentos. Uma página em branco no lote digitalizado sinaliza o limite do documento. A ferramenta de divisão remove as páginas separadoras em branco e divide as páginas restantes em documentos individuais nas posições das páginas em branco.

A detecção de padrões de conteúdo é o método mais sofisticado. A ferramenta de divisão procura padrões recorrentes que indicam o início de um novo documento. Uma fatura normalmente começa com o logotipo do fornecedor, endereço e número da fatura. Um formulário começa com um campo de título e data. Um relatório começa com uma página de rosto. A ferramenta identifica esses padrões e marca cada ocorrência como um limite do documento.

A detecção de código de barras identifica páginas separadoras com códigos de barras impressos. Um código de barras no topo da primeira página de cada documento codifica o ID do documento. A ferramenta de divisão lê o código de barras, nomeia o arquivo de saída com o valor codificado e divide a cada ocorrência do código de barras. Este método é popular no processamento de documentos jurídicos, de saúde e financeiros.

Usando ferramentas de divisão com recursos de detecção de documentos

WukongPDF fornece processamento de PDF digitalizado por meio do navegador, incluindo a capacidade de dividir lotes digitalizados de vários documentos em arquivos individuais. A ferramenta de divisão pode detectar limites de documentos usando padrões de conteúdo ou contagens de páginas específicas.

Before splitting, preview the batch to verify the page order and orientation. As páginas que foram digitalizadas de cabeça para baixo ou fora de ordem produzirão arquivos de saída ordenados incorretamente. A maioria das ferramentas de divisão inclui uma visualização de página e função de reordenação para corrigir erros de digitalização antes da divisão.

Configure a nomenclatura do arquivo de saída com base no conteúdo detectado. Se a ferramenta de divisão puder ler o número da fatura ou o ID do documento na primeira página de cada documento, use esse valor como nome do arquivo de saída. Se a nomenclatura baseada em conteúdo não estiver disponível, use numeração sequencial com um prefixo descritivo.

Verificando a precisão da divisão

Após a divisão, verifique os primeiros e os últimos arquivos de saída. Abra o primeiro arquivo de saída e confirme se ele contém as páginas corretas. Abra o último arquivo de saída e confirme se ele contém as páginas finais do lote. Verifique um arquivo no meio do lote. Essas verificações detectam erros de detecção de limites antes que os arquivos sejam distribuídos.

Compare a contagem total de páginas de todos os arquivos de saída com a contagem de páginas do lote original. Se a soma corresponder, cada página foi atribuída a um arquivo de saída. Se a soma for menor, as páginas foram perdidas durante a divisão. Se a soma for maior, as páginas foram duplicadas.

Lotes onde os limites do documento são ambíguos executam a divisão com configurações conservadoras que exigem evidências de limite mais fortes. Uma divisão conservadora pode deixar alguns documentos combinados em vez de dividir incorretamente um único documento em vários arquivos. Os documentos combinados podem ser divididos manualmente com menor risco do que fragmentos de um único documento.

Automatizando o fluxo de trabalho de divisão e nome

Para digitalização e divisão recorrentes em lote, automatize o fluxo de trabalho. Salve as configurações de divisão, o método de detecção de limite e a convenção de nomenclatura de saída como um perfil. Cada lote subsequente é processado com o mesmo perfil, produzindo resultados consistentes. O tempo de configuração inicial é recuperado após o segundo lote.

Integre a saída dividida com sistemas de gerenciamento de documentos configurando a nomenclatura da saída para corresponder ao formato esperado do sistema. Um ID de documento extraído durante a divisão que corresponda à convenção de nomenclatura do sistema de gerenciamento de documentos permite a ingestão automática sem renomeação manual.

A separação de documentos em lotes digitalizados é uma necessidade comum em setores que processam documentos em papel em grande volume: processos de saúde processam registros de pacientes, processos jurídicos, arquivos de casos, processos contábeis, faturas e processos governamentais. Cada setor tem seus próprios tipos de documentos, contagens de páginas e padrões de limites.

As folhas separadoras de código de barras são o método mais confiável para operações de digitalização de alto volume. Imprima uma folha de código de barras do sistema de gerenciamento de documentos, coloque-a em cima de cada documento antes de digitalizá-la e a ferramenta de divisão lê o código de barras para identificar os limites do documento e nomear os arquivos de saída. O código de barras elimina a ambiguidade sobre onde os documentos começam e terminam.

O reconhecimento óptico de marcas pode identificar caixas de seleção ou círculos preenchidos na primeira página de cada documento que indicam o tipo ou prioridade do documento. A ferramenta de divisão lê essas marcas e encaminha documentos para diferentes pastas de saída com base no tipo reconhecido.

A precisão da separação automatizada de documentos deve ser medida e monitorada. Um lote de 500 documentos com 99% de precisão de separação ainda produz 5 documentos mal divididos que necessitam de correção manual. Acompanhe a taxa de erros ao longo do tempo para identificar tipos de documentos ou condições de digitalização que produzem taxas de erros mais altas.

Para lotes em que os limites do documento são inconsistentes, uma etapa de revisão humana entre a digitalização e a divisão detecta erros de limite que a detecção automatizada falha. O revisor examina o lote em um visualizador de páginas, confirma ou ajusta os limites detectados e, em seguida, aciona a divisão automatizada.

O formato do arquivo de saída após a divisão pode incluir PDF/A para arquivamento, PDF compactado para distribuição ou TIFF para processamento adicional de imagem. Configure o formato de saída com base no uso posterior dos documentos separados.

A integração do fluxo de trabalho dividido com um sistema de gerenciamento de documentos cria um fluxo contínuo do papel ao arquivo pesquisável. O scanner produz um PDF em lote, o divisor o separa em documentos individuais, o OCR os torna pesquisáveis e o sistema de gerenciamento de documentos os indexa para recuperação.

Os serviços divididos baseados em nuvem oferecem os mesmos recursos das ferramentas de desktop com a vantagem de acessibilidade em qualquer dispositivo. O lote PDF digitalizado é carregado, processado e os documentos individuais são retornados como arquivos separados. Considerações sobre privacidade de dados se aplicam ao usar serviços em nuvem para documentos confidenciais.

A convenção de nomenclatura para arquivos de saída divididos deve ser consistente e classificável. Um formato como AAAA-MM-DD_DocumentType_SequentialNumber produz nomes de arquivos que são classificados cronologicamente e agrupados por tipo de documento. A nomenclatura consistente permite o processamento automatizado por sistemas downstream.

Ao dividir lotes que contêm tipos de documentos mistos, a ferramenta de divisão pode rotear diferentes tipos de documentos para diferentes pastas de saída com base no reconhecimento de conteúdo. As faturas vão para a pasta Contábil, os contratos vão para a pasta Jurídico e as correspondências vão para a pasta Registros.

A resolução das páginas digitalizadas afeta a precisão do OCR se o OCR for executado nos documentos divididos. Digitalize com no mínimo 300 DPI documentos que serão processados por OCR após a divisão.

Algumas ferramentas de divisão podem gerar um arquivo de manifesto junto com a saída dividida. O manifesto lista cada nome de arquivo de saída, o intervalo de páginas de origem e quaisquer metadados extraídos durante a divisão. O manifesto oferece suporte à garantia de qualidade e rastreamento de documentos.

A economia de tempo com a divisão automatizada de lotes em comparação com a divisão manual é proporcional ao tamanho do lote. Um lote de 50 documentos divididos manualmente requer aproximadamente 50 minutos de trabalho repetitivo. A divisão automatizada do mesmo lote requer aproximadamente 30 segundos de configuração e tempo de processamento.

A resolução da digitalização afeta a precisão da divisão e a qualidade do documento de saída. Digitalizações de resolução mais alta produzem texto mais claro que melhora a detecção de limites baseada em conteúdo. A desvantagem são tamanhos de arquivo maiores durante o processamento. Para fins de divisão, 200 DPI geralmente são suficientes para uma detecção precisa de limites.

Método de detecçãoComo funcionaMelhor paraPrecisão
Consistência de contagem de páginasDivida o total de páginas pelo comprimento conhecido do documentoDocumentos uniformes da mesma fonteAlto para contagens de páginas conhecidas
Detecção de página em brancoIdentifique páginas separadoras vaziasLotes digitalizados com separadoresAlto se as páginas em branco estiverem realmente vazias
Padrão de conteúdoReconhecer padrões de cabeçalho recorrentesFaturas, formulários, relatóriosMédio-Alto; depende da consistência do padrão
Reconhecimento de código de barrasLeia o código de barras na primeira página de cada documentoDocumentos de saúde, jurídicos e financeirosMuito alto; código de barras é inequívoco
WukongPDF

Experimente dividir PDF

Nenhuma instalação necessária. Funciona diretamente no seu navegador.

Começar agora →