Tips & Tricks

Jak podzielić zeskanowany plik PDF wsadowy, aby każdy dokument fizyczny stał się osobnym plikiem

Umieszczasz stos pięćdziesięciu faktur na skanerze dokumentów z automatycznym podajnikiem dokumentów. Skaner generuje pojedynczy plik PDF zawierający wszystkie pięćdziesiąt stron po kolei. Teraz potrzebujesz każdej faktury jako osobnego pliku PDF nazwanego numerem faktury. Ręczne podzielenie pięćdziesięciostronicowego pliku PDF na pięćdziesiąt pojedynczych plików, otwarcie każdego z nich i zapisanie pod prawidłową nazwą zajmuje godzinę żmudnej pracy. Narzędzie do dzielenia wsadowego, które wykrywa granice dokumentów i nadaje nazwy plikom wyjściowym, automatycznie wykonuje to samo zadanie w ciągu kilku sekund.

Wyzwanie Split PDF w przypadku zeskanowanych partii polega na tym, że skaner widzi pojedyncze strony, a nie pojedyncze dokumenty. Dziesięciostronicowa faktura wygląda w skanerze dokładnie tak samo, jak dziesięć oddzielnych jednostronicowych faktur. Narzędzie podziału musi analizować zawartość strony, aby określić, gdzie kończy się jeden dokument, a zaczyna następny. W tej analizie do identyfikacji granic dokumentu wykorzystuje się wzorce zawartości stron, puste strony oddzielające, kody kreskowe lub stałą liczbę stron.

How to Split a Scanned Batch PDF So Each Physical Document Becomes Its Own Separate File

Jak skanery wsadowe tworzą pliki PDF zawierające wiele dokumentów

Automatyczne podajniki dokumentów przetwarzają strony sekwencyjnie. Każda strona przechodzi przez skaner i jest dołączana do pojedynczego wyjściowego pliku PDF. Skaner nie wie i nie przejmuje się tym, że strony od pierwszej do trzeciej to faktura A, strony od czwartej do piątej to faktura B, a strony od szóstej do ósmej to faktura C. Po prostu tworzy strony od pierwszej do ósmej w jednym pliku.

Niektóre skanery obsługują arkusze separujące, czyli puste strony wstawiane pomiędzy dokumentami, które sygnalizują skanerowi konieczność rozpoczęcia tworzenia nowego pliku PDF. Jednak w większości procesów skanowania pomijane są arkusze separujące, ponieważ spowalniają one proces skanowania. Rezultatem jest pojedynczy plik PDF Batch zawierający wiele połączonych ze sobą dokumentów.

Ta metoda zamienia godziny ręcznej pracy w sekundy zautomatyzowanego przetwarzania.

Problem pogłębia się w przypadku skanowania dwustronnego. W przypadku dziesięciostronicowego dokumentu zeskanowanego dwustronnie powstaje dwadzieścia stron PDF, przy czym każda strona fizyczna staje się dwiema stronami PDF. Narzędzie podziału musi rozumieć, że strony pierwsza i druga należą do tego samego dokumentu, nawet jeśli pojawiają się jako osobne strony PDF.

WukongPDF

Wypróbuj opcję Podziel plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Metody wykrywania granic dokumentów w skanowanej partii

Spójność liczby stron to najprostsza metoda wykrywania. Jeśli każdy dokument w partii ma tę samą liczbę stron, narzędzie podziału dzieli całkowitą liczbę stron przez liczbę stron dokumentu i dzieli według tych granic. Faktury od tego samego dostawcy często mają stałą liczbę stron. Metoda ta nie wymaga analizy treści.

Wykrywanie pustych stron identyfikuje strony oddzielające, które zostały celowo wstawione pomiędzy dokumentami. Pusta strona w zeskanowanej partii sygnalizuje granicę dokumentu. Narzędzie podziału usuwa puste strony oddzielające i dzieli pozostałe strony na poszczególne dokumenty w miejscach pustych stron.

Wykrywanie wzorców treści jest najbardziej wyrafinowaną metodą. Narzędzie podziału wyszukuje powtarzające się wzorce wskazujące początek nowego dokumentu. Faktura zazwyczaj zaczyna się od logo dostawcy, adresu i numeru faktury. Formularz zaczyna się od pola tytułu i daty. Raport zaczyna się od strony tytułowej. Narzędzie identyfikuje te wzorce i zaznacza każde wystąpienie jako granicę dokumentu.

Wykrywanie kodów kreskowych identyfikuje strony separujące z wydrukowanymi kodami kreskowymi. Kod kreskowy u góry pierwszej strony każdego dokumentu koduje identyfikator dokumentu. Narzędzie podziału odczytuje kod kreskowy, nadaje plikowi wyjściowemu nazwę zakodowanej wartości i dzieli przy każdym wystąpieniu kodu kreskowego. Metoda ta jest popularna w przetwarzaniu dokumentów związanych z opieką zdrowotną, prawem i finansami.

Korzystanie z narzędzi podziału z możliwością wykrywania dokumentów

WukongPDF umożliwia przetwarzanie zeskanowanego pliku PDF za pośrednictwem przeglądarki, łącznie z możliwością dzielenia zeskanowanych partii wielu dokumentów na pojedyncze pliki. Narzędzie podziału może wykrywać granice dokumentu na podstawie wzorców treści lub określonej liczby stron.

Przed podziałem wyświetl podgląd partii, aby sprawdzić kolejność i orientację stron. Strony zeskanowane do góry nogami lub w niewłaściwej kolejności spowodują utworzenie plików wyjściowych o nieprawidłowej kolejności. Większość narzędzi podziału obejmuje podgląd strony i funkcję zmiany kolejności w celu skorygowania błędów skanowania przed podziałem.

Skonfiguruj nazewnictwo plików wyjściowych na podstawie wykrytej zawartości. Jeśli narzędzie podziału może odczytać numer faktury lub identyfikator dokumentu z pierwszej strony każdego dokumentu, użyj tej wartości jako nazwy pliku wyjściowego. Jeśli nazewnictwo oparte na treści nie jest dostępne, użyj numeracji sekwencyjnej z opisowym przedrostkiem.

Weryfikacja dokładności podziału

Po podzieleniu sprawdź kilka pierwszych i kilka ostatnich plików wyjściowych. Otwórz pierwszy plik wyjściowy i potwierdź, że zawiera prawidłowe strony. Otwórz ostatni plik wyjściowy i potwierdź, że zawiera ostatnie strony wsadu. Sprawdź plik ze środka partii. Kontrole te wychwytują błędy wykrywania granic przed dystrybucją plików.

Porównaj całkowitą liczbę stron wszystkich plików wyjściowych z pierwotną liczbą stron wsadowych. Jeśli suma się zgadza, każda strona została przypisana do pliku wyjściowego. Jeśli suma jest niższa, strony zostały utracone podczas podziału. Jeżeli suma jest większa, oznacza to, że strony zostały zduplikowane.

W przypadku partii, w których granice dokumentu są niejednoznaczne, należy przeprowadzić podział przy użyciu konserwatywnych ustawień, które wymagają silniejszego potwierdzenia granic. Konserwatywny podział może spowodować połączenie niektórych dokumentów zamiast nieprawidłowego podziału pojedynczego dokumentu na wiele plików. Połączone dokumenty można dzielić ręcznie przy mniejszym ryzyku niż fragmenty pojedynczego dokumentu.

Automatyzacja przepływu pracy typu „Podziel i nazwij”.

W przypadku powtarzającego się skanowania wsadowego i dzielenia można zautomatyzować przepływ pracy. Zapisz ustawienia podziału, metodę wykrywania granic i konwencję nazewnictwa wyników jako profil. Każda kolejna partia jest przetwarzana według tego samego profilu, co zapewnia spójne wyniki. Początkowy czas konfiguracji zostaje odzyskany po drugiej partii.

Zintegruj podzielone dane wyjściowe z systemami zarządzania dokumentami, konfigurując nazewnictwo wyników tak, aby pasowało do oczekiwanego formatu systemu. Identyfikator dokumentu wyodrębniony podczas podziału, zgodny z konwencją nazewnictwa systemu zarządzania dokumentami, umożliwia automatyczne pozyskiwanie bez ręcznej zmiany nazwy.

Separacja dokumentów w zeskanowanych partiach jest powszechną potrzebą w branżach przetwarzających masowo dokumenty papierowe: opieka zdrowotna przetwarza dokumentację pacjentów, procesy prawne, akta spraw, procesy księgowe, faktury i wnioski rządowe. Każda branża ma własne typy dokumentów, liczbę stron i wzorce granic.

Arkusze oddzielające kody kreskowe to najbardziej niezawodna metoda w przypadku operacji skanowania o dużej objętości. Wydrukuj arkusz kodu kreskowego z systemu zarządzania dokumentami, umieść go na każdym dokumencie przed skanowaniem, a narzędzie podziału odczyta kod kreskowy w celu zidentyfikowania granic dokumentu i nazwania plików wyjściowych. Kod kreskowy eliminuje niejasności co do tego, gdzie zaczyna się i kończy dokument.

Optyczne rozpoznawanie znaków umożliwia identyfikację pól wyboru lub wypełnionych kółek na pierwszej stronie każdego dokumentu, które wskazują typ dokumentu lub jego priorytet. Narzędzie podziału odczytuje te znaczniki i kieruje dokumenty do różnych folderów wyjściowych w zależności od rozpoznanego typu.

Należy mierzyć i monitorować dokładność automatycznej separacji dokumentów. W partii 500 dokumentów z dokładnością separacji na poziomie 99% nadal powstaje 5 błędnie podzielonych dokumentów, które wymagają ręcznej korekty. Śledź poziom błędów w czasie, aby zidentyfikować typy dokumentów lub warunki skanowania, które powodują wyższy poziom błędów.

W przypadku partii, w których granice dokumentów są niespójne, etap przeglądu ręcznego między skanowaniem a dzieleniem wychwytuje błędy granic, które pomija automatyczne wykrywanie. Recenzent skanuje partię w przeglądarce stron, potwierdza lub dostosowuje wykryte granice, a następnie uruchamia automatyczny podział.

Format pliku wyjściowego po podziale może obejmować format PDF/A do archiwizacji, skompresowany plik PDF do dystrybucji lub TIFF do dalszego przetwarzania obrazu. Skonfiguruj format wyjściowy w oparciu o dalsze wykorzystanie oddzielnych dokumentów.

Integracja podzielonego przepływu pracy z systemem zarządzania dokumentami umożliwia płynne przejście od wersji papierowej do archiwum z możliwością przeszukiwania. Skaner generuje wsadowy plik PDF, moduł rozdzielający dzieli go na poszczególne dokumenty, OCR umożliwia ich przeszukiwanie, a system zarządzania dokumentami indeksuje je w celu pobrania.

Usługi podzielone w chmurze oferują te same możliwości, co narzędzia stacjonarne, z zaletą dostępności z dowolnego urządzenia. Zeskanowany wsadowy plik PDF jest przesyłany, przetwarzany, a poszczególne dokumenty zwracane w postaci oddzielnych plików. W przypadku korzystania z usług w chmurze w przypadku poufnych dokumentów obowiązują zasady ochrony danych.

Konwencja nazewnictwa podzielonych plików wyjściowych powinna być spójna i możliwa do sortowania. Format taki jak RRRR-MM-DD_DocumentType_SequentialNumber tworzy nazwy plików sortowane chronologicznie i grupowane według typu dokumentu. Spójne nazewnictwo umożliwia automatyczne przetwarzanie przez kolejne systemy.

Podczas dzielenia partii zawierających mieszane typy dokumentów narzędzie podziału może kierować różne typy dokumentów do różnych folderów wyjściowych w oparciu o rozpoznawanie zawartości. Faktury trafiają do folderu Księgowość, umowy do folderu Prawne, a korespondencja trafia do folderu Ewidencja.

Rozdzielczość zeskanowanych stron wpływa na dokładność OCR, jeśli OCR zostanie uruchomiony na podzielonych dokumentach. Skanuj w rozdzielczości co najmniej 300 DPI w przypadku dokumentów, które po podzieleniu zostaną przetworzone przez OCR.

Niektóre narzędzia podziału mogą generować plik manifestu wraz z podzielonymi danymi wyjściowymi. Manifest zawiera listę każdej nazwy pliku wyjściowego, zakresu stron źródłowych i wszelkich metadanych wyodrębnionych podczas podziału. Manifest wspiera zapewnienie jakości i śledzenie dokumentów.

Oszczędność czasu wynikająca z automatycznego podziału partii w porównaniu z podziałem ręcznym jest proporcjonalna do wielkości partii. Partia 50 dokumentów rozdzielona ręcznie wymaga około 50 minut powtarzalnej pracy. Automatyczne dzielenie tej samej partii wymaga około 30 sekund czasu konfiguracji i przetwarzania.

Rozdzielczość skanowania wpływa zarówno na dokładność podziału, jak i jakość dokumentu wyjściowego. Skany o wyższej rozdzielczości zapewniają wyraźniejszy tekst, co poprawia wykrywanie granic na podstawie zawartości. Kompromisem są większe rozmiary plików podczas przetwarzania. Do celów podziału zwykle wystarcza rozdzielczość 200 DPI, aby dokładnie wykryć granicę.

Metoda wykrywaniaJak to działaNajlepsze dlaDokładność
Spójność liczby stronPodziel całkowitą liczbę stron przez znaną długość dokumentuJednolite dokumenty z tego samego źródłaWysoka dla znanej liczby stron
Wykrywanie pustej stronyZidentyfikuj puste strony oddzielająceZeskanowane partie z separatoramiWysoki, jeśli puste strony są naprawdę puste
Wzór treściRozpoznaj powtarzające się wzorce nagłówkówFaktury, formularze, raportyŚrednio-wysoki; zależy od spójności wzoru
Rozpoznawanie kodów kreskowychPrzeczytaj kod kreskowy na pierwszej stronie każdego dokumentuDokumenty dotyczące opieki zdrowotnej, prawne i finansoweBardzo wysoki; kod kreskowy jest jednoznaczny
WukongPDF

Wypróbuj opcję Podziel plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →