Masz stos wydruków, który ktoś zaznaczył długopisem, a także kilka stron napisanych bezpośrednio w Dokumentach Google. Musisz połączyć wszystko w jeden plik PDF, który wygląda profesjonalnie i spójnie. Zeskanowane strony to płaskie fotografie papieru. Strony cyfrowe zawierają tekst na żywo. Czy te dwa zasadniczo różne typy treści PDF mogą współistnieć w jednym dokumencie? Krótka odpowiedź brzmi: tak, ale to, jak dobrze współistnieją, zależy od tego, jak podejdziesz do połączenia.
To nie jest niezwykły scenariusz. Badanie przeprowadzone w 2024 r. przez Association for Information and Image Management wykazało, że 42% organizacji w swoich codziennych przepływach pracy nadal regularnie korzysta z kombinacji zeskanowanych i utworzonych cyfrowo dokumentów (AIIM, „State of Intelligent Information Management”, 2024). Hybrydowe pliki PDF, czyli dokumenty zawierające zarówno strony zeskanowanych obrazów, jak i cyfrowe strony tekstowe, są codziennością w kancelariach prawnych, firmach księgowych, agencjach nieruchomości i na wydziałach akademickich.

Co wyróżnia strony zeskanowane i strony cyfrowe w pliku PDF
Aby zrozumieć, dlaczego łączenie stron zeskanowanych i cyfrowych wymaga pewnej ostrożności, warto wiedzieć, co faktycznie zawiera każdy typ strony na poziomie pliku. Strona cyfrowa przechowuje pojedyncze znaki tekstowe, każdy z dokładną pozycją, odwołaniem do czcionki i wartością Unicode. Funkcje wyszukiwania mogą bezpośrednio czytać te znaki. Zeskanowana strona przechowuje pojedynczy skompresowany obraz, często w formacie JPEG lub JPEG2000, który zajmuje prostokątny obszar równy wymiarom strony. Plik nie zawiera żadnych informacji na temat tego, co przedstawia ten obraz. Może to być tekst, fotografia lub rysunek, a plik PDF nie robi żadnej różnicy.
Ta różnica ma praktyczne konsekwencje. W połączonym hybrydowym pliku PDF niektóre strony będzie można przeszukiwać, a inne nie. Niektóre strony będą zawierały tekst do wyboru, a inne będą zachowywać się jak fotografie. Rozmiar pliku na stronę również będzie się znacznie różnić. Utworzona cyfrowo strona zawierająca zwykły tekst może zajmować od 30 do 50 KB. Pełnokolorowy skan tej samej treści w rozdzielczości 300 DPI może zająć od 500 KB do 2 MB. 20-stronicowy dokument hybrydowy może z łatwością mieć rozmiar od 2 MB w przypadku pliku w większości cyfrowego do 30 MB w przypadku pliku w większości zeskanowanego. Ta odmiana ma znaczenie, gdy wysyłasz dokument e-mailem lub przesyłasz go do portalu o ograniczonym rozmiarze pliku.
Spróbuj scalić pliki PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Jak połączyć strony zeskanowane i cyfrowe, zachowując porządek
Rzeczywisty proces łączenia zeskanowanych i cyfrowych stron PDF nie różni się od łączenia innych zestawów plików PDF. Każde narzędzie Scal PDF może obsłużyć to zadanie. Narzędzie do łączenia WukongPDF umożliwia przesyłanie plików w dowolnej kolejności, przeciąganie w celu zmiany układu stron i pobieranie jednego połączonego pliku PDF. Narzędzie nie bierze pod uwagę, czy każda strona źródłowa pochodzi ze skanera czy edytora tekstu. Traktuje wszystkie strony wejściowe jednakowo i łączy je w określonej kolejności.
Ważniejsze jest to, co stanie się po fuzji. Jeśli chcesz, aby dokument końcowy był w pełni przeszukiwalny, zeskanowane strony muszą przejść etap OCR przed lub po połączeniu. Uruchomienie OCR przed połączeniem daje większą kontrolę, ponieważ możesz indywidualnie sprawdzić jakość tekstu w każdym zeskanowanym pliku. Uruchomienie OCR po połączeniu jest wygodniejsze, ponieważ przetwarzasz cały dokument w jednym przebiegu. Obydwa podejścia działają. Wybór zależy od tego, czy chcesz inaczej dostosować ustawienia OCR dla różnych dokumentów źródłowych.
Spójność rozmiaru strony to kolejny szczegół, który warto monitorować. Zeskanowane strony często mają domyślne wymiary papieru znajdującego się na stole skanera, zazwyczaj jest to format US Letter (8,5 x 11 cali). Strony cyfrowe mogły zostać utworzone w formacie A4 (8,27 x 11,69 cala) lub w dowolnych niestandardowych wymiarach używanych w oryginalnej aplikacji. Kiedy w tym samym pliku PDF pojawiają się strony o nieco innych rozmiarach, większość przeglądających radzi sobie z tą różnicą z wdziękiem, skalując każdą stronę w celu dopasowania do okna przeglądania. Jednak wizualne przejście pomiędzy nieco różnymi rozmiarami stron może być irytujące podczas przewijania. Jeśli spójność ma znaczenie w Twoim przypadku użycia, rozważ standaryzację wszystkich stron do jednego rozmiaru podczas procesu scalania.
Kiedy hybrydowe pliki PDF mają sens, a kiedy nie
Hybrydowe pliki PDF są praktycznym rozwiązaniem w wielu typowych sytuacjach. Prawnicy rutynowo łączą umowy sporządzone cyfrowo ze zeskanowanymi eksponatami i dokumentami dowodowymi. Agenci nieruchomości łączą oferty utworzone cyfrowo ze zeskanowanymi raportami z inspekcji i formularzami ujawnień. Księgowi łączą generowane komputerowo sprawozdania finansowe ze zeskanowanymi paragonami i fakturami. W każdym z tych przypadków hybrydowy plik PDF spełnia swój cel: tworzy pojedynczy, zorganizowany plik, który można otwierać, przewijać i przeglądać od początku do końca.
Są jednak sytuacje, w których hybrydowy plik PDF nie spełnia wymagań. Jeśli odbiorca będzie musiał przeszukać cały dokument, zeskanowane strony będą niewidoczne dla funkcji wyszukiwania, chyba że zostały przetworzone przez OCR. Jeśli odbiorca będzie musiał skopiować i wkleić tekst z dowolnej strony, zeskanowane strony nie przejdą testu. Jeśli dokument zostanie przesłany do systemu, który automatycznie wyodrębnia tekst lub indeksuje cały tekst, takiego jak sądowy system składania wniosków lub platforma zarządzania dokumentami, niezeskanowane strony spowodują w tych systemach puste lub wypełnione błędami wyniki.
W przypadku scenariuszy o wyższej stawce uruchomienie OCR na każdej zeskanowanej stronie przed połączeniem nie jest opcjonalne, ale wręcz niezbędne. Hybrydowy plik PDF z możliwością pełnego przeszukiwania działa prawie nie do odróżnienia od pliku w pełni cyfrowego. Jedyna pozostała różnica polega na tym, że na zeskanowanych stronach tekst nie będzie się zmieniał po powiększeniu, w przeciwieństwie do stron cyfrowych, w zależności od sposobu ich utworzenia. Z większości praktycznych zastosowań dobrze wykonany hybrydowy plik PDF z funkcją OCR na każdej zeskanowanej stronie zapewnia użytkownikowi takie same wrażenia, jak dokument całkowicie cyfrowy.
Zarządzanie rozmiarem pliku podczas mieszania treści zeskanowanych i cyfrowych
Rozmiar pliku jest często pierwszą rzeczą, na którą ludzie zwracają uwagę w przypadku hybrydowego pliku PDF, i to nie w pozytywny sposób. 10-stronicowy dokument, w którym 3 strony to kolorowe skany w rozdzielczości 300 DPI, a 7 to zwykły tekst cyfrowy, może z łatwością przekroczyć 10 MB. Jeśli dokument wymaga przesłania e-mailem, wiele serwerów poczty e-mail wymusza limit 25 MB załączników, a odbiorcy korzystający z mobilnego połączenia transmisji danych nie będą zadowoleni z pobrania pliku o tak dużym rozmiarze, jak na zawartość, która mogłaby mieć ułamek rozmiaru.
Kilka technik może zapewnić kontrolę nad rozmiarem pliku hybrydowego pliku PDF. Skanowanie w trybie czarno-białym lub w skali szarości zamiast w kolorze zmniejsza rozmiar pliku na stronę o około 60% do 80% w przypadku dokumentów zawierających dużo tekstu. Zmniejszenie rozdzielczości skanowania z 300 DPI do 200 DPI zmniejsza rozmiar pliku o około połowę, jednocześnie zapewniając wystarczającą ilość szczegółów, aby tekst był czytelny i akceptowalne wyniki OCR. Zastosowanie kompresji do scalonego pliku PDF jako ostatniego kroku może jeszcze bardziej zmniejszyć całkowity rozmiar. Skanowane strony PDF korzystają szczególnie z kompresji, ponieważ zeskanowane obrazy często zawierają znacznie więcej danych w pikselach, niż jest to konieczne do przeglądania lub drukowania na ekranie. Narzędzie do kompresji WukongPDF może zredukować hybrydowy plik PDF o 50% do 70% bez widocznej utraty jakości, co odróżnia plik odbijany od serwera e-mailowego od pliku przesyłanego przez niego.
Krok po kroku: Tworzenie czystego hybrydowego pliku PDF
Konsekwentne podejście do tworzenia hybrydowych plików PDF daje lepsze rezultaty niż każdorazowa improwizacja. Rozpocznij od zeskanowania wszystkich stron fizycznych w rozdzielczości 300 DPI w skali szarości, chyba że wymagany jest kolor. Zapisz je jako pojedyncze pliki PDF, a nie jako pojedynczy połączony skan. Następnie otwórz każdy zeskanowany plik i sprawdź, czy strony są proste i czytelne. Uruchom OCR na zeskanowanych plikach, jeśli chcesz, aby dokument końcowy mógł być przeszukiwany.
Zbierz swoje cyfrowe strony. Jeśli są one rozproszone w wielu plikach, najpierw połącz je ze sobą. Teraz powinieneś mieć dwa czyste zestawy: jedną partię zeskanowanych plików PDF i jedną partię cyfrowych plików PDF. Użyj narzędzia scalającego, aby połączyć je we właściwej kolejności. Interfejs scalania oparty na przeglądarce wyświetla wszystkie przesłane strony jako miniatury, które można przeciągać w odpowiednie miejsce, dzięki czemu porządkowanie zeskanowanych i cyfrowych stron w kolejności jest szybkie i wizualne.
Po połączeniu przeprowadź szybką kontrolę jakości. Przewiń każdą stronę. Poszukaj stron, które wyglądają na obrócone, stron, na których skan odciął część treści, oraz stron, na których tekst jest tak blady, że trudno go odczytać. Napraw wszelkie problemy u źródła i w razie potrzeby połącz ponownie. Uruchom test wyszukiwania Ctrl+F na kilku słowach, o których wiesz, że pojawiają się na zeskanowanych stronach. Jeśli wyszukiwanie je znajdzie, OCR działa poprawnie. Jeśli nie, zeskanowane strony wymagają ponownego przejścia przez OCR, zanim dokument będzie gotowy do udostępnienia.
Na koniec sprawdź rozmiar pliku. Jeśli dokument jest przeznaczony do przesłania pocztą elektroniczną, staraj się, aby jego rozmiar nie przekraczał 10 MB. Jeśli przekroczy tę wartość, przeprowadź kompresję i sprawdź ponownie. Kilka dodatkowych minut spędzonych na tych etapach weryfikacji jest znacznie mniej bolesne niż informacja od klienta, współpracownika lub urzędnika sądowego, że wysłany dokument jest bezużyteczny.
Spróbuj scalić pliki PDF
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
