Tips & Tricks

Jak OCR pliku PDF i zachować nienaruszony oryginalny układ strony

Uruchomienie OCR PDF na zeskanowanym dokumencie wyodrębnia tekst, ale wynik często usuwa strukturę wizualną, która zapewniła czytelność oryginału. Nagłówki stają się zwykłymi akapitami, kolumny zwijają się w jeden strumień tekstu, a tabele rozpadają się na pomieszane fragmenty. Zachowanie nienaruszonego oryginalnego układu strony po OCR oznacza, że rozpoznany tekst pozostaje na swoim miejscu, zachowując kolejność czytania, strukturę kolumn i relacje przestrzenne, które nadają dokumentowi znaczenie. Wymaga to wybrania właściwych ustawień OCR i formatu wyjściowego przed przetwarzaniem, a nie po.

How to OCR a PDF and Keep the Original Page Layout Intact

Jak działa zachowywanie układu OCR

Silniki OCR przetwarzają zeskanowaną stronę w dwóch odrębnych etapach. W pierwszym etapie analizowany jest obraz strony w celu zidentyfikowania stref, bloków treści, takich jak kolumny tekstu, obrazy, tabele i nagłówki. Drugi etap polega na rozpoznaniu postaci w obrębie każdej strefy. Metoda OCR zachowująca układ zachowuje współrzędne przestrzenne każdego rozpoznanego słowa, rejestrując nie tylko treść tekstu, ale także miejsce, w którym się ono pojawia. Współrzędne te definiują kolejność czytania i hierarchię wizualną dokumentu.

Gdy włączone jest zachowanie układu, wynik OCR osadza niewidoczne warstwy tekstowe bezpośrednio na oryginalnym zeskanowanym obrazie w pliku PDF. Każde rozpoznane słowo znajduje się dokładnie w tej samej pozycji w pikselach, co znak źródłowy na skanie. Oznacza to, że dokument wygląda identycznie jak oryginał podczas przeglądania, ale tekst znajdujący się pod spodem można zaznaczyć, przeszukać i uzyskać dostęp do czytników ekranu. Zeskanowany plik PDF staje się dokumentem hybrydowym z wizualną wiernością oryginalnego skanu i funkcjonalnością tekstową pliku utworzonego cyfrowo.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Wybór odpowiedniego trybu wyjściowego OCR

Większość narzędzi OCR oferuje co najmniej trzy tryby wyjściowe, a wybór między nimi decyduje o tym, czy układ przetrwa. Tryb obrazu z możliwością przeszukiwania zachowuje oryginalną zeskanowaną stronę jako widoczną warstwę i dodaje pod nią niewidoczną warstwę tekstową. Zachowuje to doskonale układ, ponieważ strona wizualna się nie zmienia. Tryb Tekst i obrazy tworzy nową stronę z rozpoznanym tekstem i wyodrębnionymi obrazami, których położenie jest zbliżone do oryginalnego układu. Ten tryb częściowo zachowuje układ i sprawdza się dobrze w przypadku prostych dokumentów jednokolumnowych, ale złożone strony wielokolumnowe mogą się nieznacznie przesunąć.

Tryb Tylko tekst odrzuca wszystkie obrazy i formatowanie, tworząc strumień zwykłego tekstu bez informacji o układzie. Tego trybu należy całkowicie unikać, gdy liczy się układ. W przypadku dokumentów, w których ważne są zarówno Jakość PDF, jak i wierność układu, tryb Obraz z możliwością przeszukiwania zapewnia najlepszą równowagę. Rozmiar pliku będzie większy niż w przypadku eksportu zawierającego wyłącznie tekst, ponieważ oryginalne dane obrazu pozostaną, ale kompromis będzie opłacalny w przypadku każdego dokumentu, który będzie czytany, udostępniany lub archiwizowany w oryginalnej formie wizualnej.

Obsługa układów wielokolumnowych i złożonych

Dokumenty wielokolumnowe stanowią największe wyzwanie w zakresie zachowania układu OCR, ponieważ kolejność czytania zmienia się na całej stronie. Dwukolumnowa praca naukowa wymaga, aby silnik OCR przeczytał całą lewą kolumnę, a następnie przeskoczył z powrotem na górę prawej kolumny. Bez prawidłowego wykrycia strefy dane wyjściowe OCR mogą przeplatać linie z obu kolumn, tworząc nonsensowny tekst, w którym każda inna linia należy do innej kolumny.

Nowoczesne silniki OCR wykorzystują algorytmy wykrywania stref, które identyfikują granice kolumn poprzez analizę przerw między blokami tekstu. Przed uruchomieniem OCR dokumentu wielokolumnowego sprawdź, czy narzędzie oferuje wykrywanie kolumn lub ustawienie automatycznej strefy. Jeśli narzędzie błędnie zidentyfikuje granice kolumn, większość komputerowych aplikacji OCR umożliwia ręczne narysowanie prostokątów stref na stronie w celu ustalenia kolejności rozpoznawania. Rysowanie stref zajmuje więcej czasu z góry, ale gwarantuje prawidłową kolejność odczytu na wyjściu.

Zachowywanie tabel i danych liczbowych

Tabele łączą układ i dane w sposób, który trudno zinterpretować w przypadku typowego OCR. Struktura siatki, która sprawia, że tabela jest czytelna dla ludzkich oczu, obejmująca naprzemienne wiersze o stałej szerokości kolumn i wyrównaniu, wymaga, aby silnik OCR rozpoznawał zarówno granice komórek, jak i relacje między komórkami w tym samym wierszu lub kolumnie. Gdy zachowywanie układu działa prawidłowo, tabela w oryginalnym dokumencie tworzy w wyniku OCR tabelę z każdą wartością w odpowiedniej komórce.

Poniższa tabela porównuje sposób, w jaki różne tryby wyjściowe OCR radzą sobie z zachowaniem tabeli:

Tryb wyjścia OCRStruktura tabeliWyrównanie komórek
Przeszukiwalny obrazZachowany oryginalny obrazDokładnie, wbudowane w źródło
Tekst i obrazyZrekonstruowany jako tabela tekstowaW przybliżeniu, może dryfować
Tylko tekstCałkowicie zagubionyNie zachowano żadnego wyrównania

Ustawienia OCR wpływające na jakość układu

Kilka ustawień poza trybem wyjściowym wpływa na to, jak dobrze oryginalny układ przetrwa rozpoznanie. Ustawienie DPI obrazu wejściowego jest najważniejsze. Skany w rozdzielczości 300 DPI zapewniają wystarczającą gęstość pikseli, aby silnik OCR mógł rozróżniać kształty znaków i dokładnie wykrywać strefy układu. Skany w rozdzielczości 150 DPI lub niższej powodują rozmycie krawędzi znaków, co dezorientuje zarówno silnik rozpoznawania, jak i algorytm wykrywania strefy. Skanowanie w rozdzielczości 600 DPI nieznacznie poprawia dokładność, ale wydłuża czas przetwarzania i zwiększa rozmiar pliku, bez proporcjonalnych korzyści w przypadku większości dokumentów.

Korekta prostowania prostuje strony zeskanowane pod niewielkim kątem. Nawet nachylenie o dwa stopnie może spowodować, że wykrywanie strefy błędnie zinterpretuje granicę kolumny jako przekątną. Włączenie automatycznego prostowania przed OCR poprawia zachowanie układu w prawie każdym przypadku. Podobnie filtry usuwające plamki usuwają przypadkowe kropki i szum skanera, który detektor strefowy może zinterpretować jako małe bloki tekstu, które mogą fragmentaryzować rozpoznane strefy i zakłócać kolejność odczytu. Narzędzia takie jak WukongPDF automatycznie stosują te poprawki przed przetwarzaniem, tworząc czystsze mapy stref i dokładniejsze zachowanie układu w różnych typach dokumentów.

Weryfikacja dokładności układu po OCR

Po uruchomieniu OCR z włączoną funkcją zachowywania układu należy sprawdzić wynik przed archiwizacją lub dystrybucją dokumentu. Otwórz wyjściowy plik PDF i włącz narzędzie do zaznaczania tekstu. Przeciągnij kursor przez akapit w każdej kolumnie i potwierdź, że wybór jest zgodny z prawidłową kolejnością czytania, bez przeskakiwania do sąsiednich kolumn. Wyszukaj słowo pojawiające się w tabeli i sprawdź, czy wynik wyszukiwania podświetla prawidłową lokalizację komórki. Skopiuj akapit ze środkowej kolumny i wklej go do edytora tekstu, aby sprawdzić, czy linie pojawiają się we właściwej kolejności.

W przypadku dokumentów o krytycznym znaczeniu, w których błędy układu mogłyby powodować zamieszanie, najbardziej wiarygodną metodą weryfikacji jest porównanie strona po stronie oryginału ze skanem i wynikiem OCR. Otwórz oba pliki obok siebie i sprawdź pierwsze zdanie każdego akapitu, każdy nagłówek tabeli oraz cały tekst pojawiający się w nagłówkach i stopkach. Wyłapanie błędu wykrywania strefy na tym etapie zajmuje kilka sekund na stronę. Odkrycie go kilka miesięcy później, gdy ktoś próbuje przeszukać dokument i otrzymuje zniekształcone wyniki, jest znacznie droższe.

Wybór odpowiedniego silnika OCR dla dokumentów o dużym układzie

Różne silniki OCR obsługują zachowanie układu na różnym poziomie zaawansowania. Tesseract, silnik open source obsługiwany przez Google, dobrze radzi sobie z prostymi dokumentami jednokolumnowymi, ale może mieć problemy z wielokolumnowymi artykułami akademickimi lub układami czasopism bez dodatkowego przetwarzania wstępnego. Komercyjny silnik ABBYY FineReader niezmiennie zajmuje najwyższe miejsca w niezależnych testach zachowania układu, ponieważ analizuje całą strukturę strony przed uruchomieniem rozpoznawania znaków, tworząc mapę stref, która zachowuje relacje przestrzenne pomiędzy blokami tekstu.

W przypadku dokumentów, w przypadku których zachowanie układu ma kluczowe znaczenie, przed przetworzeniem całego dokumentu poświęć czas na przetestowanie dwóch różnych silników OCR na reprezentatywnej przykładowej stronie. OCR pojedynczą złożoną stronę dla każdego silnika i porównaj wyniki obok siebie. Przyjrzyj się kolejności odczytu, separacji kolumn i strukturze tabeli w obu wynikach. Silnik, który obsługuje najtrudniejszą stronę w dokumencie, prawdopodobnie poradzi sobie z resztą w zadowalający sposób. Ta piętnastominutowa inwestycja w testowanie może zapobiec godzinom ręcznej korekty układu później.

WukongPDF zawiera funkcję OCR, która zachowuje układ strony i kolejność czytania, co czyni go praktycznym wyborem dla użytkowników, którzy potrzebują dokładnych przeszukiwalnych plików PDF bez konieczności instalowania oprogramowania OCR na komputerze. Przetwarzanie oparte na chmurze skutecznie obsługuje wielostronicowe dokumenty, dając przeszukiwalny plik PDF z nienaruszonym oryginalnym wyglądem.

Często pomijanym czynnikiem wpływającym na zachowanie układu jest jakość i stan oryginalnego skanu. Przekrzywiona, pomarszczona lub o niskim kontraście oryginalna strona zmusza silnik OCR do wykorzystania zasobów analitycznych na korygowanie defektów obrazu, a nie na mapowanie struktury układu. Przed uruchomieniem OCR sprawdź wizualnie każdą stronę. Jeśli na skanie widać przechylony blok tekstu, ciemne cienie wzdłuż grzbietu pochodzące z oprawionej książki lub wyblakły tekst zlewający się z tłem, należy wstępnie przetworzyć obrazy.

Różnica w rozmiarze pliku pomiędzy danymi wyjściowymi OCR z zachowaniem układu i pozbawionymi układu może być znaczna. Obraz PDF z możliwością przeszukiwania zachowuje oryginalną zeskanowaną stronę jako warstwę obrazu w pełnej rozdzielczości z niewidoczną nakładką tekstową, co powoduje, że rozmiar pliku jest kilkakrotnie większy niż w przypadku pliku wyjściowego zawierającego wyłącznie tekst. W przypadku celów archiwalnych, gdzie miejsce na dane nie jest ograniczone, większy plik jest opłacalnym kompromisem w zakresie wierności układu.

W przypadku projektów archiwalnych obejmujących dokumenty historyczne zachowanie układu nabiera dodatkowego znaczenia, ponieważ fizyczny wygląd oryginalnego dokumentu ma wartość historyczną i dowodową. Dane wyjściowe OCR, które poprawnie rozpoznają każde słowo, ale układają je w jednokolumnowy blok tekstowy, zniszczyły kontekst wizualny oryginału. W tych projektach podejście oparte na obrazie z możliwością przeszukiwania jest obowiązkowe, a wszelkie wyniki zawierające wyłącznie tekst należy traktować jako pomoc w znalezieniu, a nie zamiennik oryginalnego dokumentu.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →