Wykonujesz OCR pliku PDF, a rozpoznany tekst pojawia się w polu tekstowym w edytorze PDF. Możesz to przeczytać. Możesz go skopiować i wkleić. Ale tak naprawdę potrzebujesz tekstu w pliku Markdown, z nagłówkami sformatowanymi jako skróty, listami jako gwiazdkami, łączami jako parami nawiasów i nawiasów oraz akapitami oddzielonymi pustymi liniami. Markdown to język programistów, autorów tekstów technicznych, blogerów i każdego, kto potrzebuje czystego, przenośnego tekstu, który można upuścić w generatorze stron statycznych, aplikacji do robienia notatek lub repozytorium kodu.
Przejście ze zeskanowanego pliku PDF do pliku Markdown przebiega dwuetapowo: OCR rozpoznaje tekst, a następnie etap formatowania konwertuje rozpoznany tekst na składnię Markdown. Każdy krok obejmuje wybór narzędzi, które wpływają na jakość końcowego wyniku.

Krok 1: OCR pliku PDF w celu wyodrębnienia rozpoznanego tekstu
Krok OCR jest taki sam, jak umożliwienie przeszukiwania dowolnego pliku PDF. Do przetwarzania zeskanowanych stron użyj narzędzia OCR PDF. Narzędzie dodaje warstwę tekstową do każdej strony. W przypadku eksportu Markdown potrzebujesz danych wyjściowych OCR w formacie, który zachowuje jak najwięcej informacji strukturalnych: który tekst jest nagłówkiem, który tekst jest treścią, który tekst jest częścią listy lub tabeli. Standardowe silniki OCR generują zwykły tekst, który traci wszystkie informacje strukturalne. Nagłówek i akapit główny stają się nierozróżnialnymi blokami tekstu oddzielonymi podziałami wierszy.
Aby uzyskać najlepsze wyniki, użyj mechanizmu OCR obsługującego wyodrębnianie tekstu z uwzględnieniem układu. Silniki te analizują przestrzenne rozmieszczenie tekstu na stronie i potrafią rozróżnić nagłówki, treść, podpisy i przypisy na podstawie rozmiaru czcionki, położenia i odległości od innych elementów. Im więcej informacji strukturalnych przechwyci silnik OCR, tym czystsza będzie konwersja Markdown. Funkcja Eksportuj do programu Adobe Acrobat Pro zawiera opcję „Tekst z formatowaniem”. opcja, która zachowuje pewne wskazówki strukturalne. Silnik OCR zachowuje metadane dotyczące rozmiaru czcionki i położenia, których mogą używać późniejsze narzędzia do konwersji do określania poziomów nagłówków i podziałów akapitów.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
Krok 2: Konwertuj rozpoznany tekst na Markdown
Gdy plik PDF ma warstwę tekstową, konwersja do Markdown może przebiegać kilkoma ścieżkami. Najprostszy to bezpośredni eksport z edytora PDF obsługującego Markdown jako format wyjściowy. Opcje eksportu WukongPDF obejmują Markdown jako format docelowy, gdy plik PDF został przetworzony przez OCR. Wybierz Markdown jako format wyjściowy, a narzędzie wygeneruje plik .md z rozpoznanym tekstem sformatowanym zgodnie z konwencjami Markdown: linie zaczynające się od większej czcionki stają się nagłówkami z przedrostkiem hash, wcięte linie stają się elementami listy, a zwykłe akapity są oddzielane pustymi liniami.
Jeśli bezpośredni eksport do Markdown nie jest dostępny, potok jest następujący: wyeksportuj rozpoznany tekst do formatu tekstu sformatowanego, który zachowuje formatowanie, takiego jak RTF lub HTML, a następnie przekonwertuj ten format pośredni do Markdown za pomocą narzędzia do konwersji. Pandoc, uniwersalny konwerter dokumentów, dobrze radzi sobie z tym potokiem. Wyeksportuj tekst z pliku PDF jako HTML, a następnie uruchom: pandoc input.html -f html -t markdown -o Output.md. Pandoc tłumaczy znaczniki nagłówków HTML na skróty Markdown, znaczniki list HTML na znaczniki list Markdown, a znaczniki łączy HTML na składnię linków Markdown. Jakość wydruku zależy od jakości eksportu HTML z pliku PDF. Jeśli eksport do pliku PDF generuje czysty, dobrze zorganizowany kod HTML, Pandoc tworzy czysty Markdown. Jeśli eksport wygeneruje niechlujny kod HTML ze stylami wbudowanymi i niesemantycznymi znacznikami, Markdown będzie odpowiednio niechlujny.
Czyszczenie błędów OCR w wynikach oznaczeń
Błędy OCR w rozpoznanym tekście są przekazywane do danych wyjściowych Markdown w niezmienionej postaci. Typowe błędy obejmują pomieszane znaki, takie jak „cl”; rozpoznawane jako „d” „rn” rozpoznawane jako „m” i „1” rozpoznawane jako „l” zwłaszcza w przypadku mniejszych rozmiarów czcionek lub skanów o niższej jakości. Jeśli tekst zostanie opublikowany lub udostępniony, niezbędne jest przejrzenie pliku Markdown w celu wykrycia tych błędów.
Większość edytorów kodu i edytorów Markdown zawiera funkcję sprawdzania pisowni, która wyróżnia nierozpoznane słowa, dzięki czemu błędy OCR są łatwe do wykrycia. Przejrzyj wyróżnione słowa i popraw je względem oryginalnego pliku PDF. Zwróć szczególną uwagę na rzeczowniki własne, terminy techniczne i liczby, które najprawdopodobniej zostaną błędnie rozpoznane, a także najbardziej szkodliwe, jeśli zostaną nieprawidłowo opublikowane. Sprawozdanie finansowe, w którym OCR rozpoznało kwotę „123 000 USD” jako „128 000 dolarów” zawiera istotny błąd, którego automatyczne sprawdzanie pisowni nie wykryje, ponieważ oba formaty liczb są prawidłowymi. Jedynym niezawodnym zabezpieczeniem jest ręczna weryfikacja wartości krytycznych z dokumentem źródłowym.
Zachowywanie obrazów i tabel w konwersji Markdown
Markdown obsługuje obrazy, odwołując się do plików zewnętrznych: . Podczas konwersji pliku PDF do Markdown obrazy z pliku PDF należy wyodrębnić i zapisać jako osobne pliki, a łącza referencyjne wstawić do tekstu Markdown we właściwych miejscach. WukongPDF Eksport PDF do Markdown obejmuje ekstrakcję obrazu jako część konwersji. Każdy obraz w pliku PDF jest zapisywany jako plik PNG lub JPEG w folderze obok pliku Markdown, a tekst Markdown zawiera odpowiednie znaczniki odniesienia do obrazu.
Stoły są bardziej wymagające. Tabele Markdown korzystają ze składni z kreską i kreską, która jest łatwa do odczytania przez ludzi, ale trudna do wygenerowania przez automatyczne konwertery z danych tabeli PDF, ponieważ pliki PDF nie przechowują tabel jako danych strukturalnych. Przechowują znaki na pozycjach. Konwerter musi dokonać inżynierii wstecznej siatki tabeli na podstawie pozycji znaków, co daje niedoskonałe wyniki w przypadku złożonych tabel ze scalonymi komórkami, wielowierszową zawartością komórek lub nierównymi szerokościami kolumn. Proste tabele siatkowe z jednolitymi kolumnami i jednowierszową zawartością komórek konwertują niezawodnie. Złożone tabele mogą wymagać ręcznej restrukturyzacji wyników Markdown. Jeśli tabela konwertuje się słabo, rozważ wyeksportowanie jej jako osobnego obrazu, a nie jako składni tabeli Markdown. Czytelny obraz złożonej tabeli jest bardziej przydatny niż zniekształcony Markdown, który renderuje się jako źle wyrównane kolumny.
Uruchamianie pliku Markdown
Wynikowy plik Markdown otwiera się w dowolnym edytorze tekstu, aplikacji do robienia notatek, takiej jak Obsidian lub Notion, generatorze stron statycznych, takim jak Hugo lub Jekyll, lub edytorze kodu, takim jak VS Code. Za pomocą Markdown możesz wygenerować kod HTML na potrzeby witryny internetowej, plik PDF do dystrybucji, DOCX do przetwarzania tekstu lub po prostu zachować tekst w formacie zwykłego tekstu, który można przeszukiwać i kontrolować wersję, który będzie czytelny przez dziesięciolecia.
Wartość tego rurociągu najlepiej widać w przypadku materiałów archiwalnych. Stare zeskanowane raporty, dokumenty historyczne, publikacje o wyczerpanym nakładzie – wszystko to można nie tylko przeszukiwać, ale także przekształcać. Zeskanowany raport z 2005 roku staje się plikiem Markdown, który można edytować w nowoczesnym edytorze, przekonwertować na stronę internetową, zacytować w poście na blogu lub przeanalizować programowo. Format PDF, który blokował tekst wewnątrz obrazu na 20 lat, nie ogranicza już sposobu wykorzystania treści.
Wypróbuj PDF OCR
Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.
