Tips & Tricks

Jak OCR ręcznie narysowany diagram lub szkic w pliku PDF

Optyczne rozpoznawanie znaków jest przeznaczone do tekstu. Znajduje linie znaków, dzieli je na pojedyncze litery i dopasowuje te kształty do znanych wzorców znaków. Ręcznie rysowany diagram, schemat blokowy naszkicowany na tablicy, schemat organizacyjny narysowany na serwetce, schemat obwodu napisany ołówkiem w notatniku inżyniera, nie zawiera prawie żadnego tekstu rozpoznawalnego maszynowo. Standardowy OCR nie generuje niczego, albo tworzy mieszaninę nonsensownych znaków w wyniku błędnego sklasyfikowania linii i kształtów jako liter.

Diagramy wymagają zasadniczo innego podejścia do rozpoznawania niż tekst.

Wyodrębnianie informacji z ręcznie rysowanego diagramu za pomocą narzędzi OCR PDF oznacza użycie specjalistycznego rozpoznawania diagramów, ręcznych adnotacji lub podejścia hybrydowego, w którym OCR obsługuje dowolne etykiety tekstowe, a eksport obrazów zachowuje strukturę diagramu do ręcznej lub wspomaganej interpretacji. WukongPDF Zeskanowany plik PDF i narzędzia OCR obsługują fragmenty tekstu, a poniższa procedura opisuje, co zrobić z częściami, których OCR nie może odczytać.

How to OCR a Hand-Drawn Diagram or Sketch Inside a PDF

Dlaczego standardowy OCR zawodzi na diagramach i szkicach

Silniki OCR wyszukują statystyczne wzorce tekstu: w przybliżeniu poziome linie składające się ze znaków o mniej więcej tej samej wysokości, rozmieszczonych w stałych odstępach, z odstępami między wyrazami i literami mieszczącymi się w oczekiwanych zakresach. Ręcznie rysowany diagram narusza każde z tych założeń. Linie nie są poziome. Kształty nie są znakami. Odstępy między elementami nie mają związku z odstępami w tekście. Silnik stosuje swój model tekstowy do treści, które nie pasują do modelu, a na wyjściu pojawia się szum.

Ten sam silnik, który osiąga 98% dokładności na wydrukowanej stronie, może zwrócić na diagramie 0% znaczących wyników, nie dlatego, że silnik jest zły, ale dlatego, że nigdy nie został poproszony o zrobienie tego, o co go proszono. Jest to podstawowa rozbieżność, którą należy zrozumieć przed przystąpieniem do rozpoznawania OCR na diagramie. Pytaniem nie jest, jakiego silnika OCR użyć. Pytanie brzmi, jakich informacji potrzebujesz z diagramu i czy OCR może wyodrębnić te informacje, czy też wymagane jest inne narzędzie.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Wyodrębnianie etykiet tekstowych z zachowaniem diagramu

Większość ręcznie rysowanych diagramów zawiera tekst: etykiety w polach schematów blokowych, tytuły osi na naszkicowanych wykresach, nazwy komponentów na schematach obwodów, nazwy w polach schematów organizacyjnych. W tym tekście OCR może faktycznie pomóc. Uruchom OCR na stronie diagramu, tak jak w przypadku każdego zeskanowanego dokumentu. Silnik znajdzie etykiety tekstowe i zwróci je jako rozpoznane ciągi znaków. Zignoruj hałas wytwarzany przez elementy diagramu. Filtruj dane wyjściowe pod kątem rozpoznawalnych słów i wyrażeń, które będą potrzebnymi etykietami tekstowymi.

Wyeksportuj stronę diagramu jako obraz o wysokiej rozdzielczości wraz z tekstem OCR. Obraz zachowuje wizualną strukturę diagramu. Wynik tekstowy OCR zapewnia przeszukiwalne etykiety, które pozwalają znaleźć określone diagramy w kolekcji bez otwierania każdego obrazu. Połączenie etykiet z możliwością przeszukiwania i obrazu wizualnego służy większości praktycznych celów lepiej niż każde z nich osobno. Możesz wyszukać schemat blokowy zawierający zatwierdzenie budżetu i otworzyć obraz, aby zobaczyć diagram, bez konieczności rozumienia struktury diagramu przez silnik OCR.

Korzystanie z narzędzi do rozpoznawania diagramów wspomaganych przez sztuczną inteligencję

Wyspecjalizowane narzędzia wyszkolone w zakresie danych diagramów mogą interpretować ręcznie rysowane diagramy w sposób, którego nie potrafią zwykłe silniki OCR. Narzędzia te rozpoznają popularne typy diagramów, schematy blokowe, schematy organizacyjne, mapy myśli, diagramy sieciowe i konwertują je na wersje edytowalne w aplikacjach takich jak Microsoft Visio, Lucidchart lub Draw.io. Rozpoznawanie nie jest doskonałe, linie mogą być błędnie interpretowane, kształty mogą być błędnie klasyfikowane, ale wynik jest punktem wyjścia do ręcznego czyszczenia, które jest znacznie szybsze niż ponowne rysowanie diagramu od zera.

Zeskanuj diagram w najwyższej dostępnej rozdzielczości, najlepiej 600 DPI, przed przesłaniem go do narzędzia do rozpoznawania diagramów. Linie rysowane ręcznie są cieńsze i mniej spójne niż linie drukowane, a wyższa rozdzielczość zapewnia algorytmowi rozpoznawania więcej danych do wykorzystania. Skan o rozdzielczości 150 DPI, który byłby odpowiedni do rozpoznawania tekstu OCR, generuje niejednoznaczne ślady linii na ręcznie rysowanym schemacie, gdzie algorytm rozpoznawania nie jest w stanie rozróżnić celowej linii, smugi i tekstury papieru.

Przygotowanie diagramu w celu uzyskania lepszych wyników rozpoznawania

Jakość obrazu źródłowego wpływa bardziej na dokładność rozpoznawania niż wybór narzędzia. Zrób zdjęcie diagramu przy równym, rozproszonym oświetleniu. Unikaj cieni rzucanych przez telefon lub aparat. Połóż papier na płaskiej powierzchni o wysokim kontraście. Wykadruj ujęcie, aby wypełnić obraz diagramem, minimalizując pusty obszar wokół. Dobrze oświetlone, płaskie zdjęcie szkicu ołówkiem o wysokiej rozdzielczości może zapewnić lepsze wyniki rozpoznawania niż słabo oświetlone zdjęcie profesjonalnie naniesionego tuszem diagramu.

Popraw obraz przed przesłaniem go do narzędzia rozpoznawania. Zwiększ kontrast, aby przyciemnić linie i rozjaśnić tło papieru. Konwertuj na skalę szarości, jeśli kolor nie ma znaczenia. Zastosuj filtr lekko wyostrzający, aby krawędzie linii były wyraźniejsze. Te ulepszenia, dostępne w dowolnym podstawowym edytorze obrazów, zajmują 30 sekund i mogą poprawić dokładność rozpoznawania o 20–30 punktów procentowych w przypadku marginalnych obrazów źródłowych. Narzędzie rozpoznawania widzi poprawiony obraz. Nie wie, że oryginał był trudniejszy do odczytania.

Adnotacja ręczna jako alternatywa dla automatycznego rozpoznawania

W przypadku niewielkiej liczby diagramów ręczna adnotacja jest szybsza niż walka z narzędziami rozpoznawania. Otwórz obraz diagramu w narzędziu do adnotacji PDF. Dodaj komentarze tekstowe opisujące kluczowe elementy: Proces rozpoczyna się tutaj, Punkt decyzji: budżet większy niż 10 000, Wymagana zgoda dyrektora finansowego. Adnotacje to tekst, który można przeszukiwać i który znajduje się obok obrazu diagramu w pliku PDF. Przyszli czytelnicy mogą wyszukiwać terminy w adnotacjach i znajdować diagram.

Adnotacja zmusza również do zrozumienia diagramu. Opisanie schematu słownie oznacza, że musisz zinterpretować intencje pierwotnego autora. Ten krok interpretacyjny wychwytuje błędy i niejasności w oryginalnym diagramie, które automatyczne rozpoznawanie mogłoby przeoczyć lub po cichu błędnie zinterpretować. Czas spędzony na robieniu notatek to czas poświęcony na zrozumienie, a to zrozumienie dodaje wartość wykraczającą poza to, co może wytworzyć narzędzie do rozpoznawania.

Treść diagramuWynik OCRZalecane podejście
Drukowane etykiety tekstowe na schemacieWysoka dokładnośćStandardowy OCR, wyjście filtra dla rozpoznawalnych słów
Odręczne etykiety tekstoweUmiarkowana dokładnośćOCR z trybem rozpoznawania pisma ręcznego, sprawdź dane wyjściowe
Linie, strzałki, pudełka, kształtyHałas albo nicEksportuj jako obraz, dodawaj adnotacje ręcznie lub użyj narzędzia do tworzenia diagramów
Mieszane elementy tekstu i diagramuTekst odzyskany, diagram utraconyOCR dla etykiet + eksport obrazu dla struktury wizualnej
Standardowe typy diagramów (schemat blokowy, schemat organizacyjny)SłabyNarzędzie do rozpoznawania diagramów AI, a następnie ręczne czyszczenie

Przechowywanie i organizacja wyników

Po przetworzeniu każdy diagram powinien mieć trzy formy: oryginalną zeskanowaną stronę w formacie PDF, etykiety tekstowe wyodrębnione za pomocą OCR w celu umożliwienia wyszukiwania oraz wersję z adnotacjami lub rekonstrukcję za pomocą narzędzia diagramu w celu umożliwienia edycji. Przechowuj wszystkie trzy razem w systemie zarządzania dokumentami lub folderze w chmurze o spójnych nazwach. Oryginał jest wiarygodnym zapisem. Tekst OCR umożliwia wyszukiwanie. Wersja z adnotacjami lub zrekonstruowana umożliwia przyszłą edycję.

Dodaj opisowe metadane do pliku PDF zawierającego diagram. Tytuł, autor, data i krótki opis zawartości diagramu w polach Właściwości dokumentu sprawiają, że plik można znaleźć za pomocą wyszukiwania w systemie operacyjnym, nawet bez pełnego OCR. Diagram z metadanymi odczytującymi Q3-2025-Budget-Flowchart trafia do właściwej osoby poprzez wyszukiwanie według nazwy pliku, w przeciwieństwie do skanu zdjęcia tablicy bez tytułu.

WukongPDF

Wypróbuj PDF OCR

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →