Die optische Zeichenerkennung erkennt dunkle Formen auf hellem Hintergrund und ordnet diese Formen bekannten Buchstabenmustern zu. Wenn der Hintergrund keine gleichmäßige helle Farbe hat, sondern ein Muster, eine Textur oder ein Wasserzeichen enthält, steht die Erkennungs-Engine vor einem grundsätzlich schwierigeren Problem. Jedes gemusterte Element auf der Seite ist ein potenzieller Fehlalarm, den die OCR vom tatsächlichen Text unterscheiden muss. Papier mit Wasserzeichen, strukturiertes Briefpapier, karierte Sicherheitsdrucke und dekorative Ränder sorgen für visuelles Rauschen, das die OCR-Genauigkeit verringert. Die Frage ist nicht, ob OCR mit diesen Hintergründen überhaupt zurechtkommt, sondern unter welchen Bedingungen es gelingt und wann die Genauigkeit unter den Punkt des Nutzens sinkt.

Wie Hintergrundmuster die Zeichenerkennung beeinträchtigen
OCR-Engines verarbeiten eine Seite, indem sie sie zunächst mithilfe eines Prozesses namens „Thresholding“ in ein binäres Schwarzweißbild umwandeln. Jedes Pixel, das dunkler als ein Grenzwert ist, wird schwarz. Jeder hellere Pixel wird weiß. Auf einer sauberen weißen Seite mit dunklem Text erzeugt die Schwellenwertberechnung ein gestochen scharfes Bild, in dem jeder Buchstabe deutlich hervorsticht. Auf einem gemusterten Hintergrund werden die Musterelemente, die dunkler als der Schwellenwert sind, zu schwarzen Pixeln, die mit dem Text vermischt werden. Die OCR-Engine versucht dann, diese Musterfragmente als Teile von Buchstaben zu interpretieren. Eine Wasserzeichenlinie, die durch die Mitte eines „e“ verläuft, kann dazu führen, dass die Engine ein „c“ mit einem verirrten Zeichen erkennt. Ein strukturierter Hintergrund mit kleinen Punkten kann dazu führen, dass die Engine Bereiche erkennt, in denen keine vorhanden sind.
Der spezifische Typ des Hintergrundmusters bestimmt die Art der OCR-Fehler. Feine Punktmuster, beispielsweise auf Sicherheitspapier oder altem Schreibmaschinenpapier, erzeugen Fleckengeräusche, die von der OCR-Engine möglicherweise als Satzzeichen oder Akzente auf Zeichen interpretiert werden. Linienmuster wie liniertes Notizbuchpapier oder Millimeterpapier erzeugen kontinuierliche Interferenzen, die mit Zeichenstrichen verschmelzen können und ein „l“ in ein „b“ verwandeln, wenn eine Linie mit der Oberlänge ausgerichtet ist. Wasserzeichen mit großem Text oder Logos erzeugen Bereiche, in denen sich die Hintergrunddunkelheit verschiebt, was dazu führt, dass die Schwellenwertermittlung entweder Text in dunklen Wasserzeichenbereichen verliert oder Wasserzeichenfragmente als Text in hellen Bereichen einfügt.
Die Dichte des Musters im Verhältnis zur Textdichte ist von großer Bedeutung. Ein Wasserzeichen, das deutlich heller als der Text ist, wie es bei den meisten professionellen Wasserzeichen der Fall ist, kann die Schwellenwertprüfung durchlaufen, ohne sichtbare Artefakte zu hinterlassen. Der Standardschwellenwert der OCR-Engine ist normalerweise so eingestellt, dass schwarzer Text von weißem Papier getrennt wird, und ein Wasserzeichen, das nur 10 bis 15 Prozent Grau registriert, kann diesen Schwellenwert vollständig unterschreiten. Am akutesten ist das Problem bei Mustern, die 40 bis 60 Prozent der Textdunkelheit erreichen und bei denen die Schwellenwertbestimmung das Muster nicht sauber vom Text trennen kann, weil sich ihre Intensitätsbereiche überlappen.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Vorverarbeitungstechniken, die die OCR-Genauigkeit auf strukturierten Hintergründen verbessern
Mehrere Bildvorverarbeitungstechniken können Hintergrundmuster reduzieren oder beseitigen, bevor die OCR-Engine die Seite verarbeitet. Die am weitesten verbreitete Technik ist das adaptive Schwellenwertverfahren, das für jeden Bereich der Seite einen anderen Helligkeitsgrenzwert berechnet, anstatt einen einzigen globalen Grenzwert zu verwenden. In Bereichen, in denen der Hintergrund gemustert ist, passt sich der adaptive Schwellenwert an, um die durchschnittliche Musterhelligkeit als Hintergrundpegel zu behandeln und so den Text beizubehalten und gleichzeitig das Muster zu unterdrücken. Die meisten modernen OCR-Programme enthalten eine adaptive Schwellenwertoption, die jedoch möglicherweise nicht standardmäßig aktiviert ist.
Eine zweite Technik ist die Frequenzfilterung unter Verwendung einer Fourier-Transformation oder eines ähnlichen mathematischen Werkzeugs. Hintergrundmuster neigen dazu, regelmäßig und periodisch zu sein, was bedeutet, dass sie bestimmte Frequenzen im Bild einnehmen. Im Gegensatz dazu ist Text unregelmäßig und weist ein breites Spektrum an Frequenzen auf. Ein Frequenzbereichsfilter kann die mit dem Hintergrundmuster verbundenen schmalen Frequenzbänder identifizieren und unterdrücken und gleichzeitig das Breitbandsignal des Textes bewahren. Diese Technik ist leistungsstark, erfordert jedoch spezielle Bildverarbeitungssoftware und wird typischerweise für groß angelegte Digitalisierungsprojekte und nicht für einzelne Dokumente verwendet.
Das OCR PDF-Tool von WukongPDF umfasst eine Bildvorverarbeitung, die häufige Hintergrundvariationen verarbeitet. Bei Dokumenten mit leichten bis mittelschweren Hintergrundmustern kann die integrierte Vorverarbeitung ausreichen, um eine brauchbare Texterkennung ohne zusätzliche manuelle Schritte zu ermöglichen. Der Schlüssel besteht darin, die Erkennung auf einer repräsentativen Seite zu testen, bevor Sie sich zur Verarbeitung eines gesamten Dokuments verpflichten. Wenn die Testseite eine akzeptable Genauigkeit liefert, fahren Sie mit dem Stapel fort. Wenn die Testseite erhebliche Fehler aufweist, muss das Bild vor der OCR möglicherweise extern vorverarbeitet werden.
Wenn die manuelle Transkription die OCR bei stark gemusterten Dokumenten übertrifft
Es gibt einen Qualitätsschwellenwert, unterhalb dessen die OCR-Ausgabe so viele manuelle Korrekturen erfordert, dass die Eingabe des Textes von Grund auf schneller wäre. Bei Dokumenten mit starken Hintergrundmustern, dichten Wasserzeichen oder Sicherheitsdrucken, die die gesamte Seite bedecken, kann OCR Text erzeugen, bei dem 20 Prozent oder mehr der Zeichen falsch sind. Die Korrektur eines von fünf Zeichen in einem mehrseitigen Dokument dauert länger als die Neueingabe des Inhalts, insbesondere wenn die Fehler nicht offensichtlich sind, wie etwa ein eingefügter Punkt an der Stelle, an der ein Punkt im Hintergrund falsch gelesen wurde, wodurch sich die Bedeutung eines Satzes ändert, ohne dass dies beim Korrekturlesen leicht zu erkennen ist.
Die wirtschaftliche Entscheidung hängt von der Länge des Dokuments und der erforderlichen Genauigkeit ab. Ein einseitiger Brief auf Briefpapier mit Wasserzeichen kann in wenigen Minuten manuell transkribiert werden. Ein 200-seitiges Buch, das auf strukturiertem Papier gedruckt ist, bedeutet wochenlange manuelle Arbeit, und selbst eine unvollständige OCR, die 85 Prozent des Textes korrekt erfasst, verschafft einen erheblichen Vorsprung. Bei großen Projekten ist der optimale Arbeitsablauf oft OCR mit aggressiver Vorverarbeitung, gefolgt von einer menschlichen Überprüfung der Ausgabe, wobei akzeptiert wird, dass der Überprüfungsschritt musterbedingte Fehler identifiziert und korrigiert. Die Pipeline Gescanntes PDF zu durchsuchbarem Text funktioniert am besten, wenn die Erwartungen an die Genauigkeit auf den Schwierigkeitsgrad des Quellmaterials abgestimmt sind.
Auswahl der richtigen Scaneinstellungen zur Minimierung von Hintergrundstörungen
Wenn Sie den Scanvorgang steuern, können verschiedene Einstellungen die Sichtbarkeit des Hintergrundmusters verringern, bevor das Bild überhaupt die OCR-Engine erreicht. Durch das Scannen in Graustufen statt in Farbe werden farbbasierte Muster wie getönte Wasserzeichen oder farbige Sicherheitsfäden eliminiert, die andernfalls zu Kontrastschwankungen führen würden. Wenn Sie die Helligkeit des Scanners etwas höher als normal einstellen, werden helle Hintergrundmuster unter die Erkennungsschwelle gedrückt, während dunkler Text erhalten bleibt. Eine Helligkeitserhöhung von 10 bis 15 Prozent reicht oft aus, um Wasserzeichen zu entfernen, ohne die Lesbarkeit des Textes zu beeinträchtigen.
Einige Scanner verfügen über eine Hintergrundentfernungs- oder Hintergrundglättungsfunktion, die speziell für Dokumente auf farbigem oder gemustertem Papier entwickelt wurde. Diese Funktion analysiert die Seite, identifiziert die vorherrschende Hintergrundfarbe oder das dominierende Hintergrundmuster und normalisiert sie dann auf Weiß, wobei der Vordergrundinhalt erhalten bleibt. Sofern verfügbar, sollte diese Einstellung für jedes Dokument aktiviert werden, das einer OCR unterzogen wird. Die Verbesserung der Erkennungsgenauigkeit durch saubere Quellbilder übertrifft bei weitem das, was durch Bildverarbeitung nach dem Scan erreicht werden kann.
Bewertung der OCR-Genauigkeit bei gemusterten Dokumenten: Was zu akzeptieren und was erneut einzugeben ist
Der praktische Schwellenwert für eine akzeptable OCR-Genauigkeit hängt davon ab, wie der extrahierte Text verwendet wird. Für die Volltextsuche in einem Dokumentenarchiv kann eine Genauigkeit von 80 Prozent ausreichend sein. Bei der Suche nach einem bestimmten Namen oder einer bestimmten Kontonummer wird das Dokument auch dann noch gefunden, wenn 20 Prozent des umgebenden Textes Fehler enthalten. Zum Extrahieren von Text, der erneut veröffentlicht, zitiert oder in weiteren Analysen verwendet wird, ist eine Genauigkeit von 95 Prozent ein angemesseneres Minimum. Unterhalb dieser Grenze nähert sich der Zeitaufwand für die Korrektur von OCR-Fehlern der Zeit an, die für die manuelle Transkription des Dokuments erforderlich wäre. Die Entscheidung, ob die OCR-Ausgabe akzeptiert oder von Grund auf neu eingegeben werden soll, sollte auf einer gemessenen Genauigkeitsbewertung basieren und nicht auf einem Eindruck, der durch einen Blick auf einige Seiten entsteht.
Um die OCR-Genauigkeit zu messen, muss eine Probe des erkannten Textes mit dem Originaldokument verglichen werden. Wählen Sie drei bis fünf repräsentative Seiten aus, zählen Sie die Gesamtzahl der Zeichen im Original, zählen Sie die Anzahl der Zeichenfehler in der OCR-Ausgabe, einschließlich Ersetzungen, Einfügungen und Löschungen, und berechnen Sie die Fehlerrate. Diese Messung dauert zehn bis fünfzehn Minuten und bietet eine objektive Grundlage für die Entscheidung, ob mit der automatischen Korrektur, der manuellen Überprüfung oder der vollständigen Neueingabe fortgefahren werden soll. Die Messung identifiziert auch, welche Arten von Fehlern am häufigsten vorkommen, und leitet so die Wahl der Korrekturstrategie. Wenn sich die Fehler auf bestimmte Mustertypen konzentrieren, können sie möglicherweise durch eine gezielte Vorverarbeitung behoben werden. Wenn die Fehler zufällig verteilt sind, wird die OCR-Genauigkeit durch die grundlegende Qualität des Quellbilds und nicht durch ein bestimmtes korrigierbares Problem begrenzt.
Hintergrundmuster auf Papier wurden nie im Hinblick auf OCR entworfen. Sie dienen Zwecken von der Markenidentität über die Fälschungssicherheit bis hin zur einfachen dekorativen Anmutung. Die aus diesen Dokumenten erfassten PDF-Bilder übertragen die Muster in den digitalen Bereich, wo sie zu Hindernissen für die Textextraktion werden. Wenn Sie wissen, welche Muster durch Vorverarbeitung gemildert werden können und welche manuelle Arbeit erfordern, können Sie fundierte Entscheidungen zu jedem Dokument treffen, anstatt bei jedem Scan den gleichen OCR-Workflow anzuwenden und auf das Beste zu hoffen. Die Zeit, die Sie in das Verständnis der spezifischen Hintergrundherausforderungen Ihres Dokuments investieren, zahlt sich durch höhere Genauigkeit, weniger manuelle Korrekturen und eine digitale Textausgabe aus, die den Originalinhalt originalgetreu wiedergibt.
OCR auf gemusterten Hintergründen ist die Schnittstelle zwischen Scantechnologie, Bildverarbeitung und Dokumenten-Workflow-Design. Es gibt keine einzelne Technik, die alle Herausforderungen im Zusammenhang mit gemusterten Hintergründen löst, aber die Kombination aus geeigneten Scaneinstellungen, adaptiver Vorverarbeitung und realistischen Genauigkeitserwartungen führt für die überwiegende Mehrheit der Dokumente zu brauchbaren Ergebnissen. Die Werkzeuge sind vorhanden und die Techniken sind gut etabliert. Durch deren systematische Anwendung wird aus einem frustrierenden OCR-Fehler ein überschaubarer Qualitätskontrollprozess.
Probieren Sie PDF-OCR aus
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
