Ein Gescanntes PDF, das von einem Blattscanner erstellt wurde, weist häufig leicht gedrehte Seiten auf, normalerweise um ein bis fünf Grad. Jede Seite, die in einem leicht unterschiedlichen Winkel durch den Scanner geführt wird, erzeugt ein Dokument, bei dem jede Seite anders gedreht ist. Das Lesen eines solchen Dokuments ist nervig. Die leichte Neigung erschwert das Scannen von Text, und beim Drucken solcher Seiten wird Papier mit verzerrtem Inhalt verschwendet. Durch die Batch-Entzerrung wird die Drehung jeder Seite in einem einzigen Vorgang korrigiert und alle Seiten auf eine einheitliche Ausrichtung ausgerichtet.
Die Schräglagenkorrektur analysiert den Inhalt jeder Seite, typischerweise durch Erkennen des vorherrschenden Winkels von Textzeilen, und dreht die Seite um den entgegengesetzten Betrag, um den Text in die Horizontale zu bringen. Der Prozess ist automatisiert, seitenspezifisch und zerstörungsfrei. Die Seite wird weder zugeschnitten noch in ihrer Größe geändert. Es wird nur die Rotationskorrektur angewendet, die jede einzelne Seite benötigt. Ein Crop PDF-Werkzeug in Kombination mit der Schräglagenkorrektur erzeugt gescannte Dokumente, die so aussehen, als ob jede Seite perfekt gerade durch den Scanner geführt würde.
WukongPDFs PDF-Qualität-Verbesserungstools umfassen Schräglagenkorrektur und Seitenbegradigung für gescannte Dokumente. Für die Stapelverarbeitung großer gescannter PDFs bieten die unten beschriebenen speziellen Tools spezielle Entzerrungsfunktionen.

Wie Entzerrungsalgorithmen die Seitendrehung erkennen
Ein Entzerrungsalgorithmus analysiert das projizierte Histogramm der Pixelintensitäten bei verschiedenen möglichen Rotationswinkeln. Es projiziert das Seitenbild in jedem Kandidatenwinkel auf die horizontale Achse und misst, wie scharf die Textzeilen ausgerichtet sind. Im richtigen Winkel, bei dem die Textzeilen perfekt horizontal verlaufen, erzeugt die Projektion scharfe Spitzen an den vertikalen Positionen jeder Textzeile. Bei falschen Winkeln werden die Peaks über mehrere Projektionsreihen hinweg verschmiert. Der Algorithmus bewertet Winkel innerhalb des erwarteten Neigungsbereichs, normalerweise minus 10 bis plus 10 Grad, und wählt den Winkel aus, der die schärfsten Projektionsspitzen erzeugt.
Der Algorithmus berücksichtigt auch den Inhaltstyp. Eine Seite mit reinem Text und klarer Linienstruktur erzeugt ein starkes Entzerrungssignal. Eine Seite, die von einem Foto oder einer Grafik ohne klare horizontale Textlinien dominiert wird, erzeugt ein schwaches Signal, und der Algorithmus setzt möglicherweise standardmäßig eine Nullkorrektur ein, um eine Rotation aufgrund unzuverlässiger Daten zu vermeiden. Gute Entzerrungstools melden den berechneten Winkel für jede Seite, sodass Sie Seiten überprüfen können, bei denen die Korrektur falsch erscheint.
Versuchen Sie es mit „PDF zuschneiden“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
Methode 1: Gescannte Seiten von Acrobat Pro optimieren
Adobe Acrobat Pro enthält in seinen Werkzeugen zur Verbesserung gescannter Seiten eine Stapelkorrekturfunktion. Öffnen Sie die gescannte PDF-Datei und gehen Sie zu „Extras“, „Scannen und OCR“, dann „Verbessern“ und wählen Sie „Gescannte Seiten optimieren“. Aktivieren Sie im Optimierungsdialog die Option „Begradigen und Geradeausrichten“. Stellen Sie die Ausgabe auf die gewünschte Auflösung ein, normalerweise 300 DPI für Dokumente, die erneut gedruckt werden, und 150 DPI für die reine Bildschirmanzeige. Acrobat verarbeitet jede Seite, entzerrt sie einzeln und erstellt ein optimiertes PDF.
Die Schräglagenkorrektur von Acrobat ist konservativ. Es korrigiert Seiten mit deutlicher Schräglage von mehr als etwa einem Grad, kann jedoch dazu führen, dass eine sehr subtile Schräglage von weniger als einem halben Grad unkorrigiert bleibt. Für die meisten Dokumente ist dieses konservative Verhalten angemessen. Eine falsche Schräglagenkorrektur, die eine korrekt ausgerichtete Seite dreht, ist störender, als eine kaum wahrnehmbare Schräglage unangetastet zu lassen. Blättern Sie nach der Optimierung mit dem an die Breite angepassten Zoom durch das Dokument und überprüfen Sie visuell, ob die Textzeilen horizontal erscheinen. Nicht korrigierte Seiten sollten weiterhin lesbar sein.
Methode 2: ScanTailor für professionelle Batch-Entzerrung
ScanTailor ist ein Open-Source-Nachbearbeitungstool, das speziell für gescannte Dokumente entwickelt wurde. Es verarbeitet einen Stapel gescannter Seiten in mehreren Schritten, einschließlich Schräglagenkorrektur, Inhaltserkennung, Randbeschnitt und Ausgabeformatierung. Importieren Sie das gescannte PDF in ScanTailor, indem Sie zunächst die einzelnen Seitenbilder mit einem Tool wie pdfimages oder der Funktion „Alle Bilder exportieren“ von Acrobat Pro extrahieren.
ScanTailor präsentiert jede Seite mit dem erkannten Schrägwinkel überlagert. Sie können den Winkel für jede Seite, bei der die automatische Erkennung falsch war, manuell anpassen, bevor Sie die Korrektur global anwenden. Fahren Sie nach der Entzerrung mit der Inhaltsauswahl fort, um den Textbereich zu identifizieren, leere Ränder zu entfernen und dann als PDF zu exportieren. Die Verarbeitung von ScanTailor ist gründlicher als die von Acrobat Pro und sorgt für eine sauberere Ausgabe von Dokumenten, die sowohl Schräglagenkorrektur als auch Randbeschnitt erfordern.
| Werkzeug | Batch-fähig? | Genauigkeit |
|---|---|---|
| Adobe Acrobat Pro (Gescannte Seiten optimieren) | Ja, der Filter gilt für alle Seiten | Gut für leichte bis mäßige Schräglage |
| ScanTailor (Open Source) | Ja, für Chargen konzipiert | Hervorragende, seitenweise Inhaltserkennung |
| ImageMagick + Deskew-CLI | Ja, vollständig skriptfähig | Gut, verwendet den dominanten Textzeilenwinkel |
Methode 3: Befehlszeilen-Entzerrung mit ImageMagick
Für geskriptete Batch-Workflows enthält der Konvertierungsbefehl von ImageMagick einen Deskew-Operator. Der Befehl „convert input.png -deskew 40% output.png“ analysiert das Bild und wendet die erkannte Rotationskorrektur an. Der Prozentparameter, in diesem Beispiel 40 Prozent, legt den Schwellenwert dafür fest, wie viel vom Bild durch den Geraderichtungsvorgang abgedeckt wird.
Wenn es um Dokument-Workflows geht, teilen Sie zum Verarbeiten einer gesamten PDF-Datei mit ImageMagick die PDF-Datei mithilfe von pdfimages oder einem ähnlichen Tool in einzelne Seitenbilder auf. Führen Sie den Deskew-Befehl mithilfe einer Shell-Schleife für jedes Seitenbild aus. Kombinieren Sie dann die begradigten Bilder erneut zu einer PDF-Datei, indem Sie den Konvertierungsbefehl von ImageMagick verwenden, wobei die Seitenbilder der Reihe nach aufgelistet werden. Der Befehlszeilenansatz ist vollständig automatisierbar und kostenlos und eignet sich daher für die Stapelverarbeitung mit hohem Volumen, bei der die GUI-Tools zu viel manuelle Interaktion erfordern würden. Die Ausgabequalität der Schräglagenkorrektur von ImageMagick ist vergleichbar mit der von Acrobat Pro für Dokumente mit klarer Textzeilenstruktur.
Die Batch-Entzerrung verwandelt ein schief gescanntes PDF in wenigen Minuten in ein professionell begradigtes Dokument. Die automatische Korrektur wird individuell auf jede Seite angewendet und berücksichtigt die seitenweisen Abweichungen, die eine manuelle Begradigung bei Dokumenten mit mehr als einer Handvoll Seiten unpraktisch machen.
Kombinieren der Schräglagenkorrektur mit anderen Korrekturen gescannter Seiten
Die Entzerrung ist am effektivsten, wenn sie mit anderen Korrekturen gescannter Seiten in einer einzigen Verarbeitungspipeline kombiniert wird. Wenden Sie nach dem Entzerren die Inhaltserkennung an, um den Textbereich zu identifizieren und leere Ränder zu entfernen. Wenden Sie dann einen Schwellenwertfilter an, um Graustufenseiten in sauberes Schwarzweiß umzuwandeln, was die OCR-Genauigkeit verbessert und die Dateigröße reduziert. Führen Sie abschließend OCR auf den begradigten, zugeschnittenen und mit Schwellenwerten versehenen Seiten durch, um ein durchsuchbares Dokument zu erstellen.
Tools wie ScanTailor und OCRmyPDF kombinieren alle diese Schritte in einer einzigen automatisierten Pipeline. OCRmyPDF, ein Python-basiertes Befehlszeilentool, akzeptiert ein gescanntes PDF, entzerrt jede Seite, wendet adaptive Schwellenwerte an, führt OCR mit Tesseract aus und gibt ein durchsuchbares PDF mit eingebetteter OCR-Textebene aus. Der einzelne Befehl ocrmypdf --deskew input.pdf output.pdf erledigt Schräglagenkorrektur, Schwellenwertermittlung und OCR in einem Durchgang. Bei Projekten zur Digitalisierung gescannter Dokumente mit hohem Volumen verarbeitet die kombinierte Pipeline Dokumente durchgängig, ohne dass in jeder Phase manuelle Eingriffe erforderlich sind.
Kalibrieren der Deskew-Empfindlichkeit für Seiten mit gemischten Inhalten
Seiten, die Text und Fotos vermischen, wie z. B. illustrierte Bücher oder Zeitschriftenscans, stellen eine Herausforderung beim Geradeausrichten dar. Auf Fotos fehlt eine klare Ausrichtung der Textzeilen und der Entzerrungsalgorithmus kann eher durch Bildkanten als durch Text in die Irre geführt werden. Die meisten Tools ermöglichen das Festlegen eines Vertrauensschwellenwerts, der eine Korrektur verhindert, wenn der erkannte Winkel unsicher ist.
Stellen Sie bei Seiten mit gemischtem Inhalt die Empfindlichkeit für die Schräglagenkorrektur konservativ ein. Ein Versatz von 0,3 Grad ist kaum wahrnehmbar. Eine falsche Korrektur, bei der eine gute Seite um 0,5 Grad gedreht wird, ist störender, als die kleine Schräge unangetastet zu lassen. Blättern Sie nach der Stapelkorrektur durch das Dokument und identifizieren Sie die Seiten, die stärker verzerrt wurden. Setzen Sie diese Seiten manuell auf ihre ursprüngliche Ausrichtung zurück.
Die Batch-Entzerrung verwandelt ein schief gescanntes Dokument in einer professionell ausgerichteten Datei in der Zeit, die für die Ausführung eines einzelnen Befehls oder das Durchklicken eines Optimierungsdialogs erforderlich ist. Die automatische Korrektur berücksichtigt die Abweichungen pro Seite, die ein manuelles Richten unpraktisch machen. In Kombination mit Zuschneiden, Schwellenwerten und OCR ist die Schräglagenkorrektur ein Schritt in einer Verarbeitungspipeline, die Rohscans in saubere, durchsuchbare und professionell präsentierte digitale Dokumente umwandelt.
Gerade Seiten sind das erste Qualitätssignal, das der Leser in einem gescannten Dokument wahrnimmt. Bevor sie ein Wort lesen, bevor sie den Inhalt bewerten, verrät ihnen die Seitenausrichtung, ob das Dokument sorgfältig erstellt wurde. Durch die Batch-Entzerrung wird sichergestellt, dass jede Seite im Dokument das richtige Signal sendet.
Die Stapelkorrektur ist ein einzelner Schritt in der Verarbeitungspipeline gescannter Dokumente, aber es ist der Schritt, der darüber entscheidet, ob das Dokument professionell vorbereitet oder nachlässig gescannt aussieht. Gerade Seiten signalisieren dem Leser Qualität, bevor er ein einziges Wort liest. In Kombination mit Zuschneiden, Schwellenwerten und OCR verwandelt die Entzerrung Rohscans in ausgefeilte digitale Dokumente.
Versuchen Sie es mit „PDF zuschneiden“.
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
