Sie konvertieren eine sauber formatierte PDF-Tabelle in Excel, öffnen die Ausgabe und stellen fest, dass aus zwei separaten Zahlenspalten im PDF eine einzelne Spalte mit Werten wie „1.2503.780“ geworden ist. in jeder Zelle. Zwei numerische Werte aus benachbarten Spalten wurden zu einer Textzeichenfolge verkettet und die Daten sind nun für die Berechnung unbrauchbar. Dies ist die häufigste Beschwerde bei der Konvertierung von PDF in Excel und geschieht, weil der Konverter falsch eingeschätzt hat, wo eine Spalte endet und die nächste beginnt.
Die Erkennung von Spaltengrenzen in PDF-Tabellen ist ein grundsätzlich schwieriges Problem, da PDFs keine Tabellenstruktur enthalten. Eine PDF-Tabelle besteht lediglich aus Text, der an bestimmten Koordinaten positioniert ist und in dessen Nähe horizontale und vertikale Linien gezeichnet sind. Der Konverter muss die Spaltengrenzen aus dem Abstand zwischen Textblöcken, aus der Ausrichtung des Textes über Zeilen hinweg oder aus der Position der gezeichneten Linien ableiten. Wenn numerische Spalten schmal sind und die Zahlen in benachbarten Spalten nahe beieinander liegen, führt der Konverter sie möglicherweise in einer einzigen breiteren Spalte zusammen und liest beide Zahlen als eine Textzeichenfolge. Der Konverter sieht eine kontinuierliche horizontale Zahlenreihe und kann nicht erkennen, wo sich im ursprünglichen Layout der Spaltenumbruch befand.

Warum benachbarte numerische Spalten besonders anfällig für Zusammenführungen sind
Numerische Spalten in PDF-Tabellen sind in der Regel schmal, da die Zahlen kurz sind. Eine Spalte mit Währungswerten könnte Einträge wie „1.250,00“ enthalten. oder "42,50" selten länger als 12 Zeichen. Zwei schmale numerische Spalten nebeneinander, z. B. „Stückpreis“ und „Erweiterter Preis“ Zwischen ihnen liegen oft nur ein paar Punkte Leerraum. Wenn der Spaltenaufteilungsalgorithmus des Konverters einen Mindestlückenschwellenwert verwendet, der größer als die tatsächliche Lücke zwischen den Spalten ist, betrachtet er die beiden Spalten als eine und verkettet ihre Werte.
Das Problem wird durch rechtsbündige Zahlen noch verschärft. In einer gut formatierten PDF-Tabelle sind numerische Spalten rechtsbündig ausgerichtet, sodass die Zahlen in jeder Zeile an derselben horizontalen Position enden. Der Abstand zwischen dem Ende einer rechtsbündigen Zahl in Spalte A und dem Anfang einer linksbündigen Zahl in Spalte B kann nur wenige Punkte betragen. Eine visuelle Prüfung der PDF-Datei zeigt eine deutliche Lücke, aber der Algorithmus des Konverters erfordert möglicherweise eine größere Lücke, um eine Spaltengrenze sicher zu identifizieren, wobei der schmale Raum als normaler Wortabstand und nicht als Spaltentrenner behandelt wird.
Ein ähnliches Problem tritt bei der Notation negativer Zahlen und Klammern auf. Ein Wert, der als „(1.250,00)“ angezeigt wird enthält sowohl eine Klammer als auch ein Komma, die ein Konverter als mehrere separate Token interpretieren kann. Die öffnende Klammer wird mit der vorherigen Spalte verknüpft, der numerische Teil wird in der aktuellen Spalte platziert und die schließende Klammer wird gelöscht oder an die nächste Spalte angehängt. Das Ergebnis ist eine Zelle mit Teildaten, die eine umfangreiche manuelle Bereinigung erfordert. Tabellen mit europäischer Zahlenformatierung, bei der das Komma ein Dezimaltrennzeichen und der Punkt ein Tausendertrennzeichen ist, verwirren Konverter, die eine US-amerikanische Zahlenformatierung annehmen, zusätzlich.
Versuchen Sie es mit PDF in Excel
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
So identifizieren Sie Problemtabellen vor der Konvertierung
Öffnen Sie vor dem Konvertieren das PDF und vergrößern Sie den Tabellenbereich. Suchen Sie nach Spalten, in denen der Abstand zwischen dem Zeichen ganz rechts einer Spalte und dem Zeichen ganz links der nächsten Spalte optisch klein ist, weniger als etwa eine Zeichenbreite. Dies sind die Spalten, die bei der Konvertierung am wahrscheinlichsten zusammengeführt werden. Wenn Sie Tabellen mit diesen engen Spaltenabständen sehen, planen Sie eine manuelle Korrektur nach der Konvertierung ein oder ziehen Sie eine alternative Extraktionsmethode in Betracht.
Suchen Sie auch nach Tabellen, die Führungspunkte und Punktreihen verwenden, die einen linksbündigen Artikelnamen mit einem rechtsbündigen Preis verbinden. Führungspunkte befinden sich im Raum zwischen den Spalten und werden häufig fälschlicherweise als Daten und nicht als visuelle Formatierung interpretiert. Ein Konverter, der Führungspunkte als Inhalt behandelt, erzeugt eine Spalte, die nur Punkte enthält, oder teilt die Tabelle falsch auf, weil er die Führungspunkte nicht von den Daten unterscheiden kann. Ein weiterer Problempunkt sind Tabellen mit zusammengeführten Kopfzellen, die sich über mehrere Spalten erstrecken. Der Konverter erkennt einen breiten Textblock in der Kopfzeile und ordnet ihn möglicherweise nicht korrekt den schmaleren Datenspalten darunter zu.
Bei kritischen Daten, bei denen es auf Genauigkeit ankommt, ist die Extraktion von PDF-Daten extrahieren mit spezieller Tabellenerkennungssoftware zuverlässiger als die allgemeine PDF-zu-Excel-Konvertierung. Speziell für Tabellen entwickelte Datenextraktionssoftware verwendet mehrere Signale, Textposition, Schriftartmetriken, Zeilenposition und Ausrichtungskonsistenz über Zeilen hinweg, um ein genaueres Spaltenmodell zu erstellen. Die zusätzlichen Kosten für spezielle Extraktionssoftware sind gerechtfertigt, wenn die Alternative darin besteht, jede konvertierte Tabelle stundenlang manuell in Excel zu bereinigen.
Manuelle Korrekturstrategien für zusammengeführte Spalten
Wenn zusammengeführte Spalten unvermeidbar sind, ist die Excel-Funktion „Text in Spalten“ das schnellste Korrekturwerkzeug. Wählen Sie die zusammengeführte Spalte aus, öffnen Sie „Daten“, „Text in Spalten“ und wählen Sie „Getrennt“. Wenn die zusammengeführten Werte durchgängig durch ein Leerzeichen getrennt sind, wählen Sie „Leerzeichen“ als Trennzeichen. Wenn sie durch eine variable Anzahl von Leerzeichen getrennt sind, wählen Sie „Feste Breite“ und platzieren Sie die Spaltenumbruchlinie manuell zwischen den beiden Werten. Excel zeigt eine Vorschau der Aufteilung an, bevor es sie anwendet, sodass Sie die Bruchposition anpassen können, bis die Aufteilung für alle Zeilen korrekt ist.
Für Werte, die ohne Trennzeichen zusammengeführt wurden, wie zum Beispiel „12503780“ wobei die Aufteilung zwischen „1250“ und „1250“ liegen sollte. und „3780“, Text in Spalten kann nicht helfen, da es kein Trennzeichen zum Teilen gibt. Sie müssen die erwartete Breite jeder Spalte kennen. Wenn die erste Spalte immer vier Ziffern und die zweite immer vier Ziffern enthält, verwenden Sie die LINKS- und RECHTS-Funktionen von Excel mit den bekannten Zeichenanzahlen, um die Werte in separate Spalten zu extrahieren. Dieser Ansatz funktioniert nur, wenn die Spaltenbreiten fest und konsistent sind, was bei Tabellen üblich ist, die aus Datenbanksystemen mit festen Feldbreiten exportiert werden.
WukongPDF konvertiert PDF-Tabellen in Excel mit Spaltenerkennung, die Textausrichtung, Abstände und Zeilenposition analysiert, um Spaltengrenzen selbst in eng beieinander liegenden numerischen Tabellen zu identifizieren. Bei der Konvertierung bleibt die numerische Formatierung erhalten, sodass extrahierte Werte ohne manuelle Bereinigung sofort für die Berechnung verwendet werden können. Für komplexe Tabellen, die sich der automatischen Spaltenerkennung widersetzen, sollten Sie die Verwendung eines OCR-basierten Ansatzes als alternativen Pfad in Betracht ziehen. Machen Sie einen Screenshot der PDF-Tabelle, lassen Sie ihn durch ein OCR-Tool mit Tabellenerkennungsfunktionen laufen und exportieren Sie die erkannte Tabelle nach Excel. Moderne OCR-Engines mit Tabellenstrukturerkennung sind bei der Spaltentrennung oft zuverlässiger als herkömmliche PDF-zu-Excel-Konverter, da sie das visuelle Layout direkt analysieren.
Versuchen Sie es mit PDF in Excel
Keine Installation erforderlich. Funktioniert direkt in Ihrem Browser.
