Others

PDF テーブルを Excel に変換すると、隣接する数値列が 1 つのセルに結合されることがあるのはなぜですか

きれいにフォーマットされた PDF 表を Excel に変換し、出力を開くと、PDF では 2 つの別々の数値列であったものが、「1,2503,780」のような値を含む 1 つの列になっていることがわかります。各細胞の中で。隣接する列の 2 つの数値が 1 つのテキスト文字列に連結されており、データは計算には使用できなくなりました。これは、PDF から Excel への変換に関する最も一般的な苦情であり、コンバーターが 1 つの列の終了位置と次の列の開始位置を誤って判断したために発生します。

PDF にはテーブル構造が含まれていないため、PDF テーブル内の列境界の検出は基本的に難しい問題です。 PDF 表は、特定の座標に配置された単なるテキストであり、テキストの近くに水平線と垂直線が引かれています。コンバーターは、テキスト ブロック間の間隔、行全体のテキストの配置、または描画された線の位置から列の境界を推測する必要があります。数値列が狭く、隣接する列の数値が互いに接近している場合、コンバータはそれらを 1 つの幅の広い列にマージし、両方の数値を 1 つのテキスト文字列として読み取ることがあります。コンバーターは連続した水平方向の数字を認識し、元のレイアウトのどこに列の区切りがあったのかを判断できません。

Why Does Converting a PDF Table to Excel Sometimes Merge Adjacent Numeric Columns Into a Single Cell

なぜ隣接する数値列が結合に対して特に脆弱なのか

PDF 表の数値列は、数値が短いため狭くなる傾向があります。通貨値の列には、「1,250.00」のようなエントリが含まれる場合があります。または「42.50」 12 文字を超えることはほとんどありません。 「単価」などの 2 つの狭い数値列が並んでいます。および「延長価格」多くの場合、それらの間にはほんの数ポイントの空白があります。コンバーターの列分割アルゴリズムが、列間の実際のギャップよりも大きい最小ギャップしきい値を使用する場合、2 つの列を 1 つと見なし、それらの値を連結します。

問題は右揃えの数値によってさらに悪化します。適切にフォーマットされた PDF 表では、数値列が右揃えになるため、各行の数値は水平方向の同じ位置で終わります。列 A の右揃えの数値の終わりと列 B の左揃えの数値の始まりの間のスペースは、数ポイント程度にすることができます。 PDF を視覚的に検査すると明らかなギャップが示されますが、コンバータのアルゴリズムでは、狭いスペースを列区切り文字ではなく通常の単語間隔として扱い、列境界を確実に識別するためにより大きなギャップが必要になる場合があります。

関連する問題は、負の数値と括弧表記で発生します。 「(1,250.00)」と表示される値。には括弧とコンマの両方が含まれており、コンバータはこれらを複数の別個のトークンとして解釈する可能性があります。左括弧は前の列に関連付けられ、数値部分は現在の列に配置され、右括弧は削除されるか次の列に付加されます。その結果、セルには部分的なデータが含まれ、大規模な手動クリーンアップが必要になります。カンマが小数点の区切り文字、ピリオドが千の位の区切り文字であるヨーロッパの数値書式設定を使用するテーブルは、米国の数値書式設定を前提とするコンバータをさらに混乱させます。

WukongPDF

PDFをExcelに変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

変換前に問題のあるテーブルを特定する方法

変換する前に、PDF を開いて表の領域を拡大します。ある列の右端の文字と次の列の左端の文字の間のスペースが視覚的に小さく、約 1 文字幅未満である列を探します。これらは、変換中にマージされる可能性が最も高い列です。このように列間隔が狭いテーブルが見つかった場合は、変換後に手動で修正することを計画するか、別の抽出方法を検討してください。

また、リーダー ドット (左揃えの商品名と右揃えの価格を接続するピリオドの行) を使用する表も確認してください。引出線のドットは列間のスペースに位置するため、視覚的な書式設定としてではなくデータとして誤って読み取られることがよくあります。リーダー ドットをコンテンツとして扱うコンバーターは、ピリオドのみを含む列を生成するか、データからリーダー ドットを区別できないためにテーブルを誤って分割します。複数の列にまたがる結合されたヘッダー セルを持つテーブルも問題の場所です。コンバーターはヘッダー行に幅の広いテキスト ブロックを認識し、それを下の幅の狭いデータ列に正しくマップしない可能性があります。

精度が重要な重要なデータの場合、汎用の PDF から Excel への変換よりも、専用の表認識ソフトウェアを使用したPDF データの抽出 抽出の方が信頼性が高くなります。表専用に設計されたデータ抽出ソフトウェアは、複数の信号、テキスト位置、フォント メトリクス、行位置、行全体の配置の一貫性を使用して、より正確な列モデルを構築します。変換されたテーブルごとに何時間もかけて Excel を手動でクリーンアップする代わりに、専用の抽出ソフトウェアの追加コストが正当化されます。

結合された列の手動修正戦略

列の結合が避けられない場合、Excel のテキストから列への機能が最も速い修正ツールです。結合された列を選択し、「データ」、「テキストを列に」を開き、「区切り文字付き」を選択します。マージされた値が一貫してスペースで区切られている場合は、区切り文字としてスペースを選択します。可変の数のスペースで区切られている場合は、「固定幅」を選択し、手動で 2 つの値の間に列区切り線を配置します。 Excel では分割を適用する前にプレビューが表示されるため、すべての行の分割が正しくなるまで分割位置を調整できます。

「12503780」など、区切り文字なしで結合された値の場合は、ここで分割は「1250」と「1250」の間にある必要があります。そして「3780」分割する区切り文字がないため、Text to Columns は役に立ちません。各列の予想される幅を知っておく必要があります。最初の列に常に 4 桁が含まれ、2 番目の列に常に 4 桁が含まれる場合は、既知の文字数で Excel の LEFT 関数と RIGHT 関数を使用して、値を別の列に抽出します。このアプローチは、列幅が固定され、一貫している場合にのみ機能します。これは、フィールド幅が固定されたデータベース システムからエクスポートされたテーブルでは一般的です。

WukongPDF は、テキストの配置、間隔、行の位置を分析して、間隔が狭い数値テーブルでも列の境界を識別する列検出を使用して、PDF テーブルを Excel に変換します。変換では数値の書式設定が保持されるため、抽出された値は手動でクリーンアップしなくてもすぐに計算に使用できます。自動列検出が困難な複雑なテーブルの場合は、代替パスとして OCR ベースのアプローチを使用することを検討してください。 PDF 表のスクリーンショットをキャプチャし、表認識機能を備えた OCR ツールでそれを実行し、認識された表を Excel にエクスポートします。テーブル構造検出を含む最新の OCR エンジンは、視覚的なレイアウトを直接分析するため、従来の PDF から Excel へのコンバーターよりも列分離の信頼性が高いことがよくあります。

WukongPDF

PDFをExcelに変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →