Others

Excel の変換中に PDF テーブルの行と列が入れ替わるのはなぜですか

PDF から Excel にテーブル データを抽出すると、行と列が元のテーブルと一致するスプレッドシートが生成されます。ただし、出力が転置される場合があります。行は列になり、列は行になり、データはスクランブルされます。これはランダムなエラーではありません。これには、PDF から Excel への変換エンジンがテーブルの視覚的なレイアウトを解釈する方法に関連した特定の原因があります。転置が発生する理由を理解すると、正しい方向の出力を生成する変換設定を選択するのに役立ちます。

重要なポイント

PDF から Excel への転置は、変換エンジンが表の読み取り方向を誤って認識した場合に発生します。通常は、結合されたセル、一貫性のない列幅、または視覚的には行に配置されているが PDF 内では列順に保存されているテキストが原因です。修正方法は原因によって異なります。変換設定を調整したり、PDF を前処理してテーブル構造を明確にしたり、Excel 出力を後処理してデータを正しい方向に戻したりすることは、すべてさまざまな根本原因に対処します。

Why Do PDF Tables Swap Rows and Columns During Excel Conversion

抽出中に PDF テーブル データが転置される理由

章のタイトルとページ番号を接続するドットを含む目次など、列間にリーダー ドットやその他の視覚的な接続を使用する表は、リーダー ドットが連続した視覚的な線を作成し、検出アルゴリズムが行の区切り文字として解釈するため、ほぼ確実に転置されます。後で表を Excel に変換する場合は、PDF を作成する前にソース文書からリーダーのドットを削除してください。

PDF の内部構造は、視覚的なレイアウトと同じくらい重要です。画面上では完全に整列して見える表が、視覚的に読み取れる順序と一致しない順序でテキスト オブジェクトとして保存される場合があります。 PDF 作成ソフトウェアによってテキスト オブジェクトの順序が決定されます。一部のアプリケーションでは、ドキュメントに追加された順序でテキスト オブジェクトを書き込みます。これは、行ごとではなく列ごとである場合があります。これが、同一に見える 2 つの PDF が異なる変換結果を生成する理由です。内部のテキスト オブジェクトの順序が異なります。

PDF テーブルはファイル内にテーブルとして保存されません。これは、ページ上の特定の座標に配置された個別のテキスト オブジェクトとして保存されます。変換エンジンはこれらの座標を調べて、どのテキスト オブジェクトがどの行と列に属するかを推測する必要があります。推論アルゴリズムは、テキストの水平方向と垂直方向の配置を使用して、テキストを行と列にグループ化します。配置があいまいな場合、アルゴリズムは最初に垂直方向の配置によってテキストをグループ化し、行であるべき列を生成することがあります。

結合されたセルは、転置の最も一般的なトリガーです。複数の列にまたがるヘッダー行を持つテーブルでは、最上行がその下の列境界と一致しない視覚的な構造が作成されます。変換エンジンは、結合されたヘッダーとその下の個々の列を 2 つの異なる配置パターンとして認識します。マージされたヘッダーを複数列の行として解釈したり、その下の列を複数行のデータとして解釈したりする場合があり、曖昧さにより転置が発生します。最初の列に複数の行にまたがる結合されたセルが含まれるテーブルも同様に問題になります。垂直方向の結合により、エンジンがデータを水平方向にグループ化するために使用する行の配置が混乱するためです。

WukongPDF

PDFをExcelに変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

転置を防ぐために変換設定を調整する

PDF テーブルがブラウザの印刷機能を使用して Web ページから生成された場合、PDF 内のテーブル構造は、専用のレポート アプリケーションのテーブルよりも構造化されていない可能性があります。ブラウザで生成された PDF では、テキスト要素間の位置合わせが緩いことが多く、表の検出が非常に困難になります。可能な場合は、ブラウザから印刷するのではなく、元のアプリケーションから表を PDF にエクスポートすると、最も信頼性の高い変換結果が得られます。

一部の PDF 表では、読者の視覚補助として行の色を交互に使用しています。これらの色が交互に現れると、異なる色の行が異なるテーブル セクションに属しているとみなされるため、テーブル検出アルゴリズムが混乱する可能性があります。変換前に PDF から背景色を取り除くか、最初にグレースケールに変換すると、この混乱の原因が取り除かれ、表構造検出の一貫性が向上します。

変換ツールにテーブル検出モードが含まれている場合は、それを有効にします。表の検出は、表の構造を示すグリッド線、背景の陰影、および一貫したテキストの配置パターンを探すようにエンジンに指示します。このモードでは、デフォルトのテキスト抽出を超えた追加の分析が適用され、行と列の方向を正確に識別できる可能性が高くなります。一部のツールは「転置出力」も提供します。デフォルトの抽出で転置されたデータが生成される場合を処理するために特別にチェックボックスをオンにします。出力が転置され、ツールにこのオプションがある場合、2 回目の変換試行時にチェックすると、正しい方向が生成されます。

スキャンされたテーブルから PDF データを抽出 の場合は、特にテーブル モードで OCR を実行します。一般的なテキスト認識用に設計された OCR エンジンは、テキスト ブロック間の空間的関係を保持しない場合があります。テーブル モードの OCR エンジンは、認識された出力の行と列の構造を保持します。 WukongPDF の PDF から Excel へのコンバーターには、視覚的な配置とコンテンツ パターンの両方に基づいて行と列の関係を識別する自動テーブル構造検出機能が含まれており、一般的なテキスト抽出と比較して転置の可能性を低減します。

変換後の修正: Excel データを元に戻す

転置後、各列のデータ型を確認します。転置されたデータには同じ列にヘッダー ラベルが含まれていたため、Excel は転置後の数値列をテキストとして解釈した可能性があります。各列を選択し、データ型が内容と一致していることを確認します。テキストとしてフォーマットされた数値は正しく計算されず、テキストとしてフォーマットされた日付は時系列に並べ替えられません。転置後にデータ型を修正して、スプレッドシートが完全に機能するようにします。

出力が転置され、再変換が現実的でない場合、Excel では数回クリックするだけでデータを転置できます。転置されたデータ範囲を選択してコピーし、新しい場所で右クリックし、貼り付けオプションで [転置] を選択します。行と列が交換され、元の方向が復元されます。これは、行と列の反転だけが問題となる単純なテーブルでは完全に機能します。結合されたセルを含む複雑な表の場合、Excel での転置では結合されたセルが正しく処理されず、最悪の形で元とは異なるレイアウトが生成される可能性があります。

転置する前に、元の PDF テーブルと Excel 出力を比較して、転置だけが問題であることを確認します。出力にセルの位置がずれている場合、データの欠落がある場合、またはセルが正しく結合されていない場合、転置してもそれらの問題は解決されません。このような場合は、手動でデータを再構築するか、異なる設定で再変換する必要があります。転置修正は、データが完全で正しく配置されているものの方向が間違っているという特定のケースに対するワンクリックのソリューションです。

よりクリーンなテーブル抽出のための PDF の前処理

PDF テーブルが SAP、Oracle Reports、従来のメインフレーム システムなどの特定のアプリケーションによって作成された場合は、その特定のアプリケーションの PDF 出力に関する既知の変換の問題をオンラインで検索してください。エンタープライズ レポート システムでは、予測可能なテーブル構造の癖を持つ PDF が生成されることが多く、他のユーザーがその特定のソースに最適な変換設定を文書化している可能性があります。ターゲットを絞った検索により、複数のコンバージョン アプローチをテストする試行錯誤が不要になります。

特定の PDF が複数の変換試行にわたって一貫して転置された出力を生成する場合は、変換する前に PDF を前処理します。 PDF エディターを使用して、表検出アルゴリズムを混乱させる可能性のある背景の陰影、グリッド線、または装飾要素を削除します。白の背景に黒のテキストがあり、細く一貫したグリッド線があるきれいな表は、行の色が交互になり、太い枠線があり、アイコンが埋め込まれている表よりも確実に変換されます。変換前に視覚的なノイズを除去すると、変換エンジンがテーブル構造を正しく識別する能力が向上します。

スキャンされたテーブルの場合は、スキャンが完全に真っ直ぐになるように調整します。テーブルを 1 度の角度でスキャンすると、すべての行がわずかに傾き、変換エンジンがその傾きを列の配置として解釈する可能性があります。ほとんどのスキャン ソフトウェアには、ページを自動的にまっすぐにするデスキュー オプションが含まれています。スキャンする前にこのオプションを有効にするか、変換する前にスキャンした PDF でデスキュー ツールを使用します。行と列を正しく検出するには、まっすぐな行が不可欠です。

よくある質問

PDF テーブルを Excel ではなく CSV に変換すると、転置の問題は回避されますか? CSV 変換では、Excel 変換と同じテーブル検出アルゴリズムが使用されます。アルゴリズムがデータを転置すると、CSV 出力も転置されます。出力形式は検出ロジックには影響しません。 CSV には、テキスト エディターで調べやすいという利点があります。ファイルを開いて、予想される 5 列が 20 列になっていることがすぐに確認できるため、転置がすぐに表示されます。

特定の種類の PDF テーブルでは転置が起こりやすくなりますか?

はい。ヘッダー セルが結合されたテーブル、行ごとの列数が一貫していないテーブル、および最初の列がテキストの縦方向を使用しているテーブルは、転置される可能性が最も高くなります。単純で均一なグリッド構造を持つテーブルは、ほとんど転置されません。テーブルが規則的であるほど、変換の信頼性が高くなります。

転置された Excel 出力の検出と修正を自動化できますか?

Excel 出力の列数と元のテーブルの予想される列数をチェックするのは、簡単な自動チェックです。 PDF テーブルには 5 列と 20 行があり、Excel 出力には 20 列と 5 行がある場合、データは転置されます。スクリプトはこの不一致を検出し、データを転置するか、手動レビューのためにファイルにフラグを立てることができます。この自動化された品質チェックは、データが下流のワークフローに入る前に転置を検出します。

同じ PDF テーブルが一度は正しく変換され、別の試行では転置されるのはなぜですか?

これは通常、2 回の試行でわずかに異なる変換設定が使用されているか、ファイル サイズまたは複雑さのしきい値に基づいて異なる内部処理パスを使用している変換ツールが原因です。一貫性のない結果が発生した場合は、正しい出力を生成するための正確な設定を文書化し、同様のテーブルの今後のすべての変換にその設定を使用します。

WukongPDF

PDFをExcelに変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →