Tips & Tricks

PDF を Word に変換し、列構造を維持する方法

複数列の PDF レイアウトを Word に変換すると、さまざまな列のテキストが 1 つのフローに混在した文書が生成されることがよくあります。 2 段組の研究論文は、1 つの長くてごちゃ混ぜな段落になります。 3 段組みのニュースレターが読めなくなります。 PDF から Word への変換中に列構造を維持するには、元のレイアウト ジオメトリを認識して維持し、各列を 1 つに結合するのではなく独立したテキスト フローとして扱う変換設定が必要です。

重要なポイント

PDF から Word への変換ツールは、各ページ上のテキストの空間配置を分析することで、複数列のレイアウトを処理します。列検出をサポートするツールは、テキスト ブロック間のギャップを特定し、列の読み取り順序を再構築します。カラム保存の品質は、変換ツールによって大きく異なります。単純な 2 列レイアウトのドキュメントは、ほとんどのツールで適切に変換されます。テキストと画像が重なった複雑な雑誌スタイルのレイアウトを持つドキュメントは、変換後に手動でクリーンアップする必要がある場合があります。

How to Convert PDF to Word and Keep the Column Structure

PDF 変換中の列検出の仕組み

元の PDF のフォント サイズと行間隔は、列検出の精度に影響します。 8 ポイントの財務表など、テキストが非常に小さい文書では、列間の空白が比例して小さくなるため、検出アルゴリズムが困難になります。元のドキュメントで許可されている場合は、PDF を作成する前にフォント サイズまたは列間隔を大きくすると、変換結果が向上します。ソースドキュメントが利用できない既存の PDF の場合、小さなテキストの複数列レイアウトでは手動によるクリーンアップがさらに必要になることを受け入れてください。

列検出をサポートするPDF Converter は、各ページのテキスト ブロックの水平位置を分析します。同じ左端を共有し、一定の幅内に収まるテキスト ブロックは 1 つの列にグループ化されます。次にコンバータは、次の列に移動する前に各列を上から下に読み取ります。これにより、各列のテキストが個別のテキスト フロー内にある Word 文書が作成されます。Word では、リンクされたテキスト ボックス、または PDF 列ごとに 1 列の表として表されます。

検出アルゴリズムは、一貫した列幅と列間のギャップの解消に依存しています。列間に 2 ミリメートルの隙間がある文書では、このような狭い隙間は列の境界ではなく通常の単語の間隔として解釈される可能性があるため、アルゴリズムに問題があります。幅の広いメイン列と狭いサイドバーなど、列の幅が等しくない文書も、列とインデントされた段落を区別する必要があるため、アルゴリズムに課題を与えます。列検出は、標準レイアウト (少なくとも 5 ミリメートルの空白で区切られた同じ幅の列) のドキュメントで最も効果的に機能します。

WukongPDF

PDF を Word に変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

列保持のための変換設定

自動設定を使用しても適切に変換できない複雑な複数列レイアウトを持つ文書の場合は、Word 以外の形式への変換を検討してください。 PDF を Adobe InDesign や Affinity Publisher などのデスクトップ パブリッシング形式に変換すると、これらのアプリケーションは最初から複数列レイアウト用に設計されているため、Word よりも列構造がより忠実に保持されます。最終的に編集したドキュメントを公開アプリケーションから PDF にエクスポートします。

最初の変換後、Word 文書を古い DOC 形式ではなく DOCX 形式で保存します。 DOCX は、列構造を含む複雑なレイアウトを DOC よりも確実に処理します。変換ツールで出力形式を選択できる場合、列の多いドキュメントには常に DOCX を選択してください。 PDF から DOC に変換して DOCX として保存すると、不要な形式変換が追加され、レイアウト エラーが発生する可能性があります。

変換された Word 文書で各列が個別のテキスト ボックスに配置される場合 (レイアウトを保持した変換の既定の動作)、Word のリンクされたテキスト ボックス機能を使用して、各テキスト ボックスからテキストを抽出し、単一の列ベースのレイアウトに流し込むことができます。テキスト ボックスを読み上げ順にリンクすると、テキストがボックス内を継続的に流れます。このアプローチでは、列レイアウトとテキストを連続的なフローとして編集する機能の両方が保持されます。

変換設定で、レイアウトの保持に関連するオプションを探します。 「流れるテキストを保持」は、テキストを編集可能な Word 段落として再構築しようとします。これは、さらに編集が必要な文書に最適です。 「ページレイアウトを保持」位置決めされたテキスト ボックスにテキストを配置します。これにより、正確な視覚的なレイアウトが維持されますが、編集が難しくなります。列を保持するには、「フローテキストを保持」を選択します。列検出を有効にすると、通常、編集可能性と構造の最適なバランスが得られます。 WukongPDF の PDF から Word へのコンバーターには、複数列のレイアウトを識別して正しい読み取り順序を再構築し、各列のテキストを個別の Word セクションに配置する列検出モードが含まれています。

コンバーターがスキャンされたドキュメントに対して OCR オプションを提供している場合は、デジタル PDF に対しても有効にします。 OCR エンジンのレイアウト分析は、多くの場合、テキスト抽出エンジンの空間分析よりも列の検出に優れています。 OCR はページを画像として処理し、テキスト領域を識別します。これにより、PDF コンテンツ ストリームを直接解析するよりも効率的に列検出が行われます。その代償として、OCR ベースの変換は遅くなり、すでにデジタル化されているテキストでは認識エラーが発生する可能性があります。列の忠実性が最優先され、文書の長さが管理可能な文書には、OCR ベースの変換を使用します。

変換後の列の手動復元

自動変換により、異なる列のテキストが間違った順序で挿入された文書が生成される場合、Word のワイルドカードを使用した検索と置換を使用すると、結合されたテキストを分離できます。元のレイアウトで列の区切りを示すパターンを検索します。たとえば、一定の数のスペースや、ある列の末尾と次の列の先頭に表示される特定の句読点パターンなどです。ワイルドカードの検索と置換は、各段落を手動で切り取って貼り付けて正しい列順序に戻すよりも高速です。

左側の列に元の言語、右側に翻訳が含まれるバイリンガル文書など、列の順序が意味論的な意味を持つ文書の場合、列のペアを保持することが不可欠です。変換後、左列の各段落が右列の正しい段落に対応していることを確認してください。文書の早い段階で 1 つの位置がずれていると、後続のすべての段落に連鎖していきます。ペア列ドキュメントの検証手順は、標準の複数列レイアウトの場合よりも時間がかかりますが、ドキュメントを使用できるようにするためには必要です。

自動列検出によって混乱した結果が生成された場合、手動復元がフォールバックとなります。 Word では、[レイアウト] タブの [列] 機能を使用して、文書の各セクションに正しい列数を設定します。次に、ごちゃ混ぜの変換からのテキストを切り取って、正しい列順序に貼り付けます。これは最も時間のかかるアプローチですが、完全に構造化されたドキュメントが作成されます。 10 ページ、2 段組の論文の場合、レイアウトの複雑さに応じて手動での復元に 15 ~ 30 分かかります。

列を手動で復元する際は、元の PDF を視覚的な参照として使用します。画面の一方の側で PDF を開き、もう一方の側で Word 文書を開きます。文書をページごとに調べて、Word 文書の各列のテキストが PDF の対応する列のテキストと一致することを確認します。この並べて比較することにより、他の方法では気づかれない誤った順序の段落が見つかります。左右の列が対照的な視点を示す比較分析など、列構造に意味がある文書の場合、追加の検証時間は価値があります。

よくある質問

PDF 全体を一度に変換するのと、列の多いドキュメントの場合はページごとに変換するのはどちらが良いでしょうか?ドキュメント全体を一度に変換すると、検出アルゴリズムにさらに多くのデータを処理させることができます。ページ全体で一貫した列パターンを特定し、それらを均一に適用できます。ページごとに変換すると、アルゴリズムは各ページの列構造を個別に再検出する必要があるため、列レイアウトがすべてのページで同じであっても、一貫性のない結果が生じる可能性があります。

変換をより予測しやすくするために、一般的な PDF 列レイアウトに一致する Word テンプレートを設定できますか?はい。正しい列数、余白、フォント設定を使用して Word テンプレートを作成します。 PDF を Word に変換した後、変換されたテキストをテンプレートにインポートします。テンプレートは列構造を提供し、インポートされたテキストがその構造を埋めます。このアプローチにより、レイアウト定義がコンテンツ抽出から分離され、同様に構造化された PDF を複数回変換しても、より一貫した結果が得られます。

3 列以上の PDF を Word に変換し、すべての列をそのまま維持できますか?

はい、ただし、列の数が増えると成功率は低下します。 2 列レイアウトは最新のツールで適切に変換されます。 3 列レイアウトは、最適なツールを使用すると適切に変換されますが、クリーンアップが必要な場合があります。新聞の密度の高いページなど、4 段以上のレイアウトでは、ほとんどの場合、手動による変換後の作業が必要です。列が狭いため、検出アルゴリズムが空白のギャップを確実に識別する余地はほとんどありません。

列ベースの PDF を Word に変換すると、列間の画像やグラフィックスに影響しますか?

複数の列にまたがる画像は、テキストとは別のオブジェクトとして検出されるため、通常は正しく変換されます。テキストのインラインに配置された小さなイラストなど、列内に埋め込まれた画像は、アルゴリズムが従おうとするテキスト フローを画像が中断するため、列の検出を妨害する可能性があります。変換後、列境界付近の画像が正しく配置されていること、およびテキストが期待どおりに画像の周囲に流れていることを確認します。

スキャンした複数段組みの文書は、デジタル文書とは異なる方法で変換する必要がありますか?

スキャンされたドキュメントは、列検出の前に OCR を通過する必要があります。これにより、手順が追加されますが、機会も提供されます。 OCR はもともとまさにこのユースケースのために開発されたものであるため、ドキュメント変換用に設計された OCR エンジンは、テキスト抽出エンジンよりも高度なレイアウト分析を備えていることがよくあります。スキャンされた複数列のドキュメントに高品質の OCR エンジンを適用すると、同等のデジタル PDF に適用されたテキスト抽出エンジンよりも優れた列の保存が可能になります。

WukongPDF

PDF を Word に変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →