PDF のテキストを操作できる形式で取得する必要があります。書式設定された Word 文書や、非表示のテキスト レイヤーを備えた検索可能な PDF ではなく、段落は段落、見出しは見出しであるプレーン テキスト ファイルです。文書構造を保持したPDF から Text への変換により、すぐに分析、再利用、またはアーカイブできるコンテンツが得られます。テキスト ファイルは任意のエディタで開くことができ、スクリプトで処理することができ、現在のドキュメント形式が廃止される可能性がある数十年後も引き続き読むことができます。
適切に構造化されたテキストのエクスポートの価値は、利便性を超えたものです。プレーン テキストは、これまでに作成された中で最もポータブルなデジタル形式です。 1970 年に書かれたテキスト ファイルは、昨日書かれたものと同じくらい簡単に開きます。 PDF をクリーンで構造化されたテキストに変換すると、ソフトウェアがどのように進化してもドキュメントのコンテンツにアクセスし続けることができます。

単純なコピー&ペーストでは段落構造が維持されない理由
PDF 内のすべてのテキストを選択してコピーすると、クリップボードは PDF コンテンツ ストリームに表示される順序でテキストを受け取ります。コンテンツ ストリームは、論理的なドキュメント構造ではなく、一連の描画命令です。元の PDF 作成者がページに合わせてテキストを折り返した箇所には改行が表示されます。段落の区切りは、クリップボードのキャプチャによって失われる余分な行間隔によって表される場合があります。見出しは、構造上の役割を示さない通常のテキストとして表示される場合があります。
コピー&ペーストの出力では、元の段落構造を復元するために手動で再フォーマットする必要があります。貼り付けたテキストに目を通し、段落の開始位置と終了位置を特定し、段落内でテキストを折り返すハード改行を削除し、段落区切りが属する位置に段落区切りを追加する必要があります。複数ページのドキュメントの場合、この手動クリーンアップはコンテンツを再入力するよりも時間がかかることがあります。
PDF 形式 のテキストの内部表現は、ワード プロセッサがテキストを表現する方法とは根本的に異なります。ワード プロセッサは、テキストを段落マーカー付きのフローとして保存します。 PDF では、テキストがページ上に配置された文字として保存されます。配置文字からフロー段落に変換するには、段落検出のための組版規則を理解する抽出ツールが必要です。
この違いを理解することが、きれいに抽出するための鍵となります。
PDF を Word に変換してみる
インストールは必要ありません。ブラウザで直接動作します。
構造化テキスト抽出ツールの使用
専用のテキスト抽出ツールは PDF をデータ レベルで分析し、論理的な文書構造を再構築します。行間隔、インデント、フォントの変更を調べることで段落の境界を検出します。大きなフォント サイズ、太字の書式設定、番号付けパターンを検出することで見出しを識別します。出力では、テキストの書式設定に反映されたドキュメント階層が保持されます。
WukongPDF は、ブラウザを通じて PDF からテキストを抽出するための PDF エクスポート 機能を提供します。抽出では、ソース PDF にそれを識別するのに十分な書式設定情報が含まれる段落構造が保持されます。書式設定のキューがない PDF の場合、抽出されたテキストは元の読み取り順序を維持します。
テキスト抽出ツールを選択するときは、定期的に処理するドキュメントと同様のドキュメントでテストしてください。テキストを抽出し、元の PDF と比較します。段落の境界が正しいこと、見出しが識別可能であること、アクセント付き文字や記号などの特殊文字が保持されていることを確認してください。ある種類のドキュメントではうまく機能するツールでも、別の種類ではうまく機能しない場合があります。
テキスト抽出中の特殊なコンテンツの処理
表は、テキスト抽出にとって最も困難なコンテンツ タイプです。 PDF 内の表はデータを行と列で視覚的に表示しますが、内部表現では読み取り順序、列順序、または予測できない順序でセルが格納される場合があります。特にテーブルを処理しないテキスト抽出ツールは、列 A の値が列 B の値の間に現れるインターリーブされたテキストを生成します。重要な表形式のコンテンツを含む PDF の場合は、プレーン テキストではなく CSV または Excel に変換することを検討してください。
箇条書き記号や番号がテキスト フローの一部としてではなく、別の位置に配置された文字として保存されている場合、箇条書きリストと番号付きリストの両方で、抽出中にその構造が失われる可能性があります。抽出されたテキストでは、リスト項目がリストに属していることが示されずに別の段落として表示される場合があります。一部の抽出ツールはリスト パターンを検出し、リスト構造を維持するために接頭辞文字を追加します。
脚注と文末脚注には空間的な課題があります。 PDF のビジュアル レイアウトでは、脚注は、それを参照するテキストから離れたページの下部に表示されます。テキスト抽出では、脚注は参照を含む段落の途中に表示されることも、無関係な段落の間に表示されることもあります。最良の抽出ツールは、脚注を文書の最後まで延期するか、段落の境界に挿入します。
抽出したテキストを最大限にクリーンにするための後処理
抽出後、テキスト ファイルに対してクリーンアップ パスを実行します。検索と置換を使用して、複数のスペースを単一のスペースに変換します。行末から末尾の空白を削除します。元の PDF をスキャンした場合、一般的な OCR アーティファクト (文字の繰り返し、単語間のスペースの欠落、句読点の誤認識) がないか確認します。
見出しの識別が重要な文書の場合は、抽出されたテキストをスキャンして、行頭の太字テキストまたはすべて大文字のテキストで始まるセクションを探します。これらの書式パターンは多くの場合、見出しを示します。プレーン テキストで文書構造を明示するには、見出しに一貫した接頭辞 (第 2 レベルの見出しの ## など) を手動でマークします。
出力テキスト ファイルのエンコーディングは、長期的な使いやすさにとって重要です。 UTF-8 は、最新のテキスト ファイルの標準エンコーディングであり、事実上すべての書記体系の文字をサポートします。 UTF-8 として保存されたテキスト ファイルは、最新のデバイスで正しく開きます。 ASCII や Latin-1 などの古いエンコーディングでは、英語以外の言語の文字が失われます。 PDF からテキストをエクスポートする場合は、エクスポート ツールが UTF-8 エンコードを使用していることを確認するか、後処理ステップとして出力を UTF-8 に変換してください。
複数の言語のテキストを含む PDF の場合、テキスト抽出では、存在するすべての言語の文字セットを処理する必要があります。フランス語やドイツ語の単語が時折含まれる英語の文書では、拡張ラテン文字セット内の文字が使用されます。英語と日本語が混在するドキュメントには、Unicode の完全なサポートが必要です。最新の抽出ツールのほとんどは多言語テキストを正しく処理しますが、英語以外のテキストを含むページで出力をテストすると、文字の処理が確認されます。
ヘッダーとフッターには、抽出中に繰り返し表示されるテキストが表示されるため、出力が乱雑になる可能性があります。各ページに表示されるページ番号、ドキュメントのタイトル、日付スタンプがメイン コンテンツと一緒に抽出されます。一部の抽出ツールでは、ヘッダーとフッターの繰り返しテキストを検出して削除できます。ツールにこの機能が含まれていない場合は、複数のページにわたって繰り返される行を識別する後処理スクリプトによって、それらの行を除外できます。
複雑な複数列レイアウトを持つ PDF の場合、テキストの抽出順序をプログラムで決定するのが難しい場合があります。 2 列の学術論文は、最初に 1 列目として抽出し、次に 2 列目として抽出する必要があります。各ページで異なる列にまたがる記事を含む新聞のレイアウトは、最良の抽出アルゴリズムでも困難を伴います。これらの文書の場合、意図した読み取り順序を復元するために、抽出されたテキストを手動で並べ替える必要がある場合があります。
抽出されたテキスト ファイルは、分析のために自然言語処理ツールでさらに処理できます。感情分析、キーワード抽出、トピック モデリングはすべてプレーン テキスト入力で機能します。 PDF をクリーン テキストに変換すると、手動での読み取りや注釈の追加が必要となるドキュメント コレクションの分析機能が利用可能になります。
合字 (2 つ以上の文字を組み合わせて 1 つのグリフにする特殊な印刷文字) を使用する PDF からのテキスト抽出では、予期しない結果が生じる可能性があります。 fi や fl などの一般的な合字は、PDF エンコードに応じて 1 つの文字として抽出されることも、2 つの別々の文字として抽出されることもあります。専門的に組版された書籍や学術雑誌によく見られる、合字が多用されている文書では、抽出されたテキストの正確性を慎重に検証する必要があります。
見開きページが 1 つの画像としてまとめてスキャンされた書籍から作成された PDF の場合、テキスト抽出では、まず各スキャン画像を左右のページに分割し、次にそれぞれの半分で OCR を実行する必要があります。見開きページの分割に失敗すると、左ページの最後の単語が右ページの最初の単語と重なったテキストが生成されます。
PDF からのプレーン テキスト出力は、さまざまな下流プロセスへの入力として機能します。テキスト分析ツールは、主要なテーマと感情を特定できます。翻訳ツールはテキストを他の言語に変換できます。検索インデックス作成ツールを使用すると、組織全体でドキュメントのコンテンツを検索できるようになります。プレーン テキスト ファイルは、PDF をテキスト処理ツールのより広範なエコシステムに接続する汎用交換形式です。
PDF のフォルダーからテキストをバッチ抽出すると、検索可能なテキスト コーパスが生成されます。抽出されたテキスト ファイルにはデスクトップ検索ツールでインデックスを付けることができ、数百もの PDF のコンテンツを 1 つの検索ボックスから検索できるようになります。この機能は、元の PDF ファイルを変更することなく、静的ドキュメント アーカイブを検索可能なナレッジ ベースに変換します。
PDF からのクリーン テキスト エクスポートは、文書コンテンツを最もポータブルで耐久性のある形式で表し、全文検索から自然言語処理、今後数十年にわたって読み続けられる形式での長期アーカイブ保存に至るまで、あらゆるユースケースに対応できます。
適切なテキスト抽出設定に時間を投資すると、ドキュメント コンテンツの検索、分析、翻訳、アーカイブの基盤として機能する、クリーンで構造化された出力が生成されます。
PDF から抽出された適切に構造化されたテキスト ファイルは、ドキュメントのコンテンツを最もアクセスしやすく、将来も使い続けられる形式で保存します。
作成されたテキスト ファイルは、今後何年にもわたってニーズに応えます。
| コンテンツタイプ | 抽出動作 | 品質に関するヒント |
|---|---|---|
| 本文の段落 | フローテキストとして抽出 | 段落区切りがオリジナルと一致していることを確認してください |
| 見出し | フォント サイズ/太字によって検出されます。 ## でマーク | 識別されたすべての見出しを確認します |
| テーブル | セルはインターリーブする場合があります。代わりに CSV エクスポートを検討してください | 表形式のデータの場合は、Excel/CSV 出力を使用します。 |
| リスト | 弾丸が失われる可能性があります。プレフィックスを手動で追加する | リスト項目がグループ化されていることを確認する |
PDF を Word に変換してみる
インストールは必要ありません。ブラウザで直接動作します。
