PDF からテキストをコピーして Word またはテキスト エディターに貼り付けると、乱雑な破線が生成されることがよくあります。 PDF の各行は、貼り付けられた出力では個別の段落になり、改行が含まれるため、テキストを連続した散文として編集することができなくなります。 PDF から Word への変換またはコピー後にこれらの不要な改行を削除することは、検索と置換といくつかのキーボード ショートカットを使用して自動化できる書式設定のクリーンアップ タスクです。
重要なポイント
PDF テキスト抽出では、すべての視覚行の末尾にハード改行が挿入されます。テキスト エディタに貼り付けると、各行が個別の段落になります。最も早い修正は、本物の段落間の二重改行を維持しながら単一の改行を削除するワイルドカードを使用した検索と置換です。この 1 回の操作により、壊れたテキストが数秒で流れる段落に変換されます。

PDF テキストのコピーに改行が多く含まれる理由
PDF では、テキストが個別の行オブジェクトとして保存され、それぞれがページ上の特定の座標に配置されます。テキストが 1 行から次の行に連続的に流れるワード プロセッサ文書とは異なり、PDF にはテキストが流れるという概念がありません。各行は個別のオブジェクトです。テキストをコピーすると、抽出プロセスはこれらの行オブジェクトを順番に読み取り、各行オブジェクトの後に改行を挿入します。これは、段落を終了する改行と、段落内の単なる改行である改行を区別できないためです。
この問題は、複数列の PDF および書式設定されたテキスト文書から作成された PDF で最も顕著です。 PDF 内の 4 つの視覚行にまたがる段落は、貼り付けると 4 つの別々の段落になり、それぞれが段落記号で終わります。このテキストを編集するには、行を手動で結合し直す必要がありますが、段落が複数ある場合はこれが面倒です。検索と置換のアプローチにより、再結合が自動化されます。
PDF を Word に変換してみる
インストールは必要ありません。ブラウザで直接動作します。
検索と置換による単一の改行の削除
検索と置換を使用して破線を結合した後、テキストをスキャンして、保持されるべきであったのに保持されていなかった段落区切りを探します。箇条書きや番号付きリストは、それぞれが独自の行に配置されているため、最も一般的な犠牲者です。検索と置換の方法では、それらを 1 つの段落に結合します。各箇条書きまたは数字の前の改行を手動で復元します。このクリーンアップ手順には数分かかりますが、洗練された最終ドキュメントが作成されます。
コピーしたテキストをWordに貼り付けます。 Ctrl+H で検索と置換を開きます。 「検索する文字列」フィールドに「^p」と入力して段落記号と一致させます。 [置換後の文字列] フィールドにスペースを 1 つ入力します。 「すべて置換」をクリックします。文書内のすべての段落記号はスペースに置き換えられ、すべてのテキストが 1 つの段落に結合されます。これは、本物の段落間の段落記号も削除するため、あまりにも強引です。これを修正するには、まず実際の段落を区切る二重段落記号を保護します。まず ^p^p を @@PARA@@ のようなプレースホルダーに置き換えます。次に、残りの単一の ^p マークをスペースに置き換えます。最後に、@@PARA@@ を ^p^p に置き換えて段落区切りを復元します。
ワイルドカードの検索と置換のアプローチを拡張して、より複雑なクリーンアップ パターンを処理することができます。セクション見出しのあるドキュメントは、通常の改行を削除する前に、コロンと段落記号で終わる行などの見出しテキスト パターンをプレースホルダーに置き換えることによって保護できます。本文のテキスト行を結合した後、プレースホルダーから見出しの区切りを復元します。これにより、段落構造と見出しの分離の両方が保持されます。
Word では、この 3 段階のプロセスに約 30 秒かかり、あらゆる長さのテキストに適用されます。重要なのは、文書テキストのどこにも表示されないプレースホルダーを使用することです。単一の改行を置き換えると、テキストは連続した段落として流れます。元の各段落区切りは二重改行として保持されます。文書は通常の散文として編集できるようになりました。 WukongPDF の PDF Format ツールは、変換中に段落構造を保持し、コピー後に必要な手動の改行クリーンアップの量を減らします。
オンライン テキスト クリーンアップ ツールを使用して簡単に修正する
ワンクリックのクリーンアップにより、手動で行ごとに編集する作業が数分節約されます。
OCR 処理されたスキャンされた PDF からコピーされたテキストの場合、改行の問題は OCR エラーによってさらに悪化します。誤認識された各文字は、すでに壊れたテキストにノイズを加えます。この場合、改行を削除した後、テキストをスペル チェッカーにかけてください。スペル チェッカーは、改行の削除では対処できない OCR エラーを検出します。改行の削除とスペルチェックを組み合わせることで、スキャンされた文書から最もきれいな出力が生成されます。
PDF からコピーされたテキストのクリーンアップに特化した無料のオンライン ツールがいくつかあります。コピーしたテキストをツールに貼り付けると、段落区切りは保持したまま単一の改行が自動的に削除されます。これらのツールは手動の検索と置換方法と同じロジックを使用しますが、ワンクリックで適用されます。これらは、Word での検索と置換の設定がタスクに見合った以上に手間がかかる、1 回限りのテキスト クリーンアップ タスクに最適です。
オンライン テキスト クリーンアップ ツールを選択するときは、機密性の高いテキストをサードパーティの Web サイトに貼り付けることになることに注意してください。機密文書の場合は、オンライン ツールではなくローカル アプリケーションで手動の検索と置換の方法を使用します。手動の方法はオフラインでも機能し、テキストはコンピュータ上に保存され、同じ結果が得られます。
今後のコピーでの改行問題の防止
テキスト抽出の品質は、PDF の作成方法によっても異なります。通常、ワード プロセッサで生成された PDF は、スキャンや OCR で作成された PDF よりも内部テキストの順序が優れています。ワードプロセッサで生成された PDF 内のテキストの順序は、元の文書の読み上げ順序に従います。 OCR で生成された PDF 内のテキストの順序は、OCR エンジンがテキストを認識した空間順序に従います。これは、複数列または複雑なレイアウトでの読み取り順序と一致しない場合があります。
PDF からテキストを定期的にコピーする必要がある場合は、ワークフローを調整してクリーンアップの負担を最小限に抑えます。 PDF ビューアから直接コピーするのではなく、テキストをコピーする前に PDF を Word に変換します。 PDF から Word への変換ツールは、改行結合を処理し、流れるようなテキストを生成するように設計されています。変換された Word 文書にはクリーンアップが必要ですが、PDF ビューアから直接コピーしたテキストよりもはるかに少ないクリーンアップが必要です。
他の人がテキストをコピーする必要がある PDF を作成するには、PDF 作成時にアクセシビリティのタグ付けを有効にします。タグ付き PDF には、段落の開始位置と終了位置をテキスト抽出ツールに伝える構造情報が含まれています。タグ付き PDF からコピーされたテキストは、タグなし PDF からのテキストよりも大幅にきれいになります。これは、抽出ツールが行の位置から段落境界を推測する代わりに段落構造タグを使用するためです。
Word から PDF を生成する場合は、PDF エクスポート設定で [アクセシビリティのための文書構造タグ] オプションを有効にします。これにより、テキスト抽出ツールが段落境界を識別するために使用する構造情報が PDF に埋め込まれます。タグ付き PDF から抽出されたテキストでは、誤った改行が大幅に少なくなります。これは、抽出ツールが行の位置から推測するのではなく、構造タグから段落の開始位置と終了位置を認識しているためです。
よくある質問
元の PDF で使用されているフォントは、テキストのコピーのきれいさに影響しますか?はい、かなりです。標準の PostScript または TrueType フォントを適切なエンコードで使用した PDF は、カスタム エンコードされたフォントを使用した PDF よりもきれいにコピーされます。一部のカスタム フォントは非標準の文字マッピングを使用しており、文字 A として表示されるものが完全に異なる文字コードとして内部的に保存されます。このような PDF からテキストをコピーすると、抽出されたテキストにまったく間違った文字が含まれる可能性があります。 OCR ベースの抽出以外にフォント エンコードの問題を修正する方法はありません。
PDF から貼り付けたテキストの単語の途中にランダムなスペースが挿入される場合があるのはなぜですか?これはテキストの断片化と呼ばれ、PDF が個々の文字または小さな文字グループを別個のテキスト オブジェクトとして保存するときに発生します。 PDF ビューアは、テキスト抽出中にオブジェクト間にスペースを挿入します。自動修正はありません。唯一の解決策は手動校正です。適切なフォントの埋め込みとテキスト エンコーディングを使用して作成された PDF は、断片化が発生する可能性が低くなります。
改行をまったく入れずに PDF からテキストをコピーする方法はありますか?一部の PDF からテキストへの抽出ツールは、設計上、連続した段落を生成します。これらのツールはテキスト レイアウトを分析し、同じ段落に属する行を結合します。出力はコピーして貼り付けるよりもきれいですが、標準の選択してコピーする方法ではなく抽出ツールを使用する必要があります。頻繁にテキストを抽出する場合は、専用の抽出ツールに投資すると、クリーンアップ時間を大幅に節約できます。
貼り付けた PDF テキストの単語の途中に余分なスペースが含まれる場合があるのはなぜですか?
これは、PDF が各文字または文字の小さなグループを、間に小さな隙間のある個別のテキスト オブジェクトとして保存する場合に発生します。テキスト抽出プロセスでは、各ギャップにスペースが挿入されます。スペースは正当な単語スペースと区別できないため、これを自動的に修正する方法はありません。手動による校正と修正が唯一の解決策です。適切なフォント埋め込みを使用して PDF を作成すると、文字レベルのテキストの断片化の発生が軽減されます。
列の配置を崩さずに PDF 表からテキストをコピーできますか?
標準のコピー&ペーストではテーブル構造が保持されません。すべての列のテキストが読み上げ順に抽出され、混乱したシーケンスが生成されます。列を保持したままテーブル データをコピーするには、テーブル構造を検出する PDF から Excel への変換ツールを使用します。 Excel 出力では列の配置が保持され、構造をそのままにして Excel からコピーできます。
PDF ビューアはテキストのコピーのきれいさに影響しますか?
はい。一般に、Adobe Acrobat のテキスト抽出が最もクリーンです。ブラウザベースのビューアは、テキスト抽出ではなく表示用に最適化されているため、改行が多くなることがよくあります。テキストを頻繁にコピーする必要がある場合は、ブラウザベースのビューアではなく、抽出に専用の PDF リーダーを使用してください。
PDF を Word に変換してみる
インストールは必要ありません。ブラウザで直接動作します。
