Others

PDF から Word にコピーするとテキストが変化したり文字化けしたりするのはなぜですか

PDF 内のテキストを選択し、コピーして Word に貼り付けると、同じテキストが生成されます。代わりに、文の途中で改行が表示されます。特殊文字はゴミ記号に変わります。フォントが変わります。きちんと整列していた段落は、ハードリターンとランダムな間隔のギザギザの混乱になります。技術的にはテキストは存在しますが、書式が破壊されています。

PDF はどこでも同じように見えるように設計されています。これらは編集できるように設計されていません。コピー&ペーストすると、そのトレードオフが明らかになります。

PDF から Word へのコピー操作中にテキストが変更される理由を理解すると、貼り付けたテキストを修正するか、適切な変換ツールを使用するか、ソース文書に戻すかを選択するのに役立ちます。 WukongPDF の PDF フォーマット 変換ツールは抽出を適切に処理し、コピー&ペーストの問題を完全に回避します。

Why Does Text Change or Garbled When Copying From a PDF to Word

PDF によるテキストの保存方法と表示方法

PDF 内では、テキストは座標グリッド上の個々の文字配置として保存されます。各文字には X 位置と Y 位置があります。 hello という単語は、(100,200) の h、(108,200) の e など、5 つの独立した文字である場合があります。これらは同じ Y 座標に隣り合って配置されているため、ビューアはこれらを単語としてレンダリングします。コピーして貼り付けると、受信アプリケーションはこれらの個々の位置から単語や文を再構築します。

再構成アルゴリズムは、単語や行の始まりと終わりをスペースに基づいて推測します。通常よりも大きい単語間隔は改行として解釈される可能性があります。段落の間隔が可変である両端揃えの段落では、アルゴリズムが混乱して改行がランダムに挿入されます。 fi や fl などの結合文字である合字には、Unicode に相当する文字が欠けている場合があり、貼り付けた出力で欠落した文字または置換された文字が生成されます。

WukongPDF

PDF を Word に変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

文の途中で改行が現れる理由

文の途中に現れるハード改行は、最も一般的なコピー&ペーストのアーティファクトです。 PDF には、ページ レイアウトに一致する行でテキストが保存されます。 1 つの視覚行から次の視覚行に折り返される文は、2 つの別個の文字位置セットとして保存されます。コピー アルゴリズムは、ある視覚行の終わりと次の視覚行の始まりの間のギャップを確認し、段落区切りを挿入します。

Word でこれらの改行を手動で修正するには、不要な改行をそれぞれ削除し、スペースを追加することになります。 1 つの段落については、ちょっとした迷惑です。 50 ページの文書の場合、1 時間の無駄な時間になります。文字位置から段落を再構築する PDF から Word へのコンバーターはこれを正しく処理し、折り返されたテキストを結合し、実際の段落境界でのみ改行を挿入します。

特殊文字とフォント置換の問題

PDF では、コピーするコンピュータにインストールされていないフォントを使用できます。コピー操作で使用できないフォントの文字が検出されると、フォールバックが置き換えられるか、文字が完全に削除されます。箇条書きは疑問符になります。 Em ダッシュは空のボックスになります。波線の引用符は直線の引用符になるか、消えます。テキストは PDF 内に存在しますが、文字エンコーディングが適切にマッピングされていないため、貼り付けターゲットで表現できません。

埋め込みフォントにより表示の問題は防止されますが、コピー&ペーストでは埋め込みフォントは転送されません。ターゲット アプリケーションは独自のフォントを使用しているため、特定の文字が欠落しているか、異なる方法でエンコードされている可能性があります。適切な PDF から Word への変換ツールは、システム クリップボードよりも賢くフォント マッピングを処理し、PDF フォント エンコーディングを Unicode に変換してすべての文字を保持します。

コピー&ペーストの問題その原因回避方法
ランダムな改行PDF はテキストを段落ではなく視覚的な行ごとに保存しますコピー&ペーストの代わりに PDF から Word へのコンバーターを使用する
特殊文字の文字化けシステムでフォントが利用できない、エンコードが一致しないソース PDF が埋め込みフォントを使用していることを確認するか、コンバータを使用してください
合字の欠落 (fi、fl、ff)合字グリフには Unicode に相当する単一のグリフはありません合字を個別の文字に分解するコンバータを使用する
失われた書式 (太字、斜体)PDF 内のテキストとは別に保存される書式設定コピー&ペーストすると書式が失われることを受け入れます。コンバーターを使用する
テキストの順序が間違っています複数列または複雑なレイアウトにより抽出が混乱するレイアウト検出付きコンバーターを使用する

コピー&ペーストの代わりに PDF から Word への変換を使用する

変換ツールは PDF の内部構造を読み取り、クリップボードでは不可能な方法で段落、表、書式設定を再構築します。出力された Word 文書では、テキスト フローが保持され、見出しが Word スタイルとして維持され、表が編集可能に保たれます。変換にはコピー&ペーストと同じ数のクリックが必要で、クリーンアップの一部を必要とする結果が得られます。

WukongPDF の変換ツールは、この再構成を自動的に処理します。 PDF をアップロードし、出力形式として Word を選択し、適切に構造化されたドキュメントをダウンロードします。変換にかかる数秒は、節約されたクリーンアップ時間として返されます。 1 ページを超える文書の場合、PDF から使用可能な Word ファイルまでの合計時間では、変換の方がコピー&ペーストよりも優れています。

非標準エンコーディングと右から左へ記述するテキストの処理

レガシー システムまたは非ラテン文字で作成された PDF では、コピー&ペーストのさらなる課題が生じます。アラビア語、ヘブライ語、中国語、または日本語のテキストを含むドキュメントでは、システムのクリップボードが正しく解釈できない可能性があるエンコード スキームが使用されています。 PDF ビューアには必要なフォントとエンコード テーブルがあるため、ビジュアル テキストは画面上で正しくレンダリングされます。クリップボードにはこれらのテーブルがないため、完全に文字化けした出力が生成されます。

多言語 PDF 用に設計された変換ツールには、クリップボードにはないエンコード検出が含まれています。 PDF のフォント エンコード テーブルを分析し、グリフ インデックスを正しい Unicode コード ポイントにマップし、適切にエンコードされたテキストを出力します。混合言語コンテンツ、英語の本文とアラビア語の脚注、図に中国語のラベルが含まれる文書の場合は、多言語対応コンバータが不可欠です。クリップボードによるアプローチは、少なくとも 1 つの言語で失敗しますが、多くの場合、すべての言語で失敗します。

ソース アプリケーションがより良い選択肢である場合

最もきれいな Word 文書は、PDF を作成したアプリケーションから得られます。 PDF が Word からエクスポートされた場合は、元の Word ファイルを再度開きます。 Google ドキュメントからエクスポートした場合は、代わりに Word ファイルとしてダウンロードします。ソース アプリケーションには、PDF がフラット化された元の書式設定、スタイル、および構造が含まれています。

PDF は配布形式であり、編集形式ではありません。これらはどこでも同じに見えるように設計されており、変更されることはありません。編集が必要な場合は、ソースに戻ります。ソースが入手できず、PDF しかない場合は、コピーアンドペーストではなく、適切な変換ツールを使用してください。このツールはこのタスクのために構築されました。クリップボードはそうではありませんでした。

WukongPDF

PDF を Word に変換してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →