
テキストのように見える PDF が編集できない理由
PDF を開いて画面上の単語を確認し、編集できると想定します。テキストをクリックしても何も起こらない場合、または入力しようとしてもカーソルが表示されない場合は、テキスト文書のように見える PDF が実際にはまったく編集可能な文書ではないことがわかります。 PDF には基本的に異なる形式のテキストが含まれており、その一部のみが編集可能であるため、このような経験はイライラするほどよくあります。
スキャンした PDF で OCR を実行すると、ドキュメント内の各ページ画像の背後に検索および編集可能なテキスト レイヤーが追加されます。
PDF から編集可能な形式への変換とその逆の変換は、直接編集できない場合に信頼できるフォールバックです。
PDF エディターは、PDF 内に実際のテキスト オブジェクトとして存在するテキストを変更でき、各文字は選択可能で変更可能な文字コードとして表されます。これはネイティブ テキストまたはライブ テキストと呼ばれます。 PDF 形式 には、テキストがページの写真の一部であるスキャンされた文書など、画像としてのみ存在するテキストを含めることもできます。 PDF には文字データが含まれておらず、文字の形を形成するピクセルのみが含まれているため、画像ベースのテキストを選択、検索、または編集することはできません。 PDF が編集可能かどうかを知る前に、PDF に含まれるテキストの種類を知る必要があります。
最も簡単なテストは、PDF 内のテキストを選択してみることです。単語をクリックしてドラッグします。ドラッグするとテキストが強調表示される場合、それはネイティブ テキストであり、編集できる可能性があります。何も強調表示されず、カーソルが変化しない場合、テキストは画像ベースであり、直接編集できません。テキストは強調表示されているが強調表示がむらがあり、一部の単語が選択されているが他の単語がスキップされている場合、PDF にはネイティブ テキストと視覚要素としてのみ存在するテキストが混在しています。これは、古いソフトウェアで作成された PDF や複数のソース ドキュメントを結合して作成された PDF でよく見られる状況です。
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
PDF テキストを編集できない一般的な理由
最も一般的な理由は、PDF がスキャンされたドキュメントであることです。フラットベッド スキャナーまたは携帯電話のカメラ アプリで紙のページをスキャンして作成された PDF には、実際のテキスト文字ではなくテキストの画像が含まれています。画面上の文字は読めますが、PDF ファイルには編集可能なテキスト データは含まれません。スキャンした PDF を編集可能にするには、まず OCR を実行して画像内のテキストを認識し、各ページ画像の背後に非表示のテキスト レイヤーを作成する必要があります。 OCR 後、テキストは検索可能になり、多くの PDF エディターでネイティブ テキストであるかのように編集できるようになります。
パスワードまたは権限の制限も、編集に対する一般的な障壁です。権限パスワードで保護された PDF は開いて表示できますが、権限により編集、コピー、印刷がブロックされる場合があります。 PDF を開いてテキストは表示されるが、編集ツールがグレー表示になったり、エラー メッセージが表示されたりする場合は、ドキュメントのセキュリティ設定を確認してください。ほとんどの PDF ビューアでは、[ドキュメント プロパティ] パネルまたは [セキュリティ] パネルに、どの権限が制限されているかが表示されます。編集が制限されており、権限パスワードを持っている場合は、制限を解除して編集を有効にすることができます。
PDF には、作成中にアウトラインまたは曲線に変換されたテキストが含まれる場合があります。グラフィック デザイナーは、受信者がフォントをインストールしているかどうかに関係なく、フォントが正しく表示されるように、PDF を作成する前に Adobe Illustrator などのアプリケーションでテキストをアウトラインに変換することがあります。アウトラインに変換されたテキストは、視覚的にはネイティブ テキストと同じに見えますが、文字データではなくベクトル形状で構成されます。 [PDF編集なし]ツールでは、アウトライン化の際に文字情報が破棄されるため、アウトライン化されたテキストをテキストとして編集することができません。
PDF にネイティブ テキスト文字が含まれている場合でも、フォント エンコードの問題によりテキストが編集できなくなる場合があります。一部の PDF では、非標準的な方法で文字コードをグリフにマッピングするカスタム フォント エンコーディングを使用しています。編集ツールは文字コードを認識しますが、それがどの文字を表すかを判断できないため、テキストの破損を避けるために文字コードの編集を拒否します。この問題は、特殊なソフトウェア、レガシー システム、またはカスタム フォント処理で非ラテン文字を使用するドキュメントによって生成された PDF で最もよく発生します。フォントの埋め込みを有効にして元のアプリケーションから PDF を再エクスポートすると、エンコードの問題が解決されることがよくあります。
OCR を使用してスキャンした PDF を編集可能にする方法
光学式文字認識は、テキストの画像を実際の編集可能なテキストに変換するプロセスです。最新の OCR テクノロジーは、一般的なサイズの一般的なフォントで印刷されたテキストを、明るく明るい状態できれいにスキャンするのに非常に正確です。スキャンした PDF で OCR を実行すると、認識された文字を含む各ページ画像の背後に隠しテキスト レイヤーが追加されます。 OCR が完了すると、文書内のテキストを検索し、ほとんどの PDF エディターで、認識されたテキストを元のネイティブであるかのように編集できます。
OCR 出力の品質は、スキャンされた画像の品質によって異なります。均一な照明、フラットなページ、鮮明なフォーカスを備えた 300 DPI の高解像度スキャンにより、標準的な印刷テキストに対して 99% 以上の OCR 精度が得られます。影、製本された本の湾曲したページ、または焦点の合っていない領域のある 150 DPI での低解像度スキャンでは、精度が低下し、OCR 後に手動での修正が必要になります。 OCR を念頭に置いてドキュメントをスキャンすると、つまりフラットなページ、良好な照明、適切な解像度が得られ、編集プロセスが大幅にスムーズになります。
OCR をサポートするほとんどの PDF エディターには、認識設定の一部として言語選択が含まれています。 OCR エンジンは言語固有の辞書と文字頻度データを使用してあいまいな文字を解決するため、正しい言語を選択すると精度が向上します。フランス語の文書をフランス語の言語設定で認識すると、同じ文書を英語の設定で認識するよりも良い結果が得られます。多言語ドキュメントの場合は、第一言語を選択し、第二言語の一節にあるエラーを手動で修正します。
WukongPDF の OCR PDF ツールは、スキャンされたドキュメントをブラウザーで処理し、検索可能で編集可能なテキスト レイヤーを備えた PDF を返します。 OCR エンジンは複数の言語をサポートし、手紙、フォーム、領収書、記事などの一般的な文書タイプを処理します。 OCR 後、それまで編集できなかったスキャンされた PDF が編集可能になり、認識されたテキストを選択、検索、および変更できるようになります。
PDF を直接編集できない場合の代替アプローチ
PDF が OCR にアクセスできないスキャンされた文書であるか、削除できないセキュリティ制限があるために、PDF を直接編集可能にできない場合は、代替ワークフローを使用すると、別のパスで同じ結果を達成できます。 PDF を Word や Google ドキュメントなどの編集可能な形式に変換し、その形式で変更を加え、編集したドキュメントを PDF に戻します。編集可能な形式でのラウンドトリップは、直接編集するよりも時間がかかりますが、開いて表示できる PDF であれば機能します。
単一段落のタイプミスの修正など、軽微な修正のみが必要な文書の場合は、PDF の注釈ツールを使用して間違ったテキストを白い四角形で覆い、その上に修正したテキストを入力するのが実用的な回避策です。この方法では、基礎となるテキストと文書構造が実際には編集されないため、注釈ベースの修正は検索ツールやアクセシビリティ ツールには表示されませんが、印刷または画像として表示される文書の視覚的な修正を迅速に行う場合は、許容可能な結果が得られます。
大規模な編集が必要で、直接編集できないドキュメントの場合、最も信頼できる方法は、元のソース ドキュメントが利用可能な場合は、元のソース ドキュメントに戻ることです。
PDF の作成に使用された Word ドキュメント、Google ドキュメント、または InDesign ファイルには、変更して新しい PDF に再エクスポートできる編集可能なテキストが含まれています。多くの場合、ドキュメントの作成者にソース ファイルを問い合わせたり、自分の記録でソース ファイルを見つけたりするほうが、非協力的な PDF を編集するのに苦労するよりも早くなります。
ネイティブ テキストが含まれているように見える一部の PDF では、テキストが検索および選択可能であっても、実際には編集ツールで変更できない方法でテキストが保存されています。この状況は、PDF に正しいテキスト レイヤーがあり、検索と選択は可能ですが、基礎となるフォント エンコーディングにより、編集ツールが編集された文字を正しい視覚グリフにマッピングできない場合に発生します。編集ツールはテキストを読み取ることはできますが、文字マッピングを破損する可能性なしに変更をドキュメントに書き戻すことはできません。この編集に対する防御は、文書作成者の側で意図的に行われる場合があります。
PDF 編集ツールの急増により、PDF の編集はかつてないほど簡単になりましたが、編集とは何なのかについての混乱も生じています。 PDF ページの上部にテキスト注釈を追加することは、その下にあるテキストを編集することと同じではありません。 PDF ページ上の画像を置換することは、画像を説明するテキストを編集することと同じではありません。既存のページの上に新しいコンテンツをオーバーレイする注釈ベースの変更と、PDF 構造内の実際のテキスト コンテンツを変更する真のテキスト編集の違いを理解することは、各編集タスクに適切なツールと適切なアプローチを選択するのに役立ちます。
あらゆる編集の試みに抵抗し、更新する必要がある情報が含まれている文書の場合、核となる選択肢は、文書を最初から再作成することです。 PDF を視覚的な参照として使用し、コンテンツをワード プロセッサまたはデザイン アプリケーションに再入力して、再作成プロセス中に編集を加えます。このアプローチは労働集約的ですが、書式設定の問題、フォントの問題、変換アーティファクトが残らない、クリーンで完全に編集可能なドキュメントを作成します。 PDF からドキュメントを再作成するには、ドキュメントの長さと複雑さに比例して時間がかかります。大幅な編集が必要な短いドキュメントの場合は、非協力的な PDF 編集ツールで苦労するよりも実際に速い場合があります。
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
