Others

PDF からすべての画像を削除してテキストのみのバージョンをエクスポートできますか

高解像度の写真、グラフ、ロゴ、装飾画像が詰まった PDF は、テキスト中心のワークフローでは実用的ではない場合があります。単語だけが必要な場合は、すべての PDF 画像 を削除し、テキストのみのバージョンをエクスポートすると、ドキュメントのテキスト コンテンツのみを含む大幅に小さなファイルが生成されます。問題は、結果として得られるテキストのみの出力が完全であり、意図した目的に使用できるかどうかです。

テキストが選択可能な文字として存在するテキストベースの PDF の場合、簡単に言うと「はい」です。テキストが画像の一部であるスキャンされた PDF の場合、画像を削除するとテキストを含むすべてが削除されます。主な違いは、テキストと画像が別個のレイヤーであるネイティブ テキスト PDF と、ページ全体がテキスト レイヤーのない画像である画像ベースの PDF の違いです。

PDF から Text 抽出では、テキストの内容を保持しながら画像が削除されます。テキストが主な意味を持ち、画像が補助的な文書の場合は、テキストのみの出力が完全に使用できます。医療スキャンや建築図面など、画像が重要な情報を伝える文書の場合、テキストのみの出力では重要なコンテンツが失われます。

WukongPDF の PDF 処理ツールには、画像除去機能とテキスト抽出機能が含まれています。

Can You Strip All Images From a PDF and Export a Text-Only Version

ネイティブ テキスト PDF と画像ベースの PDF の違い

ネイティブ テキスト PDF は、テキストをページ上に配置された文字コードとして保存します。画像は、テキスト ブロック間にオーバーレイまたは配置される個別のオブジェクトです。ネイティブ テキスト PDF から画像を削除しても、テキストはそのまま残り、完全に読むことができます。見出し、段落、改ページなどの文書構造は保持されます。装飾的な画像とイラスト画像のみが消えます。

画像ベースの PDF は、通常はスキャナーまたはスクリーンショットから取得したラスター イメージとしてページ全体を保存します。保存するテキスト文字はありません。画像ベースの PDF から画像を削除すると、すべてが削除され、空白の文書が作成されます。 OCR 処理されたスキャンされた PDF の場合、画像の背後に非表示のテキスト レイヤーがあります。画像を除去すると、表示されているスキャンされたページが削除されますが、認識エラーが含まれる可能性がある OCR テキストは保持されます。

お持ちの PDF の種類を確認するには、PDF リーダーで PDF を開き、テキストの単語を選択してみます。個々の文字を選択できる場合、PDF はネイティブ テキストであり、画像の除去によりテキストが保持されます。クリックしてページ全体を 1 つの大きな画像ブロックとして選択した場合、PDF は画像ベースであり、画像を削除すると何も残らないか、OCR テキスト レイヤーのみが残ります。

WukongPDF

PDFを圧縮してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

方法 1: Acrobat Pro PDF Optimizer を使用して画像を除去する

Acrobat Pro で PDF を開き、「ファイル」、「別名で保存」、「最適化 PDF」の順に選択します。 [PDF オプティマイザー] ダイアログで、左側のパネルの [オブジェクトの破棄] をクリックします。 「すべての画像を破棄」というラベルのボックスをオンにします。 [クリーンアップ] で、[未使用のオブジェクトを削除する] にチェックを入れます。 「OK」をクリックし、最適化されたファイルを新しい名前で保存します。 Acrobat はファイルを処理し、すべてのラスター画像オブジェクトを削除します。

実際には、ファイル サイズが大幅に削減される可能性があります。高解像度の写真を含む 20 MB の PDF は、文書が主に画像を含むテキストであった場合、100 KB 未満に縮小される可能性があります。最適化されたファイルを開き、すべてのページをスクロールして、すべてのテキスト コンテンツが存在し、読み取れることを確認します。画像が削除されたページ領域を確認します。以前画像が占めていたスペースが空になったため、レイアウトがわずかに移動する場合があります。

ベクター グラフィックスではなく画像として保存されたグラフなど、重要なコンテンツが画像とともに削除された場合は、操作を元に戻し、より選択的なアプローチを使用します。すべての画像を破棄するのではなく、画像を大幅に圧縮するか、削除された内容を説明するプレースホルダー テキストに置き換えます。

方法 2: プログラムによるテキスト抽出

PyMuPDF や pdfplumber などの Python ライブラリは、画像をネイティブに無視してテキストを抽出します。抽出ではテキスト レイヤーのみが読み取られ、画像データのないクリーンなテキスト ストリームが生成されます。抽出されたテキストは、編集用に .txt ファイルとして保存したり、新しいテキストのみの PDF に入力したりできます。プログラムによるアプローチはスクリプト化可能で反復可能であり、複数のファイルのバッチ処理を処理します。

OCR テキスト レイヤーを含むスキャンされた PDF の場合、プログラムによる抽出により OCR テキストが読み取られます。品質は OCR の精度に完全に依存します。最新の OCR を使用して文書をきれいにスキャンすると、99% 正確なテキストが生成される場合があります。古い OCR を使用してスキャンした文書が不十分であると、大幅な手動修正が必要なテキストが生成される場合があります。抽出には、テキスト レイヤーに存在する OCR エラーが含まれます。

抽出後の品質検証

画像を削除したりテキストを抽出した後は、使用する前に出力品質を確認してください。抽出されたテキストの単語数を、元の文書から手動で推定した値と比較します。大幅な不一致は、コンテンツが失われたことを示しています。オリジナルに出現する既知の用語を検索して、出力に存在することを確認します。各主要セクションの最初と最後の段落を見直し、完全であることを確認してください。

ドキュメントのワークフローに関して言えば、法的申告書や財務報告書など、テキストの正確さが重要なドキュメントの場合は、2 人目のレビュー担当者に、抽出したテキストを元の PDF と照らし合わせてスポットチェックさせます。 99% 正確に抽出したとしても、100 単語ごとに 1 つのエラーが発生することになり、精密な文書では許容できない場合があります。検証パスは、自動品質チェックでは見逃される抽出エラーを検出します。

文書タイプ剥がしても安全ですか?代替
法的準備書面はい、テキストが第一です何も必要ありません
グラフ付きレポートいいえ、グラフにはデータが含まれていますストリップの代わりに圧縮する
スキャンした文書いいえ、スキャンはコンテンツですまず OCR してからテキストを抽出する

PDF から画像を削除することは、テキスト コンテンツが主な価値であり、画像が付随的な場合に適しています。結果として得られるテキストのみのファイルは大幅に小さくなり、完全に検索可能になり、テキスト分析、翻訳、またはコンテンツの再利用が可能になります。画像を削除するかどうかは、テキストだけで文書の本質的な意味が伝わっていることを確認した上で決定する必要があります。

ドキュメントのワークフローに関して言えば、画像とテキストが連携するドキュメントの場合は、完全な PDF を保持し、削除ではなく圧縮によって最適化します。圧縮 PDF は、テキストと画像の間の視覚的な関係を維持しながら、配布用のファイル サイズを削減します。

画像の除去後に PDF レイアウトはどうなるか

一般的なワークフローでは、画像が削除されると、ページ上で画像が占めていたスペースが空になります。画像の周囲に回り込んだテキストが空のスペースにリフローする場合があります。画像セルを含む表には空白セルが表示されます。特定の画像配置を中心に設計されたページ レイアウトは、ぎこちなく見える場合があります。ストリップされた PDF は、ビジュアル デザインではなくコンテンツに最適化されます。

レイアウトの整合性が重要なドキュメントの場合は、画像を完全に削除するのではなく、プレースホルダー テキストで置き換えることを検討してください。各画像の代わりに、「画像が削除されました: 製品写真」などのキャプションを挿入できます。プレースホルダーは、視覚的なコンテンツが意図的に削除されたことを認識しながら、レイアウト構造を保持します。

OCR を使用して画像を除去する前にテキストレイヤーを作成する

ドキュメント処理では、テキスト レイヤーのないスキャンされた PDF の場合、画像のストリッピング前に OCR を実行すると、ストリッピング プロセスで保存されるテキスト データが作成されます。 OCRmyPDF は、スキャンした PDF に 1 つのコマンドでテキスト レイヤーを追加できます。 OCR 処理後の PDF には、表示されるスキャン画像と非表示のテキスト レイヤーの両方が含まれます。画像を除去すると、認識されたテキストは保存されたまま、スキャンされたページが削除されます。

実際には、OCR の品質によって、ストリップされた出力の使いやすさが直接決まります。 99% の OCR 精度を持つドキュメントでは、エラーは発生しますが、使用可能なテキストが生成されます。 80% の精度のドキュメントでは、大幅な手動修正が必要なテキストが生成されます。スキャンしたドキュメントの画像除去を実行する前に、OCR を実行し、サンプル ページでテキストの品質を評価します。

ストリッピングの代替としての画像の圧縮

画像を完全に削除すると貴重なコンテンツが失われるドキュメントに関しては、積極的な画像圧縮が中間点を提供します。高 JPEG 圧縮を使用して画像を 72 DPI にダウンサイズすると、画像の認識性を維持したまま、20 MB の PDF を 2 ~ 3 MB に縮小できます。圧縮された画像は低品質ですが、それでも視覚的な情報を伝えます。

圧縮と画像の選択的削除を組み合わせると、最も柔軟な対応が可能になります。コンテンツの中心となる図や写真など、画像が重要なページには画像を保持し、情報提供を目的としないページからは装飾的な画像を削除します。ハイブリッド アプローチでは、より多くの手作業が必要になりますが、品質とサイズの最適なバランスが得られます。

テキストのみの PDF エクスポートは、テキスト分析パイプラインへのコンテンツのフィード、モバイル閲覧用の軽量バージョンの作成、画像によって付加価値が得られずにコストが増加する翻訳用のドキュメントの準備など、特定のユースケースに役立ちます。これらの各ユースケースでは、テキストが製品であり、画像は廃棄できるパッケージです。

画像を削除する決定は、将来テキストのみのバージョンを読む人が視覚的なコンテンツが意図的に削除されたことを理解できるように文書化する必要があります。ドキュメントのプロパティまたは表紙に簡単なメモを付けると、テキストのみのバージョンとオリジナルを比較するときに混乱を防ぐことができます。

ほとんどのツールにおいて、テキストのみの PDF エクスポートは特定のニーズに特化したツールです。これは汎用的な最適化ではありません。ほとんどのドキュメントでは、画像を削除するよりも圧縮する方が良い最初のステップです。画像の除去は、テキストが唯一の価値のあるコンテンツであり、文書の目的がテキストのみで果たされる場合に備えて予約してください。

画像ストリッピングの機能と制限を理解すると、画像ストリッピングが適切な理由で適切なドキュメントに適用され、意図しないコンテンツの損失がなく、意図した目的を果たす出力が生成されます。テキストのみの PDF は特定の目的に適しているため、文書の種類と使用目的に基づいて選択的に適用する必要があります。

WukongPDF

PDFを圧縮してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →