Tips & Tricks

ベクターテキストとグラフィックスをピクセル化された画像に変換せずに PDF を圧縮する方法

ほとんどの人は、PDF を圧縮するということは、ある程度の品質の低下を受け入れることを意味すると考えています。その仮定は半分しか当たっていません。 PDF 内のテキストとベクター グラフィックスは、ピクセルの固定グリッドとしてではなく、形状、曲線、文字グリフの数学的記述として保存されます。圧縮ツールがこの違いを理解すると、埋め込まれたラスター イメージを積極的に最適化し、すべての文字、線、多角形をオリジナルとまったく同じ鮮明さを残してファイルを圧縮できます。結果として、見た目は同じですが、サイズは数分の一のファイルが作成されます。

この問題は、圧縮ツールが圧縮を適用する前に、ベクター コンテンツを含むすべてを単一の画像レイヤーに平坦化するときに発生します。その時点で、テキストはテキストの写真になり、圧縮画像に影響を与えるのと同じぼやけや JPEG アーチファクトが発生しやすくなります。これがいつ起こるのか、そしてなぜ起こるのかを理解することが、それを回避するための鍵です。このガイドでは、PDF のベクター コンテンツとラスター コンテンツの違い、ファイルに含まれるタイプを識別する方法、鮮明なテキストをピクセル化された混乱にせずにファイル サイズを削減する圧縮設定を選択する方法について説明します。

How to Compress a PDF Without Converting Vector Text and Graphics Into Pixelated Images

一部の PDF 圧縮プログラムがテキストをぼやけた画像に変換してしまうのはなぜですか?

PDF Association による 2025 年の調査では、圧縮後の画質の低下を報告したユーザーの 47% が、JPEG または JPEG 2000 圧縮を適用する前に、テキストを含むページ全体をラスタライズするツールを使用していたことがわかりました (PDF Association、「PDF Compression Practices Survey」、2025 年)。 PDF ページがラスタライズされると、ページ上のすべての要素が固定解像度の単一のフラット イメージに変換されます。かつては選択可能、検索可能で、限りなく鮮明だったテキストはテキストの画像になり、その明瞭さはラスター化ステップで使用された解像度によって制限されます。

これは、簡略化された処理パイプラインを使用するブラウザベースのツールや軽量モバイル アプリで最もよく発生します。内部 PDF 構造を解析して個々の画像オブジェクトを選択的に再圧縮する代わりに、ページをキャンバス要素またはオフスクリーン ビットマップにレンダリングし、そのビットマップを新しい画像としてエンコードします。これは高速で、内部の複雑さに関係なくあらゆる PDF で動作しますが、外科医の仕事は大ハンマーで処理されます。

PDF ファイル形式は、視覚的なコンテンツを表現するために 2 つの根本的に異なる方法を使用します。ベクター グラフィックスには、点 A から点 B までの線、指定された半径の円、指定されたフォントの文字を指定されたサイズで描画するための命令が保存されます。これらの命令は、携帯電話の画面から看板まで、鮮明さを損なうことなく、ディスプレイが要求するあらゆる解像度でレンダリングします。ラスター イメージは、カラー ピクセルのグリッドを固定解像度 (通常は 72 ~ 300 ドット/インチ) で保存し、目に見える劣化なしにネイティブ解像度を超えて拡大することはできません。

ワード プロセッサまたはデスクトップ パブリッシング アプリケーションから作成された PDF は通常ベクトルを使用するため、この区別は重要です。そのテキストは、フォント参照を持つ文字コードとして保存された実際のテキストです。そのロゴとチャートはベクター パスです。埋め込まれた写真がある場合のみ、ラスター イメージです。適切に設計された圧縮ツールはこれを認識しており、ベクトル部分をそのまま残します。

WukongPDF

PDFを圧縮してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

PDF にベクター テキストまたはラスター テキストが含まれているかどうかを確認する方法

圧縮を適用する前に、PDF に実際にどのようなコンテンツが含まれているかを知っておく価値があります。最も簡単なテストは、標準の PDF ビューアでファイルを開き、400% 以上に拡大することです。テキストが鮮明で滑らかなエッジを保っている場合、それはベクター テキストです。エッジがギザギザになったりブロック状になったりする場合、テキストは早い段階ですでにラスタライズされているため、さらなる圧縮には特に注意して行う必要があります。

2 番目のテストは、テキストの文を選択してコピーしてみることです。個々の文字を強調表示してクリップボードにコピーすると、テキストは実際のテキスト データとして保存されます。クリックしてドラッグすると、テキストの流れに従わずに長方形の領域が選択される場合、または何も選択できない場合、そのページはスキャンされた画像であるか、ラスタライズされています。スキャンされた PDF では、テキスト レイヤーを復元するために OCR 処理が必要です。また、PDF の圧縮には、ネイティブのデジタル ドキュメントの圧縮とは異なる考慮事項が必要です。

pdfinfo やメタデータ ビューアなどのツールを使用して、ファイルのオブジェクト構造を確認することもできます。実際のテキストの存在を確認するフォント オブジェクトと、JPEG または JPEG 2000 圧縮ラスター イメージを示す DCTDecode または JPXDecode フィルターを備えたイメージ オブジェクトを探します。フォント オブジェクトと画像オブジェクトの両方を含むドキュメントは混合コンテンツ PDF であり、選択的圧縮の理想的な候補です。この内部構造を理解することで、品質を維持する圧縮と品質を低下させる圧縮を分けることができます。

ベクター コンテンツを保護する圧縮設定の選択

すべてのベクトル詳細を保持しながら PDF を圧縮する必要がある場合は、WukongPDF の PDF 圧縮 ツールが各ページ要素を個別に分析します。テキストとベクター パスは変更されず、画像データのみが最適化されます。そのため、ほとんどのファイルは目に見えるテキスト品質の変化なしに 50 ~ 70% 縮小します。

ほとんどのデスクトップおよびオンライン圧縮ツールには、最大圧縮から最大品質までの品質設定が用意されていますが、スライダーのラベルからはツールが実際に何をしているのかがわかることはほとんどありません。 「高圧縮」というラベルの設定は、これは、ベクター コンテンツを保持した積極的な画像ダウンサンプリングを意味する場合もあれば、150 DPI でのフルページのラスタライズとその後の強力な JPEG 圧縮を意味する場合もあります。この区別は表面的なものではなく、同じように見える小さなファイルと、明らかに劣化しているように見える小さなファイルとの違いです。

探すべき最も重要な設定は、画像のダウンサンプリング解像度です。一般的なプリセットには、画面のみの表示用の 72 DPI、印刷可能な標準的なオフィス ドキュメント用の 150 DPI、および専門的な印刷を目的としたドキュメント用の 300 DPI が含まれます。ベクター テキストとグラフィックスの場合、ダウンサンプリングするピクセルがないため、DPI 設定は無関係です。 PDF 内のラスター イメージのみが影響を受け、150 DPI であっても画面上での読み取りには完全に許容されます。

カラー画像とグレースケール画像に適用される圧縮アルゴリズムは、2 番目の重要な設定を構成します。 60 ~ 80% の品質レベルで JPEG 圧縮すると、通常、非圧縮のオリジナルよりも 50 ~ 70% 小さいファイルが生成され、写真コンテンツの目に見える違いは最小限になります。モノクロ スキャンの場合、JBIG2 または CCITT グループ 4 圧縮により、テキストの可読性を維持しながら白黒ページのサイズを大幅に縮小できます。正しい PDF サイズの削減 アプローチでは、これらの決定を分離し、同じページ内の異なるコンテンツ タイプに異なるアルゴリズムを適用します。

ラスターとベクターの区別を維持するツール

圧縮ツールの状況は、PDF の内部オブジェクト構造を解析して尊重するものと、PDF を再エンコードされるフラット イメージとして扱うものの 2 つのカテゴリに明確に分割されます。最初のカテゴリのツールは、PDF の相互参照テーブルを読み取り、各コンテンツ ストリーム、フォント、画像オブジェクトを個別に識別し、意味のある場合にのみ圧縮を適用します。 2 番目のカテゴリのツールは、ページをビットマップにレンダリングしてからそのビットマップを圧縮し、最初に PDF を PDF にした構造情報を破棄します。

Adobe Acrobat Pro、Ghostscript、およびいくつかのオープンソース PDF プロセッサなどのデスクトップ アプリケーションは、最初のカテゴリに分類されます。カラー画像圧縮、グレースケール画像圧縮、モノクロ画像圧縮を個別に制御できますが、テキストやベクターのコンテンツ ストリームには一切触れません。トレードオフは、これらのツールはシングルクリック Web コンプレッサーよりも重く、より複雑であることです。

ブラウザベースのツールの間では、品質の差が縮まっています。現在、最高のオンライン コンプレッサーは、ラスター ベクター PDF の区別を尊重するサーバー側 PDF 解析を実行し、MRC (混合ラスター コンテンツ) 圧縮を適用します。これにより、各ページがテキスト領域、画像領域、および背景領域に分割され、それぞれに最適なアルゴリズムで圧縮されます。テキスト領域はロスレス JBIG2 を取得し、写真は JPEG を取得し、単色の背景は低解像度の塗りつぶしを取得します。 International PDF Association による 2025 年の調査では、MRC ベースの圧縮により、ISO 標準のテキスト可読性スコアを維持しながら、ファイル サイズが平均 68 パーセント削減されたことがわかりました (PDF Association、「混合コンテンツ文書の高度な圧縮技術」、2025 年)。

クライアント側で実行されるブラウザベースのツールは、ブラウザの JavaScript エンジンと Canvas API ができることによって制限されます。通常、ブラウザ環境では PDF の内部オブジェクト構造に直接アクセスできないため、ページがラスタライズされます。ツールがファイルをサーバーにアップロードせずにブラウザ内で完全に処理する場合は、ツールが明示的に別のことを指定していない限り、ラスタライズ手法を使用していると想定してください。

ステップバイステップ: 混合コンテンツ PDF を正しく圧縮する

まず、圧縮ファイルが何をする必要があるかを判断します。 PDF が画面上でのみ読み取られる場合は、テキストはベクトルであり、それに関係なく全画面解像度でレンダリングされるため、テキストの品質を気にせずに画像を 150 DPI にダウンサンプリングし、JPEG 品質 60 を使用できます。ファイルを標準的なオフィス プリンタで印刷する可能性がある場合は、画像のダウンサンプリングを 200 ~ 300 DPI に、JPEG 品質を 80 に設定します。アーカイブまたはプリプレスで使用する場合は、画像に可逆 FlateDecode 圧縮を適用し、ダウンサンプリングを避けてください。

次に、オブジェクトごとの圧縮設定を公開するツールで PDF を開きます。ツールの圧縮ダイアログで、「テキストと線画を圧縮」が選択されていることを確認します。オプションが有効になっています。この設定は、テキストおよびベクター パスが保存されているコンテンツ ストリームにロスレス DEFLATE 圧縮を適用します。削減量は控えめで、通常はコンテンツ ストリームだけで 20 ~ 30% ですが、視覚的な変化はなく、その後の画像圧縮が全体的により効果的になります。

3 番目に、画像固有の圧縮を適用します。品質許容度に応じて、カラー画像を JPEG 品質 60 ~ 80 に設定します。グレースケール画像を同じ JPEG 品質範囲に設定します。モノクロ画像を JBIG2 ロスレスまたは CCITT グループ 4 に設定します。ツールに「メタデータの削除」機能がある場合は、「メタデータの削除」を選択します。または「非表示のオブジェクトを破棄」オプションで有効にします。 PDF には、多くの場合、埋め込みサムネイル、文書情報辞書、未使用のオブジェクトが含まれており、表示される出力には影響を与えずにファイル サイズに影響します。

4 番目に、圧縮を実行して出力を確認します。圧縮ファイルを開き、テキストのセクションを少なくとも 400% 拡大します。テキストの端はオリジナルと同じくらいシャープである必要があります。文を選択してコピーすると、コピーによってまったく同じ文字が生成されるはずです。いずれかのテストが失敗した場合は、ツールによってページがラスタライズされているため、別のコンプレッサーまたはより高品質の設定を試す必要があります。 WukongPDF では、この検証ステップが自然に処理されます。これは、圧縮によってテキストが設計上テキストとして保存されるため、コピー&ペーストのテストは常にパスします。

5 番目に、ファイル サイズを比較します。画像がファイル サイズの主な要因である混合コンテンツ PDF を適切に圧縮すると、最終的には 50 ~ 70% 小さくなるはずです。サイズの削減が大幅に高く、90% を超えている場合は、ツールによって画像データ以外のデータも削除されている可能性があるため、コンテンツが欠落していないか確認する必要があります。削減率が 20% 未満の場合、PDF 内の画像はすでに圧縮されている可能性があり、非可逆アプローチに切り替えることなく最適化する方法はほとんどありません。

ラスタライズが実際に意味のある場合

フルページのラスタライズが間違いではなく、意図的なトレードオフであるシナリオもあります。 PDF に数千の小さなベクトル要素、数十万の個別の線分を含む複雑な CAD 図面、または重なり合った半透明レイヤーを含む複雑なデータ ビジュアライゼーションが含まれている場合、これらすべてのベクトル命令をエンコードするコンテンツ ストリームは、実際には同じページの高解像度ラスター イメージよりも大きくなる可能性があります。このような特殊なケースでは、300 DPI でラスタライズして JPEG 圧縮を適用すると、ベクトル表現を維持するよりもファイルサイズが小さくなり、300 DPI ではテキストはあらゆる実用的な目的で判読できる状態になります。

重要なのは、この決定をデフォルトでツールにさせるのではなく、意識的に行うことです。 PDF が標準的なオフィス文書、レポート、電子ブック、フォーム、または主に適度な数の画像が埋め込まれたテキストで構成されるものである場合は、ベクター テキスト レイヤーを保持する選択的圧縮が常に正しいアプローチです。 PDF がエンジニアリング回路図、非常に詳細な地図、またはベクトルの複雑さがベクトルを維持する利点を圧倒する設計プルーフである場合は、テキストが読み取れる程度の十分な解像度でのみラスター化を検討してください。

圧縮後にテキストのピクセル化を引き起こす一般的な間違い

よくある間違いの 1 つは、すでに圧縮された PDF を再圧縮することです。ページをラスタライズするツールによって PDF がすでに処理されている場合、テキストはすでに画像になっています。積極的な画像ダウンサンプリングを適用する 2 番目の圧縮ツールを使用して実行すると、劣化がさらに悪化します。 2 番目のツールは、ページ全体を 1 つの大きな画像として認識し、それをさらにダウンサンプリングして、かつては鮮明なベクター テキストだったものをぼやけた混乱に縮小します。解決策は、元の非圧縮ファイルのコピーを常に保持し、すでに圧縮されたバージョンからではなく、元のファイルから再圧縮することです。

もう 1 つのよくある間違いは、ツールの動作を確認せずにツールの最低品質のプリセットを使用することです。 「最大圧縮」とは、または「最小ファイルサイズ」多くのツールのプリセットにより、72 または 100 DPI でのフルページのラスタライズが有効になります。これは、入力コンテンツに関係なく小さな出力ファイルを保証する最速の方法であるためです。結果として得られるファイルは驚くほど小さいかもしれませんが、そのテキストは標準的なモニターでも柔らかく見え、読者が拡大すると基本的に読めなくなります。

3 番目の間違いは、一部のツールが圧縮中に適用する色空間変換を無視することです。ツールがサイズ削減戦略としてカラー PDF をグレースケールに変換する場合、埋め込まれた画像のカラー チャネルにのみ影響を与える必要があります。代わりにツールがページをラスタライズし、結果のビットマップをグレースケールに変換すると、色付きのテキストとベクター要素も平坦化されます。この修正は、カラー変換がページ全体ではなく画像オブジェクトに選択的に適用されていることを確認することです。

元の画像と圧縮ターゲットの間の解像度の不一致も問題を引き起こす可能性があります。元の PDF に 600 DPI の画像が含まれており、それを 72 DPI にダウンサンプリングすると、写真は柔らかく見え、図の細部は失われます。圧縮は使用目的に合わせて行う必要があります。 72 DPI ターゲットは、通常のズーム レベルの画面のみで表示されるドキュメントにのみ適しています。基本的なオフィス プリンタでさえも、印刷される可能性のあるドキュメントでは、画像のダウンサンプリング ターゲットとして少なくとも 150 DPI を使用する必要があります。

WukongPDF

PDFを圧縮してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →