Tips & Tricks

複数の PDF ファイルの合計単語数またはページ数をカウントする方法

1 つの PDF に含まれるページ数を調べるのは簡単です。ビューアにはページ数が表示されます。フォルダー内の 50 個の PDF に含まれるページ数や、すべての PDF を合わせた単語数を調べることはできません。各ファイルを手動で開き、数を記録し、数値を合計すると、PDF が作成された実際の作業よりも時間がかかります。

ファイル全体を手動で数えるのは、コンピュータが行うために発明されたタスクです。ただし、ほとんどの PDF ツールは複数ファイルのカウントを提供しません。

複数の PDF Batch ファイルにわたる単語とページをカウントするには、バッチ統計をサポートするツール、または各ファイルから情報を抽出して合計するスクリプトのいずれかが必要です。 WukongPDF の PDF Pages ツールは個々のファイルの統計に役立ち、以下のメソッドは複数ファイルの集計を処理します。

How to Count the Total Number of Words or Pages Across Multiple PDF Files

PDF ツールでの組み込みバッチ統計の使用

Adobe Acrobat Pro には、バッチページやワードカウント機能は含まれていません。一部のサードパーティ PDF 管理ツールではこれが可能です。 PDF Architect と Nitro Pro には、選択したファイルのセット全体のページ数をレポートできるバッチ処理モジュールが含まれています。通常、出力は各ファイル名とそのページ数をリストした CSV ファイルで、最後に合計が表示されます。

ステートレス要求モデルではファイルのアップロード全体にわたって情報が保持されないため、ブラウザベースの PDF ツールは通常、複数ファイルの統計を提供しません。各ファイルは個別のセッションです。統計を集約するには、複数のファイルにまたがる永続的なセッションが必要ですが、これはデスクトップおよびサーバーベースのツールでより一般的です。

WukongPDF

PDFを結合してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →

ファイル エクスプローラーを使用したページ数の推定

Windows ファイル エクスプローラーと macOS Finder では、ファイル メタデータ列に PDF ページ数が表示されます。ファイル エクスプローラーの詳細ビューで [ページ] 列を有効にすると、各 PDF のページ数がリストに表示されます。すべてのファイルを選択すると、オペレーティング システムのバージョンと構成に応じて、ステータス バーに合計が表示される場合があります。

ファイル エクスプローラーは、ファイル全体を開くのではなく、各 PDF 内の小さなメタデータ フィールドを読み取るため、ページ数の読み取りが高速になります。数百の PDF が含まれるフォルダーの場合、ページ数は数秒で入力されます。ただし、ファイル エクスプローラーはワード数を提供しないため、メタデータが実際のページ数と一致しない非標準の内部構造を持つ PDF では、ページ数の読み取りが不正確になる可能性があります。

PDF にわたる単語とページ数のスクリプト作成

PyPDF2 や pdfplumber などの PDF ライブラリを備えた Python では、フォルダー内のすべての PDF からページ数とワード数を抽出し、合計することができます。スクリプトは各 PDF を開き、ドキュメントのメタデータからページ数を読み取り、各ページからテキストを抽出し、単語をカウントし、合計を累積します。出力は、フォルダー全体のページ数と単語数を組み合わせたものです。

スクリプトは任意の数のファイルを処理します。ファイル サイズとテキスト抽出の速度に応じて、500 PDF のフォルダーは数分で処理されます。このスクリプトはすべてのファイルに同じカウント ロジックを適用するため、一貫した結果が生成されます。手動で数を数えると、疲労や気晴らしによる誤差が生じます。スクリプト化されたカウントは再現可能で監査可能です。

メソッド速度精度単語数を提供しますか?
ファイルエクスプローラーのメタデータ中(メタデータのみ)いいえ
バッチ PDF ツール高いいくつかのツール
Python スクリプト分 (ファイル数によって異なります)高 (実際のテキストを抽出)はい
手動で開いてカウントする営業時間低い(疲労)はい、手動で

ワード数でのスキャンされた PDF の処理

スキャンした PDF にはテキストではなく画像が含まれます。抽出するテキストがないため、スキャンされた文書に対してテキスト抽出に基づく単語カウントではゼロ単語が返されます。スキャンした PDF をワード数に含めるには、まず OCR を実行してテキスト レイヤーを作成します。次に、単語カウント スクリプトが OCR テキストをカウントします。 OCR では認識エラーが発生するため、OCR の単語数は概算です。

デジタル PDF とスキャン PDF の両方を含む混合フォルダーの場合、スクリプトは、ネイティブ テキストを含むデジタル PDF の単語と、OCR 後のスキャン PDF の単語の合計を個別に報告する必要があります。ソースを区別せずにこれらを 1 つの合計に結合すると、スキャンされた文書の単語数の精度が誇張され、合計の一部が正確ではなく OCR 推定によるものであるという事実が曖昧になります。

セクションまたは章ごとの単語数のエクスポート

総単語数に加えて、各 PDF 内のセクションごとの単語数を抽出すると、編集、翻訳、または請求のための詳細なデータが得られます。 PDF ブックマークまたは見出し検出を使用してテキストをセグメント化し、セグメントごとに単語数をカウントするスクリプトにより、詳細なレポートが作成されます。出力の各行には、ファイル名、セクション名、およびそのセクションの単語数が表示されます。

セクション レベルのカウントは、異なるセクションが異なる翻訳者に割り当てられる翻訳プロジェクトの場合に役立ちます。プロジェクト マネージャーは、このカウントを使用して作業を均等に分散し、完了時間を見積もります。同じカウントは、コンテンツの複雑さによって料金が異なるセクションごとの請求をサポートします。総ワード数からプロジェクトのサイズがわかります。セクションレベルの単語数によって、分割方法がわかります。

請求と見積りのためのカウントの使用

ページ単位またはワード単位で請求を行うフリーランサーや代理店は、バッチ数を使用して請求書を作成します。ファイル名、ページ数、単語数の CSV を生成するスクリプトにより、すぐに請求できるレポートが提供されます。クライアントはカウントを個別に検証できます。レポートはデータを含む請求書をサポートします。

プロジェクトの見積もりにはバッチ数も役立ちます。単語ごとに料金が設定される翻訳プロジェクトでは、すべてのドキュメントにわたる正確な原文の単語数が必要です。ページごとに価格が設定されている印刷プロジェクトには、総ページ数が必要です。見積もりの前にカウントを実行すると、見積もりが推定値ではなく実際のドキュメントの量に基づいていることが保証されます。カウントに費やした時間は、正確な価格設定に反映されます。

WukongPDF

PDFを結合してみる

インストールは必要ありません。ブラウザで直接動作します。

始める →