データベースからエクスポートされた PDF テーブルには 500 行が含まれています。ファイルを開くと、すべての行が 2 回表示されるか、重複を返したソース クエリからの特定のエントリがパターンで繰り返されていることがわかります。 PDF自体は壊れていません。内部のデータには重複したコンテンツが含まれており、それらの重複を削除するには、PDF を直接編集するか (ほとんどのツールでは行レベルの操作をサポートしていません)、外部で抽出して重複を排除し、クリーンなバージョンを再作成する必要があります。
PDF はスプレッドシートではありません。ボタンをクリックして重複行を削除することはできません。ただし、データを取り出して消去し、元に戻すことはできます。
PDF Editor ドキュメントから重複行を削除するには、PDF コンテンツを編集可能な形式に変換し、そこで重複を除去し、必要に応じて PDF を再作成する必要があります。 WukongPDF の Fix PDF と変換ツールが抽出を処理し、以下のワークフローは完全な重複排除パイプラインをカバーします。

コンテンツを編集可能な形式に抽出する
PDF からテキストを取り出し、重複排除に適した形式に変換することが重要な最初のステップです。コンテンツが一貫した列を含む表形式の場合は、Excel にエクスポートします。コンテンツに段落のあるテキストが含まれている場合は、Word にエクスポートします。構造が単純な場合はプレーンテキストにエクスポートします。エクスポート形式の選択は、コンテンツの構造に従います。
表形式のデータは、組み込みの重複排除ツールを使用する Excel に属します。データ範囲を選択し、「データ」タブに移動して、「重複の削除」をクリックします。何を重複としてカウントするかを定義する列を選択します。通常は、行が完全に一致するすべての列を選択します。 Excel は、最初に出現したものを除くすべての重複を削除し、数秒で数千行を処理します。
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
PDF から Excel への変換後の Excel での重複排除
Excel の重複の削除は、選択した列間の完全一致に対して機能します。ほぼ重複した行、データは同じだが書式設定や空白が異なる場合は、最初にクリーニングする必要があります。 TRIM を使用して余分なスペースをトリミングします。大文字と小文字を UPPER または LOWER で標準化します。 CLEAN を使用して非印刷文字を削除します。重複排除前のデータがクリーンであるということは、より多くの重複が検出されることを意味します。
確認が必要な場合は、削除する前に重複を強調表示します。条件付き書式設定、セルの強調表示ルール、重複値は、何も削除せずに重複している行を表示します。強調表示された行を確認し、それらが真の重複であることを確認してから削除します。このレビューでは、2 つの行が似ているように見えても、たまたま同じ金額を共有する実際には異なるトランザクションであるケースを検出します。
Word でのテキストベースの PDF の重複排除
重複した段落を含むテキストを実行するには、Word の検索と置換をワイルドカード パターンと組み合わせて行う必要があります。 2 回連続して出現する段落を見つけて、1 つのインスタンスに減らすことができます。これは完全な重複を処理しますが、1 つまたは 2 つの単語が異なるほぼ重複は処理しません。
説明文の場合は、自動レビューよりも手動レビューの方が信頼性が高くなります。繰り返されている段落をスキャンします。導入部と結論部の両方にある段落は、重複エラーではなく、修辞効果を目的とした意図的な繰り返しである可能性があります。自動化ツールは、意図的な繰り返しと偶発的な繰り返しを区別できません。文脈によって繰り返しが正しいかどうかが判断されるテキストの重複排除には人間の判断が必要です。
| コンテンツタイプ | エクスポート先 | 重複排除方法 | 注意 |
|---|---|---|---|
| 列を含む表形式のデータ | エクセル | データ>重複の削除 | 照合用に選択されたすべての列が正しいことを確認してください |
| シンプルなリスト、1 行に 1 つの項目 | プレーンテキストまたは Excel | 重複の並べ替えと削除、または Excel の重複排除 | 並べ替えると元の順序が失われる可能性があります。最初にインデックス列を追加します |
| 実行中のテキスト、段落 | 言葉 | 手動レビュー、またはワイルドカードの重複を検索 | 意図的な繰り返しが誤って削除される可能性があります |
| 混合コンテンツ | 表は Excel、テキストは Word | コンテンツタイプごとに分割し、それぞれを個別に重複排除します | 再組み立て順序は保存する必要があります |
重複排除後のクリーンな PDF の再作成
Excel または Word で重複を削除した後、PDF として保存またはオンライン コンバーターを使用して、クリーンなファイルを新しい PDF として保存します。結果として得られる PDF には、重複のないクリーンなデータが含まれています。元の PDF とクリーンな PDF のページ数を比較します。元の行が 500 行で、そのうちの 50 行が重複である場合、クリーンアップされた PDF のページ数は約 10% 少なくなるはずです。ページ数の削減により、重複排除が機能したことが確認されます。
クリーンなバージョンが確認されるまで、元の PDF を未変更のバックアップとして保持します。あまりにも積極的すぎて、重複とともに一意の行が削除された重複排除は、元の行が削除されると元に戻すことができません。検証により、クリーンアップされたバージョンが正しく完全であることが確認されるまで、オリジナルを保管してください。
大規模なジョブまたは繰り返しのジョブに対するスクリプトによる重複排除の使用
Python の pandas ライブラリは、Excel の組み込みツールよりも柔軟に大規模なデータセットの重複排除を処理します。エクスポートされたデータを読み取り、構成可能な一致基準を使用して重複排除ロジックを適用し、クリーンなファイルを出力するスクリプトは、行数に関係なく数秒で実行されます。このスクリプトは、適用される正確なロジックを文書化したコードを使用して、エッジ ケース、何が重複としてカウントされるか、どの出現を保持するか、削除された行をログに記録するかどうかを処理します。
反復的な重複排除ジョブの場合、スクリプトは永続的な資産です。同じ重複パターンで毎週生成される同じ PDF レポートは、毎週同じスクリプトによってクリーンアップされます。 30 分の初期スクリプト投資により、年間を通じて何時間もの手動重複排除が節約されます。スクリプトをバージョン管理して、将来のメンテナが重複排除ロジックを確認し、ソース データ形式の変更に応じて調整できるようにします。
ソースでの重複コンテンツの防止
PDF 内の重複コンテンツは通常、PDF を作成したデータベース クエリ、レポート ジェネレーター、またはマージ プロセスの上流で発生します。 SELECT DISTINCT を使用するようにソース クエリを修正するか、JOIN 条件を修正します。重複するページ範囲をチェックするように結合プロセスを修正しました。ソースで重複が削除されると、ダウンストリームの PDF 重複除去セッションが妨げられます。
PDF 重複排除ワークフローは症状を治療します。重複コンテンツを生成したシステムであれば、どのようなシステムであっても解決策は存在します。重複がどこから来たのかを文書化し、プロセスを修正します。最初の救出活動は理解できる。同じソースから同じ重複が 2 回発生した場合は、永久的な修正が必要なプロセス障害を示します。
PDFを編集してみる
インストールは必要ありません。ブラウザで直接動作します。
