記入済みの PDF 求人応募書を 200 件集めたとします。各フォームには同じフィールドがあります: 名前、電子メール、電話番号、役職、開始日、予想給与。各応募者を行、各フィールドを列として、200 件の回答すべてを 1 つの Excel スプレッドシートに含める必要があります。各 PDF を手動で開き、フィールド値を読み取り、Excel に入力すると、丸 1 日かかります。電子メール アドレスまたは電話番号に 1 つのタイプミスがあると、応募者と連絡が取れなくなる可能性があります。
入力可能な PDF フォーム から Excel にデータを自動的に取得することは、フォーム フィールドの値を読み取り、スプレッドシートに書き込むデータ抽出ワークフローです。このプロセスは高速かつ正確で、転記エラーが排除されます。抽出では、PDF のフォーム フィールドからデータを直接読み取ります。

PDF フォーム データ抽出の仕組み
入力可能な PDF フォームは、名前付きフィールドにデータを保存します。各フィールドには、FirstName や Email などの名前と、ユーザーが入力した値があります。データ抽出では、フィールド名と値を読み取り、それらを構造化フォーマットにエクスポートします。フィールド名はスプレッドシートの列ヘッダーになります。各 PDF は 1 行のデータになります。値は、対応する列の下のセルに入力されます。
WukongPDF の PDF to Excel フォーム データ抽出は、複数の PDF をバッチで処理します。記入済みの 200 個のフォームをすべてアップロードします。このツールは、各フォームからフィールド名と値を読み取ります。フォームごとに 1 行のスプレッドシートを生成します。各フィールドは列になります。抽出では、入力されたとおりのデータが保存されます。データはデジタル フォーム フィールドに入力されているため、OCR や文字認識エラーは発生しません。
PDFをExcelに変換してみる
インストールは必要ありません。ブラウザで直接動作します。
クリーンなデータ抽出の前提条件
フォームは、実際のフォームフィールドを備えた入力可能な PDF である必要があります。手書きで記入してからスキャンしたフォームには、フォーム フィールド データがありません。 OCR が必要ですが、精度が低く、認識エラーが発生します。抽出ワークフローを設定する前に、入力されたフォームの 1 つを開き、入力されたテキストをクリックして編集できるかどうかを確認してください。可能であれば、フォームにはライブ フォーム フィールドが含まれます。テキストがページ画像の一部である場合、フォームはスキャンされるため、代わりに OCR が必要になります。
PDF フォームのフィールド名によって、スプレッドシートの列ヘッダーが決まります。フォームの異なるバージョンで異なるフィールド名が使用されている場合、抽出されたスプレッドシートには同じデータの複数の列が含まれます。フォーム テンプレートを配布する前に標準化します。すべてのコピーで一貫したフィールド名を使用します。この事前の標準化により、抽出時にクリーンで統一されたスプレッドシートが得られます。
抽出されたデータの処理
抽出したスプレッドシートを開いてデータを確認します。フォームフィールドが空白のままになっている欠損値がないか確認します。電話番号が一部のフォームでは 555-123-4567 として入力され、他のフォームでは 5551234567 として入力されるなど、形式が一貫していないか確認してください。 Excel 関数を使用してデータをクリーンアップします。フォームがフルネームを 1 つのフィールドとして収集した場合は、フルネームを名と姓の列に分割します。 @ 記号の存在を確認して電子メール アドレスを検証します。
フォームに行番号または一意の識別子の列が含まれていない場合は、それを追加します。この識別子を使用すると、スプレッドシート内の特定の行を元の PDF フォームまで追跡できます。データ入力が疑わしい場合は、申請者の元の PDF を開いてフィールド値を確認し、必要に応じてスプレッドシートを修正できます。
繰り返し使用できるようにワークフローを拡張する
PDF フォームの回答を定期的に収集する場合は、抽出されたデータを入力する Excel テンプレートを作成します。テンプレートで数式、ピボット テーブル、グラフ、書式設定を設定します。期間ごとに、新しいフォーム データを抽出し、テンプレートのデータ シートに貼り付けます。数式とグラフは自動的に更新されます。このテンプレートを使用すると、応答のバッチごとに分析を再作成するという反復作業が不要になります。 PDF データの抽出 ワークフローは、最初は数時間かかりましたが、その後は毎回数分かかります。
抽出後、元の PDF フォームをアーカイブします。スプレッドシートは分析に便利です。 PDF はオリジナルの記録です。データに関して質問が生じた場合、元のフォームが信頼できる回答を提供します。外部ユーザーから PDF フォームの応答を収集する組織の場合、抽出後のデータ検証ワークフローは、データが下流システムに入力される前に最も一般的なユーザー エラーを検出します。 @ 記号のない電子メール アドレスを確認します。これは、ユーザーが無効なアドレスを入力したことを示します。電話番号が短すぎたり長すぎたりしていないか確認してください。必須フィールドが空白になっていないか確認してください。不正なデータをサイレントにインポートするのではなく、フォローアップのためにこれらのレコードにフラグを付けます。抽出後に数分間検証することで、不正なデータがレポート、データベース、通信に伝播した場合に数時間かかるクリーンアップを防ぐことができます。定期的なフォーム データ パイプラインを構築するときは、フィールド マッピング (どの PDF フィールド名がデータベースまたはスプレッドシートのどの列に対応するか) を文書化します。 FName や Q1_Answer などのフォーム フィールド名は、FirstName や SatisfactionRating などのシステムの列名と一致しない可能性があります。 PDF フィールド名をシステム列名に変換するマッピング テーブルを作成します。データを抽出するたびに、このマッピングを適用します。マッピング テーブルは、フォーム データが組織のシステムにどのように流れ込むかを理解する必要がある将来のチーム メンバーのための文書としても機能します。オプションのフィールドを含むフォームの場合、抽出により、ユーザーが空のままにしたフィールドに空白のセルが生成されます。必須フィールドが入力されているかどうかをチェックする検証列を追加することで、意図的に空白のフィールドと欠落したデータを区別します。必須の電子メールフィールドに電子メールアドレスが欠落している場合は、フォローアップが必要です。オプションのフィールドにミドルネームが欠けていても問題ありません。検証フラグは、注意が必要なレコードへのフォローアップ作業をガイドします。マッピング テーブルは、フォーム データが組織のシステムにどのように流れ込むかを理解する必要がある将来のチーム メンバーのための文書としても機能します。
PDFをExcelに変換してみる
インストールは必要ありません。ブラウザで直接動作します。
