200개의 채워진 PDF 입사 지원서를 수집합니다. 각 양식에는 이름, 이메일, 전화번호, 직위, 시작일, 예상 급여 등 동일한 필드가 있습니다. 단일 Excel 스프레드시트에 200개의 응답이 모두 필요하며, 각 지원자는 행으로, 각 필드는 열로 구성됩니다. 각 PDF를 수동으로 열고, 필드 값을 읽고, Excel에 입력하는 데는 하루 종일 소요됩니다. 이메일 주소나 전화번호에 오타가 하나만 있어도 지원자와의 연락이 두절될 수 있습니다.
채울 수 있는 PDF 양식에서 Excel로 데이터를 자동으로 가져오는 것은 양식 필드 값을 읽고 이를 스프레드시트에 쓰는 데이터 추출 워크플로입니다. 이 프로세스는 빠르고 정확하며 전사 오류를 제거합니다. 추출은 PDF의 양식 필드에서 직접 데이터를 읽습니다.

PDF 양식 데이터 추출 작동 방식
채울 수 있는 PDF 양식은 명명된 필드에 데이터를 저장합니다. 각 필드에는 FirstName 또는 Email과 같은 이름과 사용자가 입력한 값이 있습니다. 데이터 추출은 필드 이름과 값을 읽고 이를 구조화된 형식으로 내보냅니다. 필드 이름은 스프레드시트의 열 머리글이 됩니다. 각 PDF는 하나의 데이터 행이 됩니다. 값은 해당 열 아래의 셀을 채웁니다.
WukongPDF의 PDF에서 Excel로의 양식 데이터 추출은 여러 PDF를 일괄 처리합니다. 작성된 양식 200개를 모두 업로드하세요. 도구는 각 양식에서 필드 이름과 값을 읽습니다. 양식당 하나의 행이 있는 스프레드시트를 생성합니다. 각 필드는 열이 됩니다. 추출을 수행하면 데이터가 입력된 대로 정확하게 보존됩니다. 데이터가 디지털 양식 필드에 입력되었기 때문에 관련 OCR이나 문자 인식 오류가 없습니다.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
클린 데이터 추출을 위한 전제 조건
양식은 실제 양식 필드가 포함된 채울 수 있는 PDF여야 합니다. 손으로 작성한 후 스캔한 양식에는 양식 필드 데이터가 없습니다. 정확도가 낮고 인식 오류가 발생하는 OCR이 필요합니다. 추출 워크플로우를 설정하기 전에 채워진 양식 중 하나를 열고 채워진 텍스트를 클릭하여 편집할 수 있는지 확인하십시오. 가능하다면 양식에 실시간 양식 필드가 있습니다. 텍스트가 페이지 이미지의 일부인 경우 양식이 스캔되며 대신 OCR이 필요합니다.
PDF 양식의 필드 이름은 스프레드시트의 열 헤더를 결정합니다. 양식의 여러 버전에서 서로 다른 필드 이름을 사용한 경우 추출된 스프레드시트에는 동일한 데이터에 대한 여러 열이 포함됩니다. 배포하기 전에 양식 서식 파일을 표준화하세요. 모든 사본에서 일관된 필드 이름을 사용하십시오. 이러한 사전 표준화는 추출 시 깨끗하고 균일한 스프레드시트를 통해 성과를 거두었습니다.
추출된 데이터 처리
추출된 스프레드시트를 열고 데이터를 검토합니다. 양식 필드가 비어 있는 경우 누락된 값이 있는지 확인하세요. 일부 양식에서는 555-123-4567로 입력되고 다른 양식에서는 5551234567로 입력된 전화번호와 같이 일관되지 않은 형식이 있는지 확인하세요. Excel 기능을 사용하여 데이터를 정리합니다. 양식에서 전체 이름을 단일 필드로 수집한 경우 전체 이름을 이름 및 성 열로 분할합니다. @ 기호가 있는지 확인하여 이메일 주소를 확인하세요.
양식에 행 번호 또는 고유 식별자 열이 포함되어 있지 않은 경우 행 번호 또는 고유 식별자 열을 추가합니다. 이 식별자를 사용하면 스프레드시트의 특정 행을 원래 PDF 형식으로 추적할 수 있습니다. 데이터 항목이 의심스러운 경우 해당 신청자의 원본 PDF를 열고 필드 값을 확인하고 필요한 경우 스프레드시트를 수정할 수 있습니다.
반복 사용을 위한 워크플로 확장
PDF 양식 응답을 정기적으로 수집하는 경우 추출된 데이터가 제공되는 Excel 템플릿을 구축하세요. 템플릿에서 수식, 피벗 테이블, 차트, 서식을 설정하세요. 각 기간마다 새 양식 데이터를 추출하여 템플릿의 데이터 시트에 붙여넣습니다. 수식과 차트가 자동으로 업데이트됩니다. 템플릿은 각 응답 배치에 대한 분석을 다시 작성하는 반복적인 작업을 제거합니다. 처음에는 몇 시간이 걸렸던 PDF 데이터 추출 워크플로는 이후에는 몇 분이 걸립니다.
추출 후 원본 PDF 양식을 보관합니다. 스프레드시트는 분석에 편리합니다. PDF는 원본 기록입니다. 데이터에 대해 질문이 있는 경우 원본 양식이 신뢰할 수 있는 답변을 제공합니다. 외부 사용자로부터 PDF 양식 응답을 수집하는 조직의 경우 추출 후 데이터 검증 작업 흐름은 데이터가 다운스트림 시스템에 들어가기 전에 가장 일반적인 사용자 오류를 포착합니다. 사용자가 잘못된 주소를 입력했음을 나타내는 @ 기호가 없는 이메일 주소를 확인하세요. 너무 짧거나 긴 전화번호를 확인하세요. 공백으로 남겨진 필수 입력란을 확인하세요. 잘못된 데이터를 자동으로 가져오는 대신 후속 조치를 위해 이러한 레코드에 플래그를 지정하세요. 추출 후 몇 분 동안 검증하면 나중에 잘못된 데이터가 보고서, 데이터베이스 및 통신에 전파될 때 몇 시간 동안 정리할 필요가 없습니다. 반복 양식 데이터 파이프라인을 구축할 때 필드 매핑(어떤 PDF 필드 이름이 데이터베이스 또는 스프레드시트의 어떤 열에 해당하는지)을 문서화하세요. FName 또는 Q1_Answer와 같은 양식 필드 이름은 FirstName 또는 SatisfactionRating과 같은 시스템의 열 이름과 일치하지 않을 수 있습니다. PDF 필드 이름을 시스템 열 이름으로 변환하는 매핑 테이블을 만듭니다. 데이터를 추출할 때마다 이 매핑을 적용합니다. 매핑 테이블은 양식 데이터가 조직 시스템으로 어떻게 흘러 들어가는지 이해해야 하는 미래의 팀 구성원을 위한 문서 역할도 합니다. 선택적 필드가 포함된 양식의 경우 추출을 통해 사용자가 비워둔 필드에 대해 빈 셀이 생성됩니다. 필수 필드가 채워졌는지 확인하는 유효성 검사 열을 추가하여 의도적으로 비어 있는 필드와 누락된 데이터를 구별합니다. 필수 이메일 필드에 이메일 주소가 누락된 경우 후속 조치가 필요합니다. 선택 필드에 중간 이름이 누락되어도 괜찮습니다. 검증 플래그는 주의가 필요한 기록에 대한 후속 노력을 안내합니다. 매핑 테이블은 양식 데이터가 조직 시스템으로 어떻게 흘러 들어가는지 이해해야 하는 미래의 팀 구성원을 위한 문서 역할도 합니다.
PDF를 Excel로 사용해 보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
