법적 자료 제출 답변의 일부로 PDF가 책상 위에 놓입니다. 문서 속성 패널이 비어 있습니다. 작성자, 작성 날짜 및 수정 내역 필드는 의도적으로 또는 부수적으로 제거되었습니다. 이 문서가 언제, 누구에 의해 작성되었는지 확인해야 합니다. 일반적으로 이러한 질문에 답하는 메타데이터는 사라졌지만 PDF에는 원본에 대한 복구 가능한 증거가 여전히 포함될 수 있습니다.
PDF 메타데이터 제거는 문서가 공유하기 전에 잠재적으로 민감한 정보를 제거하도록 설계된 정리 도구를 통과할 때 흔히 발생합니다. 이러한 도구는 문서 정보 사전, 표준 메타데이터 필드 및 종종 XMP 메타데이터 스트림을 삭제합니다. 표시되는 페이지 콘텐츠는 유지됩니다. 다큐멘터리 맥락이 제거되었습니다.

스트리핑 후 메타데이터가 숨길 수 있는 위치
Author, Title, Subject, Keywords, Creator, Producer, CreationDate, ModDate가 저장되어 있는 문서 정보 사전은 메타데이터 스트리핑의 주요 대상입니다. 제거 후 이러한 필드는 쿼리 시 비어 있거나 기본값을 반환합니다.
PDF 내의 별도 스트림에 저장된 XMP 메타데이터는 정보 사전만 대상으로 하는 기본 메타데이터 스트리퍼에서 종종 누락됩니다. XMP에는 동일한 필드와 사용자 정의 속성이 포함될 수 있습니다. 전체 파일 구조를 검사하는 Repair PDF 검사 도구를 사용하면 스트리핑 후에도 살아남은 XMP 메타데이터를 확인할 수 있습니다.
원본 페이지 크기, 각 페이지를 생성한 소프트웨어, 페이지 콘텐츠 스트림에 포함된 수정 타임스탬프를 포함한 페이지 수준 메타데이터는 거의 제거되지 않습니다. 스트리핑 도구는 페이지 콘텐츠에서 메타데이터와 유사한 데이터를 검사하지 않기 때문입니다.
PDF 복구를 시도해보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
제거된 메타데이터를 복구하는 기술적 방법
바이너리 파일을 처리할 수 있는 텍스트 편집기에서 PDF 파일을 검사합니다. 파일 헤더와 개별 개체 스트림에서 Creator 및 Producer 문자열을 검색합니다. 이러한 문자열은 원래 PDF를 만든 소프트웨어와 PDF를 마지막으로 수정한 소프트웨어를 식별합니다. 문서 정보 사전이 비워진 경우에도 문자열은 유지됩니다.
포함된 글꼴 메타데이터를 검사합니다. PDF에 포함된 글꼴은 글꼴 생성 날짜와 글꼴 파일을 생성하거나 수정하는 데 사용된 소프트웨어를 포함하여 자체 메타데이터를 유지합니다. 이 날짜는 사후 종료를 제공하며, 포함된 글꼴이 존재하기 전에는 문서를 생성할 수 없습니다.
WukongPDF는 문서 속성을 검사하고 파일 구조 내에서 복구 가능한 메타데이터 요소를 식별할 수 있는 브라우저를 통한 PDF 버전 제어 검사를 제공합니다.
메타데이터 복구가 공개할 수 있는 것과 공개할 수 없는 것
복구 가능한 메타데이터는 생성 소프트웨어, 운영 체제 및 생성 날짜 범위를 식별할 수 있습니다. 2023년 여름 Windows 10에서 Microsoft Word 2016으로 생성된 PDF는 원본을 크게 좁혔습니다. 복구 가능한 메타데이터는 해당 정보가 사용자 정의 메타데이터 필드에 저장되지 않은 한 문서를 생성한 특정 사용자 또는 문서가 생성된 특정 컴퓨터를 식별할 수 없습니다.
수정 내역은 생성 정보보다 복구가 어렵습니다. 일부 PDF 편집기의 각 저장 작업은 새로운 수정 날짜를 기록하지만 이전 날짜는 유지하지 않습니다. 복구 가능한 수정 내역은 증분 저장 정보를 보존한 편집자에 의한 저장 내역입니다.
향후 문서의 메타데이터 손실 방지
PDF를 외부에 공유하기 전에 메타데이터를 검토하여 보존해야 하는지 아니면 제거해야 하는지 결정하세요. 모든 메타데이터를 제거하면 나중에 필요할 수 있는 문서 컨텍스트가 제거됩니다. 메타데이터를 보존하면 기밀일 수 있는 정보가 공유됩니다. 결정은 신중해야 합니다.
중요한 문서의 생성 날짜, 작성자 및 버전 기록을 기록하는 PDF 외부의 문서 기록부를 유지 관리합니다. 외부 등록부는 PDF 메타데이터 작업의 영향을 받지 않으며 문서 출처에 대한 독립적인 기록을 제공합니다.
운영 체제가 파일 자체에 저장하는 생성 및 수정 날짜인 PDF 파일 시스템 메타데이터는 PDF 내부 메타데이터와 별개입니다. PDF 내부 생성 날짜가 제거된 경우에도 파일 시스템은 파일이 현재 저장 위치에 처음 저장된 시점을 계속 기록할 수 있습니다.
이메일 첨부 파일은 이메일 시스템 메타데이터에 이메일 날짜를 유지합니다. PDF가 전자 메일 첨부 파일로 수신된 경우 전자 메일 날짜는 문서의 가능한 가장 최근 생성 날짜를 제공합니다. PDF를 이메일로 보낸 후에는 생성할 수 없습니다.
파일 메타데이터와 별도로 문서 기록을 추적하는 문서 관리 시스템은 메타데이터가 제거되기 전에 원래 생성 날짜, 작성자 및 수정 이벤트를 기록했을 수 있습니다. 문서 관리 시스템에서 문서 ID 또는 파일 이름을 검색하면 사전 스트리핑 메타데이터를 복구할 수 있습니다.
PDF 증분 저장 구조는 파일이 완전히 다시 작성되지 않고 증분적으로 저장된 경우 이전 버전의 문서 정보 사전을 보존합니다. 증분 저장 데이터에 대한 포렌식 조사를 통해 이전 버전에는 있었지만 현재 버전에서 덮어쓴 메타데이터 값이 드러날 수 있습니다.
PDF에 포함된 글꼴은 글꼴 파일 메타데이터에 자체 생성 및 수정 날짜를 포함합니다. 이러한 날짜는 PDF 메타데이터 제거의 영향을 받지 않습니다. 가장 최근의 글꼴 날짜는 문서 생성 날짜의 하한을 제공합니다.
PDF에 포함된 이미지에는 촬영 날짜, 카메라 정보, 편집에 사용된 소프트웨어 등 원본 이미지 파일의 EXIF 메타데이터가 포함되어 있습니다. PDF 이미지에 포함된 EXIF 데이터는 PDF 메타데이터 제거 작업의 영향을 받지 않습니다.
복구된 메타데이터는 복구 방법 및 신뢰도 평가와 함께 문서화되어야 합니다. 파일 시스템 타임스탬프에서 복구된 메타데이터는 포함된 글꼴 생성 날짜에서 복구된 메타데이터보다 신뢰도가 낮습니다. 문서를 통해 미래의 사용자는 복구된 정보의 신뢰성을 평가할 수 있습니다.
제거된 PDF에서 메타데이터를 복구하는 것은 파일 구조에 대한 기술적 조사와 문서 원본에 대한 상황별 조사를 결합하는 포렌식 작업이며, 복구된 정보는 일반적으로 완전하지 않고 부분적입니다.
공유하기 전에 PDF에서 메타데이터를 제거하는 결정은 제거된 정보가 나중에 필요할 수 있으며 복구 옵션이 제한적이고 불확실하다는 점을 염두에 두고 이루어져야 합니다.
제거된 PDF에서 메타데이터 복구는 기술적 분석과 상황별 조사를 결합하여 문서 원본 스토리를 재구성합니다.
PDF 파일 자체의 파일 시스템 타임스탬프는 내부 PDF 메타데이터와 독립적입니다.
제거된 PDF에서 메타데이터를 복구하려면 파일 구조와 외부 소스를 모두 검사해야 합니다.
메타데이터 복구는 기술적 분석과 상황별 분석을 결합한 조사 프로세스입니다.
문서 정보 사전의 PDF 생산자 필드는 파일을 생성한 소프트웨어, 즉 대부분의 메타데이터 제거 후에도 유지되는 정보를 식별합니다.
16진수 편집기를 사용하여 원시 PDF 파일을 검사하면 문서 정보 사전에서 더 이상 참조하지 않는 메타데이터 조각이 드러날 수 있습니다.
PDF 내의 글꼴 파일에 포함된 생성 날짜는 문서 생성에 대한 종료 시점을 제공합니다.
PDF의 XMP 메타데이터 스트림은 문서 정보 사전과 별개이며 도구가 사전만 대상으로 하는 경우 제거 후에도 유지될 수 있습니다.
PDF의 수정 내역은 편집할 때마다 누적되는 증분 저장 섹션에서 재구성될 수 있습니다.
PDF에 포함된 이미지 EXIF 데이터는 PDF 메타데이터 작업에 관계없이 원본 이미지 캡처 날짜를 유지합니다.
문서 관리 시스템 로그에는 배포를 위해 PDF가 처리되기 전의 원본 메타데이터 값이 기록될 수 있습니다.
PDF를 전달한 메시지의 이메일 헤더는 문서의 가능한 최신 작성 날짜를 제공할 수 있습니다.
응용 프로그램마다 기본 페이지 크기가 다르기 때문에 페이지 수와 페이지 크기는 작성 소프트웨어를 식별하는 데 도움이 될 수 있습니다.
PDF 버전 번호 1.4, 1.7, 2.0은 문서가 작성되었을 때 어떤 사양 기능을 사용할 수 있었는지 나타냅니다.
상호 참조 테이블 분석을 통해 개체가 파일에 추가된 순서를 밝혀 상대적인 연대순을 제공할 수 있습니다.
PDF의 개체 번호 지정은 순차적이며 낮은 번호의 개체는 일반적으로 높은 번호의 개체보다 먼저 생성됩니다.
PDF 카탈로그의 문서 언어 설정은 원래 작성자의 언어와 로케일을 나타낼 수 있습니다.
생성 조직에서 정의한 사용자 정의 메타데이터 필드는 문서 소스를 식별하는 명명 규칙을 사용할 수 있습니다.
PDF 출력 의도(있는 경우)는 대상 인쇄 조건을 식별하고 문서의 용도를 나타낼 수 있습니다.
포함된 색상 프로필은 문서가 생성된 색상 관리 환경에 대한 정보를 제공합니다.
페이지 레이아웃 초기 보기 설정은 문서가 화면 보기용으로 디자인되었는지 아니면 인쇄 보기용으로 디자인되었는지를 나타낼 수 있습니다.
PDF의 주석과 주석은 주석 속성에 자체 생성 날짜와 작성자 정보를 포함합니다.
대화형 PDF의 양식 필드에는 조직 시스템이나 날짜를 참조하는 기본값이나 JavaScript가 포함될 수 있습니다.
PDF 뷰어 제목 표시줄에 표시되는 문서 제목은 메타데이터 제목 필드와 다르게 설정될 수 있습니다.
책갈피와 문서 개요는 메타데이터가 제거된 경우에도 섹션 구조를 유지합니다.
문서의 하이퍼링크는 날짜 정보나 조직 식별자가 포함된 URL을 참조할 수 있습니다.
문서에 사용된 글꼴 목록은 페이지 콘텐츠 스트림에서 복구 가능하며 작성 소프트웨어를 나타낼 수 있습니다.
PDF 뷰어에 표시되는 논리적 페이지 번호인 페이지 레이블은 실제 페이지 번호와 다를 수 있으며 문서 구조를 드러낼 수 있습니다.
페이지 콘텐츠에 포함된 워터마크 텍스트에는 문서 작성 중에 적용된 날짜 또는 작성자 정보가 포함될 수 있습니다.
문서 체크섬 또는 해시를 알려진 파일과 비교하여 원본 소스를 식별할 수 있습니다.
파일 크기 패턴, 큰 이미지, 다양한 글꼴, 복잡한 벡터 그래픽은 문서 유형 및 작성 소프트웨어를 나타낼 수 있습니다.
특정 PDF 기능, 레이어, 포트폴리오, 리치 미디어가 있으면 어떤 소프트웨어 버전이 사용되었는지 나타냅니다.
문서에서 텍스트를 추출하면 날짜, 문서 ID 또는 작성자 이름이 포함된 머리글 및 바닥글 텍스트가 표시될 수 있습니다.
문서 암호화 방법은 비밀번호로 보호된 경우 소프트웨어 보안 기능 생성을 나타냅니다.
각 페이지의 용지 크기 및 방향 메타데이터는 문서가 미터법 또는 영국식 측정 지역에서 생성되었는지 여부를 나타낼 수 있습니다.
문서 생성 플랫폼인 Windows, Mac 또는 Linux는 PDF 생산자 문자열에서 식별할 수 있는 경우가 많습니다.
의도적으로 메타데이터를 제거한 후에도 이러한 포렌식 단서를 결합하면 문서 원본에 대한 합리적으로 완전한 그림을 생성할 수 있습니다.
제거된 메타데이터를 복구하려면 내부 PDF 구조와 외부 상황별 소스를 모두 검사해야 합니다.
| 증거 출처 | 공개 내용 | 신뢰성 | 박리 저항 |
|---|---|---|---|
| XMP 메타데이터 스트림 | 작성자, 날짜, 사용자 정의 필드 | 높은 | 기본 스트리퍼가 종종 놓치는 경우가 있음 |
| 포함된 글꼴 날짜 | 글꼴 생성 날짜 | 중간 | 매우 높음(글꼴 파일) |
| 이미지 EXIF 데이터 | 촬영 날짜, 카메라, 소프트웨어 | 중간 | 매우 높음(이미지 데이터에서) |
| 파일 시스템 타임스탬프 | 파일 생성/수정 | 낮은 | 해당 없음(PDF 외부) |
PDF 복구를 시도해보세요
설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.
