Others

병합된 PDF에서 원본 텍스트 레이어를 복구할 수 있습니까?

PDF를 병합하면 모든 주석, 양식 필드 및 레이어 콘텐츠가 단일 정적 이미지 레이어로 병합됩니다. 병합되면 병합 이전에 존재했던 원본 텍스트 레이어는 사라집니다. 한때 선택, 검색 및 추출이 가능했던 텍스트 문자는 병합된 이미지의 픽셀이 됩니다. 병합된 문서에 대한 PDF 복구에서는 병합된 출력에서 원본 텍스트 레이어를 복구할 수 있는지 여부를 묻습니다.

짧은 대답은 PDF가 텍스트 레이어를 유지하거나 유지하지 않고 병합되었는지 여부에 따라 다릅니다. 일부 병합 작업에서는 병합된 이미지 뒤의 원본 텍스트를 숨겨진 콘텐츠로 유지합니다. 다른 병합 작업에서는 텍스트를 완전히 버리고 렌더링된 이미지로 바꿉니다. 첫 번째 경우에는 복구가 가능하지만 두 번째 경우에는 복구가 불가능합니다.

WukongPDF의 PDF 형식 복구 도구는 병합된 PDF 문서에서 보존된 텍스트 레이어를 감지하고 추출할 수 있습니다.

Can You Recover the Original Text Layer From a Flattened PDF

PDF 병합의 작동 방식 및 제거 내용

병합은 PDF 페이지의 보이는 모든 레이어를 하나의 렌더링된 이미지로 결합합니다. 강조 표시, 스티커 메모, 그리기 마크업을 포함한 주석이 페이지 콘텐츠와 병합됩니다. 양식 필드는 대화형 요소에서 채워진 값의 정적 시각적 표현으로 변환됩니다. 투명도 효과는 불투명 픽셀로 분해됩니다. 결과는 원본과 동일해 보이지만 대화형 구조나 계층 구조가 없는 페이지입니다.

실제로 병합 프로세스에서는 병합된 이미지 뒤의 원본 텍스트 레이어를 보존할 수도 있고 그렇지 않을 수도 있습니다. Acrobat Pro의 병합 미리 보기 또는 특정 설정이 포함된 프리플라이트 도구를 통해 병합을 수행하면 원본 텍스트가 보이지 않는 레이어로 유지될 수 있습니다. PDF로 인쇄 또는 타사 도구를 통해 병합을 수행하는 경우 일반적으로 텍스트 레이어가 완전히 삭제됩니다.

빠른 테스트를 통해 텍스트가 보존되었는지 확인합니다. 병합된 PDF를 열고 페이지에서 텍스트를 선택해 보십시오. 텍스트를 선택하고 복사할 수 있으면 텍스트 레이어가 병합된 상태로 유지됩니다. 텍스트를 클릭해도 아무것도 선택되지 않거나 전체 페이지가 이미지로 선택되는 경우 텍스트 레이어가 삭제되고 시각적인 모양만 남습니다.

WukongPDF

PDF 복구를 시도해보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

방법 1: 병합된 이미지 뒤에 숨겨진 텍스트 레이어 확인

Acrobat Pro에서 병합된 PDF를 열고 도구, 콘텐츠 편집, 텍스트 및 이미지 편집으로 이동합니다. 보이는 텍스트 영역을 클릭하세요. Acrobat이 텍스트 주위에 경계 상자를 표시하고 편집을 허용하는 경우 병합된 이미지 뒤에 텍스트 레이어가 존재합니다. 일반 보기 중에는 선택 가능한 텍스트로 표시되지 않더라도 텍스트가 파일 데이터에 존재합니다.

텍스트가 있으면 Acrobat Pro의 PDF를 텍스트로 내보내기 기능을 사용하여 추출합니다. 시각적 페이지가 병합되어 표시되더라도 추출된 텍스트에는 원본 콘텐츠가 포함될 수 있습니다. 추출된 텍스트를 복사하여 원본 콘텐츠 샘플과 비교합니다. 텍스트가 일치하면 원본 텍스트 레이어가 병합된 파일에서 성공적으로 복구된 것입니다.

이를 광범위하게 살펴보면 실제 시나리오에서 Acrobat이 편집 가능한 텍스트를 찾을 수 없는 경우 병합 중에 텍스트 레이어가 삭제되었습니다. 페이지의 시각적 텍스트는 문자 코드가 아닌 병합된 이미지의 픽셀로 구성됩니다. 추출할 텍스트 데이터가 없기 때문에 텍스트 추출을 통한 복구는 불가능합니다.

방법 2: OCR을 사용하여 손실된 텍스트 레이어 재생성

병합 중에 원본 텍스트 레이어가 삭제된 경우 OCR은 이를 다시 만들 수 있는 경로를 제공합니다. Acrobat Pro의 텍스트 인식 기능을 사용하여 병합된 PDF에서 OCR을 실행하세요. OCR 엔진은 각 페이지의 픽셀 이미지를 분석하고 문자 모양을 식별하며 인식된 문자로 새 텍스트 레이어를 생성합니다.

이를 폭넓게 고려하면 실제로 OCR로 재생성된 텍스트 레이어는 원본 텍스트가 아닙니다. OCR은 특히 작은 텍스트, 특이한 글꼴 또는 복잡한 배경 위의 텍스트에서 인식 오류를 발생시킵니다. 다시 생성된 텍스트는 깔끔한 표준 문서의 경우 약 95~99% 정확하며, 인쇄나 레이아웃이 어려운 문서의 경우 정확도가 떨어집니다.

OCR 후 인식된 텍스트를 원본 콘텐츠의 알려진 샘플과 비교합니다(가능한 경우). OCR 오류를 수동으로 수정하거나 다시 생성된 텍스트 레이어를 원본과 비슷한 수준으로 받아들입니다. OCR 출력은 검색 및 텍스트 추출에 사용할 수 있지만 법률, 금융 또는 규제 목적으로 텍스트를 사용하기 전에 확인이 필요한 오류가 포함될 수 있습니다.

PDF 파일 구조에서 텍스트 확인

병합된 PDF에 텍스트 데이터가 존재하는지 확실하게 확인하려면 원시 파일 구조를 검사하십시오. VS Code 또는 Notepad++와 같은 바이너리 파일을 처리할 수 있는 텍스트 편집기에서 PDF를 엽니다. 원본 문서 콘텐츠에서 인식 가능한 텍스트 문자열을 검색합니다. 파일 데이터 내에서 텍스트 문자열이 발견되면 PDF 리더 인터페이스를 통해 액세스할 수 없는 경우에도 텍스트 레이어가 존재합니다.

이 접근 방식을 사용하려면 PDF 내부 구조에 어느 정도 익숙해야 합니다. PDF의 텍스트는 텍스트 개체의 시작과 끝을 나타내는 BT 및 ET 마커 내에 저장됩니다. 이러한 마커 사이에는 위치 지정 명령과 함께 문자 코드가 나열됩니다. 인식 가능한 텍스트가 포함된 BT 및 ET 마커를 찾는 것은 텍스트 데이터가 병합되어도 살아남았음을 나타냅니다.

실제적인 관점에서 보면 실제 시나리오에서 파일 데이터에 텍스트 문자열이 없으면 병합 작업이 콘텐츠를 완전히 래스터화한 것입니다. 페이지는 이미지이며 복구 가능한 텍스트 정보가 포함되어 있지 않습니다. OCR은 텍스트 레이어를 생성하는 데 사용할 수 있는 유일한 경로입니다.

향후 병합 작업에서 텍스트 레이어 손실 방지

텍스트 레이어를 유지해야 하는 PDF를 병합할 때 숨겨진 텍스트를 유지하는 설정을 사용하십시오. Acrobat Pro의 병합 미리 보기 도구에는 중복 인쇄 및 별색 정보를 유지하는 확인란이 포함되어 있어 텍스트 데이터를 간접적으로 보존하는 데 도움이 됩니다. 프리플라이트 도구는 텍스트를 명시적으로 유지하는 병합 수정 기능을 제공합니다.

가장 안전한 방법은 병합하기 전에 병합되지 않은 PDF 사본을 저장하는 것입니다. 병합되지 않은 복사본에는 모든 대화형 요소, 주석 및 텍스트 레이어가 유지됩니다. 평면화된 버전을 배포합니다. 병합되지 않은 원본을 보관합니다. 복구가 필요한 경우 원본이 완전한 소스 데이터를 제공합니다.

더 넓은 관점에서 문서 작업 과정에서 중요한 문서에 대해 병합 설정을 원본에 적용하기 전에 복사본에서 테스트해 보세요. 병합 후에도 텍스트가 복구 가능한 상태로 유지되는지 확인합니다. 복구가 실패하면 설정을 조정하십시오. 테스트 단계에서는 작업 흐름에 시간이 추가되고 영구적인 텍스트 손실이 방지됩니다.

프리플라이트를 사용하여 숨겨진 텍스트 레이어 감지 및 추출

Acrobat Pro Preflight 도구에는 PDF 콘텐츠 구조를 분석하도록 특별히 설계된 프로필이 포함되어 있습니다. 인벤토리 보고서에는 일반 보기 중에 표시되지 않는 개체를 포함하여 파일에 있는 모든 텍스트 개체가 나열됩니다. 병합된 PDF에서 이 보고서를 실행하면 텍스트 데이터가 병합 프로세스에서 살아남았는지 여부가 표시됩니다.

프리플라이트 보고서가 텍스트 개체를 식별하는 경우 모든 텍스트 내보내기 수정을 사용하여 해당 개체를 별도의 파일로 추출합니다. 그런 다음 추출된 텍스트를 표시되는 페이지 콘텐츠와 비교하여 원본 텍스트가 얼마나 보존되었는지, 정확하고 완전한지 여부를 확인할 수 있습니다.

부분적으로 병합된 PDF에서 텍스트 복구

일부 병합 작업은 특정 페이지 요소에만 영향을 미치고 다른 요소는 그대로 유지합니다. 본문 텍스트는 선택 가능한 문자로 유지되는 동안 양식 필드는 병합될 수 있습니다. 기본 페이지 텍스트가 유지되는 동안 주석이 병합될 수 있습니다. 각 요소 유형을 독립적으로 검사하여 병합된 요소와 보존된 요소를 확인하세요.

넓은 각도에서 문서 작업 흐름에서 부분적으로 병합된 문서의 경우 병합되지 않은 부분에서 남아 있는 텍스트를 추출하고 이를 병합된 부분의 OCR 출력과 결합합니다. 하이브리드 접근 방식은 사용 가능한 원본 텍스트와 원본이 손실된 OCR 재구성 텍스트를 사용하여 텍스트 복구를 극대화합니다.

회복이 불가능하다고 받아들여야 하는 경우

이러한 상황이 발생하는 경우 파일 구조에 텍스트 데이터가 없고 Acrobat이 편집 가능한 텍스트를 찾을 수 없으며 OCR이 허용할 수 없을 정도로 부정확한 결과를 생성하는 경우 원본 텍스트 레이어를 복구할 수 없습니다. 이 결론을 받아들이고 복구 시도에 더 많은 시간을 투자하기보다는 남은 것을 보존하는 방향으로 나아가십시오.

복구 시도와 그 결과를 문서화합니다. 사용된 도구, 시도한 방법 및 도달한 결론을 기록해 두십시오. 이 문서는 더 나은 복구 도구에 액세스할 수 있고 이전에 시도된 내용을 이해해야 하는 미래의 문서 관리자에게 제공됩니다.

병합 문서의 장기 보관 전략

병합된 PDF는 대화형 종속성을 제거하므로 보관 목적으로 특별히 생성되는 경우가 많습니다. 병합된 문서를 보관할 때 가능하면 병합되지 않은 원본을 병합된 버전과 함께 저장하십시오. 원본은 전체 문서 구조를 유지합니다. 평면화된 버전은 안정적인 보관 형식을 제공합니다.

병합된 버전만 존재하는 문서의 경우 OCR을 실행하여 텍스트 레이어를 생성하고 이를 PDF에 포함하세요. OCR 텍스트는 완벽하지 않을 수 있지만 그렇지 않으면 불가능했던 향후 검색 및 텍스트 추출이 가능해집니다. OCR 레이어는 병합된 이미지와 향후 문서 분석 요구 사항을 연결하는 다리 역할을 합니다.

문서 컬렉션에 대한 자동 평탄화 감지

대규모 문서 컬렉션을 관리하는 조직은 병합된 PDF를 자동으로 감지하는 이점을 누릴 수 있습니다. 각 PDF를 열고, 선택 가능한 텍스트가 있는지 확인하고, 텍스트가 없는 파일에 플래그를 지정하는 스크립트는 OCR 처리가 필요한 문서를 식별합니다. 자동화된 스캔은 검색 가능한 텍스트 레이어 없이 병합된 문서가 자동으로 아카이브에 들어가는 것을 방지합니다.

문서 수집 워크플로에 평면화 감지를 통합합니다. 새 PDF가 시스템에 입력되면 텍스트가 있는지 확인하십시오. 텍스트가 없는 경우 문서가 아카이브에 도달하기 전에 문서를 OCR 처리 대기열로 라우팅합니다. 자동 감지 및 수정 기능을 통해 보관된 모든 문서를 검색할 수 있습니다.

WukongPDF

PDF 복구를 시도해보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →