Others

형식 변환이 유지되도록 PDF에서 정보를 편집할 수 있습니까?

PDF 편집기의 수정 도구를 사용하여 PDF에서 주민등록번호를 수정합니다. 검은색 상자가 나타나는 것을 확인하고 파일을 저장한 후 전송하세요. 수신자는 편집을 위해 PDF를 Word로 변환하고 마치 편집이 발생하지 않은 것처럼 변환된 문서에 완전히 표시되는 주민등록번호를 찾습니다. 이것은 버그가 아닙니다. 이는 문서 형식 변환이 진행될 때 대부분의 수정 도구에서 예상되는 동작이며 이로 인해 실제 데이터 유출이 발생했습니다.

2024년 영국 정보위원회 사무실은 부적절한 PDF 수정이 정부 문서와 관련된 데이터 침해의 세 번째로 흔한 원인이라고 보고했습니다(ICO, "Data Security Incident Trends", 2024). 가장 빈번한 근본 원인은 수정 실패가 아니라 수정이 다운스트림을 통과할 수 있는 모든 형식 변환을 포함하여 문서의 전체 수명주기 동안 유지되었는지 확인하지 못한 것입니다.

Can You Redact Information From a PDF So It Survives Format Conversion

데이터 수준에서 적절한 PDF 교정이 작동하는 방법

적절한 PDF 편집은 텍스트 위에 검은색 상자를 그리는 것과 근본적으로 다릅니다. 실제 편집 도구를 사용하면 두 가지 일이 발생합니다. 보이는 텍스트가 검은색 직사각형으로 덮이고 기본 텍스트 내용이 PDF의 텍스트 레이어에서 제거됩니다. 문자 자체는 파일의 데이터 스트림에서 삭제됩니다. 리더 어플리케이션은 블랙박스 아래에 아무것도 없기 때문에 아무것도 표시하지 않습니다.

주석 도구를 사용하여 텍스트 위에 검은색 직사각형을 그리고 이를 수정되었다고 하면 보안 전문가가 외관상 수정이라고 부르는 작업을 수행한 것입니다. 텍스트는 여전히 PDF의 데이터 레이어에 그대로 남아 있어 추출이 가능합니다. 누구나 텍스트를 선택하고, 복사하고, 다른 곳에 붙여넣고, 블랙박스 아래의 모든 단어를 읽을 수 있습니다. PDF를 다른 형식으로 변환하면 변환 도구는 시각적 오버레이가 아닌 기본 텍스트를 읽습니다. 편집은 애초에 실제가 아니었기 때문에 사라집니다.

실제 편집과 외관 편집의 차이는 매우 중요하므로 이제 정부 기관과 법률 회사는 민감한 문서를 처리하는 직원을 위한 필수 교육에 이를 포함시킵니다. 부적절하게 수정된 단일 법원 서류, FOIA 응답 또는 규제 제출로 인해 개인 데이터가 대규모로 노출될 수 있으며, 적절한 수정 도구를 사용하는 데 소요되는 몇 초의 추가 시간보다 평판 및 법적 결과가 훨씬 더 커집니다.

문서가 여러 사람의 손을 거치는 경우 특히 위험한 시나리오가 발생합니다. A 사람은 적절한 교정을 적용하고, B는 파일을 열고 블랙박스를 확인한 후 교정이 완료되었다고 가정하고 이를 전달합니다. 그러나 A가 자신도 모르게 외관 교정 도구를 사용했다면 블랙박스에 대한 B의 신뢰는 잘못된 것입니다. 이러한 신뢰 체인 문제로 인해 조직은 검증된 단일 수정 도구를 표준화하고 모든 직원이 이를 올바르게 사용하도록 교육해야 합니다.

코스메틱 편집의 특히 교활한 변형은 화이트박스 편집입니다. 일부 사용자는 흰색 바탕에 흰색이 있으면 텍스트가 보이지 않는다고 가정하여 텍스트 위에 흰색 직사각형을 그립니다. 텍스트를 선택하거나 문서를 변환하면 아래의 텍스트가 표시되고 화면 판독기 소프트웨어는 시각적 색상에 관계없이 해당 텍스트를 소리내어 읽기 때문에 실패합니다. 화이트박스 수정은 전혀 수정이 아닙니다.

WukongPDF

PDF 편집을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

형식 변환 중 수정 작업은 어떻게 되나요?

형식 변환은 원본 PDF를 읽고 해당 내용을 다른 형식으로 작성하여 새 문서를 만듭니다. 변환 도구는 PDF 구조를 구문 분석하고 텍스트, 이미지 및 레이아웃 정보를 추출합니다. PDF 형식 변환의 경우 중요한 질문은 변환 도구가 수정된 영역에서 어떤 텍스트 콘텐츠를 찾는가입니다.

교정이 진짜이고 텍스트가 PDF의 콘텐츠 스트림에서 제거된 경우 변환 도구는 해당 영역에서 아무것도 찾지 못하고 아무것도 쓰지 않습니다. 출력 문서에는 교정이 있었던 텍스트가 없습니다. 수정이 외관상이거나 아래에 텍스트가 여전히 존재하는 블랙 박스 오버레이인 경우 변환 도구는 텍스트를 찾아 출력 문서에 성실하게 기록합니다. 블랙박스는 데이터 요소가 아닌 시각적 요소이며 대부분의 변환 도구는 텍스트 콘텐츠를 추출할 때 시각적 오버레이를 무시합니다.

WukongPDF는 시각적 수준뿐만 아니라 데이터 수준에서 콘텐츠를 제거하는 수정 도구를 제공합니다. 문서의 텍스트 스트림에서 작동하는 적절하게 구현된 PDF 보안 도구를 통해 수정을 적용하면 데이터가 더 이상 파일에 존재하지 않기 때문에 제거된 정보가 형식 변환을 통해 다시 나타날 수 없습니다.

일부 PDF-Word 변환기는 설명 상자, 강조 표시 및 그려진 모양을 포함하여 주석을 보존하려고 특별히 시도합니다. 외관 편집이 주석으로 적용된 경우 변환기는 검은색 직사각형을 Word 모양으로 충실하게 재현할 수 있습니다. 그러나 기본 텍스트는 제거되지 않았으므로 Word 문서에는 검은색 사각형과 그 아래의 텍스트가 모두 표시됩니다. 이 사각형은 선택 및 복사가 가능하며 사각형을 이동하거나 삭제하는 사람이 모두 볼 수 있습니다.

형식 변환은 수정된 콘텐츠가 유출될 수 있는 유일한 경로가 아닙니다. 외관 교정이 포함된 PDF에서 모든 텍스트를 선택하고 텍스트 편집기에 붙여넣기만 하면 교정된 내용이 표시됩니다. 찾기 기능을 사용하여 PDF에서 수정된 용어를 검색하면 해당 용어가 시각적으로 가려져 있어도 찾을 수 있습니다. 화면 판독기와 접근성 도구는 기본 텍스트 레이어를 읽습니다. 이러한 대체 추출 경로는 모두 외관 편집이 의존하는 시각적 오버레이를 우회합니다.

OCR 기반 교정 및 텍스트 다시 나타나는 문제

스캔한 PDF는 편집에 또 다른 복잡성을 추가합니다. 스캔한 문서는 기본적으로 종이 사진입니다. 텍스트는 문자로 저장되지 않고 이미지의 픽셀로 저장됩니다. 텍스트 레이어에서 작동하는 표준 교정 도구는 이미지에서 텍스트를 제거할 수 없으므로 대신 이미지 위에 검은색 상자를 그립니다. 이는 선택이 아닌 필요에 의한 미용적 편집입니다.

스캔한 PDF를 올바르게 수정하려면 실제 이미지 데이터를 수정하여 수정된 영역의 픽셀 값을 검정색으로 바꾸는 도구가 필요합니다. 이미지가 수정된 후 문서에서 OCR을 실행하여 수정되지 않은 콘텐츠에 대해서만 텍스트 레이어를 생성합니다. 교정하기 전에 OCR을 수행하는 경우 교정된 콘텐츠의 OCR 텍스트는 텍스트 레이어에 있으며 모든 형식 변환 도구를 통해 추출됩니다.

스캔한 PDF 교정 시 흔히 저지르는 실수는 먼저 OCR을 수행하여 문서를 검색 가능하게 만든 다음 교정 표시를 적용한 다음 다시 저장하는 것입니다. 이 시퀀스에서는 OCR로 생성된 텍스트 레이어가 교정 표시 아래 그대로 유지됩니다. 후속 변환이나 텍스트 추출은 OCR 레이어에서 수정된 텍스트를 복구합니다. 올바른 순서는 먼저 이미지 픽셀을 수정한 다음 정리된 이미지를 OCR하는 것입니다. 이 순서를 사용하면 텍스트 레이어에 수정된 내용이 포함되지 않습니다.

교정이 변환 후에도 유지되는지 확인하는 방법

편집이 영구적인지 확인하는 유일한 방법은 테스트하는 것입니다. PDF를 수정한 후 일반 텍스트 파일로 변환하고 수정된 콘텐츠를 검색하세요. 텍스트 파일에 수정된 데이터가 포함되어 있으면 수정이 효과적이지 않은 것입니다. 교정 후 PDF의 모든 텍스트를 선택하여 텍스트 편집기에 붙여넣는 것이 더 빠른 확인 방법입니다. 붙여넣기 버퍼에 수정된 텍스트가 포함된 경우 수정은 외관상 수정되었습니다.

스캔한 PDF의 경우 페이지를 PNG와 같은 이미지 형식으로 변환하고 높은 확대/축소로 수정된 영역을 시각적으로 검사합니다. 특히 밝기가 높은 화면이나 인쇄할 때 검정색 오버레이를 통해 원본 콘텐츠의 흔적이 보이면 편집이 충분하지 않은 것입니다. 표시되는 콘텐츠의 단일 픽셀만으로도 원본 정보를 재구성하기에 충분할 수 있습니다.

이러한 각 단계를 포함하고 문서 공개 프로세스의 일부로 요구하는 확인 체크리스트를 만듭니다. 교정을 확인하는 데 걸리는 몇 분은 교정 실패로 인한 데이터 침해에 따른 교정에 걸리는 시간, 일 또는 개월에 비하면 무시할 수 있는 수준입니다. 개인 데이터나 기밀 정보를 처리하는 조직에서는 이 단계가 선택 사항이 아닙니다.

메타데이터 수정: 자주 간과되는 계층

눈에 보이는 텍스트가 적절하게 수정되더라도 PDF는 메타데이터를 통해 민감한 정보를 유출할 수 있습니다. PDF 메타데이터에는 문서 제목, 작성자 이름, 생성 날짜, 수정 내역, 때로는 문서를 검토하거나 서명한 사람의 이름이 포함됩니다. 형식 변환 도구는 일반적으로 가능한 경우 메타데이터를 보존하므로 수정된 메타데이터는 의도한 문서 콘텐츠와 마찬가지로 변환 후에도 유지됩니다.

SANS Institute의 2025년 연구에서는 정부 웹사이트에서 공개적으로 사용 가능한 500개의 수정된 PDF를 분석한 결과 12%에 정리되지 않은 메타데이터 필드의 민감한 정보가 포함되어 있는 것으로 나타났습니다(SANS Institute, "Hidden Data in Publicly Released Documents", 2025). 몇몇 경우에는 문서 본문의 수정된 정보를 수정되지 않은 메타데이터를 사용하여 상호 참조하고 확인할 수 있습니다. 출시 전에 메타데이터를 정리하는 것은 눈에 보이는 콘텐츠를 수정하는 것만큼 중요합니다.

변환 수행 방법에 관계없이 변환이 진행되는 모든 문서에 동일한 확인 프로세스를 적용해야 합니다. 워크플로에 자동화된 변환 단계가 포함된 경우 수동 즉석 검사에 의존하기보다는 해당 자동화에 대한 수정 확인 검사를 구축하세요. 알려진 수정된 용어에 대해 변환된 출력을 검색하는 스크립트는 수동 검토에서 놓칠 수 있는 오류를 포착할 수 있습니다.

표준 문서 검토 체크리스트에 수정 검증을 구축하면 이 중요한 보안 단계를 절대 건너뛰지 않게 됩니다.

WukongPDF

PDF 편집을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →