Tips & Tricks

PDF에서 모든 하이퍼링크를 추출하여 클릭 가능한 목록으로 내보내는 방법

PDF에는 웹사이트, 이메일 주소, 내부 문서 참조에 대한 수십 개의 하이퍼링크가 포함되어 있습니다. 확인, 보관 또는 용도 변경을 위해서는 모든 링크 목록이 필요합니다. 각 링크를 수동으로 클릭하고 URL을 복사하는 것은 지루하고 오류가 발생하기 쉽습니다. PDF 링크 추출 도구는 PDF에서 링크 주석을 읽고 이를 구조화된 목록으로 내보냅니다.

PDF의 하이퍼링크는 연관된 작업이 있는 페이지의 개체인 링크 주석으로 저장됩니다. 작업은 일반적으로 웹 주소나 이메일 클라이언트를 여는 URI 작업입니다. 추출 도구는 이러한 주석을 읽고, URL을 추출하고, 이를 목록으로 컴파일합니다.

How to Extract All the Hyperlinks From a PDF and Export Them to a Clickable List

PDF 하이퍼링크가 저장되는 방법

PDF 링크 주석에는 클릭 가능한 영역을 정의하는 페이지의 직사각형 영역과 해당 영역을 클릭할 때 실행되는 작업이라는 두 가지 구성 요소가 있습니다. URI 작업은 대상 URL을 저장합니다. 링크에는 눈에 보이는 텍스트, 즉 밑줄이 그어지거나 색상이 지정된 단어가 있을 수도 있지만 URL은 눈에 보이는 텍스트가 아닌 작업에 저장됩니다.

내부 링크는 문서 내의 특정 페이지나 명명된 대상으로 이동하는 GoTo 작업을 사용합니다. 이는 URL이 아니라 PDF 내부 탐색 명령입니다. 추출 도구는 내부 링크의 대상 페이지 번호 또는 명명된 대상을 보고할 수 있습니다.

링크 주석에서 PDF 데이터 추출에는 개체 수준에서 PDF 구조를 구문 분석할 수 있는 도구가 필요합니다. 주석은 페이지 콘텐츠가 아니기 때문에 범용 텍스트 추출 도구에는 링크 주석이 표시되지 않습니다. 전용 링크 추출 도구가 필요합니다.

WukongPDF

PDF 편집을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →

링크 추출 및 내보내기

링크 추출 도구에 PDF를 로드합니다. 이 도구는 모든 페이지에서 링크 주석을 검색하고 결과를 컴파일합니다. 각 항목에는 일반적으로 페이지 번호, 표시되는 링크 텍스트(사용 가능한 경우), URL 또는 대상, 링크 유형, 웹, 이메일 또는 내부가 포함됩니다.

WukongPDF는 브라우저를 통해 PDF 내보내기 도구를 제공합니다. 문서 분석 기능의 일부로 링크 추출이 가능합니다.

추출된 링크 목록 구성

정렬 및 필터링을 위해 추출된 링크를 CSV 또는 Excel 파일로 내보냅니다. 외부 웹사이트, 이메일 주소, 내부 문서 참조 등 유형별로 링크를 그룹화합니다. 샘플을 테스트하여 각 외부 링크를 확인하세요. 이전 PDF의 링크는 더 이상 존재하지 않는 웹 사이트를 가리킬 수 있습니다.

확인 및 유지 관리를 위해 링크 목록 사용

게시된 문서의 경우 링크 목록은 품질 보증 도구 역할을 합니다. 모든 링크가 의도한 대상으로 이동하는지, 링크가 끊어지지 않았는지 확인하세요. 원본 문서에서 끊어진 링크를 업데이트하고 PDF를 다시 생성합니다.

보관된 PDF의 경우 링크 목록은 출판 당시 문서가 참조한 외부 리소스를 문서화합니다. 이 정보는 연결된 리소스를 더 이상 사용할 수 없는 후에도 역사적 가치를 갖습니다.

특수 링크 유형 처리

mailto를 사용한 이메일 링크: 추출된 각 이메일 주소로 테스트 메시지를 보내 URL을 확인해야 합니다. 이전 PDF의 이메일 주소는 더 이상 유효하지 않을 수 있습니다. 링크 추출은 주소가 여전히 활성 상태인지 확인하지 않고 PDF에 나타나는 대로 주소를 보고합니다.

URL로 이동하지 않고 코드를 실행하는 JavaScript 링크는 단순 URL로 추출할 수 없습니다. 추출 도구는 JavaScript 작업이 존재하지만 해당 대상을 결정할 수 없다고 보고합니다. 이러한 링크의 목적을 이해하려면 수동 검사가 필요합니다.

PDF 내에 포함된 파일을 여는 파일 첨부 링크는 외부 URL이 아닌 내부 참조입니다. 추출 도구는 첨부 파일 이름을 보고하지만 URL을 추출할 수는 없습니다. 첨부 파일에 액세스하려면 PDF를 열고 첨부 파일 패널을 사용하세요.

대용량 문서의 링크 확인 자동화

수백 개의 링크가 포함된 문서의 경우 자동 링크 확인을 통해 수동 확인에 소요되는 시간을 절약할 수 있습니다. 링크 목록을 CSV로 내보낸 다음 CSV를 읽고 각 URL을 테스트하는 링크 검사기 도구를 사용합니다. 검사기는 오류를 반환하거나 리디렉션하거나 느리게 반응하는 링크를 보고합니다.

배포된 PDF의 끊어진 링크는 독자의 경험을 저하시키고 문서가 오래되었음을 암시합니다. 활발히 배포되는 PDF에 대해 정기적인 링크 확인을 예약합니다. 수정된 링크로 소스 문서를 업데이트하고 PDF를 다시 생성합니다.

웹 사이트의 일부인 PDF의 링크 확인 프로세스는 웹 사이트 링크 확인 작업 흐름과 통합될 수 있습니다. 웹 사이트 링크를 확인하는 동일한 도구는 추출된 PDF 링크 목록을 처리하여 게시된 모든 콘텐츠에 대한 통합 링크 상태 보고를 제공할 수 있습니다.

추출된 링크 목록은 문서의 사이트맵 역할을 하여 문서가 외부 리소스에 연결되는 방식을 보여줄 수도 있습니다. 문서 참조의 네트워크 보기는 문서 범위를 이해하고 문서와 함께 보관해야 할 리소스를 식별하는 데 유용합니다.

링크 추출 보고서는 보이는 페이지 텍스트에서 발견된 링크와 보이는 텍스트 없이 PDF 구조에만 존재하는 링크를 구별해야 합니다. 링크 주석이 텍스트 콘텐츠 없이 페이지 영역을 덮을 때 보이지 않는 링크가 발생할 수 있습니다.

모든 페이지에서 반복되는 페이지 바닥글의 URL과 같은 PDF 머리글 및 바닥글의 링크는 추출 보고서에 여러 번 나타납니다. 이러한 반복 링크를 그룹화하면 동일한 URL이 수십 번 보고되는 것을 방지할 수 있습니다.

도메인 이름이 아닌 IP 주소를 사용하는 링크 대상은 추출 보고서에 플래그가 지정되어야 합니다. IP 주소 링크는 대상 서비스에 적절한 도메인 이름이 있기 전에 PDF가 생성되었음을 나타낼 수 있습니다.

추출된 링크 목록이 PDF와 함께 게시될 때 내부 또는 관리 URL이 실수로 포함되지 않았는지 확인하십시오. 링크 추출을 통해 공개용으로 의도되지 않은 URL이 드러날 수 있습니다.

링크 추출 프로세스는 문서에 더 이상 존재하지 않는 페이지 또는 명명된 대상을 참조하는 끊어진 내부 링크도 식별할 수 있습니다. 이러한 깨진 내부 링크는 독자의 탐색 막다른 골목입니다.

대규모 문서 컬렉션의 일부인 PDF의 경우 모든 문서에서 추출된 링크 목록을 통합하여 마스터 링크 색인을 만듭니다. 색인은 어떤 문서가 어떤 외부 리소스를 참조하는지 보여줍니다.

추출된 URL에 대한 정규식 일치는 특정 도메인에 대한 링크, 추적 매개변수가 있는 링크 또는 HTTP와 같이 더 이상 사용되지 않는 프로토콜을 사용하는 링크와 같은 특정 패턴을 따르는 링크를 식별할 수 있습니다.

추출된 링크 목록은 PDF와 함께 보관되어야 하는 메타데이터 아티팩트입니다. 미래의 연구자는 모든 링크를 수동으로 열지 않고도 링크 목록을 사용하여 문서 컨텍스트와 참조를 이해할 수 있습니다.

일부 PDF 생성 도구는 링크 대상을 반영하는 텍스트로 문서에 링크 정보를 포함합니다. 이 텍스트는 클릭 가능한 링크 옆이나 아래에 나타날 수 있으며 링크 주석에 액세스하지 않고도 텍스트 추출을 통해 추출할 수 있습니다.

접근성 준수를 위해 PDF의 모든 링크에는 링크 목적을 설명하는 식별 가능한 대체 텍스트가 있어야 합니다. 링크 추출 보고서는 문서 전체의 링크 접근성을 감사하는 데 사용할 수 있습니다.

링크 유형PDF 작업추출된 출력확인
외부 URLURI 작업전체 URL테스트 링크; 리디렉션 확인
이메일(mailto:)URI 작업이메일 주소테스트 메시지 보내기
내부 페이지 참조GoTo 액션페이지 번호 또는 명명된 대상탐색을 확인하려면 클릭하세요.
자바스크립트 링크자바스크립트 액션작업 코드(URL 아님)수동 검사 필요

대상 페이지가 제거되거나 재구성되어 시간이 지남에 따라 하이퍼링크 작동이 중지되는 현상인 링크 부패는 웹 페이지에 영향을 미치는 것처럼 PDF에도 영향을 미칩니다. 오늘 수행된 링크 추출은 몇 년 후에 보관된 PDF에서 여전히 활성 상태인 링크를 감사하는 데 사용될 수 있습니다.

여러 개의 포함된 문서가 포함된 PDF 포트폴리오에서 링크를 추출할 때 포함된 각 문서에는 고유한 링크 세트가 있습니다. 추출 도구는 포함된 각 문서를 별도로 처리하고 추출된 링크에 소스 문서 이름으로 레이블을 지정해야 합니다.

bit.ly 또는 t.co와 같은 URL 단축기를 사용하는 링크는 실제 목적지를 모호하게 만듭니다. 추출 보고서에는 PDF에 있는 단축 URL이 포함되어 있습니다. 최종 목적지에 대한 단축 URL을 확인하고 두 가지를 모두 보고서에 포함하면 각 링크가 어디로 연결되는지에 대한 완전한 투명성이 제공됩니다.

추출된 링크 목록을 스프레드시트로 가져와 도메인별로 정렬할 수 있습니다. 도메인별로 정렬하면 문서에서 가장 자주 참조하는 외부 웹사이트가 무엇인지 알 수 있습니다. 주로 하나의 도메인에 연결되는 문서는 해당 조직과 후원 또는 제휴 관계를 가질 수 있습니다.

접근성 감사의 경우 링크 추출 보고서를 통해 설명 텍스트가 부족한 링크를 식별할 수 있습니다. 표시되는 텍스트가 여기를 클릭하세요 또는 자세히 알아보기인 링크는 대상에 대한 컨텍스트를 제공하지 않습니다. 이러한 설명이 없는 링크는 의미 있는 링크 텍스트를 포함하도록 소스 문서에서 업데이트되어야 합니다.

정부 및 법률 PDF에는 법령, 규정, 법원 판결에 대한 링크가 포함되어 있는 경우가 많습니다. 이러한 문서에 대한 링크 추출 보고서는 확인을 위한 URL과 함께 모든 법적 참조를 나열하는 근거 목록 역할을 합니다.

링크 추출은 정적 PDF를 확인, 분석 및 용도 변경이 가능한 구조화된 참조 데이터 세트로 변환하는 간단하지만 강력한 기능입니다.

추출된 링크 목록은 문서의 품질 보증 도구이자 인용 소스를 탐색하려는 독자를 위한 참조 리소스 역할을 합니다.

WukongPDF

PDF 편집을 사용해 보세요

설치가 필요하지 않습니다. 브라우저에서 직접 작동합니다.

시작하기 →