Others

Czy możesz automatycznie zredagować wzór, taki jak numery telefonów lub adresy e-mail, w całym pliku PDF?

300-stronicowy dokument dotyczący odkrycia prawnego zawiera numery telefonów, adresy e-mail i numery ubezpieczenia społecznego rozrzucone po stronach. Ręczne znajdowanie i redagowanie każdego z nich zajęłoby kilka dni i nadal istnieje ryzyko pominięcia niektórych. Automatyczna redakcja oparta na wzorcach przeszukuje cały dokument pod kątem tekstu pasującego do określonych formatów, numerów telefonów, adresów e-mail, numerów kart kredytowych i stosuje redakcję do każdego dopasowania w ramach jednej operacji. Pytanie nie brzmi, czy jest to możliwe, ale na ile jest to dokładne i jakiego nadzoru wymaga.

Oparta na wzorcach Redakcja PDF używa wyrażeń regularnych w celu identyfikacji tekstu pasującego do predefiniowanych lub niestandardowych wzorców. Wzorzec numeru telefonu pasuje do sekwencji takich jak (555) 123-4567 lub 555-123-4567. Wzorzec wiadomości e-mail pasuje do sekwencji takich jak nazwa@domena.com. Wzór numeru ubezpieczenia społecznego pasuje do ###-##-####. Narzędzie skanuje warstwę tekstową PDF, znajduje każde dopasowanie i jednocześnie je redaguje.

Can You Redact a Pattern Like Phone Numbers or Email Addresses Automatically Across an Entire PDF

Jak działa redakcja oparta na wzorcach

Narzędzie redakcyjne najpierw wyodrębnia tekst ze strumienia treści PDF i wyszukuje określone wzorce. Po znalezieniu dopasowania narzędzie rejestruje numer strony i współrzędne pasującego tekstu na tej stronie. Po zakończeniu wyszukiwania na wszystkich stronach narzędzie stosuje znaczniki redakcyjne do każdej zarejestrowanej lokalizacji, zakrywając tekst i usuwając go z warstwy tekstowej.

Dokładność redakcji opartej na wzorcach zależy od dwóch czynników: precyzji wzorca i jakości warstwy tekstowej PDF. Precyzyjny wzór wychwytuje zamierzony tekst, unikając jednocześnie fałszywych dopasowań. Wzorzec numerów telefonów musi rozróżniać rzeczywiste numery telefonów od innych ciągów cyfr, które mają tę samą długość, takich jak numery faktur, zakresy dat lub numery części.

Dopasowywanie wzorców pozwala znaleźć to, czego ludzkie oko zajęłoby wiele godzin.

Jakość warstwy tekstowej określa, czy wzór w ogóle odnajdzie tekst. Jeśli plik PDF został utworzony z zeskanowanego dokumentu przy użyciu funkcji OCR, funkcja OCR mogła błędnie rozpoznać niektóre znaki. Numer telefonu, w którym cyfra „5” została błędnie rozpoznana jako „S”, nie będzie pasował do wzorca numeru telefonu. Narzędzie redakcyjne nie może zredagować tego, czego nie może znaleźć, a błędy OCR powodują luki w wykrywaniu wzorców.

WukongPDF

Spróbuj zredagować plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →

Typowe wzorce i ich pułapki

Numery ubezpieczenia społecznego są najczęściej redagowanym wzorcem i najprawdopodobniej powodują fałszywe dopasowania. Dziewięciocyfrowy ciąg z łącznikami we właściwych miejscach może być numerem ubezpieczenia społecznego, ale może to być również kod produktu, identyfikator dokumentu lub zakres dat zapisany w nietypowym formacie. Redakcja oparta na wzorcach nie rozumie kontekstu. Pasuje do wzoru, a nie do znaczenia.

Adresy e-mail są łatwiejsze do dokładnego dopasowania, ponieważ symbol @ jest charakterystyczny i rzadko pojawia się poza adresami e-mail. Jednak adresy e-mail osadzone w plikach PDF jako łącza mailto, a nie widoczny tekst, mogą nie zostać dopasowane w wyniku wyszukiwania wzorców tekstowych. Narzędzie redakcyjne przeszukuje widoczną warstwę tekstową, a nie znajdujące się pod nią adnotacje o linkach.

Numery kart kredytowych mają określony format, składający się z 16 cyfr, czasami zgrupowanych w czwórki, który przechodzi kontrolę algorytmu Luhna. Narzędzia redakcyjne oparte na wzorcach, które obejmują weryfikację Luhna, znacznie ograniczają liczbę fałszywych dopasowań, ponieważ losowe 16-cyfrowe sekwencje rzadko przechodzą kontrolę. Jeśli Twoje narzędzie do redagowania nie obejmuje weryfikacji Luhna, przed zastosowaniem redakcji sprawdź ręcznie dopasowania kart kredytowych.

Wzorce niestandardowe umożliwiają redagowanie informacji specyficznych dla organizacji. Format identyfikatora pracownika, wzór numeru konta klienta lub wewnętrzny kod projektu można zdefiniować jako niestandardowe wyrażenie regularne. Bezpieczeństwo PDF Zaletą wzorców niestandardowych jest to, że skupiają się one na informacjach, których brakowałoby we wzorcach ogólnych, dzięki czemu redakcja jest bardziej wszechstronna.

Przeglądanie dopasowań wzorców przed zastosowaniem redakcji

Nigdy nie stosuj redakcji opartej na wzorcach bez uprzedniego przejrzenia dopasowań. Krok przeglądu umożliwia odznaczenie fałszywych dopasowań i ręczne dodanie brakujących dopasowań. Wzorzec generujący 500 dopasowań może zawierać 480 poprawnych dopasowań i 20 fałszywych dopasowań. Jeśli zastosuje się 20 fałszywych dopasowań, tekst, który powinien pozostać widoczny, zostanie nieprawidłowo zredagowany. Etap przeglądu zapobiega temu.

Większość narzędzi redakcyjnych wyświetla dopasowania jako wyróżniony tekst w panelu recenzji. Przewiń listę dopasowań i sprawdź każdy z nich pod kątem kontekstu na stronie. Odznacz mecze, które wyraźnie nie są zamierzonym celem. Ręczny przegląd jest szybszy niż ręczne wyszukiwanie każdego wystąpienia, ponieważ narzędzie przeprowadziło wyszukiwanie, ale nadal jest niezbędny dla zapewnienia dokładności.

Po zastosowaniu redakcji i zapisaniu dokumentu zweryfikuj redakcję, konwertując plik PDF na zwykły tekst i wyszukując zredagowane wzorce w wynikowym tekście. Jeśli w pliku tekstowym pojawi się którykolwiek ze wzorców, oznacza to, że redakcja nie została ukończona. Ta weryfikacja po redakcji wychwytuje dopasowania do wzorców, które znajdowały się w warstwie tekstowej, ale nie zostały pomyślnie zredagowane.

Ograniczenia redakcji opartej na wzorcach

Redakcja oparta na wzorach działa tylko w przypadku tekstowych plików PDF, w których tekst jest przechowywany w postaci znaków. Zeskanowane pliki PDF, które nie zostały przetworzone przez OCR, przechowują tekst jako obrazy i nie zawierają żadnych danych znakowych, które mógłby przeszukać moduł dopasowujący wzorce. Przed przystąpieniem do redagowania na podstawie wzorców wykonaj OCR na zeskanowanych plikach PDF, pamiętając, że błędy OCR spowodują pominięcie niektórych dopasowań wzorców.

Tekst przechowywany w postaci konturów wektorowych, a nie kodów znaków, np. tekst przekonwertowany na ścieżki w oprogramowaniu do projektowania, jest niewidoczny w przypadku redakcji opartej na wzorcach. Tekst wygląda jak tekst na stronie, ale plik PDF zawiera instrukcje rysowania dla każdego kształtu znaku, a nie kody znaków. Redakcja oparta na wzorcach nie może znaleźć tekstu zapisanego w tym formacie.

Przepisy PDF Privacy coraz częściej wymagają od organizacji wykazania, że redakcja została przeprowadzona prawidłowo. Raport redakcyjny oparty na wzorcach, który dokumentuje, które wzorce zostały przeszukane, ile dopasowań znaleziono, ile zastosowano, a ile zostało ręcznie nadpisanych, stanowi dowód należytej staranności w procesie redakcyjnym.

WukongPDF zapewnia narzędzia redakcyjne za pośrednictwem przeglądarki, które mogą lokalnie przetwarzać pliki PDF. Redakcja oparta na wzorcach przeszukuje warstwę tekstową dokumentu pod kątem pasujących wzorców i stosuje znaczniki redakcyjne. Podejście oparte na przeglądarce przechowuje dane dokumentu na Twoim urządzeniu podczas procesu redakcji.

Częściowa redakcja jest czasami konieczna w przypadku wzorców, w których powinna być ukryta tylko część dopasowanego tekstu. Numer telefonu, na którym powinny być widoczne tylko cztery ostatnie cyfry, lub adres e-mail, pod którym domena powinna pozostać widoczna. Narzędzia redakcyjne oparte na wzorcach, które obsługują grupy przechwytywania, pozwalają zdefiniować, które części dopasowanego wzorca należy zredagować, a które pozostawić widoczne.

Po zastosowaniu redakcji wzorcowej należy przeszukać dokument pod kątem fragmentów zredagowanych informacji. Adres e-mail zmieniony na j***@domain.com może nadal być możliwy do zidentyfikowania, jeśli domena jest unikalna. Aby zapewnić maksymalną prywatność, zredaguj cały dopasowany wzór, zamiast próbować częściowej redakcji.

W dokumentach zawierających wystąpienia tego samego wzorca zarówno w formie tekstowej, jak i graficznej, np. plik PDF zawierający zarówno strony wpisane na maszynie, jak i zeskanowane, redakcja oparta na wzorcach obsługuje wystąpienia tekstowe, natomiast redakcja oparta na obrazie musi zostać zastosowana oddzielnie do zeskanowanych stron.

Redakcja oparta na wzorcach jest jednym z elementów kompleksowej strategii oczyszczania dokumentów. Inne komponenty obejmują usuwanie metadanych, usuwanie ukrytej zawartości oraz usuwanie komentarzy i adnotacji. Dokument, który został dokładnie zredagowany według wzorca, ale nadal zawiera nazwisko autora i organizację w metadanych, może nadal powodować wyciek poufnych informacji.

W przypadku dokumentów zawierających informacje prawne redakcja oparta na wzorcach musi być połączona z ręczną recenzją. Wzorzec może znaleźć numery telefonów, ale nie może znaleźć odniesienia do rozmowy telefonicznej, która nie zawierała numeru telefonu. Ręczny przegląd wyłapuje odniesienia kontekstowe, które pomijane są przy dopasowywaniu wzorców.

Biblioteki wzorców współużytkowane przez organizacje mogą poprawić spójność redakcyjną. Kancelaria prawnicza obsługująca setki dokumentów odkrywczych opracowuje bibliotekę przetestowanych wzorców dla typowych wrażliwych typów danych. Udostępnianie tej biblioteki w całej firmie gwarantuje, że każdy dokument zostanie zredagowany według tych samych wzorców.

Niezbędne jest testowanie nowych wzorców na przykładowym dokumencie przed zastosowaniem ich w pełnym dokumencie. Wzorzec, który doskonale sprawdza się w testach, może generować nieoczekiwane dopasowania w rzeczywistym dokumencie z powodu różnic w formatowaniu, artefaktów OCR lub nietypowych formatów danych.

Ścieżka audytu redakcyjnego powinna zostać zachowana obok zredagowanego dokumentu. Ścieżka audytu dokumentuje, jakie wzorce zostały użyte, ile dopasowań znaleziono dla każdego wzorca i czy którekolwiek dopasowania zostały ręcznie nadpisane. Niniejsza dokumentacja wspiera zapewnienie jakości i zgodność z przepisami.

Wyrażenia regularne do dopasowywania wzorców można przetestować poza narzędziem PDF przed uruchomieniem redakcji. Testery wyrażeń regularnych online umożliwiają wprowadzenie przykładowego tekstu i sprawdzenie, które wzorce pasują. Przetestuj swój numer telefonu, adres e-mail i wzorce SSN na reprezentatywnych próbkach tekstu dokumentu, aby sprawdzić, czy odpowiadają zamierzonym celom.

Czas zaoszczędzony dzięki redakcji opartej na wzorcach w porównaniu z redakcją ręczną jest znaczny. Znalezienie i zredagowanie dokumentu zawierającego 500 wrażliwych wzorców zajmuje narzędziu opartemu na wzorcach niecałą minutę. Ręczna redakcja tego samego dokumentu zajęłaby wiele godzin.

W przypadku dokumentów, które będą redagowane cyklicznie, takich jak raporty miesięczne, które zawsze zawierają te same typy poufnych danych, zapisz zestaw wzorców jako ustawienie wstępne. Zastosowanie ustawienia wstępnego do każdego nowego raportu zapewnia spójną redakcję bez konieczności każdorazowej zmiany konfiguracji wzorców.

Szkolenie personelu w zakresie właściwych technik redakcyjnych jest równie ważne, jak posiadanie odpowiednich narzędzi. Narzędzie do redagowania oparte na wzorcach w nieprzeszkolonych rękach może dawać fałszywe poczucie bezpieczeństwa. Personel powinien rozumieć, co narzędzie może, a czego nie może zrobić, znaczenie sprawdzania dopasowań i kroki weryfikacji po redakcji.

W przypadku organizacji podlegających przepisom RODO, HIPAA lub podobnym przepisom dotyczącym prywatności redakcja oparta na wzorcach powinna stanowić część udokumentowanego procesu ochrony danych. Proces powinien określać, jakich wzorców należy szukać, kto sprawdza dopasowania i w jaki sposób redakcja jest weryfikowana przed publikacją dokumentu.

WzórPrzykład wyrażenia regularnegoRyzyko fałszywego dopasowaniaWskazówka dotycząca weryfikacji
Telefon (USA)\(\d{3}\) \d{3}-\d{4}Średni: odpowiada numerom fakturSprawdź kontekst; odznacz dopasowania inne niż telefon
E-mail\S+@\S+\.\S+Niski: @ jest charakterystycznySprawdź, czy domena jest prawdziwą domeną e-mail
numer SSN\d{3}-\d{2}-\d{4}Wysoki: odpowiada kodom produktówRęczny przegląd niezbędny dla wzorców SSN
Karta kredytowa\d{4}-\d{4}-\d{4}-\d{4}Niski z czekiem LuhnaWłącz weryfikację Luhna, jeśli jest dostępna
WukongPDF

Spróbuj zredagować plik PDF

Nie wymaga instalacji. Działa bezpośrednio w Twojej przeglądarce.

Zacznij teraz →