Others

Puoi oscurare automaticamente uno schema come numeri di telefono o indirizzi e-mail su un intero PDF

Un documento di scoperta legale di 300 pagine contiene numeri di telefono, indirizzi e-mail e numeri di previdenza sociale sparsi tra le sue pagine. Trovarli e redigerli manualmente richiederebbe giorni e rischierebbe comunque di perderne alcuni. La redazione automatica basata su pattern ricerca nell'intero documento il testo che corrisponde a formati, numeri di telefono, indirizzi e-mail e numeri di carte di credito specifici e applica la redazione a ogni corrispondenza in un'unica operazione. La questione non è se ciò sia possibile, ma quanto sia accurato e quale supervisione richieda.

Redazione PDF basata su modelli utilizza espressioni regolari per identificare il testo che corrisponde a modelli predefiniti o personalizzati. Uno schema di numero di telefono corrisponde a sequenze come (555) 123-4567 o 555-123-4567. Un modello di posta elettronica corrisponde a sequenze come nome@dominio.com. Un modello di numero di previdenza sociale corrisponde a ###-##-####. Lo strumento esegue la scansione del livello di testo del PDF, trova tutte le corrispondenze e le oscura simultaneamente.

Can You Redact a Pattern Like Phone Numbers or Email Addresses Automatically Across an Entire PDF

Come funziona la redazione basata su modelli

Lo strumento di redazione estrae innanzitutto il testo dal flusso di contenuti PDF e cerca i modelli specificati. Quando viene trovata una corrispondenza, lo strumento registra il numero di pagina e le coordinate del testo corrispondente su quella pagina. Una volta completata la ricerca su tutte le pagine, lo strumento applica i segni di redazione a ogni posizione registrata, coprendo il testo e rimuovendolo dal livello di testo.

La precisione dell'oscuramento basato su pattern dipende da due fattori: la precisione del pattern e la qualità del livello di testo del PDF. Uno schema preciso cattura il testo desiderato evitando false corrispondenze. Un modello di numero di telefono deve distinguere tra numeri di telefono effettivi e altre sequenze di cifre che hanno la stessa lunghezza, come numeri di fattura, intervalli di date o numeri di parte.

La corrispondenza dei modelli trova ciò che gli occhi umani impiegherebbero ore per individuare.

La qualità del livello di testo determina se il modello riesce a trovare il testo. Se il PDF è stato creato da un documento scansionato con l'OCR, l'OCR potrebbe aver riconosciuto erroneamente alcuni caratteri. Un numero di telefono in cui la cifra "5" è stata erroneamente riconosciuta come "S" non corrisponderà al modello del numero di telefono. Lo strumento di oscuramento non è in grado di oscurare ciò che non riesce a trovare e gli errori OCR creano lacune nel rilevamento dei pattern.

WukongPDF

Prova Redige PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →

Modelli comuni e le loro insidie

I numeri di previdenza sociale sono il modello più comunemente oscurato e quello che ha maggiori probabilità di produrre false corrispondenze. Una sequenza di nove cifre con trattini al posto giusto potrebbe essere un numero di previdenza sociale, ma potrebbe anche essere un codice prodotto, un ID documento o un intervallo di date scritto in un formato insolito. La redazione basata su modelli non comprende il contesto. Corrisponde allo schema, non al significato.

Gli indirizzi e-mail sono più facili da abbinare con precisione perché il simbolo @ è distintivo e appare raramente al di fuori degli indirizzi e-mail. Tuttavia, gli indirizzi e-mail incorporati nei PDF come collegamenti mailto anziché testo visibile potrebbero non trovare corrispondenza in una ricerca di pattern basata su testo. Lo strumento di redazione esegue la ricerca nel livello di testo visibile, non nelle annotazioni dei collegamenti sottostanti.

I numeri delle carte di credito seguono un formato specifico, 16 cifre, a volte raggruppate per quattro, che supera il controllo dell'algoritmo Luhn. Gli strumenti di redazione basati su modelli che includono la convalida Luhn riducono significativamente le false corrispondenze perché le sequenze casuali di 16 cifre raramente superano il controllo. Se il tuo strumento di redazione non include la convalida Luhn, esamina manualmente le corrispondenze delle carte di credito prima di applicare la redazione.

I modelli personalizzati consentono di oscurare informazioni specifiche dell'organizzazione. Un formato ID dipendente, un modello di numero di conto cliente o un codice di progetto interno possono essere definiti come espressione regolare personalizzata. Il vantaggio Sicurezza PDF dei modelli personalizzati è che prendono di mira le informazioni che i modelli generici non potrebbero cogliere, rendendo la redazione più completa.

Revisione delle corrispondenze dei modelli prima di applicare la redazione

Non applicare mai la redazione basata su modelli senza prima rivedere le corrispondenze. La fase di revisione ti consente di deselezionare le false corrispondenze e aggiungere manualmente le corrispondenze perse. Un modello che produce 500 corrispondenze potrebbe avere 480 corrispondenze corrette e 20 corrispondenze false. Le 20 false corrispondenze, se applicate, oscurerebbero erroneamente il testo che dovrebbe rimanere visibile. La fase di revisione lo impedisce.

La maggior parte degli strumenti di redazione visualizza le corrispondenze come testo evidenziato in un pannello di revisione. Scorri l'elenco delle corrispondenze e verifica ciascuna di esse rispetto al relativo contesto nella pagina. Deseleziona le corrispondenze che chiaramente non sono l'obiettivo previsto. Questa revisione manuale è più veloce della ricerca manuale di ogni istanza perché lo strumento ha eseguito la ricerca, ma è comunque essenziale per la precisione.

Dopo aver applicato la redazione e salvato il documento, verificare la redazione convertendo il PDF in testo semplice e cercando i modelli redatti nell'output di testo. Se nel file di testo viene visualizzato uno qualsiasi dei modelli, la redazione non è stata completata. Questa verifica post-redazione rileva corrispondenze di modelli presenti nel livello di testo ma non redatte correttamente.

Limitazioni della redazione basata su modelli

La redazione basata su pattern funziona solo su PDF basati su testo in cui il testo è archiviato come caratteri. I PDF scansionati che non sono stati elaborati dall'OCR memorizzano il testo come immagini e non contengono dati sui caratteri da ricercare da parte del dispositivo di corrispondenza dei modelli. Esegui l'OCR sui PDF scansionati prima di tentare la redazione basata su pattern, tenendo presente che gli errori OCR faranno sì che alcune corrispondenze dei pattern vengano perse.

Il testo memorizzato come contorni vettoriali anziché come codici carattere, ad esempio il testo convertito in tracciati nel software di progettazione, è invisibile alla redazione basata su pattern. Il testo appare come il testo sulla pagina ma il PDF contiene istruzioni di disegno per ogni forma di carattere, non i codici dei caratteri. La redazione basata su modelli non riesce a trovare il testo archiviato in questo formato.

Le normative PDF Privacy richiedono sempre più alle organizzazioni di dimostrare che la redazione è stata eseguita correttamente. Un report di redazione basato su modelli che documenta quali modelli sono stati cercati, quante corrispondenze sono state trovate, quante sono state applicate e quante sono state sovrascritte manualmente fornisce prova della due diligence nel processo di redazione.

WukongPDF fornisce strumenti di redazione tramite il browser in grado di elaborare i PDF localmente. La redazione basata su pattern ricerca i pattern corrispondenti nel livello di testo del documento e applica i segni di redazione. L'approccio basato su browser conserva i dati del documento sul dispositivo durante il processo di redazione.

A volte è necessaria una redazione parziale per i modelli in cui solo una parte del testo corrispondente deve essere nascosta. Un numero di telefono in cui dovrebbero essere visibili solo le ultime quattro cifre o un indirizzo email in cui il dominio dovrebbe rimanere visibile. Gli strumenti di redazione basati su pattern che supportano i gruppi di acquisizione consentono di definire quali parti del pattern corrispondente oscurare e quali lasciare visibili.

Dopo aver applicato la redazione basata su pattern, cercare nel documento frammenti delle informazioni oscurate. Un indirizzo email oscurato come j***@domain.com potrebbe essere ancora identificabile se il dominio è univoco. Per la massima privacy, oscura l'intero modello corrispondente anziché tentare una oscurazione parziale.

Nei documenti che contengono istanze sia basate su testo che su immagini dello stesso modello, ad esempio un PDF con pagine digitate e scansionate, la redazione basata su pattern gestisce le istanze basate su testo mentre la redazione basata su immagini deve essere applicata separatamente alle pagine scansionate.

La redazione basata su modelli è una componente di una strategia completa di sanificazione dei documenti. Altri componenti includono la rimozione dei metadati, l'eliminazione del contenuto nascosto e l'eliminazione di commenti e annotazioni. Un documento che è stato completamente oscurato ma contiene ancora il nome dell'autore e l'organizzazione nei metadati potrebbe comunque divulgare informazioni sensibili.

Per i documenti di legal discovery, la redazione basata su modelli deve essere combinata con la revisione manuale. Uno schema può trovare i numeri di telefono, ma non può trovare un riferimento a una conversazione telefonica che non includa il numero di telefono. La revisione manuale rileva i riferimenti contestuali che mancano alla corrispondenza dei modelli.

Le librerie di modelli condivise tra le organizzazioni possono migliorare la coerenza della redazione. Uno studio legale che gestisce centinaia di documenti di rilevamento sviluppa una libreria di modelli testati per tipi di dati sensibili comuni. La condivisione di questa libreria all'interno dell'azienda garantisce che ogni documento venga redatto con gli stessi modelli.

È essenziale testare nuovi modelli su un documento campione prima di applicarli al documento completo. Un modello che funziona perfettamente durante i test può produrre corrispondenze inaspettate nel documento reale a causa di variazioni di formattazione, artefatti OCR o formati di dati insoliti.

La traccia di controllo della redazione deve essere conservata insieme al documento redatto. L'audit trail documenta quali modelli sono stati utilizzati, quante corrispondenze sono state trovate da ciascun modello e se alcune corrispondenze sono state sovrascritte manualmente. Questa documentazione supporta la garanzia della qualità e la conformità normativa.

Le espressioni regolari per la corrispondenza dei modelli possono essere testate all'esterno dello strumento PDF prima di eseguire la redazione. I tester regex online ti consentono di inserire testo di esempio e vedere quali modelli corrispondono. Metti alla prova il numero di telefono, l'e-mail e i modelli SSN confrontandoli con campioni rappresentativi del testo del documento per verificare che raggiungano gli obiettivi previsti.

Il tempo risparmiato dalla redazione basata su pattern rispetto alla redazione manuale è notevole. Un documento con 500 istanze di pattern sensibili richiede uno strumento basato su pattern in meno di un minuto per trovarlo e correggerlo. La redazione manuale dello stesso documento richiederebbe ore.

Per i documenti che verranno oscurati in base a una pianificazione ricorrente, come i report mensili che contengono sempre gli stessi tipi di dati sensibili, salvare il modello impostato come predefinito. L'applicazione della preimpostazione a ogni nuovo report garantisce una redazione coerente senza dover riconfigurare i modelli ogni volta.

Formare il personale sulle tecniche di redazione adeguate è importante quanto disporre degli strumenti giusti. Uno strumento di redazione basato su modelli in mani inesperte può produrre un falso senso di sicurezza. Il personale deve comprendere cosa può e non può fare lo strumento, l'importanza di rivedere le corrispondenze e le fasi di verifica post-redazione.

Per le organizzazioni soggette a GDPR, HIPAA o normative simili sulla privacy, la redazione basata su modelli dovrebbe far parte di un processo di protezione dei dati documentato. Il processo dovrebbe specificare quali modelli cercare, chi esamina le corrispondenze e come viene verificata la redazione prima che il documento venga rilasciato.

MotivoEsempio RegexRischio di falsa corrispondenzaSuggerimento per la verifica
Telefono (Stati Uniti)\(\d{3}\) \d{3}-\d{4}Medio: corrisponde ai numeri delle fattureControllare il contesto; deseleziona le corrispondenze non telefoniche
E-mail\S+@\S+\.\S+Basso: @ è distintivoVerifica che il dominio sia un dominio email reale
SSN\d{3}-\d{2}-\d{4}Alto: corrisponde ai codici prodottoRevisione manuale essenziale per i modelli SSN
Carta di credito\d{4}-\d{4}-\d{4}-\d{4}Basso con controllo LuhnAbilita la convalida Luhn se disponibile
WukongPDF

Prova Redige PDF

Nessuna installazione necessaria. Funziona direttamente nel tuo browser.

Inizia ora →