Tips & Tricks

Hoe u dubbele regels of herhaalde invoer in een PDF-document kunt verwijderen

Een PDF-tabel die uit een database wordt geëxporteerd, bevat 500 rijen. Als u het bestand opent, wordt elke rij twee keer zichtbaar, of worden bepaalde vermeldingen herhaald in een patroon uit een bronquery die duplicaten retourneert. De PDF zelf is niet beschadigd. De gegevens binnenin bevatten dubbele inhoud, en het verwijderen van deze dubbele inhoud betekent dat je de PDF rechtstreeks moet bewerken, wat de meeste tools niet ondersteunen voor bewerkingen op regelniveau, of dat je de PDF moet extraheren, extern ontdubbelen en opnieuw een schone versie moet maken.

PDF's zijn geen spreadsheets. U kunt niet op een knop klikken om dubbele rijen te verwijderen. Maar u kunt de gegevens eruit halen, opschonen en terugplaatsen.

Voor het verwijderen van dubbele regels uit een PDF Editor-document moet de PDF-inhoud worden geconverteerd naar een bewerkbaar formaat, daar worden ontdubbeld en optioneel moet de PDF opnieuw worden gemaakt. WukongPDF's Fix PDF en conversietools verzorgen de extractie, en de onderstaande workflow omvat de volledige deduplicatiepijplijn.

How to Remove Duplicate Lines or Repeated Entries Inside a PDF Document

De inhoud extraheren naar een bewerkbaar formaat

Tekst uit de PDF halen en in een deduplicatievriendelijk formaat plaatsen is de cruciale eerste stap. Exporteer naar Excel als de inhoud in tabelvorm is met consistente kolommen. Exporteer naar Word als de inhoud tekst met alinea's bevat. Exporteer naar platte tekst als de structuur eenvoudig is. De keuze voor het exportformaat volgt de inhoudsstructuur.

Gegevens in tabelvorm horen thuis in Excel vanwege de ingebouwde deduplicatietools. Selecteer het gegevensbereik, ga naar het tabblad Gegevens en klik op Duplicaten verwijderen. Kies de kolommen die definiëren wat als duplicaat telt, meestal alle kolommen voor exacte rijmatching. Excel verwijdert elk duplicaat, behalve het eerste exemplaar, en verwerkt duizenden rijen in seconden.

WukongPDF

Probeer PDF bewerken

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Ontdubbelen in Excel na conversie van PDF naar Excel

Excel's Duplicaten verwijderen werkt op exacte overeenkomsten in geselecteerde kolommen. Bijna dubbele rijen, dezelfde gegevens maar een andere opmaak of witruimte, moeten eerst worden opgeschoond. Trim extra spaties met TRIM. Standaardiseer de behuizing met UPPER of LOWER. Verwijder niet-afdrukbare tekens met CLEAN. Schonere gegevens vóór deduplicatie betekenen dat er meer duplicaten worden gevonden.

Markeer duplicaten voordat u ze verwijdert als beoordeling nodig is. Voorwaardelijke opmaak, regels voor markeercellen, dubbele waarden, laat zien welke rijen duplicaten zijn zonder iets te verwijderen. Bekijk de gemarkeerde rijen, bevestig dat het echte duplicaten zijn en verwijder ze vervolgens. In deze beoordeling worden gevallen opgespoord waarin twee rijen op elkaar lijken, maar werkelijk verschillende transacties zijn die toevallig hetzelfde dollarbedrag delen.

Ontdubbelen in Word voor op tekst gebaseerde PDF's

Voor het uitvoeren van tekst met dubbele alinea's is Zoeken en Vervangen van Word nodig, gecombineerd met jokertekenpatronen. Een alinea die twee keer achter elkaar voorkomt, kan worden gevonden en tot één exemplaar worden teruggebracht. Hiermee worden exacte duplicaten verwerkt, maar niet bijna-duplicaten die een paar woorden verschillen.

Handmatige beoordeling is betrouwbaarder dan automatisering voor verhalende tekst. Scannen naar herhaalde alinea's. Een alinea die zowel in de inleiding als in de conclusie voorkomt, kan een opzettelijke herhaling zijn vanwege een retorisch effect, en geen duplicatiefout. Geautomatiseerde hulpmiddelen kunnen geen onderscheid maken tussen opzettelijke en toevallige herhalingen. Menselijk oordeel is vereist voor tekstontdubbeling waarbij de context bepaalt of herhaling correct is.

InhoudstypeExporteren naarOntwikkelmethodeLet op
Tabelgegevens met kolommenExcelGegevens > Duplicaten verwijderenControleer of alle kolommen die voor matching zijn geselecteerd, correct zijn
Eenvoudige lijst, één item per regelPlatte tekst of ExcelSorteer en verwijder duplicaten, of Excel-ontdubbelingBij het sorteren kan de oorspronkelijke volgorde verloren gaan; voeg eerst de indexkolom toe
Lopende tekst, alinea'sWoordHandmatige beoordeling of duplicaten met jokertekens zoekenOpzettelijke herhaling kan per ongeluk worden verwijderd
Gemengde inhoudExcel voor tabellen, Word voor tekstGesplitst op inhoudstype, elk afzonderlijk ontdubbelenDe volgorde van de hermontage moet behouden blijven

De schone PDF opnieuw maken na ontdubbeling

Nadat u de duplicaten in Excel of Word hebt verwijderd, slaat u het schone bestand op als een nieuwe PDF via Opslaan als PDF of een online converter. De resulterende PDF bevat schone gegevens zonder duplicaten. Vergelijk het aantal originele en opgeschoonde PDF-pagina's. Als het origineel 500 rijen had en 50 duplicaten, zou de opgeschoonde PDF ongeveer 10% minder pagina's moeten hebben. De vermindering van het aantal pagina's bevestigt dat de ontdubbeling heeft gewerkt.

Bewaar de originele PDF als ongewijzigde back-up totdat de opgeschoonde versie is geverifieerd. Een te agressieve ontdubbeling waarbij unieke rijen naast duplicaten zijn verwijderd, kan niet ongedaan worden gemaakt als het origineel wordt verwijderd. Bewaar het origineel totdat verificatie bevestigt dat de opgeschoonde versie correct en volledig is.

Gescripte deduplicatie gebruiken voor grote of herhaalde taken

De Panda's-bibliotheek van Python verwerkt de deduplicatie van grote datasets met meer flexibiliteit dan de ingebouwde tool van Excel. Een script dat de geëxporteerde gegevens leest, deduplicatielogica met configureerbare matchingcriteria toepast en het schone bestand uitvoert, wordt binnen enkele seconden uitgevoerd, ongeacht het aantal rijen. Het script verwerkt randgevallen, wat telt als een duplicaat, welke gebeurtenis moet worden bewaard en of verwijderde rijen moeten worden geregistreerd, met code die de exacte toegepaste logica documenteert.

Voor terugkerende dedup-taken is het script een permanent hulpmiddel. Hetzelfde PDF-rapport dat wekelijks met hetzelfde duplicatiepatroon wordt gegenereerd, wordt elke week door hetzelfde script opgeschoond. De initiële investering in scripting van 30 minuten bespaart urenlang handmatig ontdubbelen gedurende het hele jaar. Versiebeheer van het script, zodat toekomstige beheerders de dedup-logica kunnen zien en deze kunnen aanpassen als het formaat van de brongegevens verandert.

Dubbele inhoud bij de bron voorkomen

Dubbele inhoud in PDF's vindt meestal zijn oorsprong in de databasequery, rapportgenerator of samenvoegingsproces waarmee de PDF is gemaakt. Corrigeer de bronquery om SELECT DISTINCT te gebruiken of de JOIN-voorwaarden te corrigeren. Herstel het samenvoegproces om te controleren op overlappende paginabereiken. Elk duplicaat dat bij de bron wordt verwijderd, voorkomt een downstream PDF-ontdubbelingssessie.

De PDF-ontdubbelingsworkflow behandelt symptomen. De remedie leeft in welk systeem dan ook dat de dubbele inhoud produceerde. Documenteer waar duplicaten vandaan komen en repareer het proces. Een eerste reddingsoperatie is begrijpelijk. Een tweede gebeurtenis uit dezelfde bron met dezelfde duplicaten duidt op een procesfout die permanente correctie behoeft.

WukongPDF

Probeer PDF bewerken

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →