Tips & Tricks

Een PDF splitsen en elke pagina opslaan met een andere aangepaste bestandsnaam

Als u een PDF van 50 pagina's in afzonderlijke pagina's opsplitst, ontstaan er 50 bestanden met de namen pagina-1.pdf tot en met pagina-50.pdf. De namen zijn technisch accuraat qua fysieke paginapositie en volledig nutteloos qua inhoud. Pagina 7 kan het Smith-contract bevatten met ondertekening en betalingsvoorwaarden. Pagina 23 kan de Jones-factuur zijn met regelitems en totaal. Het hernoemen van alle 50 bestanden door ze allemaal afzonderlijk te openen om te ontdekken wat ze bevatten en vervolgens een beschrijvende bestandsnaam te typen, duurt bijna net zo lang als het splitsen van de PDF in de eerste plaats en brengt het risico met zich mee van naamgevingsfouten waardoor bestanden later onvindbaar worden.

De daadwerkelijke splitsingsoperatie duurt seconden. Het hernoemen dat volgt duurt minuten of uren, afhankelijk van het aantal bestanden en of je een methode hebt om namen uit inhoud af te leiden. Het automatiseren van de naamgevingsstap transformeert het splitsen van PDF's van een vervelende klus in een daadwerkelijk efficiënte workflow.

Het splitsen van een Split PDF en het opslaan van elk bestand met een betekenisvolle aangepaste naam betekent dat u vóór het splitsen een naamgevingspatroon moet instellen dat namen afleidt van de documentstructuur zoals bladwijzers, of dat u na het splitsen een tool voor batchhernoemen gebruikt die tekst uit elk bestand leest en een beschrijvende naam uit de inhoud genereert. De PDF-pagina's-splittools van WukongPDF ondersteunen aangepaste naamgeving op basis van bladwijzertekst, en de onderstaande methoden omvatten zowel de gestructureerde pre-split-aanpak als de inhoud-extractie post-split-benadering.

How to Split a PDF and Save Each Page With a Different Custom File Name

Bestandsnamen afleiden uit de documentstructuur vóór het splitsen

Wanneer de PDF een goed georganiseerde bladwijzerhiërarchie heeft, waarbij elke bladwijzer op het hoogste niveau overeenkomt met een logische sectie met een beschrijvende titel, produceert op bladwijzers gebaseerde splitsing uitvoerbestanden die automatisch de bladwijzertekst als bestandsnaam overnemen. Een pdf met maandelijkse klantrapporten waarbij elke bladwijzer op het hoogste niveau een klantnaam is, opgesplitst in bestanden met de naam van elke klant, Smith-Corp.pdf, Jones-LLC.pdf, Acme-Inc.pdf, zonder handmatig hernoemen. De bladwijzertekst moet bestandsysteemveilig zijn, wat betekent dat deze geen tekens mag bevatten die besturingssystemen in bestandsnamen verbieden, zoals dubbele punten, slashes, backslashes, sterretjes of vraagtekens.

Als er bladwijzers aanwezig zijn, maar de tekst ervan is niet geschikt als bestandsnaam, is te lang, bevat ongeldige tekens of gebruikt een inconsistente opmaak, bewerk dan de bladwijzertekst voordat u deze splitst. Open in Adobe Acrobat het deelvenster Bladwijzers, klik met de rechtermuisknop op elke bladwijzer, selecteer Naam wijzigen en typ de gewenste bestandsnaam. Het bewerken van bladwijzers duurt een paar minuten voor een document met tientallen secties, maar de tijd die is geïnvesteerd in het opschonen van bladwijzers betaalt zich direct terug wanneer de gesplitste bewerking perfect benoemde bestanden oplevert zonder verdere tussenkomst.

WukongPDF

Probeer PDF splitsen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Op inhoud gebaseerde namen extraheren na splitsing met algemene namen

Als naamgeving op basis van bladwijzers niet beschikbaar is omdat de PDF geheel geen bladwijzers bevat of omdat de bladwijzertekst geen betekenisvolle inhoudsidentificaties bevat, splitst u het document eerst met generieke opeenvolgende namen en hernoemt u vervolgens elk uitvoerbestand op basis van de tekst die uit de inhoud is geëxtraheerd. Een tool voor batchhernoeming of een Python-script leest de eerste paar regels tekst van de eerste pagina van elk gesplitst bestand, zoekt naar een bekend patroon, zoals een klantnaam die verschijnt na het label Klant: of een factuurnummer na Factuur #, en gebruikt de overeenkomende tekst als de nieuwe bestandsnaam.

De aanpak voor het extraheren van inhoud werkt het beste voor gestructureerde documenten waarbij elke gesplitste sectie een consistente indeling heeft met identificerende tekst op een voorspelbare positie. Een map met maandelijkse facturen waarbij op de eerste regel van elke pagina Factuur # staat, gevolgd door een nummer en op de tweede regel Klant: gevolgd door een naam. De naam ervan kan batchgewijs worden gewijzigd door een script dat beide velden extraheert en een bestandsnaam maakt zoals Invoice-1234-Acme-Corp.pdf. Het script past dezelfde extractie- en naamgevingslogica toe op elk bestand in de batch, waardoor zowel de tijd als het foutenpercentage van handmatig hernoemen wordt geëlimineerd.

De workflow voor het splitsen en benoemen van scripts maken voor terugkerende opdrachten

Een 'split-and-name'-taak die zich volgens een schema herhaalt, dezelfde maandelijkse rapportstructuur die elke maand in dezelfde benoemde secties voor dezelfde distributielijst wordt opgesplitst, rechtvaardigt het bouwen van een permanent script in plaats van het handmatige proces elke cyclus te herhalen. Schrijf de paginabereiken en bijbehorende uitvoerbestandsnamen één keer naar een configuratiebestand. Het script leest de configuratie, splitst de PDF op volgens de opgegeven bereiken, en geeft elk uitvoerbestand een eigen naam. Werk elke maand alleen de ingevoerde PDF-bestandsnaam in de configuratie bij. Het script verwerkt al het andere elke cyclus op identieke wijze.

Versiebeheer van zowel het script als het configuratiebestand. Wanneer de rapportstructuur verandert, een sectie wordt toegevoegd, verwijderd of gereorganiseerd, moet u de configuratie bijwerken zodat deze overeenkomt. De scriptlogica blijft constant. Deze scheiding tussen de verwerkingslogica, vastgelegd in het script, en de documentspecifieke gegevens, vastgelegd in de configuratie, maakt de workflow in de loop van de tijd onderhoudbaar. De persoon die de maandelijkse splitsing uitvoert, hoeft het script niet te begrijpen of aan te passen. Ze bewerken het eenvoudige configuratiebestand en voeren het script uit.

NaamgevingsmethodeVereistenContentbewust?Beste voor
Op bladwijzers gebaseerde splitsingGoed gestructureerde bladwijzers met duidelijke tekstJa, namen afgeleid van de documentstructuurDocumenten met kophiërarchieën
Script voor inhoudextractieConsistente tekstpatronen in elke sectieJa, namen afgeleid van documentinhoudGestructureerde formulieren, facturen, rapporten
Gescripte split-and-nameConfiguratiebestand met bereiken en namenJa, volledig aanpasbaarTerugkerende taken met een identieke structuur

Omgaan met bestandsnaamconflicten en ongeldige tekens

Twee gesplitste pagina's of secties die dezelfde geëxtraheerde naam produceren, twee facturen van dezelfde klant zonder onderscheidingsnummer, creëren een bestandsnaamconflict waarbij het tweede bestand niet kan worden opgeslagen omdat er al een bestand met die naam bestaat. Los conflicten op door een onderscheidend achtervoegsel, een volgnummer, een datum of welk veld dan ook toe te voegen dat de twee documenten onderscheidt. Factuur-1234-Acme-Corp.pdf en Factuur-1235-Acme-Corp.pdf onderscheiden zich op factuurnummer. Als er geen onderscheidingsveld beschikbaar is, voegt u een reeksteller toe: Acme-Corp-1.pdf en Acme-Corp-2.pdf.

Uitgepakte tekst die als bestandsnaam wordt gebruikt, moet worden ontdaan van tekens die het besturingssysteem verbiedt. Verwijder of vervang dubbele punten, schuine strepen, backslashes, sterretjes, vraagtekens, punthaken en sluistekens door koppeltekens of onderstrepingstekens. Trim voorloop- en volgspaties en punten. De schoonmaakstap is alledaags maar essentieel. Een niet-opgeschoonde bestandsnaam die een illegaal teken bevat, zorgt ervoor dat de hernoemingsbewerking mislukt met een besturingssysteemfout, en het diagnosticeren van welke van de 50 bestanden de fout heeft veroorzaakt, is veel tijdrovender dan het preventief opschonen van alle bestandsnamen.

WukongPDF

Probeer PDF splitsen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →