De meeste PDF splitsen-tools verdelen documenten op basis van het aantal pagina's. Vertel de tool dat hij elke 10 pagina's moet splitsen, en hij produceert een set van 10 pagina's, ongeacht hoeveel gegevens elke pagina bevat. Voor documenten waarbij de dichtheid van de pagina-inhoud sterk varieert, produceert het splitsen van het aantal pagina's bestanden van zeer verschillende formaten. Een tekstgedeelte van 10 pagina's kan 100 KB groot zijn. Een sectie van 10 pagina's met foto's in hoge resolutie kan 25 MB groot zijn. Door te splitsen op bestandsgrootte in plaats van op aantal pagina's ontstaan uitvoerbestanden die elk onder een specifieke megabytelimiet liggen, wat e-mailservers, uploadformulieren en documentbeheersystemen feitelijk afdwingen.
Splitsen op basis van bestandsgrootte is complexer dan splitsen op basis van het aantal pagina's, omdat de tool moet schatten hoeveel pagina's binnen de doelgrootte passen voordat de splitsing wordt uitgevoerd. De schatting is nooit exact omdat PDF-compressie en objectontdubbeling de uiteindelijke bestandsgrootte beïnvloeden. De tool splitst conservatief en produceert bestanden die iets onder het doel liggen, en het laatste bestand bevat de resterende pagina's.
De PDF Batch-splitstools van WukongPDF bieden splitsopties voor zowel het aantal pagina's als de bestandsgrootte voor workflows voor documentdistributie.

Waarom het splitsen van bestandsgroottes belangrijk is voor distributie
Limieten voor e-mailbijlagen zijn de meest voorkomende reden voor het splitsen van bestandsgroottes. Gmail beperkt bijlagen tot 25 MB. Outlook-limieten voor de meeste abonnementen zijn 20 MB. Zakelijke e-mailservers leggen vaak zelfs nog lagere limieten op, soms 10 MB of 5 MB. Een pdf van 60 MB die per e-mail moet worden verzonden, moet worden opgesplitst in delen die binnen de bijlagelimiet van de ontvanger vallen. Als u opsplitst op basis van het aantal pagina's, kan er één deel van 22 MB en een ander deel van 38 MB ontstaan, die geen van beide per e-mail kunnen worden verzonden. Door te splitsen op bestandsgrootte wordt gegarandeerd dat elk deel onder de limiet blijft.
Online uploadformulieren handhaven ook limieten voor de bestandsgrootte. Overheidsportals, archiefsystemen voor rechtbanken en sollicitatiesites beperken uploads doorgaans tot 5 MB, 10 MB of 25 MB. De limiet wordt weergegeven op de uploadpagina en als deze wordt overschreden, ontstaat er een foutmelding nadat het uploaden al tijd heeft gekost. Door de PDF vooraf op te splitsen in stukken die overeenkomen met de grootte, zorgt u ervoor dat de upload bij de eerste poging slaagt.
Documentbeheersystemen met opslagquota per bestand profiteren van consistente bestandsgroottes. Een systeem dat kosten in rekening brengt per opgeslagen gigabyte maakt niet uit of bestanden worden opgesplitst op basis van het aantal pagina's of de grootte, maar een systeem dat het aantal bestanden per record beperkt, kan het splitsen van het aantal pagina's, dat veel kleine bestanden oplevert, bestraffen. Het begrijpen van de beperkingen van het stroomafwaartse systeem vormt de basis voor de splitsingsstrategie.
Probeer PDF splitsen
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Methode 1: Opsplitsing van Adobe Acrobat Pro op grootte
Acrobat Pro bevat een optie voor het splitsen van de bestandsgrootte in de tool Document splitsen. Open de PDF, ga naar Extra, Pagina's indelen en klik vervolgens op Splitsen. In het splitsdialoogvenster kiest u Bestandsgrootte in de vervolgkeuzelijst Splitsen op. Voer de maximale bestandsgrootte in megabytes in. Acrobat schat hoeveel pagina's binnen dat formaat passen en splitst dienovereenkomstig.
Het Acrobat-algoritme voor splitsen op grootte werkt goed voor documenten met relatief uniforme pagina's. Voor documenten met zeer variabele paginaformaten kan de schatting 10 tot 20 procent afwijken, omdat Acrobat niet precies kan voorspellen in welke mate de uitvoercompressie de bijdrage van elke pagina aan de bestandsgrootte zal verkleinen. Controleer na het splitsen de werkelijke bestandsgrootte van de uitvoerblokken. Als een deel het doel overschrijdt, verkleint u de doelgrootte enigszins en splitst u opnieuw.
Acrobat geeft de uitvoerbestanden een naam door een achtervoegsel aan de oorspronkelijke bestandsnaam toe te voegen, zoals Document_Part1.pdf, Document_Part2.pdf. De naamgevingsconventie maakt duidelijk dat de bestanden deel uitmaken van een geheel en geeft de juiste leesvolgorde aan. Voor documenten die door de ontvanger opnieuw worden gecombineerd, voegt u in het eerste deel een voorblad toe waarop wordt uitgelegd hoeveel onderdelen u kunt verwachten en hoe u deze weer in elkaar kunt zetten.
Methode 2: Commandoregel splitsen met pdftk
pdftk heeft geen native functie voor splitsen op grootte, maar er kan een script voor worden gebruikt om hetzelfde resultaat te bereiken. De aanpak bestaat uit het opsplitsen van de PDF in afzonderlijke pagina's, het meten van de bestandsgrootte van elke pagina en het groeperen van pagina's in delen waarvan de cumulatieve grootte onder het doel blijft. Een bash- of PowerShell-script automatiseert deze workflow.
Gebruik eerst pdftk om de PDF in afzonderlijke paginabestanden te splitsen: pdftk input.pdf burst. Dit levert pg_0001.pdf, pg_0002.pdf, enzovoort op. Gebruik een systeemopdracht zoals ls -l of du om de bestandsgrootte van elke pagina te meten. Blader in volgorde door de pagina's en verzamel de groottes totdat de volgende pagina het totaal boven het doel zou duwen. Wanneer het doel is bereikt, voegt u de verzamelde pagina's samen in een chunk-bestand met behulp van pdftk cat, reset u de accumulator en gaat u verder met het volgende chunk.
In de praktijk is de pdftk-aanpak gratis en scriptbaar, waardoor deze geschikt is voor batchverwerking en server-side automatisering. De nauwkeurigheid is afhankelijk van de meting van de bestandsgrootte per pagina. Afzonderlijke pagina's, gemeten als afzonderlijke bestanden, kunnen iets groter zijn dan dezelfde pagina's gecombineerd in één PDF, omdat gedeelde bronnen zoals lettertypen worden gedupliceerd in de afzonderlijke paginabestanden. De uiteindelijke bestandsgrootte zal iets kleiner zijn dan de som van de afzonderlijke paginaformaten.
Methode 3: Python-scripting met pikepdf
In de praktijk biedt de pikepdf-bibliotheek programmatische controle over het splitsen van PDF's met precisie op byteniveau. Een Python-script opent de PDF, doorloopt pagina's en gebruikt de pikepdf API om voor elk deel een nieuwe PDF te maken. Het script houdt de cumulatieve, niet-gecomprimeerde grootte bij van de pagina's die aan het huidige deel zijn toegevoegd en start een nieuw deel wanneer het toevoegen van de volgende pagina het doel zou overschrijden.
pikepdf biedt toegang tot de onbewerkte pagina-inhoudsstromen, waardoor een nauwkeurige schatting van de grootte mogelijk is voordat het uitvoerbestand wordt geschreven. Het script kan ook elk deel comprimeren met specifieke instellingen, zoals JPEG-compressie voor afbeeldingen, om de grootte van het uitvoerbestand verder te controleren. De Python-aanpak behandelt randgevallen zoals een enkele pagina die groter is dan de doelgrootte door die pagina afzonderlijk te comprimeren in plaats van te mislukken.
Omgaan met randgevallen bij het splitsen van bestandsgrootte
Wanneer een enkele pagina de doelbestandsgrootte overschrijdt, kan de splitsing geen deel produceren dat alleen die pagina bevat terwijl het onder de doelbestandsgrootte blijft. Opties zijn onder meer het afzonderlijk comprimeren van de extra grote pagina met agressievere beelddownsampling, het opsplitsen van de pagina in kleinere subpagina's als de pagina uit meerdere logische secties bestaat, of het accepteren dat deze pagina het doel zal overschrijden en de uitzondering noteren.
Voor documenten met veel kleine pagina's kan het algoritme voor opsplitsen op grootte stukjes produceren met zeer verschillende paginaaantallen. Blok 1 kan 50 pagina's tekst bevatten. Blok 2 kan 3 pagina's met foto's bevatten. De ontvanger moet ervan op de hoogte worden gesteld dat de delen variëren in aantal pagina's, omdat het splitsingscriterium de bestandsgrootte is en niet het aantal pagina's.
| Methode | Hoe het werkt | Beste voor |
|---|---|---|
| Acrobat Pro gesplitst op grootte | Geef het maximale aantal MB per uitvoerbestand op | GUI-gebruikers, af en toe een splitsing |
| pdftk met schatting van de grootte | Herhaal pagina's totdat de doelgrootte is bereikt | Gescripte workflows, gratis |
| Python + snoekpdf | Paginaformaten lezen, splitsen wanneer het cumulatieve doel het doel overschrijdt | Aangepaste logica, batchverwerking |
Gesplitste uitvoer verifiëren vóór distributie
Na het splitsen op bestandsgrootte opent u elk uitvoerfragment en bevestigt u dat de eerste en laatste pagina's correct zijn. De splitsing moet plaatsvinden aan de paginagrenzen, niet in het midden van een pagina. Controleer of het totale aantal pagina's over alle delen gelijk is aan het aantal pagina's van het originele document. Een discrepantie geeft aan dat een pagina tijdens de splitsing is verwijderd.
Controleer de bestandsgrootte van elk deel ten opzichte van het doel. Chunks moeten zich op of iets onder het doel bevinden. Als een deel het doel met meer dan 5 procent overschrijdt, onderschatte het splitsalgoritme de uitvoergrootte. Verlaag het doel met 10 procent en splits opnieuw. De marge van 5 tot 10 procent houdt rekening met compressievariabiliteit en gedeelde overheadkosten.
Door een PDF op te splitsen op bestandsgrootte in plaats van op paginaaantal, ontstaat uitvoer die voldoet aan de werkelijke beperkingen van digitale distributie. E-mailservers, uploadformulieren en opslagquota maken het niet uit hoeveel pagina's een PDF heeft. Het maakt ze uit hoeveel megabytes het is. Het splitsen van bestandsgroottes brengt de splitsingsstrategie in lijn met de beperking die er toe doet.
Terugkerende splitsingen van bestandsgrootte automatiseren
Vanuit praktisch perspectief automatiseren organisaties die regelmatig grote PDF's splitsen voor distributie in documentworkflows de workflow voor het opsplitsen op grootte. Een script controleert een map op inkomende PDF's boven een bepaalde drempelgrootte, splitst deze op in delen binnen de standaardlimiet voor e-mailbijlagen van de organisatie, en slaat de delen op in een uitvoermap met een consistente naamgeving. Door de automatisering wordt de handmatige splitsingsstap uit het documentdistributieproces verwijderd.
De automatisering kan ook een manifestbestand genereren waarin elke chunkbestandsnaam, de bestandsgrootte en het paginabereik ervan worden vermeld. Het manifest vergezelt de brokken en vertelt de ontvanger hoe het document weer in elkaar gezet moet worden. Een eenvoudig tekstbestand met één regel per chunk en de originele bestandsnaam als header is voldoende. Het manifest verandert een verzameling willekeurig genoemde chunk-bestanden in een duidelijk gedocumenteerd documentpakket.
Als we dit in het algemeen bekijken, kan in documentworkflows voor bedrijfsdocumentbeheersystemen de gesplitste automatisering worden geïntegreerd met de systeem-API om elk deel te registreren als een gerelateerd onderdeel van het bovenliggende document. Het systeem houdt bij dat het oorspronkelijke document van 60 MB is opgesplitst in drie delen van 20 MB voor distributie en kan deze op aanvraag weer samenstellen voor gebruikers die het volledige bestand nodig hebben.
Gesplitste bestanden opnieuw samenstellen aan de ontvangerszijde
Normaal gesproken heeft de ontvanger van een document dat op bestandsgrootte is gesplitst, duidelijke instructies nodig voor het opnieuw in elkaar zetten. De meeste PDF-samenvoegtools kunnen de delen weer combineren in het originele document, als ze in de juiste volgorde worden samengevoegd. De bestandsnamen van de chunks moeten de volgorde aangeven: Document_Part1_of_3.pdf, Document_Part2_of_3.pdf, enzovoort. De ontvanger opent een samenvoegtool, voegt de bestanden in volgorde toe en produceert het opnieuw samengestelde document.
Voor niet-technische ontvangers: voeg een kort instructiebestand met de chunks toe. In het instructiebestand wordt uitgelegd wat de chunks zijn, hoeveel er moeten zijn, hoe je ze opnieuw kunt combineren met behulp van een gratis online PDF-samenvoegtool en met wie je contact kunt opnemen als een chunk ontbreekt of beschadigd is. De extra minuut die wordt besteed aan het schrijven van het instructiebestand voorkomt verwarring en ondersteuningsverzoeken van ontvangers die meerdere PDF-bijlagen ontvangen zonder context.
Na het opnieuw samenstellen moet de ontvanger verifiëren dat het aantal pagina's van het samengevoegde document overeenkomt met het aantal pagina's dat in het manifest staat vermeld. Een mismatch duidt op een ontbrekend of gedupliceerd deel. Het aantal manifestpagina's is de gezaghebbende referentie voor het bevestigen van de volledige hermontage.
Probeer PDF splitsen
Geen installatie nodig. Werkt rechtstreeks in uw browser.
