Tips & Tricks

Hoe u het totale aantal woorden of pagina's in meerdere PDF-bestanden kunt tellen

Uitzoeken hoeveel pagina's er in één PDF staan, is triviaal. De viewer geeft het aantal pagina's weer. Uitzoeken hoeveel pagina's er in 50 PDF's in een map staan, of hoeveel woorden er allemaal bij elkaar staan, is dat niet. Het handmatig openen van elk bestand, het noteren van het aantal en het optellen van de getallen duurt langer dan het eigenlijke werk waarvoor de PDF's zijn gemaakt.

Handmatig tellen van bestanden is een taak waarvoor computers zijn uitgevonden. Toch bieden de meeste PDF-tools geen telling van meerdere bestanden.

Voor het tellen van woorden en pagina's in meerdere PDF Batch-bestanden is een tool nodig die batchstatistieken ondersteunt, of een script dat de informatie uit elk bestand haalt en optelt. De PDF Pages-hulpmiddelen van WukongPDF kunnen helpen met individuele bestandsstatistieken, en de onderstaande methoden kunnen de aggregatie van meerdere bestanden verwerken.

How to Count the Total Number of Words or Pages Across Multiple PDF Files

Ingebouwde batchstatistieken gebruiken in PDF-tools

Adobe Acrobat Pro bevat geen batchpagina- of woordentelfunctie. Sommige PDF-beheertools van derden doen dat wel. PDF Architect en Nitro Pro bevatten batchverwerkingsmodules die het aantal pagina's voor een geselecteerde reeks bestanden kunnen rapporteren. De uitvoer is doorgaans een CSV-bestand waarin elke bestandsnaam en het aantal pagina's worden vermeld, met onderaan een totaal.

Browsergebaseerde PDF-tools bieden over het algemeen geen statistieken over meerdere bestanden, omdat het staatloze verzoekmodel geen informatie bijhoudt tijdens het uploaden van bestanden. Elk bestand is een afzonderlijke sessie. Het aggregeren van statistieken vereist een aanhoudende sessie die meerdere bestanden omvat, wat vaker voorkomt bij desktop- en servergebaseerde tools.

WukongPDF

Probeer PDF samenvoegen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Verkenner gebruiken voor schattingen van het aantal pagina's

Windows File Explorer en macOS Finder geven het aantal PDF-pagina's weer in de kolommen met bestandsmetagegevens. Schakel de kolom Pagina's in de detailweergave van de Verkenner in en het aantal pagina's voor elke PDF verschijnt in de lijst. Selecteer alle bestanden en de statusbalk geeft mogelijk de som weer, afhankelijk van de versie en configuratie van het besturingssysteem.

Het lezen van het aantal pagina's in File Explorer gaat snel omdat het een klein metagegevensveld in elke PDF leest in plaats van het hele bestand te openen. Voor een map met honderden PDF's wordt het aantal pagina's binnen enkele seconden ingevuld. Bestandsverkenner biedt echter geen woordenaantallen, en de aflezing van het aantal pagina's kan onnauwkeurig zijn voor PDF's met niet-standaard interne structuren waarbij de metagegevens niet overeenkomen met het werkelijke aantal pagina's.

Een woord- en paginatelling in PDF's scripten

Python met een PDF-bibliotheek zoals PyPDF2 of pdfplumber kan het aantal pagina's en woorden uit elke PDF in een map extraheren en optellen. Het script opent elke PDF, leest het aantal pagina's uit de metagegevens van het document, extraheert tekst uit elke pagina, telt de woorden en telt de totalen op. De uitvoer is het gecombineerde aantal pagina's en woorden voor de hele map.

Het script verwerkt een willekeurig aantal bestanden. Een map met 500 PDF's wordt in enkele minuten verwerkt, afhankelijk van de bestandsgrootte en de snelheid van tekstextractie. Het script produceert consistente resultaten omdat het op elk bestand dezelfde tellogica toepast. Handmatig tellen introduceert variantie door vermoeidheid en afleiding. Gescripte tellingen zijn herhaalbaar en controleerbaar.

MethodeSnelheidNauwkeurigheidVoorziet in aantal woorden?
Metagegevens van VerkennerSecondenMatig (alleen metadata)Nee
Batch PDF-toolNotulenHoogSommige hulpmiddelen
Python-scriptMinuten (afhankelijk van het aantal bestanden)Hoog (extraheert daadwerkelijke tekst)Ja
Handmatig openen en tellenUurLaag (vermoeidheid)Ja, handmatig

Gescande PDF's verwerken in aantal woorden

Gescande PDF's bevatten afbeeldingen, geen tekst. Een woordentelling op basis van tekstextractie levert nul woorden op voor een gescand document, omdat er geen tekst is om te extraheren. Als u gescande PDF's wilt meenemen in het aantal woorden, voert u eerst OCR uit om een tekstlaag te maken. Het woordentellingsscript telt vervolgens de OCR-tekst. Het aantal OCR-woorden is bij benadering omdat OCR herkenningsfouten introduceert.

Voor gemengde mappen die zowel digitale als gescande PDF's bevatten, moet het script afzonderlijke totalen rapporteren: woorden uit digitale PDF's met oorspronkelijke tekst en woorden uit gescande PDF's na OCR. Door ze te combineren tot één totaal zonder onderscheid te maken tussen de bronnen wordt de nauwkeurigheid van het aantal woorden in het gescande document overschat en wordt het feit verdoezeld dat een deel van het totaal door OCR is geschat en niet exact.

Woordentellingen per sectie of hoofdstuk exporteren

Naast het totale aantal woorden levert het extraheren van het aantal woorden per sectie binnen elke PDF gedetailleerde gegevens op voor bewerking, vertaling of facturering. Een script dat PDF-bladwijzers of kopdetectie gebruikt om de tekst te segmenteren en woorden per segment te tellen, produceert een gedetailleerd rapport. Elke rij in de uitvoer toont een bestandsnaam, een sectienaam en het aantal woorden voor die sectie.

Tellingen op sectieniveau zijn waardevol voor vertaalprojecten waarbij verschillende secties aan verschillende vertalers worden toegewezen. De projectmanager gebruikt de tellingen om het werk gelijkmatig te verdelen en de doorlooptijden in te schatten. Dezelfde tellingen ondersteunen facturering per sectie, waarbij de prijzen variëren afhankelijk van de complexiteit van de inhoud. Het totale aantal woorden vertelt u de omvang van het project. Het aantal woorden op sectieniveau vertelt u hoe u het moet verdelen.

De telling gebruiken voor facturering en schatting

Freelancers en bureaus die per pagina of per woord factureren, gebruiken batchtellingen om facturen te genereren. Een script dat een CSV-bestand met bestandsnamen, paginaaantallen en woordenaantallen produceert, biedt een rapport dat gereed is voor facturering. De klant kan de tellingen zelfstandig verifiëren. Het rapport ondersteunt de factuur met gegevens.

Projectschatting profiteert ook van batchtellingen. Voor een vertaalproject met een prijs per woord is een nauwkeurig aantal bronwoorden voor alle documenten nodig. Voor een afdrukproject met een prijs per pagina is het totale aantal pagina's nodig. Door de telling uit te voeren vóór de offerte, zorgt u ervoor dat de offerte gebaseerd is op werkelijke documentvolumes in plaats van op schattingen. De tijd die u aan het tellen besteedt, betaalt zichzelf terug in een nauwkeurige prijsstelling.

WukongPDF

Probeer PDF samenvoegen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →