Tips & Tricks

OCR batchgewijs uitvoeren op gescande PDF's met behoud van de originele bestandsnamen

Het uitvoeren van OCR PDF op een map met gescande documenten zou doorzoekbare PDF's moeten opleveren met namen die overeenkomen met de originelen. Wanneer batch-OCR-tools de uitvoerbestanden generiek hernoemen, zoals output1.pdf, output2.pdf, gaat de verbinding tussen het origineel en de doorzoekbare versie verloren. Door bestandsnamen te behouden via het OCR-proces blijven de gescande documenten georganiseerd en traceerbaar.

Het behoud van bestandsnamen is een configuratiedetail en geen functiebeperking. De meeste OCR-tools genereren standaard uitvoerbestandsnamen op basis van de invoerbestandsnamen of staan het specificeren van een uitvoernaamgevingspatroon toe. De sleutel is het vinden van de juiste instelling of opdrachtregelvlag voordat de batch wordt uitgevoerd, en niet nadat is ontdekt dat 200 bestanden zijn hernoemd.

De Gescande PDF OCR-tools van WukongPDF verwerken documenten afzonderlijk en in batch met behoud van de originele bestandsnamen.

How to Batch-Run OCR on Scanned PDFs While Keeping Original Filenames

Batch-OCR met de actiewizard van Acrobat Pro

De Actiewizard van Acrobat Pro automatiseert PDF-verwerking in meerdere stappen voor een map. Ga naar Extra, Actiewizard, Nieuwe actie. Voeg de stap Tekst herkennen toe aan de actie, waarbij u de juiste OCR-taal en uitvoerinstellingen selecteert. Voeg een stap Opslaan toe die bestanden opslaat in een opgegeven uitvoermap, waarbij u optioneel een achtervoegsel zoals _OCR kunt toevoegen om doorzoekbare bestanden van originelen te onderscheiden.

Voer de actie uit op de invoermap. Acrobat opent elk bestand, voert OCR uit, slaat de uitvoer op met het achtervoegsel toegevoegd aan de oorspronkelijke bestandsnaam en gaat naar het volgende bestand. De uitvoermap bevat doorzoekbare PDF's met namen als report_OCR.pdf die overeenkomen met het originele report.pdf. Bij de achtervoegselbenadering blijft de oorspronkelijke bestandsnaam behouden, terwijl duidelijk wordt aangegeven welke bestanden met OCR zijn verwerkt.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Opdrachtregel batch-OCR met Tesseract

Tesseract verwerkt één afbeeldingsbestand tegelijk. Voor batch-OCR van een map met gescande PDF's converteert u eerst elke PDF-pagina naar een afbeelding, voert u Tesseract uit en combineert u vervolgens opnieuw tot een doorzoekbare PDF. Een shellscript handelt de pijplijn af. Voor elke PDF in de map extraheert het script de basisbestandsnaam, converteert pagina's naar TIFF-afbeeldingen, voert Tesseract uit met de juiste taalvlag en genereert een doorzoekbare PDF met de originele basisbestandsnaam.

Het script gebruikt parameteruitbreiding om de bestandsextensie te verwijderen: base=${f%.pdf} geeft de bestandsnaam zonder .pdf. De uitvoer van Tesseract heet $base en de resulterende doorzoekbare PDF wordt opgeslagen als ${base}_searchable.pdf. De originele bestandsnaam blijft behouden in de uitvoernaam. Een lus van één regel verwerkt een hele map: for f in *.pdf; doe tesseract $f ${f%.pdf} -l eng PDF; klaar.

Gestroomlijnde batch-OCR met OCRmyPDF

OCRmyPDF is een op Python gebaseerd opdrachtregelprogramma dat een OCR-tekstlaag toevoegt aan bestaande PDF's. Het verzorgt de beeldextractie, OCR en het opnieuw samenstellen van PDF's intern. Eén enkele opdracht verwerkt één PDF: ocrmypdf input.pdf output.pdf. De uitvoer behoudt de pagina-afbeeldingen en voegt herkende tekst erachter toe als een onzichtbare laag.

Voor batchverwerking accepteert OCRmyPDF een mappad met de vlag --batch of kan in een shellscript worden herhaald. Het belangrijkste voordeel ten opzichte van Tesseract voor PDF-verwerking is dat OCRmyPDF rechtstreeks werkt met PDF-invoer en -uitvoer. Er is geen tussentijdse beeldconversie nodig. De uitvoerbestandsnaam kan per bestand worden opgegeven, waarbij de oorspronkelijke naamgevingsconventie behouden blijft. Voor de digitalisering van grote volumes gescande documenten biedt OCRmyPDF in combinatie met een shell-lus het meest efficiënte pad van onbewerkte scans naar doorzoekbare archieven.

ToolBatchmethodeBestandsnaamverwerking
Acrobat Pro ActiewizardActie maken, toepassen op mapBehoudt de originele bestandsnaam, voegt een achtervoegsel toe
Tesseract CLIShell for-loop over mapUitvoer komt overeen met de invoerbestandsnaam
OCRmijnPDFEén opdracht per bestand of batchOverschrijft of maakt een nieuw bestand per instellingen

Batch-OCR-uitvoer verifiëren

Controleer na de batchverwerking een voorbeeld van de uitvoerbestanden voordat u de originelen archiveert. Open drie tot vijf uitvoer-PDF's uit verschillende delen van de alfabetisch gesorteerde bestandslijst. Zoek naar een woord dat zichtbaar is in de gescande afbeelding. Als de zoekopdracht het woord vindt, is de OCR voor dat bestand geslaagd. Controleer de eerste pagina, een middelste pagina en de laatste pagina van elk voorbeeldbestand. De OCR-kwaliteit kan binnen een document variëren als pagina's een verschillende scankwaliteit hebben.

Als het gaat om documentworkflows: voor documenten waarbij OCR mislukte, aangegeven door een PDF waarin zoeken niets oplevert, voert u OCR opnieuw uit met aangepaste instellingen. Verhoog de afbeeldingsresolutie naar 400 DPI als de originele scan van lage kwaliteit is. Probeer een andere OCR-engine als Tesseract slechte resultaten oplevert. Verwerk probleembestanden afzonderlijk in plaats van de hele batch opnieuw uit te voeren.

Batch OCR met behoud van bestandsnamen transformeert een map met ontoegankelijke gescande documenten in een doorzoekbaar archief waarin elk bestand traceerbaar is naar het origineel. De bestandsnaam is de link tussen de originele scan en de OCR-versie.

Langdurige opslag van met OCR verbeterde gescande PDF's

Eenmaal ingesteld, slaat u, na batch-OCR-verwerking, de doorzoekbare PDF's op een locatie op waar zowel pagina-afbeeldingen als de OCR-tekstlaag behouden blijven. PDF/A-formaat met een ingebedde tekstlaag is de archiveringsstandaard. Converteer OCR-uitvoer naar PDF/A met Acrobat Pro of Ghostscript met de PDF/A-uitvoerinstelling.

In de praktijk voegt de OCR-tekstlaag een minimale overhead toe aan de bestandsgrootte, doorgaans 5 tot 15 procent. De afweging van iets grotere bestanden voor doorzoekbaarheid is bijna altijd de moeite waard. Een gescand document dat niet kan worden doorzocht, is aanzienlijk minder nuttig dan een document dat dat wel kan.

In de praktijk zou de mapstructuur voor batch-OCR-uitvoer de invoerstructuur moeten weerspiegelen bij het verwerken van geneste mappen. Een recursief batchscript dat de relatieve padstructuur behoudt, zorgt ervoor dat OCR-bestanden dezelfde organisatorische hiërarchie behouden als originelen.

Als het gaat om documentworkflows, kunt u voor extreem grote batch-OCR-projecten met duizenden documenten overwegen de werklast over meerdere sessies of machines te verdelen. OCR is rekenintensief en een batch van tienduizend pagina's kan op één machine enkele uren duren.

Eenmaal ingesteld, genereert u na het voltooien van een batch-OCR-project een verwerkingsmanifest met een lijst van elk invoerbestand, het uitvoerbestand, de gebruikte OCR-engine en instellingen, en de verwerkingsdatum. Het manifest dient als documentatie en registratie van verwerkte bestanden.

Als we dit in de praktijk bekijken, is de overgang van ondoorzoekbare gescande archieven naar doorzoekbare met OCR verbeterde collecties een van de digitaliseringsactiviteiten met de grootste impact. De mogelijkheid om voorheen ontoegankelijke documenten te doorzoeken, transformeert ze van statische records in actieve informatiebronnen.

De OCR-verwerkingssnelheid varieert afhankelijk van de complexiteit van het document. Pagina's met alleen tekst worden snel verwerkt. Pagina's met tabellen, gemengde lettertypen of decoratieve elementen duren langer. Een reeks uniforme tekstpagina's is sneller voltooid dan een reeks gevarieerde inhoud.

Bij de meeste tools heeft de OCR-taalinstelling invloed op de batchverwerkingstijd en nauwkeurigheid. Door alleen de talen te selecteren die daadwerkelijk in de documenten aanwezig zijn, vermijdt u onnodige verwerkingsoverhead en vermindert u valse tekenherkenning door ongebruikte taalmodellen.

Voor documenten die zowel tekst als foto's bevatten, kan de OCR-engine proberen tekst in fotogebieden te herkennen, waardoor ruis ontstaat. Post-OCR-filtering verwijdert deze artefacten door de ruimtelijke verdeling van herkende tekst te analyseren.

Doorgaans balanceert de DPI-instelling voor OCR-invoerafbeeldingen de verwerkingssnelheid en nauwkeurigheid. 300 DPI is de standaardaanbeveling. 400 DPI verbetert de nauwkeurigheid voor kleine tekst. 200 DPI verwerkt sneller, maar mist mogelijk fijne tekens.

Voer na batch-OCR een trefwoordzoektest uit op de verwerkte bestanden met behulp van termen waarvan bekend is dat ze in de originelen voorkomen. Bestanden waarin het trefwoord niet wordt gevonden, moeten opnieuw worden verwerkt met aangepaste instellingen of handmatige beoordeling.

OCR-uitvoerbestanden moeten worden opgeslagen in een mapstructuur die de verwerkte bestanden scheidt van de originelen. Dit voorkomt onbedoelde herverwerking van bestanden die al met OCR zijn verbeterd en houdt het archief georganiseerd.

Binnen deze context kan de OCR-tekstlaag in de praktijk voor elk document afzonderlijk worden geëxtraheerd en opgeslagen als plat tekstbestand. Afzonderlijke tekstbestanden ondersteunen zoeken in de volledige tekst in het hele archief zonder elke PDF afzonderlijk te openen.

Bij documentverwerking kunt u voor hoogwaardige gescande archieven overwegen om OCR uit te voeren met twee verschillende zoekmachines en de uitvoer te vergelijken. Discrepanties tussen motoren wijzen op onzekere herkenning die handmatige verificatie vereist.

Batch OCR vormt de brug tussen papieren archieven en digitaal zoeken. Een archiefkast met papieren documenten wordt, zodra ze zijn gescand en met OCR verwerkt, een doorzoekbare kennisbank. De transitie van fysiek naar doorzoekbaar digitaal is een van de meest impactvolle transformaties op het gebied van informatiemanagement die een organisatie kan doorvoeren.

Batch-OCR met behoud van bestandsnamen vormt de brug tussen een map met ontoegankelijke gescande documenten en een doorzoekbaar digitaal archief. De verwerking is geautomatiseerd. De bestandsnamen zorgen voor traceerbaarheid. De OCR-tekstlaag maakt elk document vindbaar. De combinatie transformeert een statische verzameling in een actieve informatiebron.

WukongPDF

Probeer PDF-OCR

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →