U OCR een PDF en de herkende tekst verschijnt in een tekstvak in uw PDF-editor. Je kunt het lezen. Je kunt het kopiëren en plakken. Maar wat je eigenlijk wilt is de tekst in een Markdown-bestand, met koppen opgemaakt als hashes, lijsten als sterretjes, links als paren haakjes en haakjes, en alinea's gescheiden door lege regels. Markdown is de taal van ontwikkelaars, technische schrijvers, bloggers en iedereen die schone, draagbare tekst nodig heeft die in een statische sitegenerator, een notitie-app of een codeopslagplaats kan worden geplaatst.
Van een gescande PDF naar een Markdown-bestand gaan is een pijplijn van twee stappen: OCR herkent de tekst, en vervolgens wordt de herkende tekst door een opmaakstap omgezet in Markdown-syntaxis. Elke stap heeft toolkeuzes die de kwaliteit van de uiteindelijke output beïnvloeden.

Stap 1: OCR de PDF om herkende tekst te extraheren
De OCR-stap is hetzelfde als het doorzoekbaar maken van een PDF. Gebruik een OCR PDF-tool om de gescande pagina's te verwerken. De tool voegt een tekstlaag toe aan elke pagina. Voor Markdown-export wilt u de OCR-uitvoer in een indeling waarin zoveel mogelijk structurele informatie behouden blijft: welke tekst is een kop, welke tekst is de hoofdtekst, welke tekst is onderdeel van een lijst of tabel. Standaard OCR-engines voeren platte tekst uit, waardoor alle structurele informatie verloren gaat. Een kop en een hoofdparagraaf worden niet van elkaar te onderscheiden tekstblokken, gescheiden door regeleinden.
Voor de beste resultaten gebruikt u een OCR-engine die lay-outbewuste tekstextractie ondersteunt. Deze motoren analyseren de ruimtelijke indeling van tekst op de pagina en kunnen onderscheid maken tussen koppen, hoofdtekst, bijschriften en voetnoten op basis van lettergrootte, positie en nabijheid van andere elementen. Hoe meer structurele informatie de OCR-engine vastlegt, hoe schoner de Markdown-conversie zal zijn. De functie Exporteren naar van Adobe Acrobat Pro omvat een optie "Tekst met opmaak" optie die enkele structurele signalen behoudt. De OCR-engine bewaart metagegevens voor de lettergrootte en positie die downstream-conversietools kunnen gebruiken om kopniveaus en alinea-einden af te leiden.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Stap 2: Converteer de herkende tekst naar Markdown
Zodra de PDF een tekstlaag heeft, kan de conversie naar Markdown via verschillende paden verlopen. De eenvoudigste is een directe export vanuit een PDF-editor die Markdown als uitvoerformaat ondersteunt. De exportopties van WukongPDF omvatten Markdown als doelformaat wanneer de PDF met OCR is verwerkt. Selecteer Markdown als uitvoerformaat en de tool genereert een .md-bestand met de herkende tekst opgemaakt volgens de Markdown-conventies: regels die beginnen met grotere lettertypen worden kopteksten met hash-voorvoegsel, ingesprongen regels worden lijstitems en gewone alinea's worden gescheiden door lege regels.
Als er geen directe Markdown-export beschikbaar is, is de pijplijn: exporteer de herkende tekst naar een rich-text-indeling waarin de opmaak behouden blijft, zoals RTF of HTML, en converteer vervolgens dat tussenliggende formaat naar Markdown met behulp van een conversietool. Pandoc, de universele documentconverter, kan deze pijplijn goed aan. Exporteer de tekst uit de PDF als HTML en voer vervolgens uit: pandoc input.html -f html -t markdown -o output.md. Pandoc vertaalt HTML-koptags naar Markdown-hashes, HTML-lijsttags naar Markdown-lijstmarkeringen en HTML-linktags naar Markdown-linksyntaxis. De kwaliteit van de uitvoer hangt af van de kwaliteit van de HTML-export uit de PDF. Als de PDF-export schone, goed gestructureerde HTML oplevert, produceert Pandoc schone Markdown. Als de export rommelige HTML oplevert met inline stijlen en niet-semantische tags, zal de Markdown dienovereenkomstig rommelig zijn.
OCR-fouten in de markdown-uitvoer opschonen
OCR-fouten in de herkende tekst worden ongewijzigd doorgegeven aan de Markdown-uitvoer. Veel voorkomende fouten zijn onder meer verwarde tekens zoals "cl" herkend als "d," "rn" herkend als "m," en "1" herkend als "l," vooral bij kleinere lettergroottes of scans van lagere kwaliteit. Een beoordeling door het Markdown-bestand om deze fouten op te sporen is essentieel als de tekst wordt gepubliceerd of gedeeld.
De meeste code-editors en Markdown-editors bevatten functionaliteit voor spellingcontrole die niet-herkende woorden markeert, waardoor OCR-fouten gemakkelijk te herkennen zijn. Werk de gemarkeerde woorden door en corrigeer ze aan de hand van de originele pdf. Besteed bijzondere aandacht aan eigennamen, technische termen en cijfers; deze worden het meest waarschijnlijk verkeerd herkend en zijn ook het schadelijkst als ze verkeerd worden gepubliceerd. Een financieel rapport waarin OCR "$123.000" als "$128.000" bevat een materiële fout die de automatische spellingcontrole niet kan onderkennen, omdat beide geldige getalformaten zijn. Handmatige verificatie van kritische waarden aan de hand van het brondocument is de enige betrouwbare waarborg.
Afbeeldingen en tabellen behouden bij de markdown-conversie
Markdown verwerkt afbeeldingen door te verwijzen naar externe bestanden: . Bij het converteren van een PDF naar Markdown moeten de afbeeldingen in de PDF worden geëxtraheerd en opgeslagen als afzonderlijke bestanden, en moeten referentielinks op de juiste posities in de Markdown-tekst worden ingevoegd. WukongPDF's PDF Export naar Markdown omvat afbeeldingsextractie als onderdeel van de conversie. Elke afbeelding in de PDF wordt opgeslagen als PNG- of JPEG-bestand in een map naast het Markdown-bestand, en de Markdown-tekst bevat de juiste afbeeldingsreferentietags.
Tafels zijn uitdagender. Markdown-tabellen gebruiken een pipe-and-dash-syntaxis die voor mensen gemakkelijk te lezen is, maar voor geautomatiseerde converters moeilijk te genereren op basis van PDF-tabelgegevens, omdat PDF's tabellen niet als gestructureerde gegevens opslaan. Ze slaan karakters op posities op. De converter moet het tabelraster reverse-engineeren op basis van tekenposities, wat imperfecte resultaten oplevert voor complexe tabellen met samengevoegde cellen, celinhoud met meerdere regels of ongelijke kolombreedtes. Eenvoudige rastertabellen met uniforme kolommen en celinhoud van één regel worden betrouwbaar geconverteerd. Bij complexe tabellen is mogelijk een handmatige herstructurering nodig in de Markdown-uitvoer. Als een tabel slecht converteert, kunt u overwegen deze als afzonderlijke afbeelding te exporteren in plaats van als Markdown-tabelsyntaxis. Een goed leesbare afbeelding van een complexe tabel is nuttiger dan een onleesbare Markdown die wordt weergegeven als verkeerd uitgelijnde kolommen.
Het markdown-bestand in gebruik nemen
Het resulterende Markdown-bestand wordt geopend in elke teksteditor, notitie-app zoals Obsidian of Notion, statische sitegenerator zoals Hugo of Jekyll, of code-editor zoals VS Code. Vanuit Markdown kunt u HTML genereren voor een website, PDF voor distributie, DOCX voor Word-verwerking, of de tekst eenvoudigweg in een doorzoekbaar, versiebeheersbaar tekstformaat houden dat tientallen jaren leesbaar blijft.
De waarde van deze pijplijn komt het duidelijkst naar voren bij archiefmateriaal. Oude gescande rapporten, historische documenten en uitverkochte publicaties worden allemaal niet alleen doorzoekbaar, maar ook transformeerbaar. Een gescand rapport uit 2005 wordt een Markdown-bestand dat kan worden bewerkt in een moderne editor, kan worden geconverteerd naar een website, kan worden geciteerd in een blogpost of programmatisch kan worden geanalyseerd. Het PDF-formaat dat de tekst twintig jaar lang in een afbeelding opsloot, beperkt niet langer de manier waarop de inhoud kan worden gebruikt.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
