Er wordt een PDF per e-mail verzonden. Als u het opent, ziet u wat lijkt op een afgedrukt document. De tekst staat er, de opmaak klopt. Maar kun je de tekst selecteren met de cursor, of gaat de cursor er overheen alsof het een foto is? Het antwoord bepaalt of de PDF is gemaakt door het scannen van papier of is gegenereerd vanuit een digitale bron, en bepaalt alles over hoe u met het bestand kunt werken.
Door op tekst te klikken en te kijken of de cursor deze selecteert of negeert, wordt de vraag in één seconde beantwoord.
Om te bepalen of een PDF is gescand of digitaal is gemaakt, moet worden gecontroleerd op selecteerbare tekst, de bestandsstructuur worden onderzocht en worden gezocht naar duidelijke visuele artefacten van het scannen. De OCR PDF-hulpmiddelen van WukongPDF kunnen gescande documenten doorzoekbaar maken, en de onderstaande identificatiestappen van Gescande PDF vertellen u of u überhaupt OCR nodig heeft.

De tekstselectietest
Open de PDF en probeer een woord tekst te selecteren met het tekstselectiehulpmiddel. Als de cursor het woord teken voor teken markeert, bevat de PDF selecteerbare tekst en is deze digitaal gemaakt of al met OCR bewerkt. Als de cursor een selectierechthoek over het hele gebied tekent zonder afzonderlijke tekens te markeren, is de pagina een afbeelding en is de PDF gemaakt door te scannen.
De tekstselectietest is snel en definitief voor controles van één pagina. Voor documenten met meerdere pagina's test u een paar pagina's vanaf het begin, het midden en het einde. Sommige PDF's combineren digitale en gescande pagina's, meestal een digitaal gemaakte begeleidende brief gevolgd door gescande bijlagen. De tekstselectietest op elke pagina maakt duidelijk welke pagina's welke zijn.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Bestandsgrootte en paginaaantal controleren op aanwijzingen
Gescande PDF's zijn doorgaans groter dan digitale PDF's met hetzelfde aantal pagina's, omdat elke pagina een afbeelding van een volledige pagina is. Een gescande PDF van 10 pagina's met 300 DPI is vaak 5-15 MB. Een digitale PDF van 10 pagina's met dezelfde inhoud kan 100-500 KB groot zijn. Het verschil in bestandsgrootte is een snelle aanwijzing voordat u het bestand zelfs maar opent.
Gescande PDF's hebben doorgaans ook minder interne functies. Geen bladwijzers, geen hyperlinks, geen ingesloten lettertypen, geen metagegevens die verder gaan dan de basisbestandseigenschappen. Open Documenteigenschappen en controleer het tabblad Lettertypen. In een gescande PDF staan geen lettertypen vermeld omdat alle inhoud uit afbeeldingen bestaat. Een digitale PDF vermeldt de lettertypen die in het document worden gebruikt.
De bestandseigenschappen voor de aanmaakmethode controleren
Documenteigenschappen omvatten vaak de toepassing waarmee de PDF is gemaakt. Een PDF gemaakt door Adobe Acrobat vanuit Microsoft Word was waarschijnlijk digitaal. Er is een PDF gescand die is gemaakt met Canon Scanner Driver of HP Scan. Een PDF die door een OCR-toepassing is gemaakt, kan een gescand document zijn dat is verwerkt voor doorzoekbaarheid.
Het producerveld in Documenteigenschappen wordt ingesteld door de applicatie die het maakt en is niet altijd betrouwbaar omdat het kan worden gewijzigd of vervalst. Combineer de producenteninformatie met de tekstselectietest en de lettertypecontrole voor een zelfverzekerde bepaling. Drie onafhankelijke tests die op dezelfde conclusie wijzen, zijn betrouwbaar.
| Test | Digitaal PDF-resultaat | Gescand PDF-resultaat |
|---|---|---|
| Tekst selectie | Cursor markeert individuele karakters | Cursor tekent een selectierechthoek over de afbeelding |
| Bestandsgrootte (10 pagina's) | 100-500 KB | 5-15MB |
| Tabblad Lettertypen in Eigenschappen | Geeft een overzicht van ingesloten lettertypen | Leeg, geen lettertypen |
| Producent veld | Word, Acrobat, Chrome | Scannerstuurprogramma, beeldverwerkingssoftware |
Op zoek naar visuele artefacten van scannen
Zoom in tot 400% op een tekstgebied. Gescande PDF's vertonen de karakteristieke artefacten van het vastleggen van afbeeldingen: lichte onscherpte aan de randen van tekens, ongelijkmatige duisternis over de pagina als gevolg van scannerverlichting, en stofvlekken of haarvlekken op de glasplaat van de scanner die verschijnen als vage lijnen of vlekken. Digitale PDF's tonen scherpe karakterranden op elk zoomniveau.
Op gescande PDF's van dubbelzijdige pagina's kunnen spookachtige, vage, omgekeerde tekst vanaf de andere kant van het papier doorschijnen. Dit is een definitief teken van scannen, omdat digitale PDF's geen idee hebben van papierondoorzichtigheid. Ghosting verschijnt als een grijze tekstschaduw achter de primaire tekst, het meest zichtbaar in gebieden waar de primaire tekst schaars is.
PDF-metagegevensvelden gebruiken voor aanvullende aanwijzingen
De PDF-metagegevensvelden, toegankelijk via Documenteigenschappen, kunnen de oorsprong van het document onthullen. Een Titelveld dat de bestandsnaam van het originele document bevat, zoals Jaarverslag-2025-Final.docx, geeft aan dat de PDF is gemaakt op basis van dat Word-bestand. Een leeg Titelveld of een Titel die overeenkomt met de PDF-bestandsnaam is neutraal. Een Creator-veld met Microsoft Word of Google Docs geeft de digitale oorsprong aan.
De velden Aanmaakdatum en Wijzigingsdatum kunnen tijdlijnaanwijzingen geven. Een PDF die binnen enkele minuten na elkaar op dezelfde datum is gemaakt en gewijzigd, suggereert een directe digitale export. Een PDF met een wijzigingsdatum jaren na de aanmaakdatum kan OCR-bewerking of verwerking hebben ondergaan. De metadata vertelt de geschiedenis van het document, en die geschiedenis laat zien of er sprake was van scannen.
Wat u moet doen als u het PDF-type kent
Voor gescande PDF's die doorzoekbaar moeten zijn, voert u OCR uit om een tekstlaag toe te voegen. Het OCR-proces herkent de tekst in de pagina-afbeeldingen en voegt daar selecteerbare, doorzoekbare tekst aan toe. Het visuele uiterlijk verandert niet. De PDF krijgt een betere doorzoekbaarheid en kopieer- en plakmogelijkheden.
Voor digitale PDF's die er gescand uit moeten zien, meestal voor officieel uitziende documentreproducties, is conversie naar afbeelding en terug onnodig en gaat de kwaliteit achteruit. De digitale PDF is al in zijn optimale vorm. Elke verwerking die tekst naar afbeeldingen omzet, vermindert de kwaliteit zonder waarde toe te voegen.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
