
Wat is een gescande PDF en hoe verschilt deze van een native PDF
Een Gescande PDF wordt gemaakt door afbeeldingen van fysieke papieren pagina's vast te leggen met behulp van een scanner of een telefooncamera. Elke pagina van de PDF is een foto van het originele document. De tekst die u op de pagina ziet, bestaat alleen als pixels in de afbeelding. Er zijn geen daadwerkelijke teksttekens opgeslagen in het PDF-bestand. Een gescande PDF is in wezen een fotoalbum waarin elke foto tekst bevat.
De snelste manier om een gescande PDF te identificeren, is door met uw cursor tekst op de pagina te selecteren.
OCR-technologie overbrugt de kloof tussen gescande en oorspronkelijke PDF's door een doorzoekbare tekstlaag toe te voegen.
Een native PDF, ook wel een digitale PDF of een born-digital PDF genoemd, wordt rechtstreeks vanuit een softwareapplicatie gemaakt. Wanneer u een Word-document naar PDF exporteert, een spreadsheet als PDF opslaat of een PDF maakt vanuit een ontwerptoepassing, bevat het resulterende bestand daadwerkelijke teksttekens, selecteerbaar en doorzoekbaar, samen met vectorafbeeldingen en ingesloten lettertypen.
De tekst bestaat als gegevens, niet alleen als pixels. Een native PDF is een gestructureerd document, geen verzameling pagina-afbeeldingen.
Het PDF-formaat ondersteunt beide soorten inhoud binnen hetzelfde bestand. Een PDF kan een aantal pagina's bevatten die gescande afbeeldingen zijn en andere pagina's die bestaan uit oorspronkelijke digitale tekst. Dit scenario met gemengde inhoud komt vaak voor wanneer documenten uit meerdere bronnen worden samengesteld, zoals een rapport dat digitaal gemaakte tekstpagina's combineert met gescande bijlagen uit gedrukte bronnen.
Het praktische verschil tussen gescande en native PDF's heeft invloed op alles wat u met het document kunt doen. U kunt naar woorden zoeken in een native PDF omdat de tekst bestaat als doorzoekbare tekengegevens. U kunt alleen in een gescande PDF zoeken als deze is verwerkt met OCR PDF-technologie die de tekst in de afbeeldingen herkent en een onzichtbare doorzoekbare tekstlaag toevoegt. U kunt tekst uit een native PDF selecteren en kopiëren. U kunt geen tekst selecteren uit een gescande PDF. U kunt tekst in een native PDF bewerken met een PDF-editor. U kunt tekst in een gescande PDF niet bewerken omdat er geen teksttekens zijn om te bewerken.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Hoe u kunt bepalen of een PDF is gescand of native
De snelste test is om te proberen tekst in de PDF te selecteren. Open de pdf en klik en sleep met uw muis of vinger over een woord. Als de tekst tijdens het slepen oplicht, bevat de PDF oorspronkelijke, selecteerbare tekst. Als er niets gebeurt wanneer u tekst probeert te selecteren, is de pagina waarschijnlijk een gescande afbeelding. Als sommige woorden wel oplichten, maar andere niet, bevat de PDF mogelijk een gedeeltelijke of beschadigde tekstlaag.
De zoomtest biedt nog een snelle controle. Zoom in tot 300 of 400 procent op een tekstgedeelte. Als de tekst bij sterke vergroting scherp en helder blijft, is het waarschijnlijk native vectortekst die soepel naar elk formaat kan worden geschaald. Als de tekst bij sterke vergroting korrelig wordt en gekartelde randen vertoont, is er sprake van een gescande afbeelding. Deze visuele test werkt omdat vectortekst vloeiend wordt weergegeven op elk zoomniveau, terwijl op afbeeldingen gebaseerde tekst de pixelstructuur onthult wanneer deze wordt vergroot.
PDF-viewertools kunnen ook rapporteren of een document tekst bevat. In Adobe Acrobat toont het venster Documenteigenschappen het aantal pagina's en of het bestand doorzoekbare tekst bevat. Sommige kijkers geven een tekstlaagindicator weer. Hulpmiddelen voor documentanalyse kunnen een PDF scannen en het percentage pagina's rapporteren dat oorspronkelijke tekst bevat versus alleen-afbeeldingsinhoud.
De bestandsgrootte kan een aanwijzing geven, maar is niet definitief. Een gescande PDF die uit paginaafbeeldingen bestaat, is doorgaans groter dan een oorspronkelijke tekst-PDF met hetzelfde aantal pagina's, omdat afbeeldingen meer opslagruimte vereisen dan tekst. Een native tekst-PDF van 10 pagina's kan 100 tot 500 kilobyte groot zijn. Een gescande PDF van 10 pagina's kan 2 tot 10 megabyte groot zijn. Een native PDF met ingesloten afbeeldingen met hoge resolutie kan echter ook groot zijn, dus de bestandsgrootte alleen is geen betrouwbare indicator.
Waarom het onderscheid belangrijk is voor alledaagse PDF-taken
Zoeken is de meest voorkomende taak die wordt beïnvloed door het onderscheid tussen gescand en native. Als u een pdf van 50 pagina's ontvangt en elke vermelding van een specifieke term moet vinden, geeft een native pdf u binnen enkele seconden het antwoord via de zoekfunctie. Een gescande PDF dwingt u om elke pagina handmatig visueel te scannen, wat minuten duurt en ervoor kan zorgen dat u gebeurtenissen mist. De mogelijkheid om in een document te zoeken verandert de manier waarop u ermee omgaat.
Voor tekstextractie voor hergebruik in andere documenten is native tekst vereist. Als u in uw eigen rapport een alinea uit een pdf moet citeren, kunt u met een native pdf de tekst rechtstreeks kopiëren en plakken. Voor een gescande PDF moet u de tekst opnieuw typen of OCR uitvoeren om deze uittrekbaar te maken. Voor documenten waarnaar u vaak verwijst, is het verschil tussen direct kopiëren en plakken en handmatig opnieuw typen aanzienlijk.
Voor toegankelijkheidstools, waaronder schermlezers die worden gebruikt door mensen met een visuele beperking, is native tekst vereist. Een schermlezer kan een native PDF voorlezen omdat deze toegang heeft tot de teksttekens. Een schermlezer kan een gescande PDF niet lezen omdat er geen teksttekens zijn die toegankelijk zijn. Om gescande PDF's toegankelijk te maken, is OCR-verwerking vereist om een tekstlaag toe te voegen die schermlezers kunnen interpreteren.
Het Gescande PDF-formaat is perfect geschikt voor archiveringsdoeleinden waarbij het document alleen als afbeelding van het origineel hoeft te worden bekeken. Een gescande kopie van een ondertekend contract dient als visueel bewijs van het ondertekende document. Voor elk doel waarvoor interactie met de tekst, zoeken, kopiëren, bewerken of toegankelijkheid vereist is, is een native PDF of een gescande PDF met OCR noodzakelijk.
Een gescande PDF converteren naar een doorzoekbare native-achtige PDF
Optische tekenherkenning is de technologie die gescande paginaafbeeldingen omzet in doorzoekbare documenten met een tekstlaag. Voer OCR uit op de gescande PDF met behulp van een PDF-tool die OCR-verwerking ondersteunt. De tool analyseert elke paginaafbeelding, herkent de teksttekens en voegt een onzichtbare tekstlaag toe achter de paginaafbeelding. Na OCR ziet de PDF er visueel identiek uit, maar is nu doorzoekbaar en kan de herkende tekst worden geselecteerd en gekopieerd.
De nauwkeurigheid van de OCR is afhankelijk van de kwaliteit van de originele scan. Een schone scan bij 300 DPI met gelijkmatige belichting, vlakke pagina's en scherpe focus produceert een OCR-nauwkeurigheid van meer dan 99 procent.
Een scan met een lage resolutie bij 150 DPI met schaduwen, gebogen pagina's of wazige tekst kan een nauwkeurigheid van minder dan 95 procent opleveren, waardoor handmatige correctie nodig is. De kwaliteit van de scan bepaalt de kwaliteit van de OCR-uitvoer.
Nadat u de OCR hebt uitgevoerd, controleert u de resultaten door te zoeken naar een paar woorden die u op de pagina kunt zien. Als de zoekopdracht ze vindt, is de OCR succesvol. Als de zoekopdracht voor de hand liggende woorden mist, heeft de OCR mogelijk problemen gehad met het specifieke lettertype, de lay-out of de afbeeldingskwaliteit van die pagina. Voer OCR opnieuw uit met aangepaste instellingen of op een scan van hogere kwaliteit, indien beschikbaar.
De OCR PDF-tool van WukongPDF verwerkt gescande documenten in de browser en retourneert een PDF met een doorzoekbare tekstlaag. Upload de gescande PDF, voer OCR uit en download een document dat zoeken, tekstselectie en toegang tot schermlezers ondersteunt. Het OCR-proces behoudt het oorspronkelijke visuele uiterlijk terwijl de tekstlaag wordt toegevoegd die het document interactief maakt.
Het verschil in bestandsgrootte tussen gescande en oorspronkelijke PDF's wordt vooral belangrijk als het om grote documentverzamelingen gaat. Een archiefkast met papieren documenten die naar PDF zijn gescand, kan tienduizenden gescande PDF-pagina's opleveren, waarbij elke pagina een volledige afbeelding is. Bij 500 kilobytes per pagina voor een typische grijswaardenscan van 300 DPI verbruiken 10.000 pagina's 5 gigabyte aan opslagruimte. Het uitvoeren van OCR op deze gescande PDF's verkleint de bestandsgrootte niet, omdat de pagina-afbeeldingen behouden blijven, maar voegt wel de doorzoekbare tekstlaag toe die de collectie praktisch bruikbaar maakt.
Voor documenten die langdurige archivering vereisen, is het PDF/A-formaat de archiveringsstandaard. Zowel gescande PDF's als oorspronkelijke PDF's kunnen worden geconverteerd naar PDF/A. Een gescande PDF die naar PDF/A is geconverteerd, blijft een op afbeeldingen gebaseerd document met de toevoeging van archiefmetagegevens. Een native PDF die naar PDF/A is geconverteerd, behoudt zijn tekst- en structurele eigenschappen. PDF/A verandert niets aan de gescande versus oorspronkelijke aard van het document. Het voegt gestandaardiseerde metadata toe en dwingt structurele vereisten af die de houdbaarheid op de lange termijn verbeteren.
Voor PDF's waarin gescande en oorspronkelijke pagina's worden gecombineerd, past u OCR toe op de gescande pagina's terwijl u de oorspronkelijke pagina's ongemoeid laat. De meeste OCR-tools kunnen specifieke paginabereiken verwerken, zodat u OCR alleen kunt uitvoeren op pagina's die dit nodig hebben. Na verwerking behoudt de PDF de oorspronkelijke tekst op de originele pagina's en beschikt deze over een doorzoekbare tekstlaag op de voorheen alleen-afbeeldingspagina's, waardoor een consistente doorzoekbaarheid in het hele document wordt geboden.
Voor documenten die met de hand worden afgedrukt en ingevuld, is een gescande PDF van het originele formulier prima geschikt. De ontvanger drukt de PDF af, vult de lege plekken in met een pen en stuurt de fysieke kopie terug of scant deze terug naar digitaal. Voor documenten die digitaal moeten worden ingevuld, is een native PDF met formuliervelden veel beter omdat de ontvanger rechtstreeks in de velden kan typen.
Bij de keuze tussen het scannen van een document naar PDF en het maken van een native PDF van het originele bronbestand moet rekening worden gehouden met de gehele levenscyclus van het document, en niet alleen met de onmiddellijke behoefte. Een gescande PDF van een contract is prima om ter beoordeling naar de andere partij te e-mailen. Als dat contract later tijdens een geschil moet worden doorzocht op een specifieke clausule, wordt het gebrek aan doorzoekbaarheid van de gescande PDF een aanzienlijk probleem. Als u tijdens het maken van een document een native PDF maakt, blijven opties behouden die bij scannen niet beschikbaar zijn.
Moderne scansoftware omvat vaak automatische OCR-verwerking, waardoor het onderscheid tussen gescande en native PDF's in de praktijk vervaagt. Een document dat is gescand met een telefoonapp die onmiddellijk na het vastleggen OCR uitvoert, produceert een PDF die technisch gezien een gescande afbeelding is, maar functioneel doorzoekbaar is als een native PDF. Deze hybride aanpak combineert het gemak van scannen met de doorzoekbaarheid van native tekst.
Probeer PDF-OCR
Geen installatie nodig. Werkt rechtstreeks in uw browser.
