Door een PDF plat te maken, worden alle annotaties, formuliervelden en gelaagde inhoud samengevoegd tot één statische afbeeldingslaag. Eenmaal afgevlakt, is de originele tekstlaag die bestond vóór het afvlakken verdwenen. De teksttekens die ooit selecteerbaar, doorzoekbaar en extraheerbaar waren, worden pixels in de afgeplatte afbeelding. PDF Repair voor een afgevlakt document vraagt of de originele tekstlaag kan worden hersteld van de afgevlakte uitvoer.
Het korte antwoord hangt ervan af of de PDF is afgevlakt, met of zonder behoud van de tekstlaag. Bij sommige afvlakkingsbewerkingen blijft de originele tekst achter de afgevlakte afbeelding behouden als verborgen inhoud. Bij andere afvlakkingsbewerkingen wordt de tekst volledig weggegooid en vervangen door de weergegeven afbeelding. In het eerste geval is herstel mogelijk, in het tweede geval onmogelijk.
De hersteltools PDF Format van WukongPDF kunnen bewaarde tekstlagen uit afgevlakte PDF-documenten detecteren en extraheren.

Hoe PDF-afvlakking werkt en wat het verwijdert
Met Flattening worden alle zichtbare lagen van een PDF-pagina gecombineerd tot één gerenderde afbeelding. Annotaties, waaronder markeringen, plaknotities en tekeningmarkeringen, worden samengevoegd met de pagina-inhoud. Formuliervelden worden geconverteerd van interactieve elementen naar statische visuele representaties van hun ingevulde waarden. Transparantie-effecten worden omgezet in ondoorzichtige pixels. Het resultaat is een pagina die er identiek uitziet als het origineel, maar geen interactieve of gelaagde structuur heeft.
In de praktijk kan het afvlakkingsproces de originele tekstlaag achter de afgevlakte afbeelding wel of niet behouden. Wanneer afvlakking wordt uitgevoerd via de Flattener Preview van Acrobat Pro of via de Preflight-tool met bepaalde instellingen, kan de originele tekst behouden blijven als een onzichtbare laag. Wanneer het afvlakken wordt uitgevoerd via Afdrukken naar PDF of via tools van derden, wordt de tekstlaag doorgaans volledig weggegooid.
Een snelle test bepaalt of de tekst behouden is gebleven. Open de afgeplatte PDF en probeer tekst op een pagina te selecteren. Als tekst kan worden geselecteerd en gekopieerd, heeft de tekstlaag de afvlakking overleefd. Als klikken op tekst niets selecteert of de hele pagina als afbeelding selecteert, wordt de tekstlaag weggegooid en blijft alleen de visuele weergave over.
Probeer PDF repareren
Geen installatie nodig. Werkt rechtstreeks in uw browser.
Methode 1: Controleren op een verborgen tekstlaag achter de afgeplatte afbeelding
Open in Acrobat Pro de afgeplatte PDF en ga naar Extra, Inhoud bewerken, Tekst en afbeeldingen bewerken. Klik op een zichtbaar tekstgebied. Als Acrobat een selectiekader rond de tekst weergeeft en bewerken toestaat, bevindt zich een tekstlaag achter de afgevlakte afbeelding. De tekst is aanwezig in de bestandsgegevens, ook al is deze tijdens normale weergave mogelijk niet zichtbaar als selecteerbare tekst.
Als de tekst aanwezig is, extraheert u deze met de functie PDF naar tekst exporteren van Acrobat Pro. De geëxtraheerde tekst kan de originele inhoud bevatten, ook al lijkt de visuele pagina afgevlakt. Kopieer de geëxtraheerde tekst en vergelijk deze met een voorbeeld van de originele inhoud. Als de tekst overeenkomt, is de originele tekstlaag met succes hersteld uit het afgeplatte bestand.
Als we dit in het algemeen bekijken, wordt in echte scenario's de tekstlaag tijdens het afvlakken weggegooid als Acrobat geen bewerkbare tekst kan vinden. De visuele tekst op de pagina bestaat uit pixels in de afgeplatte afbeelding, niet uit tekencodes. Herstel via tekstextractie is niet mogelijk omdat er geen tekstgegevens zijn om te extraheren.
Methode 2: OCR gebruiken om de verloren tekstlaag opnieuw te creëren
Wanneer de originele tekstlaag tijdens het afvlakken werd weggegooid, biedt OCR een pad om deze opnieuw te maken. Voer OCR uit op de afgevlakte PDF met behulp van de functie Tekst herkennen van Acrobat Pro. De OCR-engine analyseert de pixelafbeelding van elke pagina, identificeert tekenvormen en creëert een nieuwe tekstlaag met de herkende tekens.
Als we dit in grote lijnen in ogenschouw nemen, is de met OCR gemaakte tekstlaag in de praktijk niet de originele tekst. OCR introduceert herkenningsfouten, vooral bij kleine tekst, ongebruikelijke lettertypen of tekst op complexe achtergronden. De opnieuw gemaakte tekst zal ongeveer 95 tot 99 procent nauwkeurig zijn voor heldere, standaarddocumenten, en minder nauwkeurig voor documenten met een uitdagende typografie of lay-out.
Vergelijk na OCR de herkende tekst met een bekend voorbeeld van de originele inhoud, indien beschikbaar. Corrigeer OCR-fouten handmatig of accepteer de opnieuw gemaakte tekstlaag als een benadering van het origineel. De OCR-uitvoer is bruikbaar voor zoeken en tekstextractie, maar kan fouten bevatten die verificatie vereisen voordat er voor juridische, financiële of regelgevende doeleinden op de tekst kan worden vertrouwd.
Controleren op tekst in de PDF-bestandsstructuur
Voor een definitieve controle of er tekstgegevens in een afgeplatte PDF voorkomen, onderzoekt u de onbewerkte bestandsstructuur. Open de PDF in een teksteditor die overweg kan met binaire bestanden, zoals VS Code of Notepad++. Zoek naar herkenbare tekstreeksen uit de originele documentinhoud. Als er tekstreeksen worden gevonden in de bestandsgegevens, bestaat de tekstlaag zelfs als deze niet toegankelijk is via de PDF-lezerinterface.
Deze aanpak vereist enige bekendheid met de interne structuur van PDF. Tekst in een PDF wordt opgeslagen tussen BT- en ET-markeringen, die het begin en einde van tekstobjecten aangeven. Tussen deze markeringen staan tekencodes met positioneringsopdrachten. Het vinden van BT- en ET-markeringen die herkenbare tekst bevatten, geeft aan dat tekstgegevens de afvlakking hebben overleefd.
Vanuit praktisch oogpunt bekeken, wordt in reële scenario's, als er geen tekstreeksen in de bestandsgegevens worden gevonden, de afvlakkingsbewerking de inhoud volledig gerasterd. De pagina's zijn afbeeldingen en bevatten geen herstelbare tekstinformatie. OCR is het enige beschikbare pad voor het maken van een tekstlaag.
Verlies van tekstlagen voorkomen bij toekomstige afvlakkingsoperaties
Wanneer u een PDF afvlakt waarvan de tekstlaag moet behouden, gebruikt u instellingen die verborgen tekst behouden. In Acrobat Pro bevat de tool Afvlakkervoorbeeld een selectievakje om overdruk- en steunkleurinformatie te behouden, waardoor tekstgegevens indirect behouden blijven. De Preflight-tool biedt afvlakkingscorrecties waarbij tekst expliciet behouden blijft.
De veiligste aanpak is om een niet-afgevlakte kopie van de PDF op te slaan voordat u deze afvlakt. De niet-afgevlakte kopie behoudt alle interactieve elementen, annotaties en tekstlagen. Verdeel de afgeplatte versie. Archiveer het niet-afgevlakte origineel. Als herstel ooit nodig is, biedt het origineel de volledige brongegevens.
Vanuit een breder perspectief: test in documentworkflows voor kritieke documenten de afvlakkingsinstellingen op een kopie voordat u deze op het origineel toepast. Controleer of de tekst na het afvlakken herstelbaar blijft. Pas de instellingen aan als het herstel mislukt. De teststap voegt minuten toe aan de workflow en voorkomt permanent tekstverlies.
Preflight gebruiken om verborgen tekstlagen te detecteren en te extraheren
De Acrobat Pro Preflight-tool bevat profielen die speciaal zijn ontworpen om de structuur van PDF-inhoud te analyseren. In het inventarisrapport worden alle tekstobjecten weergegeven die in het bestand aanwezig zijn, inclusief de tekstobjecten die niet zichtbaar zijn tijdens normale weergave. Als dit rapport wordt uitgevoerd op een afgevlakt PDF-bestand, wordt duidelijk of tekstgegevens het afvlakkingsproces hebben overleefd.
Als het preflightrapport tekstobjecten identificeert, gebruikt u de fixup Alle tekst exporteren om ze naar een afzonderlijk bestand te extraheren. De geëxtraheerde tekst kan vervolgens worden vergeleken met de zichtbare pagina-inhoud om te bepalen hoeveel van de originele tekst bewaard is gebleven en of deze accuraat en volledig is.
Tekst herstellen uit gedeeltelijk afgevlakte PDF's
Sommige afvlakkingsbewerkingen hebben alleen invloed op specifieke pagina-elementen, terwijl andere intact blijven. Formuliervelden kunnen worden afgevlakt, terwijl de hoofdtekst als selecteerbare tekens blijft bestaan. Annotaties kunnen afgevlakt worden terwijl de onderliggende paginatekst blijft bestaan. Onderzoek elk elementtype afzonderlijk om te bepalen wat afgevlakt is en wat behouden is gebleven.
Vanuit een brede hoek extraheert u in documentworkflows voor gedeeltelijk afgevlakte documenten de overgebleven tekst uit de niet-afgevlakte delen en combineert u deze met OCR-uitvoer uit de afgevlakte delen. De hybride aanpak maximaliseert tekstherstel door gebruik te maken van de originele tekst, indien beschikbaar, en OCR-gereconstrueerde tekst waar het origineel verloren is gegaan.
Wanneer moet je accepteren dat herstel niet mogelijk is
Mocht dit zich voordoen, als er geen tekstgegevens in de bestandsstructuur aanwezig zijn, als Acrobat geen bewerkbare tekst kan vinden en als OCR onaanvaardbaar onnauwkeurige resultaten oplevert, kan de oorspronkelijke tekstlaag niet worden hersteld. Accepteer deze conclusie en ga over tot het behoud van wat overblijft in plaats van meer tijd te investeren in herstelpogingen.
Documenteer de herstelpoging en de uitkomst ervan. Let op de gebruikte hulpmiddelen, de uitgeprobeerde methoden en de bereikte conclusie. De documentatie is bedoeld voor toekomstige documentbewaarders, die mogelijk toegang hebben tot betere herstelhulpmiddelen en moeten begrijpen wat er eerder is geprobeerd.
Langetermijnarchiefstrategie voor platte documenten
Afgevlakte PDF's worden vaak speciaal voor archiveringsdoeleinden gemaakt, omdat ze interactieve afhankelijkheden wegnemen. Wanneer u afgevlakte documenten archiveert, bewaart u het niet-afgevlakte origineel waar mogelijk naast de afgeplatte versie. Het origineel behoudt de volledige documentstructuur. De afgevlakte versie biedt het stabiele archiefformaat.
Voor documenten waarvan alleen de afgevlakte versie bestaat, voert u OCR uit om een tekstlaag te maken en deze in de PDF in te sluiten. De OCR-tekst is misschien niet perfect, maar maakt toekomstig zoeken en tekstextractie mogelijk die anders onmogelijk zouden zijn. De OCR-laag slaat een brug tussen het afgevlakte beeld en de toekomstige behoeften op het gebied van documentanalyse.
Geautomatiseerde detectie van afvlakking voor documentverzamelingen
Organisaties die grote documentverzamelingen beheren, profiteren van de geautomatiseerde detectie van afgevlakte PDF's. Een script dat elke PDF opent, controleert op de aanwezigheid van selecteerbare tekst en bestanden markeert waar tekst ontbreekt, identificeert documenten die OCR-verwerking nodig hebben. De geautomatiseerde scan voorkomt dat afgeplatte documenten geruisloos het archief binnenkomen zonder doorzoekbare tekstlagen.
Integreer afvlakkingsdetectie in de workflow voor documentopname. Wanneer een nieuwe PDF het systeem binnenkomt, controleer dan of er tekst aanwezig is. Als er geen tekst is, stuurt u het document naar een OCR-verwerkingswachtrij voordat het het archief bereikt. Geautomatiseerde detectie en correctie zorgt ervoor dat elk gearchiveerd document doorzoekbaar is.
Probeer PDF repareren
Geen installatie nodig. Werkt rechtstreeks in uw browser.
