Others

Kunt u alle afbeeldingen uit een PDF verwijderen en een tekstversie exporteren?

Een PDF boordevol foto's, grafieken, logo's en decoratieve afbeeldingen met hoge resolutie kan onpraktisch zijn voor tekstgerichte workflows. Als u alleen de woorden nodig heeft, levert het verwijderen van alle PDF-afbeeldingen en het exporteren van een versie met alleen tekst een aanzienlijk kleiner bestand op dat alleen de tekstuele inhoud van het document bevat. De vraag is of de resulterende tekstuitvoer compleet en bruikbaar is voor het beoogde doel.

Het korte antwoord is ja voor op tekst gebaseerde PDF's waarbij de tekst bestaat uit selecteerbare tekens. Bij gescande PDF's waarbij de tekst deel uitmaakt van de afbeelding, wordt bij het strippen van afbeeldingen alles verwijderd, inclusief de tekst. Het belangrijkste onderscheid is tussen PDF's met oorspronkelijke tekst, waarbij tekst en afbeeldingen afzonderlijke lagen zijn, en op afbeeldingen gebaseerde PDF's, waarbij de hele pagina een afbeelding is zonder tekstlaag.

Met PDF naar tekst-extractie worden afbeeldingen verwijderd terwijl de tekstinhoud behouden blijft. Voor documenten waarbij de tekst de primaire betekenis heeft en afbeeldingen aanvullend zijn, is uitvoer met alleen tekst perfect bruikbaar. Voor documenten waarin afbeeldingen essentiële informatie overbrengen, zoals medische scans of architectuurtekeningen, verliest uitvoer met alleen tekst essentiële inhoud.

De PDF-verwerkingstools van WukongPDF omvatten mogelijkheden voor het strippen van afbeeldingen en het extraheren van tekst.

Can You Strip All Images From a PDF and Export a Text-Only Version

Het verschil tussen native tekst en op afbeeldingen gebaseerde PDF's

Een native tekst-PDF slaat tekst op als tekencodes die op de pagina zijn geplaatst. Afbeeldingen zijn afzonderlijke objecten die over tekstblokken heen worden gelegd of tussen tekstblokken worden geplaatst. Wanneer u afbeeldingen uit een PDF met oorspronkelijke tekst verwijdert, blijft de tekst intact en volledig leesbaar. De documentstructuur, zoals kopteksten, alinea's en pagina-einden, blijft behouden. Alleen de decoratieve en illustratieve afbeeldingen verdwijnen.

Een op afbeeldingen gebaseerde PDF slaat de hele pagina op als een rasterafbeelding, meestal van een scanner of een screenshot. Er zijn geen teksttekens die u kunt behouden. Door afbeeldingen uit een op afbeeldingen gebaseerde PDF te verwijderen, wordt alles verwijderd, waardoor een leeg document ontstaat. Bij gescande PDF's die met OCR zijn verwerkt, bevindt zich een onzichtbare tekstlaag achter de afbeelding. Door het verwijderen van afbeeldingen wordt de zichtbare gescande pagina verwijderd, maar blijft de OCR-tekst behouden, die mogelijk herkenningsfouten bevat.

Om te bepalen welk type PDF u heeft, opent u deze in een willekeurige PDF-lezer en probeert u een woord tekst te selecteren. Als u afzonderlijke tekens kunt selecteren, is de PDF oorspronkelijke tekst en blijft de tekst behouden als u afbeeldingen verwijdert. Als klikken een hele pagina als één groot afbeeldingsblok selecteert, is de PDF op afbeeldingen gebaseerd en zal het verwijderen van afbeeldingen niets of alleen de OCR-tekstlaag achterlaten.

WukongPDF

Probeer PDF comprimeren

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Methode 1: Afbeeldingen strippen met Acrobat Pro PDF Optimizer

Open de PDF in Acrobat Pro en ga naar Bestand, Opslaan als andere, Geoptimaliseerde PDF. Klik in het dialoogvenster PDF-optimalisatie op Objecten weggooien in het linkerdeelvenster. Vink het vakje aan met het label Alle afbeeldingen weggooien. Vink onder Opschonen Ongebruikte objecten verwijderen aan. Klik op OK en sla het geoptimaliseerde bestand op onder een nieuwe naam. Acrobat verwerkt het bestand en verwijdert elk rasterafbeeldingsobject.

In de praktijk kan de resulterende verkleining van de bestandsgrootte dramatisch zijn. Een PDF van 20 MB met foto's in hoge resolutie kan kleiner worden tot minder dan 100 KB als het document voornamelijk uit tekst met ingesloten afbeeldingen bestaat. Open het geoptimaliseerde bestand en blader door elke pagina om te controleren of alle tekstinhoud aanwezig en leesbaar is. Controleer paginagebieden waar afbeeldingen zijn verwijderd. De lay-out kan enigszins verschuiven omdat de ruimte die voorheen werd ingenomen door afbeeldingen nu leeg is.

Als er essentiële inhoud samen met de afbeeldingen is verwijderd, zoals diagrammen die zijn opgeslagen als afbeeldingen in plaats van als vectorafbeeldingen, maak dan de bewerking ongedaan en gebruik een selectievere aanpak. In plaats van alle afbeeldingen te verwijderen, comprimeert u ze zwaar of vervangt u ze door tijdelijke tekst die beschrijft wat er is verwijderd.

Methode 2: Programmatische tekstextractie

Python-bibliotheken zoals PyMuPDF en pdfplumber extraheren tekst terwijl afbeeldingen native worden genegeerd. De extractie leest alleen de tekstlaag en produceert een schone tekststroom zonder afbeeldingsgegevens. De geëxtraheerde tekst kan worden opgeslagen als een .txt-bestand om te bewerken of in een nieuwe, alleen-tekst-PDF worden ingevoerd. De programmatische aanpak is scriptbaar, herhaalbaar en verwerkt batchverwerking van meerdere bestanden.

Voor gescande PDF's met een OCR-tekstlaag leest programmatische extractie de OCR-tekst. De kwaliteit hangt volledig af van de OCR-nauwkeurigheid. Een netjes gescand document met moderne OCR kan tekst produceren die 99 procent nauwkeurig is. Een slecht gescand document met oude OCR kan tekst opleveren die aanzienlijke handmatige correctie vereist. Bij de extractie worden eventuele OCR-fouten in de tekstlaag meegenomen.

Kwaliteitsverificatie na extractie

Nadat u afbeeldingen hebt verwijderd of tekst hebt geëxtraheerd, controleert u de uitvoerkwaliteit voordat u deze gebruikt. Vergelijk het aantal woorden van de geëxtraheerde tekst met een handmatige schatting uit het originele document. Een significante discrepantie suggereert dat inhoud verloren is gegaan. Zoek naar bekende termen die in het origineel voorkomen om te bevestigen dat ze aanwezig zijn in de uitvoer. Bekijk de eerste en laatste alinea van elke hoofdsectie om de volledigheid te verifiëren.

Als het om documentworkflows gaat, kunt u voor documenten waarbij de nauwkeurigheid van de tekst van cruciaal belang is, zoals juridische dossiers of financiële rapporten, een tweede revisor de geëxtraheerde tekst laten vergelijken met de originele PDF. Zelfs een nauwkeurige extractie van 99 procent betekent één fout per honderd woorden, wat onaanvaardbaar kan zijn voor precisiedocumenten. De verificatiepas spoort extractiefouten op die geautomatiseerde kwaliteitscontroles over het hoofd zien.

DocumenttypeVeilig om te strippen?Alternatief
Juridische opdrachtJa, tekst is primairGeen nodig
Rapportage met grafiekenNee, grafieken bevatten gegevensSamenpersen in plaats van strippen
Gescand documentNee, scannen IS de inhoudEerst OCR en vervolgens tekst extraheren

Het verwijderen van afbeeldingen uit een PDF is geschikt als tekstinhoud de primaire waarde is en afbeeldingen incidenteel zijn. Het resulterende tekstbestand is aanzienlijk kleiner, volledig doorzoekbaar en klaar voor tekstanalyse, vertaling of herbestemming van de inhoud. De beslissing om afbeeldingen te strippen moet worden genomen nadat is bevestigd dat alleen de tekst de essentiële betekenis van het document weergeeft.

Als het gaat om documentworkflows, voor documenten waarin afbeeldingen en tekst samenwerken, bewaar dan de volledige PDF en optimaliseer deze door middel van compressie in plaats van verwijdering. Een gecomprimeerde PDF behoudt de visuele relatie tussen tekst en afbeeldingen en verkleint de bestandsgrootte voor distributie.

Wat er gebeurt met de PDF-indeling na het verwijderen van afbeeldingen

Tijdens typische workflows, wanneer afbeeldingen worden verwijderd, wordt de ruimte die ze op de pagina innemen leeg. Tekst die rond afbeeldingen is gewikkeld, kan opnieuw in de lege ruimte terechtkomen. Tabellen die afbeeldingscellen bevatten, hebben lege cellen. Pagina-indelingen die zijn ontworpen rond specifieke afbeeldingsplaatsingen kunnen er vreemd uitzien. De gestripte PDF is geoptimaliseerd voor inhoud, niet voor visueel ontwerp.

Voor documenten waarbij de integriteit van de lay-out van belang is, kunt u overwegen afbeeldingen te vervangen door plaatsaanduidingstekst in plaats van ze volledig te verwijderen. Een bijschrift zoals Afbeelding verwijderd: productfoto kan in plaats van elke afbeelding worden ingevoegd. De tijdelijke aanduiding behoudt de lay-outstructuur en erkent dat visuele inhoud opzettelijk is verwijderd.

OCR gebruiken om een tekstlaag te maken vóór het strippen van afbeeldingen

Bij documentverwerking worden voor gescande PDF's zonder tekstlaag door het uitvoeren van OCR vóór het strippen van afbeeldingen de tekstgegevens gemaakt die tijdens het stripproces behouden blijven. OCRmyPDF kan met één opdracht een tekstlaag toevoegen aan gescande PDF's. Na OCR-verwerking bevat de PDF zowel de zichtbare gescande afbeelding als een onzichtbare tekstlaag. Door afbeeldingen te strippen, wordt de gescande pagina verwijderd terwijl de herkende tekst behouden blijft.

In de praktijk bepaalt de OCR-kwaliteit rechtstreeks de bruikbaarheid van de gestripte uitvoer. Een document met een OCR-nauwkeurigheid van 99 procent produceert bruikbare tekst met incidentele fouten. Een document met een nauwkeurigheid van 80 procent produceert tekst die aanzienlijke handmatige correctie vereist. Voordat u afbeeldingen verwijdert op gescande documenten, voert u OCR uit en evalueert u de tekstkwaliteit op een voorbeeldpagina.

Afbeeldingen comprimeren als alternatief voor strippen

Met betrekking tot documenten waarbij het volledig verwijderen van afbeeldingen waardevolle inhoud zou verliezen, biedt agressieve beeldcompressie een middenweg. Door afbeeldingen te verkleinen naar 72 DPI met hoge JPEG-compressie kan een PDF van 20 MB worden teruggebracht tot 2 tot 3 MB, terwijl de afbeeldingen herkenbaar blijven. De gecomprimeerde afbeeldingen zijn van lage kwaliteit, maar brengen nog steeds de visuele informatie over.

Het combineren van compressie met selectieve beeldverwijdering biedt de meeste flexibiliteit. Bewaar afbeeldingen op pagina's waar ze essentieel zijn, zoals diagrammen en foto's die centraal staan in de inhoud, en verwijder decoratieve afbeeldingen van pagina's waar ze geen informatief doel dienen. De hybride aanpak vereist meer handmatig werk, maar levert de beste balans tussen kwaliteit en omvang op.

PDF-export met alleen tekst is geschikt voor specifieke gebruiksscenario's: het invoeren van inhoud in pijplijnen voor tekstanalyse, het maken van lichtgewicht versies voor mobiel lezen en het voorbereiden van documenten voor vertaling waarbij afbeeldingen de kosten zouden verhogen zonder waarde toe te voegen. Voor elk van deze gebruiksscenario's is de tekst het product en de afbeeldingen een verpakking die kan worden weggegooid.

De beslissing om afbeeldingen te strippen moet worden gedocumenteerd, zodat toekomstige lezers van de tekstversie begrijpen dat de visuele inhoud opzettelijk is verwijderd. Een korte opmerking in de documenteigenschappen of op een voorblad voorkomt verwarring wanneer iemand de tekstversie vergelijkt met het origineel.

Bij de meeste tools is de PDF-export met alleen tekst een gespecialiseerd hulpmiddel voor specifieke behoeften. Het is geen optimalisatie voor algemene doeleinden. Voor de meeste documenten is compressie een betere eerste stap dan het verwijderen van afbeeldingen. Reserveer het strippen van afbeeldingen voor gevallen waarin tekst de enige waardevolle inhoud is en het doel van het document alleen door tekst wordt gediend.

Als u de mogelijkheden en beperkingen van het strippen van afbeeldingen begrijpt, zorgt u ervoor dat het om de juiste redenen op de juiste documenten wordt toegepast, waardoor uitvoer wordt geproduceerd die het beoogde doel dient, zonder onbedoeld verlies van inhoud. De tekst-only PDF dient specifieke doeleinden en moet selectief worden toegepast op basis van documenttype en beoogd gebruik.

WukongPDF

Probeer PDF comprimeren

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →