Tips & Tricks

Een gescand boek van twee pagina's scheiden in afzonderlijke afzonderlijke PDF-pagina's

Een open boek of een ingebonden rapport scan je op een flatbedscanner. Bij elke scan worden twee pagina's naast elkaar vastgelegd, de linkerpagina en de rechterpagina, als één brede afbeelding. Wanneer u de resulterende PDF bekijkt, bestaat elk blad uit twee pagina's. Tekst op de linkerpagina loopt over in tekst op de rechterpagina. Zoeken naar een zin die zich uitstrekt over de rugmarge tussen de twee pagina's levert niets op. De pdf is visueel trouw aan het originele boek, maar is praktisch onbruikbaar als leesdocument.

Het scheiden van een gescande spread van twee pagina's in individuele PDF's van één pagina is een gebruikelijke behoefte voor iedereen die boeken, ingebonden rapporten of tijdschriften digitaliseert. Het proces omvat het splitsen van elke pagina met dubbele breedte in het midden en het opnieuw ordenen van de helften in een opeenvolgend document van één pagina. Met de juiste aanpak wordt een boekscan van 100 pagina's, 50 spreads, een pdf van 200 pagina's die van begin tot eind correct leest.

How to Separate a Two-Page Scanned Book Spread Into Individual Single PDF Pages

Het probleem van het verspreiden van twee pagina's begrijpen

Wanneer een boek op een flatbed wordt gescand, legt de scanner het hele glasoppervlak vast als één afbeelding. Als beide pagina's van een open boek op de glasplaat passen, toont de scan twee pagina's naast elkaar. De PDF behandelt dit als één landschapsgeoriënteerde pagina. De paginaafmetingen kunnen 11 bij 8,5 inch zijn, breder dan ze hoog zijn. Elke pagina van het originele boek beslaat ongeveer de helft van het gescande gebied. De uitdaging is om deze brede pagina in twee portretgeoriënteerde pagina's te verdelen, die elk één boekpagina bevatten.

Het eenvoudig opsplitsen van het exacte midden werkt voor perfect uitgelijnde scans, maar boekscans zijn zelden perfect. De rug kan een gebogen vervorming veroorzaken nabij de goot. De linker- en rechterpagina's zijn mogelijk niet even breed. Het boek kan tussen de scans enigszins zijn verschoven, waardoor het splitsingspunt van pagina tot pagina varieert. Een goede Split PDF-aanpak voor boekscans moet met deze inconsistenties omgaan.

WukongPDF

Probeer PDF splitsen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →

Methode 1: Snijd elke spread in linker- en rechterhelften

De meest betrouwbare methode is een proces dat uit twee stappen bestaat: snijd elke spread bij om de linkerpagina te extraheren, en snijd vervolgens opnieuw bij om de rechterpagina te extraheren. Open de gescande PDF. Gebruik het bijsnijdgereedschap om de linkerhelft van elke pagina te selecteren. Pas de uitsnede toe, waardoor alles buiten het bijsnijdvak wordt verborgen. Sla het bestand op als de versie op de linkerpagina. Open vervolgens het origineel opnieuw, snijd het bij tot de rechterhelft en sla het op als de versie op de rechterpagina. Voeg ten slotte de twee bestanden tussen elkaar: pagina 1 uit het linkerbestand, pagina 1 uit het rechterbestand, pagina 2 uit het linkerbestand, pagina 2 uit het rechterbestand, enzovoort.

Het bijsnijdgereedschap ondersteunt het opslaan van bijsnijdgebieden als benoemde voorinstellingen, zodat u de linkerhelft en de rechterhelft één keer kunt definiëren en deze met één klik op alle pagina's kunt toepassen. De tool ondersteunt ook het batchgewijs toepassen van een uitsnede op alle oneven of alle even pagina's, wat handig is wanneer alle spreads een consistente lay-out delen.

Methode 2: Splitsen op pagina-afmetingen

Als elke spread exact dezelfde breedte heeft, wat gebruikelijk is bij scans gemaakt met een automatische documentinvoer of een speciale boekscanner, is een op dimensies gebaseerde splitsing sneller dan handmatig bijsnijden. Deel de paginabreedte door twee en stel het splitspunt in op die coördinaat. Een spreiding van 11 inch breed splitst zich op 5,5 inch. Pas de splitsing gelijkmatig op alle pagina's toe. Deze methode is snel, er is één enkele handeling nodig voor het hele document, maar mislukt als de spreads niet perfect gecentreerd zijn of als het boek tussen de scans verschuift.

Voor documenten die zijn gescand op een flatbed waarbij elke spread handmatig is geplaatst, levert op dimensies gebaseerde splitsing vaak acceptabele resultaten op als de operator redelijk consistent was. Om dit te controleren splitst u de eerste paar pagina's en controleert u of er geen tekst wordt afgesneden op de splitslijn. Als de splitsing consistent inhoud aan één kant afknipt, pas dan de splitsingscoördinaat aan en probeer het opnieuw. Zodra het splitspunt op een voorbeeld is geverifieerd, past u dit op alle pagina's toe.

Methode 3: OCR gebruiken om de rugmarge te detecteren en automatisch splitsen

Sommige geavanceerde scansoftware omvat automatische verspreidingsdetectie. De software analyseert elke gescande pagina, identificeert de donkere verticale band van de boekgoot en splitst de pagina langs die lijn. Dit levert de meest nauwkeurige splitsing op, omdat deze zich aanpast aan de werkelijke inhoud van elke pagina in plaats van een vaste coördinaat te gebruiken. De rugmarge is meestal het donkerste verticale gebied op de pagina en wordt betrouwbaar gedetecteerd door algoritmen voor beeldanalyse.

De Gescande PDF-verwerking van WukongPDF omvat automatische rugmargedetectie voor boekscans. Upload de scan en de tool identificeert de rugschaduw op elke pagina, berekent de optimale splitslijn en genereert een PDF van één pagina met pagina's in de juiste leesvolgorde. Handmatige beoordeling van de splitsingsresultaten wordt aanbevolen, vooral voor pagina's met volledige afbeeldingen die de rugmarge kruisen, waarbij de automatische detectie de splitslijn door het midden van de afbeelding kan plaatsen in plaats van in de rugmarge.

Pagina's opnieuw rangschikken na het splitsen

Door een gescande spread te splitsen, ontstaan pagina's die opnieuw in leesvolgorde moeten worden gerangschikt. Een boek dat als spreads wordt gescand, produceert pagina's in deze volgorde: spread 1 links, spread 1 rechts, spread 2 links, spread 2 rechts. De juiste leesvolgorde is: spreid 1 rechts, spreid 2 links, spreid 2 rechts, spreid 3 links. De eerste linkerpagina is vaak de binnenzijde van de vooromslag of een blanco pagina voorafgaand aan de titelpagina. Controleer dus de bedoelde volgorde aan de hand van het fysieke boek.

De stap voor het opnieuw ordenen is handmatig maar eenvoudig. Open de gesplitste PDF in een viewer die paginaminiaturen toont. Sleep pagina's naar de juiste volgorde. De tool voor het opnieuw ordenen van pagina's van WukongPDF geeft alle pagina's weer als een miniatuurraster, waardoor het gemakkelijk wordt om de volgorde te zien en te corrigeren. Het duurt 10 tot 15 minuten om een boek van 200 pagina's correct opnieuw te ordenen. De tijd wordt goed besteed omdat een correct geordende pdf van een gescand boek op natuurlijke wijze van begin tot eind leest, terwijl een onjuist geordende pdf de lezer dwingt heen en weer te springen tussen pagina's, wat precies het probleem is dat de splitsing moest oplossen.

Voer na het splitsen en opnieuw ordenen OCR uit op de uiteindelijke PDF van één pagina. De tekst op elke pagina is nu correct georiënteerd en geïsoleerd, wat de OCR-nauwkeurigheid verbetert in vergelijking met het uitvoeren van OCR op dubbele pagina's. OCR voor één pagina produceert ook een tekstlaag waarbij de leesvolgorde overeenkomt met de paginavolgorde, zodat het zoeken naar een zinsnede resultaten oplevert in de juiste paginavolgorde. De getransformeerde PDF-pagina's zijn nu een goed geordend, doorzoekbaar digitaal boek in plaats van een stapel onleesbare afbeeldingen van dubbele pagina's.

Voor boekscans met ongelijke splitspunten waarbij de linker- en rechterpagina's niet even breed zijn over het gehele document, is handmatig bijsnijden van pagina's de moeite waard voor documenten waarnaar u herhaaldelijk verwijst. De automatische rugmargedetectie verwerkt 80% van de pagina's correct. De resterende 20% heeft individuele aandacht nodig, meestal pagina's aan het begin en einde van hoofdstukken waar de pagina-indeling verandert, of pagina's met full-bleed illustraties die over de rugmarge lopen. Op die pagina's kan de automatische splitsing door het midden van een afbeelding snijden of een stukje van de tegenoverliggende pagina zichtbaar laten. Het openen van elke paginaminiatuur na het splitsen en het controleren van de eerste paar woorden en de laatste paar woorden van elke regel bevestigt dat er geen inhoud verloren is gegaan bij de splitsingsgrens. De verificatiepas duurt ongeveer 30 seconden per pagina en transformeert een splitsing die grotendeels klopt in een splitsing die precies klopt.

WukongPDF

Probeer PDF splitsen

Geen installatie nodig. Werkt rechtstreeks in uw browser.

Nu beginnen →