Tips & Tricks

Как пакетно исправить перекос повернутых страниц в отсканированном PDF-файле

Отсканированный PDF, созданный с помощью листового сканера, часто содержит страницы, слегка повернутые, обычно на один-пять градусов. Каждая страница, проходящая через сканер под немного разным углом, создает документ, в котором каждая страница повернута по-разному. Читать такой документ неприятно. Небольшой наклон затрудняет сканирование текста, а при печати таких страниц тратится бумага с перекошенным содержимым. Пакетное исправление перекоса корректирует поворот каждой страницы за одну операцию, выравнивая все страницы до одинаковой ориентации.

Функция устранения перекоса анализирует содержимое на каждой странице, обычно путем определения преобладающего угла текстовых строк, и поворачивает страницу на противоположную величину, чтобы выровнять текст по горизонтали. Этот процесс автоматизирован, специфичен для каждой страницы и неразрушителен. Он не обрезает и не изменяет размер страницы. Он применяет только ту коррекцию поворота, которая необходима каждой отдельной странице. Инструмент Crop PDF в сочетании с функцией устранения перекоса позволяет получить отсканированные документы, которые выглядят так, как будто каждая страница проходит через сканер совершенно ровно.

Инструменты улучшения PDF Quality WukongPDF включают в себя устранение перекоса и выпрямление страниц для отсканированных документов. Для пакетной обработки больших отсканированных PDF-файлов специальные инструменты, описанные ниже, предлагают специальные возможности устранения перекоса.

How to Batch-Deskew Rotated Pages in a Scanned PDF

Как алгоритмы устранения перекосов обнаруживают поворот страниц

Алгоритм устранения перекоса работает путем анализа прогнозируемой гистограммы интенсивностей пикселей при различных углах поворота кандидатов. Он проецирует изображение страницы на горизонтальную ось под каждым предполагаемым углом и измеряет, насколько четко выравниваются текстовые строки. Под правильным углом, когда текстовые строки идеально горизонтальны, проекция создает острые пики в вертикальных положениях каждой текстовой строки. При неправильных углах пики размазываются по нескольким рядам проекций. Алгоритм оценивает углы в пределах ожидаемого диапазона перекоса, обычно от минус 10 до положительных 10 градусов, и выбирает угол, при котором проекции получаются наиболее резкими.

Алгоритм также учитывает тип контента. Страница чистого текста с четкой структурой линий дает сильный сигнал выравнивания. Страница, на которой преобладает фотография или графика без четких горизонтальных текстовых строк, создает слабый сигнал, и алгоритм может по умолчанию использовать нулевую коррекцию, чтобы избежать поворота на основе ненадежных данных. Хорошие инструменты исправления перекоса сообщают рассчитанный угол для каждой страницы, поэтому вы можете просмотреть страницы, где исправление кажется неправильным.

WukongPDF

Попробуйте обрезать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Метод 1: оптимизация отсканированных страниц в Acrobat Pro

Adobe Acrobat Pro включает функцию пакетного исправления перекоса в свои инструменты улучшения отсканированных страниц. Откройте отсканированный PDF-файл и выберите «Инструменты», «Сканирование и распознавание текста», затем «Улучшение» и выберите «Оптимизировать отсканированные страницы». В диалоговом окне оптимизации установите флажок «Выпрямить и устранить перекос». Установите для вывода желаемое разрешение, обычно 300 точек на дюйм для документов, которые будут перепечатываться, и 150 точек на дюйм для просмотра только на экране. Acrobat обрабатывает каждую страницу, корректирует ее индивидуально и создает оптимизированный PDF-файл.

Исправление перекосов в Acrobat консервативно. Он исправляет страницы с явным перекосом более одного градуса, но может оставить неустраненным очень незначительный перекос, менее половины градуса. Для большинства документов такое консервативное поведение является подходящим. Ложная коррекция перекоса, которая приводит к повороту правильно ориентированной страницы, более разрушительна, чем оставление нетронутым едва заметного перекоса. После оптимизации пролистайте документ с увеличением по ширине и визуально проверьте, что текстовые строки выглядят горизонтально. Страницы, которые не были исправлены, должны оставаться читабельными.

Метод 2: ScanTailor для профессионального пакетного устранения перекосов

ScanTailor — это инструмент постобработки с открытым исходным кодом, разработанный специально для отсканированных документов. Он обрабатывает пакет отсканированных страниц на нескольких этапах, включая исправление перекоса, обнаружение контента, обрезку полей и форматирование вывода. Импортируйте отсканированный PDF-файл в ScanTailor, сначала извлекая изображения отдельных страниц с помощью такого инструмента, как pdfimages или функции «Экспорт всех изображений» в Acrobat Pro.

ScanTailor представляет каждую страницу с наложенным на нее обнаруженным углом перекоса. Вы можете настроить угол вручную для любой страницы, на которой автоматическое определение было неправильным, прежде чем применять коррекцию глобально. После исправления перекоса продолжите этап выбора содержимого, чтобы определить текстовую область и обрезать пустые поля, а затем экспортируйте в PDF. Обработка ScanTailor более тщательна, чем в Acrobat Pro, и обеспечивает более чистый результат для документов, которые требуют как исправления перекоса, так и обрезки полей.

ИнструментВозможность пакетной обработки?Точность
Adobe Acrobat Pro (оптимизация отсканированных страниц)Да, фильтр применяется ко всем страницамПодходит для незначительного и умеренного перекоса
ScanTailor (с открытым исходным кодом)Да, предназначен для пакетной обработкиПревосходное постраничное обнаружение контента
ImageMagick + устранение перекоса CLIДа, полностью скриптовыйХорошо, используется доминирующий угол текстовой строки

Метод 3: устранение перекоса из командной строки с помощью ImageMagick

Для пакетных рабочих процессов по сценарию команда преобразования ImageMagick включает оператор выравнивания перекоса. Команда Convert input.png -deskew 40% output.png анализирует изображение и применяет обнаруженную коррекцию поворота. Процентный параметр, в данном примере 40 процентов, устанавливает пороговое значение того, какая часть изображения покрывается операцией выравнивания.

Когда дело доходит до рабочих процессов с документами, для обработки всего PDF-файла с помощью ImageMagick разделите PDF-файл на отдельные изображения страниц с помощью pdfimages или аналогичного инструмента. Запустите команду устранения перекоса для каждого изображения страницы, используя цикл оболочки. Затем объедините выпрямленные изображения в PDF-файл с помощью команды преобразования ImageMagick, указав изображения страниц по порядку. Подход с использованием командной строки полностью автоматизирован и бесплатен, что делает его подходящим для пакетной обработки больших объемов, где инструменты с графическим интерфейсом требуют слишком большого количества ручного взаимодействия. Качество вывода при устранении перекоса в ImageMagick сравнимо с качеством в Acrobat Pro для документов с четкой структурой строк текста.

Пакетное исправление перекоса за считанные минуты превращает криво отсканированный PDF-файл в профессионально выпрямленный документ. Автоматическое исправление применяется индивидуально к каждой странице, обрабатывая постраничные изменения, что делает ручное выпрямление непрактичным для документов, содержащих более нескольких страниц.

Сочетание исправления перекоса с другими исправлениями отсканированных страниц

Исправление перекосов наиболее эффективно в сочетании с другими исправлениями отсканированных страниц в одном конвейере обработки. После исправления перекоса примените обнаружение содержимого, чтобы определить текстовую область и обрезать пустые поля. Затем примените пороговый фильтр, чтобы преобразовать страницы в оттенках серого в чистые черно-белые, что повышает точность распознавания и уменьшает размер файла. Наконец, запустите распознавание текста на выпрямленных, обрезанных страницах и страницах с порогами, чтобы создать документ с возможностью поиска.

Такие инструменты, как ScanTailor и OCRmyPDF, объединяют все эти шаги в единый автоматизированный конвейер. OCRmyPDF, инструмент командной строки на основе Python, принимает отсканированный PDF-файл, выравнивает каждую страницу, применяет адаптивное пороговое значение, запускает распознавание текста с помощью Tesseract и выводит PDF-файл с возможностью поиска со встроенным текстовым слоем OCR. Единственная команда ocrmypdf --deskew input.pdf output.pdf обрабатывает выравнивание, определение порога и распознавание текста за один проход. В проектах оцифровки больших объемов отсканированных документов комбинированный конвейер обрабатывает документы непрерывно без ручного вмешательства на любом этапе.

Калибровка чувствительности к выравниванию для страниц со смешанным содержанием

Страницы, на которых смешаны текст и фотографии, например, иллюстрированные книги или сканы журналов, представляют собой проблему с устранением перекосов. На фотографиях отсутствует четкая ориентация строк текста, а алгоритм исправления перекоса может быть сбит с толку краями изображения, а не текстом. Большинство инструментов позволяют устанавливать доверительный порог, который предотвращает коррекцию, когда обнаруженный угол неопределенен.

Для страниц со смешанным контентом чувствительность к выравниванию устанавливайте консервативно. Перекос в 0,3 градуса едва заметен. Ложная коррекция, поворачивающая хорошую страницу на 0,5 градуса, более разрушительна, чем оставление небольшого перекоса нетронутым. После пакетного исправления перекоса пролистайте документ и определите страницы, которые стали более перекошенными. Верните этим страницам исходную ориентацию вручную.

Пакетное исправление перекоса преобразует искривленный отсканированный документ в профессионально выровненный файл за время, необходимое для запуска одной команды или щелчка в диалоговом окне оптимизации. Автоматическая коррекция обрабатывает изменения на каждой странице, что делает ручное выпрямление непрактичным. В сочетании с обрезкой, определением порога и оптическим распознаванием текста исправление перекоса является одним из этапов процесса обработки, который преобразует необработанные отсканированные изображения в чистые, доступные для поиска и профессионально представленные цифровые документы.

Прямые страницы — это первый признак качества, который читатель замечает в отсканированном документе. Прежде чем они прочитают слово, прежде чем они оценят содержание, ориентация страницы говорит им, был ли документ подготовлен тщательно. Пакетное исправление перекоса гарантирует, что каждая страница документа передает правильный сигнал.

Пакетное исправление перекоса — это отдельный этап в конвейере обработки отсканированных документов, но именно от него зависит, будет ли документ выглядеть профессионально подготовленным или небрежно отсканированным. Прямые страницы сигнализируют читателю о качестве еще до того, как он прочитает хоть одно слово. В сочетании с обрезкой, определением порога и оптическим распознаванием текста функция исправления перекоса преобразует необработанные сканы в безупречные цифровые документы.

WukongPDF

Попробуйте обрезать PDF

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →