Tips & Tricks

Как распознать PDF-файл с вертикальным или справа налево направлением текста

Стандартные механизмы оптического распознавания символов построены на фундаментальном предположении: текст располагается по странице горизонтально слева направо. Это предположение работает для английского, испанского, французского, немецкого и большинства европейских языков. Он полностью не работает для японского текста, расположенного вертикально в традиционных столбцах, для китайских знаков, где символы располагаются сверху вниз, а также для документов на арабском языке и иврите, где текст располагается справа налево. Запуск стандартного оптического распознавания символов в этих документах приводит к выводу, в котором символы распознаются индивидуально, но собираются в неправильном порядке, что делает результат бесполезным.

Способность механизмов OCR PDF обрабатывать нестандартные направления текста значительно улучшилась благодаря последнему поколению систем распознавания на основе искусственного интеллекта. Эти механизмы определяют ориентацию текста перед попыткой распознавания, определяют направление чтения и восстанавливают логический порядок чтения независимо от визуального макета. Для документов со смешанным направлением текста, таких как статья на японском языке, содержащая горизонтальные английские кавычки, механизм переключает режимы в середине страницы.

How to OCR a PDF With Vertical or Right-to-Left Text Direction

Как механизмы OCR определяют и обрабатывают направление текста

Современные механизмы OCR начинаются с этапа анализа макета, который идентифицирует текстовые области, определяет их ориентацию и классифицирует их по направлению чтения. Для горизонтального текста механизм определяет базовую линию и группирует символы вдоль нее. Для вертикального текста движок определяет вертикальную ось и группирует символы в столбцы. Для текста, написанного справа налево, механизм определяет доминирующий набор символов и меняет порядок слов по умолчанию слева направо.

Обнаружение направления текста зависит от нескольких сигналов. Наличие определенных диапазонов символов Юникода указывает на вероятные языки и типичные для них направления текста. Пространственное расположение обнаруженных символов, независимо от того, образуют ли они горизонтальные линии или вертикальные столбцы, обеспечивает доказательство компоновки. Соотношение сторон ограничивающих рамок символов дает третий сигнал: латинские символы обычно шире, чем высота, в то время как символы CJK имеют примерно квадратную форму, а арабские символы соединяются горизонтально, показывая направление чтения.

Самые надежные механизмы оптического распознавания символов сочетают в себе все три типа сигналов. Документ, содержащий как арабский алфавит, подразумевающий чтение справа налево, так и латинский алфавит, подразумевающий чтение слева направо, требует, чтобы движок анализировал каждую текстовую область независимо. Правильно настроенный конвейер Extract PDF Data для многоязычных документов включает определение направления для каждого региона, а не применение одного направления ко всей странице.

Каждая система письма требует принципиально различной конфигурации оптического распознавания символов.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Настройки оптического распознавания символов для вертикального текста на японском, китайском и корейском языках

Японский вертикальный текст, называемый татегаки, является наиболее распространенной системой вертикального письма в современном использовании. Он появляется в романах, газетах, традиционных документах и официальной переписке. В вертикальном японском языке символы читаются сверху вниз, а столбцы продвигаются по странице справа налево. Числа и слова, написанные латиницей, встроенные в вертикальный японский текст, можно поворачивать или располагать горизонтально в вертикальном потоке.

Для распознавания вертикального текста на японском языке выберите механизм распознавания, который явно поддерживает татегаки. Механизмы оптического распознавания символов общего назначения могут правильно распознавать символы, но выводить их в горизонтальном порядке слева направо, создавая мусор. Механизмы оптического распознавания символов, специфичные для Японии, понимают порядок чтения на основе столбцов и выводят текст, который можно читать естественным образом. Tesseract, механизм оптического распознавания символов с открытым исходным кодом, в версии 5 добавил улучшенную поддержку вертикального японского языка, и теперь его предлагают несколько коммерческих механизмов.

Для китайского вертикального текста, который появляется в традиционных публикациях, каллиграфии и некоторых официальных документах, проблема распознавания аналогична, но набор символов больше. В упрощенном китайском языке обычно используется около 7000 символов, а в традиционном китайском — более 13 000. Механизм OCR должен не только определять вертикальное расположение, но и различать визуально похожие символы, которые отличаются только деталями штрихов.

Корейский вертикальный текст редко встречается в современных документах, но встречается в исторических текстах и некоторых традиционных публикациях. Корейский алфавит хангыль объединяет отдельные буквы в слоговые блоки, а при вертикальном письме эти блоки располагаются сверху вниз. Механизмы оптического распознавания символов, обрабатывающие корейский вертикальный текст, должны распознавать структуру блоков слогов, а также отдельные компоненты букв внутри каждого блока.

Настройки оптического распознавания текста для текста с письмом справа налево на арабском, иврите и персидском языке

Оптическое распознавание текста на арабском языке представляет собой уникальные проблемы, выходящие за рамки направления текста. Арабский — это рукописный шрифт, в котором большинство букв соединяются со своими соседями, а форма буквы меняется в зависимости от ее положения в слове: начальная, средняя, конечная или изолированная. Механизм OCR должен распознавать эти контекстные формы и сопоставлять их с правильным абстрактным символом. Пропущенные связи или ложные связи между буквами приводят к ошибкам распознавания, характерным для рукописного письма.

При выборе OCR на иврите шрифт не является курсивом, но включает в себя точки гласных, называемые никкуд, которые отображаются в виде точек и тире над, под или внутри букв. Эти знаки гласных небольшие, обычно от 2 до 4 пикселей в сканированном изображении, и легко теряются во время бинаризации. Механизм оптического распознавания символов, который явно не обрабатывает niqqud, правильно распознает согласные, но пропускает знаки гласных, создавая текст, который может понять читатель-человек, но который является технически неполным.

В персидском и урду используются расширенные версии арабского алфавита с дополнительными символами. Механизм OCR, обученный только на арабском языке, пропустит эти дополнительные символы или ошибочно распознает их как похожие арабские буквы. Выбирая механизм оптического распознавания символов для этих языков, убедитесь, что в нем указана поддержка именно того языка и варианта алфавита, который используется в вашем документе, а не только арабского алфавита в целом.

Обработка документов смешанного направления

Во многих реальных документах на одной странице сочетаются несколько направлений текста. Технический документ на японском языке может иметь вертикальный основной текст на японском языке, горизонтальные подписи к рисункам на английском языке и математические уравнения, которые следуют своим собственным правилам компоновки. Деловое письмо на арабском языке может включать название компании на английском языке и блок адреса в формате слева направо над основным текстом, написанным справа налево.

Для документов смешанного направления этап предварительной обработки OCR имеет решающее значение. Документ должен быть сегментирован на текстовые области, и каждая область должна быть классифицирована независимо по направлению текста, прежде чем начнется распознавание. Ручной выбор региона часто дает лучшие результаты, чем автоматическая сегментация для сложных макетов. Нарисуйте ограничивающие рамки вокруг каждой текстовой области и назначьте правильный язык и направление для каждой рамки.

После OCR проверьте выходные данные, проверив текст, который пересекает границы направлений. Распространенной ошибкой при распознавании символов смешанного направления является неправильная граница между двумя текстовыми областями, в результате чего последнее слово области, написанной слева направо, добавляется к началу области, написанной справа налево, или наоборот. Выборочная проверка этих граничных областей выявляет ошибки сегментации макета, которые в противном случае привели бы к путанице в результатах.

Пост-OCR-обработка для нестандартных направлений текста

После завершения OCR распознанный текст может нуждаться в изменении порядка для обеспечения естественного порядка чтения. Некоторые механизмы OCR выводят вертикальный текст на японском языке в том порядке, в котором он был распознан: сверху вниз в каждом столбце, столбец за столбцом слева направо. Этот порядок не соответствует исходному порядку чтения, который представляет собой столбец за столбцом справа налево. Шаг постобработки, который меняет порядок столбцов, обеспечивает правильную последовательность чтения.

Для документов с содержимым Scanned PDF, включающим двунаправленный текст на арабском языке со встроенными английскими терминами, алгоритм двунаправленного отображения Unicode определяет порядок отображения. Вывод OCR должен включать двунаправленные управляющие символы Юникода или следовать алгоритму, чтобы текст отображался правильно при вставке в приложения, поддерживающие двунаправленный текст.

WukongPDF обеспечивает обработку OCR через браузер для отсканированных PDF-файлов с опциями выбора языка, которые включают поддержку основных систем письма справа налево и вертикального письма. Тестирование OCR на образце страницы перед обработкой всего документа позволяет убедиться, что направление текста обрабатывается правильно.

Для документов, которые содержат как вертикальный, так и горизонтальный текст на одной странице, например макет японского журнала, где основная статья расположена вертикально, а подписи и боковые панели — горизонтальны, ручное зонирование дает наиболее точные результаты распознавания. Нарисуйте отдельные зоны распознавания для вертикальной и горизонтальной областей, назначьте для каждой правильное направление текста и запустите распознавание текста в зонированном документе. Дополнительное время, потраченное на зонирование, окупается точностью распознавания.

При обработке исторических документов с нестандартной компоновкой текста будьте готовы к тому, что точность распознавания будет ниже, чем у современных печатных документов. Исторические шрифты, неровная печать, состаренная, обесцвеченная бумага и нестандартные варианты символов снижают уверенность в распознавании. Для научной или архивной работы рассматривайте результаты оптического распознавания текста как отправную точку для ручной транскрипции, а не как готовый продукт.

Некоторые механизмы оптического распознавания символов поддерживают режим обучения, в котором вы предоставляете примеры конкретного шрифта или стиля рукописного ввода, используемого в вашем документе. Обучение механизма на нескольких репрезентативных страницах повышает точность распознавания по всему документу. Этот подход особенно полезен для документов, напечатанных необычными шрифтами, или для коллекций документов одного и того же издателя, где типографика одинакова в нескольких томах.

После завершения OCR в документе с письмом справа налево убедитесь, что направление текста правильное, скопировав несколько предложений из выходных данных и вставив их в приложение, поддерживающее двунаправленный текст, например Microsoft Word или Google Docs. Если текст отображается в обратном порядке, это означает, что механизм оптического распознавания символов неправильно применил направление справа налево, и вывод необходимо обработать повторно с исправленными настройками направления.

Время, затраченное на настройку правильных параметров распознавания нестандартных направлений текста, немедленно окупается точностью распознавания. Документ, который требует 30 минут ручного исправления после плохого распознавания текста, может потребовать всего 5 минут очистки после правильно настроенного распознавания текста.

Система письмаНаправлениеТребования к механизму OCRКлючевая задача
Японский (татегаки)Столбцы сверху вниз и справа налевоДвижок с явной поддержкой татегакиСмешанный горизонтальный английский в вертикальном потоке
Китайский (традиционный)Вертикальные столбцы, справа налевоБольшой набор символов (13 000+)Визуально похожие персонажи
арабскийСправа налево, курсивное соединениеМеханизм арабского письма с позиционными формамиКонтекстные формы букв; диакритические знаки
ивритСправа налево, с niqqudМеханизм сценариев на иврите с поддержкой гласныхМаленькие гласные теряются при бинаризации
Персидский / урдуСправа налево, расширенный арабский языкЯзыкозависимый движокДополнительные символы помимо арабского набора
WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →