Tips & Tricks

Как распознать отсканированную академическую статью, в которой текст сноски и цитаты на полях физически перекрываются со столбцом основного текста

How to OCR a Scanned Academic Paper Where Footnote Text and Margin Citations Physically Overlap With the Main Body Text Column

Почему распознавание текста плохо справляется с перекрытием текста сноски и содержимого полей

Механизмы оптического распознавания символов работают лучше всего, когда текст располагается в чистых, предсказуемых блоках с постоянным межстрочным интервалом и четким разделением между областями контента. Операция OCR PDF на стандартном деловом письме или странице романа обычно дает точные результаты, поскольку текст разбит на упорядоченные абзацы с широкими полями со всех сторон. Научные статьи представляют собой принципиально более сложную проблему, поскольку их макет намеренно упаковывает несколько отдельных текстовых потоков в непосредственной физической близости, при этом сноски, цитаты на полях и основной текст часто соприкасаются или перекрываются по границам.

Основной проблемой является сегментация, этап, на котором механизм OCR делит изображение страницы на текстовые области перед попыткой распознавания символов. Когда номер ссылки на надстрочную сноску в основном тексте находится непосредственно над линией-разделителем сноски, а эта линия находится непосредственно над самим текстом сноски при меньшем размере шрифта, алгоритм сегментации должен решить, где заканчивается одна текстовая область и начинается следующая. Неправильное решение о сегментации здесь приводит к ошибкам распознавания, поскольку символы из двух разных текстовых потоков подаются в механизм распознавания, как если бы они были одной непрерывной строкой. Вывод выглядит как тарабарщина, смешивающая слова основного текста с фрагментами сносок.

Цитаты на полях добавляют к проблеме третий текстовый поток. В гуманитарных статьях, оформленных в стиле Чикаго, или в юридических документах, использующих формат Bluebook, примечания на полях, номера строк или параллельные цитаты располагаются вертикально или горизонтально рядом с основным столбцом текста. Эти элементы полей часто печатаются с меньшим размером, иногда 7 или 8 пунктов, и могут использовать курсив или сжатые шрифты, с которыми механизмы OCR уже сталкиваются при нормальных размерах. Когда текст на полях физически соприкасается с основным текстом, что часто случается в плотно отформатированных журналах с узкими разделителями, проблема сегментации становится трехсторонней, а не двусторонней.

Качество бумаги источника Scanned PDF также усугубляет трудности распознавания. Многие научные статьи сканируются из переплетенных томов, где кривизна страницы возле корешка приводит к сгибанию и искажению текста. Сноски внизу страницы — это раздел, на который больше всего влияет искривление корешка, поскольку они расположены ближе всего к переплету. Сочетание физического искажения из-за изогнутой страницы, маленького размера шрифта и непосредственной близости к основному тексту выше создает идеальный шторм неблагоприятных условий для точности оптического распознавания символов.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Предварительная обработка отсканированной страницы для разделения перекрывающихся текстовых областей

Самый эффективный способ повысить точность распознавания на академических страницах с перекрывающимися текстовыми элементами — это предварительная обработка изображения страницы до того, как оно достигнет механизма распознавания. Эта предварительная обработка разделяет различные текстовые потоки, поэтому механизму никогда не приходится принимать неоднозначные решения по сегментации.

Начните с выравнивания перекоса отсканированной страницы, чтобы все текстовые строки располагались идеально горизонтально. Даже наклон исходного отсканированного изображения на один градус может привести к смещению текста сноски в область основного текста по краям страницы, создавая ложные перекрытия, которых не было бы на правильно выровненной странице. Большинство программ для сканирования документов включают автоматическое выравнивание, но для научных статей, сканированных из переплетенных томов, выравнивание вручную с опорной линией, проведенной вдоль базовой линии основного текста, дает более точные результаты, чем автоматическое исправление.

После исправления перекоса следующим шагом является маскирование области. Используя редактор изображений или специальный инструмент предварительной обработки OCR, нарисуйте горизонтальную разделительную линию между областью основного текста и областью сноски. Эта строка сообщает нижестоящему механизму OCR рассматривать все, что находится выше нее, как одну текстовую область, а все, что ниже нее, как отдельную текстовую область. На страницах, где присутствуют сноски, разделитель должен располагаться чуть выше правила сноски — короткой горизонтальной линии, которая традиционно отделяет основной текст от сносок в печатных академических работах. На страницах без сносок разделитель не нужен.

Для ссылок на полях и номеров строк эквивалентным подходом является вертикальное маскирование. Нарисуйте вертикальный разделитель между текстом на полях и основным текстовым столбцом. На страницах с номерами строк на левом поле и цитатами на правом поле обе стороны нуждаются в вертикальных разделителях. Цель состоит в том, чтобы разделить страницу на прямоугольные области, где каждая область содержит ровно один текстовый поток. Затем механизм OCR обрабатывает каждую область независимо и выдает отдельные выходные данные распознанного текста, которые вы можете собрать в правильном порядке чтения после завершения распознавания.

Настройка параметров оптического распознавания символов для многопоточных академических страниц

Большинство профессиональных механизмов оптического распознавания символов предоставляют настройки, которые помогают создавать макеты страниц с несколькими столбцами и несколькими потоками. Включение автоматического анализа макета является отправной точкой, но для академических страниц с близкими текстовыми потоками ручная настройка зоны дает лучшие результаты, чем полностью автоматический анализ.

Определите отдельные зоны распознавания для основного текста, области сноски и каждой области текста на полях. В каждой зоне установите соответствующий язык, ожидаемый диапазон размеров шрифта и ориентацию текста. Зоны основного текста должны иметь размер текста от 10 до 12 пунктов в горизонтальной ориентации слева направо. В зонах сносок следует ожидать текст размером от 8 до 10 пунктов, по-прежнему горизонтальный, но с учетом того, что текст сносок часто включает URL-адреса, DOI и строки цитирования, которые могут сбить с толку языковые модели, ожидающие естественной прозы.

В частности, для зоны основного текста включите параметр, который игнорирует надстрочный и подстрочный текст для сегментации строк. Ссылочные номера сносок надстрочного индекса и математические показатели степени обычно меньше и возвышаются над базовой линией, что приводит к ошибкам расчета высоты строки, если механизм обрабатывает их как часть обычной текстовой строки. Игнорирование положения надстрочного индекса для целей сегментации сохраняет строки основного текста неповрежденными, в то время как маркеры сносок распознаются как отдельные небольшие элементы, которые не влияют на границы строк.

Качество вывода из PDF в Text значительно улучшается, когда результат распознавания каждой зоны сохраняется в отдельный текстовый файл или в отдельный отмеченный раздел в объединенном выводе. Такой вывод с разделением по зонам позволяет легко проверить, что основной текст не перетекает в текст сноски и что ссылки на полях появляются в отдельном четко обозначенном разделе вывода, а не чередуются с основным содержимым.

Очистка результатов распознавания после распознавания для академических результатов распознавания

Даже при тщательной предварительной обработке и настройке зон некоторые ошибки распознавания неизбежны на плотно упакованных научных страницах. Структурированный процесс очистки после распознавания выявляет и исправляет эти остаточные ошибки до того, как текст попадет в окончательный документ.

Запускайте проверку орфографии только для вывода основного текста, при этом для словаря проверки орфографии выбран основной язык документа. Слова, помеченные как написанные с ошибками в основном тексте, но которые оказались правильно написанными содержимым сноски, являются явным признаком того, что граница зоны основного текста была слишком большой и захватила текст сноски. Настройте границы зоны для этих страниц и повторно запустите распознавание, а не вручную редактируете фрагменты сносок.

При выводе текста сноски убедитесь, что каждая сноска начинается с ожидаемого ссылочного номера и что текст сноски движется непрерывно, без вкраплений фрагментов основного текста. Распространенной ошибкой после распознавания является появление строк основного текста в середине текста сноски, где столбец основного текста простирается ниже на странице, чем предполагалась граница зоны. Просмотр исходного изображения страницы вместе с распознанным текстом сноски быстро выявляет эти вторжения, поскольку тема предложения резко переключается с академической темы на несвязанную тему основного абзаца.

Инструмент OCR WukongPDF поддерживает распознавание на основе зон для сложных макетов страниц, включая научные статьи с несколькими колонками со сносками и содержимым на полях. Определение настроек языка, диапазона размера шрифта и ориентации текста для каждой зоны перед запуском этапа распознавания обеспечивает более точный вывод OCR PDF, чем обработка одной зоны на тех же страницах, а разделенный формат вывода упрощает проверку после распознавания.

Обработка особых случаев: математическая запись, нелатинское письмо и смешанные языки

Научные статьи в области STEM добавляют математические обозначения к проблеме перекрывающихся текстов. Уравнения и формулы, перемежающиеся с основным текстом, создают дополнительную сложность сегментации, поскольку в математических обозначениях используются символы, греческие буквы и двумерное форматирование, такое как дроби и верхние индексы, которые не следуют тем же правилам компоновки, что и прозаический текст. Механизмы оптического распознавания символов, предназначенные для текста документа, плохо работают с математическими обозначениями, а механизмы, предназначенные для математических вычислений, плохо работают с текстом документа.

Наиболее практичным подходом для страниц со смешанной математикой и прозой является стратегия двухпроходного распознавания текста. При первом проходе используется механизм, оптимизированный для документов, для распознавания всех областей прозаического текста, включая основной текст, сноски и цитаты на полях. Второй проход использует механизм распознавания математических вычислений в определенных областях страницы, содержащих уравнения. Объединение двух выходных данных в единый документ, который сохраняет как точность текста механизма документов, так и точность формул математического механизма, дает наиболее надежный общий результат.

Для документов, в которых используется сочетание латинского и нелатинского алфавита, например статей на английском языке с арабскими, китайскими или кириллическими кавычками в сносках, настройте каждую зону распознавания с правильным основным алфавитом. Зона основного текста использует основной язык документа. Для зон сносок, содержащих фрагменты нелатинского алфавита, может потребоваться конфигурация распознавания нескольких рукописей, позволяющая переключаться между алфавитами в пределах одной текстовой области.

В таблице ниже приведены рекомендуемые конфигурации зон OCR для различных областей страниц в научных статьях.

Область страницыОжидаемый размер шрифтаОриентацияСпециальные настройки
Основной текст10-12 балловГоризонтальныйИгнорировать верхний индекс для сегментации линий
Сноски8-10 балловГоризонтальныйМультискрипт, если цитаты содержат нелатинский текст.
Левое поле (номера строк)7-9 балловГоризонтальный или ВертикальныйИзвлечь как отдельный вывод; не сливаться с телом
Правое поле (Цитаты)7-9 балловГоризонтальныйИзвлечь как отдельный вывод
Уравнения/ФормулыПеременнаяГоризонтальный с 2D-планировкойИспользовать математический движок на втором проходе
WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →