Вы сканируете двуязычный контракт. Левая колонка на английском языке. Правый столбец на испанском языке. Оба языка должны быть доступны для поиска, но стандартный запуск оптического распознавания символов, настроенный для одного языка, исказит другой. Английское OCR, примененное к испанскому тексту, выдает бессмыслицу, поскольку механизм распознавания ожидает разную частоту букв и шаблоны слов. Испанское OCR, примененное к английскому языку, дает такие же искаженные результаты. Вам нужен OCR, который понимает оба языка одновременно.
Многоязычный OCR PDF — это функция современных механизмов распознавания, которая может переключаться между языковыми моделями в пределах одного документа. Движок определяет, на каком языке написан каждый текстовый блок, и применяет соответствующую модель распознавания. Результатом является точное распознавание текста на всех языках документа.

Как механизмы OCR обрабатывают несколько языков
Механизмы OCR распознают текст, сравнивая формы символов с обученными моделями того, как выглядят буквы на каждом языке. Английская модель знает, что буква «е» является наиболее распространенным, это "th" часто появляется вместе, и некоторые комбинации символов, такие как «qx»; почти никогда не встречаются. Испанская модель знает, что символы с акцентом, такие как «a»; с акцентом "n" с тильдой и перевернутыми вопросительными знаками. Французская модель предполагает частые ударные гласные и определенные диграфы.
Когда вы указываете несколько языков для задания OCR, механизм загружает модели символов для всех указанных языков. Обрабатывая каждый текстовый блок на странице, он оценивает, какая языковая модель лучше всего соответствует наблюдаемым шаблонам символов, и применяет эту модель. Определение языка происходит автоматически на уровне текстового блока, поэтому страница с английским основным текстом и французскими сносками обрабатывается правильно без ручного добавления языковых тегов.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Настройка многоязычного распознавания текста
В выборе языка инструмента OCR можно использовать несколько языков. Выберите все языки, которые присутствуют в документе. Для двуязычного англо-испанского контракта выберите английский и испанский. Если документ Европейского Союза содержит английский, французский и немецкий языки, выберите все три. Для научной работы с английским текстом и древнегреческими цитатами выберите «Английский» и «Греческий». Движок загружает все необходимые модели.
Существует компромисс между языковым охватом и точностью. Каждый дополнительный язык добавляет в процесс распознавания больше моделей символов, что увеличивает вероятность путаницы между похожими символами из разных языков. Кириллическая буква "а" выглядит идентично латинской букве "a" но представляет собой другой звук и появляется в разных контекстах. Добавление ненужных языков увеличивает риск того, что движок неправильно классифицирует текстовые блоки и применит неверную языковую модель. Выбирайте только те языки, которые действительно присутствуют в документе, а не все языки, которые, по вашему мнению, могут быть полезны.
Распространенные сценарии многоязычного оптического распознавания символов и способы их обработки
Наиболее распространенным многоязычным сценарием является документ, написанный преимущественно на одном языке с короткими отрывками, цитатами или сносками на другом. Научная статья на английском языке с французскими цитатами в сносках. Инструкция по эксплуатации на немецком языке с английскими техническими терминами. Юридический договор на испанском языке с условиями, определенными на английском языке. В этих документах основной язык содержит большую часть текста, а дополнительный язык появляется в коротких, предсказуемых контекстах.
Механизм распознавания хорошо обрабатывает эти документы на разных языках, поскольку переключение языка локализовано для определенных текстовых блоков. Основной текст на английском языке распознается по английской модели. Французская цитата распознается во французской модели. Поскольку два языка отображаются в отдельных текстовых блоках, механизм определения языка правильно определяет, какую модель использовать для каждого блока.
Более сложный сценарий — это документ, в котором языки чередуются в одной строке, например, учебник по языку, в котором в той же строке показано предложение на английском языке, за которым следует его перевод на испанский язык. Механизм OCR может рассматривать всю строку как один текстовый блок и применять ко всему этому одну языковую модель, создавая ошибки в половине строки, написанной на другом языке. Для этих документов наиболее точным подходом является распознавание документа дважды, по одному разу на каждом языке, и объединение результатов вручную. Это трудоемко и практично только для коротких документов, где точность имеет решающее значение.
Проверка результатов многоязычного распознавания текста
После запуска многоязычного распознавания текста проверьте результаты, проверив текст на каждом языке. Поиск слова, которое вы знаете, отображается на каждом языке. Подтвердите, что поиск находит его. Выделите текст на каждом языке и скопируйте его, чтобы убедиться в правильности символов. Особое внимание обратите на акцентированные символы и специальные символы. Распознавание Scanned PDF, скорее всего, не будет работать с символами, которые не существуют в доминирующей языковой модели, поскольку механизм по умолчанию может использовать ближайший латинский эквивалент.
Распространенные ошибки оптического распознавания символов в многоязычных документах включают замену акцентированных символов их эквивалентами без ударения, e с акцентом становится e, n с тильдой становится n, специальные знаки пунктуации, такие как перевернутые вопросительные знаки в испанском языке, заменяются стандартными вопросительными знаками, а нелатинские символы, такие как кириллица или греческий язык, ошибочно распознаются как визуально похожие латинские символы. Эти ошибки обычно концентрируются во второстепенных языковых отрывках. Если содержание второго языка имеет решающее значение, вручную сверьте эти отрывки с исходным документом. Инструмент OCR WukongPDF выдает оценку достоверности для каждого распознанного текстового блока, при этом более низкие оценки указывают на блоки, в которых механизм распознавания был менее уверен.
Для документов, в которых языки с латинским алфавитом сочетаются с нелатинскими алфавитами, например, английский документ с китайскими или арабскими кавычками, проблема многоязычного распознавания текста является более серьезной, поскольку формы символов принципиально различаются. Механизм распознавания должен различать совершенно разные системы письма. Выберите конкретные языки для каждого семейства алфавитов, которое появляется в документе. Обработка формата PDF в WukongPDF поддерживает смешивание латинских, кириллических, арабских, CJK и индийских алфавитов в одном задании OCR, хотя точность зависит от алфавита и качества сканирования.
Практический метод улучшения многоязычного оптического распознавания документов с отдельными языковыми разделами: предварительно разделите документ по языку перед запуском оптического распознавания. Если в 20-страничном контракте первые 10 страниц указаны на английском языке, а последние 10 страниц — на испанском, разделите документ на два файла, запустите распознавание текста на английском языке в первом и распознавание текста на испанском языке во втором, а затем повторно объедините. Это полностью позволяет избежать накладных расходов на многоязычную модель и обеспечивает немного более высокую точность, поскольку каждое задание OCR использует одну языковую модель, оптимизированную для конкретного обрабатываемого текста. Разделение, отдельное распознавание символов и повторное слияние занимают несколько дополнительных минут, но надежно обеспечивают максимальную точность для документов с четкими языковыми границами. Зарезервируйте подход многоязычного оптического распознавания символов для документов, в которых языки действительно чередуются на одной странице и разделение нецелесообразно.
И последний совет по многоязычному распознаванию текста: если документ содержит сценарии с написанием справа налево, такие как арабский, иврит или персидский язык, а также сценарии с письмом слева направо, такие как английский или французский, направление текста усложняет ситуацию. Механизмы оптического распознавания символов должны определять не только язык, на котором написан каждый текстовый блок, но и направление движения текста. Блок арабского текста должен распознаваться справа налево, а английская подпись под ним — слева направо. Большинство современных механизмов оптического распознавания символов достаточно хорошо обрабатывают документы смешанного направления, если в настройках указаны обе языковые семьи. После оптического распознавания текста проверьте направление текста, скопировав отрывок на арабском языке и вставив его в текстовый редактор. Символы должны появляться в правильном порядке чтения, а не в обратном порядке.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
