Tips & Tricks

Как извлечь текст из отсканированного PDF-файла только на одном конкретном языке, если присутствует несколько языков

Вы просматриваете двуязычное меню. Названия блюд на итальянском языке. Описания на английском языке. Цены представляют собой цифры, которые не зависят от языка. Вам нужно извлечь только итальянский текст, чтобы создать список слов на итальянском языке, или только английский текст, чтобы отправить его переводчику для другой языковой пары. Запуск OCR для всего документа создает смесь обоих языков, что хорошо для поиска, но не для выборочного извлечения.

Для извлечения текста только на одном языке из многоязычного документа OCR PDF требуется механизм оптического распознавания символов, который может определить, на каком языке написан каждый текстовый блок, и извлечь только те блоки, которые соответствуют вашему целевому языку. Это более избирательная операция, чем стандартное распознавание текста, которое распознает весь текст независимо от языка.

How to Extract Text From a Scanned PDF in Only One Specific Language When Multiple Languages Are Present

Как работает языковое распознавание текста

Механизмы оптического распознавания символов с поддержкой нескольких языков можно настроить для одновременного распознавания текста на нескольких языках. Когда вы указываете "Итальянский и английский" как и языки оптического распознавания символов, механизм распознает текст на обоих языках. Он также помечает каждый распознанный текстовый блок языком, на котором он был распознан. Блок итальянского текста помечен как итальянский. Блок текста на английском языке помечен как английский. Языковые теги позволяют выборочное извлечение.

После OCR вы можете фильтровать распознанный текст по языковому тегу. Экспортируйте только блоки, помеченные как итальянский. На выходе получается документ, содержащий только текст меню на итальянском языке. Описания на английском языке, распознанные, но отфильтрованные, не появляются в выводе. Такое выборочное извлечение полезно для рабочих процессов перевода, материалов для изучения языка и анализа контента, когда вам нужен текст на определенном языке, изолированный от окружающего текста на других языках.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Шаг за шагом: извлечение текста на определенном языке

Загрузите отсканированный PDF-файл в инструмент OCR WukongPDF. Выберите языки, присутствующие в документе. Для итальянско-английского меню выберите итальянский и английский язык. Запустите OCR. Инструмент распознает весь текст и помечает каждый блок языком. После завершения OCR используйте языковой фильтр, чтобы выбрать итальянский. Экспортируйте отфильтрованный текст в виде обычного текстового файла, документа Word или нового PDF-файла, содержащего только блоки итальянского языка.

Точность определения языка зависит от своеобразия языков. Итальянский и английский используют один и тот же алфавит, но имеют разные образцы слов. Механизм OCR различает их, анализируя частоту слов. В итальянском языке много слов, оканчивающихся на гласные. В английском языке много слов, оканчивающихся на согласные. Чем более различны языки, тем точнее языковая маркировка. Два близкородственных языка, таких как испанский и португальский, могут быть перепутаны движком при работе с короткими текстовыми блоками.

Обработка текста на разных языках в одной строке

В некоторых документах языки смешиваются в одной строке, например в учебнике по языку, в котором предложение на французском языке сочетается с его переводом на английский язык в одной строке. Механизм OCR может классифицировать всю строку как доминирующий язык, ошибочно отмечая слова на языке меньшинства. Для этих документов языково-селективное извлечение на уровне блоков недостаточно точно. Вам нужен другой подход.

Альтернативой является запуск OCR дважды, по одному разу с каждым языком в качестве единственного языка распознавания. Проход OCR только для итальянского языка хорошо распознает итальянский текст, но искажает английский текст. Проход только для английского языка хорошо распознает английский, но искажает итальянский. Сравните два вывода и вручную выберите правильную версию для каждого текстового сегмента. Этот двухпроходный подход требует больше времени, но обеспечивает наиболее точное извлечение с учетом особенностей языка для документов, в которых языки чередуются на уровне предложений.

Проверка и очистка извлеченного текста

После извлечения текста на целевом языке убедитесь, что языковая фильтрация выполнена правильно. Просканируйте извлеченный текст на наличие слов, которые явно написаны на неправильном языке. Извлечение итальянского текста из меню не должно содержать английских слов, таких как «гриль». или «подается с»; если только меню намеренно не использовало эти слова в итальянских описаниях. Отфильтрованный текст, содержащий неожиданные иностранные слова, указывает на ошибки языковых тегов, которые необходимо исправить вручную.

Запустите проверку орфографии на целевом языке. Проверка правописания на итальянском языке выявляет английские слова, которые были неправильно включены в итальянское извлечение. Флаги проверки орфографии — это эффективный способ найти ошибки языковой маркировки, не читая каждое извлеченное слово. Extract PDF Data, прошедший языковую фильтрацию и проверку орфографии, готов к переводу, анализу или архивированию. Scanned PDF OCR WukongPDF с языковой фильтрацией обеспечивает более чистые одноязычные фрагменты, чем постобработка вывода OCR на смешанных языках для удаления нежелательного языка.

Практическое применение языкового оптического распознавания символов: создание двуязычных глоссариев из переведенных документов. Извлеките все термины исходного языка и все термины целевого языка отдельно. Выровняйте их по положению на странице, поскольку каждому исходному термину соответствует целевой термин примерно в той же вертикальной позиции на странице или в соседнем столбце. Выровненный результат превращается в список терминов, который переводчики могут использовать для обеспечения единообразия в будущих переводах. Этот метод построения глоссария широко используется в техническом переводе, где единообразие терминологии имеет решающее значение.

Для документов, в которых языки указаны в отдельных столбцах, например двуязычного контракта с двумя столбцами, выборочное извлечение языка становится задачей выбора столбца. Левый столбец — один язык, правый — другой. Вместо того, чтобы полагаться на определение языка, которое может спутать похожие языки, обрежьте PDF-файл, чтобы извлечь каждый столбец отдельно. Запустите распознавание текста на одном языке для каждого столбца. Этот подход с обрезкой столбцов более надежен, чем языковая фильтрация для документов с четким разделением языков по столбцам.

Для архивных проектов, включающих исторические многоязычные документы, языковое распознавание текста в сочетании с тегами метаданных создает архив с возможностью поиска, в котором исследователи могут находить контент на определенном языке в тысячах документов. Выходные данные OCR каждого документа помечаются обнаруженными языками. Исследователь, ищущий французские документы XVIII века, может отфильтровать текст только на французском языке в многоязычной коллекции. Такой избирательный подход превращает архивное оптическое распознавание текста из грубого инструмента, смешивающего языки, в точный инструмент лингвистических исследований.

WukongPDF

Попробуйте PDF-распознавание текста

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →