Tips & Tricks

Как распознать PDF-документ, написанный на языке, на котором вы не говорите

Получение Отсканированного PDF-файла, написанного на языке, на котором вы не говорите, сегодня более распространено, чем когда-либо, в глобальном бизнесе, научных исследованиях и проверке юридических документов. Вам нужно извлечь текст, перевести его и понять, о чем говорится в документе. Задача состоит не в том, чтобы просто запустить распознавание текста в файле. Он выполняет распознавание текста с правильными языковыми настройками, поэтому извлеченный текст достаточно точен для перевода. Выбор неправильного языка во время обработки OCR PDF приводит к искажению вывода, который не может спасти ни одна система перевода.

Механизмы OCR не видят буквы. Они видят формы и сопоставляют эти формы с шаблонами символов определенного языка. Если вы сообщите движку OCR, что документ на английском языке, но на самом деле он на русском, движок сопоставит кириллические фигуры с ближайшими известными ему латинскими символами. В результате получается строка случайных букв, не имеющая никакого отношения к исходному тексту. Правильная настройка языка или использование автоматического определения, если оно доступно, — это самое важное решение во всем конвейере преобразования OCR в перевод.

Инструменты PDF to Text и OCR WukongPDF извлекают текст из отсканированных документов для перевода и анализа. Сочетание правильного выбора языка распознавания с надежной службой перевода превращает нечитаемый отсканированный документ на иностранном языке в понятный документ менее чем за пять минут.

How to OCR a PDF Document Written in a Language You Don't Speak

Шаг 1. Определите язык документа

Прежде чем приступить к использованию любого программного обеспечения для оптического распознавания символов, точно определите язык документа. Если метаданные документа или имя файла намекают на язык, начните с него. Если нет, откройте PDF и просмотрите несколько страниц. Даже не читая текст, визуальные подсказки значительно сужают возможности. Семейства алфавитов уникальны: латиница используется в большинстве европейских языков. Кириллица используется для русского, украинского, болгарского и сербского языков. Арабский сценарий охватывает арабский, персидский и урду. CJK охватывает китайский, японский и корейский языки. Деванагари охватывает хинди, маратхи и непальский языки.

Если вы не можете визуально определить даже семейство шрифтов, сделайте снимок экрана репрезентативного абзаца и загрузите его в функцию перевода изображений Google Translate или в функцию обратного поиска изображений. В большинстве случаев эти инструменты идентифицируют как сценарий, так и конкретный язык. Знание того, что документ тайский, а не лаосский, или корейский, а не японский, определяет разницу между точным выводом OCR и бесполезным символьным шумом.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Шаг 2. Выберите инструмент оптического распознавания символов, поддерживающий целевой язык

Не все инструменты OCR поддерживают все языки. Adobe Acrobat Pro поставляется с механизмами оптического распознавания символов примерно для 40 языков. Его инструмент «Распознавание текста» включает раскрывающийся список выбора языка в диалоговом окне настроек. Tesseract, бесплатная система оптического распознавания символов с открытым исходным кодом, поддерживаемая Google, поддерживает более 100 языков посредством загружаемых файлов языковых данных. Google Cloud Vision API имеет самый широкий языковой охват (более 200 языков) и включает автоматическое определение языка в качестве дополнительной функции.

Для документа на одном языке, который вы можете идентифицировать, любой из этих инструментов работает, если вы укажете правильный язык перед запуском OCR. Для документа, содержащего несколько языков, например двуязычного контракта с пунктами на английском и французском языках, вам нужен инструмент, который либо поддерживает несколько языков одновременно, либо может автоматически определять каждый абзац. Google Cloud Vision и Tesseract с соответствующими языковыми пакетами данных обрабатывают многоязычные документы, хотя точность границ переключения языков никогда не бывает идеальной.

Шаг 3. Настройте и запустите OCR с правильным языком

В Adobe Acrobat Pro откройте отсканированный PDF-файл, выберите «Инструменты», затем «Сканирование и распознавание текста» и выберите «Распознать текст», затем «В этом файле». Нажмите кнопку «Изменить» рядом с переключателем языка. В диалоговом окне «Распознавание текста» выберите правильный основной язык из раскрывающегося списка. Если документ содержит второй язык, нажмите кнопку «Добавить язык» и также выберите его. Acrobat обрабатывает оба языка одновременно. Нажмите «ОК», затем «Распознать текст». Acrobat запускает этап оптического распознавания символов и встраивает распознанный текст в виде невидимого слоя за отсканированное изображение. Теперь документ доступен для поиска.

В Tesseract вызов командной строки указывает язык с флагом -l: tesseract input.pdf вывод -l rus для русского, tesseract input.pdf вывод -l jpn для японского или tesseract input.pdf вывод -l fra+eng для двуязычного франко-английского документа. Сначала установите необходимые файлы языковых данных; По умолчанию Tesseract поставляется только с английским языком. Для Google Cloud Vision вызов API включает параметр LanguageHints, который принимает массив языковых кодов BCP-47. Cloud Vision также предлагает режим автоматического определения языка, который вообще не требует языковой подсказки, что делает его самым простым вариантом, когда вы действительно не знаете язык документа.

Шаг 4. Скопируйте извлеченный текст и переведите

После завершения распознавания проверьте качество текста, прежде чем отправлять его на перевод. В Acrobat откройте инструмент «Найти» и найдите в документе знакомое вам слово. Если поиск находит совпадения, значит OCR сработал. Выделите абзац извлеченного текста, скопируйте его и вставьте в текстовый редактор. Сканируйте на наличие очевидных ошибок распознавания: повторяющихся символов, слов с разрывами посередине или больших блоков нераспознанных символов. Если более 5 процентов текста повреждено, повторно запустите OCR, выбрав другой язык или более высокое разрешение.

Как только извлеченный текст пройдет визуальную проверку, скопируйте весь текст и вставьте его в инструмент перевода. Google Translate, DeepL или Microsoft Translator поддерживают ввод обычного текста. Для более длинных документов DeepL и Google Translate поддерживают прямую загрузку PDF-файлов с возможностью поиска, минуя этап копирования вручную. Результат перевода достаточен для понимания, исследования и внутреннего использования в бизнесе. Чтобы обеспечить юридическую, медицинскую или публикационную точность, отправьте PDF-файл с возможностью поиска профессиональному переводчику, который будет использовать уровень оптического распознавания символов в качестве отправной точки и корректировать машинный перевод по сравнению с исходными отсканированными страницами.

Обработка документов со смешанными алфавитами или нестандартными шрифтами

Документы, в которых используются смешанные алфавиты, такие как исследовательская работа на арабском языке, включающая английские технические термины, написанные латиницей, сбивают с толку механизмы оптического распознавания символов, которые ожидают один алфавит. Сначала настройте OCR для доминирующего сценария, а затем запустите второй проход, нацеленный на сценарий меньшинства, в том же документе. Объедините результаты, экспортировав оба слоя OCR и объединив их в текстовом редакторе. Точность фрагментов сценария меньшинства будет ниже, поскольку движок оптимизирован для основного сценария.

Нестандартные шрифты, включая декоративные шрифты, старые шрифты пишущих машинок и рукописные рукописные шрифты, снижают точность распознавания даже при правильном выборе языка. Предварительно обработайте эти документы, преобразовав страницы PDF в изображения высокого разрешения (400 точек на дюйм или выше), применив фильтр резкости и увеличив контрастность, прежде чем подавать их в механизм оптического распознавания символов. Встроенная предварительная обработка Tesseract, включенная с помощью --psm 3 для автоматической сегментации страниц, обрабатывает умеренные вариации шрифтов. Для сильно искаженного или стилизованного текста API Google Cloud Vision обычно превосходит локальные механизмы оптического распознавания символов, поскольку его модели были обучены на большем объеме реальных образцов шрифтов.

Инструмент OCRПоддержка нескольких языковАвтоопределениеНаилучший вариант для
Adobe Акробат Про40+ языковРучной выборПрофессиональные документы, высокая точность
Тессеракт (с открытым исходным кодом)100+ языковТребуется ручной выборПакетная обработка, создание сценариев, бесплатно
Облачное видение Google200+ языковДоступно автоматическое обнаружениеИнтеграция API, смешанные скрипты
Онлайн-сервисы оптического распознавания символов10-50 языковРучной выборБыстрое распознавание текста одного документа

Проверка точности перед использованием переведенного контента

OCR с последующим машинным переводом создает два уровня потенциальных ошибок: неправильное распознавание OCR и неоднозначность перевода. Для важных документов проверьте результат выборочно, попросив двуязычного коллегу или профессионального переводчика сравнить случайно выбранный абзац перевода с исходным PDF-файлом. Пятиминутная проверка выявляет катастрофические сбои, такие как неправильная настройка языка, из-за которой текст выглядит правдоподобно, но совершенно неверно.

Если вы регулярно обрабатываете отсканированные PDF-файлы на иностранном языке, составьте контрольный список: определите язык, выберите соответствующий механизм оптического распознавания символов, запустите оптическое распознавание текста с правильным языковым параметром, выборочно проверьте извлеченный текст на точность символов, переведите и проверьте образец абзаца. После двух-трех документов рабочий процесс становится рутинным и занимает менее пяти минут от открытия файла до прочтения переведенного результата.

Когда дело доходит до обработки документов, чувствительных к безопасности, автономное распознавание текста полностью позволяет избежать воздействия облака. Tesseract запускается локально без сетевых запросов после однократной загрузки файлов языковых данных. Adobe Acrobat Pro также выполняет локальное распознавание текста с помощью функции «Распознавание текста» без входа в Document Cloud. Для конфиденциальных материалов на иностранном языке, таких как юридические документы или конфиденциальная деловая переписка, локальное оптическое распознавание текста в сочетании с автономным просмотром текста сохраняет исходное содержимое документа в контролируемой вами среде.

Когда одного OCR недостаточно: услуги вспомогательной транскрипции

Для документов, в которых точность распознавания неприемлемо низкая из-за сильного ухудшения качества шрифта, рукописного текста или сильно смешанных сценариев, службы вспомогательной транскрипции обеспечивают вывод, проверенный человеком. Эти услуги сочетают в себе первоначальный этап машинного оптического распознавания текста с проверкой и исправлением человеком, обычно взимая плату за страницу. Срок выполнения варьируется от нескольких часов до нескольких дней. Для одного критического документа, точность которого не подлежит обсуждению, такого как свидетельство о рождении на иностранном языке или патентная заявка, стоимость человеческой транскрипции оправдана риском воздействия на неправильно распознанный текст. Сначала запустите машинное распознавание текста, чтобы оценить качество. Если более 15 процентов слов не распознаны или явно неправильны, переходите к вспомогательной транскрипции, а не тратьте часы на ручное исправление машинного вывода.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →