Tips & Tricks

Как превратить фотографию распечатанной страницы в редактируемый текст с возможностью поиска с помощью OCR

Вы фотографируете распечатанный документ на телефон. Возможно, это страница из книги в библиотеке, раздаточный материал с собрания, квитанция, необходимая для отчета о расходах, или увиденная вами табличка с важной информацией. Фотография достаточно четкая, чтобы ее можно было прочитать, но это всего лишь картинка. В нем нельзя искать слова. Вы не можете копировать и вставлять текст из него. Вы не можете его редактировать. Это фотография текста, а не сам текст.

Оптическое распознавание символов может преобразовать эту фотографию в редактируемый текст с возможностью поиска, а инструменты для этого доступны на вашем телефоне и в браузере. В процессе делается фотография напечатанной страницы и создается документ, в котором вы можете искать, выбирать, копировать и редактировать каждое слово, как если бы вы напечатали его самостоятельно.

How to Turn a Photo of a Printed Page Into Editable, Searchable Text Using OCR

Получение наилучшей фотографии для OCR

Точность оптического распознавания символов во многом зависит от качества входного изображения. Хорошо освещенная, четко сфокусированная фотография плоской страницы будет распознаваться с точностью от 95% до 99%. Плохо освещенная, размытая, перекошенная фотография изогнутой страницы может быть распознана с точностью 70 %, а это означает, что примерно каждое третье или четвертое слово содержит ошибку. Время, потраченное на получение хорошей фотографии, многократно окупается за счет сокращения усилий по ее исправлению.

Поместите документ на ровную, хорошо освещенную поверхность. Естественный дневной свет идеален, поскольку он рассеян и не содержит теней. Верхнее офисное освещение работает, если вы расположитесь так, чтобы ваша тень не падала на страницу. Держите телефон прямо над страницей, параллельно ей, а не под углом. Используйте обе руки или положите локти на поверхность, чтобы телефон оставался устойчивым. Заполните рамку страницей, оставив небольшой запас по краям. Коснитесь экрана, чтобы сосредоточиться на тексте. Если в вашем телефоне есть режим сканирования документов, воспользуйтесь им. На iPhone приложение «Заметки» включает функцию сканирования документов, которая автоматически определяет края страницы, корректирует перспективу и усиливает контраст. На Android функция сканирования Google Диска делает то же самое.

Если страница взята из переплетенной книги и не может лежать ровно, осторожно нажмите на корешок, чтобы уменьшить изгиб, и примите во внимание, что точность распознавания будет ниже возле желоба, где страница изгибается в сторону от камеры. Для важного текста возле корешка сделайте вторую фотографию, сосредоточив внимание именно на этой области, расположив телефон ближе к странице, чтобы максимально увеличить разрешение изогнутого текста.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →

Запуск распознавания фотографий с помощью встроенных инструментов телефона

iPhone оснащены Live Text — встроенной функцией оптического распознавания символов, которая работает непосредственно в приложениях «Камера», «Фотографии» и Safari. Наведите камеру на текст, и в углу видоискателя появится значок «Живой текст». Нажмите на него, и телефон распознает текст в режиме реального времени. Вы можете выбрать, скопировать и вставить его немедленно. Если фотография уже находится в вашей библиотеке, откройте ее в приложении «Фото» и найдите значок «Живой текст». Коснитесь его, чтобы выделить весь распознанный текст. Вы можете скопировать выбранные части или все целиком. Live Text работает полностью на устройстве без подключения к Интернету.

Телефоны Android оснащены Google Lens, встроенным в Google Фото и приложение Google. Откройте фотографию в Google Фото и коснитесь значка объектива. Google Lens идентифицирует текст на изображении и позволяет выбирать, копировать, переводить или искать его. Как и Live Text от Apple, Google Lens работает в автономном режиме для распознавания текста на последних устройствах. Для обеих платформ встроенный OCR рассчитан на короткие отрывки, несколько предложений или абзац, а не на многостраничные документы. Он извлекает текст, но не создает форматированный документ.

Преобразование фотографии в PDF-файл с возможностью поиска с помощью инструментов OCR PDF

Для фотографии, которая должна стать полноценным документом, PDF-файлом с текстовым слоем с возможностью поиска, инструменты OCR на базе браузера выполняют весь процесс обработки. WukongPDF допускает загрузку фотографий в форматах JPEG, PNG, HEIC и других распространенных форматах. Загрузите фотографию. Инструмент обрабатывает его, распознает текст и выводит PDF-файл с исходной фотографией в качестве видимой страницы и распознанным текстом в виде невидимого слоя с возможностью поиска позади него. Результат выглядит точно так же, как на фотографии, но теперь вы можете искать слова, выделять и копировать текст, а файл ведет себя как любой другой PDF-файл.

Если у вас есть несколько фотографий последовательных страниц, загрузите их вместе. Инструмент обрабатывает каждый из них, и вы можете объединить их в один многостраничный PDF-файл с возможностью поиска. Это рабочий процесс оцифровки короткого документа с помощью телефона: сфотографируйте каждую страницу, загрузите пакет, запустите распознавание текста и загрузите единый PDF-файл с возможностью поиска всего документа. Для 10-страничного документа этот процесс занимает несколько минут, а результат функционально эквивалентен отсканированному PDF-файлу с помощью планшетного сканера.

Очистка результатов распознавания фотографий

Фотографии, сделанные на телефон, даже хорошие, дают меньшую точность распознавания, чем планшетное сканирование с разрешением 300 точек на дюйм. Фотография напечатанной страницы, сделанная телефоном, обычно распознается с точностью от 90% до 95%, то есть примерно в одном слове из 20 будет ошибка. Ошибки группируются в предсказуемых местах: по краям страницы, где объектив камеры вносит искажения, в мелких шрифтах ниже 10 пунктов, а также в областях с тенями или неравномерным освещением.

После преобразования Отсканированного PDF из фотографии откройте PDF-файл и найдите типичные ошибки оптического распознавания символов. Найдите "cl" который часто обозначается как «d»,» "рн"; который часто обозначается как «м», и "1"; который часто обозначается как «l». Прочитайте текст и исправьте найденные ошибки. Время, необходимое для очистки, зависит от длины документа и качества фотографии. Проверка одностраничного документа занимает от 5 до 10 минут. Документ объемом 20 страниц занимает час или больше. Этап очистки — это то, что отличает небрежный результат оптического распознавания символов от безупречного профессионального документа.

Когда фотография превосходит сканер

Фотография с телефона не является заменой планшетного сканера, когда качество является главным приоритетом. Но фотография с телефона намного лучше, чем сканер, которого нет под рукой, когда он вам нужен. Лучшая камера — та, которая у вас есть. Для захвата текста из библиотечных книг, раздаточных материалов конференций, заметок на доске, квитанций, вывесок, меню и любых печатных материалов, с которыми вы сталкиваетесь вне рабочего места, фотография с телефона с последующим распознаванием текста превращает мимолетное визуальное впечатление в постоянный, доступный для поиска и редактируемый текст. Конвейер Image to PDF WukongPDF соединяет фотографию телефона с готовым PDF-файлом менее чем за минуту, сокращая разрыв между просмотром текста в реальном мире и его доступностью в виде документа, который вы можете использовать.

Стоит понять одно ограничение: фотографии текстовых документов, сделанные телефоном, обычно создают файлы большего размера, чем эквивалентные планшетные сканы, поскольку камеры телефонов фиксируют цветную информацию даже для черно-белых документов. Телефонная фотография одной текстовой страницы может иметь размер от 3 до 5 МБ в формате JPEG, а планшетное сканирование той же страницы в черно-белом режиме может составлять 200 КБ. Если вы оцифровываете на телефоне много страниц, преобразуйте фотографии в оттенки серого, прежде чем запускать распознавание текста. Это уменьшает размер файла на 60–80 % и часто повышает точность оптического распознавания символов, поскольку преобразование оттенков серого устраняет цветовой шум и тени, которые сбивают с толку механизм распознавания. Большинство приложений для редактирования фотографий, включая встроенное приложение «Фото» на iPhone и Android, включают в себя фильтр в оттенках серого или монохромный фильтр, который позволяет сделать это одним касанием каждой фотографии.

WukongPDF

Попробуйте распознавание PDF-файлов

Никакой установки не требуется. Работает прямо в вашем браузере.

Начать →