Вы распознаете PDF-файл, и распознанный текст появится в текстовом поле вашего PDF-редактора. Вы можете прочитать это. Вы можете скопировать и вставить его. Но на самом деле вам нужен текст в файле Markdown с заголовками, отформатированными в виде хешей, списками в виде звездочек, ссылками в виде пар скобок и круглых скобок и абзацами, разделенными пустыми строками. Markdown — это лингва-франка разработчиков, технических писателей, блоггеров и всех, кому нужен чистый, переносимый текст, который можно добавить в генератор статических сайтов, приложение для заметок или хранилище кода.
Переход от отсканированного PDF-файла к файлу Markdown осуществляется в два этапа: OCR распознает текст, а затем этап форматирования преобразует распознанный текст в синтаксис Markdown. На каждом этапе есть выбор инструментов, которые влияют на качество конечного результата.

Шаг 1. Распознавание PDF-файла для извлечения распознанного текста
Шаг оптического распознавания символов аналогичен тому, как сделать любой PDF-файл доступным для поиска. Используйте инструмент OCR PDF для обработки отсканированных страниц. Инструмент добавляет текстовый слой на каждую страницу. Для экспорта Markdown требуется, чтобы выходные данные OCR сохраняли как можно больше структурной информации: какой текст является заголовком, какой текст является телом, какой текст является частью списка или таблицы. Стандартные механизмы оптического распознавания символов выводят простой текст, при котором теряется вся структурная информация. Заголовок и основной абзац становятся неразличимыми блоками текста, разделенными разрывами строк.
Для достижения наилучших результатов используйте механизм оптического распознавания символов, который поддерживает извлечение текста с учетом макета. Эти механизмы анализируют пространственное расположение текста на странице и могут различать заголовки, основной текст, подписи и сноски на основе размера шрифта, положения и близости к другим элементам. Чем больше структурной информации захватывает механизм OCR, тем чище будет преобразование Markdown. Функция экспорта в Adobe Acrobat Pro включает в себя функцию «Текст с форматированием». вариант, который сохраняет некоторые структурные признаки. Механизм OCR сохраняет метаданные размера и положения шрифта, которые последующие инструменты преобразования могут использовать для определения уровней заголовков и разрывов абзацев.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
Шаг 2. Преобразование распознанного текста в Markdown
Если в PDF-файле есть текстовый слой, преобразование в Markdown может осуществляться несколькими способами. Самый простой — прямой экспорт из PDF-редактора, поддерживающего Markdown в качестве выходного формата. Параметры экспорта WukongPDF включают Markdown в качестве целевого формата, если PDF-файл был обработан с помощью оптического распознавания символов. Выберите Markdown в качестве выходного формата, и инструмент сгенерирует файл .md с распознанным текстом, отформатированным в соответствии с соглашениями Markdown: строки, начинающиеся с более крупных шрифтов, становятся заголовками с префиксом хэша, строки с отступом становятся элементами списка, а обычные абзацы разделяются пустыми строками.
Если прямой экспорт Markdown недоступен, конвейер заключается в следующем: экспортируйте распознанный текст в формат RTF, сохраняющий форматирование, например RTF или HTML, а затем преобразуйте этот промежуточный формат в Markdown с помощью инструмента преобразования. Pandoc, универсальный конвертер документов, хорошо справляется с этим конвейером. Экспортируйте текст из PDF-файла в формате HTML, затем запустите: pandoc input.html -f html -t markdown -o output.md. Pandoc переводит теги заголовков HTML в хеши Markdown, теги списков HTML в маркеры списков Markdown, а теги ссылок HTML в синтаксис ссылок Markdown. Качество вывода зависит от качества экспорта HTML из PDF. Если экспорт PDF создает чистый, хорошо структурированный HTML, Pandoc создает чистый Markdown. Если экспорт создает беспорядочный HTML-код со встроенными стилями и несемантическими тегами, Markdown будет соответственно беспорядочным.
Устранение ошибок OCR в выводе Markdown
Ошибки OCR в распознанном тексте передаются в выходные данные Markdown без изменений. Распространенные ошибки включают в себя перепутанные символы, такие как "cl" признанный как "d," "рн"; признанный как «м,»; и "1"; признан как «l,»; особенно при меньшем размере шрифта или при сканировании низкого качества. Проверка файла Markdown для выявления этих ошибок необходима, если текст будет опубликован или передан другим.
Большинство редакторов кода и редакторов Markdown включают функцию проверки орфографии, которая выделяет нераспознанные слова, что позволяет легко обнаружить ошибки оптического распознавания. Проработайте выделенные слова и исправьте их по сравнению с исходным PDF-файлом. Обратите особое внимание на имена собственные, технические термины и числа, которые с наибольшей вероятностью будут неправильно распознаны, а также нанесут наибольший вред в случае неправильной публикации. Финансовый отчет, в котором OCR признал «123 000 долларов США»; как «128 000 долларов»; содержит существенную ошибку, которую не обнаружит автоматическая проверка правописания, поскольку оба формата являются допустимыми числовыми форматами. Ручная проверка критических значений по исходному документу является единственной надежной защитой.
Сохранение изображений и таблиц при преобразовании Markdown
Markdown обрабатывает изображения, ссылаясь на внешние файлы: . При преобразовании PDF в Markdown изображения в PDF необходимо извлечь и сохранить как отдельные файлы, а ссылки на ссылки вставить в текст Markdown в правильных позициях. PDF Export в Markdown WukongPDF включает в себя извлечение изображений как часть преобразования. Каждое изображение в PDF-файле сохраняется в виде файла PNG или JPEG в папке рядом с файлом Markdown, а текст Markdown содержит соответствующие теги ссылок на изображения.
Таблицы сложнее. В таблицах Markdown используется синтаксис вертикальной и тире, который легко читать людям, но сложно генерировать автоматическим конвертерам из данных таблицы PDF, поскольку PDF-файлы не хранят таблицы в виде структурированных данных. Они хранят символы на позициях. Преобразователю приходится перепроектировать сетку таблицы с учетом позиций символов, что приводит к несовершенным результатам для сложных таблиц с объединенными ячейками, содержимым многострочных ячеек или столбцов с неравной шириной. Простые таблицы с едиными столбцами и содержимым однострочных ячеек обеспечивают надежное преобразование. Сложные таблицы могут потребовать ручной реструктуризации вывода Markdown. Если таблица конвертируется плохо, рассмотрите возможность ее экспорта как отдельного изображения, а не как синтаксис таблицы Markdown. Четко читаемое изображение сложной таблицы более полезно, чем искаженный Markdown, который отображается как смещенные столбцы.
Использование файла Markdown
Полученный файл Markdown открывается в любом текстовом редакторе, приложении для создания заметок, например Obsidian или Notion, генераторе статических сайтов, например Hugo или Jekyll, или редакторе кода, например VS Code. С помощью Markdown вы можете генерировать HTML для веб-сайта, PDF для распространения, DOCX для обработки Word или просто сохранять текст в простом текстовом формате с возможностью поиска и контролем версий, который будет читаться десятилетиями.
Ценность этого процесса наиболее очевидна на примере архивных материалов. Старые отсканированные отчеты, исторические документы, вышедшие из печати публикации — все становится доступным не только для поиска, но и для преобразования. Отсканированный отчет за 2005 год становится файлом Markdown, который можно редактировать в современном редакторе, конвертировать в веб-сайт, цитировать в сообщении в блоге или анализировать программным способом. Формат PDF, который блокировал текст внутри изображения на 20 лет, больше не ограничивает возможности использования контента.
Попробуйте распознавание PDF-файлов
Никакой установки не требуется. Работает прямо в вашем браузере.
