Вы редактируете номер социального страхования из PDF-файла с помощью инструмента редактирования вашего PDF-редактора. Вы видите появление черного ящика, сохраните файл и отправьте его. Получатель преобразует PDF-файл в Word для редактирования и обнаруживает, что номер социального страхования полностью виден в преобразованном документе, как если бы редактирование никогда не происходило. Это не ошибка. Это ожидаемое поведение большинства инструментов редактирования, когда документ подвергается преобразованию формата, и это приводит к реальным утечкам данных.
В 2024 году Управление комиссара по информации Великобритании сообщило, что неправильное редактирование PDF-файлов было третьей по распространенности причиной утечки данных, связанных с правительственными документами (ICO, «Тенденции инцидентов в области безопасности данных», 2024). Наиболее частой основной причиной была не неспособность отредактировать, а неспособность проверить, что редактирование выдержало полный жизненный цикл документа, включая любые преобразования формата, которые он мог пройти в дальнейшем.

Как правильное редактирование PDF-файлов работает на уровне данных
Правильное PDF Redaction принципиально отличается от рисования черного ящика поверх текста. Когда вы используете настоящий инструмент редактирования, происходят две вещи: видимый текст покрывается черным прямоугольником, а нижележащее текстовое содержимое удаляется из текстового слоя PDF-файла. Сами символы удаляются из потока данных файла. Приложению чтения нечего отображать под черным ящиком, потому что там ничего нет.
Когда вы рисуете черный прямоугольник поверх текста с помощью инструментов аннотаций и называете его отредактированным, вы делаете то, что специалисты по безопасности называют косметическим редактированием. Текст все еще находится на уровне данных PDF, полностью неповрежденный и пригодный для извлечения. Любой может выделить текст, скопировать его, вставить в другое место и прочитать каждое слово под черным ящиком. Конвертируйте PDF-файл в любой другой формат, и инструмент преобразования будет читать основной текст, а не визуальное наложение. Редакция исчезает, потому что она никогда не была реальной.
Различие между реальным и косметическим редактированием настолько важно, что правительственные учреждения и юридические фирмы теперь включают его в обязательную подготовку сотрудников, работающих с конфиденциальными документами. Одно-единственное неправильно отредактированное судебное заявление, ответ по закону о свободе информации или заявление в регулирующие органы могут привести к раскрытию персональных данных в огромных масштабах, а репутационные и юридические последствия намного перевешивают несколько дополнительных секунд, которые требуются для использования надлежащих инструментов редактирования.
Особенно опасный сценарий возникает, когда документ проходит через несколько рук. Человек А применяет правильное редактирование, Человек Б открывает файл и видит черные ящики, предполагает, что редактирование завершено, и пересылает его. Но если человек А использовал инструмент косметического редактирования, не осознавая этого, уверенность человека Б в черных ящиках неуместна. Проблема цепочки доверия заключается в том, почему организациям следует стандартизировать единый проверенный инструмент редактирования и обучить всех сотрудников правильному его использованию.
Особенно коварный вариант косметической редактирования — редактирование «белого ящика». Некоторые пользователи рисуют белый прямоугольник поверх текста, полагая, что белый цвет на белом делает текст невидимым. Это не удается, поскольку при выборе текста или преобразовании документа отображается текст под ним, а программа чтения с экрана читает его вслух независимо от визуального цвета. Редактирование «белого ящика» — это вообще не редактирование.
Попробуйте Редактировать PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
Что происходит с редактированием во время преобразования формата
При преобразовании формата создается новый документ путем чтения исходного PDF-файла и записи его содержимого в другой формат. Инструмент преобразования анализирует структуру PDF и извлекает текст, изображения и информацию о макете. Для преобразования формата PDF критическим вопросом является то, какое текстовое содержимое инструмент преобразования находит в отредактированных областях.
Если редактирование было подлинным и текст был удален из потока содержимого PDF-файла, инструмент преобразования ничего не найдет в этих областях и ничего не запишет. В выходном документе нет текста, в котором были внесены изменения. Если редактирование было косметическим, то есть наложением черного ящика с текстом под ним, инструмент преобразования находит текст и корректно записывает его в выходной документ. Черный ящик — это визуальный элемент, а не элемент данных, и большинство инструментов преобразования игнорируют визуальные наложения при извлечении текстового содержимого.
WukongPDF предоставляет инструмент редактирования, который удаляет контент на уровне данных, а не только на визуальном уровне. Когда вы применяете редактирование с помощью правильно реализованного инструмента PDF Security, который работает с текстовым потоком документа, удаленная информация не может появиться снова посредством преобразования формата, поскольку данные просто больше не существуют в файле.
Некоторые конвертеры PDF в Word специально пытаются сохранить аннотации, включая поля комментариев, выделение и нарисованные фигуры. Если в качестве аннотации было применено косметическое редактирование, конвертер может точно воспроизвести черный прямоугольник как фигуру Word. Но поскольку основной текст никогда не удалялся, в документе Word будет отображаться как черный прямоугольник, так и текст под ним, который можно выбирать, копировать и полностью видеть всем, кто перемещает или удаляет прямоугольник.
Преобразование формата — не единственный путь утечки отредактированного контента. Просто выделив весь текст в PDF-файле с косметическими изменениями и вставив его в текстовый редактор, вы увидите отредактированное содержимое. При поиске в PDF-файле отредактированного термина с помощью функции «Найти» он будет найден, даже если он визуально скрыт. Средства чтения с экрана и специальные возможности читают базовый текстовый слой. Все эти альтернативные пути извлечения обходят визуальное наложение, на котором основано косметическое редактирование.
Редактирование на основе OCR и проблема повторного появления текста
Отсканированные PDF-файлы усложняют редактирование. Отсканированный документ — это, по сути, фотография листа бумаги. Текст хранится не в виде символов, а в виде пикселей изображения. Стандартные инструменты редактирования, которые работают с текстовыми слоями, не могут удалить текст из изображения, поэтому вместо этого они рисуют черные прямоугольники поверх изображения. Это косметическая правка по необходимости, а не по собственному желанию.
Чтобы правильно отредактировать отсканированный PDF-файл, вам понадобится инструмент, который изменяет фактические данные изображения, заменяя значения пикселей в отредактированной области сплошным черным цветом. После изменения изображения вы запускаете распознавание текста в документе, чтобы создать текстовый слой только для неотредактированного содержимого. Если вы выполняете распознавание текста перед редактированием, текст OCR для отредактированного содержимого находится в текстовом слое и будет извлечен любым инструментом преобразования формата.
Распространенная ошибка при редактировании отсканированных PDF-файлов заключается в том, что сначала OCR делает документ доступным для поиска, затем применяет пометки редактирования, а затем повторно сохраняет. Эта последовательность оставляет текстовый слой, созданный с помощью OCR, нетронутым под пометками редактирования. Любое последующее преобразование или извлечение текста восстановит отредактированный текст из слоя OCR. Правильная последовательность: сначала отредактируйте пиксели изображения, затем распознавайте очищенное изображение. Такое расположение гарантирует, что текстовый слой никогда не будет содержать отредактированное содержимое.
Как проверить, что редактирование сохраняется после преобразования
Единственный способ убедиться, что ваше редактирование является постоянным, — это протестировать его. После редактирования PDF-файла преобразуйте его в обычный текстовый файл и найдите любой отредактированный контент. Если текстовый файл содержит отредактированные данные, ваше редактирование не вступило в силу. Более быстрая проверка – выделить весь текст в PDF-файле после редактирования и вставить его в текстовый редактор. Если буфер вставки содержит отредактированный текст, редактирование было косметическим.
Для отсканированных PDF-файлов преобразуйте страницу в формат изображения, например PNG, и визуально осмотрите отредактированные области при большом увеличении. Если вы видите какие-либо следы исходного контента через черное наложение, особенно на экранах с высокой яркостью или при печати, редактирование недостаточно. Иногда одного пикселя видимого контента может быть достаточно, чтобы восстановить исходную информацию.
Создайте контрольный список проверки, включающий каждый из этих шагов, и сделайте его частью процесса выпуска документов. Несколько минут, необходимые для проверки редактирования, ничтожны по сравнению с часами, днями или месяцами исправления, которые следуют за утечкой данных, вызванной неудачным редактированием. Этот шаг не является обязательным для любой организации, которая обрабатывает персональные данные или конфиденциальную информацию.
Редактирование метаданных: слой, который часто упускают из виду
Даже если видимый текст правильно отредактирован, PDF-файл все равно может пропускать конфиденциальную информацию через свои метаданные. Метаданные PDF включают название документа, имя автора, дату создания, историю изменений, а иногда и имена людей, которые просмотрели или подписали документ. Инструменты преобразования формата обычно сохраняют метаданные, когда это возможно, поэтому отредактированные метаданные сохраняются при преобразовании так же надежно, как и предполагаемое содержимое документа.
Исследование, проведенное в 2025 году Институтом SANS, проанализировало 500 общедоступных отредактированных PDF-файлов с правительственных веб-сайтов и обнаружило, что 12% из них содержали конфиденциальную информацию в полях метаданных, которые не были очищены (Институт SANS, «Скрытые данные в публично выпущенных документах», 2025). В некоторых случаях отредактированная информация в тексте документа может иметь перекрестные ссылки и подтверждаться с использованием неотредактированных метаданных. Очистка метаданных перед выпуском так же важна, как и редактирование видимого контента.
Тот же процесс проверки следует применять к любому документу, подвергающемуся преобразованию, независимо от того, как выполняется преобразование. Если ваш рабочий процесс включает этап автоматического преобразования, встройте в эту автоматизацию проверку редактирования, а не полагайтесь на выборочные проверки вручную. Сценарий, который ищет в преобразованном выводе известные отредактированные термины, может обнаружить ошибки, которые могут быть пропущены при проверке вручную.
Включение проверки редактирования в стандартный контрольный список проверки документов гарантирует, что этот важный шаг безопасности никогда не будет пропущен.
Попробуйте Редактировать PDF
Никакой установки не требуется. Работает прямо в вашем браузере.
