Как удалить заданный текст из PDF
Передайте PDF в Base64 и непустую фразу, чтобы удалить совпадения из текста его страниц. При успехе результат содержит PDF в Base64, число обработанных страниц и количество совпадений во входном документе, найденных по этой строке.
Для чего подходит удаление фразы из PDF
Redact PDF помогает убрать выбранную фразу из текстового содержимого PDF. Инструмент ищет заданную строку на страницах переданного документа и применяет редактирование к областям, где найдены совпадения. Такой способ подходит для удаления из счёта, формы или другого PDF конкретного реквизита, номера либо короткого фрагмента.
Для запуска подготовьте два значения: PDF в формате Base64 и непустой текст для поиска. После успешной обработки результат содержит PDF в Base64, из которого совпавшее содержимое удалено применённым редактированием. Поиск выполняется по тексту страницы, доступному для извлечения, поэтому заранее выясните, представлен ли нужный фрагмент текстовым слоем, а не только изображением.
Перед началом определите точное написание искомого текста. Различия в пробелах, знаках препинания или представлении символов могут повлиять на число совпадений, поэтому полезно сверить строку с текстом, извлечённым из исходного документа.
Пошаговая обработка документа
-
Подготовьте входной файл. Представьте байты PDF в виде строки Base64. После декодирования содержимое должно начинаться с подписи PDF. Отсутствующий файл, повреждённая строка Base64 или данные другого формата приводят к ошибке, поэтому проверьте исходное кодирование до передачи значения.
-
Введите текст поиска. Укажите непустую фразу, которую нужно найти на страницах. Пустое значение прекращает операцию до обработки документа. Сохраните значимые пробелы, двоеточия, дефисы и другие знаки, если они входят в отображаемый фрагмент.
-
Настройте замену. Если отдельное значение не задано, используется стандартное закрашивание области. Когда на месте редактирования нужен текст, передайте замену, составленную из ASCII-символов. Не-ASCII значение не передаётся в операцию редактирования как текст аннотации, поэтому для этой настройки применяйте только ASCII-вариант.
-
Запустите обработку. Инструмент просматривает текст каждой страницы, находит совпавшие области и применяет к ним редактирование. Дополнительная обработка изображений не входит в этот поиск: надпись, доступная лишь внутри изображения или требующая OCR, не будет найдена таким способом.
-
Разберите результат. При успехе получите PDF в Base64, декодируйте его и откройте как отдельный документ. Сопоставьте число обработанных страниц и найденных совпадений со своей задачей, затем просмотрите страницы, где ожидалось редактирование. Для дополнительного контроля извлеките текст из результата и найдите исходную фразу повторно.
Что означает ответ инструмента
Успешный ответ включает три полезные части: обработанный PDF в Base64, число просмотренных страниц и количество обнаруженных совпадений. Количество совпадений показывает, сколько фрагментов соответствовало переданной строке, но его следует сопоставлять с ожидаемым числом мест в документе, а не рассматривать отдельно от проверки файла.
Нулевой счётчик не доказывает отсутствие похожих сведений. Причиной может быть другое написание фразы, отличие в пробелах или расположение надписи в изображении, которое не относится к тексту страницы для этого поиска. Если число отличается от ожидания, сравните строку поиска с извлечённым текстом исходного PDF и проверьте представление нужной области.
После применения редактирования совпавшее содержимое удаляется из итогового PDF. В проверенном сценарии с образцом документа найденная строка отсутствовала как в извлечённом тексте, так и в байтах полученного файла. Для собственного документа дополнительно осмотрите визуальное отображение страниц, чтобы убедиться, что закрыта нужная область.
Практический пример
В PDF со счётом нужно удалить фразу «Серия: AB-2048», которая доступна как текст страницы документа, а не как часть изображения.
Передайте PDF со счётом в Base64, задайте «Серия: AB-2048» как искомую фразу и используйте стандартное значение замены. Декодируйте возвращённый PDF и проверьте страницу счёта и извлечённый текст на наличие исходной строки.
Успешный ответ содержит PDF в Base64, число обработанных страниц и количество найденных совпадений; значения определяются переданным документом и строкой поиска.
Ограничения
- Поиск ограничен доступным текстом страниц и не охватывает фрагменты только в изображениях или требующие OCR; не-ASCII замена не передаётся как текст аннотации редактирования.
Частые ошибки
- Причина: вместо корректного Base64 передана исходная строка, повреждённое значение или содержимое не-PDF. Исправление: заново закодируйте байты PDF и проверьте PDF-подпись после декодирования.
Частые вопросы
Удаляет ли инструмент текст, который находится на изображении в PDF?
Это возможно при условии, что надпись представлена доступным для поиска текстом страницы. Фрагмент, находящийся только в изображении или требующий OCR, такой поиск не охватывает, поэтому он может остаться в документе.
Можно ли запустить обработку без текста для поиска?
Нет, пустое значение не подходит: операция завершается до обработки PDF. Укажите непустую строку, соответствующую фрагменту в текстовом слое страницы, чтобы поиск мог начаться корректно и дал проверяемый счётчик совпадений.
Что используется на месте удалённой фразы?
По умолчанию область получает стандартное закрашивание. Для другого варианта задайте ASCII-текст; значение с не-ASCII символами не передаётся в PDF-операцию как текст аннотации замены, поэтому его отображение не следует ожидать.