Как преобразовать HTML в обычный текст
Вставьте HTML-текст, выберите нужную обработку переносов, ссылок и скриптов, затем запустите преобразование. Инструмент вернёт обычный текст с удалёнными тегами и декодированными поддерживаемыми сущностями, если они есть во вводе.
Назначение преобразования
HTML-фрагмент трудно читать напрямую: в нём рядом с содержимым находятся теги, служебные блоки и дополнительные атрибуты. Инструмент преобразует переданное текстовое значение в обычный текст, удаляя HTML-подобные теги и сохраняя окружающее текстовое содержимое. Поддерживаемые HTML-сущности также декодируются, поэтому записи для пробела, знаков пунктуации, валюты или авторского права могут появиться в более привычном виде.
Такой способ подходит, когда нужно подготовить копию фрагмента страницы, проверить содержание письма или перенести текст в редактор без разметки. Базовый текст и текст с простой разметкой принимаются успешно. При этом результат следует читать как очищенное представление исходного фрагмента, а не как восстановленную веб-страницу: оформление, структура заголовка и другие свойства HTML не сохраняются в исходном виде.
Перед обработкой проверьте, что исходные данные представлены именно текстом. Для нестандартной, повреждённой или сложной разметки нельзя заранее считать результат таким же, как после разбора полноценным HTML-парсером.
Порядок работы с HTML-текстом
-
Подготовьте текстовое значение с HTML-разметкой. Не передавайте вместо него объект, число или другое нетекстовое значение: поддержка таких типов не подтверждена, и преобразование может завершиться ошибкой.
-
Вставьте содержимое в поле ввода и запустите обработку. Поле необязательно. Если оставить его пустым, операция завершится успешно, а обычный текст на выходе будет пустым.
-
Определите, нужны ли переводы строк между структурными элементами. Сохранение переносов включено по умолчанию. В этом режиме элементы абзаца, блока, заголовка, пункта списка, строки таблицы, цитаты и переноса превращаются в переводы строк. При отключении настройки такое специальное добавление переводов не выполняется, но теги удаляются, а их текстовое содержимое сохраняется.
-
Проверьте обработку ссылок. По умолчанию она включена. Для подходящей ссылки с атрибутом href в двойных кавычках видимый текст сохраняется, а адрес добавляется в квадратных скобках. Сведения об адресе берутся из уже переданного фрагмента; отдельно рассчитывать на проверку или получение содержимого по этому адресу не следует.
-
Если во фрагменте есть скрипты или стили, оставьте их удаление включённым, когда нужно убрать эти блоки вместе с содержимым. Эта настройка включена по умолчанию.
-
Прочитайте результат и оцените его форматирование. Поддерживаемые именованные сущности и десятичные числовые ссылки декодируются. Затем последовательности из трёх и более переводов строк сокращаются до двух, две и более последовательные пробелы заменяются одним, а пробелы в начале и конце удаляются.
Проверка полученного текста
Сначала проверьте, исчезли ли теги, а текст, который они окружали, остался в результате. Это показывает, что фрагмент преобразован в плоское представление, но не означает сохранения исходного оформления. Заголовок, абзац или пункт списка могут быть представлены только текстом и разделителями строк.
При включённой обработке переносов структурные элементы разделяются строками. Если настройка отключена, содержимое тех же элементов останется, однако специальные переводы строк для них добавляться не будут. Поэтому два результата с одним исходным фрагментом могут отличаться расположением строк даже при одинаковом наборе слов.
Ссылку проверяйте отдельно: адрес появляется рядом с видимым текстом только при подходящем href в двойных кавычках и включённой настройке сохранения ссылок. Скрипты и стили при активном удалении не должны попадать в результат вместе со своим содержимым. Наконец, учитывайте нормализацию: несколько пустых строк и повторяющиеся пробелы сокращаются, поэтому посимвольное совпадение с исходным форматированием не ожидается.
Если после обработки часть сложной конструкции выглядит неожиданно, сравните результат с исходным текстом и проверьте настройки. Инструмент предназначен для получения читаемого текста, а не для редактирования HTML или восстановления его визуальной структуры.
Практический пример
Вы готовите текст новости для редактора и хотите убрать HTML-разметку, сохранив читаемое содержание исходного фрагмента.
Вставьте фрагмент
Обновление готово
и выполните преобразование со стандартной обработкой переносов строк и удалением скриптов и стилей, если они присутствуют в настройках по умолчанию. Затем сравните строки результата с исходным содержимым и убедитесь, что HTML-теги не отображаются.На выходе ожидается обычный текст без тегов: «Новости» и «Обновление готово» будут разделены переводом строки, а поддерживаемая сущность пробела будет декодирована.
Ограничения
- Поддержка нетекстовых значений не подтверждена, а нестандартная или повреждённая разметка не описана как разбор полноценным HTML-парсером.
Частые ошибки
- Преобразование может завершиться ошибкой, если вместо текстового значения передать другой тип. Преобразуйте исходные данные в текст и повторите обработку.
Частые вопросы
Что произойдёт при пустом вводе?
Пустое поле допустимо: ввод необязателен, поэтому операция завершится успешно и вернёт пустой обычный текст. Это отличается от случая, когда передано нетекстовое значение, для которого поддержка не подтверждена.
Сохраняется ли адрес ссылки?
Ссылка сохраняется в определённом виде только при включённой обработке ссылок и подходящем атрибуте href в двойных кавычках. Тогда после видимого текста добавляется адрес в квадратных скобках; сведения берутся из введённого фрагмента.
Удаляются ли скрипты и стили?
При включённой настройке удаления скриптов и стилей из результата исчезают соответствующие блоки вместе с их содержимым. Если настройку отключить, это специальное удаление не применяется, поэтому результат нужно проверить по исходному фрагменту.