Как извлечь ссылки HTTP и HTTPS из текста
Передайте текст с префиксом `http://` или `https://`, выберите режим повторов и запустите обработку. По умолчанию одинаковые совпадения объединяются, а отключение настройки сохраняет каждое вхождение.
Передайте текст с префиксом http:// или https://, выберите режим повторов и запустите обработку. По умолчанию одинаковые совпадения объединяются, а отключение настройки сохраняет каждое вхождение.
Что проверяет обработка текста
Инструмент Extract URLs помогает найти в переданном тексте фрагменты, которые начинаются с префикса http:// или https://, и представить их списком. Это удобно, когда адреса уже собраны в заметке, письме, отчёте или другом текстовом материале, а вам нужно быстро выделить их для дальнейшей работы.
Поиск относится к содержимому, которое вы передаёте в поле текста. Учитываются префиксы именно в нижнем регистре. Доменное имя без схемы, а также вариант с другой схемой не следует считать поддерживаемым форматом. После подходящего префикса совпадение продолжается до пробела либо символа, который относится к поддерживаемым разделителям, поэтому соседняя пунктуация может влиять на границу найденного фрагмента.
Настройка удаления повторов включена по умолчанию. В таком режиме одинаковые значения объединяются, а для каждого из них сохраняется положение первого появления. Если нужно увидеть каждое вхождение, настройку можно отключить перед запуском.
Пошаговая настройка и запуск
-
Подготовьте исходный текст. Вставьте адресные фрагменты вместе с префиксом
http://илиhttps://и проверьте, что буквы схемы записаны в нижнем регистре. Если в материале указано только доменное имя, не рассчитывайте на его извлечение. Сохраните исходный порядок строк, если хотите сопоставить результат с местами появления. -
Поместите материал в поле текста. Поле необязательно, поэтому его можно оставить пустым, если вы проверяете результат для отсутствующего ввода. Перед обработкой найдите настройку, отвечающую за сохранение только различных совпадений. Оставьте её включённой для перечня без повторов или отключите для последовательности всех обнаружений.
-
Запустите базовую обработку после выбора нужного режима. Для обычного текста она завершается успешно. При включённой настройке одинаковые строки сводятся к одному элементу. При отключённой настройке повторное появление той же строки остаётся самостоятельной позицией.
-
Откройте список найденных значений и общее количество. В режиме без повторов сравнивайте порядок с первым появлением каждого различающегося значения. В режиме с повторами воспринимайте список как последовательность обнаружений.
-
Сверьте итог с исходным текстом, чтобы убедиться в полноте извлечения.
Как понимать список и количество
Результат показывает фрагменты, найденные в переданном тексте, а не подтверждает существование соответствующих страниц. Успешное завершение означает, что базовая обработка выполнена; оно не сообщает о доступности ресурса или правильности его содержимого. Поэтому список стоит сопоставлять с исходным материалом и не использовать как заключение о состоянии найденных адресов.
Количество нужно читать с учётом выбранного режима. При удалении повторов оно отражает число различных строк, причём каждая строка занимает место своего первого появления. При сохранении повторов в число входят все обнаруженные вхождения, включая одинаковые значения. Один и тот же итоговый текст поэтому может дать разные количества при разных настройках.
Пустое поле приводит к успешному результату без найденных ссылок, а общее количество равно нулю. Нулевой итог для непустого материала требует отдельной проверки: возможно, в нём использовано доменное имя без схемы, другая схема, заглавные буквы в префиксе или неподходящая граница совпадения.
При сравнении сначала зафиксируйте исходный текст и режим повторов, затем проверьте каждую позицию по порядку. Так проще отличить список различных значений от списка всех вхождений.
Практический пример
Вам нужно составить перечень различных адресных фрагментов из короткого текста, где один фрагмент встречается дважды, а затем увидеть оба вхождения отдельно.
Вставьте две строки с одним и тем же адресным фрагментом, начинающимся с префикса HTTPS, оставьте удаление повторов включённым и запустите обработку. Затем отключите настройку и повторите действие с тем же текстом, чтобы сравнить форму результата.
При включённом удалении повторов список содержит одно первое вхождение, а общее количество равно одному; после отключения настройки список содержит два вхождения, и количество равно двум.
Ограничения
- Результат относится к поиску поддерживаемых фрагментов в переданном тексте, а не к проверке страниц; домены без схемы и другие схемы не подтверждены как извлекаемые.
Частые ошибки
- Причина: префикс записан с заглавными буквами, отсутствует схема или соседний символ задаёт неподходящую границу. Исправление: проверьте исходную строку и повторите обработку после корректировки записи.
Частые вопросы
Извлекаются ли ссылки из обычного текста?
При условии, что фрагмент начинается с префикса в нижнем регистре и его границы соответствуют области поиска, он может попасть в результат. Домен без схемы этим описанием не подтверждён.
Можно ли сохранить повторяющиеся ссылки?
Если удаление повторов включено, одинаковые значения объединяются. После отключения этой настройки повторные вхождения остаются отдельными элементами, поэтому итоговое количество может вырасти.
Что произойдёт при пустом поле текста?
При пустом поле обработка завершается успешно, список остаётся без найденных ссылок, а общее количество получает значение ноль. Это предусмотренный результат пустого ввода.