Как удалить повторяющиеся строки из текста
Вставьте список, где каждая запись находится на отдельной строке, выберите правила сравнения и запустите обработку. Инструмент оставит первое появление каждой различающейся строки и покажет число сохранённых и удалённых строк.
Когда использовать удаление повторяющихся строк
Повторяющиеся строки появляются в списках адресов, тегов, идентификаторов, названий файлов и других данных, где каждая запись находится на отдельной строке. Remove Duplicate Lines помогает очистить такой текст, оставив по одному экземпляру каждой различающейся строки. Инструмент сравнивает именно строки, разделённые переводами строки, поэтому он подходит для построчных списков, а не для поиска отдельных повторов внутри одной строки.
Перед обработкой решите, что считать одинаковой записью. В стандартном режиме различия регистра букв не учитываются, а пробелы в начале и конце строки удаляются перед сравнением и формированием результата. Это удобно, когда одна запись случайно оформлена с отступом или завершающим пробелом. Если регистр имеет смысл, например в кодах или именах, включите чувствительное к регистру сравнение. При необходимости можно также отключить удаление пробелов по краям.
По умолчанию порядок сохраняется: строки в результате идут в той последовательности, в какой впервые встретились. Это позволяет очистить список без перестановки записей. Если порядок не важен, его можно отключить, чтобы оставшиеся строки были отсортированы перед сборкой результата.
Как удалить дублирующиеся строки
-
Подготовьте исходный список. Поместите каждую запись на отдельную строку и скопируйте текст в поле ввода. Например, адреса, названия или идентификаторы должны быть разделены переводами строки, а не только пробелами или запятыми. Поле можно оставить пустым, если нужно проверить поведение без исходного текста: пустой или пропущенный ввод завершается успешно и не даёт уникальных либо удалённых строк.
-
Проверьте режим сравнения. Если
Каталогикаталогдолжны считаться одной записью, оставьте сравнение без учёта регистра, установленное по умолчанию. Если эти варианты должны остаться разными, включите чувствительное к регистру сравнение. Такой выбор влияет на то, какие строки будут признаны совпадающими. -
Настройте обработку пробелов. По умолчанию пробелы и другие пробельные символы в начале и конце каждой строки убираются до сравнения и подготовки результата. Поэтому строки
отчётиотчётпри стандартной настройке рассматриваются после удаления этих внешних пробелов. Если отступы или конечные пробелы являются частью данных, отключите обрезку. Тогда текст строки сравнивается и сохраняется без этого шага. -
Определите порядок результата. Оставьте сохранение порядка включённым, если список должен начинаться с первой встретившейся записи и далее следовать исходной последовательности. Отключите эту настройку, если нужна сортировка оставшихся строк перед формированием результата. Выбор не меняет правило удаления повторов, но влияет на расположение строк в готовом тексте.
-
Запустите обработку и просмотрите полученный текст. В результате остаётся первое появление каждой различающейся строки, а последующие повторы исключаются. Скопируйте очищенный текст в нужное место и отдельно проверьте строки, для которых важны регистр, пробелы или исходная последовательность.
-
Сверьте показатели обработки. Для непустого обработанного текста инструмент сообщает число оставшихся уникальных строк и число удалённых строк. Эти значения помогают понять масштаб очистки: удалённые строки показывают, сколько повторных появлений было исключено, а уникальные отражают число строк, сохранённых в результате.
Как читать результат и учитывать границы
Главный результат состоит из построчного текста без повторных появлений, где для каждой различающейся строки сохраняется её первое появление. При стандартных настройках сравнение не различает регистр, внешние пробелы удаляются, а порядок первых появлений сохраняется. Поэтому итог зависит не только от самого списка, но и от выбранных параметров.
Если включить чувствительность к регистру, варианты RU и ru могут остаться отдельными строками. Если отключить обрезку пробелов, визуально похожие записи с разными пробелами по краям могут сравниваться как разные. Если выключить сохранение порядка, оставшиеся строки будут отсортированы, поэтому результат уже не отражает последовательность первых появлений.
Показатель уникальных строк означает количество записей, оставшихся после обработки, а показатель удалённых строк показывает количество исключённых повторов для непустого текста. Пустой или пропущенный ввод завершается без уникальных и удалённых строк. Если нужно убрать повторы слов внутри абзаца, части строки или целых абзацев, сначала преобразуйте данные в список, где каждая запись отделена переводом строки: заявленная обработка относится к строкам, а не к другим типам фрагментов.
Перед использованием результата проверьте чувствительные к регистру значения, пробелы и порядок. Не смешивайте в одном списке записи, которые выглядят одинаково, но по смыслу различаются: при стандартном сравнении регистр не создаёт отдельного варианта. Для важных данных полезно сохранить исходную копию отдельно от очищенного текста, чтобы можно было сопоставить изменения с исходным списком.
Практический пример
Вы очищаете список адресов электронной почты перед переносом его в другой построчный список.
Вставьте четыре адреса на отдельных строках, оставьте сравнение без учёта регистра и сохранение порядка, затем запустите обработку. Перед проверкой результата учитывайте стандартное удаление пробелов по краям.
В результате отображается текст с одним первым появлением каждой различающейся строки, а также количество уникальных и удалённых строк.
Ограничения
- Обработка предназначена для текста, разделённого переводами строки. Эти сведения не описывают удаление повторов слов, частей строки или абзацев, если они не представлены отдельными строками.
Частые ошибки
- Причина: список вставлен одной строкой или пробелы по краям приняты за незначимые. Исправление: разделите записи переводами строки и отключите обрезку пробелов, если эти пробелы входят в данные.
Частые вопросы
Можно ли убрать повторы слов внутри одной строки?
Да, если каждая запись отделена переводом строки. Обработка относится к различающимся строкам, а не к отдельным словам или фрагментам внутри строки.
Как оставить строки, отличающиеся только регистром?
По умолчанию регистр не учитывается. Включите чувствительное к регистру сравнение, если варианты с разными заглавными и строчными буквами должны считаться разными.
Что произойдёт с пробелами в начале и конце строк?
По умолчанию внешние пробелы удаляются перед сравнением и сборкой результата. Отключите обрезку, если пробелы в начале или конце являются частью записи.