Как извлечь числа из текста и посчитать сумму и среднее
Вставьте текст, выберите обработку повторов и режим десятичных совпадений, затем запустите извлечение. В результате появятся найденные текстовые фрагменты, их количество, сумма и среднее арифметическое.
Для чего нужен извлекатель чисел из текста
Инструмент помогает найти в обычном тексте фрагменты, похожие на числа, а затем получить их количество, сумму и среднее арифметическое. Это удобно, когда числовые значения находятся среди слов и их нужно быстро собрать для первичной проверки или небольшого расчёта.
Текст можно не вводить: поле считается необязательным. Для пустого ввода результат будет успешным, но список найденных значений останется пустым, а статистика примет нулевые значения. Поэтому инструмент подходит и для проверки того, как система ведёт себя без исходных данных.
Перед обработкой выберите подходящий режим для повторяющихся совпадений и десятичной точки. Эти настройки меняют состав найденных текстовых фрагментов, а значит, могут повлиять и на последующий расчёт.
Как извлечь числа и получить статистику
-
Подготовьте исходный текст. Вставьте в поле предложение, список, таблицу в виде обычного текста или другой фрагмент, из которого нужно выделить числовые записи. Если текст отсутствует, оставьте поле пустым и перейдите к обработке.
-
Определите, нужно ли сохранять повторы. По умолчанию повторяющиеся найденные текстовые фрагменты не удаляются. Если требуется оставить только первое появление каждого отличающегося фрагмента, включите настройку удаления повторов. Она сравнивает именно извлечённые текстовые токены и сохраняет первое вхождение каждого различающегося токена.
-
Проверьте режим десятичных совпадений. По умолчанию он включён. В этом режиме подходящая запись может содержать необязательный знак минус, одну или несколько цифр и необязательную точку с нулём или большим количеством цифр после неё. При выключенном режиме точка не участвует в совпадении: допускаются необязательный минус и одна или несколько цифр.
-
Запустите обработку выбранного текста с заданными настройками. Не меняйте режим десятичных совпадений после запуска, если хотите сопоставить результаты двух проверок: изменение режима может изменить сам список извлечённых фрагментов.
-
Просмотрите выданный результат. Сначала проверьте список текстовых совпадений, затем их количество, сумму и среднее арифметическое. Если список не соответствует задаче, вернитесь к исходному тексту и настройкам, а не пытайтесь трактовать статистику отдельно от найденных фрагментов.
Как читать результат и понимать ограничения
Список совпадений показывает текстовые фрагменты, которые прошли выбранное правило распознавания. Это не разбор смысла предложения: инструмент не определяет, обозначает ли запись цену, дату, номер заказа, процент или другой объект. Например, цифры внутри слова могут быть найдены как часть подходящего фрагмента, если окружающий текст не мешает простому шаблону.
Количество отражает число элементов в итоговом списке. При включённом удалении повторов оно может быть меньше, чем при стандартной обработке, потому что одинаковый текстовый токен сохраняется только при первом появлении. Сумма и среднее рассчитываются по извлечённым совпадениям после преобразования их в числовые значения. Среднее равно нулю, когда совпадений нет.
Обратите внимание на точку. Включённый режим допускает записи вроде -12.5, а выключенный режим рассчитан на целые записи вроде -12. Десятичная запятая этим правилом не названа, поэтому не следует автоматически считать запись с запятой десятичным числом. Также не стоит воспринимать найденное значение как гарантированно полное или семантически правильное представление исходного текста.
Пустой или пропущенный ввод обрабатывается успешно: извлечённых значений нет, а статистика содержит нулевые показатели. Для непустого текста отсутствие совпадений имеет тот же смысл для среднего, но причину нужно искать в содержимом или выбранном режиме сопоставления. Сопоставляйте список и статистику: так проще заметить лишний фрагмент, пропущенную точку или влияние удаления повторов.
Практический пример
Вы проверяете короткую товарную заметку, где одно десятичное значение повторяется, а другое число содержит знак минус.
Вставьте этот текст, включите удаление повторов и оставьте режим десятичных совпадений включённым: «Товар A: 12.5 кг; товар B: 12.5 кг; скидка: -2». Запустите обработку и сопоставьте список совпадений со статистикой.
После обработки результат содержит список найденных текстовых совпадений, их количество, сумму и среднее арифметическое. При включённом удалении повторов одинаковый токен учитывается по первому появлению.
Ограничения
- Извлечение основано на простом шаблоне: необязательный минус, цифры и, в соответствующем режиме, точка с цифрами после неё. Инструмент не определяет смысл записи и не обещает распознать произвольные форматы чисел.
Частые ошибки
- Причина: десятичный режим выключен, хотя в исходных данных используются записи с точкой. Действие: включите режим десятичных совпадений и снова проверьте список, сумму и среднее.
Частые вопросы
Можно ли извлечь десятичные числа из текста?
Да, но результат зависит от режима десятичных совпадений. При включённом режиме запись может содержать точку и цифры после неё, а при выключенном сопоставляются записи без точки.
Что произойдёт с одинаковыми числами?
При включённой настройке удаления повторов в итоговом списке остаётся первое появление каждого отличающегося текстового токена. По умолчанию повторы не удаляются.
Что будет без исходного текста или без найденных совпадений?
Если ввод пустой или отсутствует, обработка всё равно завершается успешно: список будет пустым, а статистика нулевой. Для непустого текста среднее также равно нулю, когда совпадений не найдено.