Результат
Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.
Факты и границы применимости
| Слово | Последовательность непробельных символов между пробелами/переносами строк |
|---|---|
| Уникальность | Без учёта регистра по умолчанию — «Кот» и «кот» считаются одним словом |
| Доля повторов | (всего слов − уникальных слов) ÷ всего слов × 100% |
| Пунктуация | Остаётся приклеенной к слову — «кот.» и «кот» считаются разными словами |
Когда этот метод вводит в заблуждение
- Знаки препинания, стоящие вплотную к слову («кот.», «кот,», «(кот»), не отделяются — такое слово будет посчитано как отдельное от «кот» без знаков, что может завысить число уникальных слов на пунктуационно насыщенном тексте.
- Словоформы одного слова («кот», «кота», «коту») считаются разными словами — счётчик не делает морфологический анализ и не сводит их к одной лемме.
- Доля повторов — это грубая метрика лексического разнообразия, а не полноценный анализ переспама: она не учитывает, что часть повторов (союзы, предлоги) естественна для любого языка.
- Регистр по умолчанию не учитывается («Текст» и «текст» — одно слово); если для вашей задачи регистр важен (например, различать имена собственные), включите соответствующую опцию.
Как это считается
Текст разбивается на слова по пробелам и переносам строк — получившиеся непустые фрагменты и есть слова.
Если регистр не учитывается, все слова приводятся к нижнему регистру перед сравнением.
Уникальные слова считаются через множество: каждое слово добавляется в набор, размер набора — это количество уникальных слов.
Доля повторов получается как (общее число слов минус уникальных) делённое на общее число слов, умноженное на 100 — чем выше число, тем больше в тексте повторяющихся слов.
Вопросы и ответы
Зачем нужна доля повторов?
Это быстрая оценка лексического разнообразия текста — например, чтобы заметить, что одно и то же ключевое слово повторяется слишком часто для естественного текста.
«Кот» и «коту» считаются одним словом?
Нет, счётчик сравнивает слова буквально, без учёта грамматических форм — это разные слова, даже если они однокоренные.
Точка в конце слова влияет на подсчёт?
Да — «кот.» и «кот» будут посчитаны как два разных слова, потому что знак препинания остаётся частью слова.
Мой текст куда-то отправляется?
Нет, весь подсчёт выполняется в вашем браузере.