Результат
У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.
Факты и границы применимости
| Метод | Индекс Жаккара по наборам слов: общие слова, делённые на все различные слова обоих текстов |
|---|---|
| Токенизация | Словом считается последовательность непробельных символов, разбитая по пробелам, табуляциям и переносам строк |
| Регистр | Оба текста приводятся к нижнему регистру перед сравнением, поэтому «Рост» и «рост» считаются одним словом |
| Повторы | Каждое слово учитывается один раз на текст — повтор слова не меняет результат |
| Порядок слов | Полностью игнорируется — важно только то, какие слова встречаются, а не их последовательность |
| Диапазон оценки | От 0% при отсутствии общих слов до 100% при полностью совпадающих наборах слов |
Когда этот метод вводит в заблуждение
- Это схожесть по НАБОРУ слов, а не по фразам или предложениям: два текста с одинаковыми словами в совершенно разном порядке получат 100%, даже если их смысл различается. Это реальное ограничение метода, а не ошибка.
- Пунктуация, прилипшая к слову, входит в токен: «рост,» и «рост» считаются двумя разными словами, если вы не уберёте пунктуацию перед вставкой текста.
- Оценка не учитывает частоту или значимость слов — текст, в котором одно слово повторяется сто раз, сравнивается точно так же, как если бы это слово встретилось один раз, потому что повторы схлопываются в одну запись набора.
- На очень коротких текстах оценка может резко скакнуть к 0% или 100% из-за разницы всего в одно слово, поскольку размеры объединения и пересечения малы — на текстах длиной с предложение или абзац оценка гораздо стабильнее и осмысленнее.
Как это считается
Оба текста приводятся к нижнему регистру и разбиваются на слова по любой последовательности пробельных символов, затем список слов каждого текста превращается в набор уникальных слов — повторяющиеся слова внутри одного текста схлопываются в одну запись.
«Общие слова» — это пересечение двух наборов: слова, встречающиеся и в тексте A, и в тексте B, независимо от того, сколько раз и где.
«Слова только в A» и «слова только в B» — это слова, присутствующие в одном наборе, но отсутствующие в другом; вместе с общими словами они составляют объединение словарей обоих текстов.
Процент схожести — это индекс Жаккара: количество общих слов, делённое на общее число различных слов в обоих текстах, показывается в процентах с одним знаком после запятой.
Вопросы и ответы
Почему два текста с одинаковыми словами в разном порядке получают 100%?
Потому что метод сравнивает НАБОРЫ слов, а не последовательности — он проверяет только то, какие слова встречаются, но никогда их порядок. Если для вашей задачи порядок слов важен, эта оценка не подходит.
Влияет ли регистр на результат?
Нет. Оба текста приводятся к нижнему регистру перед сравнением, поэтому «Отчёт» и «отчёт» считаются одним словом.
Повышает ли повтор слова оценку схожести?
Нет. Каждое слово учитывается один раз на текст независимо от того, сколько раз оно встречается, поэтому повтор внутри одного текста никак не влияет на результат.
Что означает 0% и что означает 100%?
0% значит, что у двух текстов вообще нет общих слов; 100% значит, что оба текста содержат совершенно одинаковый набор уникальных слов, даже если количество слов или их порядок различаются.
Какой-то из текстов куда-то загружается?
Нет. Всё выполняется в вашем браузере; ни один из текстов никогда не отправляется на сервер.