Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.
Факты и границы применимости
| С чем работает | С текстом и числами одинаково — значения сравниваются как написаны |
|---|---|
| Сортировка | По частоте, самое частое первым |
| Какие столбцы выдаются | Значение, частота, доля от общего, накопленная доля |
| Пустые ячейки | Считаются отдельной категорией, а не отбрасываются |
| Ограничение вывода | Показываются 60 верхних строк; в выгрузке все различные значения |
| График | Столбчатая диаграмма 20 самых частых значений |
Когда этот метод вводит в заблуждение
- Значения сравниваются ровно так, как написаны, поэтому «Москва» и «москва » — две разные категории. Это намеренно: молчаливое объединение скрыло бы проблему качества данных, — но означает, что грязный столбец даёт грязную таблицу, пока его не почистить.
- Для непрерывных измерений частотная таблица — неверный инструмент. Время отклика или цены редко повторяются, поэтому почти каждая строка становится своей категорией с частотой один; сгруппируйте их по интервалам гистограммой.
- Накопленная доля целиком зависит от порядка сортировки, а здесь этот порядок — частота. Она отвечает на вопрос «сколько покрывают самые частые значения», а не «сколько покрывают первые по алфавиту», что было бы другим и обычно бессмысленным вопросом.
- Столбцы с высокой кардинальностью формат не выдерживает. Столбец идентификаторов даст по строке на запись — таблица корректная и бесполезная.
Как это считается
Каждое значение выбранного столбца сравнивается как текст после отсечения окружающих пробелов, и одинаковые строки группируются. Сравнение как написано, без попыток нормализовать регистр или написание, и делает утилиту честной относительно состояния ваших данных.
Строки сортируются по частоте по убыванию, поэтому самое частое значение идёт первым. Именно этот порядок и наполняет смыслом накопленную долю: она отвечает, какую часть ваших данных уже покрывает верхняя горстка категорий, — практический вопрос, стоящий за большинством подсчётов частот.
Пустые ячейки становятся отдельной категорией, а не выбрасываются. Столбец, где пятая часть строк пуста, сообщает вам нечто важное, и таблица, тихо их опустившая, скрыла бы ровно это.
Вывод ограничен 60 строками, потому что более длинные таблицы перестают читаться на странице, но в выгрузке CSV лежит каждое различное значение со своей частотой и долей. На диаграмме показаны 20 верхних — рубеж, после которого подписи столбцов начинают сталкиваться.
Вопросы и ответы
Почему «Москва» и «москва» — разные строки?
Потому что значения сравниваются ровно так, как написаны. Автоматическое объединение скрыло бы несогласованность в ваших данных. Почистите столбец, если разница несущественна, — отчёт о качестве данных покажет, насколько распространена проблема.
Частотная таблица или гистограмма?
Частотная таблица — для категорий и для чисел, которые повторяются, вроде оценок и количеств. Гистограмма — для непрерывных измерений, где значения редко повторяются и их нужно группировать по интервалам.
Что мне даёт накопленная доля?
Сколько данных покрывают верхние категории вместе. Если первые три значения дотягивают до 70%, большая часть ваших данных живёт в трёх категориях, и длинный хвост может не заслуживать внимания.
В моей таблице сотни строк.
У вашего столбца высокая кардинальность — часто это идентификатор или поле свободного текста. Частотная таблица для него не подходит; отчёт о качестве данных сообщит число различных значений, не перечисляя их все.
Мои данные загружаются?
Нет. И подсчёт, и построение диаграммы происходят в вашем браузере.