Блог
Статистика по данным

Построитель частотной таблицы онлайн

Вопрос подсчёта, отвеченный как следует: сколько раз встречается каждое различное значение, какую долю от общего это составляет и какую часть данных уже покрывают несколько верхних значений. Работает и с текстом, и с числами — это и отличает её от гистограммы.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.

Факты и границы применимости

С чем работает С текстом и числами одинаково — значения сравниваются как написаны
Сортировка По частоте, самое частое первым
Какие столбцы выдаются Значение, частота, доля от общего, накопленная доля
Пустые ячейки Считаются отдельной категорией, а не отбрасываются
Ограничение вывода Показываются 60 верхних строк; в выгрузке все различные значения
График Столбчатая диаграмма 20 самых частых значений

Когда этот метод вводит в заблуждение

Как это считается

Каждое значение выбранного столбца сравнивается как текст после отсечения окружающих пробелов, и одинаковые строки группируются. Сравнение как написано, без попыток нормализовать регистр или написание, и делает утилиту честной относительно состояния ваших данных.

Строки сортируются по частоте по убыванию, поэтому самое частое значение идёт первым. Именно этот порядок и наполняет смыслом накопленную долю: она отвечает, какую часть ваших данных уже покрывает верхняя горстка категорий, — практический вопрос, стоящий за большинством подсчётов частот.

Пустые ячейки становятся отдельной категорией, а не выбрасываются. Столбец, где пятая часть строк пуста, сообщает вам нечто важное, и таблица, тихо их опустившая, скрыла бы ровно это.

Вывод ограничен 60 строками, потому что более длинные таблицы перестают читаться на странице, но в выгрузке CSV лежит каждое различное значение со своей частотой и долей. На диаграмме показаны 20 верхних — рубеж, после которого подписи столбцов начинают сталкиваться.

Вопросы и ответы

Почему «Москва» и «москва» — разные строки?

Потому что значения сравниваются ровно так, как написаны. Автоматическое объединение скрыло бы несогласованность в ваших данных. Почистите столбец, если разница несущественна, — отчёт о качестве данных покажет, насколько распространена проблема.

Частотная таблица или гистограмма?

Частотная таблица — для категорий и для чисел, которые повторяются, вроде оценок и количеств. Гистограмма — для непрерывных измерений, где значения редко повторяются и их нужно группировать по интервалам.

Что мне даёт накопленная доля?

Сколько данных покрывают верхние категории вместе. Если первые три значения дотягивают до 70%, большая часть ваших данных живёт в трёх категориях, и длинный хвост может не заслуживать внимания.

В моей таблице сотни строк.

У вашего столбца высокая кардинальность — часто это идентификатор или поле свободного текста. Частотная таблица для него не подходит; отчёт о качестве данных сообщит число различных значений, не перечисляя их все.

Мои данные загружаются?

Нет. И подсчёт, и построение диаграммы происходят в вашем браузере.

Похожие утилиты

Все утилиты