Блог
Статистика по данным

Построитель частотной таблицы онлайн

Вопрос подсчёта, отвеченный как следует: сколько раз встречается каждое различное значение, какую долю от общего это составляет и какую часть данных уже покрывают несколько верхних значений. Работает и с текстом, и с числами — это и отличает её от гистограммы.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.

Факты и границы применимости

С чем работает С текстом и числами одинаково — значения сравниваются как написаны
Сортировка По частоте, самое частое первым
Какие столбцы выдаются Значение, частота, доля от общего, накопленная доля
Пустые ячейки Считаются отдельной категорией, а не отбрасываются
Ограничение вывода Показываются 60 верхних строк; в выгрузке все различные значения
График Столбчатая диаграмма 20 самых частых значений

Когда этот метод вводит в заблуждение

Как это считается

Каждое значение выбранного столбца сравнивается как текст после отсечения окружающих пробелов, и одинаковые строки группируются. Сравнение как написано, без попыток нормализовать регистр или написание, и делает утилиту честной относительно состояния ваших данных.

Строки сортируются по частоте по убыванию, поэтому самое частое значение идёт первым. Именно этот порядок и наполняет смыслом накопленную долю: она отвечает, какую часть ваших данных уже покрывает верхняя горстка категорий, — практический вопрос, стоящий за большинством подсчётов частот.

Пустые ячейки становятся отдельной категорией, а не выбрасываются. Столбец, где пятая часть строк пуста, сообщает вам нечто важное, и таблица, тихо их опустившая, скрыла бы ровно это.

Вывод ограничен 60 строками, потому что более длинные таблицы перестают читаться на странице, но в выгрузке CSV лежит каждое различное значение со своей частотой и долей. На диаграмме показаны 20 верхних — рубеж, после которого подписи столбцов начинают сталкиваться.

Вопросы и ответы

Почему «Москва» и «москва» — разные строки?

Потому что значения сравниваются ровно так, как написаны. Автоматическое объединение скрыло бы несогласованность в ваших данных. Почистите столбец, если разница несущественна, — отчёт о качестве данных покажет, насколько распространена проблема.

Частотная таблица или гистограмма?

Частотная таблица — для категорий и для чисел, которые повторяются, вроде оценок и количеств. Гистограмма — для непрерывных измерений, где значения редко повторяются и их нужно группировать по интервалам.

Что мне даёт накопленная доля?

Сколько данных покрывают верхние категории вместе. Если первые три значения дотягивают до 70%, большая часть ваших данных живёт в трёх категориях, и длинный хвост может не заслуживать внимания.

В моей таблице сотни строк.

У вашего столбца высокая кардинальность — часто это идентификатор или поле свободного текста. Частотная таблица для него не подходит; отчёт о качестве данных сообщит число различных значений, не перечисляя их все.

Мои данные загружаются?

Нет. И подсчёт, и построение диаграммы происходят в вашем браузере.

Похожие утилиты

Все утилиты