Блог
Статистика по данным

Калькулятор описательной статистики онлайн

Семнадцать мер, посчитанных по настоящему столбцу настоящего файла, а не по десятку чисел, вбитых руками. Каждая использованная формула прямо названа ниже — чтобы числа совпадали с тем, что вернёт ваша таблица, а не расходились тихо в третьем знаке.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Столбцы

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.

Факты и границы применимости

Что считается 17 мер: количество, сумма, среднее, медиана, мода, минимум, максимум, размах, Q1, Q3, IQR, дисперсия, стандартное отклонение, стандартная ошибка, коэффициент вариации, асимметрия, эксцесс
Определение квантиля R type 7 — то же, что Excel PERCENTILE.INC, Google Таблицы и numpy по умолчанию
Делитель дисперсии n−1 (выборочная). Генеральная есть на отдельной странице дисперсии.
Формула асимметрии G1, несмещённая оценка, та же, что в Excel SKEW
Формула эксцесса G2, избыточный эксцесс, как в Excel KURT — нормальное распределение даёт 0, а не 3
Минимум строк 2 для большинства мер, 4 — прежде чем эксцесс вообще определён
Пропуски Пропускаются, а не считаются нулём. Количество отражает только корректные числа.

Когда этот метод вводит в заблуждение

Как это считается

Среднее — это сумма, делённая на количество. Медиана — среднее значение упорядоченного ряда, а при чётном количестве — полусумма двух центральных. Мода — самое частое значение; если каждое встречается ровно один раз, моды нет, и утилита так и пишет, а не выдумывает её.

Квартили считаются по определению R type 7: позиция равна (n−1)·p, а когда она попадает между двумя элементами, результат линейно интерполируется. Это важнее, чем кажется: девять конкурирующих определений квантиля на малых выборках расходятся на несколько процентов, и утилиту, которая не сообщает используемое определение, невозможно сверить с вашей таблицей.

Дисперсия считается с делителем n−1 — это несмещённая оценка для выборки из большей совокупности. Именно её возвращает Excel ВАРИАЦИЯ.В (VAR.S) и именно её почти всякий учебник имеет в виду под словом «дисперсия», если явно не сказано «генеральная». Стандартное отклонение — корень из неё, а стандартная ошибка среднего — это отклонение, делённое на корень из количества.

Асимметрия — оценка G1, эксцесс — избыточная оценка G2, обе с поправкой на размер выборки, как в Excel SKEW и KURT. Избыточный эксцесс вычитает 3, поэтому идеально нормальное распределение даёт ровно 0: положительные значения означают более тяжёлые хвосты, чем у нормального, отрицательные — более лёгкие.

Коэффициент вариации — это стандартное отклонение, делённое на модуль среднего, в процентах. Поскольку он безразмерный, это единственная мера здесь, позволяющая сравнивать разброс величин, измеренных в совершенно разных шкалах.

Вопросы и ответы

Почему стандартное отклонение отличается от другого калькулятора?

Почти всегда из-за делителя. Здесь используется n−1, выборочная формула. Калькуляторы для школьных задач часто берут n, генеральную. Оба числа показаны на отдельной странице стандартного отклонения — там разницу видно напрямую.

Почему эксцесс около нуля, а не около трёх?

Это избыточный эксцесс: из него вычтена тройка, чтобы нормальное распределение давало ровно 0. Такая договорённость принята в Excel и в большинстве статистических пакетов. Прибавьте 3, если нужен вариант через четвёртый момент.

Что происходит с пустыми ячейками?

Они полностью пропускаются, а указанное количество относится только к корректным числам. Их никогда не превращают молча в нули — это стянуло бы среднее к нулю и незаметно испортило все остальные меры.

Сколько строк выдержит?

Сотни тысяч. Всё считается за один проход или одну сортировку, целиком в памяти вашего браузера — практический предел задаёт размер файла, который браузер согласится прочитать, а не сам расчёт.

Что-нибудь из этого уходит на сервер?

Нет. Сервера нет вообще. Откройте страницу, отключите сеть, вставьте данные — всё продолжит работать. В этом и смысл локальных расчётов: столбцы с зарплатами, медицинскими и финансовыми данными не обязаны покидать машину, на которой лежат.

Обратная утилита

Нужно наоборот? Среднее, медиана и мода Три центра одних и тех же данных и почему они расходятся

Похожие утилиты

Все утилиты