Блог
Статистика по данным

Калькулятор описательной статистики онлайн

Семнадцать мер, посчитанных по настоящему столбцу настоящего файла, а не по десятку чисел, вбитых руками. Каждая использованная формула прямо названа ниже — чтобы числа совпадали с тем, что вернёт ваша таблица, а не расходились тихо в третьем знаке.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Столбцы

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.

Факты и границы применимости

Что считается 17 мер: количество, сумма, среднее, медиана, мода, минимум, максимум, размах, Q1, Q3, IQR, дисперсия, стандартное отклонение, стандартная ошибка, коэффициент вариации, асимметрия, эксцесс
Определение квантиля R type 7 — то же, что Excel PERCENTILE.INC, Google Таблицы и numpy по умолчанию
Делитель дисперсии n−1 (выборочная). Генеральная есть на отдельной странице дисперсии.
Формула асимметрии G1, несмещённая оценка, та же, что в Excel SKEW
Формула эксцесса G2, избыточный эксцесс, как в Excel KURT — нормальное распределение даёт 0, а не 3
Минимум строк 2 для большинства мер, 4 — прежде чем эксцесс вообще определён
Пропуски Пропускаются, а не считаются нулём. Количество отражает только корректные числа.

Когда этот метод вводит в заблуждение

Как это считается

Среднее — это сумма, делённая на количество. Медиана — среднее значение упорядоченного ряда, а при чётном количестве — полусумма двух центральных. Мода — самое частое значение; если каждое встречается ровно один раз, моды нет, и утилита так и пишет, а не выдумывает её.

Квартили считаются по определению R type 7: позиция равна (n−1)·p, а когда она попадает между двумя элементами, результат линейно интерполируется. Это важнее, чем кажется: девять конкурирующих определений квантиля на малых выборках расходятся на несколько процентов, и утилиту, которая не сообщает используемое определение, невозможно сверить с вашей таблицей.

Дисперсия считается с делителем n−1 — это несмещённая оценка для выборки из большей совокупности. Именно её возвращает Excel ВАРИАЦИЯ.В (VAR.S) и именно её почти всякий учебник имеет в виду под словом «дисперсия», если явно не сказано «генеральная». Стандартное отклонение — корень из неё, а стандартная ошибка среднего — это отклонение, делённое на корень из количества.

Асимметрия — оценка G1, эксцесс — избыточная оценка G2, обе с поправкой на размер выборки, как в Excel SKEW и KURT. Избыточный эксцесс вычитает 3, поэтому идеально нормальное распределение даёт ровно 0: положительные значения означают более тяжёлые хвосты, чем у нормального, отрицательные — более лёгкие.

Коэффициент вариации — это стандартное отклонение, делённое на модуль среднего, в процентах. Поскольку он безразмерный, это единственная мера здесь, позволяющая сравнивать разброс величин, измеренных в совершенно разных шкалах.

Вопросы и ответы

Почему стандартное отклонение отличается от другого калькулятора?

Почти всегда из-за делителя. Здесь используется n−1, выборочная формула. Калькуляторы для школьных задач часто берут n, генеральную. Оба числа показаны на отдельной странице стандартного отклонения — там разницу видно напрямую.

Почему эксцесс около нуля, а не около трёх?

Это избыточный эксцесс: из него вычтена тройка, чтобы нормальное распределение давало ровно 0. Такая договорённость принята в Excel и в большинстве статистических пакетов. Прибавьте 3, если нужен вариант через четвёртый момент.

Что происходит с пустыми ячейками?

Они полностью пропускаются, а указанное количество относится только к корректным числам. Их никогда не превращают молча в нули — это стянуло бы среднее к нулю и незаметно испортило все остальные меры.

Сколько строк выдержит?

Сотни тысяч. Всё считается за один проход или одну сортировку, целиком в памяти вашего браузера — практический предел задаёт размер файла, который браузер согласится прочитать, а не сам расчёт.

Что-нибудь из этого уходит на сервер?

Нет. Сервера нет вообще. Откройте страницу, отключите сеть, вставьте данные — всё продолжит работать. В этом и смысл локальных расчётов: столбцы с зарплатами, медицинскими и финансовыми данными не обязаны покидать машину, на которой лежат.

Обратная утилита

Нужно наоборот? Среднее, медиана и мода Три центра одних и тех же данных и почему они расходятся

Похожие утилиты

Все утилиты