Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Столбцы
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.
Факты и границы применимости
| Что считается | 17 мер: количество, сумма, среднее, медиана, мода, минимум, максимум, размах, Q1, Q3, IQR, дисперсия, стандартное отклонение, стандартная ошибка, коэффициент вариации, асимметрия, эксцесс |
|---|---|
| Определение квантиля | R type 7 — то же, что Excel PERCENTILE.INC, Google Таблицы и numpy по умолчанию |
| Делитель дисперсии | n−1 (выборочная). Генеральная есть на отдельной странице дисперсии. |
| Формула асимметрии | G1, несмещённая оценка, та же, что в Excel SKEW |
| Формула эксцесса | G2, избыточный эксцесс, как в Excel KURT — нормальное распределение даёт 0, а не 3 |
| Минимум строк | 2 для большинства мер, 4 — прежде чем эксцесс вообще определён |
| Пропуски | Пропускаются, а не считаются нулём. Количество отражает только корректные числа. |
Когда этот метод вводит в заблуждение
- Среднее и стандартное отклонение хорошо описывают симметричное одновершинное распределение и плохо — любое другое. Если в данных два сгустка, среднее попадает в пустую впадину между ними и не описывает ничего реального.
- Одно экстремальное значение сдвигает сразу среднее, размах, дисперсию и стандартное отклонение, почти не трогая медиану и IQR. Когда эти два набора чисел сильно расходятся, доверяйте медиане и идите искать выбросы.
- Асимметрия и эксцесс чрезвычайно шумны на малых выборках. Меньше примерно 50 значений они колеблются так сильно, что вычитывать в них смысл — самообман.
- Коэффициент вариации превращается в бессмыслицу, когда среднее приближается к нулю или данные могут быть отрицательными: знаменатель перестаёт что-либо означать.
Как это считается
Среднее — это сумма, делённая на количество. Медиана — среднее значение упорядоченного ряда, а при чётном количестве — полусумма двух центральных. Мода — самое частое значение; если каждое встречается ровно один раз, моды нет, и утилита так и пишет, а не выдумывает её.
Квартили считаются по определению R type 7: позиция равна (n−1)·p, а когда она попадает между двумя элементами, результат линейно интерполируется. Это важнее, чем кажется: девять конкурирующих определений квантиля на малых выборках расходятся на несколько процентов, и утилиту, которая не сообщает используемое определение, невозможно сверить с вашей таблицей.
Дисперсия считается с делителем n−1 — это несмещённая оценка для выборки из большей совокупности. Именно её возвращает Excel ВАРИАЦИЯ.В (VAR.S) и именно её почти всякий учебник имеет в виду под словом «дисперсия», если явно не сказано «генеральная». Стандартное отклонение — корень из неё, а стандартная ошибка среднего — это отклонение, делённое на корень из количества.
Асимметрия — оценка G1, эксцесс — избыточная оценка G2, обе с поправкой на размер выборки, как в Excel SKEW и KURT. Избыточный эксцесс вычитает 3, поэтому идеально нормальное распределение даёт ровно 0: положительные значения означают более тяжёлые хвосты, чем у нормального, отрицательные — более лёгкие.
Коэффициент вариации — это стандартное отклонение, делённое на модуль среднего, в процентах. Поскольку он безразмерный, это единственная мера здесь, позволяющая сравнивать разброс величин, измеренных в совершенно разных шкалах.
Вопросы и ответы
Почему стандартное отклонение отличается от другого калькулятора?
Почти всегда из-за делителя. Здесь используется n−1, выборочная формула. Калькуляторы для школьных задач часто берут n, генеральную. Оба числа показаны на отдельной странице стандартного отклонения — там разницу видно напрямую.
Почему эксцесс около нуля, а не около трёх?
Это избыточный эксцесс: из него вычтена тройка, чтобы нормальное распределение давало ровно 0. Такая договорённость принята в Excel и в большинстве статистических пакетов. Прибавьте 3, если нужен вариант через четвёртый момент.
Что происходит с пустыми ячейками?
Они полностью пропускаются, а указанное количество относится только к корректным числам. Их никогда не превращают молча в нули — это стянуло бы среднее к нулю и незаметно испортило все остальные меры.
Сколько строк выдержит?
Сотни тысяч. Всё считается за один проход или одну сортировку, целиком в памяти вашего браузера — практический предел задаёт размер файла, который браузер согласится прочитать, а не сам расчёт.
Что-нибудь из этого уходит на сервер?
Нет. Сервера нет вообще. Откройте страницу, отключите сеть, вставьте данные — всё продолжит работать. В этом и смысл локальных расчётов: столбцы с зарплатами, медицинскими и финансовыми данными не обязаны покидать машину, на которой лежат.