Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Столбцы
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.
Факты и границы применимости
| Среднее | Сумма, делённая на количество. Двигается от каждого значения, включая экстремальные. |
|---|---|
| Медиана | Середина упорядоченного ряда; при чётном количестве — полусумма двух центральных. |
| Мода | Самое частое значение. Выдаётся списком — мод может быть несколько. |
| Моды нет | Когда каждое значение встречается однажды, утилита так и пишет, а не выдумывает её. |
| Индикатор перекоса | Выводится из знака «среднее − медиана» и подтверждается коэффициентом асимметрии G1. |
| Минимум строк | 2 |
Когда этот метод вводит в заблуждение
- Среднее — единственное из трёх, которое двигает каждое значение. В примере одна зарплата в 128 вытягивает среднее выше любой реальной зарплаты списка, кроме неё самой, — именно поэтому статистика «средней зарплаты» так часто вводит в заблуждение.
- Медиана полностью игнорирует величину. Она не отличит ряд, кончающийся на 48, от ряда, кончающегося на 4800, — это делает её устойчивой и одновременно слепой.
- Мода бессмысленна на непрерывных измерениях. Время, вес и цены редко повторяются точно, поэтому либо моды нет, либо полученная — артефакт округления.
- Все три описывают одну вершину. Если в данных два сгустка — например, частичная и полная занятость, — ни одно из трёх чисел не попадает в реальную группу, и честный ход — разделить данные до того, как их обобщать.
Как это считается
Среднее — это сумма всех корректных значений, делённая на их количество. Пустые и нечисловые ячейки пропускаются, а не считаются нулями: отсутствующая зарплата — не зарплата в ноль, и такой подсчёт тянул бы среднее вниз.
Медиана берётся из упорядоченного ряда. При нечётном количестве это средний элемент, при чётном — полусумма двух центральных: стандартная договорённость, та же, что в вашей таблице.
Моды находятся подсчётом повторов. Если наибольшее число повторов равно единице — все значения уникальны, — моды нет вовсе, и утилита сообщает об этом, а не возвращает первое попавшееся значение. Если наибольшее число повторов делят несколько значений, перечисляются все.
Сравнение среднего и медианы выдаётся фразой, потому что именно ею люди и пользуются. Среднее выше медианы — хвост вправо, обычно несколько крупных значений; среднее ниже медианы — хвост влево. Когда они совпадают, распределение симметрично.
Вопросы и ответы
Какое число указывать в отчёте?
Если среднее и медиана близки, годится любое, и среднее привычнее. Если различаются заметно, указывайте медиану как типичное значение, а среднее упоминайте отдельно: сам разрыв между ними и есть находка.
Почему в моих данных нет моды?
Потому что ни одно значение не повторяется. Для измерений вроде времени и цен это нормально. Мода придумана для категорий и для значений, попадающих в небольшой набор возможностей.
Может быть две моды?
Да, и перечисляются все. Две моды обычно означают, что в одном столбце смешаны две группы, — это стоит выяснить прежде, чем считать что-либо ещё.
Среднее выше почти всех значений в списке.
Это признак правого хвоста — одного или нескольких крупных значений. Проверьте утилитой поиска выбросов: одна экстремальная строка часто оказывается ошибкой ввода, а не реальным наблюдением.
Что-нибудь загружается?
Нет. Весь расчёт идёт внутри вашего браузера, и страница работает при отключённой сети.