Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Столбцы
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.
Факты и границы применимости
| Формула | z = (значение − среднее) / стандартное отклонение |
|---|---|
| Какое отклонение берётся | Выборочное, делитель n−1 |
| Среднее результата | Ровно 0 по построению |
| Стандартное отклонение результата | Ровно 1 по построению |
| Что подсчитывается | Сколько строк лежит за ±2σ и за ±3σ |
| Минимум строк | 2, и разброс должен быть ненулевым |
Когда этот метод вводит в заблуждение
- Стандартизация не делает данные нормальными. Она сдвигает и перемасштабирует распределение, не трогая его форму: перекошенный столбец после стандартизации остаётся перекошенным, и привычные проценты, привязанные к z-оценкам, к нему не относятся.
- Оба ингредиента чувствительны к выбросам. Одно экстремальное значение тянет среднее к себе и раздувает стандартное отклонение, что уменьшает z-оценку и его самого, и всего остального. Для охоты на выбросы правило IQR — более надёжный инструмент.
- На малых выборках диапазон возможных z-оценок математически ограничен. При n строках ни одно значение не может превысить (n−1)/√n, а это около 4,2 на двадцати строках, — поэтому «нет z-оценок выше 3» может означать и чистые данные, и просто слишком маленькую выборку.
- Z-оценка сопоставима между наборами данных, только если у обоих распределений похожая форма. Сравнивать z = 2 в нормальном столбце с z = 2 в сильно перекошенном — значит сравнивать разные вещи.
Как это считается
Среднее и выборочное стандартное отклонение считаются по корректным значениям столбца. Затем каждое значение уменьшается на среднее и делится на стандартное отклонение — это переносит центр данных в ноль и перемасштабирует их так, что одна единица равна одному стандартному отклонению.
По построению у полученного столбца среднее всегда ровно ноль, а стандартное отклонение ровно единица. Это не совпадение, которое надо проверять, а определение, — и именно поэтому стандартизованные значения из разных источников можно класть на одну ось.
Подсчёт строк за ±2σ и ±3σ выдаётся потому, что это самая быстрая доступная проверка на здравый смысл. В нормальном распределении примерно 5% значений выходят за два стандартных отклонения и около 0,3% — за три; числа, далёкие от этих, намекают, что распределение не нормальное.
Если все значения столбца одинаковы, стандартное отклонение равно нулю, деление не определено, и утилита так и говорит, вместо того чтобы вернуть нули или бесконечности. Такой случай редок в измерениях и част в столбцах, которые оказались константами.
Вопросы и ответы
Какая z-оценка считается высокой?
За ±2 — необычно, за ±3 — редко, но эти пороги взяты из нормального распределения. Сначала проверьте утилитой нормальности: на перекошенных данных они значат гораздо меньше, чем кажется.
Почему среднее моих z-оценок ровно ноль?
Потому что вычитание среднего из каждого значения заставляет его быть нулём. Это свойство преобразования, а не находка о ваших данных.
Можно z-оценками сравнивать два разных столбца?
Да, в этом их главное назначение: z = 1,2 означает одно и то же относительное положение в обоих. Оговорка в том, что сравнение верно, только если у двух распределений похожая форма.
Чем искать выбросы — z-оценками или правилом IQR?
Правилом IQR: оно не искажается самими выбросами. Z-оценками удобно описывать, насколько значение экстремально, уже после того, как вы его нашли.
Мои данные загружаются?
Нет. Стандартизация выполняется в браузере, и ничего не передаётся.