Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Столбцы
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.
Факты и границы применимости
| Какие уровни считаются | 90%, 95% и 99% — все сразу |
|---|---|
| Распределение | Стьюдента с n−1 степенями свободы, а не нормальное |
| Критическое значение | Находится обращением точного t-распределения, а не берётся из таблицы |
| Формула | среднее ± t · стандартное отклонение / √n |
| Поведение ширины | Сжимается как √n — учетверение выборки вдвое сужает интервал |
| Минимум строк | 2 |
Когда этот метод вводит в заблуждение
- Интервал описывает среднее совокупности, а не отдельные значения. 95-процентный интервал от 3050 до 3210 не означает, что 95% чеков попадают в этот диапазон, — большинство из них лежит далеко за его пределами. Путаница этих двух вещей — самое частое неверное прочтение этого числа.
- Он предполагает, что ваши строки — случайная выборка из той совокупности, которую вы хотите описать. Данные одного магазина, одной недели или одного канала дадут точный интервал вокруг не той величины, и никакая арифметика этого не обнаружит.
- «Уверенность 95%» — утверждение о процедуре, а не о вашем конкретном интервале. Оно означает, что при многократном повторении выборки примерно 95 из каждых 100 построенных так интервалов накрыли бы истинное среднее; ваш либо накрывает, либо нет.
- На сильно перекошенных данных интервал по-прежнему считается, но становится ненадёжным, потому что t-распределение предполагает приблизительную нормальность выборочного среднего. При 30+ строках это верно, при 8 — плохо.
Как это считается
Полуширина — это стандартная ошибка среднего, умноженная на критическое значение из распределения Стьюдента. Стандартная ошибка равна стандартному отклонению, делённому на корень из количества, — поэтому интервал сужается по мере накопления данных, а само стандартное отклонение нет.
Используется распределение Стьюдента, а не нормальное, и это важно ровно там, где чаще всего игнорируется. На 10 строках критическое значение для 95% равно 2,26 вместо 1,96 — интервал шире на 15%, — и этот разрыв и есть поправка на то, что стандартное отклонение оценено по той же малой выборке.
Критическое значение получается численным обращением точного t-распределения, а не поиском в округлённой таблице. Это значит, что результат корректен при любом числе строк, включая неудобные размеры, которые печатные таблицы пропускают.
Все три общепринятых уровня показываются вместе, потому что выбор между ними произволен, а показ только одного это скрывает. Результат, значимый на 95% и незначимый на 99%, — это результат, хрупкость которого заслуживает быть видимой.
Вопросы и ответы
95-процентный интервал содержит 95% моих значений?
Нет, и это классическая ошибка. Это диапазон для среднего совокупности. Диапазон, покрывающий большинство отдельных значений, — это примерно среднее ± 2 стандартных отклонения, и он гораздо шире.
Почему интервал так медленно сужается при добавлении данных?
Потому что он сужается как корень из размера выборки. Чтобы вдвое уменьшить ширину, нужно вчетверо больше строк, а чтобы уменьшить ещё вдвое — в шестнадцать раз больше.
Почему распределение Стьюдента, а не нормальное?
Потому что стандартное отклонение оценено по той же выборке, а это добавляет неопределённости. Распределение Стьюдента её учитывает. Выше примерно 30 строк они почти совпадают, а ниже нормальное даёт слишком узкие интервалы.
Какой уровень указывать?
95% — общепринятая договорённость в большинстве областей. Указывайте выбранный уровень рядом с интервалом: интервал без уровня доверия лишён смысла.
Мои данные загружаются?
Нет. И критические значения, и интервал считаются в вашем браузере.