Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Столбцы
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.
Факты и границы применимости
| Какие уровни считаются | 90%, 95% и 99% — все сразу |
|---|---|
| Распределение | Стьюдента с n−1 степенями свободы, а не нормальное |
| Критическое значение | Находится обращением точного t-распределения, а не берётся из таблицы |
| Формула | среднее ± t · стандартное отклонение / √n |
| Поведение ширины | Сжимается как √n — учетверение выборки вдвое сужает интервал |
| Минимум строк | 2 |
Когда этот метод вводит в заблуждение
- Интервал описывает среднее совокупности, а не отдельные значения. 95-процентный интервал от 3050 до 3210 не означает, что 95% чеков попадают в этот диапазон, — большинство из них лежит далеко за его пределами. Путаница этих двух вещей — самое частое неверное прочтение этого числа.
- Он предполагает, что ваши строки — случайная выборка из той совокупности, которую вы хотите описать. Данные одного магазина, одной недели или одного канала дадут точный интервал вокруг не той величины, и никакая арифметика этого не обнаружит.
- «Уверенность 95%» — утверждение о процедуре, а не о вашем конкретном интервале. Оно означает, что при многократном повторении выборки примерно 95 из каждых 100 построенных так интервалов накрыли бы истинное среднее; ваш либо накрывает, либо нет.
- На сильно перекошенных данных интервал по-прежнему считается, но становится ненадёжным, потому что t-распределение предполагает приблизительную нормальность выборочного среднего. При 30+ строках это верно, при 8 — плохо.
Как это считается
Полуширина — это стандартная ошибка среднего, умноженная на критическое значение из распределения Стьюдента. Стандартная ошибка равна стандартному отклонению, делённому на корень из количества, — поэтому интервал сужается по мере накопления данных, а само стандартное отклонение нет.
Используется распределение Стьюдента, а не нормальное, и это важно ровно там, где чаще всего игнорируется. На 10 строках критическое значение для 95% равно 2,26 вместо 1,96 — интервал шире на 15%, — и этот разрыв и есть поправка на то, что стандартное отклонение оценено по той же малой выборке.
Критическое значение получается численным обращением точного t-распределения, а не поиском в округлённой таблице. Это значит, что результат корректен при любом числе строк, включая неудобные размеры, которые печатные таблицы пропускают.
Все три общепринятых уровня показываются вместе, потому что выбор между ними произволен, а показ только одного это скрывает. Результат, значимый на 95% и незначимый на 99%, — это результат, хрупкость которого заслуживает быть видимой.
Вопросы и ответы
95-процентный интервал содержит 95% моих значений?
Нет, и это классическая ошибка. Это диапазон для среднего совокупности. Диапазон, покрывающий большинство отдельных значений, — это примерно среднее ± 2 стандартных отклонения, и он гораздо шире.
Почему интервал так медленно сужается при добавлении данных?
Потому что он сужается как корень из размера выборки. Чтобы вдвое уменьшить ширину, нужно вчетверо больше строк, а чтобы уменьшить ещё вдвое — в шестнадцать раз больше.
Почему распределение Стьюдента, а не нормальное?
Потому что стандартное отклонение оценено по той же выборке, а это добавляет неопределённости. Распределение Стьюдента её учитывает. Выше примерно 30 строк они почти совпадают, а ниже нормальное даёт слишком узкие интервалы.
Какой уровень указывать?
95% — общепринятая договорённость в большинстве областей. Указывайте выбранный уровень рядом с интервалом: интервал без уровня доверия лишён смысла.
Мои данные загружаются?
Нет. И критические значения, и интервал считаются в вашем браузере.