Блог
Статистика по данным

Калькулятор доверительного интервала онлайн

Среднее по вашей выборке — одно число, но среднее всех, кого вы не измеряли, находится где-то рядом с ним, а не ровно на нём. Доверительный интервал говорит, насколько рядом: он превращает точечную оценку в диапазон, и это честный способ приводить среднее, посчитанное по выборке.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Столбцы

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.

Факты и границы применимости

Какие уровни считаются 90%, 95% и 99% — все сразу
Распределение Стьюдента с n−1 степенями свободы, а не нормальное
Критическое значение Находится обращением точного t-распределения, а не берётся из таблицы
Формула среднее ± t · стандартное отклонение / √n
Поведение ширины Сжимается как √n — учетверение выборки вдвое сужает интервал
Минимум строк 2

Когда этот метод вводит в заблуждение

Как это считается

Полуширина — это стандартная ошибка среднего, умноженная на критическое значение из распределения Стьюдента. Стандартная ошибка равна стандартному отклонению, делённому на корень из количества, — поэтому интервал сужается по мере накопления данных, а само стандартное отклонение нет.

Используется распределение Стьюдента, а не нормальное, и это важно ровно там, где чаще всего игнорируется. На 10 строках критическое значение для 95% равно 2,26 вместо 1,96 — интервал шире на 15%, — и этот разрыв и есть поправка на то, что стандартное отклонение оценено по той же малой выборке.

Критическое значение получается численным обращением точного t-распределения, а не поиском в округлённой таблице. Это значит, что результат корректен при любом числе строк, включая неудобные размеры, которые печатные таблицы пропускают.

Все три общепринятых уровня показываются вместе, потому что выбор между ними произволен, а показ только одного это скрывает. Результат, значимый на 95% и незначимый на 99%, — это результат, хрупкость которого заслуживает быть видимой.

Вопросы и ответы

95-процентный интервал содержит 95% моих значений?

Нет, и это классическая ошибка. Это диапазон для среднего совокупности. Диапазон, покрывающий большинство отдельных значений, — это примерно среднее ± 2 стандартных отклонения, и он гораздо шире.

Почему интервал так медленно сужается при добавлении данных?

Потому что он сужается как корень из размера выборки. Чтобы вдвое уменьшить ширину, нужно вчетверо больше строк, а чтобы уменьшить ещё вдвое — в шестнадцать раз больше.

Почему распределение Стьюдента, а не нормальное?

Потому что стандартное отклонение оценено по той же выборке, а это добавляет неопределённости. Распределение Стьюдента её учитывает. Выше примерно 30 строк они почти совпадают, а ниже нормальное даёт слишком узкие интервалы.

Какой уровень указывать?

95% — общепринятая договорённость в большинстве областей. Указывайте выбранный уровень рядом с интервалом: интервал без уровня доверия лишён смысла.

Мои данные загружаются?

Нет. И критические значения, и интервал считаются в вашем браузере.

Похожие утилиты

Все утилиты