Блог
Статистика по данным

Критерий хи-квадрат на независимость онлайн

В таблице частоты, а не измерения: сколько людей из каждого канала купили и сколько нет. Критерий хи-квадрат спрашивает, различается ли это соотношение между строками сильнее, чем породило бы случайное распределение, — то есть связаны ли канал и исход вообще.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.

Факты и границы применимости

Что на входе Таблица сопряжённости: категории в строках, частоты исходов в столбцах
Статистика χ² = Σ (наблюдённое − ожидаемое)² / ожидаемое
Ожидаемые частоты Итог строки × итог столбца ÷ общий итог, показываются целиком
Степени свободы (строк − 1) × (столбцов − 1)
p-значение Точный правый хвост распределения хи-квадрат через неполную гамма-функцию
Величина эффекта V Крамера, от 0 до 1

Когда этот метод вводит в заблуждение

Как это считается

Ожидаемая частота каждой ячейки — это то, чем она была бы, если бы строковая и столбцовая величины не были связаны: итог строки, умноженный на итог столбца и делённый на общий итог. Статистика суммирует квадраты разностей наблюдённого и ожидаемого, каждый делённый на ожидаемое, — так отклонение взвешивается тем, насколько оно удивительно в этом масштабе.

p-значение — это правый хвост распределения хи-квадрат с (строк−1)×(столбцов−1) степенями свободы, вычисленный через регуляризованную неполную гамма-функцию. Оно точное, а не интерполированное по таблице, и это важно для неудобных чисел степеней свободы, которые печатные таблицы округляют.

Полная таблица ожидаемых частот показывается, а не только вердикт. Сравнение её с наблюдённой таблицей ячейка за ячейкой — это и есть способ выяснить, где на самом деле живёт связь: статистика агрегирует все ячейки и ничего не говорит о том, какая из них её породила.

V Крамера перемасштабирует статистику в диапазон 0–1, деля на размер выборки и размерности таблицы. В отличие от самого χ², его можно сравнивать между таблицами разного размера, — именно поэтому его и стоит приводить рядом с p-значением.

Вопросы и ответы

Как должна выглядеть моя таблица?

Категории по строкам, частоты исходов по столбцам, а сами частоты — числами. В данных-образце три канала строками и два столбца исходов, то есть таблица 3×2.

Часть ожидаемых частот меньше 5. Результат неверен?

Он скорее ненадёжен, чем неверен. Приближение хи-квадрат предполагает достаточно большие ожидаемые частоты. Объедините редкие категории в более крупную группу или соберите больше данных.

Можно подставить проценты вместо частот?

Нет. Критерий зависит от фактического числа наблюдений, а проценты именно его и отбрасывают. Соотношение 60/40 из десяти человек и из десяти тысяч — совершенно разные свидетельства.

Какое V Крамера считается большим?

Грубый ориентир: 0,1 — слабая связь, 0,3 — умеренная, 0,5 — сильная. В отличие от χ², оно не растёт просто оттого, что вы собрали больше строк, — это и делает его честной мерой силы.

Что-нибудь загружается?

Нет. И ожидаемые частоты, и статистика, и p-значение считаются в вашем браузере.

Похожие утилиты

Все утилиты