Блог
Статистика по данным

Критерий хи-квадрат на независимость онлайн

В таблице частоты, а не измерения: сколько людей из каждого канала купили и сколько нет. Критерий хи-квадрат спрашивает, различается ли это соотношение между строками сильнее, чем породило бы случайное распределение, — то есть связаны ли канал и исход вообще.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

У этой страницы вообще нет серверной части. Вставленная таблица разбирается кодом JavaScript внутри вашего же браузера, график рисуется на элементе canvas на вашей машине, файл экспорта собирается локально. Ничего не загружается, не хранится и не пишется ни в какие логи. После загрузки страницы можно отключить сеть — всё продолжит работать, и это самый простой способ проверить обещание самостоятельно.

Факты и границы применимости

Что на входе Таблица сопряжённости: категории в строках, частоты исходов в столбцах
Статистика χ² = Σ (наблюдённое − ожидаемое)² / ожидаемое
Ожидаемые частоты Итог строки × итог столбца ÷ общий итог, показываются целиком
Степени свободы (строк − 1) × (столбцов − 1)
p-значение Точный правый хвост распределения хи-квадрат через неполную гамма-функцию
Величина эффекта V Крамера, от 0 до 1

Когда этот метод вводит в заблуждение

Как это считается

Ожидаемая частота каждой ячейки — это то, чем она была бы, если бы строковая и столбцовая величины не были связаны: итог строки, умноженный на итог столбца и делённый на общий итог. Статистика суммирует квадраты разностей наблюдённого и ожидаемого, каждый делённый на ожидаемое, — так отклонение взвешивается тем, насколько оно удивительно в этом масштабе.

p-значение — это правый хвост распределения хи-квадрат с (строк−1)×(столбцов−1) степенями свободы, вычисленный через регуляризованную неполную гамма-функцию. Оно точное, а не интерполированное по таблице, и это важно для неудобных чисел степеней свободы, которые печатные таблицы округляют.

Полная таблица ожидаемых частот показывается, а не только вердикт. Сравнение её с наблюдённой таблицей ячейка за ячейкой — это и есть способ выяснить, где на самом деле живёт связь: статистика агрегирует все ячейки и ничего не говорит о том, какая из них её породила.

V Крамера перемасштабирует статистику в диапазон 0–1, деля на размер выборки и размерности таблицы. В отличие от самого χ², его можно сравнивать между таблицами разного размера, — именно поэтому его и стоит приводить рядом с p-значением.

Вопросы и ответы

Как должна выглядеть моя таблица?

Категории по строкам, частоты исходов по столбцам, а сами частоты — числами. В данных-образце три канала строками и два столбца исходов, то есть таблица 3×2.

Часть ожидаемых частот меньше 5. Результат неверен?

Он скорее ненадёжен, чем неверен. Приближение хи-квадрат предполагает достаточно большие ожидаемые частоты. Объедините редкие категории в более крупную группу или соберите больше данных.

Можно подставить проценты вместо частот?

Нет. Критерий зависит от фактического числа наблюдений, а проценты именно его и отбрасывают. Соотношение 60/40 из десяти человек и из десяти тысяч — совершенно разные свидетельства.

Какое V Крамера считается большим?

Грубый ориентир: 0,1 — слабая связь, 0,3 — умеренная, 0,5 — сильная. В отличие от χ², оно не растёт просто оттого, что вы собрали больше строк, — это и делает его честной мерой силы.

Что-нибудь загружается?

Нет. И ожидаемые частоты, и статистика, и p-значение считаются в вашем браузере.

Похожие утилиты

Все утилиты