Блог
Статистика по данным

Калькулятор корреляции Пирсона онлайн

r Пирсона измеряет, насколько близко два столбца подходят к прямолинейной связи, по шкале от −1 до +1. Одного коэффициента мало, поэтому рядом считается p-значение: на восьми строках r = 0,6 ничем не примечательно, а на восьмистах — решающе.

Ваши данные

Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.

CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.

Настройки разбора

Столбцы

Результат

Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.

Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.

Факты и границы применимости

Диапазон от −1 до +1; 0 означает отсутствие линейной связи
Что измеряет Только линейную связь
R² Квадрат r — доля дисперсии одного столбца, объяснённая другим
p-значение Точное, из распределения Стьюдента с n−2 степенями свободы
Метод p-значения Регуляризованная неполная бета-функция, а не нормальное приближение
Минимум строк 3, а осмысленно — около 20

Когда этот метод вводит в заблуждение

Как это считается

Коэффициент — это ковариация двух столбцов, делённая на произведение их стандартных отклонений. Именно это деление убирает единицы измерения и запирает результат в диапазон от −1 до +1, — поэтому r можно сравнивать между совершенно разными парами величин.

Строки используются, только когда присутствуют оба значения. Строка с одним числом и одной пустой ячейкой отбрасывается парой и подсчитывается, а число отброшенных сообщается: молча оставить половину пары значило бы сместить результат в невидимую сторону.

p-значение получается переводом r в статистику t с n−2 степенями свободы и вычислением точной хвостовой вероятности через регуляризованную неполную бета-функцию. Многие калькуляторы применяют здесь нормальное приближение; на малых выборках оно занижает p-значение и делает слабые связи значимыми на вид.

R² выдаётся потому, что именно оно поддаётся истолкованию. r = 0,7 звучит как «почти всё», но R² = 0,49 говорит, что второй столбец объясняет чуть меньше половины вариации первого, — и это куда более честная сводка.

Вопросы и ответы

Какая корреляция считается сильной?

Грубый ориентир: выше 0,7 — сильная, 0,4–0,7 — умеренная, 0,2–0,4 — слабая. Но контекст важнее: 0,3 впечатляет в социальных науках и разочаровывает в физике.

p-значение значимо, а r крошечный. Что это значит?

Что у вас много строк. Значимость говорит, что связь, вероятно, не равна нулю; она ничего не говорит о том, достаточно ли связь велика, чтобы на неё реагировать. Для этого смотрите на R².

Пирсон или Спирмен?

Пирсон, когда связь выглядит линейной и нет экстремальных выбросов. Спирмен, когда связь монотонна, но искривлена, или когда выбросы есть: он работает с рангами, и исказить его гораздо труднее.

Почему корреляция так сильно изменилась после удаления одной строки?

Потому что Пирсон очень чувствителен к выбросам. Если одна строка существенно двигает r, корреляция является свойством этой строки, а не набора данных. Посмотрите диаграмму рассеяния и подумайте о Спирмене.

Мои данные загружаются?

Нет. И коэффициент, и p-значение считаются в вашем браузере.

Обратная утилита

Нужно наоборот? Корреляция Спирмена Ранговая корреляция — устойчива к выбросам и к искривлённым связям

Похожие утилиты

Все утилиты