Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Столбцы
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.
Факты и границы применимости
| Диапазон | от −1 до +1; 0 означает отсутствие линейной связи |
|---|---|
| Что измеряет | Только линейную связь |
| R² | Квадрат r — доля дисперсии одного столбца, объяснённая другим |
| p-значение | Точное, из распределения Стьюдента с n−2 степенями свободы |
| Метод p-значения | Регуляризованная неполная бета-функция, а не нормальное приближение |
| Минимум строк | 3, а осмысленно — около 20 |
Когда этот метод вводит в заблуждение
- Корреляция — не причинность, и это не формальность. В данных-образце расходы на рекламу и продажи растут вместе, но оба ещё и растут в течение года; третья величина, влияющая на обе, — самое частое объяснение любой сильной корреляции в бизнес-данных.
- Пирсон видит только прямые. Идеальная парабола — продажи растут с ценой до какой-то точки и падают после неё — может дать r около нуля, хотя две величины полностью определяют друг друга. Всегда смотрите на диаграмму рассеяния.
- Один выброс способен создать или уничтожить корреляцию. Одна экстремальная точка вдали от облака вытягивает r с 0,1 до 0,8, а её удаление возвращает r обратно. Устойчивая замена — корреляция Спирмена.
- Статистическая значимость — не важность. На 10 000 строк r = 0,03 имеет крошечное p-значение и объясняет 0,09% дисперсии: реально, измеримо и бесполезно.
Как это считается
Коэффициент — это ковариация двух столбцов, делённая на произведение их стандартных отклонений. Именно это деление убирает единицы измерения и запирает результат в диапазон от −1 до +1, — поэтому r можно сравнивать между совершенно разными парами величин.
Строки используются, только когда присутствуют оба значения. Строка с одним числом и одной пустой ячейкой отбрасывается парой и подсчитывается, а число отброшенных сообщается: молча оставить половину пары значило бы сместить результат в невидимую сторону.
p-значение получается переводом r в статистику t с n−2 степенями свободы и вычислением точной хвостовой вероятности через регуляризованную неполную бета-функцию. Многие калькуляторы применяют здесь нормальное приближение; на малых выборках оно занижает p-значение и делает слабые связи значимыми на вид.
R² выдаётся потому, что именно оно поддаётся истолкованию. r = 0,7 звучит как «почти всё», но R² = 0,49 говорит, что второй столбец объясняет чуть меньше половины вариации первого, — и это куда более честная сводка.
Вопросы и ответы
Какая корреляция считается сильной?
Грубый ориентир: выше 0,7 — сильная, 0,4–0,7 — умеренная, 0,2–0,4 — слабая. Но контекст важнее: 0,3 впечатляет в социальных науках и разочаровывает в физике.
p-значение значимо, а r крошечный. Что это значит?
Что у вас много строк. Значимость говорит, что связь, вероятно, не равна нулю; она ничего не говорит о том, достаточно ли связь велика, чтобы на неё реагировать. Для этого смотрите на R².
Пирсон или Спирмен?
Пирсон, когда связь выглядит линейной и нет экстремальных выбросов. Спирмен, когда связь монотонна, но искривлена, или когда выбросы есть: он работает с рангами, и исказить его гораздо труднее.
Почему корреляция так сильно изменилась после удаления одной строки?
Потому что Пирсон очень чувствителен к выбросам. Если одна строка существенно двигает r, корреляция является свойством этой строки, а не набора данных. Посмотрите диаграмму рассеяния и подумайте о Спирмене.
Мои данные загружаются?
Нет. И коэффициент, и p-значение считаются в вашем браузере.