Ваши данные
Вставьте таблицу прямо из Excel или Google Таблиц либо перетащите CSV-файл. Никуда ничего не загружается — весь расчёт идёт внутри этой вкладки браузера.
CSV, TSV или обычный текст. Файлы в windows-1251 распознаются и перечитываются автоматически, поэтому кириллица в заголовках не превращается в кракозябры.
Настройки разбора
Столбцы
Результат
Сохранить и поделиться
Библиотека отрисовки скачивается только при нажатии кнопки и только на этой странице.
Все вычисления выполняются локально в браузере: разбор, график, экспорт. Если отключите сеть, страница продолжит работать.
Факты и границы применимости
| Что измеряет | Монотонную связь — последовательно растущую или падающую, не обязательно линейную |
|---|---|
| Метод | Корреляция Пирсона, посчитанная по рангам, а не по значениям |
| Обработка совпадений | Совпадающие значения получают средний ранг занимаемых позиций |
| Устойчивость | Экстремальное значение становится просто наивысшим рангом и не может доминировать |
| p-значение | Точное, через распределение Стьюдента с n−2 степенями свободы |
| Минимум строк | 3, а осмысленно — около 20 |
Когда этот метод вводит в заблуждение
- Ранги полностью отбрасывают величину. Скачок с 88 до 260 в данных-образце превращается в шаг на один ранг — точно такой же, как скачок с 44 до 45. Это и делает Спирмена устойчивым, и это же лишает его способности сообщить, насколько что-либо велико.
- Он обнаруживает только монотонные связи. U-образная связь даёт ρ около нуля так же, как и у Пирсона: устойчивость к выбросам — не устойчивость к кривизне, меняющей направление.
- Обилие совпадений его ослабляет. Если в столбце много повторяющихся значений, крупные блоки строк делят усреднённый ранг и коэффициент теряет разрешение; на столбце всего из трёх различных значений Спирмен почти бессмыслен.
- Высокое ρ не означает пропорциональной связи. Оно говорит, что порядок совпадает, а это допускает любую монотонную форму, включая такие, где малое изменение в одном столбце соответствует огромному в другом.
Как это считается
Каждый столбец переводится в ранги: наименьшее значение получает ранг 1, следующее — 2 и так далее. Затем по этим двум ранговым столбцам считается корреляция Пирсона — это и есть определение ρ Спирмена.
Совпадающие значения получают средний ранг занимаемых ими позиций. Если три строки делят одно значение на позициях 4, 5 и 6, все три получают ранг 5. Это важно: раздача им 4, 5 и 6 в произвольном порядке внесла бы фальшивую упорядоченность и систематически завышала бы коэффициент.
Устойчивость следует прямо из ранжирования. В данных-образце одна зарплата в 260 стоит среди значений от сорока до восьмидесяти: у Пирсона она доминирует над всем расчётом, а у Спирмена это просто ранг 14, вносящий ровно столько же, сколько любая другая строка.
p-значение выводится так же, как для Пирсона: через статистику t с n−2 степенями свободы и точную неполную бета-функцию. На очень малых выборках для ρ это приближение, и результат лучше читать как ориентировочный, а не окончательный.
Вопросы и ответы
Когда выбирать Спирмена вместо Пирсона?
Когда на диаграмме рассеяния видна последовательно растущая или падающая связь, не являющаяся прямой; когда в данных есть выбросы, которые не хочется удалять; или когда столбцы — это рейтинги и оценки, а не измерения.
Почему мой Спирмен так отличается от Пирсона?
Обычно по одной из двух причин: выброс завышает Пирсона либо связь искривлена. Сопоставьте их с диаграммой рассеяния — само расхождение двух коэффициентов диагностично.
Как обрабатываются совпадающие значения?
Они получают средний ранг занимаемых позиций. Это стандартный метод, и он не даёт произвольному порядку равных значений породить корреляцию, которой нет.
Можно применять Спирмена к оценкам от 1 до 5?
Да, и для них это правильный выбор: Пирсон предполагает, что расстояние от 1 до 2 равно расстоянию от 4 до 5, а именно этого шкала оценок не гарантирует. Только следите за обилием совпадений.
Что-нибудь загружается?
Нет. И ранжирование, и корреляция выполняются в вашем браузере.