Что показывает корреляция Пирсона

Коэффициент корреляции Пирсона показывает направление и тесноту линейной связи между двумя числовыми величинами. Его обозначают буквой r. Значение лежит от -1 до 1: положительный знак означает совместный рост X и Y, отрицательный означает, что при росте X величина Y обычно снижается. Чем ближе модуль r к 1, тем плотнее точки располагаются вдоль прямой.
Пара в одной строке относится к одному наблюдению: например, рекламные расходы за один день и заявки за тот же день. Первая колонка служит X, вторая Y. Если в таблице одна величина измерена утром, а другая на следующей неделе, сначала согласуйте периоды. Иначе точный расчёт ответит на плохо поставленный вопрос.
Диаграмма рассеяния нужна не для украшения ответа. Коэффициент сжимает облако точек в одно число, но не показывает изгиб, отдельный выброс или две смешанные группы. После расчёта раскройте график и проверьте, действительно ли точки напоминают полосу вокруг прямой. При наведении, касании или выборе точки стрелками появятся исходные X и Y.
Как устроен расчёт
Сначала для каждой колонки находится среднее. Затем из каждого значения вычитается своё среднее. Если большие X чаще встречаются вместе с большими Y, произведения отклонений обычно положительны. Если большим X соответствуют меньшие Y, произведения чаще отрицательны. Формула нормирует эту совместную изменчивость на разброс обеих колонок.
Здесь n означает число пар, а x̄ и ȳ обозначают средние по колонкам. Делить суммы на n или n - 1 в итоговой формуле не требуется: одинаковые множители сократятся. Если все X или все Y равны между собой, знаменатель равен нулю и корреляция не определена. Калькулятор показывает ошибку вместо придуманного нуля.
Такую нормировку использует и описание коэффициента Пирсона в справочнике NIST. Само вычисление не требует нормального распределения. Нормальность и независимость становятся важны, когда поверх r строят статистический тест или доверительный интервал. Здесь их нет: страница описывает введённые пары и не выдаёт коэффициент за доказанную связь во всей популяции.
Как читать значения от -1 до 1
r = 1 означает, что все точки лежат на возрастающей прямой, а r = -1 на убывающей. При r = 0 линейный тренд отсутствует, но зависимость иной формы вполне может быть. Жёсткой универсальной границы для «сильной» связи нет: в одних задачах 0,3 уже важно, в других 0,8 оставляет слишком много неопределённости для решения.
Знак зависит от порядка величин лишь внешне: если поменять колонки X и Y местами, r не изменится. Это отличает корреляцию от линейной регрессии, где X задаёт прогноз для Y, а перестановка ролей меняет модель. Если нужны отдельные средние и разброс по колонкам, сначала посчитайте их в калькуляторе стандартного отклонения.
Нельзя читать r = 0,8 как «Y растёт на 80%» или «X объясняет 80% причин». Коэффициент безразмерен. Для простой линейной модели квадрат r² равен доле вариации Y, объясняемой именно этой прямой на введённых данных, но даже такая формулировка не доказывает причинность.
Когда график меняет вывод
Реклама и заявки. Для пар расходов и заявок (10; 2), (20; 4), (30; 5), (40; 8) получается r ≈ 0,9812. В этой маленькой таблице рост расходов идёт рядом с ростом заявок. Но сезон, скидка и качество объявления не зафиксированы; прежде чем увеличивать бюджет, полезно сравнить стоимость заявки по дням.
Цена и спрос. При ценах 100, 120, 140, 160 и заказах 20, 16, 13, 9 коэффициент равен примерно -0,9985. Снижение спроса сопровождает рост цены почти по прямой. Четырёх наблюдений мало, чтобы объявить ценовую эластичность известной: акции и конкуренты могут менять картину.
Учёба и результат. Часы подготовки 1, 2, 3, 4 и баллы 55, 70, 72, 90 дают r ≈ 0,9634. Связь положительная, но по четырём ученикам нельзя вывести правило «каждый дополнительный час прибавит столько-то баллов». Для этого нужен другой дизайн данных и модель с оговорками.
Температура и отопление. При температуре 10, 20, 30, 40 градусов и условном расходе энергии 90, 70, 55, 30 получаем r ≈ -0,9954. Это пример обратной связи: в более тёплые дни на отопление тратится меньше. При переносе вывода на другой сезон сначала проверьте, что масштабы и режим здания остались сопоставимыми.
Связь в форме дуги. Пары (-1; 1), (0; 0), (1; 1) дают r = 0, хотя Y точно равен квадрату X. Это главный случай, ради которого стоит раскрыть диаграмму: числовой ответ «нет линейной связи» не равен «нет зависимости вообще».
Один далёкий день. Точки (1; 1), (2; 2), (3; 3) лежат на прямой. Добавьте (4; 20), и коэффициент станет примерно 0,8286. Он всё ещё положительный, но теперь гораздо хуже описывает первые три наблюдения. Выброс нельзя удалять автоматически: возможно, это ошибка записи, а возможно, редкое реальное событие.
Две пары. Для (1; 2) и (2; 4) получится r = 1, потому что через две точки всегда проходит прямая. Математически ответ верен, но о воспроизводимости связи почти ничего не сообщает. Добавьте новые наблюдения, прежде чем делать практический вывод.
Какие пары можно сравнивать
Обе колонки должны содержать числовые значения для одних и тех же объектов или периодов. Годы и продажи, рост и масса человека, время доставки и оценка клиента образуют пары. Два списка разной длины без явного соответствия не образуют. Не стоит сортировать колонки отдельно: такое действие разорвёт исходные пары и изменит r.
Из электронной таблицы выделите ровно два столбца и вставьте их целиком. Табуляция сохранит границу между X и Y. Можно также написать два числа через пробел или точку с запятой, по одной паре на строку. Дробную часть разрешено отделять запятой или точкой. Запятая между столбцами намеренно не принята: запись «1,2» неоднозначна, ведь в русской нотации это одно число.
Сравнивайте связь в пределах сопоставимого масштаба и не прячьте группы. Если в одном облаке смешаны будни и праздники, положительный общий r может возникнуть за счёт различия групп, а внутри каждой группы исчезнуть или сменить знак. Перед объединением полезно посмотреть на точки и на механизм появления данных.
Частые вопросы
Эти случаи помогают не принять красивое число за ответ на другой статистический вопрос.
Чем корреляция Пирсона отличается от Спирмена?
Пирсон измеряет тесноту линейной связи исходных чисел. Спирмен сравнивает ранги и может обнаружить монотонную, но нелинейную связь. Если облако точек изгибается, выбор метода зависит от вопроса, а не от того, какой коэффициент больше.
Может ли корреляция быть больше единицы?
Нет. Для корректно рассчитанного коэффициента Пирсона диапазон всегда от -1 до 1. Значение за его пределами указывает на ошибку формулы или данных; микроскопический выход из-за машинного округления можно ограничить границей.
Можно ли считать корреляцию по процентам?
Да, если каждый процент относится к сопоставимому объекту или периоду и смысл пар не меняется. Но проценты с общим знаменателем иногда связаны механически, поэтому сперва проверьте, как они были получены.
Почему связь исчезает после добавления новых данных?
Корреляция описывает именно выбранный набор пар. Новые периоды могут охватить иной диапазон X, другую группу или выброс. Проверьте диаграмму и условия измерения до сравнения старого и нового коэффициентов.
Можно ли вычислить корреляцию, если все X одинаковы?
Нет. При нулевом разбросе X нельзя сравнить совместное изменение X и Y, поэтому знаменатель формулы равен нулю. Нужны наблюдения с разными X; искусственно добавлять шум ради числа не следует.
Положительная корреляция доказывает причинную связь?
Нет. Обе величины могут зависеть от третьего фактора, а порядок причин может быть обратным. Чтобы проверить причинность, нужны временная логика, контроль смешивающих факторов и подходящий дизайн исследования.
Как быть с пропущенной парой в таблице?
Удалите всю строку наблюдения либо восстановите пропуск обоснованным методом вне этого калькулятора. Нельзя сдвинуть одну колонку вверх: после такого сдвига X и Y будут относиться к разным объектам.
Почему нельзя просто читать r как процент совпадения?
Коэффициент сравнивает форму совместного изменения, а не долю одинаковых значений. X может измеряться в часах, Y в рублях, и совпадать им буквально не требуется.
Похожие калькуляторы
Возможно вам пригодятся ещё несколько калькуляторов по данной теме:
- Калькулятор линейной регрессии. Вставьте пары чисел, чтобы построить прямую и сделать прогноз.
- Калькулятор стандартного отклонения. Вставьте список чисел и найдите среднее, дисперсию и стандартное отклонение.
- Калькулятор среднего, медианы и моды. Вставьте список чисел и сравните среднее, медиану, моду и размах.
- Обычный калькулятор. Просто посчитайте чего вы там хотели.
- Рандомайзер: генератор случайных чисел. Выберите случайное число в нужном диапазоне для любых целей, в частности для розыгрышей и онлайн-лотерей в соцсетях.
- Бросить монетку онлайн. С помощью данной формы вы можете подбросить монетку онлайн любое количество раз.
- Калькулятор корней. Найдите правильное решение корней n-степени, включая квадратные и кубические.
- Калькулятор дробей. Введите целые части, числители и знаменатели, чтобы получить решение.
- Калькулятор квадратных уравнений. Решите квадратные уравнения с помощью специальных формул, через дискриминант и по теореме Виета. Все способы решения сопровождаются примерами.
- Калькулятор дискриминанта. Введите коэффициенты a, b и c: получите дискриминант и число действительных корней.
Есть что добавить?
Напишите своё мнение, комментарий или предложение.