Что проверяет критерий хи-квадрат

Критерий хи-квадрат сравнивает количество случаев по категориям. Он помогает проверить, похоже ли распределение наблюдений на заранее заданное, или связаны ли два категориальных признака. Например, одинаково ли часто выбирают три варианта доставки и зависит ли выбор от группы покупателей. Ответ включает статистику χ² и p-value: меру того, насколько необычно такое расхождение при проверяемом предположении.
Метод носит имя Карла Пирсона, математика и статистика, который в 1900 году предложил критерий для проверки согласия наблюдений с теоретическим распределением. Греческая буква χ читается «хи», поэтому запись χ² называют «хи-квадрат». Квадрат здесь относится к статистике, а числа наблюдений в таблице нужно вводить обычными.
Категории описывают виды или группы: курьер, пункт выдачи, самовывоз; согласен, не согласен; первая и вторая смена. В ячейке стоит число случаев, например 24 заказа. Среднее время доставки 24 минуты имеет другой смысл и для такой таблицы не подходит. Если сравниваете два набора числовых измерений, начните с вопроса о средних и t-критерия Стьюдента.
Как выбрать режим и подготовить частоты
Режим «Согласие с распределением» нужен, когда ожидаемые доли известны до анализа. Для трёх равновероятных вариантов в выборке из 90 ответов ожидается по 30 случаев. В каждой строке введите фактическое число, затем ожидаемое. Допустим, получено 20, 30 и 40 ответов: строки будут «20 30», «30 30», «40 30». Обе колонки относятся к одним и тем же 90 наблюдениям.
Ожидаемая частота может быть дробной. При 100 наблюдениях и трёх равных долях получится по 33,333… случая. Это среднее число, которое предсказывает модель при многократном повторении опыта, поэтому округлять его до целого не нужно. Вставьте достаточно знаков после запятой, чтобы сумма ожиданий совпадала с числом наблюдений; калькулятор допускает лишь небольшое расхождение из-за записи дробей.
В режиме «Независимость признаков» ожидания рассчитываются автоматически. Строки обозначают категории одного признака, столбцы другого. Например, строки соответствуют двум группам покупателей, а три столбца способам доставки. Вставляйте только внутренние ячейки таблицы, без заголовков и итогов. Если добавить строку «всего», одни и те же люди будут посчитаны повторно.
Поддерживается вставка из электронной таблицы: столбцы разделяются табуляцией, пробелом или точкой с запятой, строки переносом. Запятая служит десятичным знаком. Для согласия можно указать от 2 до 100 категорий; для независимости таблицу от 2 × 2 до 20 × 20. В наблюдениях допустимы целые неотрицательные числа, а ожидаемые значения должны быть строго положительными.
От частот к статистике и p-value
Сначала для каждой категории находится разность наблюдаемой и ожидаемой частот. Она возводится в квадрат и делится на ожидаемую частоту. Благодаря квадрату избыток в одной категории не погашает недостаток в другой. Деление учитывает масштаб: отклонение на 10 случаев от ожидания 20 весит больше, чем отклонение на те же 10 от ожидания 200.
Здесь O обозначает наблюдаемую частоту, E ожидаемую, а k число категорий. Статистика неотрицательна. При полном совпадении всех частот χ² = 0. Чем сильнее расхождение относительно ожидаемых частот, тем больше χ². Эта формула критерия согласия приведена в статистическом справочнике NIST.
Для таблицы сопряжённости ожидаемое число в ячейке получается из итогов её строки и столбца. Допустим, в первой группе 40 из 100 человек, а первый вариант выбрали 30 из 100. При независимости ожидается 40 × 30 / 100 = 12 человек на пересечении первой группы и первого варианта.
R обозначает сумму строки, C сумму столбца, N число всех наблюдений. Полученные ожидания подставляются в ту же формулу χ². Размеры групп могут различаться: метод сравнивает распределение по категориям с учётом этих размеров, а не требует одинакового количества людей в каждой строке.
Одного χ² для вывода недостаточно. Нужно число степеней свободы, или df, которое определяет распределение статистики при нулевой гипотезе. Для согласия с заранее заданными частотами df = k − 1. Для таблицы из r строк и c столбцов df = (r − 1)(c − 1). У таблицы 2 × 3 получаются две степени свободы, у 3 × 3 четыре.
p-value вычисляется по правому хвосту распределения: это вероятность получить такое же или большее χ², если нулевая гипотеза и условия метода верны. Чем меньше p, тем хуже наблюдаемое расхождение согласуется с этой гипотезой. Выбирать левый или двусторонний хвост здесь не требуется: большие отклонения уже собраны в неотрицательную статистику.
Что означает вывод при уровне значимости 5%
Уровень значимости α выбирают до просмотра результата. При α = 0,05 и p ≤ 0,05 нулевую гипотезу отвергают. В режиме согласия это свидетельство отличия от заданного распределения. В режиме независимости это свидетельство связи признаков. Если p больше порога, данных недостаточно для такого вывода.
p = 0,03 не означает, что гипотеза верна с вероятностью 3%, и не говорит, что эффект составляет 3%. Это вероятность определённого или более сильного расхождения при условии гипотезы. Для отдельной проверки уже известной статистики можно использовать калькулятор p-value, указав χ² и df.
Решение принимается по числу до округления. Например, p = 0,0500004 больше 0,05, хотя короткая запись может выглядеть как «0,05». Результат рядом с порогом лучше описывать точным p, размером выборки и условиями сбора данных. Переключение α после расчёта ради нужного вывода меняет заранее установленное правило проверки.
Статистическая значимость также не доказывает причинность. Если выбор доставки связан с возрастной группой, причиной могут быть география, стоимость или ассортимент. Сам тест не отделяет эти объяснения и не показывает величину практической пользы. Для решения нужно посмотреть на исходные доли и понять, как получены наблюдения.
Примеры для разных задач
Проверка заранее заданных долей. В шести категориях наблюдается 16, 18, 16, 14, 12 и 12 случаев, а ожидается 16, 16, 16, 16, 16 и 8. Сумма каждой колонки 88. Получаем χ² = 3,5, df = 5 и p ≈ 0,623388. При α = 0,05 оснований отвергнуть такое распределение нет. Самое заметное отличие в последней категории ещё не делает весь результат статистически значимым.
Равные варианты ответа. Сто человек выбрали три варианта 20, 30 и 50 раз. При гипотезе равного интереса ожидается по 100/3 случаев. χ² = 14, df = 2, p ≈ 0,000912. Равенство долей отвергается при всех трёх доступных уровнях значимости. Дальше полезно сравнить сами доли 20%, 30% и 50%; общий тест не выдаёт отдельное p для каждой пары вариантов.
Доставка в двух группах. В первой группе три способа доставки выбрали 10, 10 и 20 человек, во второй 20, 20 и 20. Таблица имеет вид «10 10 20» и «20 20 20». Ожидания равны 12, 12, 16 и 18, 18, 24. Получаем χ² ≈ 2,777778, df = 2, p ≈ 0,249352. Выбор третьего способа выглядит разным, но этих данных недостаточно, чтобы отвергнуть независимость на уровне 5%.
Группы разного размера. В одной группе ответы «да/нет» распределились как 20 и 30, в другой как 40 и 60. Абсолютных ответов «да» во второй вдвое больше, однако доля в обеих группах составляет 40%. Ожидания совпадают с наблюдениями, χ² = 0, df = 1 и p = 1. Сравнивать одни количества без знаменателей в этом случае было бы ошибкой.
Совпадение в крошечной выборке. Два человека выбрали разные варианты: наблюдаемые частоты 1 и 1, ожидаемые тоже 1 и 1. Формально χ² = 0 и p = 1. Но оба ожидания меньше 5, поэтому появляется предупреждение. Красивое совпадение в двух ответах не подтверждает распределение во всей аудитории; для такого объёма нужны подходящий точный метод и осторожная интерпретация.
Ни одного случая в категории. Из десяти независимых наблюдений все попали во вторую из двух заранее равновероятных категорий. Введите строки «0 5» и «10 5». Получатся χ² = 10, df = 1 и p ≈ 0,001565. Ноль среди наблюдений допустим: ожидаемые частоты положительны. Это приближённый результат Пирсона; для десяти бинарных исходов можно отдельно проверить точную биномиальную вероятность.
Когда приближение может подвести
Распределение χ² даёт приближение, качество которого зависит от ожидаемых частот. Простой осторожный ориентир: каждая ожидаемая частота не меньше 5. Калькулятор отмечает все случаи ниже этого уровня. Большое суммарное N само по себе не спасает таблицу, если почти все наблюдения скопились в одной категории, а остальные ожидания малы.
Для малой таблицы 2 × 2 часто выбирают точный тест Фишера. Для больших разреженных таблиц применяют точные или имитационные методы. Объединять категории допустимо только при содержательном основании и понятном плане анализа. Склеить неудобные столбцы после просмотра p, чтобы получить значимость, значит изменить вопрос уже после получения ответа.
Каждое наблюдение должно вносить один независимый вклад. Если один человек ответил пять раз, пять строк не становятся пятью независимыми людьми. В обычной таблице признаки также должны разбивать наблюдения на взаимно исключающие категории: один заказ не относится одновременно к двум способам доставки. Для множественного выбора нужна другая постановка анализа.
Здесь рассчитывается классический критерий Пирсона без поправки Йейтса. Поправка меняет статистику таблиц 2 × 2, а некоторые программы включают её по умолчанию. Она не превращает приближение в точный тест и не устраняет зависимость повторных наблюдений. При сравнении результатов всегда проверяйте название метода, настройки поправки и число степеней свободы.
Частые вопросы
Проценты, повторные ответы и параметры, подобранные по выборке, могут выглядеть как обычные частоты, но требуют другого расчёта. Эти случаи полезно проверить до переноса таблицы в отчёт.
Можно ли подставить проценты вместо количества случаев?
Нет. Таблицы 20 и 80 человек и 200 и 800 человек имеют одинаковые доли, но разный объём информации. Подстановка процентов стирает размер выборки и меняет p-value. Если известны только проценты, восстановите абсолютные частоты по исходному числу наблюдений; округлённые проценты могут не позволить сделать это однозначно.
Почему Excel, R или SPSS показывают другой результат?
Сначала сравните один и тот же тест. Excel ХИ2.ТЕСТ возвращает p-value, а не саму статистику χ². В R для таблицы 2 × 2 может по умолчанию применяться поправка Йейтса. SPSS показывает несколько строк: Пирсон, поправка на непрерывность и другие варианты. Здесь нужен результат Пирсона без поправки, с теми же исходными частотами и степенями свободы.
Как считать степени свободы, если распределение подобрано по выборке?
В ряде стандартных моделей из k − 1 дополнительно вычитают число оценённых параметров. Но правильность такой поправки зависит от способа оценки и устройства модели. Режим согласия на этой странице рассчитан на заранее заданные частоты и не выполняет подгонку. Для проверки подобранного нормального или другого распределения используйте специализированную процедуру.
Нужно ли прибавлять единицу к нулевым ячейкам?
Нет. Ноль среди наблюдаемых частот сам по себе допустим, если соответствующее ожидание положительно. Искусственное добавление единицы меняет объём выборки и результат. Полностью пустую строку или столбец следует убрать. Если сочетание категорий принципиально невозможно, это структурный ноль: обычная проверка независимости для такой таблицы не подходит.
Подходит ли тест для ответов до и после у тех же людей?
Обычный тест независимости не учитывает парность таких данных. Для двух бинарных ответов до и после используют критерий Мак-Немара, которому нужны числа людей, изменивших ответ в каждом направлении. Две отдельные суммы «да» и «нет» теряют эту информацию и не заменяют таблицу переходов.
Доказывает ли большое p-value независимость признаков?
Нет. Большое p означает, что выбранный тест не нашёл достаточных оснований отвергнуть независимость. Небольшая выборка может не обнаружить реальную связь. Для доказательства практически малых различий задают содержательно важную границу эффекта и планируют соответствующую проверку, а не просто ищут p больше 0,05.
Чем этот критерий отличается от корреляции Пирсона?
Хи-квадрат работает с числами случаев в категориях, например с выбором доставки в разных группах. Корреляция Пирсона измеряет линейную связь двух числовых величин для одних и тех же объектов, например роста и массы. Одинаковая фамилия не делает методы взаимозаменяемыми; коды категорий 1, 2 и 3 не превращают их в осмысленную числовую шкалу.
Похожие калькуляторы
Возможно вам пригодятся ещё несколько калькуляторов по данной теме:
- Калькулятор корреляции. Вставьте пары чисел, чтобы измерить силу линейной связи.
- Калькулятор p-value. Введите статистику критерия, чтобы найти p-значение для проверки гипотезы.
- Калькулятор t-критерия Стьюдента. Вставьте результаты измерений, чтобы проверить различие средних.
- Обычный калькулятор. Просто посчитайте чего вы там хотели.
- Рандомайзер: генератор случайных чисел. Выберите случайное число в нужном диапазоне для любых целей, в частности для розыгрышей и онлайн-лотерей в соцсетях.
- Бросить монетку онлайн. С помощью данной формы вы можете подбросить монетку онлайн любое количество раз.
- Калькулятор корней. Найдите правильное решение корней n-степени, включая квадратные и кубические.
- Калькулятор дробей. Введите целые части, числители и знаменатели, чтобы получить решение.
- Калькулятор квадратных уравнений. Решите квадратные уравнения с помощью специальных формул, через дискриминант и по теореме Виета. Все способы решения сопровождаются примерами.
- Калькулятор дискриминанта. Введите коэффициенты a, b и c: получите дискриминант и число действительных корней.
Есть что добавить?
Напишите своё мнение, комментарий или предложение.