Калькулятор t-критерия Стьюдента

Вставьте результаты измерений, чтобы проверить различие средних.

Вставьте числа через пробел, точку с запятой или с новой строки. Дробную часть можно отделять точкой или запятой.
Вставьте числа через пробел, точку с запятой или с новой строки. Дробную часть можно отделять точкой или запятой.

p-значение

0,107531

Вывод при α = 0,05Различие не подтверждено
t-статистика-1,8974
Степени свободы5,8824
Разность A − B-3
Наблюдений A / B5 / 5

Читайте объяснение ниже

Что проверяет t-критерий Стьюдента

Две группы разновесов рядом с лабораторными весами для сравнения результатов измерений

t-критерий проверяет, насколько наблюдаемое различие средних согласуется с предположением об отсутствии различия в исследуемых группах. Например, две линии фасуют одинаковый товар, но средняя масса пяти упаковок с первой линии оказалась выше. Тест учитывает величину этого расхождения, разброс масс и число проверенных упаковок. Ответом служит p-значение: чем оно меньше, тем труднее объяснить результат принятой моделью без различия средних.

Название «Стьюдент» появилось благодаря статистику Уильяму Госсету, публиковавшемуся под псевдонимом Student. Его работа «The Probable Error of a Mean» вышла в 1908 году и посвящалась неопределённости среднего при малом числе наблюдений. Сейчас семейство t-тестов используют и для небольших экспериментов, и для больших выборок. Само по себе число «меньше 30» не делает тест правильным: сначала нужно понять, как собраны данные.

Калькулятор принимает исходные числа и сам считает средние и выборочные отклонения. Для одной группы укажите значение, с которым сравнивается её среднее. Для двух независимых групп применяется критерий Уэлча. Для измерений одних и тех же объектов до и после изменения нужен парный вариант. Во всех режимах результат относится к средним количественного признака, например массе, времени или длине.

Как выбрать вид сравнения

Одна выборка и заданное среднее. Этот вариант подходит, когда есть один ряд измерений и заранее известный ориентир. Например, время операции сравнивают с нормативом 9 минут. Проверяемое число вводят отдельным полем. Это значение должно существовать независимо от среднего той же выборки: сравнение ряда с его собственным средним всегда даст нулевое расхождение.

Независимые группы. В выборках A и B находятся разные объекты: упаковки с двух линий, изделия двух поставщиков, участники двух отдельных групп. Число наблюдений может различаться. Критерий Уэлча оценивает разброс каждой группы отдельно и не требует считать их генеральные дисперсии равными. Все числа внутри сравнения должны описывать один и тот же признак в одинаковых единицах.

Парные измерения. Каждое значение A имеет конкретного партнёра B. Например, один прибор измеряет те же детали до и после настройки. Вставляйте по одной паре на строку, сохраняя соответствие деталей. Калькулятор вычитает B из A в каждой строке, а затем анализирует полученные разности. Если отдельно отсортировать два столбца, пары будут разрушены и проверка ответит уже на другой вопрос.

Одинаковая длина списков не означает, что наблюдения парные. Две группы по десять разных человек остаются независимыми. И наоборот, десять измерений до и после у тех же людей нельзя превращать в независимые только потому, что такой вариант дал меньшее p. Вид сравнения следует из устройства эксперимента.

От среднего к t и p

Во всех вариантах идея одна: наблюдаемое расхождение делится на его стандартную ошибку, то есть оценку случайного колебания этого расхождения при повторении выборки. Для одновыборочного теста формула выглядит так:

t=xˉ−μ0s/n,ν=n−1\displaystyle t=\frac{\bar{x}-\mu_0}{s/\sqrt{n}},\qquad \nu=n-1

Здесь x̄ обозначает среднее введённых чисел, μ₀ обозначает проверяемое среднее, s является выборочным стандартным отклонением, а n равно количеству наблюдений. Символ ν показывает число степеней свободы. При расчёте выборочной дисперсии сумму квадратов отклонений делят на n − 1. Разброс можно отдельно проверить в калькуляторе стандартного отклонения, выбрав выборочный вариант.

В парном тесте вместо исходных значений берутся разности dᵢ = Aᵢ − Bᵢ. Их среднее делится на стандартную ошибку этих же разностей:

t=dˉsd/n,ν=n−1\displaystyle t=\frac{\bar{d}}{s_d/\sqrt{n}},\qquad \nu=n-1

Поэтому большое колебание самих A и B не обязательно мешает обнаружить изменение. Детали могут сильно отличаться по размеру, но настройка прибора может сдвигать каждое измерение примерно одинаково. Для парного теста важна устойчивость разностей, а не сходство всех размеров между собой.

Для независимых групп используется формула Уэлча. Сначала оценивается стандартная ошибка разности средних:

SE=sA2nA+sB2nB,t=xˉA−xˉBSE\displaystyle SE=\sqrt{\frac{s_A^2}{n_A}+\frac{s_B^2}{n_B}},\qquad t=\frac{\bar{x}_A-\bar{x}_B}{SE}

Размеры групп обозначены nA и nB, их выборочные отклонения обозначены sA и sB. Число степеней свободы вычисляется по приближению Уэлча–Саттертуэйта и может быть дробным. Округлять его до целого перед получением p не нужно. Формулы и различие вариантов приведены в справочнике NIST по сравнению средних.

Знак t показывает направление: положительное число соответствует A больше B либо среднему выше заданного ориентира. Для двусторонней проверки учитываются оба направления отклонения, поэтому перестановка A и B меняет знак t, но сохраняет p. Для односторонней проверки направление имеет значение. Если t уже рассчитано в другой программе, его можно проверить через калькулятор p-значения.

Как читать результат

Уровень значимости α задают до проверки. При α = 0,05 калькулятор считает результат статистически значимым, когда неокруглённое p ≤ 0,05. При большем p вывод звучит как «различие не подтверждено». Это аккуратная формулировка: имеющихся наблюдений могло просто не хватить, чтобы обнаружить небольшое изменение на фоне сильного разброса.

p = 0,03 не означает, что вероятность ошибочной гипотезы равна 3%. Это вероятность получить столь же или более экстремальную статистику при нулевой гипотезе и принятых предпосылках. Также p не измеряет пользу эффекта. При большом числе наблюдений статистически значимым может оказаться сдвиг, который не имеет практического значения. Эти ограничения закреплены в заявлении Американской статистической ассоциации о p-значениях.

Поэтому рядом с p смотрите разность в исходных единицах. Экономия одной секунды на операции может быть важна на массовом производстве и незаметна в редкой ручной работе. Для оценки среднего одной выборки полезен также доверительный интервал: он показывает диапазон совместимых с данными значений при выбранном методе.

Одностороннюю альтернативу выбирают, если до получения данных интересовало конкретное направление. Нельзя увидеть положительный t, переключить тест на «больше» и представить это как заранее спланированную проверку. Такое переключение искусственно облегчает получение значимости. Для общего вопроса «различаются ли средние» оставляйте двусторонний вариант.

Примеры расчётов и выводов

Все примеры ниже учебные. Они позволяют повторить расчёт в форме и проверить, как вид сравнения, объём данных и направление вопроса меняют вывод.

Контроль времени операции. Пять независимых замеров дали 8, 9, 10, 11 и 12 минут. Проверяется среднее 9 минут. Выборочное среднее равно 10, стандартное отклонение примерно 1,5811, стандартная ошибка примерно 0,7071. Получаются t = 1,4142, четыре степени свободы и двустороннее p ≈ 0,2302. Различие на уровне 5% не подтверждено. Измеренная лишняя минута остаётся наблюдаемым фактом, но пяти замеров с таким разбросом недостаточно для выбранного вывода о среднем процесса.

Два способа обработки деталей. Для способа A время составило 1, 2, 3, 4 и 5 минут, для B получилось 2, 4, 6, 8 и 10 минут. Средние равны 3 и 6 минутам. При проверке Уэлча t ≈ −1,8974, ν ≈ 5,8824, p ≈ 0,1075. Несмотря на двукратное отношение средних, двусторонняя проверка не достигает уровня 5%. Разброс и малое количество деталей мешают отделить устойчивое различие от случайного. Из этих чисел нельзя честно обещать двукратное ускорение будущих работ.

Настройка измерителя. Для тех же пяти деталей показания A до настройки равны 8, 9, 10, 11 и 12 мм; показания B после неё равны 7, 7, 8, 8 и 9 мм. Разности A − B составляют 1, 2, 2, 3 и 3 мм, средняя разность равна 2,2 мм. Парный тест даёт t ≈ 5,8797, ν = 4, p ≈ 0,00418. Средний сдвиг значим даже при α = 0,01. Однако сам тест не устанавливает, какие показания ближе к истинному размеру: для этого нужен контрольный эталон.

Пилот из двух наблюдений. Две операции заняли 1 и 3 минуты, их среднее сравнивают с одной минутой. Получаются t = 1, ν = 1 и двустороннее p = 0,5. Рассчитать тест технически можно, но один удачный и один медленный запуск почти ничего не говорят о стабильности процесса. Для решения о смене технологии такой пилот следует расширить по заранее выбранному плану, а не записывать несколько новых результатов только до первого p ниже 0,05.

Вопрос только о замедлении. Вернёмся к двум способам обработки: A = 1, 2, 3, 4, 5 и B = 2, 4, 6, 8, 10. Если заранее проверяется, что A требует меньше времени, одностороннее p ≈ 0,05377. Оно всё ещё выше 0,05. Противоположный вопрос «A больше B» даёт p ≈ 0,94623. Один и тот же набор чисел отвечает по-разному на разные направленные гипотезы, поэтому направление записывают до сбора результатов.

Совпавшие средние. Две независимые контрольные группы дали одинаковые ряды 1, 2, 3. Здесь t = 0 и двустороннее p = 1. Отсутствие наблюдаемой разности не доказывает, что процессы эквивалентны с нужной точностью. Если допустима разница не больше 0,1 единицы, необходимо проверять именно такую границу отдельным методом. Большое p обычного t-теста на этот вопрос не отвечает.

Какие данные подходят для проверки

Наблюдения должны соответствовать выбранной модели независимости. Сто последовательных показаний одного датчика могут быть тесно связаны во времени и не заменяют сто независимых объектов. Несколько измерений каждой детали также нельзя бездумно считать отдельными деталями: так число наблюдений выглядит большим, а неопределённость оказывается заниженной.

При небольшой выборке особенно важны форма распределения и выбросы. Для одной выборки предполагается нормальная модель наблюдений, для парного теста нормальность относится к разностям. Уэлч снимает требование равных дисперсий, но не исправляет произвольную зависимость данных или редкие огромные значения. Увеличение выборки часто делает оценку среднего устойчивее, однако универсальной границы n, после которой любые данные подходят, нет.

Вставляйте результаты в одной размерности и с исходной точностью. Не смешивайте секунды с минутами, не заменяйте пропущенный результат нулём, не удаляйте неудобные наблюдения только потому, что после этого p стало меньше. Значение, полученное вследствие ошибки измерения, можно исключать по понятному заранее установленному правилу; само необычное число ошибкой ещё не является.

Вопросы о t-критерии

Проверка средних зависит от способа сбора данных. Различия между программами, постоянные значения и несколько групп требуют отдельных решений.

Почему результат отличается от t-теста в Excel?

Сначала сравните вид теста и число хвостов. Для независимых групп здесь применяется Уэлч: в Excel функции Т.ТЕСТ соответствует тип 3, парному тесту тип 1, предположению равных дисперсий тип 2. Есть тонкость: Т.ТЕСТ с одним хвостом использует модуль t и возвращает половину двустороннего p. Здесь направление задаётся явно, поэтому для эффекта против выбранного направления p будет больше 0,5. Для прямой сверки используйте два хвоста и одинаковые исходные числа.

Можно ли сравнить группы разного размера?

Да, в режиме независимых групп. Например, 12 наблюдений в A и 19 в B допустимы: каждая группа получает собственные среднее, дисперсию и объём. Для парных измерений нужна одна запись A и одна запись B на каждый объект. Если значение пары отсутствует, его нельзя заменить наблюдением от другого объекта.

Можно ли использовать t-критерий для трёх групп?

Один t-тест сравнивает только два средних либо одно среднее с заданным значением. Для трёх независимых групп обычно начинают с дисперсионного анализа, выбирая вариант под предпосылки данных. Набор отдельных t-тестов увеличивает вероятность ложного обнаружения различия; множественные сравнения требуют заранее выбранной корректировки.

Что делать, если все значения одинаковые?

Если стандартная ошибка равна нулю, отношение для t не определено, и калькулятор показывает ошибку. В парном режиме это происходит также при одинаковой ненулевой разности во всех парах. Проверьте округление и точность измерительного прибора. В тесте Уэлча постоянная одна группа допустима, если вторая имеет ненулевой разброс, но условия измерения всё равно требуют внимания.

Подходит ли t-тест для оценок от 1 до 5?

Такая шкала ограничена и обычно задаёт порядок ответов, а не равные интервалы между ними. Применимость проверки среднего требует содержательного обоснования, особенно при маленькой выборке или сильном скоплении ответов у границ. Сам факт, что ответы записаны цифрами, не делает их непрерывными измерениями. Для порядковых данных выбирают метод с подходящими предпосылками.

Нужно ли автоматически переходить на Манна–Уитни при ненормальности?

Нет. Критерий Манна–Уитни относится к другому вопросу о распределениях и без дополнительных условий не равнозначен проверке средних или медиан. Сначала выясните причину ненормальности, наличие выбросов, размеры групп и то, какой эффект нужно измерить. Переключать метод только ради меньшего p нельзя.

Можно ли сравнить средние, имея только среднее, отклонение и n?

Для одновыборочного теста и Уэлча этих сводных показателей достаточно, если отклонение выборочное. Эта форма рассчитывает их по исходным числам. Для парного теста отдельных средних и отклонений двух групп недостаточно: нужен разброс разностей или информация о связи между измерениями. Восстановить её по двум отдельным наборам сводных чисел нельзя.

Похожие калькуляторы

Возможно вам пригодятся ещё несколько калькуляторов по данной теме:

Есть что добавить?

Напишите своё мнение, комментарий или предложение.