Тест одной доли

Укажите число успехов и попыток, чтобы проверить заданную долю.

Число испытаний n
Успехом называется выбранный исход: ответ «да», покупка, дефект или отказ. Посчитайте его появления.
Проверяемая доля p₀
%

p-значение

0,0413895

Сравнение с αp ≤ 5%
Нулевая гипотезаОтклоняется

Что проверяет тест одной доли

Образцы деталей разделены на прошедшие и не прошедшие проверку

Тест одной доли проверяет, согласуется ли число выбранных исходов с заданным процентом. Например, 15 человек из 20 выбрали первый эскиз. Можно проверить, похоже ли это на случайное отклонение от равного выбора, когда каждому варианту отдают предпочтение 50% людей. Точный биномиальный тест даёт для такой двусторонней проверки p ≈ 0,0413895.

Каждое наблюдение должно иметь два исхода: человек выбрал первый эскиз или второй, деталь прошла проверку или не прошла. Один исход условно называют успехом. Слово звучит радостно, но в статистике успехом может быть и обнаруженный дефект. Главное, заранее выбрать, что именно вы считаете, и не менять определение внутри выборки.

Исходное предположение называют нулевой гипотезой H₀. Здесь оно утверждает, что вероятность успеха равна заданной доле p₀. P-значение показывает, насколько необычным оказался результат при этой модели и выбранном направлении проверки. Чем меньше p, тем хуже данные согласуются с H₀. Вероятность истинности самой гипотезы из него не получается.

Какие данные подходят для расчёта

Нужны два целых числа: количество испытаний n и количество успехов k. В примере с эскизами это 20 и 15. Проверяемую долю вводят в процентах: для равного выбора укажите 50, для доли дефектов 2% укажите 2. Наблюдаемая доля получается делением k на n; вычислять и округлять её перед вводом не требуется.

Биномиальная модель предполагает независимые испытания с одинаковой вероятностью успеха. Десять голосов одного человека не становятся десятью независимыми мнениями. Повторные проверки одной детали тоже могут быть связаны: её скрытый дефект никуда не исчезает между измерениями. В таких данных простого подсчёта успехов недостаточно.

Объём наблюдений и правило остановки задают до анализа. Если отбирать предметы без возвращения из небольшой конечной партии, вероятность очередного успеха меняется вслед за составом остатка. Для такого механизма биномиальная модель может не подойти. Если же нужно узнать вероятность конкретного числа событий при известной доле, без проверки гипотезы, используйте биномиальное распределение.

Как выбираются исходы для p-значения

Под гипотезой H₀ вероятность ровно j успехов считается по формуле ниже. Символ C обозначает число способов выбрать j успешных испытаний из n, а p₀ записывается долей от 0 до 1. Например, 20% соответствуют p₀ = 0,2.

b(j)=(nj)p0j(1−p0)n−j\displaystyle b(j)=\binom{n}{j}p_0^j(1-p_0)^{n-j}

Для альтернативы «меньше» складываются вероятности от нуля до наблюдаемого k. Для альтернативы «больше» складываются вероятности от k до n. Само наблюдаемое число входит в обе суммы. Так, при 3 дефектах из 15 правосторонняя проверка учитывает 3, 4 и все последующие количества дефектов до 15.

Двусторонняя проверка устроена иначе: она складывает вероятности всех количеств успехов, которые при H₀ не вероятнее наблюдаемого. Это правило используется в точном биномиальном тесте R и SciPy. При несимметричном распределении нельзя просто удвоить меньший односторонний хвост и ожидать тот же ответ.

pдвустороннее=∑j: b(j)≤b(k)b(j)\displaystyle p_{\text{двустороннее}}=\sum_{j:\,b(j)\le b(k)} b(j)

Слово «точный» означает, что тест использует дискретную биномиальную модель без замены нормальной кривой. Оно не обещает безошибочный вывод по любой выборке. При малом n возможных результатов мало, поэтому p меняется скачками, а не плавно. Нормальное приближение может дать другое число, особенно возле границ 0 и 100%.

Примеры проверки заданного процента

Во всех примерах уровень значимости выбран заранее: α = 0,05. При p ≤ α гипотеза отклоняется. Важно повторить направление проверки вместе с числами: вопрос «изменилась ли доля» отличается от вопроса «стала ли она меньше».

Выбор эскиза. Первый вариант предпочли 15 из 20 независимых участников. Проверяем 50% в обе стороны и получаем p ≈ 0,0413895. Основания отклонить равный выбор есть. Но выборка из коллег по одному офису не обязательно описывает покупателей по всей стране: статистическая проверка не исправляет способ отбора людей.

Дефекты выше ориентира. При проверке 15 изделий обнаружены 3 дефекта. Для ориентира 10% выбираем «больше»: p ≈ 0,184061. Наблюдаемые 20% выглядят вдвое хуже цели, но этой небольшой выборки недостаточно, чтобы отклонить H₀ на уровне 5%. Решение о ремонте опасного оборудования при этом нельзя сводить к одному статистическому порогу.

Отказы после доработки. В 50 независимых испытаниях не случилось ни одного отказа. Против заранее заданной доли 10% проверяем снижение и получаем p ≈ 0,00515378. Это свидетельство в пользу меньшей доли. Если прежние 10% сами оценены по маленькой партии, их неопределённость нужно учитывать отдельно: здесь ориентир считается заданным.

Несимметричная вероятность ответа. Из 10 приглашённых ответили 3 человека, заданная доля ответов составляет 20%. Двустороннее p равно 0,429574656. Удвоение меньшего одностороннего хвоста дало бы 0,6444009472. В обоих случаях результат незначим на 5%, но сами числа различаются. При сверке с другим инструментом сначала проверьте определение двустороннего теста.

Короткая серия без успехов. Получено 0 успехов из 5 при ожидаемых 50%. Двустороннее p равно 0,0625, H₀ не отклоняется. Даже пять неудач подряд ещё не пересекли выбранный порог. При этом интервал Уилсона 95% составляет от 0 до 43,45% и не включает 50%. Ниже объясняется, почему эти два вывода не стоит смешивать.

Проверка строгих 100%. Из 10 изделий проверку прошли 9. При гипотезе p₀ = 100% и альтернативе «меньше» p равно нулю: хотя бы один отказ невозможен в модели, где пригодно абсолютно всё. Если «100%» в исходном документе было округлением, сначала восстановите настоящий ориентир. Обещание «почти всегда» математически отличается от «всегда».

Зачем нужен интервал Уилсона

Один процент в выборке не показывает точность оценки. В раскрытии «Оценка доли» рядом с ним выводится двусторонний 95%-й интервал Уилсона. Метод назван по работе статистика Эдвина Бидуэлла Уилсона 1927 года. Он даёт границы внутри диапазона 0…100% и пригоден в том числе при нуле успехов или успехе в каждом испытании.

Для 15 успехов из 20 наблюдаемая доля равна 75%, а интервал составляет примерно 53,13…88,81%. Размах показывает, сколько неопределённости остаётся за аккуратным числом «75%». При повторении процедуры интервалы рассчитаны на приблизительно 95%-е покрытие фиксированной истинной доли. Это не утверждение, что внутри уже полученного интервала случайно перемещается параметр.

В формуле q = k/n, а z ≈ 1,959964 соответствует двустороннему уровню 95%. Используется вариант без поправки на непрерывность, приведённый в руководстве NIST по интервалам для доли.

q+z2/(2n)  ±  zq(1−q)/n+z2/(4n2)1+z2/n\displaystyle \frac{q+z^2/(2n)\;\pm\;z\sqrt{q(1-q)/n+z^2/(4n^2)}}{1+z^2/n}

Уилсон и точный биномиальный тест используют разные процедуры. Поэтому интервал в примере с 0 из 5 исключает 50%, хотя точное p равно 0,0625. Решение теста принимается только по его p-значению. Интервал здесь служит отдельной оценке доли; его уровень остаётся 95% при любом α и любом направлении проверки.

Как читать результат без ложной уверенности

При p ≤ α калькулятор отклоняет H₀, при p > α не отклоняет. Выбор α из 1%, 5% и 10% меняет границу решения, но не само p. Сравнение выполняется до округления. Дополнительное объяснение того, чем статистическая значимость отличается от размера эффекта, есть на странице p-значения.

Поддерживается до 10 000 испытаний. Это ограничение объёма вычислений в браузере, а не правило статистики. Для малых положительных p используется научная запись: например, 1,00247 × 10⁻³⁰¹⁰ при 0 успехов из 10 000 и ориентире 50% в двустороннем тесте. Такой хвост не заменяется нулём. Настоящий p = 0 возможен здесь при строгом ориентире 0 или 100%, когда наблюдение невозможно в заданной модели.

Вопросы о данных и выводах

Перед проверкой определите единицу наблюдения и вопрос исследования. Процент без размера выборки, два меняющихся ориентира или остановка после удобного результата требуют другого подхода.

Можно ли проверить процент без числа наблюдений?

Нужны исходные счётчики. Доля 60% может означать 6 успехов из 10 или 600 из 1000; точность этих оценок различается. Если известен только округлённый процент, восстановить точное число успехов обычно нельзя. Возьмите k и n из исходной таблицы или журнала наблюдений.

Почему p равно 1, хотя доля в выборке отличается от заданной?

При 4 успехах из 9 и ориентире 50% двустороннее p равно 1, хотя наблюдаемая доля составляет около 44,44%. Именно 4 и 5 успехов являются самыми вероятными исходами этой модели. Все остальные исходы не вероятнее наблюдаемого, поэтому в сумму входят все вероятности. Значение p = 1 не доказывает истинность гипотезы.

Означает ли ноль успехов, что истинная доля равна нулю?

Нет. После 0 успехов в 10 испытаниях верхняя граница 95%-го интервала Уилсона составляет около 27,75%. Маленькая выборка может просто не встретить выбранный исход. Чтобы оценка стала уже, нужны дополнительные независимые наблюдения по заранее определённому плану.

Как выбрать направление проверки?

По исходному вопросу, до просмотра данных. Для поиска любого изменения выбирайте «отличается», для заранее интересующего повышения «больше», для снижения «меньше». Переключать направление после результата ради маленького p нельзя без изменения смысла и правил проверки.

Можно ли сравнить этим тестом две группы?

Эта проверка принимает одну выборку и заданную долю. Если ориентир посчитан по второй группе, в нём тоже есть неопределённость. Нужен метод сравнения двух долей или подходящий критерий для таблицы частот; простая подстановка процента второй группы здесь не учитывает её размер.

Доказывает ли p больше 0,05, что доля соответствует цели?

Нет, это недостаток оснований отклонить выбранную гипотезу на уровне 5%. Небольшая выборка может не обнаружить существенное отличие. Для доказательства практически допустимой близости нужна проверка эквивалентности с заранее заданными границами отклонения, а не обычный тест равенства.

Можно ли добавлять наблюдения, пока p не станет меньше 0,05?

Обычный тест не рассчитан на такое правило остановки. Повторные проверки и завершение при первом удобном p меняют вероятность ошибочного вывода. Зафиксируйте объём или план исследования заранее; для последовательного анализа нужны специальные правила, учитывающие повторные проверки.

Похожие калькуляторы

Возможно вам пригодятся ещё несколько калькуляторов по данной теме:

Есть что добавить?

Напишите своё мнение, комментарий или предложение.