Почему выборочную дисперсию делят на n − 1
На четырёх выборках из чисел 0 и 2 видно, где теряется разброс, зачем нужна поправка n − 1 и почему она не исправляет всё.

На четырёх выборках из чисел 0 и 2 видно, где теряется разброс, зачем нужна поправка n − 1 и почему она не исправляет всё.

Среднее, рассчитанное по тем же данным, подстраивается под них и делает расстояния до центра меньше. Поэтому сумма квадратов отклонений получается заниженной. Деление на n − 1 исправляет это занижение в среднем при многократном случайном отборе.
В статье вы узнаете:
Положим в коробку две карточки с числами 0 и 2. Вся интересующая нас совокупность, то есть полный набор возможных значений, известна заранее. Оба числа встречаются с равной вероятностью, а их среднее равно 1.
Каждая карточка находится на расстоянии 1 от среднего. Квадраты этих расстояний тоже равны 1, поэтому настоящая дисперсия совокупности равна 1:
Теперь представим, что содержимое коробки неизвестно. Мы вытаскиваем карточку, записываем число, возвращаем карточку и повторяем опыт. Получается случайная выборка из двух независимых наблюдений. По ним мы оцениваем дисперсию порождающего распределения, то есть случайного процесса, который выдаёт 0 или 2 с равной вероятностью. Возможны четыре упорядоченные пары, и каждая появляется с вероятностью 1/4:
| Выборка | Среднее выборки | Сумма квадратов отклонений от этого среднего | Делим на n = 2 | Делим на n − 1 = 1 |
|---|---|---|---|---|
| 0, 0 | 0 | 0 | 0 | 0 |
| 0, 2 | 1 | 2 | 1 | 2 |
| 2, 0 | 1 | 2 | 1 | 2 |
| 2, 2 | 2 | 0 | 0 | 0 |
| Среднее по четырём выборкам | 1 | 0,5 | 1 |
Если делить сумму квадратов на n, четыре оценки в среднем дают 0,5. Настоящая дисперсия коробки равна 1, значит, такой способ теряет ровно половину разброса.
При делении на n − 1 оценки равны 0, 2, 2 и 0. Каждая отдельная оценка может промахнуться, зато их среднее равно 1. В этом и состоит несмещённость: если повторять случайный отбор много раз, средняя оценка попадёт в настоящий параметр.
Несмещённость не обещает, что конкретная выборка окажется удачной. Пара 0, 0 сообщает нулевой разброс, хотя в коробке есть ещё карточка 2. Пара 0, 2, наоборот, даёт оценку 2, вдвое выше настоящей дисперсии. Поправка убирает систематический перекос, но не отменяет случайность.
Причина занижения видна в двух одинаковых карточках. Для выборки 0, 0 мы ставим центр в точку 0, потому что её среднее равно 0. Оба отклонения становятся нулевыми. Для выборки 2, 2 происходит то же самое возле точки 2.
Но настоящий центр коробки находится в точке 1. Если бы он был известен заранее, две нулевые карточки дали бы квадраты отклонений 1 и 1. Их среднее снова равнялось бы 1. Часть разброса исчезла только потому, что мы разрешили центру подстроиться под те же наблюдения, разброс которых затем измеряем.
В общем виде это можно записать одной строкой:
Здесь μ обозначает настоящее среднее всей совокупности, а x̄ обозначает среднее конкретной выборки. Слева находится доступная нам сумма квадратов вокруг выборочного среднего. Справа видно, что из суммы вокруг настоящего центра вычитается неотрицательная величина. Перенос центра к выборке может только уменьшить сумму квадратов или оставить её прежней.
Для независимых наблюдений из одного распределения сумма вокруг настоящего центра в среднем равна nσ², где σ² обозначает дисперсию совокупности. Подстройка среднего отнимает в среднем одну σ². Остаётся (n − 1)σ². Поэтому деление остатка на n − 1 возвращает σ² в среднем.
Формула объясняет и результат с карточками. При n = 2 вокруг выборочного среднего остаётся в среднем только одна порция настоящей дисперсии, а деление на 2 уменьшает её ещё вдвое.
После вычисления выборочного среднего отклонения всегда складываются в ноль. Возьмём числа 3, 5 и 7. Их среднее равно 5, а отклонения равны −2, 0 и 2. Если известны первые два отклонения, третье уже нельзя выбрать свободно: оно обязано вернуть сумму к нулю.
У n отклонений остаётся только n − 1 независимо меняющееся значение. Это и называют n − 1 степенями свободы. Одно ограничение появилось потому, что центр был оценён по тем же данным.
Степени свободы хорошо помогают запомнить делитель, но сами по себе не заменяют объяснение смещения. Главная причина всё та же: выборочное среднее подстраивается под наблюдения и уменьшает их расстояния до центра. Полный перебор карточек показывает результат этой подстройки, а равенство из предыдущего раздела обобщает его на любой размер выборки.
Если бы по данным оценивали ещё параметры, число степеней свободы могло бы уменьшиться сильнее. Например, в линейной модели отдельно подбирают несколько коэффициентов. Но в обычной выборочной дисперсии оценивается один неизвестный центр, поэтому исчезает ровно одна степень.
Делитель n − 1 нужен не всякому короткому ряду. Он нужен, когда ряд является случайной выборкой и по нему оценивают дисперсию более широкой совокупности или распределения. Здесь N обозначает число элементов во всей группе, а n обозначает размер выборки.
Делите на N, если список содержит всю интересующую группу. Допустим, завершённый проект включал 12 задач, и известно время каждой из них. Если вопрос относится только к этим 12 задачам, их дисперсия считается с делителем N = 12. Ничего за пределами списка оценивать не требуется.
Делите на n − 1, если список представляет более широкий процесс. Допустим, с линии взяли 12 деталей, чтобы оценить разброс размеров всех деталей, которые выпускает станок. Среднее станка неизвестно и тоже оценивается по этим 12 измерениям. Тогда обычная выборочная дисперсия использует делитель 11.
Делите на n вокруг заранее известного среднего. Если настоящее среднее μ известно независимо и отклонения считаются именно от него, подстройки центра по текущей выборке нет. Среднее квадратов Σ(xᵢ − μ)² / n уже является несмещённой оценкой дисперсии при стандартной случайной модели. На практике настоящее среднее известно редко, поэтому учебные и прикладные формулы обычно используют x̄ и n − 1.
Можно вставить числа в калькулятор дисперсии и переключить режим между полной совокупностью и выборкой. Результаты различаются только делителем, но отвечают на разные вопросы. Если квадратные единицы неудобно читать, калькулятор стандартного отклонения вернёт разброс в единицы исходных данных.
Для несмещённости нужны независимые наблюдения, полученные одним и тем же случайным способом, и конечная дисперсия. Делитель n − 1 не превращает удобную группу знакомых, первые десять ответов в опросе или измерения неисправным прибором в случайную выборку.
Поправка не лечит и зависимость. Если датчик записывает одно состояние каждую секунду, соседние показания могут быть почти копиями друг друга. Формула посчитает число, но десять связанных измерений несут меньше новой информации, чем десять независимых.
Размер выборки тоже важен. При n = 2 делитель равен 1, однако две карточки всё ещё дают оценки от 0 до 2 при настоящей дисперсии 1. С ростом n случайные оценки обычно становятся стабильнее, а разница между n и n − 1 уменьшается. При n = 100 множитель поправки равен 100/99, то есть примерно 1,0101. При n = 2 он равен 2.
У одного наблюдения выборочная дисперсия не определена. Среднее совпадает с единственным числом, сумма квадратов равна нулю, а делитель n − 1 тоже равен нулю. Один результат ничего не сообщает о том, как мог бы меняться более широкий процесс.
Выборочное стандартное отклонение s получают как квадратный корень из выборочной дисперсии s². Единицы снова становятся обычными: если измеряли граммы, s выражается в граммах, а не в квадратных граммах.
Поправка n − 1 делает среднее значение дисперсий по множеству повторных выборок равным настоящей дисперсии. Но извлечение квадратного корня и усреднение нельзя менять местами. В опыте с карточками выборочные стандартные отклонения равны 0, √2, √2 и 0. Их среднее равно √2 / 2, примерно 0,707, хотя настоящее стандартное отклонение коробки равно 1. NIST поэтому отдельно подчёркивает: дисперсия с делителем n − 1 является несмещённой оценкой, а её квадратный корень не является несмещённой оценкой стандартного отклонения [NIST, Engineering Statistics Handbook].
Для нормального распределения существуют дополнительные коэффициенты коррекции стандартного отклонения. В обычных расчётах их применяют только тогда, когда нужна именно несмещённость s при явной модели распределения. Стандартная формула с n − 1 остаётся полезной и общепринятой, просто её обещание нужно называть точно.
Итог простой. Делитель n − 1 не является штрафом за маленькую выборку и не делает каждый ответ верным. Он возвращает ту часть разброса, которую в среднем спрятало подстроенное по той же выборке среднее. Для полного списка считайте его собственную дисперсию с N. Для случайной части большой совокупности выбирайте n − 1, а затем всё равно смотрите, как данные были собраны и насколько их достаточно.
Напишите своё мнение, комментарий или предложение.