Одинаковые среднее и отклонение не означают одинаковые данные
Два ряда задержек имеют среднее 12 минут и одинаковое отклонение, но разные медианы, максимумы и практические риски.

Два ряда задержек имеют среднее 12 минут и одинаковое отклонение, но разные медианы, максимумы и практические риски.

Одинаковая сводка поэтому не гарантирует одинаковый опыт или риск. Перед решением нужно увидеть хотя бы сами значения либо график, затем добавить показатель, который отвечает на задачу: медиану, максимум, долю превышений, квартили или порядок наблюдений во времени.
В статье вы узнаете:
Представим два автобусных маршрута. Для каждого записали задержку пяти последних поездок в минутах.
Маршрут А: 0, 0, 0, 30, 30.
Маршрут Б: 0, 0, 10, 10, 40.
В обоих рядах сумма равна 60 минутам. Делим её на пять поездок и получаем одинаковое среднее:
Стандартное отклонение показывает разброс значений вокруг среднего в исходных единицах. Сначала найдём сумму квадратов отклонений от 12.
Для маршрута А отклонения равны −12, −12, −12, 18 и 18:
Для маршрута Б отклонения равны −12, −12, −2, −2 и 28:
Суммы снова совпали. Если эти пять поездок считаются всей интересующей группой, дисперсия равна 1080 ÷ 5 = 216 минут², а стандартное отклонение равно √216 ≈ 14,697 минуты у обоих маршрутов.
Если считать пять поездок выборкой из будущей работы маршрута, делителем станет 5 − 1. Тогда выборочная дисперсия у обоих равна 270 минут², а выборочное стандартное отклонение примерно 16,432 минуты. Выбор режима меняет оба числа, но не разрушает совпадение, потому что размер рядов и суммы квадратов одинаковы. Откуда берётся этот делитель, отдельно показывает разбор, почему выборочную дисперсию делят на n − 1.
Остальные характеристики уже расходятся:
| Характеристика | Маршрут А | Маршрут Б |
|---|---|---|
| Среднее | 12 минут | 12 минут |
| Стандартное отклонение для полной группы | 14,697 минуты | 14,697 минуты |
| Медиана | 0 минут | 10 минут |
| Мода | 0 минут | 0 и 10 минут |
| Максимум | 30 минут | 40 минут |
| Поездки с любой задержкой | 2 из 5 | 3 из 5 |
| Задержки больше 20 минут | 2 из 5 | 1 из 5 |
Калькулятор среднего, медианы и моды покажет различие центра и повторяющихся значений, а калькулятор стандартного отклонения подтвердит совпадение разброса в одном выбранном режиме.
Сводка «12 минут в среднем, отклонение 14,7» звучит так, будто маршруты одинаковы. Три бытовых решения быстро ломают эту иллюзию.
Хочется чаще приезжать минута в минуту. Маршрут А пришёл без задержки в трёх поездках из пяти, маршрут Б только в двух. По этим пяти наблюдениям преимущество у А.
Штраф начинается после 20 минут. У маршрута А порог превышен дважды, у маршрута Б один раз. Для такого правила выгоднее выглядит Б, хотя он опаздывал чаще вообще.
Опоздание больше 35 минут означает пропущенную пересадку. У маршрута А таких случаев нет, у маршрута Б есть задержка 40 минут. Теперь снова предпочтительнее А.
Это не прогноз надёжности двух настоящих маршрутов. Пять поездок слишком мало, чтобы объявить устойчивые вероятности, а условия могли различаться. Пример показывает другое: даже для уже собранных данных один и тот же набор сводных чисел не отвечает на все вопросы.
Порог особенно важен в прикладных задачах. Среднее сглаживает нарушения по обе стороны границы. Стандартное отклонение измеряет общую величину разброса, но не сообщает, сколько наблюдений перешло конкретный предел. Если решение зависит от 20, 35 или 60 минут, нужно считать превышения именно этого порога.
Среднее хранит сумму, разделённую на количество значений. Поэтому любые пять чисел с суммой 60 получат среднее 12.
Стандартное отклонение равно квадратному корню из среднего квадрата расстояний от среднего. Если число значений и делитель одинаковы, равные стандартные отклонения означают равные суммы квадратов. В наших рядах эта сумма равна 1080. Как именно она распределилась между наблюдениями, итоговое число уже не помнит.
У маршрута А большая часть суммы получилась из двух одинаковых задержек по 30 минут. У маршрута Б одна задержка 40 минут дала отклонение 28 минут от среднего и квадрат 784. Остаток распределился между четырьмя меньшими значениями. Общая сумма квадратов совпала, хотя рисунок данных изменился.
Квадрат ещё и стирает направление. Отклонения −10 и +10 дают одинаковый вклад 100. По одному стандартному отклонению нельзя узнать, вытянут ли ряд вверх, вниз или симметрично в обе стороны. Нельзя восстановить число пиков, повторения, пробелы между группами и положение каждого крайнего значения.
Порядок наблюдений пропадает полностью. Ряды 0, 0, 0, 30, 30 и 0, 30, 0, 30, 0 состоят из одних и тех же чисел, поэтому все их обычные сводные характеристики совпадают. Но первый похож на изменение режима после третьей поездки, а второй на чередование. Если время важно, нужен график последовательности, а не только отсортированный список.
Универсальной «полной цифры» для ряда нет. Показатель выбирают после вопроса.
NIST отдельно различает разброс возле центра и поведение хвостов. Разные меры придают этим частям разный вес, а гистограмма помогает увидеть обе [NIST, Measures of Scale]. Поэтому стандартное отклонение полезно дополнять, а не автоматически заменять случайно выбранной другой цифрой.
Для середины и повторений подойдут медиана и мода. Центральную половину и кандидатов в выбросы показывает калькулятор квартилей и IQR. Если решение зависит от порога, нужную долю придётся посчитать отдельно по исходному списку.
В 1973 году статистик Фрэнсис Энскомб показал четыре набора данных с почти одинаковыми числовыми сводками, которые на графиках выглядели по-разному. Его пример подтверждает ту же мысль, что и наши маршруты: точные сводные числа не заменяют взгляда на сами данные [Anscombe, 1973].
Для короткого одномерного списка достаточно точечной диаграммы на общей шкале. Каждая точка представляет наблюдение, одинаковые значения складываются друг над другом. Наши два маршрута на такой диаграмме различаются сразу: у А видны две группы возле 0 и 30, у Б три уровня и отдельная точка 40.
Если вам прислали только среднее и стандартное отклонение, этих чисел достаточно для некоторых формул, но недостаточно для проверки формы ряда. Попросите дополнение, которое соответствует риску.
Если исходный список слишком велик, запросите размер группы, медиану, несколько квартилей, минимум, максимум и число превышений важного порога. Для временного процесса пригодится сводка по периодам. Эти данные не восстановят ряд, но закроют больше практических вопросов, чем пара «среднее плюс отклонение».
Среднее и стандартное отклонение остаются полезными. Ошибка начинается, когда два точных ответа принимают за полный портрет. Сначала сформулируйте, чего боитесь или чего хотите добиться, затем посмотрите на ряд и посчитайте показатель, который отвечает на ваш вопрос.
Напишите своё мнение, комментарий или предложение.