Парадокс Симпсона
Парадокс Симпсона возникает, когда разные веса групп меняют общий вывод.

Парадокс Симпсона возникает, когда разные веса групп меняют общий вывод.

Дальше вы увидите разворот вывода на 220 учебных попытках, разберётесь в роли весов и получите короткую проверку для отчёта с процентами.
В статье вы узнаете:
Представим учебный эксперимент с двумя методами решения задач. Задачи заранее разделили на простые и сложные. Успех означает, что задача решена правильно. Числа придуманы специально, чтобы механизм был виден без статистического тумана.
| Задачи | Метод A | Успех A | Метод B | Успех B |
|---|---|---|---|---|
| Простые | 9 из 10 | 90% | 80 из 100 | 80% |
| Сложные | 20 из 100 | 20% | 1 из 10 | 10% |
| Все вместе | 29 из 110 | 26,4% | 81 из 110 | 73,6% |
В строке простых задач метод A лучше: 90% против 80%. В строке сложных он снова лучше: 20% против 10%. Но общая строка сообщает обратное. После объединения метод B получает 73,6%, а метод A только 26,4%.
Пересчитаем итог без хитрых приёмов. У метода A было 9 + 20 = 29 успешных решений из 10 + 100 = 110 попыток. У метода B получилось 80 + 1 = 81 из тех же 110. Арифметика каждой строки верна. Развернулся не расчёт, а ответ на вопрос.
Калькулятор процентов поможет проверить каждую долю: разделите число успешных попыток на общее число попыток и умножьте результат на 100%.
Метод A проверяли в основном на сложных задачах: 100 сложных и 10 простых. Метод B получил почти зеркальный набор: 10 сложных и 100 простых. Поэтому общий показатель смешал качество метода со сложностью его задач.
Итоговая доля является взвешенным средним. Процент каждой группы умножается на её долю во всей выборке:
p1 и p2 обозначают проценты успеха внутри групп, n1 и n2 количество попыток в них. Чем больше группа, тем сильнее её результат тянет общий процент к себе.
У метода A высокий вес получил результат 20%, у метода B результат 80%. Различие внутри одинаковых по сложности групп оказалось меньше различия между простыми и сложными задачами, поэтому веса перекрыли преимущество A.
Та же механика знакома по оценкам. Обычное среднее даёт каждому значению один голос. Взвешенное среднее позволяет значению участвовать несколько раз, например по числу учебных часов. В нашем примере роль веса играет количество задач каждого уровня.
Не усредняйте готовые проценты поровну. Среднее между 90% и 20% равно 55%, но оно неверно описывает 10 простых и 100 сложных задач. Сначала восстановите числители и знаменатели или используйте реальные размеры групп как веса.
Сравнение внутри строк отвечает на вопрос: какой метод чаще справляется с задачей одинаковой сложности? Здесь выигрывает A. Общая строка отвечает на другой вопрос: какая доля успеха получилась при фактическом наборе задач у каждого метода? Здесь выигрывает B.
Оба утверждения описывают таблицу правильно. Ошибка появляется, когда ответ на второй вопрос выдают за ответ на первый. Фраза «метод B эффективнее» скрывает условие, при котором получен результат. Точнее сказать: «в этой общей выборке у B выше доля успеха, но внутри каждого уровня сложности выше доля у A».
Такой разворот называют парадоксом Симпсона. Статистик Эдвард Симпсон в 1951 году показал, почему связь в отдельных таблицах может измениться после их объединения. Слово «парадокс» описывает конфликт с интуицией, а не нарушение математики [Simpson, 1951].
Общий показатель не становится бесполезным. Он честно описывает фактический поток работы. Если руководителю нужно знать, сколько задач команда решила за месяц, общая строка подходит. Если нужно выбрать лучший метод для будущих задач одинаковой сложности, состав выборки уже нельзя игнорировать.
В учебном примере ключевой признак известен заранее: сложность задачи влияет на шанс успеха и распределена между методами неравномерно. Такой признак часто называют смешивающей переменной. Он смешивает сравнение метода с различием условий.
Но третий столбец не получает статус важного только потому, что нашёлся в таблице. Возраст, регион, устройство или время дня стоит учитывать, если есть понятный механизм, который связывает признак и с выбором варианта, и с результатом. Случайное дробление данных на десятки сегментов почти гарантирует странные проценты хотя бы в одном из них.
Особенно осторожно нужно обращаться с признаками, которые появились после сравниваемого действия. Например, метод мог сам изменить скорость ответа, а скорость повлияла на результат. Если разделить данные по скорости, мы уже будем отвечать не на исходный вопрос об общем эффекте метода, а на более узкий вопрос при фиксированном промежуточном результате.
Джуда Перл показывает, что одной таблицы недостаточно, чтобы автоматически выбрать общий или разделённый вывод. Нужна причинная модель: что происходило раньше, что влияло на выбор метода и что могло изменить результат [Pearl, 2014].
Практический ориентир проще термина. Сначала нарисуйте порядок событий и задайте вопрос: мог ли признак существовать до выбора варианта и повлиять на оба сравниваемых значения? Если да, разбиение или статистическая поправка может убрать смешение. Если признак является следствием варианта или фильтром отбора, механическая поправка способна создать новую ошибку.
В продуктовой аналитике общая конверсия варианта может упасть, хотя отдельно на телефонах и компьютерах она выросла. Причиной бывает разная доля мобильного трафика, стран или рекламных каналов. Перед решением по эксперименту полезно проверить сегменты, а затем оценить статистическую неопределённость в калькуляторе A/B-тестов.
В образовании общий средний балл преподавателя может оказаться ниже, если он ведёт больше сложных курсов. Сравнение внутри одинаковых дисциплин способно дать другой порядок. Но и здесь сложность нельзя назначать задним числом только ради красивого результата.
В медицине больница, которая принимает больше тяжёлых пациентов, может иметь худший общий исход и лучшие результаты внутри сопоставимых групп риска. Простая таблица не доказывает качество лечения. Для решения нужны корректные группы, дизайн исследования и оценка неопределённости.
В производстве линия с меньшей долей брака для каждого типа изделия может проиграть в общей строке, если ей досталось больше сложной продукции. Итоговый процент полезен для планирования потерь, а сравнение внутри типов для оценки самого процесса.
Общий шаблон один: признак сильно влияет на результат, а его доля различается между сравниваемыми вариантами. Иногда это реальная особенность работы, иногда ошибка распределения, иногда сознательный отбор. Итоговая цифра не рассказывает, какой случай перед нами.
Одна сводная строка удобна для экрана руководителя, но вывод по ней стоит отложить на несколько минут. Последовательная проверка выглядит так:
После проверки не нужно выбирать одну «настоящую» строку и выбрасывать остальные. Общий показатель отвечает за результат при фактическом составе данных. Групповой помогает сравнить варианты в похожих условиях. Для причинного вывода дополнительно нужны знания о процессе, корректный дизайн исследования и подходящий статистический метод.
Короткий вывод: парадокс Симпсона предупреждает не против объединения данных, а против вывода без понимания их состава. Если общий процент спорит с каждой группой, проверьте веса, восстановите знаменатели и сформулируйте вопрос точнее. Иногда одна дополнительная строка в отчёте меняет не только цифру, но и решение.
Напишите своё мнение, комментарий или предложение.