Что показывает формула Байеса

Формула Байеса пересчитывает вероятность события после нового наблюдения. Например, проверка обнаруживает 90% дефектных изделий, но из этого ещё не следует, что каждое помеченное изделие дефектно с вероятностью 90%. При доле брака 1% и ложных срабатываниях на 5% исправных изделий ответ составляет около 15,38%. Причина в том, что исправных изделий изначально гораздо больше.
Название связано с Томасом Байесом, который занимался задачами теории вероятностей. Его работа об оценке неизвестной вероятности по наблюдениям вошла в том Philosophical Transactions за 1763 год. Сегодня имя Байеса носит правило, позволяющее поменять направление вопроса: от «как часто признак встречается у нужных объектов» к «как часто объект с таким признаком оказывается нужным».
На странице событием может быть дефект, спам, дождь или происхождение детали от определённого поставщика. Сигналом может служить отметка проверки, слово в письме или облачное утро. Сначала определите эти две вещи словами. Тогда числа попадут в правильные поля, а ответ будет относиться именно к вашей задаче.
Как перейти от сигнала к вероятности
Для расчёта нужны три доли: исходная вероятность события, вероятность сигнала при наличии события и вероятность того же сигнала при его отсутствии. В математической записи событие обозначают A, сигнал B. Вертикальная черта читается «при условии»: P(B|A) означает вероятность сигнала, когда событие есть.
Сначала складываются два пути появления сигнала: событие есть и сигнал появился; события нет, но сигнал всё равно появился. Затем первый путь делится на их сумму:
Здесь P(A) является исходной, или априорной, вероятностью. P(B|A) и P(B|¬A) описывают сигнал в двух разных группах. Результат P(A|B) называют апостериорной вероятностью: она учитывает уже полученный сигнал. Формула определена, когда знаменатель, полная вероятность сигнала, больше нуля. Вывод следует из определения условной вероятности и правила сложения несовместных исходов. MIT, курс 18.05.
Проценты перед подстановкой переводятся в доли: 1% равен 0,01, а 90% равен 0,9. В поля калькулятора, напротив, нужно вводить сами проценты. Число 0,9 в поле со знаком % означает девять десятых процента, а не 90%.
Почему 90% обнаружения превращаются в 15,38%
Возьмём условную группу из 10 000 изделий. При доле дефектов 1% в ней ожидается 100 дефектных и 9900 исправных изделий. Проверка обнаруживает 90 из 100 дефектных. Одновременно она ошибочно помечает 5% исправных: 9900 × 0,05 = 495 изделий.
Всего сигнал появляется у 585 изделий. Дефект есть только у 90 из них, поэтому искомая доля равна 90 / 585 ≈ 15,38%. Остальные 84,62% сигналов оказываются ложными. Это другая величина, чем введённые 5%: там знаменателем были все исправные изделия, здесь все сработавшие сигналы.
Практический вывод для такой модели: сигнал подходит для отбора на повторную проверку, но отправлять каждое помеченное изделие в брак было бы расточительно. Сам калькулятор не определяет процедуру контроля. Он показывает, сколько ошибок скрывается за одним вроде бы убедительным процентом обнаружения.
Где полезен такой пересчёт
Следующие примеры используют учебные вероятности. Их можно повторить в калькуляторе, но нельзя переносить на конкретный сервис, прибор или город без собственных данных.
📨 Письмо в папке «Спам». Допустим, 20% писем являются спамом. Фильтр помечает 80% спама и 10% обычных писем. Из 10 000 писем сигнал получат 1600 нежелательных и 800 обычных. Вероятность спама среди помеченных составляет 1600 / 2400 ≈ 66,67%. Удалять всю папку без просмотра в такой системе рискованно: около трети отмеченных писем окажутся обычными.
🏭 Деталь от одного из двух поставщиков. Первый поставщик даёт 30% деталей и имеет долю дефектов 4%. Второй даёт остальные 70% при доле дефектов 1%. Найдена дефектная деталь. Введите 30, 4 и 1: вероятность первого поставщика равна 0,012 / 0,019 ≈ 63,16%. Он поставляет меньшую часть продукции, но среди дефектных деталей его доля выше. Это помогает выбрать, какие документы поднять первыми, хотя конкретное происхождение устанавливается по маркировке.
☁️ Облачное утро и дождь. В условных наблюдениях дождь идёт в 20% дней. Облачное утро бывает в 60% дождливых и в 30% остальных дней. Получаем 0,12 / (0,12 + 0,24) ≈ 33,33%. Облака повысили исходные 20%, но дождь всё ещё не стал самым вероятным исходом. Для реального решения о зонте нужны наблюдения за сопоставимым сезоном и местом, а не эти учебные числа.
🎁 Признак, который ничего не сообщает. В акции 30% коробок содержат приз. Красная наклейка встречается у 40% коробок с призом и у 40% пустых. Ввод 30, 40 и 40 снова даёт 30%. Выбирать красную коробку ради дополнительного шанса бесполезно: наклейка одинаково распространена в обеих группах.
🔎 Признак против предположения. Пусть половина деталей относится к серии A. Метка встречается у 20% деталей этой серии и у 80% остальных. Ввод 50, 20 и 80 даёт 20%. Наблюдение уменьшило вероятность серии A. Слово «сигнал» само по себе не обещает подтверждения: важнее, в какой группе он встречается чаще.
Как выбрать исходные данные
Все три процента должны описывать сопоставимые условия. Если доля дефектов взята с новой производственной линии, а качество проверки со старой, результат объединит разные процессы. Для почты важно не смешивать долю спама во всём входящем потоке и долю спама уже после другого фильтра.
Для каждого поля запишите числитель и знаменатель. Исходная частота: число событий среди всех случаев. Обнаружение: сигналы среди случаев с событием. Ложное срабатывание: сигналы среди случаев без события. Простые доли и их перевод в проценты можно проверить калькулятором процентов.
Точный расчёт по неточным исходным оценкам остаётся оценкой. Если параметр известен только примерно, посчитайте несколько правдоподобных вариантов. Например, при остальных начальных значениях снижение ложных срабатываний с 5% до 1% повышает долю реальных дефектов среди сигналов с 15,38% до 47,62%. Это полезнее, чем обсуждать пятый знак после запятой.
Вероятность ещё не является решением. Для выбора действия нужны последствия ошибки и стоимость проверки. Когда они известны, вероятность исхода можно использовать при расчёте математического ожидания. Одинаковый шанс означает разные решения для дешёвой перепроверки и необратимой потери изделия.
Вопросы о формуле и необычных результатах
Нули, гарантированные сигналы и повторные наблюдения требуют отдельно проверить условия задачи. Округлённый процент не должен скрывать невозможное событие или повторный учёт одной информации.
Чем чувствительность отличается от специфичности?
Для проверки изделий чувствительность описывает долю обнаруженных дефектов среди дефектных изделий. Специфичность описывает долю правильно пропущенных исправных изделий. В третье поле нужна обратная величина: 100% минус специфичность. При специфичности 98% введите 2%, а не 98%.
Почему три введённых процента не дают 100%?
Они относятся к разным группам и не являются частями одного целого. Например, 1%, 90% и 5% можно использовать одновременно. До 100% складываются событие и его отсутствие; внутри каждой из этих групп отдельно складываются сигнал и отсутствие сигнала.
Что получится при исходной вероятности 0% или 100%?
Если сигнал возможен, ответ останется соответственно 0% или 100%. Нулевая исходная вероятность исключает событие из модели. Поэтому отсутствие сведений не стоит автоматически записывать как 0%: «не знаю» и «невозможно» имеют разный смысл.
Когда вероятность после сигнала не определена?
Когда сигнал имеет нулевую вероятность при заданных условиях. Например, оба поля сигнала равны 0%. Делить на ноль нельзя. Если наблюдение всё же произошло, исходная модель не описывает случившееся, и сначала нужно пересмотреть её параметры.
Можно ли дважды учесть один и тот же результат проверки?
Копия отчёта не является новым независимым свидетельством. Для последовательного пересчёта нужны вероятности второго сигнала с учётом первого. Просто подставлять прежнюю вероятность обнаружения снова допустимо лишь при обоснованной условной независимости проверок в обеих группах.
Почему дерево показывает дробное количество случаев?
Оно переводит заданные вероятности в средние ожидаемые частоты на 10 000 случаев. Например, 9,9 означает среднее ожидание, а не часть отдельного изделия. Реальные результаты целочисленны и могут отличаться; дерево помогает понять пропорции, а не предсказывает точный состав партии.
Можно ли сравнить больше двух гипотез?
Формула Байеса работает и с несколькими альтернативами, но эта форма разделяет случаи только на A и «не A». Объединять несколько остальных гипотез можно, если известна общая вероятность сигнала в их смеси. Простое среднее процентов не подходит, когда доли альтернатив различаются.
Похожие калькуляторы
Возможно вам пригодятся ещё несколько калькуляторов по данной теме:
- Калькулятор математического ожидания. Задайте исходы и вероятности, чтобы найти математическое ожидание и разброс.
- Калькулятор процентов. Рассчитайте онлайн процент от числа, на сколько процентов одно число больше или меньше другого, или сколько процентов составляет одно число от другого числа, а также прибавьте или вычтете процент к числу.
- Обычный калькулятор. Просто посчитайте чего вы там хотели.
- Рандомайзер: генератор случайных чисел. Выберите случайное число в нужном диапазоне для любых целей, в частности для розыгрышей и онлайн-лотерей в соцсетях.
- Бросить монетку онлайн. С помощью данной формы вы можете подбросить монетку онлайн любое количество раз.
- Калькулятор корней. Найдите правильное решение корней n-степени, включая квадратные и кубические.
- Калькулятор дробей. Выполните сложение, умножение, сокращение обыкновенных дробей.
- Калькулятор квадратных уравнений. Решите квадратные уравнения с помощью специальных формул, через дискриминант и по теореме Виета. Все способы решения сопровождаются примерами.
- Калькулятор дискриминанта. Введите коэффициенты a, b и c: получите дискриминант и число действительных корней.
- Калькулятор сложного процента. Рассчитайте на инвесткалькуляторе сумму, полученную в результате применения сложного процента с реинвестированием, регулярным пополнением, капитализацией и с примерами.
Есть что добавить?
Напишите своё мнение, комментарий или предложение.