сеньорчикОткрыть в Telegram
← вся теориятеория к собесу · Статистика

Распределения: нормальное, биномиальное, Пуассона

Зачем это спрашивают

Вопросы про распределения проверяют картину мира: понимаешь ли ты, как устроены чеки, клики и время ответа, и почему для них слово «среднее» может врать. Формул тут минимум, интуиции максимум.

Типовые формулировки: «как распределён средний чек и чем его описывать?», «почему для времени ответа смотрят p99, а не среднее?», «когда Пуассон перестаёт работать?».

// Форма вопроса почти всегда одна: «какое распределение у X и какой метрикой его описывать».

Когда события можно пересчитать: биномиальное и Пуассон

Биномиальное - это про «сколько раз получилось из скольких попыток». Пришло n посетителей, каждый покупает с вероятностью p, сколько будет покупок? Вот это оно. При большом n биномиальное становится почти нормальным, а если при этом p совсем мал - переходит в Пуассон.

Пуассон - про редкие события на отрезке времени, когда они происходят сами по себе с постоянной интенсивностью. Заявки в саппорт за час, сбои за сутки, клики за минуту. У него есть фирменная примета, по которой его узнают: матожидание равно дисперсии, и оба равны λ - средней частоте событий.

// Этой приметой и проверяют пригодность. Если у счётных данных разброс заметно больше среднего, значит интенсивность не постоянна - где-то всплески, где-то тишина. Это называют overdispersion, и Пуассон там уже врёт; берут отрицательное биномиальное.

λ (интенсивность)
среднее число событий за интервал; у Пуассона ей же равна и дисперсия

Время и деньги: экспоненциальное и логнормальное

Экспоненциальное - это время до следующего события в пуассоновском потоке. У него есть свойство, которое противоречит здравому смыслу и потому попадает на собесы: отсутствие памяти. Сколько ты уже прождал автобуса, никак не влияет на то, сколько осталось ждать. Обидно, но так устроена математика потока без расписания.

Логнормальное - это когда логарифм величины распределён нормально. Звучит абстрактно, а выглядит знакомо: строго положительные числа с длинным правым хвостом. Так распределены чеки, доходы, длительности сессий. У такого распределения среднее заметно выше медианы, потому что хвост тянет его вправо.

// Практический вывод, который и хотят услышать: метрики времени и денег описывают медианой и перцентилями (p50, p95, p99), а не средним. Одна аномальная покупка сдвигает среднее, а квантили её почти не замечают.

тяжёлый хвост
очень большие значения встречаются заметно чаще, чем позволило бы нормальное распределение
отсутствие памяти
остаток ожидания не зависит от того, сколько уже прождал

Нормальное распределение и главная путаница темы

Нормальное задаётся двумя числами: μ - где центр, σ - насколько широко. Правило 68-95-99.7 говорит, какая доля значений укладывается в одну, две и три сигмы от центра.

А теперь главное. Нормальное распределение встречается повсюду не потому, что данные в природе нормальны - они как раз обычно нет. Оно встречается потому, что по центральной предельной теореме нормальны суммы и средние, то есть твои оценки. Различие тонкое и стоит целого вопроса на собесе: чеки как были логнормальными, так и остались, а вот их среднее по большой выборке распределено почти нормально. ЦПТ нормализует оценку, а не данные.

// Как проверить форму на практике: гистограмма плюс QQ-plot (quantile-quantile) - график квантилей твоих данных против теоретических; совпали, значит точки лягут на прямую. Формальные тесты нормальности на больших выборках отвергают всё подряд, толку от них немного.

σ (сигма)
стандартное отклонение: насколько широко значения расходятся от центра
QQ-plot
квантили данных против квантилей теории; прямая линия значит, что форма совпала

Как отвечать: «Как распределён средний чек и какой метрикой его описывать?»

Чеки обычно логнормальные: строго положительные, с длинным правым хвостом, среднее заметно выше медианы. Поэтому типичный чек это медиана и перцентили - одна аномальная покупка утащит среднее, а квантили останутся на месте. При этом в A/B по выручке сравнивать именно средние вполне корректно: центральная предельная теорема делает распределение выборочного среднего почти нормальным, даже если сами данные скошены. Если хвосты совсем дикие, страхуюсь бутстрэпом или подрезаю верхние доли процента.

Ответ разводит распределение данных и распределение оценки - главную ловушку темы - и заканчивается тем, что ты делаешь на практике, а не тем, что написано в учебнике.

На чём валят

  • Показывать среднее логнормальных данных как «типичное значение»: типичнее медиана, среднее утащено выбросами.
  • Прикладывать правило 68-95-99.7 к данным, которые на нормальные не похожи.
  • Путать распределение данных и распределение оценки: ЦПТ нормализует среднее, но не сами наблюдения.
  • Моделировать Пуассоном счётные данные, у которых разброс сильно больше среднего: это overdispersion, там отрицательное биномиальное.

Проверьте себя

Пять вопросов из банка по этой подтеме. Всего их 19, остальные разбираются в тренажёре.

  1. #distributions1 / 5
    Каким распределением естественно моделировать число заказов, поступающих в сервис за час?
    A)Пуассоновским
    B)Нормальным
    C)Биномиальным
    D)Равномерным
    показать ответ и разбор
    +A)Пуассоновским

    // разбор: Пуассон — стандартная модель числа редких независимых событий за интервал при примерно постоянной интенсивности; у него среднее равно дисперсии. На практике у реального трафика дисперсия часто больше среднего (overdispersion) — тогда берут отрицательное биномиальное. Проверка этого нюанса — любимое продолжение вопроса.

  2. #distributions2 / 5
    Среднее, медиана и мода — чем отличаются и когда медиана честнее среднего?
    A)Это три совершенно полных синонима, отражающих ровно одно и то же свойство данных
    B)Медиана — самое частое значение, а мода — середина отсортированного ряда
    C)Медиана устойчива к выбросам — на скошенных данных честнее среднего
    D)Среднее равно медиане в распределении по определению
    показать ответ и разбор
    +C)Медиана устойчива к выбросам — на скошенных данных честнее среднего

    // разбор: Среднее — сумма/количество, медиана — центральное значение отсортированного ряда, мода — самое частое. На скошенных данных (зарплаты, чеки) один большой выброс тянет среднее вверх, а медиану почти нет — поэтому «типичное» значение честнее описывает медиана. Совпадают все три только у симметричных распределений.

  3. #distributions3 / 5
    Что такое дисперсия и стандартное отклонение?
    A)Меры разброса вокруг среднего; std — корень из дисперсии, в тех же единицах
    B)Дисперсия — это просто среднее арифметическое всей выборки, а std — её медиана
    C)Обе величины измеряют центр распределения, а не его разброс
    D)Стандартное отклонение — это квадрат дисперсии в квадратных единицах
    показать ответ и разбор
    +A)Меры разброса вокруг среднего; std — корень из дисперсии, в тех же единицах

    // разбор: Дисперсия — средний квадрат отклонения от среднего, поэтому она в квадратных единицах и плохо интерпретируется. Стандартное отклонение — корень из дисперсии, оно возвращает единицы исходных данных, и его удобно читать («±σ вокруг среднего»). Обе меряют разброс, а не центр.

  4. #distributions4 / 5
    Что описывает правило 68–95–99.7 для нормального распределения?
    A)Доли данных в пределах 1, 2 и 3 стандартных отклонений от среднего
    B)Вероятности выпадения орла при трёх последовательных бросках монеты
    C)Минимальные размеры выборки для трёх разных уровней значимости теста
    D)Стандартные проценты пропущенных значений, допустимые в трёх слоях витрины данных
    показать ответ и разбор
    +A)Доли данных в пределах 1, 2 и 3 стандартных отклонений от среднего

    // разбор: Для нормального распределения ~68% значений лежат в пределах ±1σ от среднего, ~95% — в ±2σ, ~99.7% — в ±3σ. Отсюда интуиция «выход за 3σ — редкое событие (~0.3%)», на которой строятся контрольные карты и правила детекции аномалий и дрейфа.

  5. #distributions5 / 5
    Меряем CTR = клики/показы как ratio-метрику. Почему нельзя считать её дисперсию наивно, как у обычного среднего?
    A)Можно наивно, как обычное среднее: отношение двух величин ведёт себя в точности как одна усреднённая по выборке величина
    B)Дисперсию ratio-метрики не получится оценить, поэтому для неё не строят доверительных интервалов
    C)Наивная формула сильно завышает дисперсию отношения, поэтому доверительный интервал выходит чересчур широким и безопасным
    D)Числитель и знаменатель случайны и коррелируют, а единица рандомизации — юзер, не показ; нужен дельта-метод или бутстреп по юзерам
    показать ответ и разбор
    +D)Числитель и знаменатель случайны и коррелируют, а единица рандомизации — юзер, не показ; нужен дельта-метод или бутстреп по юзерам

    // разбор: CTR — отношение двух случайных величин, а рандомизируют юзеров, тогда как показы вложены в юзеров и коррелируют внутри них. Наивная биномиальная дисперсия по показам игнорирует эту кластеризацию и корреляцию числителя со знаменателем — доверительный интервал выходит неверным (обычно занижен). Корректно применяют дельта-метод для дисперсии отношения или бутстреп по юзерам — единице рандомизации.

дальше

Теорию прочитали. Навык ставится повторением

В Сеньорчике эта подтема идёт в ежедневных сессиях: движок возвращает её, пока ответы не станут уверенными, и ведёт прогресс отдельно по каждой подтеме. Теория внутри тоже бесплатна, лимит только на количество вопросов в день.