Распределения: нормальное, биномиальное, Пуассона
Вопросы про распределения проверяют картину мира: понимаешь ли ты, как устроены чеки, клики и время ответа, и почему для них слово «среднее» может врать. Формул тут минимум, интуиции максимум.
Типовые формулировки: «как распределён средний чек и чем его описывать?», «почему для времени ответа смотрят p99, а не среднее?», «когда Пуассон перестаёт работать?».
// Форма вопроса почти всегда одна: «какое распределение у X и какой метрикой его описывать».
Когда события можно пересчитать: биномиальное и Пуассон
Биномиальное - это про «сколько раз получилось из скольких попыток». Пришло n посетителей, каждый покупает с вероятностью p, сколько будет покупок? Вот это оно. При большом n биномиальное становится почти нормальным, а если при этом p совсем мал - переходит в Пуассон.
Пуассон - про редкие события на отрезке времени, когда они происходят сами по себе с постоянной интенсивностью. Заявки в саппорт за час, сбои за сутки, клики за минуту. У него есть фирменная примета, по которой его узнают: матожидание равно дисперсии, и оба равны λ - средней частоте событий.
// Этой приметой и проверяют пригодность. Если у счётных данных разброс заметно больше среднего, значит интенсивность не постоянна - где-то всплески, где-то тишина. Это называют overdispersion, и Пуассон там уже врёт; берут отрицательное биномиальное.
- λ (интенсивность)
- среднее число событий за интервал; у Пуассона ей же равна и дисперсия
Время и деньги: экспоненциальное и логнормальное
Экспоненциальное - это время до следующего события в пуассоновском потоке. У него есть свойство, которое противоречит здравому смыслу и потому попадает на собесы: отсутствие памяти. Сколько ты уже прождал автобуса, никак не влияет на то, сколько осталось ждать. Обидно, но так устроена математика потока без расписания.
Логнормальное - это когда логарифм величины распределён нормально. Звучит абстрактно, а выглядит знакомо: строго положительные числа с длинным правым хвостом. Так распределены чеки, доходы, длительности сессий. У такого распределения среднее заметно выше медианы, потому что хвост тянет его вправо.
// Практический вывод, который и хотят услышать: метрики времени и денег описывают медианой и перцентилями (p50, p95, p99), а не средним. Одна аномальная покупка сдвигает среднее, а квантили её почти не замечают.
- тяжёлый хвост
- очень большие значения встречаются заметно чаще, чем позволило бы нормальное распределение
- отсутствие памяти
- остаток ожидания не зависит от того, сколько уже прождал
Нормальное распределение и главная путаница темы
Нормальное задаётся двумя числами: μ - где центр, σ - насколько широко. Правило 68-95-99.7 говорит, какая доля значений укладывается в одну, две и три сигмы от центра.
А теперь главное. Нормальное распределение встречается повсюду не потому, что данные в природе нормальны - они как раз обычно нет. Оно встречается потому, что по центральной предельной теореме нормальны суммы и средние, то есть твои оценки. Различие тонкое и стоит целого вопроса на собесе: чеки как были логнормальными, так и остались, а вот их среднее по большой выборке распределено почти нормально. ЦПТ нормализует оценку, а не данные.
// Как проверить форму на практике: гистограмма плюс QQ-plot (quantile-quantile) - график квантилей твоих данных против теоретических; совпали, значит точки лягут на прямую. Формальные тесты нормальности на больших выборках отвергают всё подряд, толку от них немного.
- σ (сигма)
- стандартное отклонение: насколько широко значения расходятся от центра
- QQ-plot
- квантили данных против квантилей теории; прямая линия значит, что форма совпала
Как отвечать: «Как распределён средний чек и какой метрикой его описывать?»
Чеки обычно логнормальные: строго положительные, с длинным правым хвостом, среднее заметно выше медианы. Поэтому типичный чек это медиана и перцентили - одна аномальная покупка утащит среднее, а квантили останутся на месте. При этом в A/B по выручке сравнивать именно средние вполне корректно: центральная предельная теорема делает распределение выборочного среднего почти нормальным, даже если сами данные скошены. Если хвосты совсем дикие, страхуюсь бутстрэпом или подрезаю верхние доли процента.
Ответ разводит распределение данных и распределение оценки - главную ловушку темы - и заканчивается тем, что ты делаешь на практике, а не тем, что написано в учебнике.
На чём валят
- −Показывать среднее логнормальных данных как «типичное значение»: типичнее медиана, среднее утащено выбросами.
- −Прикладывать правило 68-95-99.7 к данным, которые на нормальные не похожи.
- −Путать распределение данных и распределение оценки: ЦПТ нормализует среднее, но не сами наблюдения.
- −Моделировать Пуассоном счётные данные, у которых разброс сильно больше среднего: это overdispersion, там отрицательное биномиальное.
Проверьте себя
Пять вопросов из банка по этой подтеме. Всего их 19, остальные разбираются в тренажёре.
- Каким распределением естественно моделировать число заказов, поступающих в сервис за час?A)ПуассоновскимB)НормальнымC)БиномиальнымD)Равномерным
показать ответ и разбор
+A)Пуассоновским// разбор: Пуассон — стандартная модель числа редких независимых событий за интервал при примерно постоянной интенсивности; у него среднее равно дисперсии. На практике у реального трафика дисперсия часто больше среднего (overdispersion) — тогда берут отрицательное биномиальное. Проверка этого нюанса — любимое продолжение вопроса.
- Среднее, медиана и мода — чем отличаются и когда медиана честнее среднего?A)Это три совершенно полных синонима, отражающих ровно одно и то же свойство данныхB)Медиана — самое частое значение, а мода — середина отсортированного рядаC)Медиана устойчива к выбросам — на скошенных данных честнее среднегоD)Среднее равно медиане в распределении по определению
показать ответ и разбор
+C)Медиана устойчива к выбросам — на скошенных данных честнее среднего// разбор: Среднее — сумма/количество, медиана — центральное значение отсортированного ряда, мода — самое частое. На скошенных данных (зарплаты, чеки) один большой выброс тянет среднее вверх, а медиану почти нет — поэтому «типичное» значение честнее описывает медиана. Совпадают все три только у симметричных распределений.
- Что такое дисперсия и стандартное отклонение?A)Меры разброса вокруг среднего; std — корень из дисперсии, в тех же единицахB)Дисперсия — это просто среднее арифметическое всей выборки, а std — её медианаC)Обе величины измеряют центр распределения, а не его разбросD)Стандартное отклонение — это квадрат дисперсии в квадратных единицах
показать ответ и разбор
+A)Меры разброса вокруг среднего; std — корень из дисперсии, в тех же единицах// разбор: Дисперсия — средний квадрат отклонения от среднего, поэтому она в квадратных единицах и плохо интерпретируется. Стандартное отклонение — корень из дисперсии, оно возвращает единицы исходных данных, и его удобно читать («±σ вокруг среднего»). Обе меряют разброс, а не центр.
- Что описывает правило 68–95–99.7 для нормального распределения?A)Доли данных в пределах 1, 2 и 3 стандартных отклонений от среднегоB)Вероятности выпадения орла при трёх последовательных бросках монетыC)Минимальные размеры выборки для трёх разных уровней значимости тестаD)Стандартные проценты пропущенных значений, допустимые в трёх слоях витрины данных
показать ответ и разбор
+A)Доли данных в пределах 1, 2 и 3 стандартных отклонений от среднего// разбор: Для нормального распределения ~68% значений лежат в пределах ±1σ от среднего, ~95% — в ±2σ, ~99.7% — в ±3σ. Отсюда интуиция «выход за 3σ — редкое событие (~0.3%)», на которой строятся контрольные карты и правила детекции аномалий и дрейфа.
- Меряем CTR = клики/показы как ratio-метрику. Почему нельзя считать её дисперсию наивно, как у обычного среднего?A)Можно наивно, как обычное среднее: отношение двух величин ведёт себя в точности как одна усреднённая по выборке величинаB)Дисперсию ratio-метрики не получится оценить, поэтому для неё не строят доверительных интерваловC)Наивная формула сильно завышает дисперсию отношения, поэтому доверительный интервал выходит чересчур широким и безопаснымD)Числитель и знаменатель случайны и коррелируют, а единица рандомизации — юзер, не показ; нужен дельта-метод или бутстреп по юзерам
показать ответ и разбор
+D)Числитель и знаменатель случайны и коррелируют, а единица рандомизации — юзер, не показ; нужен дельта-метод или бутстреп по юзерам// разбор: CTR — отношение двух случайных величин, а рандомизируют юзеров, тогда как показы вложены в юзеров и коррелируют внутри них. Наивная биномиальная дисперсия по показам игнорирует эту кластеризацию и корреляцию числителя со знаменателем — доверительный интервал выходит неверным (обычно занижен). Корректно применяют дельта-метод для дисперсии отношения или бутстреп по юзерам — единице рандомизации.
дальше
Теорию прочитали. Навык ставится повторением
В Сеньорчике эта подтема идёт в ежедневных сессиях: движок возвращает её, пока ответы не станут уверенными, и ведёт прогресс отдельно по каждой подтеме. Теория внутри тоже бесплатна, лимит только на количество вопросов в день.