Вопросы по статистике на собеседовании
Статистику спрашивают, чтобы понять, будете ли вы делать выводы из данных или из ощущений. Формулы наизусть почти никого не интересуют, а вот трактовка p-value и понимание, что доверительный интервал говорит о процедуре, а не о параметре, выясняются сразу.
Что спрашивают
- +Проверка гипотез: нулевая и альтернативная, ошибки первого и второго рода, мощность, множественные сравнения
- +p-value: что оно означает на самом деле и какие формулировки на собесе считаются провалом
- +Распределения: нормальное и его хвосты, биномиальное, пуассоновское, центральная предельная теорема
- +Доверительные интервалы: как строятся, от чего зависит ширина, чем отличаются от предсказательных
- +Байес: условная вероятность, обновление убеждений, классические задачи про тесты и ложные срабатывания
Из чего состоит тема
Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.
- Проверка гипотез33
- Распределения19
- Вероятность17
- Байес13
- Доверительные интервалы13
Разборы подтем
Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.
- Распределения: нормальное, биномиальное, Пуассона19 вопросов
- Проверка гипотез и p-value33 вопросов
- Доверительный интервал: что он означает13 вопросов
- Теорема Байеса и условная вероятность13 вопросов
- Вероятность: задачи с собеседований17 вопросов
Примеры вопросов с разбором
- Чем отличается частотный подход к вероятности от байесовского?A)Частотник: параметр фиксирован, вероятность — предел частоты; байес: параметр распределёнB)Частотный подход точнее байесовского на больших данныхC)Байесовский подход не использует наблюдаемые данные, опираясь на априориD)Различие между подходами лишь в обозначениях и терминах
показать ответ и разбор
+A)Частотник: параметр фиксирован, вероятность — предел частоты; байес: параметр распределён// разбор: Частотник спрашивает «насколько необычны данные при H0», байесовец — «как данные меняют мою уверенность в гипотезе» через prior → likelihood → posterior. Практика: байесовские методы дают прямые вероятностные утверждения и естественно включают априори, но требуют его выбора и вычислительно тяжелее.
- Как корректно интерпретировать 95%-й доверительный интервал?A)~95% таких построенных интервалов при повторении накроют параметрB)С вероятностью 95% истинный параметр лежит именно в этом интервалеC)Внутри интервала лежит ровно 95% наблюдаемых данных выборкиD)Интервал содержит 95% всех вообще возможных значений оцениваемого параметра
показать ответ и разбор
+A)~95% таких построенных интервалов при повторении накроют параметр// разбор: В частотном подходе параметр фиксирован, случаен интервал: гарантия относится к процедуре, а не к конкретному интервалу. Формулировка «с вероятностью 95% параметр внутри» корректна для байесовского credible interval. На собесе ценится именно это различие.
- В чём суть центральной предельной теоремы (ЦПТ)?A)Исходные данные при большом n сами становятся нормально распределённымиB)Медиана выборки сходится к её среднему при росте nC)Дисперсия выборочного среднего растёт с увеличением nD)Среднее iid-величин с конечной дисперсией при росте n → нормально
показать ответ и разбор
+D)Среднее iid-величин с конечной дисперсией при росте n → нормально// разбор: ЦПТ — про распределение среднего, а не самих данных: сами данные могут оставаться сколь угодно скошенными. Именно поэтому t-тесты и z-интервалы для средних работают на больших выборках. Важные оговорки: нужна конечная дисперсия, а «большое n» для тяжёлых хвостов может означать тысячи наблюдений.
- Что такое p-value?A)Вероятность того, что нулевая гипотеза верна при данных наблюденияхB)Вероятность совершить ошибку второго рода в этом тестеC)Шанс увидеть такой или более экстремальный результат, если H0 вернаD)Доля дисперсии отклика, объяснённая построенной моделью
показать ответ и разбор
+C)Шанс увидеть такой или более экстремальный результат, если H0 верна// разбор: P-value — это P(данные ≥ наблюдаемых | H0), а не P(H0 | данные): путаница между ними — самая частая ловушка на собесах. Маленький p-value говорит «при H0 такое маловероятно», но ничего не говорит о вероятности самой гипотезы и о размере эффекта.
- Тест на болезнь: чувствительность 99%, специфичность 99%, болеет 1 человек из 1000. Тест положительный. Какова примерно вероятность, что человек болен?A)≈99%B)≈9%C)≈50%D)≈1%
показать ответ и разбор
+B)≈9%// разбор: Байес: на 1000 человек — 1 больной (тест почти наверняка его поймает) и ~10 ложных срабатываний среди 999 здоровых (1%). Итого ~1 истинный на ~11 положительных ≈ 9%. Низкая априорная вероятность «съедает» точность теста — та же логика объясняет ложные алерты в антифроде и мониторинге.
- Что такое сопряжённый prior и зачем он нужен?A)Prior, который в точности равен функции правдоподобияB)Prior, имеющий нулевое математическое ожиданиеC)Prior, при котором posterior остаётся в том же семействеD)Prior, который вообще никак не зависит от наблюдаемых данных выборки
показать ответ и разбор
+C)Prior, при котором posterior остаётся в том же семействе// разбор: Сопряжённость даёт аналитический posterior без MCMC: Beta(a, b) + k успехов из n даёт Beta(a+k, b+n−k). Псевдонаблюдения prior'а прозрачно интерпретируются как «виртуальные данные». Это рабочая лошадка байесовских A/B-тестов и сглаживания CTR/конверсий редких категорий.
- Когда бутстреп-оценка доверительного интервала может systematically врать?A)Бутстреп по построению возвращает точные интервалы для статистикиB)Если число ресемплов оказалось меньше сотниC)На экстремумах, хвостовых квантилях, малых n и автокорреляцииD)Когда данные нормальны — бутстреп нужен для ненормальных
показать ответ и разбор
+C)На экстремумах, хвостовых квантилях, малых n и автокорреляции// разбор: Бутстреп опирается на то, что эмпирическое распределение похоже на истинное и статистика «гладкая». Максимум выборки, хвостовые квантили, ratio-метрики на малых n, автокорреляция (нужен блочный бутстреп) — классические случаи провала. Число ресемплов влияет лишь на шум симуляции, а не на корректность метода.
- Средний чек в интернет-магазине имеет сильно скошенное распределение с тяжёлым правым хвостом. Почему сравнение медиан вместо средних в A/B-тесте — не всегда правильный ход?A)Медиану не получится оценить по конечной выборке данныхB)Медиана равна среднему при достаточно большом nC)Для медианы практически нет статистических тестов значимостиD)Выручка живёт на среднем; эффект в хвосте медиана не увидит
показать ответ и разбор
+D)Выручка живёт на среднем; эффект в хвосте медиана не увидит// разбор: Выручка = n × средний чек, поэтому продуктовый вопрос обычно про среднее, каким бы шумным оно ни было. Медиана устойчивее, но нечувствительна к изменениям в хвосте, где живут деньги. Рабочие альтернативы: бутстреп для среднего, усечённые/винзоризованные средние, CUPED для снижения дисперсии — с явным пониманием, какой вопрос решаем.
- Что такое ошибка I и II рода в проверке гипотез?A)I род — ошибка в данных при сборе; II род — ошибка в спецификации моделиB)I род — пропустили реальный эффект; II род — подняли ложную тревогуC)Оба рода описывают одну и ту же ошибку, но с разных сторонD)I род — отвергли верную H0 (α); II — не отвергли ложную (β)
показать ответ и разбор
+D)I род — отвергли верную H0 (α); II — не отвергли ложную (β)// разбор: α — уровень значимости, вероятность ложно задетектить эффект там, где его нет; β — вероятность не заметить реальный эффект, а мощность = 1 − β. Между ними трейдофф при фиксированной выборке: ужесточая α, теряешь мощность. Дизайн эксперимента — это баланс α, β, MDE и размера выборки.
это 9 из 95
Ещё 86 вопросов по теме — в тренажёре, с движком повторения
Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.
Частые вопросы
Насколько глубоко спрашивают статистику у аналитика данных?
Обычно до уровня проверки гипотез и доверительных интервалов: как устроен A/B-тест, что такое p-value, почему нельзя подсматривать результаты каждый день. Матстатистику с выводом формул спрашивают редко.
Что отвечать на вопрос «что такое p-value»?
Вероятность увидеть такой или более экстремальный результат при верной нулевой гипотезе. Ответ «вероятность того, что гипотеза верна» считается ошибкой и почти всегда тянет за собой уточняющие вопросы.
Дают ли задачи на вероятность?
Да, чаще всего короткие: про монеты и кости, про ложноположительные результаты теста, про выбор из урны. Проверяют аккуратность рассуждения, а не знание экзотических распределений.