Вопросы по A/B-тестам на собеседовании
A/B-тесты это место, где статистика встречается с продуктом, поэтому вопросы задают и аналитикам, и дата-сайентистам. Провальный ответ обычно один и тот же: тест остановили, когда метрика прокрасилась.
Из чего состоит тема
Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.
- Дизайн A/B-тестов18
- Ловушки A/B14
- Снижение дисперсии (CUPED)14
- Размер выборки и мощность13
Разборы подтем
Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.
- Дизайн A/B-теста18 вопросов
- Ловушки A/B-тестов14 вопросов
- Размер выборки и мощность теста13 вопросов
- Снижение дисперсии: CUPED14 вопросов
Примеры вопросов с разбором
- Что такое guardrail-метрики в A/B-тесте?A)Метрики, которые обязаны обязательно вырасти для признания теста успешнымB)Контрольные метрики здоровья, которые не должны просесть в тестеC)Сугубо технические внутренние метрики самой сплит-системы экспериментаD)Метрики, которые готовят для отчёта высшему руководству
показать ответ и разбор
+B)Контрольные метрики здоровья, которые не должны просесть в тесте// разбор: Оптимизация одной метрики почти всегда умеет каннибализировать соседние: агрессивные пуши растят DAU и отписки одновременно. Guardrails фиксируются до запуска вместе с порогами останова; для них важна достаточная мощность (заметить −1% выручки сложнее, чем +5% кликов). Это дисциплина против метрик-туннельного зрения.
- Тест скидок в двустороннем маркетплейсе: эффект «протёк» из тестовой группы в контроль. Как называется проблема и как её обойти?A)Нарушение SUTVA (интерференция): группы влияют друг на друга; рандомизируют кластерами — по гео, времени или маркетуB)Это обычный шум измерения, который исчезает сам собой, если увеличить длительность эксперимента вдвоеC)Проблема в неверной метрике, достаточно заменить среднее на медиану, чтобы протечка эффекта пропалаD)Никакой проблемы нет: в маркетплейсе тестовая и контрольная группы независимы друг от друга
показать ответ и разбор
+A)Нарушение SUTVA (интерференция): группы влияют друг на друга; рандомизируют кластерами — по гео, времени или маркету// разбор: Классический A/B предполагает SUTVA: исход одного юзера не зависит от того, в какой группе другой. В маркетплейсе это нарушается — скидки тесту меняют предложение/спрос и для контроля (общий инвентарь, цены, курьеры), эффект протекает и смещает оценку. Лечат рандомизацией на уровне кластеров: гео, временные окна (switchback), рынки — чтобы группы не пересекались через общий ресурс.
- Что означает MDE (минимальный детектируемый эффект) в дизайне теста?A)Фактический эффект, который тест в среднем показал по итогам всего экспериментаB)Наименьший эффект, который тест надёжно поймает при заданных α, мощности и nC)Порог значимости, ниже которого p-value считается случайнымD)Максимальный эффект, физически достижимый данной фичей
показать ответ и разбор
+B)Наименьший эффект, который тест надёжно поймает при заданных α, мощности и n// разбор: MDE — наименьший истинный эффект, который эксперимент способен надёжно зафиксировать при выбранных α, мощности и размере выборки. Он задаётся ДО теста и отвечает на вопрос «какой минимальный сдвиг мы вообще в силах заметить». Фактический результат и физический потолок фичи — не про это, а порог значимости — это α.
- На чём основан метод CUPED?A)На увеличении размера тестовой группы за счёт контрольнойB)На удалении из анализа пользователей с выбросами метрикиC)На вычитании из метрики предсказуемой части по данным предпериодаD)На повторном использовании одних и тех же данных для нескольких гипотез
показать ответ и разбор
+C)На вычитании из метрики предсказуемой части по данным предпериода// разбор: CUPED (controlled experiment using pre-experiment data) берёт ковариату из предпериода — обычно ту же метрику до эксперимента — и вычитает предсказуемую по ней часть. Остаётся остаток с меньшей дисперсией, а оценка эффекта остаётся несмещённой. Это регрессионная корректировка на доэкспериментное поведение, а не отбраковка юзеров и не переиспользование данных.
- Что такое A/B-тест по своей сути?A)Обычный прогон одной и той же модели дважды подряд с разными случайными сидами инициализацииB)Сравнение продукта с прямым конкурентом по открытым данным рынкаC)Контролируемый эксперимент: случайные группы A и B → причинный выводD)Разовый опрос небольшой фокус-группы пользователей о новой фиче
показать ответ и разбор
+C)Контролируемый эксперимент: случайные группы A и B → причинный вывод// разбор: A/B-тест — контролируемый эксперимент: пользователей случайно делят на группу A (контроль) и B (изменение). Случайность уравнивает группы по всем прочим факторам, поэтому разницу в метрике можно причинно приписать изменению, а не совпадению. Это отличает эксперимент от наблюдения «до/после».
- Победивший в A/B вариант выкатили, но в проде прирост оказался заметно меньше, чем был в тесте. Обычная причина?A)В проде стоит другой, более медленный сервер, из-за чего эффект выигравшей модели уменьшается сам собойB)Это однозначно баг в коде выката, ведь эффект выигравшего варианта обязан в точности повторяться в проде без каких-либо отличийC)Причина в том, что после теста поменяли дизайн страницы, и к эксперименту это не относитсяD)Winner's curse и регресс к среднему: отобрали максимум из шумных оценок; плюс возможен novelty-эффект — тестовый прирост смещён вверх
показать ответ и разбор
+D)Winner's curse и регресс к среднему: отобрали максимум из шумных оценок; плюс возможен novelty-эффект — тестовый прирост смещён вверх// разбор: Мы выбираем вариант с наибольшей оценкой эффекта, а оценки шумные — у победителя измеренный эффект систематически завышен относительно истинного (winner's curse, регресс к среднему). Добавьте novelty-эффект (новизна временно бустит метрику) — и прод-прирост честно меньше тестового. Смягчают: жёсткий порог значимости, холдаут-подтверждение эффекта после выката, поправка на множественные варианты.
- α, мощность, MDE и размер выборки в планировании теста связаны так, что:A)все четыре можно задать независимо друг от другаB)важны только уровень α и размер выборки, а всё остальное второстепенноC)зафиксировав любые три величины, четвёртую вычисляешь однозначноD)мощность и MDE — это одно и то же под разными именами
показать ответ и разбор
+C)зафиксировав любые три величины, четвёртую вычисляешь однозначно// разбор: Четыре величины связаны одним уравнением мощности: α, мощность (1−β), MDE и n. Зафиксируешь три — четвёртая определена. На практике фиксируют α=0.05 и power=0.8, задают MDE от бизнеса и вычисляют нужное n. Или наоборот: при доступном n и α/power находят, какой минимальный эффект реально поймать.
- Команда применила CUPED и удивилась, что средний эффект почти не изменился. Это нормально?A)Нет, CUPED должен был увеличить измеренный эффектB)Да, но лишь потому, что выборка в этом тесте оказалась слишком мелкойC)Нет, значит ковариата выбрана неверно и эффект заниженD)Да, CUPED сужает доверительный интервал, а не двигает оценку эффекта
показать ответ и разбор
+D)Да, CUPED сужает доверительный интервал, а не двигает оценку эффекта// разбор: CUPED снижает дисперсию оценки — доверительный интервал становится уже, значимость достигается легче, — но саму точечную оценку эффекта он оставляет примерно на месте (она несмещённая). Ждать роста эффекта неверно: метод борется с шумом, а не с величиной сигнала. Неизменность оценки при более узком интервале — ровно то, чего от него хотят.
- Что такое контрольная и тестовая (treatment) группы в A/B-тесте?A)Обе эти группы одновременно получают одну и ту же новую фичу, но в разном порядке её показаB)Контрольная тестирует новую фичу, а тестовая остаётся на старой версииC)Это две метрики, которые сравнивают в самом конце проведённого экспериментаD)Контрольная видит старый опыт, тестовая — новый; разницу и измеряют
показать ответ и разбор
+D)Контрольная видит старый опыт, тестовая — новый; разницу и измеряют// разбор: Контрольная группа видит текущий (старый) опыт и служит базовой линией, тестовая (treatment) получает изменение. Сравнение их метрик и даёт эффект. Контроль нужен именно потому, что метрики сами по себе колеблются (сезонность, тренды): без параллельного контроля «до/после» перепутает эффект фичи с фоном.
это 9 из 59
Ещё 50 вопросов по теме — в тренажёре, с движком повторения
Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.
Частые вопросы
Как рассчитывают длительность теста?
Из минимального эффекта, который важно поймать, уровня значимости и целевой мощности. Срок фиксируют до запуска, иначе ошибка первого рода растёт непредсказуемо.
Что делать с незначимым результатом?
Не объявлять отсутствие эффекта. Незначимость означает, что данных не хватило: стоит посмотреть на доверительный интервал и понять, исключает ли он практически важный эффект.