сеньорчикОткрыть в Telegram
← все вопросывопросы для собеседований · A/B-тесты

Вопросы по A/B-тестам на собеседовании

A/B-тесты это место, где статистика встречается с продуктом, поэтому вопросы задают и аналитикам, и дата-сайентистам. Провальный ответ обычно один и тот же: тест остановили, когда метрика прокрасилась.

59 вопросов в банке·4 подтем·ниже разбор 9

Из чего состоит тема

Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.

Разборы подтем

Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.

Примеры вопросов с разбором

  1. #ab_design1 / 9
    Что такое guardrail-метрики в A/B-тесте?
    A)Метрики, которые обязаны обязательно вырасти для признания теста успешным
    B)Контрольные метрики здоровья, которые не должны просесть в тесте
    C)Сугубо технические внутренние метрики самой сплит-системы эксперимента
    D)Метрики, которые готовят для отчёта высшему руководству
    показать ответ и разбор
    +B)Контрольные метрики здоровья, которые не должны просесть в тесте

    // разбор: Оптимизация одной метрики почти всегда умеет каннибализировать соседние: агрессивные пуши растят DAU и отписки одновременно. Guardrails фиксируются до запуска вместе с порогами останова; для них важна достаточная мощность (заметить −1% выручки сложнее, чем +5% кликов). Это дисциплина против метрик-туннельного зрения.

  2. #ab_pitfalls2 / 9
    Тест скидок в двустороннем маркетплейсе: эффект «протёк» из тестовой группы в контроль. Как называется проблема и как её обойти?
    A)Нарушение SUTVA (интерференция): группы влияют друг на друга; рандомизируют кластерами — по гео, времени или маркету
    B)Это обычный шум измерения, который исчезает сам собой, если увеличить длительность эксперимента вдвое
    C)Проблема в неверной метрике, достаточно заменить среднее на медиану, чтобы протечка эффекта пропала
    D)Никакой проблемы нет: в маркетплейсе тестовая и контрольная группы независимы друг от друга
    показать ответ и разбор
    +A)Нарушение SUTVA (интерференция): группы влияют друг на друга; рандомизируют кластерами — по гео, времени или маркету

    // разбор: Классический A/B предполагает SUTVA: исход одного юзера не зависит от того, в какой группе другой. В маркетплейсе это нарушается — скидки тесту меняют предложение/спрос и для контроля (общий инвентарь, цены, курьеры), эффект протекает и смещает оценку. Лечат рандомизацией на уровне кластеров: гео, временные окна (switchback), рынки — чтобы группы не пересекались через общий ресурс.

  3. #sample_size_power3 / 9
    Что означает MDE (минимальный детектируемый эффект) в дизайне теста?
    A)Фактический эффект, который тест в среднем показал по итогам всего эксперимента
    B)Наименьший эффект, который тест надёжно поймает при заданных α, мощности и n
    C)Порог значимости, ниже которого p-value считается случайным
    D)Максимальный эффект, физически достижимый данной фичей
    показать ответ и разбор
    +B)Наименьший эффект, который тест надёжно поймает при заданных α, мощности и n

    // разбор: MDE — наименьший истинный эффект, который эксперимент способен надёжно зафиксировать при выбранных α, мощности и размере выборки. Он задаётся ДО теста и отвечает на вопрос «какой минимальный сдвиг мы вообще в силах заметить». Фактический результат и физический потолок фичи — не про это, а порог значимости — это α.

  4. #variance_reduction4 / 9
    На чём основан метод CUPED?
    A)На увеличении размера тестовой группы за счёт контрольной
    B)На удалении из анализа пользователей с выбросами метрики
    C)На вычитании из метрики предсказуемой части по данным предпериода
    D)На повторном использовании одних и тех же данных для нескольких гипотез
    показать ответ и разбор
    +C)На вычитании из метрики предсказуемой части по данным предпериода

    // разбор: CUPED (controlled experiment using pre-experiment data) берёт ковариату из предпериода — обычно ту же метрику до эксперимента — и вычитает предсказуемую по ней часть. Остаётся остаток с меньшей дисперсией, а оценка эффекта остаётся несмещённой. Это регрессионная корректировка на доэкспериментное поведение, а не отбраковка юзеров и не переиспользование данных.

  5. #ab_design5 / 9
    Что такое A/B-тест по своей сути?
    A)Обычный прогон одной и той же модели дважды подряд с разными случайными сидами инициализации
    B)Сравнение продукта с прямым конкурентом по открытым данным рынка
    C)Контролируемый эксперимент: случайные группы A и B → причинный вывод
    D)Разовый опрос небольшой фокус-группы пользователей о новой фиче
    показать ответ и разбор
    +C)Контролируемый эксперимент: случайные группы A и B → причинный вывод

    // разбор: A/B-тест — контролируемый эксперимент: пользователей случайно делят на группу A (контроль) и B (изменение). Случайность уравнивает группы по всем прочим факторам, поэтому разницу в метрике можно причинно приписать изменению, а не совпадению. Это отличает эксперимент от наблюдения «до/после».

  6. #ab_pitfalls6 / 9
    Победивший в A/B вариант выкатили, но в проде прирост оказался заметно меньше, чем был в тесте. Обычная причина?
    A)В проде стоит другой, более медленный сервер, из-за чего эффект выигравшей модели уменьшается сам собой
    B)Это однозначно баг в коде выката, ведь эффект выигравшего варианта обязан в точности повторяться в проде без каких-либо отличий
    C)Причина в том, что после теста поменяли дизайн страницы, и к эксперименту это не относится
    D)Winner's curse и регресс к среднему: отобрали максимум из шумных оценок; плюс возможен novelty-эффект — тестовый прирост смещён вверх
    показать ответ и разбор
    +D)Winner's curse и регресс к среднему: отобрали максимум из шумных оценок; плюс возможен novelty-эффект — тестовый прирост смещён вверх

    // разбор: Мы выбираем вариант с наибольшей оценкой эффекта, а оценки шумные — у победителя измеренный эффект систематически завышен относительно истинного (winner's curse, регресс к среднему). Добавьте novelty-эффект (новизна временно бустит метрику) — и прод-прирост честно меньше тестового. Смягчают: жёсткий порог значимости, холдаут-подтверждение эффекта после выката, поправка на множественные варианты.

  7. #sample_size_power7 / 9
    α, мощность, MDE и размер выборки в планировании теста связаны так, что:
    A)все четыре можно задать независимо друг от друга
    B)важны только уровень α и размер выборки, а всё остальное второстепенно
    C)зафиксировав любые три величины, четвёртую вычисляешь однозначно
    D)мощность и MDE — это одно и то же под разными именами
    показать ответ и разбор
    +C)зафиксировав любые три величины, четвёртую вычисляешь однозначно

    // разбор: Четыре величины связаны одним уравнением мощности: α, мощность (1−β), MDE и n. Зафиксируешь три — четвёртая определена. На практике фиксируют α=0.05 и power=0.8, задают MDE от бизнеса и вычисляют нужное n. Или наоборот: при доступном n и α/power находят, какой минимальный эффект реально поймать.

  8. #variance_reduction8 / 9
    Команда применила CUPED и удивилась, что средний эффект почти не изменился. Это нормально?
    A)Нет, CUPED должен был увеличить измеренный эффект
    B)Да, но лишь потому, что выборка в этом тесте оказалась слишком мелкой
    C)Нет, значит ковариата выбрана неверно и эффект занижен
    D)Да, CUPED сужает доверительный интервал, а не двигает оценку эффекта
    показать ответ и разбор
    +D)Да, CUPED сужает доверительный интервал, а не двигает оценку эффекта

    // разбор: CUPED снижает дисперсию оценки — доверительный интервал становится уже, значимость достигается легче, — но саму точечную оценку эффекта он оставляет примерно на месте (она несмещённая). Ждать роста эффекта неверно: метод борется с шумом, а не с величиной сигнала. Неизменность оценки при более узком интервале — ровно то, чего от него хотят.

  9. #ab_design9 / 9
    Что такое контрольная и тестовая (treatment) группы в A/B-тесте?
    A)Обе эти группы одновременно получают одну и ту же новую фичу, но в разном порядке её показа
    B)Контрольная тестирует новую фичу, а тестовая остаётся на старой версии
    C)Это две метрики, которые сравнивают в самом конце проведённого эксперимента
    D)Контрольная видит старый опыт, тестовая — новый; разницу и измеряют
    показать ответ и разбор
    +D)Контрольная видит старый опыт, тестовая — новый; разницу и измеряют

    // разбор: Контрольная группа видит текущий (старый) опыт и служит базовой линией, тестовая (treatment) получает изменение. Сравнение их метрик и даёт эффект. Контроль нужен именно потому, что метрики сами по себе колеблются (сезонность, тренды): без параллельного контроля «до/после» перепутает эффект фичи с фоном.

это 9 из 59

Ещё 50 вопросов по теме — в тренажёре, с движком повторения

Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.

Частые вопросы