Вопросы по каузальному выводу на собеседовании
Эту тему спрашивают там, где A/B-тест невозможен, а решение принимать надо. Проверяют, понимаете ли вы, какие допущения вы делаете, когда называете эффект причинным.
Из чего состоит тема
Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.
- Конфаундеры и смещения18
- Причинность по наблюдениям16
- Квазиэксперименты15
Разборы подтем
Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.
- Каузальный анализ: конфаундеры и смещения18 вопросов
- Каузальный анализ: причинность по наблюдениям16 вопросов
- Каузальный анализ: квазиэксперименты15 вопросов
Примеры вопросов с разбором
- Что такое конфаундер (confounder)?A)Общая причина воздействия и исхода — создаёт ложную связь между нимиB)Промежуточное звено на пути от воздействия к исходу (посредник)C)Обыкновенная случайная ошибка измерения, возникающая при сборе данных экспериментаD)Переменная, на которую воздействие и исход не влияют вообще никак
показать ответ и разбор
+A)Общая причина воздействия и исхода — создаёт ложную связь между ними// разбор: Конфаундер — переменная, влияющая и на воздействие, и на исход, из-за чего между ними возникает ложная связь. Классика: возраст влияет и на выбор лечения, и на выздоровление — прямое сравнение «лечили vs нет» смещено. Именно конфаундеры контролируют (в отличие от медиаторов и коллайдеров).
- Почему причинные выводы из наблюдательных данных особенно опасны?A)Наблюдательные данные содержат заметно меньше строк, чем экспериментальныеB)В наблюдательных данных сложно посчитать метрикиC)Нет рандомизации — группы различались ещё до воздействия (конфаундинг)D)Наблюдательные данные идеально репрезентативны и потому скучны
показать ответ и разбор
+C)Нет рандомизации — группы различались ещё до воздействия (конфаундинг)// разбор: В наблюдательных данных люди сами выбрали воздействие (купили подписку, кликнули), поэтому группы «получил/не получил» систематически различаются ещё до него — по мотивации, доходу, активности. Без рандомизации, уравнивающей эти различия, наивное сравнение путает эффект воздействия с эффектом отбора. Методы вроде matching и DiD пытаются сымитировать рандомизацию.
- Что такое квазиэксперимент?A)Совершенно обыкновенный классический A/B-тест с идеально случайным распределением по группамB)Оценка эффекта без рандомизации — когда честный A/B невозможенC)Синтетический эксперимент на искусственно сгенерированных данныхD)Эксперимент, который прервали задолго до набора нужной выборки
показать ответ и разбор
+B)Оценка эффекта без рандомизации — когда честный A/B невозможен// разбор: Квазиэксперимент оценивает причинный эффект, когда рандомизировать нельзя — по этике, стоимости или потому что вмешательство уже случилось. Вместо случайного распределения используют структуру данных: difference-in-differences, regression discontinuity, matching, инструментальные переменные. Это «почти эксперимент» на наблюдательных данных с явными допущениями.
- Почему из корреляции нельзя делать вывод о причинности?A)Потому что саму корреляцию сложно корректно измерить на реальных данныхB)Потому что корреляция равна нулю при наличии настоящей причинной связиC)Связь может идти от конфаундера, обратной причинности или совпаденияD)Потому что причинность бывает в физике, но не в данных о людях
показать ответ и разбор
+C)Связь может идти от конфаундера, обратной причинности или совпадения// разбор: Наблюдаемая корреляция X и Y объяснима как минимум тремя способами кроме «X причина Y»: общий конфаундер (жара двигает и мороженое, и утопления), обратная причинность (Y влияет на X) или чистое совпадение при множестве проверок. Поэтому для причинного вывода нужен дизайн (рандомизация или квазиэксперимент), а не сама корреляция.
- В чём идея matching / propensity score при оценке эффекта на наблюдательных данных?A)Совершенно случайным образом распределить все имеющиеся наблюдения по группам уже после сбора данныхB)Просто удалить из данных всю контрольную группу как ненужную для анализаC)Взять тех, кто получил воздействие, и сравнить их значения до и послеD)Сопоставить похожих по ковариатам объекты из групп — имитируя сравнимость
показать ответ и разбор
+D)Сопоставить похожих по ковариатам объекты из групп — имитируя сравнимость// разбор: Matching сравнивает получивших воздействие с максимально похожими на них по наблюдаемым ковариатам не-получившими — так группы делают сопоставимыми, как при рандомизации. Propensity score сводит множество ковариат к одной вероятности получить воздействие и матчит по ней. Ключевая слабость: метод уравнивает только наблюдаемые переменные, а скрытые конфаундеры остаются.
- В чём идея метода difference-in-differences (разность разностей)?A)Сравнить обе группы до вмешательства и проигнорировать весь период после негоB)Взять группу воздействия и сравнить её значения до и после измененияC)Из изменения в тест-группе вычесть изменение в контроле — убрать общий трендD)Сравнить абсолютные уровни метрики в двух группах в один момент времени
показать ответ и разбор
+C)Из изменения в тест-группе вычесть изменение в контроле — убрать общий тренд// разбор: DiD берёт изменение метрики в тест-группе (после − до) и вычитает такое же изменение в контрольной группе. Контроль ловит общий фон (сезонность, тренды рынка), а разность разностей выделяет эффект самого вмешательства. Простое «до/после» без контроля путает эффект с трендом, а сравнение уровней — с конфаундерами.
- Что такое ошибка отбора (selection bias)?A)Обыкновенный случайный шум, одинаково равномерно размазанный по всей собранной выборкеB)Выборка нерепрезентативна из-за неслучайного попадания — выводы смещеныC)Намеренное удаление выбросов из данных перед обучением моделиD)Ситуация, когда выборка в точности повторяет генеральную совокупность
показать ответ и разбор
+B)Выборка нерепрезентативна из-за неслучайного попадания — выводы смещены// разбор: Selection bias возникает, когда попадание объектов в выборку неслучайно и связано с изучаемым исходом, поэтому выборка систематически искажает картину. Пример: опрос удовлетворённости только среди оставшихся клиентов — ушедшие (недовольные) не попали, и оценка завышена. Это близкий родственник survivorship bias.
- Что такое инкрементальный эффект (uplift) промо-акции?A)Прирост именно от акции — сверх того, что случилось бы и без неёB)Общее суммарное число вообще всех покупок, совершённых за весь период проведения акцииC)Суммарная выручка за весь период проведения промо-акции целикомD)Число пользователей, которые вообще увидели баннер этой акции
показать ответ и разбор
+A)Прирост именно от акции — сверх того, что случилось бы и без неё// разбор: Uplift — причинный прирост метрики, вызванный именно акцией, а не то, что произошло бы всё равно. Скидка тем, кто и так купил бы, — слитый бюджет, а не эффект. Поэтому uplift меряют разницей с контрольной группой (holdout), а не валовыми продажами за период: «после ≠ вследствие».
- В чём идея regression discontinuity (разрывного дизайна, RDD)?A)Совершенно случайным образом честной монеткой поделить всех участников на тест и контрольB)Сравнить самых непохожих друг на друга участников из разных группC)Отказаться от контрольной группы в пользу одного временного рядаD)У порога отбора близкие объекты почти случайны — сравниваем по обе стороны
показать ответ и разбор
+D)У порога отбора близкие объекты почти случайны — сравниваем по обе стороны// разбор: RDD применяют, когда воздействие даётся по резкому порогу непрерывной переменной (скидка при чеке ≥ 5000, грант при балле ≥ 80). Объекты чуть выше и чуть ниже порога почти неразличимы — попадание «квазислучайно», — поэтому разрыв в исходе на пороге и есть причинный эффект. Работает локально, у самого порога.
это 9 из 49
Ещё 40 вопросов по теме — в тренажёре, с движком повторения
Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.
Частые вопросы
Когда применяют каузальные методы вместо A/B?
Когда эксперимент нельзя провести: изменение затрагивает всех пользователей, эффект сетевой, данные уже собраны задним числом или тест неэтичен.
Что такое разность разностей?
Сравнение изменения метрики в тестовой и контрольной группах до и после воздействия. Метод работает при допущении, что без воздействия группы менялись бы параллельно.