сеньорчикОткрыть в Telegram
← все вопросывопросы для собеседований · Каузальный вывод

Вопросы по каузальному выводу на собеседовании

Эту тему спрашивают там, где A/B-тест невозможен, а решение принимать надо. Проверяют, понимаете ли вы, какие допущения вы делаете, когда называете эффект причинным.

49 вопросов в банке·3 подтем·ниже разбор 9

Из чего состоит тема

Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.

Разборы подтем

Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.

Примеры вопросов с разбором

  1. #confounding_bias1 / 9
    Что такое конфаундер (confounder)?
    A)Общая причина воздействия и исхода — создаёт ложную связь между ними
    B)Промежуточное звено на пути от воздействия к исходу (посредник)
    C)Обыкновенная случайная ошибка измерения, возникающая при сборе данных эксперимента
    D)Переменная, на которую воздействие и исход не влияют вообще никак
    показать ответ и разбор
    +A)Общая причина воздействия и исхода — создаёт ложную связь между ними

    // разбор: Конфаундер — переменная, влияющая и на воздействие, и на исход, из-за чего между ними возникает ложная связь. Классика: возраст влияет и на выбор лечения, и на выздоровление — прямое сравнение «лечили vs нет» смещено. Именно конфаундеры контролируют (в отличие от медиаторов и коллайдеров).

  2. #observational_causal2 / 9
    Почему причинные выводы из наблюдательных данных особенно опасны?
    A)Наблюдательные данные содержат заметно меньше строк, чем экспериментальные
    B)В наблюдательных данных сложно посчитать метрики
    C)Нет рандомизации — группы различались ещё до воздействия (конфаундинг)
    D)Наблюдательные данные идеально репрезентативны и потому скучны
    показать ответ и разбор
    +C)Нет рандомизации — группы различались ещё до воздействия (конфаундинг)

    // разбор: В наблюдательных данных люди сами выбрали воздействие (купили подписку, кликнули), поэтому группы «получил/не получил» систематически различаются ещё до него — по мотивации, доходу, активности. Без рандомизации, уравнивающей эти различия, наивное сравнение путает эффект воздействия с эффектом отбора. Методы вроде matching и DiD пытаются сымитировать рандомизацию.

  3. #quasi_experiments3 / 9
    Что такое квазиэксперимент?
    A)Совершенно обыкновенный классический A/B-тест с идеально случайным распределением по группам
    B)Оценка эффекта без рандомизации — когда честный A/B невозможен
    C)Синтетический эксперимент на искусственно сгенерированных данных
    D)Эксперимент, который прервали задолго до набора нужной выборки
    показать ответ и разбор
    +B)Оценка эффекта без рандомизации — когда честный A/B невозможен

    // разбор: Квазиэксперимент оценивает причинный эффект, когда рандомизировать нельзя — по этике, стоимости или потому что вмешательство уже случилось. Вместо случайного распределения используют структуру данных: difference-in-differences, regression discontinuity, matching, инструментальные переменные. Это «почти эксперимент» на наблюдательных данных с явными допущениями.

  4. #confounding_bias4 / 9
    Почему из корреляции нельзя делать вывод о причинности?
    A)Потому что саму корреляцию сложно корректно измерить на реальных данных
    B)Потому что корреляция равна нулю при наличии настоящей причинной связи
    C)Связь может идти от конфаундера, обратной причинности или совпадения
    D)Потому что причинность бывает в физике, но не в данных о людях
    показать ответ и разбор
    +C)Связь может идти от конфаундера, обратной причинности или совпадения

    // разбор: Наблюдаемая корреляция X и Y объяснима как минимум тремя способами кроме «X причина Y»: общий конфаундер (жара двигает и мороженое, и утопления), обратная причинность (Y влияет на X) или чистое совпадение при множестве проверок. Поэтому для причинного вывода нужен дизайн (рандомизация или квазиэксперимент), а не сама корреляция.

  5. #observational_causal5 / 9
    В чём идея matching / propensity score при оценке эффекта на наблюдательных данных?
    A)Совершенно случайным образом распределить все имеющиеся наблюдения по группам уже после сбора данных
    B)Просто удалить из данных всю контрольную группу как ненужную для анализа
    C)Взять тех, кто получил воздействие, и сравнить их значения до и после
    D)Сопоставить похожих по ковариатам объекты из групп — имитируя сравнимость
    показать ответ и разбор
    +D)Сопоставить похожих по ковариатам объекты из групп — имитируя сравнимость

    // разбор: Matching сравнивает получивших воздействие с максимально похожими на них по наблюдаемым ковариатам не-получившими — так группы делают сопоставимыми, как при рандомизации. Propensity score сводит множество ковариат к одной вероятности получить воздействие и матчит по ней. Ключевая слабость: метод уравнивает только наблюдаемые переменные, а скрытые конфаундеры остаются.

  6. #quasi_experiments6 / 9
    В чём идея метода difference-in-differences (разность разностей)?
    A)Сравнить обе группы до вмешательства и проигнорировать весь период после него
    B)Взять группу воздействия и сравнить её значения до и после изменения
    C)Из изменения в тест-группе вычесть изменение в контроле — убрать общий тренд
    D)Сравнить абсолютные уровни метрики в двух группах в один момент времени
    показать ответ и разбор
    +C)Из изменения в тест-группе вычесть изменение в контроле — убрать общий тренд

    // разбор: DiD берёт изменение метрики в тест-группе (после − до) и вычитает такое же изменение в контрольной группе. Контроль ловит общий фон (сезонность, тренды рынка), а разность разностей выделяет эффект самого вмешательства. Простое «до/после» без контроля путает эффект с трендом, а сравнение уровней — с конфаундерами.

  7. #confounding_bias7 / 9
    Что такое ошибка отбора (selection bias)?
    A)Обыкновенный случайный шум, одинаково равномерно размазанный по всей собранной выборке
    B)Выборка нерепрезентативна из-за неслучайного попадания — выводы смещены
    C)Намеренное удаление выбросов из данных перед обучением модели
    D)Ситуация, когда выборка в точности повторяет генеральную совокупность
    показать ответ и разбор
    +B)Выборка нерепрезентативна из-за неслучайного попадания — выводы смещены

    // разбор: Selection bias возникает, когда попадание объектов в выборку неслучайно и связано с изучаемым исходом, поэтому выборка систематически искажает картину. Пример: опрос удовлетворённости только среди оставшихся клиентов — ушедшие (недовольные) не попали, и оценка завышена. Это близкий родственник survivorship bias.

  8. #observational_causal8 / 9
    Что такое инкрементальный эффект (uplift) промо-акции?
    A)Прирост именно от акции — сверх того, что случилось бы и без неё
    B)Общее суммарное число вообще всех покупок, совершённых за весь период проведения акции
    C)Суммарная выручка за весь период проведения промо-акции целиком
    D)Число пользователей, которые вообще увидели баннер этой акции
    показать ответ и разбор
    +A)Прирост именно от акции — сверх того, что случилось бы и без неё

    // разбор: Uplift — причинный прирост метрики, вызванный именно акцией, а не то, что произошло бы всё равно. Скидка тем, кто и так купил бы, — слитый бюджет, а не эффект. Поэтому uplift меряют разницей с контрольной группой (holdout), а не валовыми продажами за период: «после ≠ вследствие».

  9. #quasi_experiments9 / 9
    В чём идея regression discontinuity (разрывного дизайна, RDD)?
    A)Совершенно случайным образом честной монеткой поделить всех участников на тест и контроль
    B)Сравнить самых непохожих друг на друга участников из разных групп
    C)Отказаться от контрольной группы в пользу одного временного ряда
    D)У порога отбора близкие объекты почти случайны — сравниваем по обе стороны
    показать ответ и разбор
    +D)У порога отбора близкие объекты почти случайны — сравниваем по обе стороны

    // разбор: RDD применяют, когда воздействие даётся по резкому порогу непрерывной переменной (скидка при чеке ≥ 5000, грант при балле ≥ 80). Объекты чуть выше и чуть ниже порога почти неразличимы — попадание «квазислучайно», — поэтому разрыв в исходе на пороге и есть причинный эффект. Работает локально, у самого порога.

это 9 из 49

Ещё 40 вопросов по теме — в тренажёре, с движком повторения

Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.

Частые вопросы