сеньорчикОткрыть в Telegram
← все роливопросы для собеседований · Data Analyst

Вопросы на собеседовании аналитика данных

SQL и оконные функции, продуктовые метрики, A/B-тесты, ClickHouse и визуализация — ядро собеседования аналитика данных. Разбор реальных вопросов ниже.

987 вопросов·12 тем·ниже разбор 9
  1. #ab_testing1 / 9
    Зачем перед запуском A/B-теста считать размер выборки (power analysis)?
    A)Чтобы формально отчитаться о самом факте запуска теста перед своим менеджером
    B)Чтобы заранее выбрать первичную метрику для оценки результата теста
    C)Размер выборки на итоговые выводы теста фактически никак не влияет
    D)Оценить трафик и срок под MDE/α/мощность; недобранный тест неинформативен
    показать ответ и разбор
    +D)Оценить трафик и срок под MDE/α/мощность; недобранный тест неинформативен

    // разбор: Мощность = вероятность увидеть эффект, если он есть. Без расчёта легко запустить тест с мощностью 20%: отрицательный результат неинформативен (эффект мог быть, вы бы его не поймали). Входы: базовое значение метрики, её дисперсия, MDE, α (обычно 0.05), мощность (0.8): отсюда n на группу и срок. MDE диктует бизнес: какой минимальный аплифт окупает изменение.

  2. #ab_testing2 / 9
    Метрика теста — «средний доход на пользователя», но рандомизация шла по сессиям. В чём проблема?
    A)Никакой проблемы: сессий заметно больше, чем юзеров, значит и мощность теста выше
    B)Юнит рандомизации ≠ юнит анализа: сессии юзера зависимы и в обеих группах
    C)Проблема в том, что группы получились разного размера
    D)Доход сложно корректно измерять в рамках A/B-теста
    показать ответ и разбор
    +B)Юнит рандомизации ≠ юнит анализа: сессии юзера зависимы и в обеих группах

    // разбор: Классическая ловушка: наблюдения внутри юзера коррелированы, а юзер размазан по группам — и независимости нет, и экспозиция смешана. Стандарт: рандомизация по user_id; ratio-метрики (клики/показы) считать с дельта-методом или бутстрепом по юзерам. Проверка «совпадает ли юнит рандомизации с юнитом анализа» — рефлекс сеньора.

  3. #ab_testing3 / 9
    Что такое мощность (power) A/B-теста?
    A)Вероятность обнаружить эффект при условии, что он на самом деле есть
    B)Доля пользователей, случайно попавших в тестовую группу вместо контрольной
    C)Величина различия между средними в группах на момент старта
    D)Вероятность ложно объявить эффект там, где его нет
    показать ответ и разбор
    +A)Вероятность обнаружить эффект при условии, что он на самом деле есть

    // разбор: Мощность 1−β — вероятность отвергнуть нулевую гипотезу, когда эффект действительно существует. Обычно целятся в 0.8: тест поймает реальный эффект в 80% случаев. Низкая мощность означает высокий риск ошибки II рода — пропустить настоящий эффект. Вероятность ложного прокраса — это α (ошибка I рода), другая величина.

  4. #ab_testing4 / 9
    Зачем в A/B-тестах специально снижают дисперсию метрики?
    A)Чтобы искусственно увеличить наблюдаемый эффект фичи
    B)Чтобы поймать тот же эффект на меньшей выборке или точнее — на той же
    C)Чтобы поднять базовое значение метрики сразу в обеих сравниваемых группах
    D)Чтобы уравнять размеры тестовой и контрольной групп
    показать ответ и разбор
    +B)Чтобы поймать тот же эффект на меньшей выборке или точнее — на той же

    // разбор: Размер выборки растёт с дисперсией (n ∝ σ²). Срезав дисперсию оценки, получаешь либо тот же MDE на меньшем трафике, либо более узкий доверительный интервал на прежнем — тест становится чувствительнее без дополнительных пользователей. Средний эффект при этом не меняется, снижается только шум оценки.

  5. #algorithms5 / 9
    Почему поиск по ключу в хеш-таблице (dict/set) в среднем O(1), а в списке — O(n)?
    A)Список хранит элементы строго отсортированными, а хеш-таблица — вперемешку без порядка
    B)В списке элементы занимают меньше памяти, поэтому поиск медленнее
    C)Хеш по ключу сразу вычисляет позицию (бакет), а список надо обходить подряд
    D)Разницы нет, оба O(n)
    показать ответ и разбор
    +C)Хеш по ключу сразу вычисляет позицию (бакет), а список надо обходить подряд

    // разбор: Хеш-функция превращает ключ в индекс бакета за O(1), и мы прыгаем прямо к нему. В списке адреса по значению неизвестны, поэтому линейный поиск обходит элементы один за другим — O(n). Цена O(1): нет порядка и есть накладные расходы на хеширование и коллизии.

  6. #algorithms6 / 9
    Алгоритм работает за O(n). Что это значит на практике?
    A)Он выполняет ровно n операций при входе — ни больше, ни меньше
    B)Число операций растёт линейно с размером входа n
    C)В худшем случае он делает порядка n² операций
    D)Ему требуется ровно n байт дополнительной памяти
    показать ответ и разбор
    +B)Число операций растёт линейно с размером входа n

    // разбор: O(n) — про асимптотику: при росте входа вдвое время растёт примерно вдвое. Это верхняя оценка скорости роста, а не точное число операций и не про память. Константы и младшие члены отбрасывают: O(3n+5) — это O(n).

  7. #algorithms7 / 9
    Бинарный поиск работает за O(log n). Какое условие обязательно для его применения?
    A)Массив должен состоять из чисел, строки бинарным поиском искать не получится
    B)Массив (или диапазон) должен быть отсортирован по искомому ключу
    C)В массиве не должно быть повторяющихся значений
    D)Размер массива должен быть степенью двойки
    показать ответ и разбор
    +B)Массив (или диапазон) должен быть отсортирован по искомому ключу

    // разбор: Бинарный поиск на каждом шаге отбрасывает половину диапазона, сравнивая середину с искомым — это возможно только если данные упорядочены по ключу. O(log n) — число делений пополам до одного элемента. Повторы и нечисловые типы допустимы (лишь бы был порядок); степень двойки не требуется.

  8. #algorithms8 / 9
    Стек (stack) — это структура с дисциплиной...
    A)LIFO: последним пришёл — первым вышел
    B)FIFO: первым пришёл — первым вышел
    C)По приоритету: первым выходит элемент с наименьшим ключом среди всех имеющихся
    D)Случайного доступа по индексу
    показать ответ и разбор
    +A)LIFO: последним пришёл — первым вышел

    // разбор: Стек — LIFO: push кладёт наверх, pop снимает верхний, оба O(1). Аналогия — стопка тарелок. FIFO — это очередь, приоритет — куча. Стек естественно моделирует вложенность: вызовы функций (call stack), парсинг скобок, откат (undo), обход в глубину.

  9. #bi_viz9 / 9
    Что такое BI-инструмент (Tableau, Power BI, DataLens, Superset) и в чём его смысл?
    A)Платформа: подключение к данным, дашборды, self-service изучение бизнесом без кода
    B)Язык программирования для анализа данных
    C)База данных для хранения таблиц
    D)Инструмент для рисования статичных картинок в презентацию, куда данные вставляют вручную один раз
    показать ответ и разбор
    +A)Платформа: подключение к данным, дашборды, self-service изучение бизнесом без кода

    // разбор: BI-инструмент связывает источники данных, модель (меры/измерения) и визуальный слой: аналитик собирает дашборд, а бизнес сам крутит фильтры и находит ответы — self-service, без запроса к разработчику на каждый вопрос. Это не БД (данные он читает из источников) и не язык программирования. Сила BI — интерактивность и переиспользуемость дашборда многими людьми.

это девять из 987

В тренажёре ещё 978 вопросов по теме — с движком повторения.

Разбор прочитать мало: навык ставится практикой. В Сеньорчике вопросы идут сессиями, а движок возвращает темы, где вы плывёте, пока не начнёт отскакивать от зубов. Роль «Data Analyst» — 12 тем, 987 вопросов. Начать можно бесплатно.