сеньорчикОткрыть в Telegram
← все вопросывопросы для собеседований · Метрики ML

Вопросы по метрикам машинного обучения на собеседовании

Метрики это самая частая ловушка ML-секции: кандидат называет accuracy на задаче с одним процентом положительных примеров и дальше разговор идёт тяжело. Проверяют связь метрики с ценой ошибки.

55 вопросов в банке·5 подтем·ниже разбор 9

Из чего состоит тема

Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.

Примеры вопросов с разбором

  1. #calibration_thresholds1 / 9
    Как проверить, что вероятности модели откалиброваны?
    A)Посмотреть на accuracy при пороге 0.5: если она высокая, значит вероятности откалиброваны
    B)reliability-диаграмма: по бинам вероятности сверить с фактической частотой позитивов
    C)Проверить, что ROC-AUC выше 0.9
    D)Убедиться, что все предсказания близки к 0 или 1
    показать ответ и разбор
    +B)reliability-диаграмма: по бинам вероятности сверить с фактической частотой позитивов

    // разбор: Калибровку оценивают reliability-диаграммой (calibration curve): примеры группируют по предсказанной вероятности (бины 0–0.1, 0.1–0.2, …) и в каждом бине сравнивают среднее предсказание с фактической долей позитивов. Идеал — точки на диагонали. Систематический прогиб выше/ниже диагонали показывает недо-/переуверенность. Числовые сводки — ECE (expected calibration error), Brier. Accuracy и AUC калибровку не отражают.

  2. #classification_metrics2 / 9
    Что показывает ROC-AUC и почему на сильном дисбалансе часто предпочитают PR-AUC?
    A)ROC-AUC — это доля правильных ответов, а PR-AUC — ровно то же самое, но на подвыборке
    B)PR-AUC просто заметно устойчивее к переобучению, чем ROC-AUC
    C)ROC-AUC по определению применим к идеально сбалансированным данным
    D)ROC — ранжирование; на редком классе FPR почти не растёт, precision в PR проседает
    показать ответ и разбор
    +D)ROC — ранжирование; на редком классе FPR почти не растёт, precision в PR проседает

    // разбор: ROC живёт в осях TPR/FPR: при 10 000 негативов даже тысяча ложных алертов даёт FPR всего 10%. Precision же делит истинные позитивы на все сработки — деградация видна сразу. Поэтому в антифроде/медицине смотрят PR-AUC и precision@k при рабочем пороге, а ROC-AUC оставляют для сравнения ранжирующей способности.

  3. #metric_pitfalls3 / 9
    Команда оптимизирует офлайн-метрику модели, но продуктовый KPI не растёт. Как это называется и почему бывает?
    A)Переобучение на обучающей выборке: большой разрыв между train и test метриками модели
    B)Утечка признаков в обучении
    C)Недообучение из-за слишком простой модели
    D)Эффект Гудхарта: суррогатная метрика отрывается от цели, став самоцелью
    показать ответ и разбор
    +D)Эффект Гудхарта: суррогатная метрика отрывается от цели, став самоцелью

    // разбор: Офлайн-метрика (AUC, F1) — суррогат бизнес-цели (выручка, удержание). По закону Гудхарта, когда мера становится целью, она перестаёт быть хорошей мерой: можно поднять F1, не двигая KPI (метрика ловит не то, что важно; или сдвиг между офлайн-оценкой и поведением в проде). Лечат согласованием метрики с целью и проверкой в онлайне (A/B), а не бесконечной догонкой суррогата.

  4. #ranking_recsys_metrics4 / 9
    Почему NDCG удобна для оценки ранжирования с градациями релевантности?
    A)Учитывает и релевантность (градацию), и позицию, и нормируется на идеальный порядок
    B)Считает только долю релевантных документов в выдаче, полностью игнорируя их порядок и позиции
    C)Измеряет исключительно позицию первого релевантного результата
    D)Штрафует за дубликаты в выдаче независимо от их релевантности
    показать ответ и разбор
    +A)Учитывает и релевантность (градацию), и позицию, и нормируется на идеальный порядок

    // разбор: DCG суммирует полезность документов с логарифмическим дисконтом по позиции: релевантный на первом месте ценнее, чем на десятом. NDCG делит DCG на идеальный (IDCG) — получается число в [0,1], сравнимое между запросами с разной длиной и числом релевантных. Ключевое отличие от precision@k — учёт ГРАДУИРОВАННОЙ релевантности (не только да/нет) и позиции.

  5. #regression_ranking_metrics5 / 9
    Чем MAE отличается от RMSE и когда что предпочесть?
    A)MAE по данным численно больше, чем RMSE
    B)RMSE сильнее штрафует крупные ошибки; MAE устойчивее к выбросам
    C)RMSE корректна при нормально распределённых остатках
    D)Это фактически одна и та же метрика, просто в разных единицах измерения
    показать ответ и разбор
    +B)RMSE сильнее штрафует крупные ошибки; MAE устойчивее к выбросам

    // разбор: RMSE ≥ MAE всегда, и разрыв растёт с дисперсией ошибок — их сравнение само по себе диагностика хвостов. Оптимизируя MSE, модель целится в среднее; MAE — в медиану (отсюда устойчивость к выбросам). Если один промах на порядок дороже десяти маленьких — RMSE; если выбросы — грязь в данных, а не бизнес-риск — MAE.

  6. #calibration_thresholds6 / 9
    Порог 0.5 по умолчанию даёт плохой баланс ошибок. Как выбрать порог осмысленно?
    A)Под цель: precision/recall-требование, максимум F1 или минимум стоимости — на валидации
    B)Оставлять 0.5 — это статистически оптимальный порог по умолчанию
    C)Брать порог, при котором предсказаний позитива ровно половина
    D)Подбирать порог прямо на тестовой выборке до наилучшей метрики — так результат честнее
    показать ответ и разбор
    +A)Под цель: precision/recall-требование, максимум F1 или минимум стоимости — на валидации

    // разбор: 0.5 оптимален лишь при равных ценах ошибок и калиброванных вероятностях. Обычно порог подбирают под задачу: обеспечить нужный recall (не пропустить фрод), максимизировать F1, или минимизировать ожидаемую стоимость с весами FP/FN. Делают это на валидации/через кросс-валидацию, а тест держат нетронутым — подбор порога на тесте завышает оценку (утечка). Полезны PR-кривая и кривая стоимости.

  7. #classification_metrics7 / 9
    Что такое калибровка вероятностей модели и когда она критична?
    A)Совпадение предсказанных вероятностей с реальными частотами исходов
    B)Подбор оптимального порога классификации по максимуму метрики F1
    C)Нормализация входных признаков модели перед этапом обучения
    D)Приведение скоров разных моделей к единой шкале от 0 до 100 баллов
    показать ответ и разбор
    +A)Совпадение предсказанных вероятностей с реальными частотами исходов

    // разбор: Хороший рэнкер может быть плохо калиброван (бустинг обычно уверен чрезмерно, после downsampling — тем более). Проверяют reliability-диаграммой, ECE и Brier score; чинят Platt scaling или isotonic regression на отложенной выборке. Если используется только порог/рэнкинг — калибровка не обязательна; если вероятности умножаются на деньги — обязательна.

  8. #metric_pitfalls8 / 9
    Офлайн модель показывает отличные метрики, а в проде работает заметно хуже. Частая причина со стороны оценки?
    A)Слишком маленький learning rate при обучении, из-за которого модель просто не дообучилась
    B)Неверно выбранный оптимизатор
    C)Недостаточно эпох обучения
    D)Offline-online gap: сдвиг распределения, утечка или срез завышают офлайн-оценку
    показать ответ и разбор
    +D)Offline-online gap: сдвиг распределения, утечка или срез завышают офлайн-оценку

    // разбор: Разрыв офлайн–онлайн возникает, когда офлайн-условия не совпадают с продом: сдвиг распределения (сезонность, новые пользователи), утечка признаков, доступных только задним числом, разметка на «удобной» подвыборке, оценка не на репрезентативном срезе, отсутствие эффекта обратной связи (модель влияет на данные). Всё это завышает офлайн-метрики. Диагноз — сверять офлайн с онлайном (A/B, backtest на честном временном сплите).

  9. #ranking_recsys_metrics9 / 9
    Что измеряет MAP (mean average precision) в задачах поиска/рекомендаций?
    A)Среднюю задержку ответа поисковой системы на пользовательский запрос в миллисекундах
    B)Средняя по запросам average precision — чувствительна к порядку релевантных
    C)Максимальную точность на лучшем из запросов
    D)Долю запросов, где хоть один результат оказался релевантным
    показать ответ и разбор
    +B)Средняя по запросам average precision — чувствительна к порядку релевантных

    // разбор: Average precision для одного запроса — среднее значение precision в точках, где встречается очередной релевантный документ; она растёт, когда релевантные стоят выше. MAP усредняет AP по всем запросам. В отличие от precision@k, MAP учитывает порядок внутри выдачи и все релевантные, а не фиксированную отсечку. Подходит для бинарной релевантности; для градаций берут NDCG.

это 9 из 55

Ещё 46 вопросов по теме — в тренажёре, с движком повторения

Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.

Частые вопросы