Вопросы по метрикам машинного обучения на собеседовании
Метрики это самая частая ловушка ML-секции: кандидат называет accuracy на задаче с одним процентом положительных примеров и дальше разговор идёт тяжело. Проверяют связь метрики с ценой ошибки.
Из чего состоит тема
Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.
- Метрики классификации19
- Метрики ранжирования и рекомендаций10
- Метрики регрессии и ранжирования10
- Калибровка и пороги8
- Ловушки метрик8
Примеры вопросов с разбором
- Как проверить, что вероятности модели откалиброваны?A)Посмотреть на accuracy при пороге 0.5: если она высокая, значит вероятности откалиброваныB)reliability-диаграмма: по бинам вероятности сверить с фактической частотой позитивовC)Проверить, что ROC-AUC выше 0.9D)Убедиться, что все предсказания близки к 0 или 1
показать ответ и разбор
+B)reliability-диаграмма: по бинам вероятности сверить с фактической частотой позитивов// разбор: Калибровку оценивают reliability-диаграммой (calibration curve): примеры группируют по предсказанной вероятности (бины 0–0.1, 0.1–0.2, …) и в каждом бине сравнивают среднее предсказание с фактической долей позитивов. Идеал — точки на диагонали. Систематический прогиб выше/ниже диагонали показывает недо-/переуверенность. Числовые сводки — ECE (expected calibration error), Brier. Accuracy и AUC калибровку не отражают.
- Что показывает ROC-AUC и почему на сильном дисбалансе часто предпочитают PR-AUC?A)ROC-AUC — это доля правильных ответов, а PR-AUC — ровно то же самое, но на подвыборкеB)PR-AUC просто заметно устойчивее к переобучению, чем ROC-AUCC)ROC-AUC по определению применим к идеально сбалансированным даннымD)ROC — ранжирование; на редком классе FPR почти не растёт, precision в PR проседает
показать ответ и разбор
+D)ROC — ранжирование; на редком классе FPR почти не растёт, precision в PR проседает// разбор: ROC живёт в осях TPR/FPR: при 10 000 негативов даже тысяча ложных алертов даёт FPR всего 10%. Precision же делит истинные позитивы на все сработки — деградация видна сразу. Поэтому в антифроде/медицине смотрят PR-AUC и precision@k при рабочем пороге, а ROC-AUC оставляют для сравнения ранжирующей способности.
- Команда оптимизирует офлайн-метрику модели, но продуктовый KPI не растёт. Как это называется и почему бывает?A)Переобучение на обучающей выборке: большой разрыв между train и test метриками моделиB)Утечка признаков в обученииC)Недообучение из-за слишком простой моделиD)Эффект Гудхарта: суррогатная метрика отрывается от цели, став самоцелью
показать ответ и разбор
+D)Эффект Гудхарта: суррогатная метрика отрывается от цели, став самоцелью// разбор: Офлайн-метрика (AUC, F1) — суррогат бизнес-цели (выручка, удержание). По закону Гудхарта, когда мера становится целью, она перестаёт быть хорошей мерой: можно поднять F1, не двигая KPI (метрика ловит не то, что важно; или сдвиг между офлайн-оценкой и поведением в проде). Лечат согласованием метрики с целью и проверкой в онлайне (A/B), а не бесконечной догонкой суррогата.
- Почему NDCG удобна для оценки ранжирования с градациями релевантности?A)Учитывает и релевантность (градацию), и позицию, и нормируется на идеальный порядокB)Считает только долю релевантных документов в выдаче, полностью игнорируя их порядок и позицииC)Измеряет исключительно позицию первого релевантного результатаD)Штрафует за дубликаты в выдаче независимо от их релевантности
показать ответ и разбор
+A)Учитывает и релевантность (градацию), и позицию, и нормируется на идеальный порядок// разбор: DCG суммирует полезность документов с логарифмическим дисконтом по позиции: релевантный на первом месте ценнее, чем на десятом. NDCG делит DCG на идеальный (IDCG) — получается число в [0,1], сравнимое между запросами с разной длиной и числом релевантных. Ключевое отличие от precision@k — учёт ГРАДУИРОВАННОЙ релевантности (не только да/нет) и позиции.
- Чем MAE отличается от RMSE и когда что предпочесть?A)MAE по данным численно больше, чем RMSEB)RMSE сильнее штрафует крупные ошибки; MAE устойчивее к выбросамC)RMSE корректна при нормально распределённых остаткахD)Это фактически одна и та же метрика, просто в разных единицах измерения
показать ответ и разбор
+B)RMSE сильнее штрафует крупные ошибки; MAE устойчивее к выбросам// разбор: RMSE ≥ MAE всегда, и разрыв растёт с дисперсией ошибок — их сравнение само по себе диагностика хвостов. Оптимизируя MSE, модель целится в среднее; MAE — в медиану (отсюда устойчивость к выбросам). Если один промах на порядок дороже десяти маленьких — RMSE; если выбросы — грязь в данных, а не бизнес-риск — MAE.
- Порог 0.5 по умолчанию даёт плохой баланс ошибок. Как выбрать порог осмысленно?A)Под цель: precision/recall-требование, максимум F1 или минимум стоимости — на валидацииB)Оставлять 0.5 — это статистически оптимальный порог по умолчаниюC)Брать порог, при котором предсказаний позитива ровно половинаD)Подбирать порог прямо на тестовой выборке до наилучшей метрики — так результат честнее
показать ответ и разбор
+A)Под цель: precision/recall-требование, максимум F1 или минимум стоимости — на валидации// разбор: 0.5 оптимален лишь при равных ценах ошибок и калиброванных вероятностях. Обычно порог подбирают под задачу: обеспечить нужный recall (не пропустить фрод), максимизировать F1, или минимизировать ожидаемую стоимость с весами FP/FN. Делают это на валидации/через кросс-валидацию, а тест держат нетронутым — подбор порога на тесте завышает оценку (утечка). Полезны PR-кривая и кривая стоимости.
- Что такое калибровка вероятностей модели и когда она критична?A)Совпадение предсказанных вероятностей с реальными частотами исходовB)Подбор оптимального порога классификации по максимуму метрики F1C)Нормализация входных признаков модели перед этапом обученияD)Приведение скоров разных моделей к единой шкале от 0 до 100 баллов
показать ответ и разбор
+A)Совпадение предсказанных вероятностей с реальными частотами исходов// разбор: Хороший рэнкер может быть плохо калиброван (бустинг обычно уверен чрезмерно, после downsampling — тем более). Проверяют reliability-диаграммой, ECE и Brier score; чинят Platt scaling или isotonic regression на отложенной выборке. Если используется только порог/рэнкинг — калибровка не обязательна; если вероятности умножаются на деньги — обязательна.
- Офлайн модель показывает отличные метрики, а в проде работает заметно хуже. Частая причина со стороны оценки?A)Слишком маленький learning rate при обучении, из-за которого модель просто не дообучиласьB)Неверно выбранный оптимизаторC)Недостаточно эпох обученияD)Offline-online gap: сдвиг распределения, утечка или срез завышают офлайн-оценку
показать ответ и разбор
+D)Offline-online gap: сдвиг распределения, утечка или срез завышают офлайн-оценку// разбор: Разрыв офлайн–онлайн возникает, когда офлайн-условия не совпадают с продом: сдвиг распределения (сезонность, новые пользователи), утечка признаков, доступных только задним числом, разметка на «удобной» подвыборке, оценка не на репрезентативном срезе, отсутствие эффекта обратной связи (модель влияет на данные). Всё это завышает офлайн-метрики. Диагноз — сверять офлайн с онлайном (A/B, backtest на честном временном сплите).
- Что измеряет MAP (mean average precision) в задачах поиска/рекомендаций?A)Среднюю задержку ответа поисковой системы на пользовательский запрос в миллисекундахB)Средняя по запросам average precision — чувствительна к порядку релевантныхC)Максимальную точность на лучшем из запросовD)Долю запросов, где хоть один результат оказался релевантным
показать ответ и разбор
+B)Средняя по запросам average precision — чувствительна к порядку релевантных// разбор: Average precision для одного запроса — среднее значение precision в точках, где встречается очередной релевантный документ; она растёт, когда релевантные стоят выше. MAP усредняет AP по всем запросам. В отличие от precision@k, MAP учитывает порядок внутри выдачи и все релевантные, а не фиксированную отсечку. Подходит для бинарной релевантности; для градаций берут NDCG.
это 9 из 55
Ещё 46 вопросов по теме — в тренажёре, с движком повторения
Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.
Частые вопросы
Когда ROC-AUC вводит в заблуждение?
На сильном дисбалансе классов: кривая выглядит хорошо, потому что истинно отрицательных много. В таких задачах информативнее PR-AUC и метрики на рабочем пороге.
Как выбрать порог классификации?
Из цены ошибок: сколько стоит пропуск и сколько ложная тревога. Порог подбирают на валидации под целевой precision или recall, а не оставляют по умолчанию.