Вопросы по машинному обучению на собеседовании
Классический ML остаётся ядром собеседования дата-сайентиста, даже когда вакансия про нейросети. Проверяют, понимаешь ли ты, откуда берётся переобучение, почему accuracy бесполезна на несбалансированных классах и что делать с утечкой признаков.
Что спрашивают
- +Линейные модели: интерпретация коэффициентов, мультиколлинеарность, зачем масштабировать признаки
- +Деревья и ансамбли: чем бэггинг отличается от бустинга, почему случайный лес устойчив, где градиентный бустинг проигрывает
- +Переобучение: как его увидеть, регуляризация, кросс-валидация и её ловушки при временных данных
- +Признаки: кодирование категорий, утечка целевой переменной, отбор признаков и его влияние на валидацию
- +Метрики: precision против recall, ROC-AUC и PR-AUC на редких классах, выбор метрики под бизнес-задачу
Из чего состоит тема
Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, что просели.
- Деревья и ансамбли23
- Кластеризация и unsupervised23
- Метрики классификации19
- Линейные модели15
- Фичи и препроцессинг15
- kNN, SVM, наивный Байес14
- Оверфит и регуляризация14
- Утечки данных13
- Метрики ранжирования и рекомендаций10
- Метрики регрессии и ранжирования10
- Калибровка и пороги8
- Ловушки метрик8
Разборы подтем
Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.
- Признаки и препроцессинг данных15 вопросов
- Линейные модели в ML15 вопросов
- Переобучение и регуляризация14 вопросов
- Деревья решений и ансамбли23 вопросов
- Кластеризация и обучение без учителя23 вопросов
- Калибровка и выбор порога8 вопросов
- Метрики классификации19 вопросов
- Ловушки метрик качества8 вопросов
- Метрики ранжирования и рекомендаций10 вопросов
- Метрики регрессии10 вопросов
- Утечки данных в ML13 вопросов
- kNN, SVM и наивный Байес14 вопросов
Примеры вопросов с разбором
- Что такое утечка данных (data leakage) в машинном обучении?A)В обучение попадает информация, недоступная модели на момент предсказания в продеB)Потеря части обучающих данных из-за сбоя при их загрузке в памятьC)Несанкционированная утечка персональных данных за пределы защищённого сетевого контураD)Постепенное устаревание модели по мере дрейфа распределения признаков
показать ответ и разбор
+A)В обучение попадает информация, недоступная модели на момент предсказания в проде// разбор: Data leakage — когда в фичи или процесс обучения просачивается информация, которой на момент реального предсказания не будет: сведения о таргете или из будущего. Модель «подсматривает» ответ, метрика на валидации завышена, а в проде рушится. Это дефект данных и пайплайна, а не утрата данных, не приватность и не дрейф.
- Каким моделям нужно масштабирование признаков (StandardScaler/MinMax), а каким — практически безразлично?A)Всем моделям без исключения: масштабирование — обязательный шаг препроцессинга в грамотном ML-пайплайне, пропускать его не получитсяB)Моделям на расстояниях и градиентах (kNN, SVM, линейные с регуляризацией, сети); деревьям и бустингу — безразличноC)Нейросетям — классическим моделям масштаб не важенD)Деревьям и бустингу нужно, линейным моделям — нет
показать ответ и разбор
+B)Моделям на расстояниях и градиентах (kNN, SVM, линейные с регуляризацией, сети); деревьям и бустингу — безразлично// разбор: Расстояния и регуляризация чувствительны к масштабу: признак с большим разбросом доминирует в метрике и в штрафе. Деревья сравнивают значения признака только с порогами внутри самого признака — монотонные преобразования им не важны. Классика собеса: «зачем скейлить перед Lasso?» — чтобы штраф был честным для всех весов.
- Что делает kNN на этапе обучения?A)Практически ничего: запоминает обучающую выборку, вся работа идёт на предсказанииB)Подбирает и оптимизирует веса признаков градиентным спуском на обучающей выборкеC)Строит дерево решений по расстояниям между всеми объектамиD)Оценивает плотность классов и запоминает параметры распределений
показать ответ и разбор
+A)Практически ничего: запоминает обучающую выборку, вся работа идёт на предсказании// разбор: kNN — ленивый алгоритм: на обучении он просто сохраняет размеченную выборку, никакой модели не строит. Вся стоимость переносится на inference — для нового объекта считаются расстояния до обучающих точек, берутся k ближайших, класс определяется голосованием. Отсюда дешёвое обучение и дорогое предсказание.
- SVM с RBF-ядром: за что отвечают параметры C и gamma?A)C — скорость обучения на каждом шаге, gamma — максимальное число опорных векторов, которое разрешено использовать моделиB)C — цена ошибки на трейне (меньше C — сильнее регуляризация), gamma — радиус влияния объектаC)C — ширина ядра, gamma — сила регуляризацииD)Оба параметра влияют на время обучения, а не на форму границы
показать ответ и разбор
+B)C — цена ошибки на трейне (меньше C — сильнее регуляризация), gamma — радиус влияния объекта// разбор: C балансирует ширину зазора и ошибки: большой C — «наказать все ошибки», риск переобучения. Gamma задаёт масштаб RBF: большой gamma — каждая точка влияет локально, граница изрезанная; маленький — почти линейная. Их подбирают совместно по сетке, эффекты переплетены.
- Модель показывает accuracy 0.99 на трейне и 0.72 на тесте. Что это и что делать в первую очередь?A)Недообучение; увеличить сложность моделиB)Утечка данных; переразметить тестовую выборкуC)Переобучение; усилить регуляризацию, упростить модель или добавить данныхD)Нормальная ситуация; тест заметно хуже трейна
показать ответ и разбор
+C)Переобучение; усилить регуляризацию, упростить модель или добавить данных// разбор: Большой разрыв train/test — классическое переобучение: модель выучила шум обучающей выборки. Стандартные ходы: регуляризация (L1/L2, дропаут, ограничение глубины), больше данных/аугментаций, упрощение модели, кросс-валидация для честной оценки.
- Чем принципиально отличается случайный лес от градиентного бустинга?A)Лес снижает смещение слабых деревьев за счёт голосования, а бустинг убирает их дисперсию последовательными шагамиB)Лес использует неглубокие деревья, бустинг — глубокиеC)Лес строит деревья независимо на бутстрепах и усредняет; бустинг — последовательно, по ошибкам предыдущихD)Бустинг работает лишь с бинарной классификацией, лес — с задачами
показать ответ и разбор
+C)Лес строит деревья независимо на бутстрепах и усредняет; бустинг — последовательно, по ошибкам предыдущих// разбор: Random forest — бэггинг: независимые деревья на подвыборках, агрегация снижает дисперсию. Бустинг — последовательная сборка: каждое следующее дерево учится на остатках (антиградиенте лосса) текущего ансамбля и снижает смещение. Поэтому лес терпимее к переобучению, а бустинг обычно точнее при аккуратной настройке.
- K-means стабильно даёт плохие кластеры на данных с кластерами разной плотности и вытянутой формы. Почему?A)K-means требует нормального распределения признаков и ломается без негоB)K-means минимизирует квадраты расстояний до центроидов — неявно ждёт сферические кластеры сопоставимого размераC)K-means не сходится на данных размерности выше десятиD)Число кластеров k приходится задавать заранее, и на сложных данных алгоритм редко угадывает правильное разбиение
показать ответ и разбор
+B)K-means минимизирует квадраты расстояний до центроидов — неявно ждёт сферические кластеры сопоставимого размера// разбор: Целевая функция k-means — сумма квадратов расстояний до центроидов, оптимум достигается на компактных «шарах» примерно равного радиуса. Вытянутые, вложенные или разноплотные кластеры он режет неправильно. Альтернативы: DBSCAN/HDBSCAN (плотностные), GMM (эллипсоиды), спектральная кластеризация.
- Модель хорошо ранжирует, но её вероятности завышены. Что делает калибровка (Platt/isotonic)?A)Меняет ранжирование примеров так, чтобы поднять итоговый ROC-AUC на валидационной выборкеB)Отбрасывает часть признаков ради простоты моделиC)Балансирует классы через передискретизацию обучающей выборкиD)Настраивает выходы в вероятности (p≈0.7 → ~70% позитивов), не трогая порядок
показать ответ и разбор
+D)Настраивает выходы в вероятности (p≈0.7 → ~70% позитивов), не трогая порядок// разбор: Калибровка чинит не порядок, а СМЫСЛ вероятностей: чтобы p=0.7 действительно означало 70% шанс. Platt scaling обучает логистическую поправку поверх выходов, isotonic — монотонную кусочную функцию (гибче, но жаднее к данным). ROC-AUC от монотонного преобразования не меняется — калибровка улучшает log-loss/Brier и надёжность порогов и ожидаемой стоимости, а не ранжирование.
- В задаче с 1% позитивного класса модель предсказывает всем «негатив» и получает accuracy 99%. Какие метрики честнее покажут её бесполезность?A)Та же accuracy, но замеренная на существенно большем тестовом набореB)MSE между предсказанными метками и истинными значениями классовC)Precision, recall, F1, PR-AUC — чувствительные к позитивному классуD)Log-loss, посчитанный на обучающей выборке модели
показать ответ и разбор
+C)Precision, recall, F1, PR-AUC — чувствительные к позитивному классу// разбор: Accuracy на дисбалансе меряет в основном мажоритарный класс. У константной модели recall позитивов = 0 — это сразу видно по precision/recall/F1 и PR-кривой. Правило: метрику выбирать от цены ошибок бизнеса, а не от красоты цифры.
это 9 из 172
Ещё 163 вопросов по теме — в тренажёре, с движком повторения
Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы приходят сессиями, а подтему, на которой ты споткнулся, движок принесёт снова: завтра, через три дня, через неделю. Бесплатно, с дневным лимитом вопросов.
Частые вопросы
Спрашивают ли классический ML, если вакансия про нейросети?
Почти всегда. Базовые вопросы про переобучение, валидацию и метрики задают независимо от стека, потому что на них видно, понимает ли человек, что вообще происходит с моделью.
Просят ли выводить формулы?
Редко и обычно для простых случаев вроде градиента линейной регрессии. Гораздо чаще просят объяснить поведение модели словами и разобрать, что пойдёт не так на конкретных данных.
Какая ошибка на ML-секции самая частая?
Выбор метрики без учёта задачи и дисбаланса классов, а следом за ним неправильная валидация: случайное разбиение там, где данные упорядочены во времени.