Вопросы по машинному обучению на собеседовании
Классический ML остаётся ядром собеседования дата-сайентиста, даже когда вакансия про нейросети. Проверяют, понимаете ли вы, откуда берётся переобучение, почему accuracy бесполезна на несбалансированных классах и что делать с утечкой признаков.
Что спрашивают
- +Линейные модели: интерпретация коэффициентов, мультиколлинеарность, зачем масштабировать признаки
- +Деревья и ансамбли: чем бэггинг отличается от бустинга, почему случайный лес устойчив, где градиентный бустинг проигрывает
- +Переобучение: как его увидеть, регуляризация, кросс-валидация и её ловушки при временных данных
- +Признаки: кодирование категорий, утечка целевой переменной, отбор признаков и его влияние на валидацию
- +Метрики: precision против recall, ROC-AUC и PR-AUC на редких классах, выбор метрики под бизнес-задачу
Из чего состоит тема
Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.
- Деревья и ансамбли23
- Кластеризация и unsupervised23
- Метрики классификации19
- Линейные модели15
- Фичи и препроцессинг15
- kNN, SVM, наивный Байес14
- Оверфит и регуляризация14
- Утечки данных13
- Метрики ранжирования и рекомендаций10
- Метрики регрессии и ранжирования10
- Калибровка и пороги8
- Ловушки метрик8
Разборы подтем
Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.
- Признаки и препроцессинг данных15 вопросов
- Линейные модели в ML15 вопросов
- Переобучение и регуляризация14 вопросов
- Деревья решений и ансамбли23 вопросов
- Кластеризация и обучение без учителя23 вопросов
- Калибровка и выбор порога8 вопросов
- Метрики классификации19 вопросов
- Ловушки метрик качества8 вопросов
- Метрики ранжирования и рекомендаций10 вопросов
- Метрики регрессии10 вопросов
- Утечки данных в ML13 вопросов
- kNN, SVM и наивный Байес14 вопросов
Примеры вопросов с разбором
- Что такое утечка данных (data leakage) в машинном обучении?A)В обучение попадает информация, недоступная модели на момент предсказания в продеB)Потеря части обучающих данных из-за сбоя при их загрузке в памятьC)Несанкционированная утечка персональных данных за пределы защищённого сетевого контураD)Постепенное устаревание модели по мере дрейфа распределения признаков
показать ответ и разбор
+A)В обучение попадает информация, недоступная модели на момент предсказания в проде// разбор: Data leakage — когда в фичи или процесс обучения просачивается информация, которой на момент реального предсказания не будет: сведения о таргете или из будущего. Модель «подсматривает» ответ, метрика на валидации завышена, а в проде рушится. Это дефект данных и пайплайна, а не утрата данных, не приватность и не дрейф.
- Каким моделям нужно масштабирование признаков (StandardScaler/MinMax), а каким — практически безразлично?A)Всем моделям без исключения: масштабирование — обязательный шаг препроцессинга в грамотном ML-пайплайне, пропускать его не получитсяB)Моделям на расстояниях и градиентах (kNN, SVM, линейные с регуляризацией, сети); деревьям и бустингу — безразличноC)Нейросетям — классическим моделям масштаб не важенD)Деревьям и бустингу нужно, линейным моделям — нет
показать ответ и разбор
+B)Моделям на расстояниях и градиентах (kNN, SVM, линейные с регуляризацией, сети); деревьям и бустингу — безразлично// разбор: Расстояния и регуляризация чувствительны к масштабу: признак с большим разбросом доминирует в метрике и в штрафе. Деревья сравнивают значения признака только с порогами внутри самого признака — монотонные преобразования им не важны. Классика собеса: «зачем скейлить перед Lasso?» — чтобы штраф был честным для всех весов.
- Что делает kNN на этапе обучения?A)Практически ничего: запоминает обучающую выборку, вся работа идёт на предсказанииB)Подбирает и оптимизирует веса признаков градиентным спуском на обучающей выборкеC)Строит дерево решений по расстояниям между всеми объектамиD)Оценивает плотность классов и запоминает параметры распределений
показать ответ и разбор
+A)Практически ничего: запоминает обучающую выборку, вся работа идёт на предсказании// разбор: kNN — ленивый алгоритм: на обучении он просто сохраняет размеченную выборку, никакой модели не строит. Вся стоимость переносится на inference — для нового объекта считаются расстояния до обучающих точек, берутся k ближайших, класс определяется голосованием. Отсюда дешёвое обучение и дорогое предсказание.
- SVM с RBF-ядром: за что отвечают параметры C и gamma?A)C — скорость обучения на каждом шаге, gamma — максимальное число опорных векторов, которое разрешено использовать моделиB)C — цена ошибки на трейне (меньше C — сильнее регуляризация), gamma — радиус влияния объектаC)C — ширина ядра, gamma — сила регуляризацииD)Оба параметра влияют на время обучения, а не на форму границы
показать ответ и разбор
+B)C — цена ошибки на трейне (меньше C — сильнее регуляризация), gamma — радиус влияния объекта// разбор: C балансирует ширину зазора и ошибки: большой C — «наказать все ошибки», риск переобучения. Gamma задаёт масштаб RBF: большой gamma — каждая точка влияет локально, граница изрезанная; маленький — почти линейная. Их подбирают совместно по сетке, эффекты переплетены.
- Модель показывает accuracy 0.99 на трейне и 0.72 на тесте. Что это и что делать в первую очередь?A)Недообучение; увеличить сложность моделиB)Утечка данных; переразметить тестовую выборкуC)Переобучение; усилить регуляризацию, упростить модель или добавить данныхD)Нормальная ситуация; тест заметно хуже трейна
показать ответ и разбор
+C)Переобучение; усилить регуляризацию, упростить модель или добавить данных// разбор: Большой разрыв train/test — классическое переобучение: модель выучила шум обучающей выборки. Стандартные ходы: регуляризация (L1/L2, дропаут, ограничение глубины), больше данных/аугментаций, упрощение модели, кросс-валидация для честной оценки.
- Чем принципиально отличается случайный лес от градиентного бустинга?A)Лес снижает смещение слабых деревьев за счёт голосования, а бустинг убирает их дисперсию последовательными шагамиB)Лес использует неглубокие деревья, бустинг — глубокиеC)Лес строит деревья независимо на бутстрепах и усредняет; бустинг — последовательно, по ошибкам предыдущихD)Бустинг работает лишь с бинарной классификацией, лес — с задачами
показать ответ и разбор
+C)Лес строит деревья независимо на бутстрепах и усредняет; бустинг — последовательно, по ошибкам предыдущих// разбор: Random forest — бэггинг: независимые деревья на подвыборках, агрегация снижает дисперсию. Бустинг — последовательная сборка: каждое следующее дерево учится на остатках (антиградиенте лосса) текущего ансамбля и снижает смещение. Поэтому лес терпимее к переобучению, а бустинг обычно точнее при аккуратной настройке.
- K-means стабильно даёт плохие кластеры на данных с кластерами разной плотности и вытянутой формы. Почему?A)K-means требует нормального распределения признаков и ломается без негоB)K-means минимизирует квадраты расстояний до центроидов — неявно ждёт сферические кластеры сопоставимого размераC)K-means не сходится на данных размерности выше десятиD)Число кластеров k приходится задавать заранее, и на сложных данных алгоритм редко угадывает правильное разбиение
показать ответ и разбор
+B)K-means минимизирует квадраты расстояний до центроидов — неявно ждёт сферические кластеры сопоставимого размера// разбор: Целевая функция k-means — сумма квадратов расстояний до центроидов, оптимум достигается на компактных «шарах» примерно равного радиуса. Вытянутые, вложенные или разноплотные кластеры он режет неправильно. Альтернативы: DBSCAN/HDBSCAN (плотностные), GMM (эллипсоиды), спектральная кластеризация.
- Модель хорошо ранжирует, но её вероятности завышены. Что делает калибровка (Platt/isotonic)?A)Меняет ранжирование примеров так, чтобы поднять итоговый ROC-AUC на валидационной выборкеB)Отбрасывает часть признаков ради простоты моделиC)Балансирует классы через передискретизацию обучающей выборкиD)Настраивает выходы в вероятности (p≈0.7 → ~70% позитивов), не трогая порядок
показать ответ и разбор
+D)Настраивает выходы в вероятности (p≈0.7 → ~70% позитивов), не трогая порядок// разбор: Калибровка чинит не порядок, а СМЫСЛ вероятностей: чтобы p=0.7 действительно означало 70% шанс. Platt scaling обучает логистическую поправку поверх выходов, isotonic — монотонную кусочную функцию (гибче, но жаднее к данным). ROC-AUC от монотонного преобразования не меняется — калибровка улучшает log-loss/Brier и надёжность порогов и ожидаемой стоимости, а не ранжирование.
- В задаче с 1% позитивного класса модель предсказывает всем «негатив» и получает accuracy 99%. Какие метрики честнее покажут её бесполезность?A)Та же accuracy, но замеренная на существенно большем тестовом набореB)MSE между предсказанными метками и истинными значениями классовC)Precision, recall, F1, PR-AUC — чувствительные к позитивному классуD)Log-loss, посчитанный на обучающей выборке модели
показать ответ и разбор
+C)Precision, recall, F1, PR-AUC — чувствительные к позитивному классу// разбор: Accuracy на дисбалансе меряет в основном мажоритарный класс. У константной модели recall позитивов = 0 — это сразу видно по precision/recall/F1 и PR-кривой. Правило: метрику выбирать от цены ошибок бизнеса, а не от красоты цифры.
это 9 из 172
Ещё 163 вопросов по теме — в тренажёре, с движком повторения
Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.
Частые вопросы
Спрашивают ли классический ML, если вакансия про нейросети?
Почти всегда. Базовые вопросы про переобучение, валидацию и метрики задают независимо от стека, потому что на них видно, понимает ли человек, что вообще происходит с моделью.
Просят ли выводить формулы?
Редко и обычно для простых случаев вроде градиента линейной регрессии. Гораздо чаще просят объяснить поведение модели словами и разобрать, что пойдёт не так на конкретных данных.
Какая ошибка на ML-секции самая частая?
Выбор метрики без учёта задачи и дисбаланса классов, а следом за ним неправильная валидация: случайное разбиение там, где данные упорядочены во времени.