сеньорчикОткрыть в Telegram
← все вопросывопросы для собеседований · Классический ML

Вопросы по машинному обучению на собеседовании

Классический ML остаётся ядром собеседования дата-сайентиста, даже когда вакансия про нейросети. Проверяют, понимаете ли вы, откуда берётся переобучение, почему accuracy бесполезна на несбалансированных классах и что делать с утечкой признаков.

172 вопросов в банке·12 подтем·ниже разбор 9

Что спрашивают

Из чего состоит тема

Так тема разложена в тренажёре: движок ведёт прогресс по каждой подтеме отдельно и возвращает те, где вы ошибаетесь.

Разборы подтем

Конспект по каждой: что это, как отвечать вслух, на чём валятся, плюс вопросы для самопроверки.

Примеры вопросов с разбором

  1. #data_leakage1 / 9
    Что такое утечка данных (data leakage) в машинном обучении?
    A)В обучение попадает информация, недоступная модели на момент предсказания в проде
    B)Потеря части обучающих данных из-за сбоя при их загрузке в память
    C)Несанкционированная утечка персональных данных за пределы защищённого сетевого контура
    D)Постепенное устаревание модели по мере дрейфа распределения признаков
    показать ответ и разбор
    +A)В обучение попадает информация, недоступная модели на момент предсказания в проде

    // разбор: Data leakage — когда в фичи или процесс обучения просачивается информация, которой на момент реального предсказания не будет: сведения о таргете или из будущего. Модель «подсматривает» ответ, метрика на валидации завышена, а в проде рушится. Это дефект данных и пайплайна, а не утрата данных, не приватность и не дрейф.

  2. #feature_engineering2 / 9
    Каким моделям нужно масштабирование признаков (StandardScaler/MinMax), а каким — практически безразлично?
    A)Всем моделям без исключения: масштабирование — обязательный шаг препроцессинга в грамотном ML-пайплайне, пропускать его не получится
    B)Моделям на расстояниях и градиентах (kNN, SVM, линейные с регуляризацией, сети); деревьям и бустингу — безразлично
    C)Нейросетям — классическим моделям масштаб не важен
    D)Деревьям и бустингу нужно, линейным моделям — нет
    показать ответ и разбор
    +B)Моделям на расстояниях и градиентах (kNN, SVM, линейные с регуляризацией, сети); деревьям и бустингу — безразлично

    // разбор: Расстояния и регуляризация чувствительны к масштабу: признак с большим разбросом доминирует в метрике и в штрафе. Деревья сравнивают значения признака только с порогами внутри самого признака — монотонные преобразования им не важны. Классика собеса: «зачем скейлить перед Lasso?» — чтобы штраф был честным для всех весов.

  3. #knn_svm_bayes3 / 9
    Что делает kNN на этапе обучения?
    A)Практически ничего: запоминает обучающую выборку, вся работа идёт на предсказании
    B)Подбирает и оптимизирует веса признаков градиентным спуском на обучающей выборке
    C)Строит дерево решений по расстояниям между всеми объектами
    D)Оценивает плотность классов и запоминает параметры распределений
    показать ответ и разбор
    +A)Практически ничего: запоминает обучающую выборку, вся работа идёт на предсказании

    // разбор: kNN — ленивый алгоритм: на обучении он просто сохраняет размеченную выборку, никакой модели не строит. Вся стоимость переносится на inference — для нового объекта считаются расстояния до обучающих точек, берутся k ближайших, класс определяется голосованием. Отсюда дешёвое обучение и дорогое предсказание.

  4. #linear_models4 / 9
    SVM с RBF-ядром: за что отвечают параметры C и gamma?
    A)C — скорость обучения на каждом шаге, gamma — максимальное число опорных векторов, которое разрешено использовать модели
    B)C — цена ошибки на трейне (меньше C — сильнее регуляризация), gamma — радиус влияния объекта
    C)C — ширина ядра, gamma — сила регуляризации
    D)Оба параметра влияют на время обучения, а не на форму границы
    показать ответ и разбор
    +B)C — цена ошибки на трейне (меньше C — сильнее регуляризация), gamma — радиус влияния объекта

    // разбор: C балансирует ширину зазора и ошибки: большой C — «наказать все ошибки», риск переобучения. Gamma задаёт масштаб RBF: большой gamma — каждая точка влияет локально, граница изрезанная; маленький — почти линейная. Их подбирают совместно по сетке, эффекты переплетены.

  5. #overfitting_regularization5 / 9
    Модель показывает accuracy 0.99 на трейне и 0.72 на тесте. Что это и что делать в первую очередь?
    A)Недообучение; увеличить сложность модели
    B)Утечка данных; переразметить тестовую выборку
    C)Переобучение; усилить регуляризацию, упростить модель или добавить данных
    D)Нормальная ситуация; тест заметно хуже трейна
    показать ответ и разбор
    +C)Переобучение; усилить регуляризацию, упростить модель или добавить данных

    // разбор: Большой разрыв train/test — классическое переобучение: модель выучила шум обучающей выборки. Стандартные ходы: регуляризация (L1/L2, дропаут, ограничение глубины), больше данных/аугментаций, упрощение модели, кросс-валидация для честной оценки.

  6. #trees_ensembles6 / 9
    Чем принципиально отличается случайный лес от градиентного бустинга?
    A)Лес снижает смещение слабых деревьев за счёт голосования, а бустинг убирает их дисперсию последовательными шагами
    B)Лес использует неглубокие деревья, бустинг — глубокие
    C)Лес строит деревья независимо на бутстрепах и усредняет; бустинг — последовательно, по ошибкам предыдущих
    D)Бустинг работает лишь с бинарной классификацией, лес — с задачами
    показать ответ и разбор
    +C)Лес строит деревья независимо на бутстрепах и усредняет; бустинг — последовательно, по ошибкам предыдущих

    // разбор: Random forest — бэггинг: независимые деревья на подвыборках, агрегация снижает дисперсию. Бустинг — последовательная сборка: каждое следующее дерево учится на остатках (антиградиенте лосса) текущего ансамбля и снижает смещение. Поэтому лес терпимее к переобучению, а бустинг обычно точнее при аккуратной настройке.

  7. #unsupervised7 / 9
    K-means стабильно даёт плохие кластеры на данных с кластерами разной плотности и вытянутой формы. Почему?
    A)K-means требует нормального распределения признаков и ломается без него
    B)K-means минимизирует квадраты расстояний до центроидов — неявно ждёт сферические кластеры сопоставимого размера
    C)K-means не сходится на данных размерности выше десяти
    D)Число кластеров k приходится задавать заранее, и на сложных данных алгоритм редко угадывает правильное разбиение
    показать ответ и разбор
    +B)K-means минимизирует квадраты расстояний до центроидов — неявно ждёт сферические кластеры сопоставимого размера

    // разбор: Целевая функция k-means — сумма квадратов расстояний до центроидов, оптимум достигается на компактных «шарах» примерно равного радиуса. Вытянутые, вложенные или разноплотные кластеры он режет неправильно. Альтернативы: DBSCAN/HDBSCAN (плотностные), GMM (эллипсоиды), спектральная кластеризация.

  8. #calibration_thresholds8 / 9
    Модель хорошо ранжирует, но её вероятности завышены. Что делает калибровка (Platt/isotonic)?
    A)Меняет ранжирование примеров так, чтобы поднять итоговый ROC-AUC на валидационной выборке
    B)Отбрасывает часть признаков ради простоты модели
    C)Балансирует классы через передискретизацию обучающей выборки
    D)Настраивает выходы в вероятности (p≈0.7 → ~70% позитивов), не трогая порядок
    показать ответ и разбор
    +D)Настраивает выходы в вероятности (p≈0.7 → ~70% позитивов), не трогая порядок

    // разбор: Калибровка чинит не порядок, а СМЫСЛ вероятностей: чтобы p=0.7 действительно означало 70% шанс. Platt scaling обучает логистическую поправку поверх выходов, isotonic — монотонную кусочную функцию (гибче, но жаднее к данным). ROC-AUC от монотонного преобразования не меняется — калибровка улучшает log-loss/Brier и надёжность порогов и ожидаемой стоимости, а не ранжирование.

  9. #classification_metrics9 / 9
    В задаче с 1% позитивного класса модель предсказывает всем «негатив» и получает accuracy 99%. Какие метрики честнее покажут её бесполезность?
    A)Та же accuracy, но замеренная на существенно большем тестовом наборе
    B)MSE между предсказанными метками и истинными значениями классов
    C)Precision, recall, F1, PR-AUC — чувствительные к позитивному классу
    D)Log-loss, посчитанный на обучающей выборке модели
    показать ответ и разбор
    +C)Precision, recall, F1, PR-AUC — чувствительные к позитивному классу

    // разбор: Accuracy на дисбалансе меряет в основном мажоритарный класс. У константной модели recall позитивов = 0 — это сразу видно по precision/recall/F1 и PR-кривой. Правило: метрику выбирать от цены ошибок бизнеса, а не от красоты цифры.

это 9 из 172

Ещё 163 вопросов по теме — в тренажёре, с движком повторения

Прочитать разбор и ответить самому — разные навыки. В Сеньорчике вопросы идут сессиями, а движок возвращает подтемы, где вы ошибаетесь, пока они не начнут отскакивать. Бесплатно, лимит по энергии.

Частые вопросы