Предобучение и масштабирование LLM
Как LLM учатся - база, без которой остальные LLM-ответы звучат как маркетинг. Проверяют три понимания: что такое next token prediction, почему base-модель - не ассистент и откуда берётся cutoff знаний.
// Одна фраза-ключ: претрейн учит продолжать текст; всё «ассистентское» - надстройка.
Next token prediction и scaling laws
Претрейн - одна задача: предсказать следующий токен на огромном корпусе, лосс - кросс-энтропия по словарю. Из этой единственной задачи вырастают знания, язык и «умения» - потому что хорошо предсказывать текст про мир нельзя, не выучив мир.
Scaling laws: качество предсказуемо растёт степенным законом от трёх ресурсов - параметров, данных, компьюта. Вывод Chinchilla: многие модели «недокормлены» данными относительно размера - сбалансированная модель бьёт недокормленного гиганта.
// Данные решают не меньше архитектуры: дедупликация, фильтрация качества, микс источников (веб, код, книги) - заметная часть рецепта фронтир-моделей.
- scaling laws
- степенная связь качества с параметрами/данными/компьютом
- Chinchilla-optimal
- баланс параметров и данных; «недокормленный» гигант проигрывает
Base-модель, эмерджентность и cutoff
Претрейн даёт base-модель - она продолжает текст, а не отвечает на вопросы: спроси её что-то, и она допишет ещё три вопроса в том же стиле. «Полезный ассистент» появляется после instruction tuning и алаймента.
Эмерджентность: некоторые способности (арифметика, многошаговое рассуждение) проявляются скачком после порога масштаба - маленькая модель не «похуже» в них, а не умеет вовсе.
// Cutoff: модель знает мир до даты корпуса. Свежие факты добываются retrieval'ом и инструментами - не «промптом получше».
- base model
- продолжатель текста до SFT (supervised fine-tuning)/алаймента - не ассистент
- perplexity
- мера предсказания корпуса; не метрика полезности ассистента
Контекст: длина - не бесплатная ручка
Длина контекста ограничена обучением и памятью attention: O(n²) по длине. Расширяют позиционными трюками (RoPE-скейлинг) и эффективными attention-реализациями.
«Влезло в контекст» не равно «модель этим пользуется»: качество работы с серединой длинного контекста бывает заметно хуже краёв - длинные задачи валидируют отдельно.
// Практический вывод: не тащи в контекст всё подряд - retrieval релевантного куска чаще работает лучше и дешевле, чем стотысячный контекст.
Как отвечать: «Почему base-модель плохо отвечает на вопросы?»
Потому что её учили не отвечать, а продолжать текст: next token prediction на корпусе. Спросишь у base-модели «как сварить кофе?» - она с тем же успехом допишет список похожих вопросов: статистически это отличное продолжение. Поведение «понять инструкцию и ответить» появляется на следующих стадиях - SFT на парах инструкция-ответ и алайнмент на человеческих предпочтениях. Поэтому же перплексия base-модели ничего не говорит о качестве будущего ассистента напрямую: это метрика предсказания корпуса, а не следования инструкции.
Ответ разводит стадии обучения и показывает следствие для метрик - глубина, которую вопрос и проверяет.
На чём валят
- −Спрашивать base-модель как ассистента - она продолжит текст вопроса, а не ответит.
- −«Больше параметров = лучше» без данных и компьюта - недокормленный гигант хуже сбалансированной модели.
- −Ждать фактов после cutoff - нужен retrieval, а не «получше промпт».
- −Перплексия как метрика полезности ассистента - она про предсказание корпуса.
Проверьте себя
Пять вопросов из банка по этой подтеме. Всего их 10, остальные разбираются в тренажёре.
- Почему число токенов, а не слов, — базовая единица для LLM?A)Модель работает с токенами (кусками слов из BPE-словаря); от них считают контекст, стоимость и лимитыB)Токен — это ровно одно целое словоC)Токены нужны для русского языкаD)Это устаревшее понятие: современные языковые модели считают отдельные символы, а не токены а токенизацию в них давно считают устаревшим лишним шагом
показать ответ и разбор
+A)Модель работает с токенами (кусками слов из BPE-словаря); от них считают контекст, стоимость и лимиты// разбор: LLM оперируют токенами — единицами субсловной токенизации (BPE и т.п.): частое слово может быть одним токеном, редкое — разбивается на несколько, пробелы и морфемы тоже считаются. Через токены измеряют длину контекста, лимиты и стоимость API. Токен ≠ слово: в среднем ~0.75 слова на токен для английского, для русского токенов на текст обычно больше.
- Что показали scaling laws (в т.ч. Chinchilla) про обучение LLM?A)Итоговое качество модели зависит от числа её параметров, а объём и качество обучающих данных не важныB)При фиксированном бюджете компьюта параметры и объём токенов растят сбалансированно; крупные модели нередко были недо-обучены по даннымC)Чем больше параметров, тем лучше при данныхD)Размер модели вообще не влияет на итоговое качество
показать ответ и разбор
+B)При фиксированном бюджете компьюта параметры и объём токенов растят сбалансированно; крупные модели нередко были недо-обучены по данным// разбор: Scaling laws: loss предсказуемо падает степенным образом с ростом параметров, данных и компьюта. Chinchilla уточнила, что при фиксированном бюджете есть оптимальный баланс: под каждый размер модели нужен пропорциональный объём токенов (грубо ~20 на параметр), и многие ранние крупные модели были недо-обучены по данным — при том же компьюте модель поменьше на большем корпусе была бы лучше. Данные и параметры растят вместе.
- Что такое эмерджентные способности LLM?A)Навыки, почти отсутствующие у малых моделей и заметно проявляющиеся с ростом масштаба (например, few-shot рассуждение)B)Ошибки, возникающие на больших моделяхC)Способности, которые инженеры-разработчики зашивают в модель вручную отдельным жёстко закодированным программным модулем после обученияD)Функции, доступные лишь после квантизации весов
показать ответ и разбор
+A)Навыки, почти отсутствующие у малых моделей и заметно проявляющиеся с ростом масштаба (например, few-shot рассуждение)// разбор: Эмерджентные способности — умения, которые у малых моделей почти на уровне случайности, но при переходе через некоторый масштаб резко становятся рабочими (многие виды few-shot рассуждения, следование сложным инструкциям). Их не программируют — они «появляются» из масштаба и данных. Оговорка: часть «резких скачков» — артефакт пороговых метрик; при плавных метриках рост нередко непрерывный.
- Плохая токенизация под язык/домен бьёт в первую очередь по чему?A)По цвету и оформлению пользовательского интерфейсаB)По орфографии в тексте ответаC)Ни на что заметно не влияетD)По стоимости и эффективному контексту: больше токенов на тот же текст — дороже, короче полезное окно, хуже на цифрах/коде
показать ответ и разбор
+D)По стоимости и эффективному контексту: больше токенов на тот же текст — дороже, короче полезное окно, хуже на цифрах/коде// разбор: Токенизатор задаёт, во сколько токенов обойдётся текст. Если язык/домен представлен плохо (редкие слова дробятся на много кусков), тот же текст съедает больше токенов: растёт цена, сокращается полезное окно, страдает работа с числами (посимвольное дробление ломает арифметику) и редкими терминами/кодом. Отсюда языковые токенизаторы и важность покрытия домена. Для русского это ощутимо.
- Почему для качества предобучения курирование и дедупликация корпуса так важны?A)Это не важно — лишь бы обучающих данных было побольшеB)Дубликаты и мусор искажают распределение, ведут к запоминанию и деградации; чистка/дедуп/фильтрация качества часто дают больше, чем просто объёмC)Дедупликация нужна лишь ради экономии места на дискеD)Качество данных влияет на скорость обучения, но не на саму модель
показать ответ и разбор
+B)Дубликаты и мусор искажают распределение, ведут к запоминанию и деградации; чистка/дедуп/фильтрация качества часто дают больше, чем просто объём// разбор: Веб-корпус полон дублей, спама, шаблонов, утечек бенчмарков. Дубликаты заставляют модель переусиливать частое и буквально запоминать повторённое (риск утечки/регургитации), мусор сдвигает распределение. Дедупликация, фильтрация качества и балансировка источников заметно поднимают качество при том же объёме — данные важнее лишних параметров. Плюс дедуп бенчмарков снижает контаминацию.
дальше
Теорию прочитали. Навык ставится повторением
В Сеньорчике эта подтема идёт в ежедневных сессиях: движок возвращает её, пока ответы не станут уверенными, и ведёт прогресс отдельно по каждой подтеме. Теория внутри тоже бесплатна, лимит только на количество вопросов в день.