Как обучаются LLM
Изучите этапы обучения LLM: предварительное обучение на огромных массивах данных, дообучение под контролем учителя и RLHF, а также поймёте значение каждого этапа для поведения модели.
«Как обучаются LLM» — бесплатный урок AI Engineering Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Engineering Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Engineering Academy содержит 4 уроков всего.
Три этапа обучения LLM
LLM создаются в три этапа: предварительное обучение формирует знания языка и мира, дообучение учит следовать инструкциям, а RLHF согласует модель с предпочтениями людей.
Предварительное обучение: предсказание следующего токена в большом масштабе
Предварительное обучение подаёт модели огромное количество текста и даёт ей одну задачу: предсказывать следующий токен. Этой простой цели достаточно, чтобы по ходу обучения освоить грамматику, факты и рассуждения.
Качество и отбор обучающих данных
Необработанный текст из интернета полон недостатков. Команды очищают его с помощью конвейеров данных, которые фильтруют, удаляют дубликаты и оценивают качество. Главное правило: качественные данные важнее модели большего размера.
Функция потерь и оптимизация
Обучение минимизирует кросс-энтропийную потерю — то, насколько предсказание модели отличается от правильного следующего токена. Небольшие изменения весов повторяются миллиарды раз. Код показывает математическую сторону процесса.
# Illustrative cross-entropy loss for a single token prediction
import math
vocab_size = 50000
correct_token_index = 4217 # index for the word 'Paris'
# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size # simplified uniform base
model_probs[correct_token_index] = 0.70 # model is 70% confident in 'Paris'
loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}') # ~0.3567Возникающие способности при масштабировании
При достаточно большом масштабе появляются новые возникающие способности, например пошаговое рассуждение, которых у маленьких моделей просто нет. Никто не обучал им напрямую — их породил масштаб.
Дообучение с учителем на парах инструкций
Необработанная модель просто продолжает текст. Дообучение с учителем обучает её на парах «инструкция — идеальный ответ», чтобы она действительно отвечала, а не продолжала бессвязно рассуждать.
# Illustrative SFT data format
training_example = {
'messages': [
{'role': 'system', 'content': 'You are a helpful assistant.'},
{'role': 'user', 'content': 'What is the capital of France?'},
{'role': 'assistant', 'content': 'The capital of France is Paris.'}
]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained onЭтап 1 RLHF: обучение модели вознаграждения
RLHF начинается с модели вознаграждения. Люди выбирают лучший из двух ответов, а модель вознаграждения учится предсказывать такие предпочтения — это заменитель человеческой оценки.
Этап 2 RLHF: дообучение с PPO
Затем PPO настраивает LLM так, чтобы она получала более высокие оценки от модели вознаграждения. Штраф KL не даёт ей слишком сильно отклоняться и добиваться награды вместо настоящей помощи пользователю.
Прямая оптимизация предпочтений: более простой RLHF
PPO сложен. DPO — более простая альтернатива: он обучает модель непосредственно на парах предпочтительного и отклонённого ответов, без отдельной модели вознаграждения.
Законы масштабирования Chinchilla: обучение с оптимальным использованием вычислений
Вывод исследования Chinchilla: старые модели обучались недостаточно. При заданном бюджете нужно одновременно увеличивать объём данных и размер модели — примерно до 20 токенов на параметр для лучших результатов.
На что влияет каждый этап обучения
Каждый этап отвечает за свою часть: предварительное обучение определяет, что модель знает, дообучение — как она ведёт себя, а RLHF — какие ценности выражает. Это подсказывает, какую часть нужно исправлять.
Быстрая проверка
Проверьте своё понимание концепций инженерии ИИ из этого урока.
Итоги урока
Итоги: предварительное обучение формирует знания, дообучение учит следовать инструкциям, а RLHF или DPO согласует модель с человеческими ценностями. Далее: что LLM умеют и чего не умеют. 💡
Изучай Python с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 30
- Уроки
- 120
Часто задаваемые вопросы
Урок «Как обучаются LLM» бесплатный?
Да — полный текст урока «Как обучаются LLM» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Engineering Academy, подпишись на CoddyKit PRO. Курс AI Engineering Academy содержит 4 уроков всего.
Чему я научусь в уроке «Как обучаются LLM»?
Изучите этапы обучения LLM: предварительное обучение на огромных массивах данных, дообучение под контролем учителя и RLHF, а также поймёте значение каждого этапа для поведения модели. Ты практикуешь AI Engineering Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Engineering Academy?
Предыдущий опыт не требуется. AI Engineering Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Как обучаются LLM»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Engineering Academy?
Да. Каждый урок AI Engineering Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- От автодополнения до ChatGPT
- Трансформеры и механизм внимания простыми словами
- Как обучаются LLM
- Возможности и ограничения LLM