AI Engineering Academy · Урок

Как обучаются LLM

Изучите этапы обучения LLM: предварительное обучение на огромных массивах данных, дообучение под контролем учителя и RLHF, а также поймёте значение каждого этапа для поведения модели.

Урок 3 из 413 шагов

«Как обучаются LLM» — бесплатный урок AI Engineering Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Engineering Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Engineering Academy содержит 4 уроков всего.

Три этапа обучения LLM

LLM создаются в три этапа: предварительное обучение формирует знания языка и мира, дообучение учит следовать инструкциям, а RLHF согласует модель с предпочтениями людей.

Предварительное обучение: предсказание следующего токена в большом масштабе

Предварительное обучение подаёт модели огромное количество текста и даёт ей одну задачу: предсказывать следующий токен. Этой простой цели достаточно, чтобы по ходу обучения освоить грамматику, факты и рассуждения.

Качество и отбор обучающих данных

Необработанный текст из интернета полон недостатков. Команды очищают его с помощью конвейеров данных, которые фильтруют, удаляют дубликаты и оценивают качество. Главное правило: качественные данные важнее модели большего размера.

Функция потерь и оптимизация

Обучение минимизирует кросс-энтропийную потерю — то, насколько предсказание модели отличается от правильного следующего токена. Небольшие изменения весов повторяются миллиарды раз. Код показывает математическую сторону процесса.

# Illustrative cross-entropy loss for a single token prediction
import math

vocab_size = 50000
correct_token_index = 4217  # index for the word 'Paris'

# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size  # simplified uniform base
model_probs[correct_token_index] = 0.70  # model is 70% confident in 'Paris'

loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}')  # ~0.3567

Возникающие способности при масштабировании

При достаточно большом масштабе появляются новые возникающие способности, например пошаговое рассуждение, которых у маленьких моделей просто нет. Никто не обучал им напрямую — их породил масштаб.

Дообучение с учителем на парах инструкций

Необработанная модель просто продолжает текст. Дообучение с учителем обучает её на парах «инструкция — идеальный ответ», чтобы она действительно отвечала, а не продолжала бессвязно рассуждать.

# Illustrative SFT data format
training_example = {
    'messages': [
        {'role': 'system', 'content': 'You are a helpful assistant.'},
        {'role': 'user', 'content': 'What is the capital of France?'},
        {'role': 'assistant', 'content': 'The capital of France is Paris.'}
    ]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained on

Этап 1 RLHF: обучение модели вознаграждения

RLHF начинается с модели вознаграждения. Люди выбирают лучший из двух ответов, а модель вознаграждения учится предсказывать такие предпочтения — это заменитель человеческой оценки.

Этап 2 RLHF: дообучение с PPO

Затем PPO настраивает LLM так, чтобы она получала более высокие оценки от модели вознаграждения. Штраф KL не даёт ей слишком сильно отклоняться и добиваться награды вместо настоящей помощи пользователю.

Прямая оптимизация предпочтений: более простой RLHF

PPO сложен. DPO — более простая альтернатива: он обучает модель непосредственно на парах предпочтительного и отклонённого ответов, без отдельной модели вознаграждения.

Законы масштабирования Chinchilla: обучение с оптимальным использованием вычислений

Вывод исследования Chinchilla: старые модели обучались недостаточно. При заданном бюджете нужно одновременно увеличивать объём данных и размер модели — примерно до 20 токенов на параметр для лучших результатов.

На что влияет каждый этап обучения

Каждый этап отвечает за свою часть: предварительное обучение определяет, что модель знает, дообучение — как она ведёт себя, а RLHF — какие ценности выражает. Это подсказывает, какую часть нужно исправлять.

Быстрая проверка

Проверьте своё понимание концепций инженерии ИИ из этого урока.

Итоги урока

Итоги: предварительное обучение формирует знания, дообучение учит следовать инструкциям, а RLHF или DPO согласует модель с человеческими ценностями. Далее: что LLM умеют и чего не умеют. 💡

Можно начать бесплатно

Изучай Python с ИИ-репетитором — бесплатно

Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.

Курсы
30
Уроки
120

Часто задаваемые вопросы

Урок «Как обучаются LLM» бесплатный?

Да — полный текст урока «Как обучаются LLM» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Engineering Academy, подпишись на CoddyKit PRO. Курс AI Engineering Academy содержит 4 уроков всего.

Чему я научусь в уроке «Как обучаются LLM»?

Изучите этапы обучения LLM: предварительное обучение на огромных массивах данных, дообучение под контролем учителя и RLHF, а также поймёте значение каждого этапа для поведения модели. Ты практикуешь AI Engineering Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Engineering Academy?

Предыдущий опыт не требуется. AI Engineering Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.

Сколько времени занимает урок «Как обучаются LLM»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Engineering Academy?

Да. Каждый урок AI Engineering Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. От автодополнения до ChatGPT
  2. Трансформеры и механизм внимания простыми словами
  3. Как обучаются LLM
  4. Возможности и ограничения LLM
← Назад к AI Engineering Academy