0Pricing
AI Agents · Урок

Оценка дообученных моделей по сравнению с базовой

Проведите A/B-сравнение с базовой моделью на своём наборе для оценки — иногда дообучение приносит больше вреда, чем пользы

«Оценка дообученных моделей по сравнению с базовой» — бесплатный урок AI Agents на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Не доверяйте потере на обучении

Низкая потеря на обучении не означает улучшения в рабочей среде. Модель может переобучиться, утратить общие способности или хуже справляться с неизвестными задачами.

Всегда оценивайте дообученную модель на отложенном наборе для оценки.

Три обязательных разбиения для оценки

  1. Обучение — используется при дообучении
  2. Проверка — используется для выбора лучшей контрольной точки
  3. Тестирование — никогда не встречается во время обучения; используется ONLY для итоговой оценки

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

Следите за катастрофическим забыванием

Дообучение на узких данных может ухудшить работу модели с OTHER задачами. Также тестируйте её на широком наборе для оценки, а не только на новой специализации.

Отчётность по категориям

Добавьте метки к набору для оценки и сообщайте оценки по каждой категории:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

Калибровка

После дообучения модели часто становятся чрезмерно уверенными. Сравнивайте предсказанную и фактическую вероятность правильного ответа и при необходимости выполняйте калибровку.

Изменение длины и стиля

Дообученные модели смещаются в сторону распределения обучающих данных. Если обучающие данные короче, выходные данные тоже становятся короче. Иногда это желательно, а иногда — нет.

A/B-тестирование в рабочей среде

Помимо автономной оценки, проводите A/B-тестирование в рабочей среде:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

Сравнение качества и затрат

Дообученная модель может быть меньше и дешевле. Общая оценка затрат и качества:

  • Базовая GPT-4o: $X за вызов, качество Y
  • Дообученная Llama 8B (развёрнутая на собственных ресурсах): $X/10 за вызов, качество 0.9Y
  • Вероятно, это победитель, если Y остаётся достаточно высоким

Скрытые режимы отказа

Пробуйте состязательные входные данные:

  • Подсказки, пытающиеся обойти защитные ограничения
  • Входные данные вне распределения
  • Подсказки для пограничных случаев

Иногда дообучение ослабляет безопасность; проверьте это перед выпуском.

Оговорка об LLM в роли судьи

Если вы используете судью на базе LLM, выбирайте DIFFERENT семейство моделей, а не то, к которому относится дообученная модель. Иначе судья будет предвзято выставлять высокие оценки.

Когда обновлять набор данных

Если оценка показывает регрессии в определённых категориях:

  1. Найдите похожие примеры в рабочих трассировках
  2. Добавьте их в обучающий набор
  3. Повторите обучение
  4. Повторите оценку

Откат — это OK

Если дообученная модель показывает худший результат, откажитесь от неё и попробуйте снова. Уже понесённые затраты — не причина выпускать более плохую модель.

Катастрофическое забывание

Что такое катастрофическое забывание при дообучении?

Повторение

Оценивайте дообученную модель по сравнению с базовой на эталонном наборе YOUR. Следите за регрессиями по категориям. Проводите A/B-тестирование в рабочей среде. Выполняйте откат, если модель проигрывает; обновляйте набор данных, если она выигрывает лишь частично.

Часто задаваемые вопросы

Урок «Оценка дообученных моделей по сравнению с базовой» бесплатный?

Да — полный текст урока «Оценка дообученных моделей по сравнению с базовой» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Оценка дообученных моделей по сравнению с базовой»?

Проведите A/B-сравнение с базовой моделью на своём наборе для оценки — иногда дообучение приносит больше вреда, чем пользы Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Оценка дообученных моделей по сравнению с базовой»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Когда дообучение лучше подсказок
  2. Сбор данных: траектории и воспроизведение трасс
  3. LoRA и QLoRA для экономичного дообучения
  4. Оценка дообученных моделей по сравнению с базовой
← Назад к AI Agents