Оценка дообученных моделей по сравнению с базовой
Проведите A/B-сравнение с базовой моделью на своём наборе для оценки — иногда дообучение приносит больше вреда, чем пользы
«Оценка дообученных моделей по сравнению с базовой» — бесплатный урок AI Agents на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Не доверяйте потере на обучении
Низкая потеря на обучении не означает улучшения в рабочей среде. Модель может переобучиться, утратить общие способности или хуже справляться с неизвестными задачами.
Всегда оценивайте дообученную модель на отложенном наборе для оценки.
Три обязательных разбиения для оценки
- Обучение — используется при дообучении
- Проверка — используется для выбора лучшей контрольной точки
- Тестирование — никогда не встречается во время обучения; используется ONLY для итоговой оценки
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')Следите за катастрофическим забыванием
Дообучение на узких данных может ухудшить работу модели с OTHER задачами. Также тестируйте её на широком наборе для оценки, а не только на новой специализации.
Отчётность по категориям
Добавьте метки к набору для оценки и сообщайте оценки по каждой категории:
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)Калибровка
После дообучения модели часто становятся чрезмерно уверенными. Сравнивайте предсказанную и фактическую вероятность правильного ответа и при необходимости выполняйте калибровку.
Изменение длины и стиля
Дообученные модели смещаются в сторону распределения обучающих данных. Если обучающие данные короче, выходные данные тоже становятся короче. Иногда это желательно, а иногда — нет.
A/B-тестирование в рабочей среде
Помимо автономной оценки, проводите A/B-тестирование в рабочей среде:
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)Сравнение качества и затрат
Дообученная модель может быть меньше и дешевле. Общая оценка затрат и качества:
- Базовая GPT-4o: $X за вызов, качество Y
- Дообученная Llama 8B (развёрнутая на собственных ресурсах): $X/10 за вызов, качество 0.9Y
- Вероятно, это победитель, если Y остаётся достаточно высоким
Скрытые режимы отказа
Пробуйте состязательные входные данные:
- Подсказки, пытающиеся обойти защитные ограничения
- Входные данные вне распределения
- Подсказки для пограничных случаев
Иногда дообучение ослабляет безопасность; проверьте это перед выпуском.
Оговорка об LLM в роли судьи
Если вы используете судью на базе LLM, выбирайте DIFFERENT семейство моделей, а не то, к которому относится дообученная модель. Иначе судья будет предвзято выставлять высокие оценки.
Когда обновлять набор данных
Если оценка показывает регрессии в определённых категориях:
- Найдите похожие примеры в рабочих трассировках
- Добавьте их в обучающий набор
- Повторите обучение
- Повторите оценку
Откат — это OK
Если дообученная модель показывает худший результат, откажитесь от неё и попробуйте снова. Уже понесённые затраты — не причина выпускать более плохую модель.
Катастрофическое забывание
Что такое катастрофическое забывание при дообучении?
Повторение
Оценивайте дообученную модель по сравнению с базовой на эталонном наборе YOUR. Следите за регрессиями по категориям. Проводите A/B-тестирование в рабочей среде. Выполняйте откат, если модель проигрывает; обновляйте набор данных, если она выигрывает лишь частично.
Часто задаваемые вопросы
Урок «Оценка дообученных моделей по сравнению с базовой» бесплатный?
Да — полный текст урока «Оценка дообученных моделей по сравнению с базовой» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Оценка дообученных моделей по сравнению с базовой»?
Проведите A/B-сравнение с базовой моделью на своём наборе для оценки — иногда дообучение приносит больше вреда, чем пользы Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.
Сколько времени занимает урок «Оценка дообученных моделей по сравнению с базовой»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Когда дообучение лучше подсказок
- Сбор данных: траектории и воспроизведение трасс
- LoRA и QLoRA для экономичного дообучения
- Оценка дообученных моделей по сравнению с базовой