Когда дообучение лучше подсказок
Дообучайте модель для узких задач и пользовательских форматов или чтобы сократить подсказки, но не для обучения новым фактам
«Когда дообучение лучше подсказок» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Сначала настройка промпта, потом дообучение
Всегда исчерпайте возможности настройки промпта, прежде чем переходить к дообучению:
- Улучшите системный промпт
- Добавьте примеры с образцами
- Улучшите описания инструментов
- Используйте более качественную модель
- Структурированные выходные данные / Pydantic
- RAG
- ... THEN дообучение
Когда дообучение помогает
- Особый формат или стиль — специально разработанный язык вывода в YAML
- Узкая предметная область — медицина, право, проверка кода
- Задержка — короткие промпты (без примеров с образцами) обеспечивают более быстрый вывод
- Стоимость — короткие промпты означают меньше оплачиваемых токенов
- Стабильная персона — голос персонажа, тон бренда
Когда дообучение вредит
- Обучение фактам — RAG лучше. Дообученные модели забывают факты
- Общие рассуждения — передовые модели уже отлично с этим справляются
- Частые обновления — повторное обучение выполняется медленно
- Крошечные наборы данных — менее 100 примеров редко дают заметный результат
Дообучение закрытых моделей
OpenAI и Anthropic предлагают API для дообучения:
# OpenAI:
client.fine_tuning.jobs.create(
training_file='file-abc',
model='gpt-4o-mini-2024-07-18'
)Дообучение моделей с открытым исходным кодом
Для Llama/Mistral/Qwen Вы контролируете всё. Инструменты:
- Unsloth — самый быстрый, требует мало VRAM
- Axolotl — управляется конфигурацией, обладает широкими возможностями
- LLaMA-Factory — альтернатива от китайской команды
- HuggingFace TRL — официальный и гибкий
Полное дообучение и PEFT
Есть два подхода:
- Полное — обновлять каждый вес. Дорого (требуется огромное количество VRAM).
- PEFT / LoRA — обучать небольшие адаптерные слои. В 100 раз дешевле и обеспечивает сопоставимое качество для большинства задач.
Стоимость дообучения (OpenAI)
Приблизительные данные (середина 2025 года):
- Обучение: $0.003 за 1 тыс. токенов
- Вывод на дообученной модели: несколько дороже, чем на базовой
- Десятки тысяч примеров: общая стоимость обучения $20–200
Стоимость дообучения (самостоятельное размещение)
Один час работы конфигурации 8xH100: около $100 при использовании Lambda Labs. Дообучение LoRA для Llama 70B на 10 тыс. образцов: общая стоимость около $50–150.
Ориентир по объёму данных
- 50 примеров — полезны только для стиля или формата
- 500 примеров — дают заметные улучшения
- 5 000 и более примеров — обеспечивают существенно новые возможности
- 50 000 и более примеров — отдача снижается по сравнению с повышением качества набора данных
Откуда берутся данные?
- Трассировки из производственной системы (с исправлениями)
- Синтетическая генерация более сильной моделью
- Разметка людьми
- Общедоступные наборы данных
Что выбрать: дообучение, RAG или настройку промпта
| Цель | Лучший подход |
|---|---|
| Новые факты | RAG |
| Новый формат | Дообучение (или сильный промпт) |
| Новый стиль | Дообучение |
| Лучшие рассуждения | Более сильная модель |
| Меньшая стоимость или задержка | Меньшая модель и дообучение |
Оценка до и после
Всегда сравнивайте производительность дообученной модели с базовой на наборе для оценки YOUR. Иногда дообученная модель хуже — будьте готовы отказаться от неё.
Лучшая причина для дообучения
Какова BEST причина для дообучения?
Повторение
Сначала используйте подсказки; дообучайте только по узким причинам, связанным с форматом, стилем или предметной областью. Используйте PEFT/LoRA для снижения затрат. Всегда проводите оценку до и после.
Часто задаваемые вопросы
Урок «Когда дообучение лучше подсказок» бесплатный?
Да — полный текст урока «Когда дообучение лучше подсказок» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Когда дообучение лучше подсказок»?
Дообучайте модель для узких задач и пользовательских форматов или чтобы сократить подсказки, но не для обучения новым фактам Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Когда дообучение лучше подсказок»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Когда дообучение лучше подсказок
- Сбор данных: траектории и воспроизведение трасс
- LoRA и QLoRA для экономичного дообучения
- Оценка дообученных моделей по сравнению с базовой