0Pricing
AI Agents · Урок

Когда дообучение лучше подсказок

Дообучайте модель для узких задач и пользовательских форматов или чтобы сократить подсказки, но не для обучения новым фактам

«Когда дообучение лучше подсказок» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Сначала настройка промпта, потом дообучение

Всегда исчерпайте возможности настройки промпта, прежде чем переходить к дообучению:

  1. Улучшите системный промпт
  2. Добавьте примеры с образцами
  3. Улучшите описания инструментов
  4. Используйте более качественную модель
  5. Структурированные выходные данные / Pydantic
  6. RAG
  7. ... THEN дообучение

Когда дообучение помогает

  • Особый формат или стиль — специально разработанный язык вывода в YAML
  • Узкая предметная область — медицина, право, проверка кода
  • Задержка — короткие промпты (без примеров с образцами) обеспечивают более быстрый вывод
  • Стоимость — короткие промпты означают меньше оплачиваемых токенов
  • Стабильная персона — голос персонажа, тон бренда

Когда дообучение вредит

  • Обучение фактам — RAG лучше. Дообученные модели забывают факты
  • Общие рассуждения — передовые модели уже отлично с этим справляются
  • Частые обновления — повторное обучение выполняется медленно
  • Крошечные наборы данных — менее 100 примеров редко дают заметный результат

Дообучение закрытых моделей

OpenAI и Anthropic предлагают API для дообучения:

# OpenAI:
client.fine_tuning.jobs.create(
    training_file='file-abc',
    model='gpt-4o-mini-2024-07-18'
)

Дообучение моделей с открытым исходным кодом

Для Llama/Mistral/Qwen Вы контролируете всё. Инструменты:

  • Unsloth — самый быстрый, требует мало VRAM
  • Axolotl — управляется конфигурацией, обладает широкими возможностями
  • LLaMA-Factory — альтернатива от китайской команды
  • HuggingFace TRL — официальный и гибкий

Полное дообучение и PEFT

Есть два подхода:

  • Полное — обновлять каждый вес. Дорого (требуется огромное количество VRAM).
  • PEFT / LoRA — обучать небольшие адаптерные слои. В 100 раз дешевле и обеспечивает сопоставимое качество для большинства задач.

Стоимость дообучения (OpenAI)

Приблизительные данные (середина 2025 года):

  • Обучение: $0.003 за 1 тыс. токенов
  • Вывод на дообученной модели: несколько дороже, чем на базовой
  • Десятки тысяч примеров: общая стоимость обучения $20–200

Стоимость дообучения (самостоятельное размещение)

Один час работы конфигурации 8xH100: около $100 при использовании Lambda Labs. Дообучение LoRA для Llama 70B на 10 тыс. образцов: общая стоимость около $50–150.

Ориентир по объёму данных

  • 50 примеров — полезны только для стиля или формата
  • 500 примеров — дают заметные улучшения
  • 5 000 и более примеров — обеспечивают существенно новые возможности
  • 50 000 и более примеров — отдача снижается по сравнению с повышением качества набора данных

Откуда берутся данные?

  1. Трассировки из производственной системы (с исправлениями)
  2. Синтетическая генерация более сильной моделью
  3. Разметка людьми
  4. Общедоступные наборы данных

Что выбрать: дообучение, RAG или настройку промпта

ЦельЛучший подход
Новые фактыRAG
Новый форматДообучение (или сильный промпт)
Новый стильДообучение
Лучшие рассужденияБолее сильная модель
Меньшая стоимость или задержкаМеньшая модель и дообучение

Оценка до и после

Всегда сравнивайте производительность дообученной модели с базовой на наборе для оценки YOUR. Иногда дообученная модель хуже — будьте готовы отказаться от неё.

Лучшая причина для дообучения

Какова BEST причина для дообучения?

Повторение

Сначала используйте подсказки; дообучайте только по узким причинам, связанным с форматом, стилем или предметной областью. Используйте PEFT/LoRA для снижения затрат. Всегда проводите оценку до и после.

Часто задаваемые вопросы

Урок «Когда дообучение лучше подсказок» бесплатный?

Да — полный текст урока «Когда дообучение лучше подсказок» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Когда дообучение лучше подсказок»?

Дообучайте модель для узких задач и пользовательских форматов или чтобы сократить подсказки, но не для обучения новым фактам Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Когда дообучение лучше подсказок»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Когда дообучение лучше подсказок
  2. Сбор данных: траектории и воспроизведение трасс
  3. LoRA и QLoRA для экономичного дообучения
  4. Оценка дообученных моделей по сравнению с базовой
← Назад к AI Agents