Версионирование промптов и оценка результатов
Отслеживайте изменения промптов и оценивайте ответы
«Версионирование промптов и оценка результатов» — бесплатный урок MLOps Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения MLOps Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс MLOps Academy содержит 4 уроков всего.
Подсказки — это код
Переформулированная подсказка может за одну ночь изменить поведение модели. Поэтому относитесь к каждой подсказке как к версионируемому артефакту с историей, проверкой и возможностью отката. 📝
Храните подсказки, а не строки
Строки, жёстко прописанные и разбросанные по коду, невозможно отслеживать. Храните подсказки в реестре или файлах, чтобы каждое изменение было видно и доступно для сравнения.
prompts/summarize_ticket.v2.txt
prompts/summarize_ticket.v3.txtПомечайте каждую версию
Присвойте каждой подсказке понятный идентификатор версии, который можно зафиксировать в коде. Тогда вы всегда будете точно знать, какая формулировка привела к определённому результату.
PROMPT_VERSION = "summarize-v3"
template = load_prompt(PROMPT_VERSION)Создайте набор данных для оценки
Соберите реальные входные данные вместе с желаемыми ответами. Этот набор для оценки станет мерилом, по которому можно определить, действительно ли изменение подсказки принесло пользу.
cases = [
{"input": "ticket text...", "expected": "Refund requested"},
]Сравнивайте с эталонами
Для задач с известным ответом сравнивайте результат с ожидаемым текстом. Такой простой показатель, как полное совпадение или F1, быстро показывает, пройдена проверка или нет.
Используйте LLM в роли судьи
Для текстов со свободной формой попросите другую модель оценить ответ по заданным критериям. Такой подход «LLM в роли судьи» позволяет масштабировать оценивание за пределы правил, написанных вручную.
judge_prompt = "Rate 1-5 how well the summary captures the ticket:\n{output}"Контролируйте самого судью
Судьи могут быть предвзятыми или непоследовательными. Чтобы сохранить объективность, выборочно сравнивайте их оценки с несколькими человеческими оценками для тех же случаев.
Запускайте оценивание при каждом изменении
Перед выпуском новой подсказки проверьте её на всём наборе для оценки. Продвигайте её дальше только в том случае, если оценка сохраняется или улучшается, а не на основании догадки.
old = run_eval("summarize-v2")
new = run_eval("summarize-v3")
assert new.score >= old.scoreОтслеживайте регрессии
Подсказка, исправляющая один случай, может сломать другой. Сравнение результатов для отдельных случаев выявляет такие регрессии ещё до того, как их увидят пользователи.
Средства разработки помогают
Инструменты вроде promptfoo или OpenAI Evals запускают наборы данных, вызывают модели и формируют отчёты с оценками. Средство разработки превращает разовые проверки в повторяемый набор тестов.
Зафиксируйте лучший вариант
После того как версия победит по результатам оценки, зафиксируйте её в рабочей среде, а остальные отправьте в архив. Теперь у вас есть чёткая проверяемая цепочка от подсказки к результату.
Быстрая проверка
Вам нужно оценить краткие тексты со свободной формой, для которых нет единственного правильного ответа. Что подойдёт лучше всего?
Итоги
Вы научились версионировать подсказки, создавать набор для оценки, оценивать результаты с помощью показателей или LLM-судьи и допускать выпуски на основании результатов. Больше никаких догадок! 🎉
Изучай Python с ИИ-репетитором — бесплатно
Пиши и запускай код прямо в браузере, получай мгновенную помощь от ИИ-репетитора 24/7 и продолжи учиться на сайте или в приложении.
- Курсы
- 30
- Уроки
- 120
Часто задаваемые вопросы
Урок «Версионирование промптов и оценка результатов» бесплатный?
Да — полный текст урока «Версионирование промптов и оценка результатов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс MLOps Academy, подпишись на CoddyKit PRO. Курс MLOps Academy содержит 4 уроков всего.
Чему я научусь в уроке «Версионирование промптов и оценка результатов»?
Отслеживайте изменения промптов и оценивайте ответы Ты практикуешь MLOps Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать MLOps Academy?
Предыдущий опыт не требуется. MLOps Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Версионирование промптов и оценка результатов»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке MLOps Academy?
Да. Каждый урок MLOps Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Чем LLMOps отличается от классического MLOps
- Версионирование промптов и оценка результатов
- Трассировка и мониторинг вызовов LLM
- Ограничители и оценка RAG