0Pricing
MLOps Academy · Lección

Versione prompts y evalúe salidas

Realice el seguimiento de los cambios en los prompts y puntúe las respuestas.

Versione prompts y evalúe salidas es una lección gratuita de MLOps Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de MLOps Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de MLOps Academy incluye 4 lecciones en total.

Partes de esta lección aún no han sido traducidas y se muestran en inglés.

Prompts Are Code

A reworded prompt can change behavior overnight. So you treat each prompt as a versioned artifact, with history, review, and the ability to roll back. 📝

Store Prompts, Not Strings

Hard-coded strings scattered in code are impossible to track. Keep prompts in a registry or files so every change is visible and diffable.

prompts/summarize_ticket.v2.txt
prompts/summarize_ticket.v3.txt

Tag Each Version

Give every prompt a clear version id you can pin in code. Then you always know exactly which wording produced a given output.

PROMPT_VERSION = "summarize-v3"
template = load_prompt(PROMPT_VERSION)

Build an Eval Dataset

Collect real inputs with the answers you want. This eval set is your yardstick for judging whether a prompt change actually helped.

cases = [
  {"input": "ticket text...", "expected": "Refund requested"},
]

Score Against References

For tasks with a known answer, compare output to the expected text. A simple metric like exact match or F1 gives you a fast pass-fail signal.

Use an LLM as Judge

For open-ended text, ask another model to grade the answer against a rubric. This LLM-as-judge pattern scales scoring beyond hand-written rules.

judge_prompt = "Rate 1-5 how well the summary captures the ticket:\n{output}"

Watch the Judge Itself

Judges can be biased or inconsistent. You keep them honest by spot-checking scores against a few human ratings on the same cases.

Run Evals on Every Change

Before shipping a new prompt, run it across the whole eval set. You only promote it if the score holds or improves, never on a hunch.

old = run_eval("summarize-v2")
new = run_eval("summarize-v3")
assert new.score >= old.score

Track Regressions

A prompt that fixes one case can break another. Comparing per-case results catches these regressions before users ever see them.

Frameworks Help

Tools like promptfoo or OpenAI Evals run datasets, call models, and report scores for you. A framework turns ad-hoc testing into a repeatable suite.

Pin the Winner

Once a version wins on your evals, pin it in production and archive the rest. You now have a clear, auditable trail from prompt to result.

Quick Check

You need to score open-ended summaries with no single correct answer. What fits best?

Recap

You learned to version prompts, build an eval set, score with metrics or an LLM judge, and gate releases on results. No more guessing! 🎉

Preguntas frecuentes

¿La lección «Versione prompts y evalúe salidas» es gratis?

Sí — el texto completo de «Versione prompts y evalúe salidas» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de MLOps Academy, actualiza a CoddyKit PRO. El curso de MLOps Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Versione prompts y evalúe salidas»?

Realice el seguimiento de los cambios en los prompts y puntúe las respuestas. Practicas MLOps Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar MLOps Academy?

No se requiere experiencia previa. MLOps Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Versione prompts y evalúe salidas»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de MLOps Academy?

Sí. Cada lección de MLOps Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. En qué se diferencia LLMOps de MLOps clásico
  2. Versione prompts y evalúe salidas
  3. Trace y supervise llamadas a LLM
  4. Guardrails y evaluación de RAG
← Volver a MLOps Academy