0Pricing
AI Agents · Lección

Recopilación de datos: trayectorias y reproducción de trazas

Reproduzca trazas satisfactorias de agentes para crear un conjunto de entrenamiento de pares (estado, acción).

Recopilación de datos: trayectorias y reproducción de trazas es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Los datos son el producto

El ajuste fino es 10 % modelado y 90 % datos. Las mayores mejoras de calidad provienen de mejores conjuntos de datos, no de modelos más grandes.

Cómo es la trayectoria de un agente

Una trayectoria captura una ejecución completa del agente:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

Extracción de trazas de producción

Su mejor fuente de datos es el uso real:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

Reproducción de trazas

Reproduzca una traza correcta para verificar que se puede reproducir y para usarla como ejemplo de entrenamiento:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

Filtrado de trazas de alta calidad

  • El resultado es correcto (las pruebas pasan y el usuario está satisfecho)
  • La traza es corta (sin iteraciones improductivas)
  • Las llamadas a herramientas son razonables
  • No se activa ninguna alerta de seguridad

Destilación a partir de modelos grandes

Use un modelo potente (GPT-4o) para generar trayectorias para el modelo objetivo del ajuste (Llama 8B):

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

Poda de trayectorias incorrectas

Un solo ejemplo incorrecto contamina el entrenamiento. Filtre de forma agresiva:

  • Elimine las trazas con errores
  • Elimine las trazas con alucinaciones en las llamadas a herramientas
  • Elimine las trazas con más de N llamadas a herramientas
  • Elimine las trazas que contradigan la política

Formato para el ajuste fino

OpenAI espera JSONL con mensajes:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

Llamadas a herramientas en los datos de entrenamiento

Incluya tool_calls y mensajes de herramientas; el modelo aprende el ciclo completo del agente:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

Ejemplos negativos

Algunos métodos de entrenamiento (DPO, KTO) también se benefician de ejemplos INCORRECTOS:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

Calculadora del tamaño del conjunto de datos

Volumen aproximado necesario según el método de entrenamiento:

  • SFT para el formato: 500-2000
  • SFT para una capacidad nueva: 5k-50k
  • DPO: 1k-10k pares de preferencias
  • RLHF / RLAIF: 10k-100k+

Control de versiones del conjunto de datos

Trate su conjunto de datos como código. Aplique control de versiones, registre qué trazas se incluyeron y use compilaciones reproducibles.

Curación con participación humana

Los mejores conjuntos de datos pasan por una cola de revisión humana. Herramientas como Argilla, Label Studio y Snorkel hacen que este proceso sea eficiente.

Mejor fuente de trazas

¿Cuál es la fuente con mayor señal para obtener trayectorias de entrenamiento?

Resumen

Las trayectorias de ejecuciones reales correctas son oro puro. Destile datos de modelos potentes cuando sea necesario. Filtre de forma agresiva. Aplique control de versiones a su conjunto de datos.

Preguntas frecuentes

¿La lección «Recopilación de datos: trayectorias y reproducción de trazas» es gratis?

Sí — el texto completo de «Recopilación de datos: trayectorias y reproducción de trazas» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Recopilación de datos: trayectorias y reproducción de trazas»?

Reproduzca trazas satisfactorias de agentes para crear un conjunto de entrenamiento de pares (estado, acción). Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.

¿Cuánto tiempo toma la lección «Recopilación de datos: trayectorias y reproducción de trazas»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Cuándo el ajuste fino supera al prompting
  2. Recopilación de datos: trayectorias y reproducción de trazas
  3. LoRA y QLoRA para un ajuste eficiente en costes
  4. Evaluación de modelos ajustados frente al modelo base
← Volver a AI Agents