0Pricing
AI Agents · Aula

Coleta de dados: trajetórias e reprodução de rastros

Reproduza rastros bem-sucedidos de agentes para criar um conjunto de treinamento de pares (estado, ação).

Coleta de dados: trajetórias e reprodução de rastros é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Os dados são o produto

O ajuste fino envolve 10% de modelagem e 90% de dados. As maiores melhorias de qualidade vêm de conjuntos de dados melhores, não de modelos maiores.

Como é uma trajetória de agente

Uma trajetória registra uma execução completa de um agente:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

Extração de rastros de produção

Sua melhor fonte de dados é o uso real:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

Reprodução de rastros

Reproduza um rastro bem-sucedido para verificar a reprodutibilidade e usá-lo como exemplo de treinamento:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

Filtragem de rastros de alta qualidade

  • O resultado é um sucesso (os testes são aprovados, o usuário está satisfeito)
  • O rastro é curto (sem repetições inúteis)
  • As chamadas de ferramentas são sensatas
  • Nenhum alerta de segurança foi acionado

Destilação de modelos grandes

Use um modelo forte (GPT-4o) para gerar trajetórias para um modelo-alvo de ajuste (Llama 8B):

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

Eliminação de trajetórias ruins

Um único exemplo ruim contamina o treinamento. Faça uma filtragem rigorosa:

  • Remova rastros com erros
  • Remova rastros com alucinações de ferramentas
  • Remova rastros com mais de N chamadas de ferramentas
  • Remova rastros que contradigam a política

Formato para ajuste fino

OpenAI espera JSONL com mensagens:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

Chamadas de ferramentas nos dados de treinamento

Inclua chamadas de ferramentas e mensagens de ferramentas — o modelo aprende o ciclo completo do agente:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

Exemplos negativos

Alguns métodos de treinamento (DPO, KTO) também se beneficiam de exemplos BAD:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

Calculadora do tamanho do conjunto de dados

Volume aproximado necessário por método de treinamento:

  • SFT para formato: 500–2000
  • SFT para uma nova capacidade: 5 mil–50 mil
  • DPO: 1 mil–10 mil pares de preferências
  • RLHF / RLAIF: 10 mil–100 mil+

Versionamento do conjunto de dados

Trate seu conjunto de dados como código. Crie versões; registre quais rastros foram incluídos; faça compilações reproduzíveis.

Curadoria com participação humana

Os melhores conjuntos de dados passam por uma fila de revisão humana. Ferramentas como Argilla, Label Studio e Snorkel tornam esse processo eficiente.

Melhor fonte de rastros

Qual é a fonte de maior sinal para trajetórias de treinamento?

Recapitulação

As trajetórias de execuções reais bem-sucedidas são valiosas. Faça a destilação de modelos fortes quando necessário. Filtre rigorosamente. Crie versões do seu conjunto de dados.

Perguntas Frequentes

A aula “Coleta de dados: trajetórias e reprodução de rastros” é grátis?

Sim — o texto completo de “Coleta de dados: trajetórias e reprodução de rastros” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Coleta de dados: trajetórias e reprodução de rastros”?

Reproduza rastros bem-sucedidos de agentes para criar um conjunto de treinamento de pares (estado, ação). Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Coleta de dados: trajetórias e reprodução de rastros”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Quando o ajuste fino supera a criação de instruções
  2. Coleta de dados: trajetórias e reprodução de rastros
  3. LoRA e QLoRA para ajuste eficiente em custos
  4. Avaliação de modelos ajustados em comparação com a base
← Voltar para AI Agents