0Pricing
AI Agents · レッスン

データ収集:軌跡とトレースの再生

成功したエージェントのトレースを再生し、(state, action)ペアからなる学習データセットを構築します。

「データ収集:軌跡とトレースの再生」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン2/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。

データがプロダクトです

ファインチューニングは、モデリングが10%、データが90%です。品質を大きく改善するのは、より大きなモデルではなく、より優れたデータセットです。

エージェントのトラジェクトリとは

トラジェクトリには、エージェントの1回の完全な実行が記録されます。

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

本番トレースの収集

最も優れたデータソースは、実際の利用データです。

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

トレースの再生

成功したトレースを再生して再現性を検証し、トレーニング例としても使用します。

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

高品質なトレースのフィルタリング

  • 結果が成功している(テストに合格し、ユーザーも満足している)
  • トレースが短い(無駄な試行錯誤がない)
  • ツール呼び出しが適切である
  • セキュリティアラートが発生していない

大規模モデルからの蒸留

強力なモデル(GPT-4o)を使用して、チューニング対象(Llama 8B)のトラジェクトリを生成します。

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

悪いトラジェクトリの除去

悪い例が1つあるだけで、トレーニングが汚染されます。積極的にフィルタリングしてください。

  • エラーのあるトレースを除外する
  • ツールの幻覚があるトレースを除外する
  • ツール呼び出しがN回を超えるトレースを除外する
  • ポリシーに反するトレースを除外する

ファインチューニング用の形式

OpenAIでは、messagesを含むJSONLが必要です。

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

トレーニングデータ内のツール呼び出し

tool_callsとツールメッセージを含めてください。モデルがエージェントループ全体を学習できるようになります。

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

否定的な例

一部のトレーニング手法(DPO、KTO)では、悪い例も役立ちます。

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

データセットサイズ計算機

トレーニング手法ごとに必要となる、おおよそのデータ量です。

  • 形式のためのSFT:500~2000
  • 新しい能力のためのSFT:5k~50k
  • DPO:1k~10k個の選好ペア
  • RLHF / RLAIF:10k~100k以上

データセットのバージョン管理

データセットをコードと同じように扱います。バージョンを管理し、どのトレースが含まれているかを追跡し、再現可能なビルドを行います。

人間参加型のキュレーション

最も優れたデータセットは、人間によるレビュ​​ーキューを通過しています。Argilla、Label Studio、Snorkelなどのツールを使うと、この作業を効率化できます。

最適なトレースソース

トレーニング用トラジェクトリの中で、最も有効な情報源はどれでしょうか。

まとめ

実際に成功した実行から得られるトラジェクトリは、非常に価値の高いデータです。必要に応じて強力なモデルから蒸留します。積極的にフィルタリングし、データセットをバージョン管理してください。

よくある質問

「データ収集:軌跡とトレースの再生」レッスンは無料ですか?

はい。「データ収集:軌跡とトレースの再生」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。

「データ収集:軌跡とトレースの再生」で何を学びますか?

成功したエージェントのトレースを再生し、(state, action)ペアからなる学習データセットを構築します。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

AI Agentsを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン2/4です。

「データ収集:軌跡とトレースの再生」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このAI Agentsレッスンでコードを書いて実行できますか?

はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. プロンプトよりファインチューニングが有効な場合
  2. データ収集:軌跡とトレースの再生
  3. コスト効率の高いチューニングのためのLoRAとQLoRA
  4. チューニング済みモデルとベースモデルの評価
← AI Agentsに戻る