データ収集:軌跡とトレースの再生
成功したエージェントのトレースを再生し、(state, action)ペアからなる学習データセットを構築します。
「データ収集:軌跡とトレースの再生」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン2/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
データがプロダクトです
ファインチューニングは、モデリングが10%、データが90%です。品質を大きく改善するのは、より大きなモデルではなく、より優れたデータセットです。
エージェントのトラジェクトリとは
トラジェクトリには、エージェントの1回の完全な実行が記録されます。
trajectory = {
'task': 'Refactor the auth module',
'messages': [
{'role': 'system', 'content': '...'},
{'role': 'user', 'content': 'Task...'},
{'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
{'role': 'tool', 'content': '...'},
...
],
'outcome': 'success'
}本番トレースの収集
最も優れたデータソースは、実際の利用データです。
for trace in production_traces:
if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
save_to_training_set(trace)トレースの再生
成功したトレースを再生して再現性を検証し、トレーニング例としても使用します。
def replay(trace):
messages = trace.messages[:1] # just the initial user msg
for expected_msg in trace.messages[1:]:
actual = agent.step(messages)
if actual.role == 'assistant':
messages.append(actual)
elif expected_msg.role == 'tool':
messages.append(expected_msg) # replay tool result高品質なトレースのフィルタリング
- 結果が成功している(テストに合格し、ユーザーも満足している)
- トレースが短い(無駄な試行錯誤がない)
- ツール呼び出しが適切である
- セキュリティアラートが発生していない
大規模モデルからの蒸留
強力なモデル(GPT-4o)を使用して、チューニング対象(Llama 8B)のトラジェクトリを生成します。
for task in task_list:
traj = big_model_agent.run(task)
if traj.success:
save_for_training(traj)
# Now fine-tune Llama 8B on the GPT-4o traces.悪いトラジェクトリの除去
悪い例が1つあるだけで、トレーニングが汚染されます。積極的にフィルタリングしてください。
- エラーのあるトレースを除外する
- ツールの幻覚があるトレースを除外する
- ツール呼び出しがN回を超えるトレースを除外する
- ポリシーに反するトレースを除外する
ファインチューニング用の形式
OpenAIでは、messagesを含むJSONLが必要です。
{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}トレーニングデータ内のツール呼び出し
tool_callsとツールメッセージを含めてください。モデルがエージェントループ全体を学習できるようになります。
{
"messages": [
{"role": "user", "content": "Weather in Paris?"},
{"role": "assistant", "tool_calls": [{...}]},
{"role": "tool", "tool_call_id": "...", "content": "{...}"},
{"role": "assistant", "content": "It is 18C and sunny."}
]
}否定的な例
一部のトレーニング手法(DPO、KTO)では、悪い例も役立ちます。
preferences = [
{'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]データセットサイズ計算機
トレーニング手法ごとに必要となる、おおよそのデータ量です。
- 形式のためのSFT:500~2000
- 新しい能力のためのSFT:5k~50k
- DPO:1k~10k個の選好ペア
- RLHF / RLAIF:10k~100k以上
データセットのバージョン管理
データセットをコードと同じように扱います。バージョンを管理し、どのトレースが含まれているかを追跡し、再現可能なビルドを行います。
人間参加型のキュレーション
最も優れたデータセットは、人間によるレビューキューを通過しています。Argilla、Label Studio、Snorkelなどのツールを使うと、この作業を効率化できます。
最適なトレースソース
トレーニング用トラジェクトリの中で、最も有効な情報源はどれでしょうか。
まとめ
実際に成功した実行から得られるトラジェクトリは、非常に価値の高いデータです。必要に応じて強力なモデルから蒸留します。積極的にフィルタリングし、データセットをバージョン管理してください。
よくある質問
「データ収集:軌跡とトレースの再生」レッスンは無料ですか?
はい。「データ収集:軌跡とトレースの再生」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「データ収集:軌跡とトレースの再生」で何を学びますか?
成功したエージェントのトレースを再生し、(state, action)ペアからなる学習データセットを構築します。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン2/4です。
「データ収集:軌跡とトレースの再生」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。