Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak
Putar ulang jejak agen yang berhasil untuk membangun set pelatihan berupa pasangan (keadaan, tindakan).
Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Data Adalah Produk
Penyetelan halus terdiri dari 10% pemodelan dan 90% data. Peningkatan kualitas terbesar berasal dari kumpulan data yang lebih baik, bukan model yang lebih besar.
Seperti Apa Trajektori Agen
Trajektori mencatat satu eksekusi agen yang lengkap:
trajectory = {
'task': 'Refactor the auth module',
'messages': [
{'role': 'system', 'content': '...'},
{'role': 'user', 'content': 'Task...'},
{'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
{'role': 'tool', 'content': '...'},
...
],
'outcome': 'success'
}Menambang Rekam Jejak Produksi
Sumber data terbaik Anda adalah penggunaan nyata:
for trace in production_traces:
if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
save_to_training_set(trace)Pemutaran Ulang Rekam Jejak
Putar ulang rekam jejak yang berhasil untuk memverifikasi keterulangan, dan gunakan sebagai contoh pelatihan:
def replay(trace):
messages = trace.messages[:1] # just the initial user msg
for expected_msg in trace.messages[1:]:
actual = agent.step(messages)
if actual.role == 'assistant':
messages.append(actual)
elif expected_msg.role == 'tool':
messages.append(expected_msg) # replay tool resultMenyaring Rekam Jejak Berkualitas Tinggi
- Hasilnya berhasil (pengujian lulus, pengguna puas)
- Rekam jejaknya singkat (tanpa proses berputar-putar)
- Pemanggilan alatnya masuk akal
- Tidak ada peringatan keamanan yang terpicu
Distilasi dari Model Besar
Gunakan model yang kuat (GPT-4o) untuk menghasilkan trajektori bagi sasaran penyetelan (Llama 8B):
for task in task_list:
traj = big_model_agent.run(task)
if traj.success:
save_for_training(traj)
# Now fine-tune Llama 8B on the GPT-4o traces.Memangkas Trajektori Buruk
Satu contoh buruk dapat mencemari pelatihan. Lakukan penyaringan secara agresif:
- Buang rekam jejak yang memiliki kesalahan
- Buang rekam jejak yang memiliki halusinasi alat
- Buang rekam jejak dengan lebih dari N pemanggilan alat
- Buang rekam jejak yang bertentangan dengan kebijakan
Format untuk Penyetelan Halus
OpenAI mengharapkan JSONL dengan pesan:
{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}Pemanggilan Alat dalam Data Pelatihan
Sertakan pemanggilan alat dan pesan alat—model mempelajari seluruh siklus agen:
{
"messages": [
{"role": "user", "content": "Weather in Paris?"},
{"role": "assistant", "tool_calls": [{...}]},
{"role": "tool", "tool_call_id": "...", "content": "{...}"},
{"role": "assistant", "content": "It is 18C and sunny."}
]
}Contoh Negatif
Beberapa metode pelatihan (DPO, KTO) juga memperoleh manfaat dari contoh BAD:
preferences = [
{'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]Kalkulator Ukuran Kumpulan Data
Perkiraan jumlah yang diperlukan berdasarkan metode pelatihan:
- SFT untuk format: 500–2000
- SFT untuk kemampuan baru: 5k–50k
- DPO: 1k–10k pasangan preferensi
- RLHF / RLAIF: 10k–100k+
Membuat Versi Kumpulan Data
Perlakukan kumpulan data Anda seperti kode. Buat versinya; lacak rekam jejak mana yang disertakan; pastikan proses pembuatannya dapat direproduksi.
Kurasi dengan Keterlibatan Manusia
Kumpulan data terbaik melewati antrean peninjauan manusia. Alat seperti Argilla, Label Studio, dan Snorkel membuat proses ini efisien.
Sumber Rekam Jejak Terbaik
Apakah sumber trajektori pelatihan dengan sinyal tertinggi?
Ringkasan
Trajektori dari eksekusi nyata yang berhasil adalah sumber yang sangat berharga. Lakukan distilasi dari model yang kuat bila diperlukan. Saring secara agresif. Buat versi kumpulan data Anda.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak” gratis?
Ya — teks lengkap “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak”?
Putar ulang jejak agen yang berhasil untuk membangun set pelatihan berupa pasangan (keadaan, tindakan). Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Saat Penyetelan Halus Lebih Unggul daripada Pemberian Perintah
- Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak
- LoRA dan QLoRA untuk Penyetelan Hemat Biaya
- Mengevaluasi Model yang Disetel vs Basis