0Pricing
AI Agents · Pelajaran

Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak

Putar ulang jejak agen yang berhasil untuk membangun set pelatihan berupa pasangan (keadaan, tindakan).

Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Data Adalah Produk

Penyetelan halus terdiri dari 10% pemodelan dan 90% data. Peningkatan kualitas terbesar berasal dari kumpulan data yang lebih baik, bukan model yang lebih besar.

Seperti Apa Trajektori Agen

Trajektori mencatat satu eksekusi agen yang lengkap:

trajectory = {
    'task': 'Refactor the auth module',
    'messages': [
        {'role': 'system', 'content': '...'},
        {'role': 'user', 'content': 'Task...'},
        {'role': 'assistant', 'content': 'Plan...', 'tool_calls': [...]},
        {'role': 'tool', 'content': '...'},
        ...
    ],
    'outcome': 'success'
}

Menambang Rekam Jejak Produksi

Sumber data terbaik Anda adalah penggunaan nyata:

for trace in production_traces:
    if trace.outcome == 'success' and trace.user_feedback == 'thumbs_up':
        save_to_training_set(trace)

Pemutaran Ulang Rekam Jejak

Putar ulang rekam jejak yang berhasil untuk memverifikasi keterulangan, dan gunakan sebagai contoh pelatihan:

def replay(trace):
    messages = trace.messages[:1]   # just the initial user msg
    for expected_msg in trace.messages[1:]:
        actual = agent.step(messages)
        if actual.role == 'assistant':
            messages.append(actual)
        elif expected_msg.role == 'tool':
            messages.append(expected_msg)   # replay tool result

Menyaring Rekam Jejak Berkualitas Tinggi

  • Hasilnya berhasil (pengujian lulus, pengguna puas)
  • Rekam jejaknya singkat (tanpa proses berputar-putar)
  • Pemanggilan alatnya masuk akal
  • Tidak ada peringatan keamanan yang terpicu

Distilasi dari Model Besar

Gunakan model yang kuat (GPT-4o) untuk menghasilkan trajektori bagi sasaran penyetelan (Llama 8B):

for task in task_list:
    traj = big_model_agent.run(task)
    if traj.success:
        save_for_training(traj)

# Now fine-tune Llama 8B on the GPT-4o traces.

Memangkas Trajektori Buruk

Satu contoh buruk dapat mencemari pelatihan. Lakukan penyaringan secara agresif:

  • Buang rekam jejak yang memiliki kesalahan
  • Buang rekam jejak yang memiliki halusinasi alat
  • Buang rekam jejak dengan lebih dari N pemanggilan alat
  • Buang rekam jejak yang bertentangan dengan kebijakan

Format untuk Penyetelan Halus

OpenAI mengharapkan JSONL dengan pesan:

{"messages": [{"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]}
{"messages": [...]}

Pemanggilan Alat dalam Data Pelatihan

Sertakan pemanggilan alat dan pesan alat—model mempelajari seluruh siklus agen:

{
  "messages": [
    {"role": "user", "content": "Weather in Paris?"},
    {"role": "assistant", "tool_calls": [{...}]},
    {"role": "tool", "tool_call_id": "...", "content": "{...}"},
    {"role": "assistant", "content": "It is 18C and sunny."}
  ]
}

Contoh Negatif

Beberapa metode pelatihan (DPO, KTO) juga memperoleh manfaat dari contoh BAD:

preferences = [
    {'prompt': '...', 'chosen': good_response, 'rejected': bad_response}
]

Kalkulator Ukuran Kumpulan Data

Perkiraan jumlah yang diperlukan berdasarkan metode pelatihan:

  • SFT untuk format: 500–2000
  • SFT untuk kemampuan baru: 5k–50k
  • DPO: 1k–10k pasangan preferensi
  • RLHF / RLAIF: 10k–100k+

Membuat Versi Kumpulan Data

Perlakukan kumpulan data Anda seperti kode. Buat versinya; lacak rekam jejak mana yang disertakan; pastikan proses pembuatannya dapat direproduksi.

Kurasi dengan Keterlibatan Manusia

Kumpulan data terbaik melewati antrean peninjauan manusia. Alat seperti Argilla, Label Studio, dan Snorkel membuat proses ini efisien.

Sumber Rekam Jejak Terbaik

Apakah sumber trajektori pelatihan dengan sinyal tertinggi?

Ringkasan

Trajektori dari eksekusi nyata yang berhasil adalah sumber yang sangat berharga. Lakukan distilasi dari model yang kuat bila diperlukan. Saring secara agresif. Buat versi kumpulan data Anda.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak” gratis?

Ya — teks lengkap “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak”?

Putar ulang jejak agen yang berhasil untuk membangun set pelatihan berupa pasangan (keadaan, tindakan). Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Saat Penyetelan Halus Lebih Unggul daripada Pemberian Perintah
  2. Pengumpulan Data: Trajektori dan Pemutaran Ulang Jejak
  3. LoRA dan QLoRA untuk Penyetelan Hemat Biaya
  4. Mengevaluasi Model yang Disetel vs Basis
← Kembali ke AI Agents