0Pricing
AI Agents · Pelajaran

Pengembangan Agen Berbasis Evaluasi

Tulis evaluasi sebelum merilis agen—satu-satunya cara untuk melakukan iterasi tanpa regresi.

Pengembangan Agen Berbasis Evaluasi adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 1 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

Evaluasi adalah Pengujian untuk AI

Anda tidak akan merilis kode tanpa pengujian. Logika yang sama berlaku untuk agen LLM — tanpa evaluasi, setiap perubahan hanyalah lemparan koin.

Pengembangan Berbasis Evaluasi (EDD) berarti menulis evaluasi BEFORE Anda merilis perubahan.

Siklus EDD

  1. Tulis evaluasi yang gagal: masukan + perilaku yang diharapkan
  2. Perbaiki agen hingga evaluasi tersebut berhasil
  3. Tambahkan evaluasi tersebut ke rangkaian evaluasi Anda
  4. Jalankan pada setiap perubahan

Hal yang Dievaluasi

Untuk sebuah agen, lakukan evaluasi pada beberapa tingkat:

  • Komponen — apakah pengambil kembali mengembalikan potongan yang tepat?
  • Langkah — apakah LLM memilih alat yang tepat?
  • Ujung ke ujung — apakah agen menghasilkan jawaban akhir yang tepat?

Data Evaluasi

Setiap baris evaluasi minimal berisi:

eval_example = {
    'input': 'What is our return policy?',
    'expected_output': 'mentions 30-day window',
    'expected_tool_calls': ['retrieve'],
    'metadata': {'tags': ['policy', 'common']}
}
for k, v in eval_example.items():
    print(f"{k}: {v}")

Run an Eval Suite

def run_evals(suite, agent):
    results = []
    for case in suite:
        actual = agent.run(case['input'])
        scores = [
            score_correctness(actual, case['expected_output']),
            score_tool_calls(actual.tool_calls, case['expected_tool_calls'])
        ]
        results.append({'case': case, 'actual': actual, 'scores': scores})
    return results

Integrasi Berkelanjutan

Jalankan evaluasi pada setiap PR. Jika kualitas turun di bawah ambang, blokir penggabungan:

# .github/workflows/evals.yml
on: pull_request
jobs:
  evals:
    runs-on: ubuntu-latest
    steps:
      - run: python -m evals.run --fail-below 0.85

Frekuensi Evaluasi

  • Evaluasi komponen — setiap PR
  • Evaluasi ujung ke ujung — setiap PR (dengan pengambilan sampel) + setiap malam (lengkap)
  • Jejak produksi -> rangkaian evaluasi — setiap minggu

Alur Produksi -> Evaluasi

Telusuri jejak nyata. Hasil yang buruk menjadi evaluasi untuk esok hari:

for trace in production_traces_with_thumbs_down():
    add_to_eval_suite(trace.input, expected=trace.fixed_output_from_human)

Evaluasi LangSmith / Langfuse

Kedua alat tersebut memiliki dukungan evaluasi bawaan: pembuatan versi dataset, fungsi evaluasi, dan tampilan perbandingan.

Pemeriksaan Sampel Manual

Evaluasi otomatis dapat melewatkan gaya dan nuansa. Bacalah 20 jejak acak secara manual secara berkala — cara ini menemukan masalah yang terlewat oleh evaluasi.

Antipola: Penghafalan Set Evaluasi

Jika Anda menyetel agen hingga lulus evaluasi, tetapi evaluasinya kecil, Anda telah menyesuaikannya secara berlebihan. Terus perluas evaluasi dan gilir pembagian pengujian/pelatihan.

Pemeliharaan Set Evaluasi

Evaluasi berubah seiring perubahan produk Anda. Tambahkan kasus untuk fitur baru; hentikan penggunaan kasus untuk fitur yang dihapus.

Definisi EDD

Apa arti Pengembangan Berbasis Evaluasi?

Ringkasan

Pengembangan Berbasis Evaluasi tidak dapat ditawar untuk agen yang serius. Tulis evaluasi pada setiap tingkat, jalankan dalam integrasi berkelanjutan, dan kembangkan rangkaian evaluasi Anda dari jejak produksi.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pengembangan Agen Berbasis Evaluasi” gratis?

Ya — teks lengkap “Pengembangan Agen Berbasis Evaluasi” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Pengembangan Agen Berbasis Evaluasi”?

Tulis evaluasi sebelum merilis agen—satu-satunya cara untuk melakukan iterasi tanpa regresi. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 1 dari 4.

Berapa lama pelajaran “Pengembangan Agen Berbasis Evaluasi” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Pengembangan Agen Berbasis Evaluasi
  2. Membangun Kumpulan Uji Emas
  3. Kendala LLM sebagai Juri
  4. Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench
← Kembali ke AI Agents