Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench
Tolok ukur publik untuk agen pemrograman (SWE-Bench), asisten umum (GAIA), dan penggunaan alat (ToolBench).
Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Tolok Ukur Publik
Untuk membandingkan model dan kerangka kerja antar tim, tolok ukur publik sangat penting. Tolok ukur ini mencakup kemampuan agen yang umum:
- SWE-Bench — tugas rekayasa perangkat lunak
- GAIA — tugas asisten umum
- ToolBench / BFCL — penggunaan alat
- WebArena — navigasi peramban
SWE-Bench
SWE-Bench menguji apakah agen dapat menyelesaikan masalah nyata di GitHub:
- 2294 masalah nyata dari repositori Python populer
- Agen harus menghasilkan patch yang lulus semua pengujian tersembunyi
- Agen tingkat terdepan saat ini menyelesaikan 50-70% (sebelumnya <5% pada 2023)
SWE-Bench Terverifikasi
OpenAI merilis subset berisi 500 masalah dengan pemeriksaan kualitas yang lebih ketat (SWE-Bench Verified). Ini adalah standar industri.
GAIA
Tolok ukur Asisten AI Umum (Meta + HF, 2023):
- 466 pertanyaan dalam tiga tingkat kesulitan
- Memerlukan penelusuran web, eksekusi kode, dan penalaran multimodal
- Dirancang agar manusia memerlukan waktu sekitar 30 detik; agen teratas mencapai sekitar 60%
Contoh Pertanyaan GAIA
"Berapa banyak album studio Mercedes Sosa yang diterbitkan antara 1972 dan 1985? Gunakan daftar dari halaman Wikipedia bahasa Inggris miliknya."
Memerlukan penelusuran web, pembacaan tabel, dan penghitungan — hal yang umum dalam tugas agen multilangkah.
Papan Peringkat Pemanggilan Fungsi Berkeley (BFCL)
Standar untuk evaluasi pemanggilan alat:
- Ribuan rangkap (kueri, definisi alat, panggilan yang diharapkan)
- Mencakup skenario sederhana/paralel/alat yang terlewat
- Diperbarui setiap kuartal
ToolBench
Lebih besar tetapi lebih berantakan: lebih dari 16 ribu API dari RapidAPI, dengan rangkaian alat multilangkah. Kurang kanonik daripada BFCL, tetapi cakupannya lebih luas.
WebArena
Tolok ukur sumber terbuka untuk agen penelusuran web. Menyediakan 4 situs web mandiri (perdagangan elektronik, forum, portal pengembang, GitLab); agen harus menyelesaikan tugas yang realistis.
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4Keterbatasan Tolok Ukur
- Tolok ukur publik bocor ke data pelatihan (risiko pengakalan)
- Satu domain — tugas Anda mungkin lebih sulit atau lebih mudah
- "Menyelesaikan X%" menyamarkan X% yang mana — bagian ekor panjang penting
Tolok Ukur Anda Sendiri Lebih Penting
Tolok ukur publik berguna untuk membandingkan pendekatan. Namun, set acuan Anda sendiri berdasarkan data YOUR adalah satu-satunya angka yang penting bagi produk YOUR.
Menggabungkan Evaluasi Internal + Publik
Praktik tim yang sehat:
- Jalankan tolok ukur publik setiap kuartal untuk melacak kemampuan tingkat terdepan
- Jalankan evaluasi internal pada setiap PR
- Percayai angka internal untuk mengambil keputusan; gunakan angka publik untuk memahami perkembangan bidang ini
Membaca Hasil Tolok Ukur
Saat sebuah makalah menyatakan "75% pada SWE-Bench":
- Periksa SWE-Bench yang mana (WHICH) (Lite, Verified, atau penuh)
- Periksa apakah beberapa percobaan diperbolehkan
- Periksa apakah mereka menggunakan alat atau petunjuk tersembunyi
Angka utama mudah disalahpahami.
Evaluasi Internal vs Publik
Mana yang lebih penting bagi produk Anda?
Ringkasan
SWE-Bench untuk agen kode, GAIA untuk asisten umum, BFCL untuk penggunaan alat, dan WebArena untuk peramban. Gunakan semuanya untuk memahami perkembangan bidang ini; percayai evaluasi Anda sendiri untuk mengambil keputusan.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench” gratis?
Ya — teks lengkap “Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench”?
Tolok ukur publik untuk agen pemrograman (SWE-Bench), asisten umum (GAIA), dan penggunaan alat (ToolBench). Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Pengembangan Agen Berbasis Evaluasi
- Membangun Kumpulan Uji Emas
- Kendala LLM sebagai Juri
- Rangkaian Tolok Ukur: SWE-Bench, GAIA, ToolBench