Perutean Model (Murah -> Mahal)
Coba model kecil terlebih dahulu, lalu beralih ke model terdepan hanya ketika model kecil gagal atau kurang yakin.
Perutean Model (Murah -> Mahal) adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Jangan Gunakan Model Besar untuk Tugas Mudah
Memanggil GPT-4o untuk menjawab "apakah email ini spam?" membuang biaya. Arahkan tugas mudah ke model murah dan tugas sulit ke model mahal.
Pola Perutean
- Coba model kecil atau murah terlebih dahulu
- Jika keluaran memiliki keyakinan rendah atau gagal dalam validasi, alihkan ke model besar
- Catat jalur yang diambil
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)Perutean Berbasis Validasi
Jika keluaran model murah gagal dalam validasi skema, alihkan ke model besar:
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)Pemilihan Model per Langkah
Bagian-bagian agen yang berbeda memerlukan model yang berbeda:
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
Perutean Lintas Penyedia
Gunakan Groq untuk latensi, OpenAI untuk kualitas, dan Anthropic untuk konteks panjang:
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')LLM sebagai Perute
Model kecil mengklasifikasikan permintaan dan memilih model berikutnya:
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)Rantai Cadangan
Jika model utama gagal (batas laju, galat), coba model sekunder:
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()Perutean Berbasis Penyematan
Sematkan query; jika mirip dengan kasus mudah yang sudah dikenal, gunakan model murah; jika tidak, gunakan model besar:
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()Contoh Hierarki Perutean
| Tingkat | Biaya | Penggunaan |
|---|---|---|
| Tingkat 1 | $ — Llama 8B | Klasifikasi, ekstraksi |
| Tingkat 2 | $$ — gpt-4o-mini | Langkah agen standar |
| Tingkat 3 | $$$ — gpt-4o / claude | Penalaran sulit, sintesis akhir |
Ukur Penghematan Bersih
Lacak:
- Persentase permintaan yang dilayani oleh setiap tingkat
- Kualitas (tingkat kelulusan evaluasi) per tingkat
- Total biaya per permintaan
Bandingkan dengan tolok ukur (selalu menggunakan model besar) untuk memastikan perutean memberikan manfaat.
Kalibrasikan Keyakinan
Keyakinan yang dilaporkan sendiri tidak dapat diandalkan. Kalibrasikan dengan kumpulan evaluasi; jika model menyatakan 90% tetapi hanya benar 60% dari waktu, sesuaikan ambang batas Anda.
Perute Sumber Terbuka
RouteLLM (LMSYS) adalah kerangka kerja OSS untuk perute model terlatih. Kerangka ini patut dipelajari jika perutean sangat penting bagi struktur biaya Anda.
Strategi Perutean
Apa strategi perutean yang paling sederhana dan efektif?
Rangkuman
Model bertingkat, mulai dari model murah lalu beralih jika perlu, perutean per langkah, dan rantai cadangan. Ukur komposisi tingkat serta kualitasnya. Perutean adalah pengungkit biaya produksi terbesar.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Perutean Model (Murah -> Mahal)” gratis?
Ya — teks lengkap “Perutean Model (Murah -> Mahal)” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Perutean Model (Murah -> Mahal)”?
Coba model kecil terlebih dahulu, lalu beralih ke model terdepan hanya ketika model kecil gagal atau kurang yakin. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.
Berapa lama pelajaran “Perutean Model (Murah -> Mahal)” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Anggaran Token per Langkah
- Perutean Model (Murah -> Mahal)
- Penyimpanan Tembolok Perintah dan Hasil (Anthropic, Vertex)
- Kuantisasi dan Dekode Spekulatif