0Pricing
AI Agents · Pelajaran

Perutean Model (Murah -> Mahal)

Coba model kecil terlebih dahulu, lalu beralih ke model terdepan hanya ketika model kecil gagal atau kurang yakin.

Perutean Model (Murah -> Mahal) adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 2 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

Jangan Gunakan Model Besar untuk Tugas Mudah

Memanggil GPT-4o untuk menjawab "apakah email ini spam?" membuang biaya. Arahkan tugas mudah ke model murah dan tugas sulit ke model mahal.

Pola Perutean

  1. Coba model kecil atau murah terlebih dahulu
  2. Jika keluaran memiliki keyakinan rendah atau gagal dalam validasi, alihkan ke model besar
  3. Catat jalur yang diambil

Confidence-Based Routing

cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
    return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)

Perutean Berbasis Validasi

Jika keluaran model murah gagal dalam validasi skema, alihkan ke model besar:

try:
    result = Schema.model_validate_json(cheap_response.content)
    return result
except ValidationError:
    return Schema.model_validate_json(call('gpt-4o', messages).content)

Pemilihan Model per Langkah

Bagian-bagian agen yang berbeda memerlukan model yang berbeda:

MODEL_BY_STEP = {
    'classify_intent': 'gpt-4o-mini',     # easy
    'plan': 'gpt-4o',                     # critical
    'extract': 'gpt-4o-mini',             # routine
    'write_response': 'claude-sonnet-4-5' # quality matters
}

# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
    print(f'{step:16s} -> {MODEL_BY_STEP[step]}')

Perutean Lintas Penyedia

Gunakan Groq untuk latensi, OpenAI untuk kualitas, dan Anthropic untuk konteks panjang:

if need_low_latency:
    return call_groq('llama-3.1-70b')
elif need_long_context:
    return call_anthropic('claude-sonnet-4-5')
else:
    return call_openai('gpt-4o-mini')

LLM sebagai Perute

Model kecil mengklasifikasikan permintaan dan memilih model berikutnya:

router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
    return call('gpt-4o-mini', user_msg)
else:
    return call('gpt-4o', user_msg)

Rantai Cadangan

Jika model utama gagal (batas laju, galat), coba model sekunder:

for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
    try:
        return call(model, messages)
    except RateLimitError:
        continue
raise AllModelsFailed()

Perutean Berbasis Penyematan

Sematkan query; jika mirip dengan kasus mudah yang sudah dikenal, gunakan model murah; jika tidak, gunakan model besar:

embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
    use_cheap_model()

Contoh Hierarki Perutean

TingkatBiayaPenggunaan
Tingkat 1$ — Llama 8BKlasifikasi, ekstraksi
Tingkat 2$$ — gpt-4o-miniLangkah agen standar
Tingkat 3$$$ — gpt-4o / claudePenalaran sulit, sintesis akhir

Ukur Penghematan Bersih

Lacak:

  • Persentase permintaan yang dilayani oleh setiap tingkat
  • Kualitas (tingkat kelulusan evaluasi) per tingkat
  • Total biaya per permintaan

Bandingkan dengan tolok ukur (selalu menggunakan model besar) untuk memastikan perutean memberikan manfaat.

Kalibrasikan Keyakinan

Keyakinan yang dilaporkan sendiri tidak dapat diandalkan. Kalibrasikan dengan kumpulan evaluasi; jika model menyatakan 90% tetapi hanya benar 60% dari waktu, sesuaikan ambang batas Anda.

Perute Sumber Terbuka

RouteLLM (LMSYS) adalah kerangka kerja OSS untuk perute model terlatih. Kerangka ini patut dipelajari jika perutean sangat penting bagi struktur biaya Anda.

Strategi Perutean

Apa strategi perutean yang paling sederhana dan efektif?

Rangkuman

Model bertingkat, mulai dari model murah lalu beralih jika perlu, perutean per langkah, dan rantai cadangan. Ukur komposisi tingkat serta kualitasnya. Perutean adalah pengungkit biaya produksi terbesar.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Perutean Model (Murah -> Mahal)” gratis?

Ya — teks lengkap “Perutean Model (Murah -> Mahal)” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Perutean Model (Murah -> Mahal)”?

Coba model kecil terlebih dahulu, lalu beralih ke model terdepan hanya ketika model kecil gagal atau kurang yakin. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 2 dari 4.

Berapa lama pelajaran “Perutean Model (Murah -> Mahal)” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Anggaran Token per Langkah
  2. Perutean Model (Murah -> Mahal)
  3. Penyimpanan Tembolok Perintah dan Hasil (Anthropic, Vertex)
  4. Kuantisasi dan Dekode Spekulatif
← Kembali ke AI Agents