Pertukaran: Latensi, Biaya, Kemampuan
Bobot terbuka menghemat biaya, tetapi memerlukan jam kerja teknisi; lakukan tolok ukur sebelum berkomitmen.
Pertukaran: Latensi, Biaya, Kemampuan adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Tiga Sumbu, Pilih Dua
Setiap pilihan model melibatkan pertukaran antara:
- Latensi—waktu per respons
- Biaya—per juta token
- Kemampuan—kualitas pada tugas sulit
Tidak ada model yang terbaik dalam ketiganya.
Lanskap Kemampuan
| Tingkat atas | Tingkat menengah | Tingkat kecil | |
|---|---|---|---|
| Tertutup | GPT-4o, Claude Sonnet 4.5 | GPT-4o-mini, Haiku | — |
| Terbuka | Llama 3.1 405B | Llama 3.1 70B, Qwen 2.5 72B | Llama 3.1 8B, Phi-3 |
Lanskap Latensi
Perkiraan latensi p50 untuk satu giliran agen pada umumnya:
- Groq Llama 3.1 70B: ~200ms (sangat cepat)
- gpt-4o-mini: ~600ms
- gpt-4o: ~1500ms
- Llama 70B yang dijalankan sendiri pada 1xH100: ~800ms
- Llama 8B yang dijalankan sendiri pada RTX 4090: ~200ms
Perkiraan Biaya per Juta Token
Perkiraan kasar pertengahan 2025, masukan/keluaran:
- GPT-4o: $2.50 / $10
- GPT-4o-mini: $0.15 / $0.60
- Claude Sonnet 4.5: $3 / $15
- Claude Haiku: $0.80 / $4
- Together Llama 70B: $0.88 / $0.88
- Groq Llama 70B: $0.59 / $0.79
- Dihosting sendiri (GPU Anda): pada dasarnya gratis per token
Hitung Titik Peralihan Anda
Dihosting sendiri hanya menghemat biaya jika volume melampaui ambang tertentu. Perkiraan kasarnya:
GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")
Perutean Model
Gunakan model murah secara default, lalu beralih ke model mahal hanya jika diperlukan:
def answer(query):
cheap = call_model('gpt-4o-mini', query)
if confidence(cheap) > 0.8:
return cheap
return call_model('gpt-4o', query)Perutean per Langkah
Di dalam agen, lakukan perutean pada setiap langkah:
- Susun rencana dengan GPT-4o (penalaran sulit)
- Lakukan pencarian dengan Llama 8B (perulangan murah)
- Lakukan sintesis dengan Claude (kualitas penulisan)
Jalur Sensitif terhadap Latensi
Untuk suara atau obrolan waktu nyata:
- Gunakan Groq, SambaNova, atau Cerebras untuk waktu di bawah 200 md
- Alirkan token secara agresif
- Hindari agen multilangkah pada jalur kritis
Jalur Sensitif terhadap Kualitas
Untuk jawaban akhir dan pekerjaan berisiko tinggi:
- Gunakan model terbaik yang mampu Anda biayai
- Tambahkan kritik lintas model (GPT-4 menulis, Claude meninjau)
- Tambahkan verifikasi (jalankan kode, periksa fakta)
Total Biaya Kepemilikan
Biaya hosting sendiri mencakup:
- Penyewaan GPU atau belanja modal
- Waktu insinyur untuk mengelola infrastruktur
- Pemantauan dan petugas siaga
- Hasil pemrosesan yang lebih rendah daripada layanan yang dihosting
Bagi sebagian besar tim, API yang dihosting memiliki total biaya kepemilikan yang lebih rendah hingga volumenya sangat tinggi.
Kapan Membayar Model Tertutup Besar
- Jawaban akhir yang ditujukan kepada pengguna
- Penalaran tingkat terdepan
- Multimodal
- Konteks 200 ribu atau lebih
Uji Tolok Ukur pada Tugas Anda
Tolok ukur publik hanya menceritakan sebagian dari keseluruhan. Buat rangkaian evaluasi berisi 50 pertanyaan berdasarkan data Anda yang sebenarnya, lalu ukur setiap kandidat model dengan rangkaian tersebut. Pilih model termurah yang memenuhi standar kualitas.
Strategi Perutean
Apa strategi perutean model termurah yang tetap memenuhi standar kualitas?
Ringkasan
Latensi, biaya, kemampuan — pilih dua. Gunakan model murah secara default, lalu beralih jika diperlukan. API model terbuka yang dihosting (Groq, Together) sering kali mengungguli kedua pilihan ekstrem.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Pertukaran: Latensi, Biaya, Kemampuan” gratis?
Ya — teks lengkap “Pertukaran: Latensi, Biaya, Kemampuan” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Pertukaran: Latensi, Biaya, Kemampuan”?
Bobot terbuka menghemat biaya, tetapi memerlukan jam kerja teknisi; lakukan tolok ukur sebelum berkomitmen. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Pertukaran: Latensi, Biaya, Kemampuan” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Ikhtisar Llama, Mistral, dan Qwen
- Menjalankan Model Lokal dengan Ollama dan llama.cpp
- Model Terbuka dengan Pemanggilan Fungsi (Hermes, Functionary)
- Pertukaran: Latensi, Biaya, Kemampuan