0Pricing
AI Agents · Pelajaran

Kuantisasi dan Dekode Spekulatif

Untuk model yang di-host sendiri: kuantisasi int8/int4 untuk menghemat memori dan dekode spekulatif untuk meningkatkan throughput.

Kuantisasi dan Dekode Spekulatif adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.

Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.

Optimasi Model yang Di-hosting Sendiri

Untuk model terbuka yang di-hosting sendiri, ada dua peningkatan besar dalam kecepatan dan biaya:

  1. Kuantisasi — bobot lebih kecil, RAM/VRAM lebih sedikit, inferensi lebih cepat
  2. Dekode spekulatif — menghasilkan beberapa token dalam setiap langkah

Dasar-Dasar Kuantisasi

Model biasanya disimpan sebagai FP16 (16 bit per bobot). Kuantisasi mengurangi jumlah bit:

  • FP16 — dasar pembanding
  • INT8 — 2 kali lebih kecil, kehilangan kualitas hampir tidak berarti
  • INT4 / Q4_K_M — 4 kali lebih kecil, sedikit kehilangan kualitas
  • INT2 / 1,58 bit — lebih dari 8 kali lebih kecil, kehilangan kualitas yang nyata

GGUF dan Tingkat Kuantisasi

GGUF adalah format yang digunakan oleh llama.cpp. Tingkat yang umum:

  • Q4_K_M — keseimbangan terbaik (kualitas dibandingkan ukuran)
  • Q5_K_M — sedikit lebih besar, sedikit lebih baik
  • Q8_0 — kualitas hampir setara FP16, kompresi 2 kali lipat

Quantise With llama.cpp

./llama-quantize models/llama-3-8b-f16.gguf models/llama-3-8b-q4_k_m.gguf Q4_K_M

# Or download pre-quantised from TheBloke / unsloth on HuggingFace

Dampak Perangkat Keras

Model FP16 8B memerlukan sekitar 16 GB VRAM. Model yang sama dalam Q4 cukup dengan sekitar 5 GB VRAM dan dapat berjalan pada GPU yang jauh lebih murah.

Dekode Spekulatif

Caranya: gunakan model kecil "draf" untuk mengusulkan token, lalu verifikasi dengan model besar "sasaran" dalam satu lintasan maju. Sering kali kecepatannya meningkat 2–3 kali lipat.

from transformers import AutoModelForCausalLM

target = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-70B')
draft = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-8B')

outputs = target.generate(
    input_ids,
    assistant_model=draft,    # speculative decoding
    max_new_tokens=200
)

Mengapa Ini Berhasil

Draf mengusulkan K token. Model sasaran memproses semuanya secara PARALLEL (satu lintasan maju). Setiap token yang diterima bersifat "gratis". Penolakan mengembalikan proses ke keadaan sebelumnya; biasanya sebagian besar token diterima.

Percepatan Dekode Lainnya

  • Dekode lihat-ke-depan — beberapa draf dalam setiap langkah
  • Medusa — beberapa kepala dekode yang dilatih bersama
  • EAGLE — spekulasi berbasis pohon yang cepat

Alat yang Menerapkan Teknik Ini

  • vLLM — memiliki kuantisasi (AWQ, GPTQ, FP8) dan dekode spekulatif
  • llama.cpp — kuantisasi dan spekulasi melalui --draft-model
  • TensorRT-LLM — server produksi NVIDIA
  • SGLang — server cepat yang ramah pemrosesan berkelompok dengan pengelompokan berkelanjutan

Pengelompokan Berkelanjutan

Fitur unggulan vLLM: memproses beberapa permintaan dengan panjang berbeda dalam lintasan maju yang sama. Ini memberikan peningkatan laju pemrosesan yang sangat besar untuk server produksi.

Memilih Tingkat Kuantisasi

Uji setiap tingkat kandidat pada evaluasi YOUR. Q4_K_M adalah titik awal bawaan; pilih tingkat yang lebih tinggi jika kualitas turun di bawah ambang batas.

Latensi per Token dibandingkan Laju Pemrosesan

Optimasi yang berbeda membantu metrik yang berbeda:

  • Latensi satu permintaan: dekode spekulatif
  • Laju pemrosesan banyak pengguna: pengelompokan berkelanjutan
  • Biaya memori: kuantisasi

Dampak Kuantisasi

Apa dampak utama kuantisasi int4?

Rangkuman

Lakukan kuantisasi ke Q4 untuk menghemat memori dan meningkatkan kecepatan. Gunakan dekode spekulatif untuk latensi. Gunakan pengelompokan berkelanjutan untuk laju pemrosesan. vLLM dan llama.cpp menerapkan ketiganya.

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Kuantisasi dan Dekode Spekulatif” gratis?

Ya — teks lengkap “Kuantisasi dan Dekode Spekulatif” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.

Apa yang akan aku pelajari di “Kuantisasi dan Dekode Spekulatif”?

Untuk model yang di-host sendiri: kuantisasi int8/int4 untuk menghemat memori dan dekode spekulatif untuk meningkatkan throughput. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai AI Agents?

Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.

Berapa lama pelajaran “Kuantisasi dan Dekode Spekulatif” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?

Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Anggaran Token per Langkah
  2. Perutean Model (Murah -> Mahal)
  3. Penyimpanan Tembolok Perintah dan Hasil (Anthropic, Vertex)
  4. Kuantisasi dan Dekode Spekulatif
← Kembali ke AI Agents