Kuantisasi dan Dekode Spekulatif
Untuk model yang di-host sendiri: kuantisasi int8/int4 untuk menghemat memori dan dekode spekulatif untuk meningkatkan throughput.
Kuantisasi dan Dekode Spekulatif adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 4 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Bagian dari pelajaran ini belum diterjemahkan dan ditampilkan dalam bahasa Inggris.
Optimasi Model yang Di-hosting Sendiri
Untuk model terbuka yang di-hosting sendiri, ada dua peningkatan besar dalam kecepatan dan biaya:
- Kuantisasi — bobot lebih kecil, RAM/VRAM lebih sedikit, inferensi lebih cepat
- Dekode spekulatif — menghasilkan beberapa token dalam setiap langkah
Dasar-Dasar Kuantisasi
Model biasanya disimpan sebagai FP16 (16 bit per bobot). Kuantisasi mengurangi jumlah bit:
- FP16 — dasar pembanding
- INT8 — 2 kali lebih kecil, kehilangan kualitas hampir tidak berarti
- INT4 / Q4_K_M — 4 kali lebih kecil, sedikit kehilangan kualitas
- INT2 / 1,58 bit — lebih dari 8 kali lebih kecil, kehilangan kualitas yang nyata
GGUF dan Tingkat Kuantisasi
GGUF adalah format yang digunakan oleh llama.cpp. Tingkat yang umum:
- Q4_K_M — keseimbangan terbaik (kualitas dibandingkan ukuran)
- Q5_K_M — sedikit lebih besar, sedikit lebih baik
- Q8_0 — kualitas hampir setara FP16, kompresi 2 kali lipat
Quantise With llama.cpp
./llama-quantize models/llama-3-8b-f16.gguf models/llama-3-8b-q4_k_m.gguf Q4_K_M
# Or download pre-quantised from TheBloke / unsloth on HuggingFaceDampak Perangkat Keras
Model FP16 8B memerlukan sekitar 16 GB VRAM. Model yang sama dalam Q4 cukup dengan sekitar 5 GB VRAM dan dapat berjalan pada GPU yang jauh lebih murah.
Dekode Spekulatif
Caranya: gunakan model kecil "draf" untuk mengusulkan token, lalu verifikasi dengan model besar "sasaran" dalam satu lintasan maju. Sering kali kecepatannya meningkat 2–3 kali lipat.
from transformers import AutoModelForCausalLM
target = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-70B')
draft = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-8B')
outputs = target.generate(
input_ids,
assistant_model=draft, # speculative decoding
max_new_tokens=200
)Mengapa Ini Berhasil
Draf mengusulkan K token. Model sasaran memproses semuanya secara PARALLEL (satu lintasan maju). Setiap token yang diterima bersifat "gratis". Penolakan mengembalikan proses ke keadaan sebelumnya; biasanya sebagian besar token diterima.
Percepatan Dekode Lainnya
- Dekode lihat-ke-depan — beberapa draf dalam setiap langkah
- Medusa — beberapa kepala dekode yang dilatih bersama
- EAGLE — spekulasi berbasis pohon yang cepat
Alat yang Menerapkan Teknik Ini
- vLLM — memiliki kuantisasi (AWQ, GPTQ, FP8) dan dekode spekulatif
- llama.cpp — kuantisasi dan spekulasi melalui --draft-model
- TensorRT-LLM — server produksi NVIDIA
- SGLang — server cepat yang ramah pemrosesan berkelompok dengan pengelompokan berkelanjutan
Pengelompokan Berkelanjutan
Fitur unggulan vLLM: memproses beberapa permintaan dengan panjang berbeda dalam lintasan maju yang sama. Ini memberikan peningkatan laju pemrosesan yang sangat besar untuk server produksi.
Memilih Tingkat Kuantisasi
Uji setiap tingkat kandidat pada evaluasi YOUR. Q4_K_M adalah titik awal bawaan; pilih tingkat yang lebih tinggi jika kualitas turun di bawah ambang batas.
Latensi per Token dibandingkan Laju Pemrosesan
Optimasi yang berbeda membantu metrik yang berbeda:
- Latensi satu permintaan: dekode spekulatif
- Laju pemrosesan banyak pengguna: pengelompokan berkelanjutan
- Biaya memori: kuantisasi
Dampak Kuantisasi
Apa dampak utama kuantisasi int4?
Rangkuman
Lakukan kuantisasi ke Q4 untuk menghemat memori dan meningkatkan kecepatan. Gunakan dekode spekulatif untuk latensi. Gunakan pengelompokan berkelanjutan untuk laju pemrosesan. vLLM dan llama.cpp menerapkan ketiganya.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Kuantisasi dan Dekode Spekulatif” gratis?
Ya — teks lengkap “Kuantisasi dan Dekode Spekulatif” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Kuantisasi dan Dekode Spekulatif”?
Untuk model yang di-host sendiri: kuantisasi int8/int4 untuk menghemat memori dan dekode spekulatif untuk meningkatkan throughput. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 4 dari 4.
Berapa lama pelajaran “Kuantisasi dan Dekode Spekulatif” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Anggaran Token per Langkah
- Perutean Model (Murah -> Mahal)
- Penyimpanan Tembolok Perintah dan Hasil (Anthropic, Vertex)
- Kuantisasi dan Dekode Spekulatif