Ejen AI · Pelajaran

Pengkuantuman dan Penyahkodan Spekulatif

Untuk model yang dihoskan sendiri: kuantuman int8/int4 bagi menjimatkan memori, dan penyahkodan spekulatif bagi meningkatkan kadar pemprosesan.

Pelajaran 4 daripada 414 langkah

Pengkuantuman dan Penyahkodan Spekulatif ialah pelajaran Ejen AI percuma di CoddyKit. Ini ialah pelajaran 4 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Ejen AI, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Ejen AI merangkumi sejumlah 4 pelajaran.

Sebahagian daripada pelajaran ini belum diterjemahkan dan dipaparkan dalam bahasa Inggeris.

Pengoptimuman Model Dihos Sendiri

Untuk model sumber terbuka yang dihos sendiri, terdapat dua peningkatan besar dari segi kelajuan dan kos:

  1. Kuantisasi — pemberat lebih kecil, kurang RAM/VRAM dan inferens lebih pantas
  2. Penyahkodan spekulatif — menjana berbilang token bagi setiap langkah

Asas Kuantisasi

Model biasanya disimpan sebagai FP16 (16 bit bagi setiap pemberat). Kuantisasi mengurangkannya kepada bilangan bit yang lebih sedikit:

  • FP16 — garis dasar
  • INT8 — 2 kali lebih kecil, kehilangan kualiti yang hampir tidak ketara
  • INT4 / Q4_K_M — 4 kali lebih kecil, kehilangan kualiti yang kecil
  • INT2 / 1.58-bit — 8 kali atau lebih kecil, kehilangan kualiti yang nyata

GGUF dan Tahap Kuantisasi

GGUF ialah format yang digunakan oleh llama.cpp. Tahap yang biasa:

  • Q4_K_M — keseimbangan terbaik (kualiti berbanding saiz)
  • Q5_K_M — sedikit lebih besar, sedikit lebih baik
  • Q8_0 — kualiti hampir setara FP16, pemampatan 2 kali ganda

Quantise With llama.cpp

./llama-quantize models/llama-3-8b-f16.gguf models/llama-3-8b-q4_k_m.gguf Q4_K_M

# Or download pre-quantised from TheBloke / unsloth on HuggingFace

Kesan Perkakasan

Model 8B FP16 memerlukan kira-kira 16GB VRAM. Model yang sama dalam Q4 muat dalam kira-kira 5GB VRAM — dan boleh dijalankan pada GPU yang jauh lebih murah.

Penyahkodan Spekulatif

Caranya: gunakan model "draf" kecil untuk mencadangkan token, kemudian sahkan dengan model "sasaran" besar dalam satu laluan hadapan. Biasanya memberikan peningkatan kelajuan 2-3 kali ganda.

from transformers import AutoModelForCausalLM

target = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-70B')
draft = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-8B')

outputs = target.generate(
    input_ids,
    assistant_model=draft,    # speculative decoding
    max_new_tokens=200
)

Mengapa Ia Berfungsi

Draf mencadangkan K token. Sasaran memproses kesemuanya secara PARALLEL (satu laluan hadapan). Setiap token yang diterima adalah "percuma". Penolakan akan mengembalikan proses ke keadaan sebelumnya; biasanya sebahagian besar token diterima.

Peningkatan Kelajuan Penyahkodan Lain

  • Penyahkodan pandang hadapan — berbilang draf bagi setiap langkah
  • Medusa — berbilang kepala penyahkodan yang dilatih bersama
  • EAGLE — spekulasi berasaskan pepohon yang pantas

Alat yang Melaksanakan Teknik Ini

  • vLLM — mempunyai kuantisasi (AWQ, GPTQ, FP8) dan penyahkodan spekulatif
  • llama.cpp — kuantisasi dan spekulasi melalui --draft-model
  • TensorRT-LLM — pelayan pengeluaran NVIDIA
  • SGLang — pelayan pantas yang sesuai untuk kelompok, dengan pengelompokan berterusan

Pengelompokan Berterusan

Ciri utama vLLM: memproses berbilang permintaan dengan panjang yang berbeza dalam laluan hadapan yang sama. Ini memberikan peningkatan besar pada kadar daya pemprosesan untuk pelayan pengeluaran.

Memilih Tahap Kuantisasi

Uji setiap tahap calon pada penilaian YOUR. Q4_K_M ialah titik permulaan lalai; pilih tahap lebih tinggi jika kualiti jatuh di bawah ambang.

Kependaman Setiap Token berbanding Kadar Daya Pemprosesan

Pengoptimuman yang berbeza membantu metrik yang berbeza:

  • Kependaman satu permintaan: penyahkodan spekulatif
  • Kadar daya pemprosesan berbilang pengguna: pengelompokan berterusan
  • Kos memori: kuantisasi

Kesan Kuantisasi

Apakah kesan utama kuantisasi int4?

Imbas Kembali

Kuantisasikan kepada Q4 untuk memori + kelajuan. Gunakan penyahkodan spekulatif untuk kependaman. Gunakan pengelompokan berterusan untuk kadar daya pemprosesan. vLLM dan llama.cpp melaksanakan ketiga-tiganya.

Percuma untuk bermula

Pelajari Ejen AI dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
60
Pelajaran
239

Soalan Lazim

Adakah pelajaran “Pengkuantuman dan Penyahkodan Spekulatif” percuma?

Ya — teks penuh “Pengkuantuman dan Penyahkodan Spekulatif” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Ejen AI, tingkat taraf kepada CoddyKit PRO. Kursus Ejen AI merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Pengkuantuman dan Penyahkodan Spekulatif”?

Untuk model yang dihoskan sendiri: kuantuman int8/int4 bagi menjimatkan memori, dan penyahkodan spekulatif bagi meningkatkan kadar pemprosesan. Anda berlatih Ejen AI menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Ejen AI?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Ejen AI di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 4 daripada 4.

Berapa lamakah pelajaran “Pengkuantuman dan Penyahkodan Spekulatif” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Ejen AI ini?

Ya. Setiap pelajaran Ejen AI menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Belanjawan Token bagi Setiap Langkah
  2. Penghalaan Model (Murah -> Mahal)
  3. Penyimpanan Prompt dan Hasil dalam Cache (Anthropic, Vertex)
  4. Pengkuantuman dan Penyahkodan Spekulatif
← Kembali ke Ejen AI