0Pricing
AI Agents · Ders

Nicemleme ve Varsayımsal Kod Çözme

Kendi barındırdığınız modeller için: bellek tasarrufu amacıyla int8/int4 nicemleme, aktarım hızını artırmak için varsayımsal kod çözme.

Nicemleme ve Varsayımsal Kod Çözme, CoddyKit'te ücretsiz bir AI Agents dersidir. Bu, 4 dersinin 4. dersidir. Aşağıdan dersin tamamını ücretsiz okuyabilir, sonra tarayıcıda yerleşik kod editörü ve 7/24 yapay zeka koçu ile uygulamalı olarak pratik yapabilirsin. Bu, AI Agents öğrenme yolunun bir parçasıdır ve ilerlemeniz web ve CoddyKit uygulaması arasında senkronize olur. AI Agents kursu toplamda 4 dersten oluşur.

Bu dersin bazı bölümleri henüz çevrilmemiş olup İngilizce olarak gösterilmektedir.

Kendi Sunucunuzda Barındırılan Model Optimizasyonları

Kendi sunucunuzda barındırdığınız açık modeller için iki büyük hız ve maliyet kazanımı vardır:

  1. Nicemleme — daha küçük ağırlıklar, daha az RAM/VRAM ve daha hızlı çıkarım
  2. Tahmine dayalı çözümleme — her adımda birden fazla belirteç üretme

Nicemlemenin Temelleri

Modeller normalde FP16 olarak (ağırlık başına 16 bit) depolanır. Nicemleme, bit sayısını azaltır:

  • FP16 — temel düzey
  • INT8 — 2 kat daha küçük, kalite kaybı yaklaşık olarak önemsiz
  • INT4 / Q4_K_M — 4 kat daha küçük, az miktarda kalite kaybı
  • INT2 / 1.58-bit — 8 kat veya daha fazla küçük, belirgin kalite kaybı

GGUF ve Nicemleme Düzeyleri

GGUF, llama.cpp tarafından kullanılan biçimdir. Yaygın düzeyler:

  • Q4_K_M — en iyi denge (kalite ve boyut)
  • Q5_K_M — biraz daha büyük, biraz daha iyi
  • Q8_0 — FP16 kalitesine yakın, 2 kat sıkıştırma

Quantise With llama.cpp

./llama-quantize models/llama-3-8b-f16.gguf models/llama-3-8b-q4_k_m.gguf Q4_K_M

# Or download pre-quantised from TheBloke / unsloth on HuggingFace

Donanım Etkisi

8B boyutunda bir FP16 modeli yaklaşık 16 GB VRAM gerektirir. Aynı model Q4 biçiminde yaklaşık 5 GB VRAM'e sığar ve çok daha ucuz bir GPU üzerinde çalışır.

Tahmine Dayalı Çözümleme

Yöntem şöyledir: belirteçler önermek için küçük bir "taslak" modeli kullanın, ardından büyük "hedef" modelle tek bir ileri geçişte doğrulayın. Çoğu zaman 2-3 kat hızlanma sağlar.

from transformers import AutoModelForCausalLM

target = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-70B')
draft = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-8B')

outputs = target.generate(
    input_ids,
    assistant_model=draft,    # speculative decoding
    max_new_tokens=200
)

Neden İşe Yarıyor

Taslak model K belirteç önerir. Hedef model bunların tümünü PARALLEL olarak (tek bir ileri geçişte) işler. Kabul edilen her belirteç "bedava"dır. Ret durumunda işlem geri alınır; genellikle çoğunu kabul edersiniz.

Diğer Çözümleme Hızlandırmaları

  • İleriye bakmalı çözümleme — adım başına birden fazla taslak
  • Medusa — birlikte eğitilmiş birden fazla çözümleme başlığı
  • EAGLE — hızlı, ağaç tabanlı tahmin

Bunları Uygulayan Araçlar

  • vLLM — hem nicemleme (AWQ, GPTQ, FP8) hem de tahmine dayalı çözümleme sunar
  • llama.cpp — nicemleme ve --draft-model aracılığıyla tahmine dayalı çözümleme
  • TensorRT-LLM — NVIDIA'nın üretim sunucusu
  • SGLang — sürekli toplu işlemeye sahip, hızlı ve toplu işlemeye uygun sunucu

Sürekli Toplu İşleme

vLLM'nin öne çıkan özelliği: farklı uzunluklardaki birden fazla isteği aynı ileri geçişte işlemek. Üretim sunucuları için işleme hacminde büyük bir kazanım sağlar.

Nicemleme Düzeyi Seçme

Her aday düzeyi YOUR değerlendirme kümeniz üzerinde sınayın. Q4_K_M varsayılan başlangıç noktasıdır; kalite eşik değerinin altına düşerse daha yüksek bir düzeye geçin.

Belirteç Başına Gecikme ile İşleme Hacmi

Farklı optimizasyonlar farklı ölçütlere yardımcı olur:

  • Tek istek gecikmesi: tahmine dayalı çözümleme
  • Birden çok kullanıcı için işleme hacmi: sürekli toplu işleme
  • Bellek maliyeti: nicemleme

Nicemlemenin Etkisi

int4 nicemlemesinin birincil etkisi nedir?

Özet

Bellek ve hız kazanımı için Q4'e nicemleyin. Gecikme için tahmine dayalı çözümleme kullanın. İşleme hacmi için sürekli toplu işlemeyi kullanın. vLLM ve llama.cpp bu üç yöntemi de uygular.

Sıkça Sorulan Sorular

“Nicemleme ve Varsayımsal Kod Çözme” dersi ücretsiz mi?

Evet — “Nicemleme ve Varsayımsal Kod Çözme” dersin tüm metni burada web'de ücretsiz olarak okunabilir. Etkileşimli olarak pratik yapmak (yerleşik kod editörü ve 7/24 yapay zeka koçu) ve AI Agents kursunun geri kalanını açmak için CoddyKit PRO'ya yükselt. AI Agents kursu toplamda 4 dersten oluşur.

“Nicemleme ve Varsayımsal Kod Çözme” dersinde ne öğreneceğim?

Kendi barındırdığınız modeller için: bellek tasarrufu amacıyla int8/int4 nicemleme, aktarım hızını artırmak için varsayımsal kod çözme. AI Agents ile uygulamalı kodu tarayıcıda doğrudan çalıştırarak pratik yaparsın ve 7/24 yapay zeka koçu dersi çalışırken sorularını yanıtlar.

AI Agents öğrenmeye başlamak için deneyim gerekli mi?

Önceden deneyim gerekmez. CoddyKit'te AI Agents, başlangıçtan ileri seviyeye kadar yapılandırıldığı için buradan başlayabilir veya başından başlayıp kendi hızında ilerleme yapabilirsin. Bu, 4 dersinin 4. dersidir.

“Nicemleme ve Varsayımsal Kod Çözme” dersi ne kadar sürer?

Çoğu CoddyKit dersi yaklaşık 5–10 dakika sürer. Her biri kısa ve etkileşimli olduğu için sabit ilerleme yaparsın ve web ile uygulama arasında tam olarak bıraktığın yerden devam edebilirsin.

Bu AI Agents dersinde kod yazıp çalıştırabilir miyim?

Evet. Her AI Agents dersi yerleşik bir kod editörü içerir, bu sayede tarayıcıda gerçek kod yazıp çalıştırabilir ve anlık yapay zeka geri bildirimi alırsın — yerel kurulum gerekli değildir.

Bu kursun tüm dersleri

  1. Adım Başına Belirteç Bütçeleri
  2. Model Yönlendirme (Ucuz → Pahalı)
  3. İstemleri ve Sonuçları Önbelleğe Alma (Anthropic, Vertex)
  4. Nicemleme ve Varsayımsal Kod Çözme
← AI Agents Sayfasına Dön