AI Agents · Lektion

Quantisierung und spekulatives Decoding

Für selbst gehostete Modelle: int8/int4-Quantisierung spart Speicher, spekulatives Decoding erhöht den Durchsatz.

Lektion 4 von 414 Schritte

Quantisierung und spekulatives Decoding ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Optimierungen für selbst gehostete Modelle

Bei selbst gehosteten offenen Modellen gibt es zwei große Geschwindigkeits- und Kostenvorteile:

  1. Quantisierung — kleinere Gewichte, weniger RAM/VRAM und schnellere Inferenz
  2. Speculative Decoding — mehrere Tokens pro Schritt generieren

Grundlagen der Quantisierung

Modelle werden normalerweise als FP16 mit 16 Bit pro Gewicht gespeichert. Durch Quantisierung wird die Anzahl der Bits reduziert:

  • FP16 — Baseline
  • INT8 — doppelt so klein, etwa kein Qualitätsverlust
  • INT4 / Q4_K_M — viermal so klein, geringer Qualitätsverlust
  • INT2 / 1.58-bit — mehr als achtmal so klein, deutlicher Qualitätsverlust

GGUF und Quantisierungsstufen

GGUF ist das von llama.cpp verwendete Format. Häufige Stufen:

  • Q4_K_M — bestes Verhältnis von Qualität zu Größe
  • Q5_K_M — etwas größer, etwas besser
  • Q8_0 — nahezu FP16-Qualität, zweifache Komprimierung

Quantise With llama.cpp

./llama-quantize models/llama-3-8b-f16.gguf models/llama-3-8b-q4_k_m.gguf Q4_K_M

# Or download pre-quantised from TheBloke / unsloth on HuggingFace

Auswirkungen auf die Hardware

Ein 8B-FP16-Modell benötigt etwa 16 GB VRAM. Dasselbe Modell passt in Q4 mit etwa 5 GB VRAM und läuft damit auf einer deutlich günstigeren GPU.

Speculative Decoding

Der Trick: Ein kleines „Draft“-Modell schlägt Tokens vor, die anschließend in einem einzigen Vorwärtsdurchlauf vom großen „Target“-Modell überprüft werden. Das beschleunigt die Ausführung häufig um das Zwei- bis Dreifache.

from transformers import AutoModelForCausalLM

target = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-70B')
draft = AutoModelForCausalLM.from_pretrained('meta-llama/Llama-3.1-8B')

outputs = target.generate(
    input_ids,
    assistant_model=draft,    # speculative decoding
    max_new_tokens=200
)

Warum es funktioniert

Das Draft-Modell schlägt K Tokens vor. Das Target-Modell verarbeitet sie alle PARALLEL in einem einzigen Vorwärtsdurchlauf. Jeder akzeptierte Token ist „kostenlos“. Bei einer Ablehnung wird zurückgerollt; normalerweise werden die meisten Tokens akzeptiert.

Weitere Beschleunigungen beim Decoding

  • Lookahead Decoding — mehrere Entwürfe pro Schritt
  • Medusa — mehrere gemeinsam trainierte Decoding-Köpfe
  • EAGLE — schnelle baumbasierte Spekulation

Tools, die diese Verfahren implementieren

  • vLLM — unterstützt sowohl Quantisierung (AWQ, GPTQ, FP8) als auch Speculative Decoding
  • llama.cpp — Quantisierung und Spekulation über --draft-model
  • TensorRT-LLM — der Produktionsserver von NVIDIA
  • SGLang — schneller, batchfreundlicher Server mit kontinuierlichem Batching

Continuous Batching

Das wichtigste Feature von vLLM: Mehrere Anfragen mit unterschiedlichen Längen werden im selben Vorwärtsdurchlauf verarbeitet. Das steigert den Durchsatz von Produktionsservern enorm.

Quantisierungsstufe auswählen

Testen Sie jede infrage kommende Stufe mit Ihrer eigenen Evaluation. Q4_K_M ist der übliche Ausgangspunkt. Wählen Sie eine höhere Stufe, wenn die Qualität unter den Schwellenwert fällt.

Latenz pro Token im Vergleich zum Durchsatz

Unterschiedliche Optimierungen helfen bei unterschiedlichen Messgrößen:

  • Latenz bei einer einzelnen Anfrage: Speculative Decoding
  • Durchsatz für mehrere Benutzer: Continuous Batching
  • Speicherbedarf: Quantisierung

Auswirkung der Quantisierung

Was ist die wichtigste Auswirkung der int4-Quantisierung?

Zusammenfassung

Quantisieren Sie auf Q4, um Speicherbedarf und Laufzeit zu reduzieren. Verwenden Sie Speculative Decoding für geringere Latenz. Nutzen Sie Continuous Batching für höheren Durchsatz. vLLM und llama.cpp implementieren alle drei Verfahren.

Kostenlos starten

Lerne AI Agents mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
60
Lektionen
239

Häufig gestellte Fragen

Ist die Lektion „Quantisierung und spekulatives Decoding“ kostenlos?

Ja — der vollständige Text von „Quantisierung und spekulatives Decoding“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Quantisierung und spekulatives Decoding“?

Für selbst gehostete Modelle: int8/int4-Quantisierung spart Speicher, spekulatives Decoding erhöht den Durchsatz. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Quantisierung und spekulatives Decoding“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Token-Budgets pro Schritt
  2. Modell-Routing (günstig -> teuer)
  3. Caching von Prompts und Ergebnissen (Anthropic, Vertex)
  4. Quantisierung und spekulatives Decoding
← Zurück zu AI Agents