0Pricing
Deep Learning Academy · Lektion

Quantisierung für kleinere, schnellere Modelle

Verkleinern Sie Gewichte mit int8-Inferenz.

Quantisierung für kleinere, schnellere Modelle ist eine kostenlose Deep Learning Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Deep Learning Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.

Kleinere Gewichte, schnellere Modelle

Große Modelle sind langsam und aufwendig bereitzustellen. Quantization verkleinert sie, indem Zahlen mit weniger Bits gespeichert werden, sodass sie schneller und ressourcenschonender laufen. 📉

Float32 im Vergleich zu Int8

Modelle speichern Gewichte normalerweise als 32-Bit-Gleitkommazahlen. Quantization wandelt sie in 8-Bit-Ganzzahlen um und reduziert die Größe dadurch ungefähr auf ein Viertel.

Warum Int8 schneller läuft

Ganzzahlarithmetik ist auf der meisten Hardware günstiger als Gleitkommaarithmetik. Daher benötigt int8-Inferenz weniger Speicherbandbreite und ist schneller abgeschlossen.

Gleitkommazahlen auf Ganzzahlen abbilden

Eine scale und ein Zero-Point bilden jeden Gleitkomma-Bereich auf Ganzzahlen ab. Dadurch kann das Modell beim Rechnen einen Näherungswert als Gleitkommazahl wiederherstellen.

Rechnen Sie mit einem kleinen Genauigkeitsverlust

Weniger Bits bedeuten einen gewissen Präzisionsverlust, daher kann die Genauigkeit leicht sinken. Bei den meisten Modellen ist der Rückgang gering und der Geschwindigkeitsgewinn lohnt sich.

Dynamische Quantisierung: Der einfache Gewinn

Dynamic quantization ist der einfachste Weg. Dabei werden die Gewichte im Voraus und die Aktivierungen während der Ausführung quantisiert – ideal für lineare Schichten und RNN-Schichten.

import torch
q = torch.quantization.quantize_dynamic(
  model, {torch.nn.Linear}, dtype=torch.qint8)

Statische Quantisierung: Zuerst kalibrieren

Static quantization quantisiert auch die Aktivierungen im Voraus. Sie führen Beispieldaten zu, um die Wertebereiche zu kalibrieren, und erzielen dadurch auf CPUs mehr Geschwindigkeit.

Quantization-Aware Training

Für die bestmögliche Genauigkeit simuliert quantization-aware training int8 während des Trainings, sodass das Modell lernt, die geringere Präzision zu tolerieren.

Messen Sie den Größengewinn

Speichern Sie das Modell nach der Quantisierung und vergleichen Sie die Dateigrößen. Eine int8-Version ist typischerweise etwa ein Viertel so groß wie das ursprüngliche float32-Modell. 💾

torch.save(q.state_dict(), 'model_int8.pt')

Testen Sie die Genauigkeit stets erneut

Führen Sie Ihren Validierungssatz mit dem quantisierten Modell aus und bestätigen Sie, dass die Genauigkeit weiterhin akzeptabel ist, bevor Sie es für echte Nutzer bereitstellen.

Quantisierung spielt ihre Stärken auf CPUs und Edge-Geräten aus

Quantization bringt den größten Nutzen auf CPUs, Smartphones und Edge-Geräten, bei denen der Speicher knapp ist und Ganzzahlarithmetik gut unterstützt wird. 📱

Schnelltest

Sie möchten die schnellste Quantisierung ohne Kalibrierungsschritt. Welche Option passt?

Zusammenfassung: Leichter und schneller

Sie haben ein Modell mit quantization verkleinert, float32 gegen int8 ausgetauscht, dynamische oder statische Quantisierung beziehungsweise quantization-aware training gewählt und die Genauigkeit erneut überprüft. 🎉

Häufig gestellte Fragen

Ist die Lektion „Quantisierung für kleinere, schnellere Modelle“ kostenlos?

Ja — der vollständige Text von „Quantisierung für kleinere, schnellere Modelle“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Deep Learning Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Quantisierung für kleinere, schnellere Modelle“?

Verkleinern Sie Gewichte mit int8-Inferenz. Du übst Deep Learning Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Deep Learning Academy zu starten?

Keine Vorkenntnisse erforderlich. Deep Learning Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.

Wie lange dauert die Lektion „Quantisierung für kleinere, schnellere Modelle“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Deep Learning Academy-Lektion Code schreiben und ausführen?

Ja. Jede Deep Learning Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. TorchScript und torch.compile
  2. Nach ONNX exportieren
  3. Quantisierung für kleinere, schnellere Modelle
  4. Mit FastAPI bereitstellen
← Zurück zu Deep Learning Academy