Quantisierung für kleinere, schnellere Modelle
Verkleinern Sie Gewichte mit int8-Inferenz.
Quantisierung für kleinere, schnellere Modelle ist eine kostenlose Deep Learning Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Deep Learning Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.
Kleinere Gewichte, schnellere Modelle
Große Modelle sind langsam und aufwendig bereitzustellen. Quantization verkleinert sie, indem Zahlen mit weniger Bits gespeichert werden, sodass sie schneller und ressourcenschonender laufen. 📉
Float32 im Vergleich zu Int8
Modelle speichern Gewichte normalerweise als 32-Bit-Gleitkommazahlen. Quantization wandelt sie in 8-Bit-Ganzzahlen um und reduziert die Größe dadurch ungefähr auf ein Viertel.
Warum Int8 schneller läuft
Ganzzahlarithmetik ist auf der meisten Hardware günstiger als Gleitkommaarithmetik. Daher benötigt int8-Inferenz weniger Speicherbandbreite und ist schneller abgeschlossen.
Gleitkommazahlen auf Ganzzahlen abbilden
Eine scale und ein Zero-Point bilden jeden Gleitkomma-Bereich auf Ganzzahlen ab. Dadurch kann das Modell beim Rechnen einen Näherungswert als Gleitkommazahl wiederherstellen.
Rechnen Sie mit einem kleinen Genauigkeitsverlust
Weniger Bits bedeuten einen gewissen Präzisionsverlust, daher kann die Genauigkeit leicht sinken. Bei den meisten Modellen ist der Rückgang gering und der Geschwindigkeitsgewinn lohnt sich.
Dynamische Quantisierung: Der einfache Gewinn
Dynamic quantization ist der einfachste Weg. Dabei werden die Gewichte im Voraus und die Aktivierungen während der Ausführung quantisiert – ideal für lineare Schichten und RNN-Schichten.
import torch
q = torch.quantization.quantize_dynamic(
model, {torch.nn.Linear}, dtype=torch.qint8)Statische Quantisierung: Zuerst kalibrieren
Static quantization quantisiert auch die Aktivierungen im Voraus. Sie führen Beispieldaten zu, um die Wertebereiche zu kalibrieren, und erzielen dadurch auf CPUs mehr Geschwindigkeit.
Quantization-Aware Training
Für die bestmögliche Genauigkeit simuliert quantization-aware training int8 während des Trainings, sodass das Modell lernt, die geringere Präzision zu tolerieren.
Messen Sie den Größengewinn
Speichern Sie das Modell nach der Quantisierung und vergleichen Sie die Dateigrößen. Eine int8-Version ist typischerweise etwa ein Viertel so groß wie das ursprüngliche float32-Modell. 💾
torch.save(q.state_dict(), 'model_int8.pt')Testen Sie die Genauigkeit stets erneut
Führen Sie Ihren Validierungssatz mit dem quantisierten Modell aus und bestätigen Sie, dass die Genauigkeit weiterhin akzeptabel ist, bevor Sie es für echte Nutzer bereitstellen.
Quantisierung spielt ihre Stärken auf CPUs und Edge-Geräten aus
Quantization bringt den größten Nutzen auf CPUs, Smartphones und Edge-Geräten, bei denen der Speicher knapp ist und Ganzzahlarithmetik gut unterstützt wird. 📱
Schnelltest
Sie möchten die schnellste Quantisierung ohne Kalibrierungsschritt. Welche Option passt?
Zusammenfassung: Leichter und schneller
Sie haben ein Modell mit quantization verkleinert, float32 gegen int8 ausgetauscht, dynamische oder statische Quantisierung beziehungsweise quantization-aware training gewählt und die Genauigkeit erneut überprüft. 🎉
Häufig gestellte Fragen
Ist die Lektion „Quantisierung für kleinere, schnellere Modelle“ kostenlos?
Ja — der vollständige Text von „Quantisierung für kleinere, schnellere Modelle“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Deep Learning Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Deep Learning Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Quantisierung für kleinere, schnellere Modelle“?
Verkleinern Sie Gewichte mit int8-Inferenz. Du übst Deep Learning Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Deep Learning Academy zu starten?
Keine Vorkenntnisse erforderlich. Deep Learning Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Quantisierung für kleinere, schnellere Modelle“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Deep Learning Academy-Lektion Code schreiben und ausführen?
Ja. Jede Deep Learning Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- TorchScript und torch.compile
- Nach ONNX exportieren
- Quantisierung für kleinere, schnellere Modelle
- Mit FastAPI bereitstellen