Mehrere Modellinstanzen pro GPU ausführen
Nutzen Sie nebenläufige Ausführung, um die Auslastung zu erhöhen.
Mehrere Modellinstanzen pro GPU ausführen ist eine kostenlose MLOps Academy-Lektion auf CoddyKit. Dies ist Lektion 3 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des MLOps Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der MLOps Academy-Kurs umfasst insgesamt 4 Lektionen.
Eine Kopie kann zum Engpass werden
Bei nur einer Modellkopie muss Anfrage zwei warten, während Anfrage eins verarbeitet wird. Selbst eine schnelle GPU kann zwischen den Aufrufen ungenutzt bleiben, wodurch Durchsatz verloren geht.
Mehrere Kopien ausführen
Triton kann mehrere Instanzen desselben Modells laden, sodass mehrere Anfragen gleichzeitig ausgeführt werden und sich ihre Arbeit auf der GPU überlappt.
Der Block instance_group
Mit einem instance_group in config.pbtxt deklarieren Sie Kopien. Das Feld count gibt an, wie viele Instanzen Triton für dieses Modell erstellen soll.
instance_group {
count: 2
kind: KIND_GPU
}GPU oder CPU auswählen
Das Feld kind wählt das Gerät aus. KIND_GPU führt Instanzen auf der GPU aus, während KIND_CPU sie stattdessen auf dem Hostprozessor ausführt.
Auf GPUs platzieren
Mit einer Liste gpus können Sie Instanzen bestimmten Karten zuweisen. Dadurch kann ein Modell seine Kopien auf mehrere GPUs desselben Servers verteilen.
instance_group {
count: 2
kind: KIND_GPU
gpus: [ 0, 1 ]
}Warum das hilft
Während eine Instanz Berechnungen durchführt, kann eine andere Eingaben laden oder Ergebnisse kopieren. Diese Überlappung verbirgt Leerlaufzeiten und erhöht die Gesamtauslastung.
Es ergänzt das Batching
Instanzen und dynamisches Batching arbeiten zusammen. Batching füllt jeden Aufruf, während mehrere Instanzen gleichzeitig mehr als einen Aufruf ausführen.
Achten Sie auf den Speicher
Jede Instanz hält eine eigene Kopie der Gewichtungen im GPU-Speicher. Bei zu vielen Kopien geht Ihnen der VRAM aus. Erhöhen Sie die Anzahl daher schrittweise.
Mehr ist nicht immer schneller
Ab einem bestimmten Punkt konkurrieren zusätzliche Instanzen lediglich um dieselben Rechenressourcen. Der Durchsatz stagniert oder sinkt. Die optimale Anzahl ermitteln Sie daher durch Messungen, nicht durch Raten.
Parallelität berücksichtigen
Die richtige Anzahl an Instanzen hängt davon ab, wie viele Anfragen gleichzeitig eintreffen. Stimmen Sie die Instanzen auf Ihre tatsächliche Parallelität ab, um sowohl Verzögerungen als auch Verschwendung zu vermeiden.
Ein sinnvoller Ausgangspunkt
Zwei Instanzen pro GPU sind ein üblicher Ausgangspunkt. Testen Sie mit einer realistischen Auslastung und passen Sie die Anzahl anschließend anhand Ihrer Beobachtungen nach oben oder unten an.
Kurzprüfung
Was bewirkt die Einstellung count auf 2 in einem instance_group?
Zusammenfassung
Sie haben gelernt, mithilfe von instance_group mehrere Modellkopien auszuführen und Instanzen für Parallelität mit Batching zu kombinieren. Dabei behalten Sie den VRAM im Blick und optimieren die Anzahl durch Messungen. 🙌
Lerne Python mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 30
- Lektionen
- 120
Häufig gestellte Fragen
Ist die Lektion „Mehrere Modellinstanzen pro GPU ausführen“ kostenlos?
Ja — der vollständige Text von „Mehrere Modellinstanzen pro GPU ausführen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des MLOps Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der MLOps Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Mehrere Modellinstanzen pro GPU ausführen“?
Nutzen Sie nebenläufige Ausführung, um die Auslastung zu erhöhen. Du übst MLOps Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um MLOps Academy zu starten?
Keine Vorkenntnisse erforderlich. MLOps Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 3 von 4.
Wie lange dauert die Lektion „Mehrere Modellinstanzen pro GPU ausführen“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser MLOps Academy-Lektion Code schreiben und ausführen?
Ja. Jede MLOps Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Warum GPUs Batching benötigen
- Dynamisches Batching in Triton konfigurieren
- Mehrere Modellinstanzen pro GPU ausführen
- Inferenzlatenz profilieren und optimieren