0Pricing
MLOps Academy · Leçon

Configurer le traitement dynamique par lots dans Triton

Ajustez la taille maximale des lots et le délai d’attente de la file.

Configurer le traitement dynamique par lots dans Triton est une leçon MLOps Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage MLOps Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours MLOps Academy comprend 4 leçons au total.

Les modèles résident dans un dépôt

Triton charge les modèles depuis un dépôt de modèles, un dossier où chaque modèle possède son propre sous-dossier contenant les poids et un fichier de configuration.

Le fichier config.pbtxt

Chaque modèle possède un fichier config.pbtxt à côté de son dossier de version. Ce fichier texte indique à Triton les entrées, les sorties et la manière d’ordonner les requêtes.

Activer le traitement par lots dynamique

Vous activez le traitement par lots en ajoutant un bloc dynamic_batching à config.pbtxt. Avec un bloc vide, Triton utilise immédiatement des valeurs par défaut raisonnables.

dynamic_batching {
}

Définir max_batch_size

Au niveau supérieur, vous définissez max_batch_size. Cette valeur limite le nombre de requêtes que Triton fusionne en un seul appel d’inférence, ce qui borne la mémoire utilisée et la latence.

max_batch_size: 32

Le délai dans la file

Le paramètre essentiel est max_queue_delay_microseconds. Il indique combien de temps Triton attend en rassemblant les requêtes avant de déclencher un lot qui n’est pas encore complet.

dynamic_batching {
  max_queue_delay_microseconds: 1000
}

Petit délai, faible latence

Un court délai maintient une faible latence, mais forme de plus petits lots lorsque la charge est légère. Un délai plus long crée de plus gros lots, au prix d’une attente accrue.

Tailles de lots privilégiées

Vous pouvez suggérer des tailles efficaces avec preferred_batch_size. Triton essaie de constituer des lots de ces tailles, qui correspondent souvent aux tailles avec lesquelles le modèle s’exécute le plus rapidement.

dynamic_batching {
  preferred_batch_size: [ 8, 16 ]
}

Comment se forme un lot

Triton conserve les requêtes entrantes dans une file d’attente. Il déclenche le traitement lorsque le lot atteint la taille maximale, correspond à une taille privilégiée ou lorsque le délai de la file expire.

Aucune modification du client

Le meilleur aspect est que les clients continuent d’envoyer des requêtes individuelles. Triton les fusionne sur le serveur, de sorte que le code de votre application reste exactement le même.

Recharger pour appliquer les changements

Après avoir modifié config.pbtxt, vous rechargez le modèle afin que Triton prenne en compte la nouvelle planification, soit en redémarrant le service, soit via l’API de contrôle des modèles.

Commencer prudemment

Commencez avec une valeur modérée pour max_batch_size et un délai de file très court, puis augmentez-les en surveillant la latence. Régler les paramètres à partir de mesures vaut mieux que deviner.

Vérification rapide

Quel champ de configuration contrôle la durée pendant laquelle Triton attend avant de déclencher un lot partiel ?

Récapitulatif

Vous avez activé dynamic_batching dans config.pbtxt, limité sa taille avec max_batch_size et réglé le délai de la file ainsi que les tailles privilégiées, le tout sans toucher au client. 🙌

Questions Fréquemment Posées

La leçon « Configurer le traitement dynamique par lots dans Triton » est-elle gratuite ?

Oui — le texte complet de « Configurer le traitement dynamique par lots dans Triton » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours MLOps Academy, passe à CoddyKit PRO. Le cours MLOps Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Configurer le traitement dynamique par lots dans Triton » ?

Ajustez la taille maximale des lots et le délai d’attente de la file. Tu pratiques MLOps Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer MLOps Academy ?

Aucune expérience préalable n'est requise. MLOps Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Configurer le traitement dynamique par lots dans Triton » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon MLOps Academy ?

Oui. Chaque leçon MLOps Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Pourquoi les GPU ont besoin du traitement par lots
  2. Configurer le traitement dynamique par lots dans Triton
  3. Exécuter plusieurs instances de modèle par GPU
  4. Analyser et ajuster la latence d’inférence
← Retour à MLOps Academy