MLOps Academy · Leçon

Activer le microtraitement adaptatif par lots

Regroupez automatiquement les requêtes pour augmenter le débit.

Leçon 3 sur 413 étapes

Activer le microtraitement adaptatif par lots est une leçon MLOps Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage MLOps Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours MLOps Academy comprend 4 leçons au total.

Le problème du débit

Appeler un modèle une fois par requête gaspille les ressources matérielles. Les modèles s’exécutent bien plus rapidement sur un lot d’entrées que sur ces mêmes entrées traitées une par une. ⚡

Fonctionnement du micro-regroupement

Le regroupement adaptatif collecte les requêtes entrantes pendant une courte période, les exécute ensemble, puis répartit automatiquement les résultats entre les appelants.

Pourquoi adaptatif ?

La taille de la fenêtre n’est pas fixe. BentoML surveille la latence en temps réel et adapte la taille du lot afin de rester rapide, quelle que soit la charge, faible ou élevée.

Tout se passe sur l’exécuteur

Le regroupement est configuré pour chaque modèle, et non pour chaque requête. Vous l’activez sur l’exécutable en indiquant quelles méthodes prennent en charge les entrées regroupées.

Activez-le

Pour un exécutable personnalisé, définissez batchable sur true pour la méthode. BentoML regroupe ensuite en arrière-plan les appels à cette méthode.

@bentoml.Runnable.method(batchable=True)
def predict(self, inputs):
    ...

Choisissez l’axe du lot

BentoML doit savoir comment empiler les entrées. L’argument batch_dim indique selon quel axe les concaténer, généralement l’axe 0.

@bentoml.Runnable.method(batchable=True, batch_dim=0)

Limitez la taille du lot

Vous fixez une limite à la taille du lot. max_batch_size plafonne le nombre de requêtes fusionnées afin qu’un lot gigantesque ne bloque jamais les autres.

Limitez le temps d’attente

Vous limitez également la durée d’attente. max_latency_ms définit la durée maximale pendant laquelle une requête peut rester dans la file avant le lancement du lot.

Ajustez la configuration

Vous définissez ces limites sans toucher au code. Un fichier bentoml_configuration vous permet d’ajuster le regroupement pour chaque exécuteur et chaque environnement.

runners:
  predict:
    batching:
      max_batch_size: 32

Le compromis

Les lots plus volumineux augmentent le débit, mais ajoutent un peu de latence à chaque requête. L’ajustement consiste à trouver le meilleur équilibre pour votre trafic.

Observez le fonctionnement

Vous ne modifiez pas du tout votre client. Les appelants continuent d’envoyer des requêtes individuelles, tandis que BentoML les fusionne en toute transparence en arrière-plan.

Vérification rapide

Vous augmentez max_batch_size à une valeur élevée. Quel effet est le plus probable sur une requête individuelle ?

Récapitulatif

Vous avez appris que le regroupement adaptatif rassemble les requêtes sur un exécuteur compatible avec le regroupement. Il est ajusté par max_batch_size et max_latency_ms, au prix d’un peu de latence pour obtenir un débit bien supérieur. 🙌

Gratuit pour commencer

Apprends Python avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
30
Leçons
120

Questions Fréquemment Posées

La leçon « Activer le microtraitement adaptatif par lots » est-elle gratuite ?

Oui — le texte complet de « Activer le microtraitement adaptatif par lots » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours MLOps Academy, passe à CoddyKit PRO. Le cours MLOps Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Activer le microtraitement adaptatif par lots » ?

Regroupez automatiquement les requêtes pour augmenter le débit. Tu pratiques MLOps Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer MLOps Academy ?

Aucune expérience préalable n'est requise. MLOps Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Activer le microtraitement adaptatif par lots » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon MLOps Academy ?

Oui. Chaque leçon MLOps Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Enregistrer un modèle dans le magasin Bento
  2. Définir un service et son API
  3. Activer le microtraitement adaptatif par lots
  4. Construire un Bento et le conteneuriser
← Retour à MLOps Academy