0Pricing
AI Agents · Leçon

Agents multimodaux (vision + voix + action)

Des agents qui voient les écrans, entendent la parole et agissent dans le monde physique ou numérique : la prochaine frontière.

Agents multimodaux (vision + voix + action) est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Au-delà du texte

Les agents modernes sont de plus en plus multimodaux :

  • Vision — voir les écrans, les images et les vidéos
  • Voix — parler aux utilisateurs et les écouter
  • Action — contrôler les navigateurs, les robots et les interfaces graphiques

Agents visuels

Nous avons abordé ce sujet dans le cours 24. Récapitulatif :

  • GPT-4o, Claude Sonnet 4.5 et Gemini pour comprendre les écrans
  • Annotations SoM pour des interactions fiables
  • Computer Use pour contrôler un ordinateur de bout en bout

Agents vocaux

OpenAI Realtime API, la voix d'Anthropic / Claude et ElevenLabs Conversational AI vous permettent de créer des agents vocaux qui reçoivent et produisent de la voix :

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

Objectifs de latence pour la voix

Une conversation vocale nécessite une réponse en moins de 500 ms pour sembler naturelle. Stratégies :

  • ASR + TTS en flux continu
  • Éviter les modèles de raisonnement
  • Mettre en cache les phrases courantes
  • Utiliser des modèles légers

Voix + utilisation d'outils

Les agents vocaux peuvent également utiliser des outils : les API Realtime prennent en charge les appels de fonctions. Imaginez : « Ajoute du lait à ma liste de courses » -> l'agent appelle add_to_list.

Action : navigateur / ordinateur

Nous avons déjà abordé ce sujet dans le cours 24. Computer Use d'Anthropic, Operator d'OpenAI et OpenInterpreter permettent tous aux agents de piloter une véritable machine.

Action : robotique

Les agents incarnés constituent la prochaine frontière. Google RT-2, Figure 02 et NVIDIA GR00T intègrent des VLM à la commande de robots. Il s'agit encore principalement de recherche ; les déploiements en production restent rares.

Compréhension des vidéos

Gemini et GPT-4o acceptent les vidéos. Cas d'utilisation :

  • Résumés de vidéos de surveillance
  • Extraction de recettes à partir de vidéos de cuisine
  • Analyse sportive
  • Résumé de réunions à partir d'enregistrements

Génération d'images comme outil

Les modèles de diffusion (DALL-E 3, Imagen, Stable Diffusion) deviennent des outils que l'agent peut appeler :

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

Raisonnement multimodal

Des agents qui combinent plusieurs modalités : « Examinez ce graphique, retranscrivez ces notes et rédigez un résumé sous forme d'e-mail. » Chaque modalité joue un rôle.

Boîte à outils Realtime d'OpenAI

OpenAI propose un SDK d'agents Realtime open source accompagné d'exemples. C'est un bon point de départ si votre objectif est de créer des agents vocaux.

Pipecat et agents LiveKit

Des frameworks open source pour créer des agents vocaux et vidéo sur WebRTC. Ils sont utilisés par de nombreuses start-up qui développent des assistants à la Alexa.

Confidentialité dans le multimodal

L'audio et la vidéo contiennent énormément de PII. Chiffrez les données au repos, masquez les transcriptions et donnez aux utilisateurs des boutons delete. La biométrie vocale peut nécessiter le consentement prévu à l'article 9 du GDPR.

Modèles classés par latence

Pour les agents vocaux et vidéo, privilégiez les modèles les plus rapides (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) et évitez les modèles de raisonnement sur le chemin critique.

L'ère des lunettes intelligentes

Meta Ray-Ban, Apple Vision Pro et d'autres objets portables rendent possibles des agents multimodaux toujours actifs. C'est la prochaine catégorie grand public de l'IA ambiante.

Latence vocale

Quel est l'objectif de latence habituel pour les agents vocaux conversationnels ?

Récapitulatif

Vision (écrans, images, vidéo), voix (conversationnelle), action (navigateurs, ordinateurs, robots). Combinez les modalités pour créer des agents plus riches. Tenez compte de la latence, de la confidentialité et du coût.

Questions Fréquemment Posées

La leçon « Agents multimodaux (vision + voix + action) » est-elle gratuite ?

Oui — le texte complet de « Agents multimodaux (vision + voix + action) » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Agents multimodaux (vision + voix + action) » ?

Des agents qui voient les écrans, entendent la parole et agissent dans le monde physique ou numérique : la prochaine frontière. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Agents multimodaux (vision + voix + action) » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Raisonnement agentique (o1, o3, modèles de raisonnement)
  2. Agents hybrides symboliques et neuronaux
  3. Agents multimodaux (vision + voix + action)
  4. Problèmes ouverts : robustesse, alignement, mémoire à long horizon
← Retour à AI Agents