Agents multimodaux (vision + voix + action)
Des agents qui voient les écrans, entendent la parole et agissent dans le monde physique ou numérique : la prochaine frontière.
Agents multimodaux (vision + voix + action) est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.
Au-delà du texte
Les agents modernes sont de plus en plus multimodaux :
- Vision — voir les écrans, les images et les vidéos
- Voix — parler aux utilisateurs et les écouter
- Action — contrôler les navigateurs, les robots et les interfaces graphiques
Agents visuels
Nous avons abordé ce sujet dans le cours 24. Récapitulatif :
- GPT-4o, Claude Sonnet 4.5 et Gemini pour comprendre les écrans
- Annotations SoM pour des interactions fiables
- Computer Use pour contrôler un ordinateur de bout en bout
Agents vocaux
OpenAI Realtime API, la voix d'Anthropic / Claude et ElevenLabs Conversational AI vous permettent de créer des agents vocaux qui reçoivent et produisent de la voix :
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])Objectifs de latence pour la voix
Une conversation vocale nécessite une réponse en moins de 500 ms pour sembler naturelle. Stratégies :
- ASR + TTS en flux continu
- Éviter les modèles de raisonnement
- Mettre en cache les phrases courantes
- Utiliser des modèles légers
Voix + utilisation d'outils
Les agents vocaux peuvent également utiliser des outils : les API Realtime prennent en charge les appels de fonctions. Imaginez : « Ajoute du lait à ma liste de courses » -> l'agent appelle add_to_list.
Action : navigateur / ordinateur
Nous avons déjà abordé ce sujet dans le cours 24. Computer Use d'Anthropic, Operator d'OpenAI et OpenInterpreter permettent tous aux agents de piloter une véritable machine.
Action : robotique
Les agents incarnés constituent la prochaine frontière. Google RT-2, Figure 02 et NVIDIA GR00T intègrent des VLM à la commande de robots. Il s'agit encore principalement de recherche ; les déploiements en production restent rares.
Compréhension des vidéos
Gemini et GPT-4o acceptent les vidéos. Cas d'utilisation :
- Résumés de vidéos de surveillance
- Extraction de recettes à partir de vidéos de cuisine
- Analyse sportive
- Résumé de réunions à partir d'enregistrements
Génération d'images comme outil
Les modèles de diffusion (DALL-E 3, Imagen, Stable Diffusion) deviennent des outils que l'agent peut appeler :
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]Raisonnement multimodal
Des agents qui combinent plusieurs modalités : « Examinez ce graphique, retranscrivez ces notes et rédigez un résumé sous forme d'e-mail. » Chaque modalité joue un rôle.
Boîte à outils Realtime d'OpenAI
OpenAI propose un SDK d'agents Realtime open source accompagné d'exemples. C'est un bon point de départ si votre objectif est de créer des agents vocaux.
Pipecat et agents LiveKit
Des frameworks open source pour créer des agents vocaux et vidéo sur WebRTC. Ils sont utilisés par de nombreuses start-up qui développent des assistants à la Alexa.
Confidentialité dans le multimodal
L'audio et la vidéo contiennent énormément de PII. Chiffrez les données au repos, masquez les transcriptions et donnez aux utilisateurs des boutons delete. La biométrie vocale peut nécessiter le consentement prévu à l'article 9 du GDPR.
Modèles classés par latence
Pour les agents vocaux et vidéo, privilégiez les modèles les plus rapides (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) et évitez les modèles de raisonnement sur le chemin critique.
L'ère des lunettes intelligentes
Meta Ray-Ban, Apple Vision Pro et d'autres objets portables rendent possibles des agents multimodaux toujours actifs. C'est la prochaine catégorie grand public de l'IA ambiante.
Latence vocale
Quel est l'objectif de latence habituel pour les agents vocaux conversationnels ?
Récapitulatif
Vision (écrans, images, vidéo), voix (conversationnelle), action (navigateurs, ordinateurs, robots). Combinez les modalités pour créer des agents plus riches. Tenez compte de la latence, de la confidentialité et du coût.
Questions Fréquemment Posées
La leçon « Agents multimodaux (vision + voix + action) » est-elle gratuite ?
Oui — le texte complet de « Agents multimodaux (vision + voix + action) » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Agents multimodaux (vision + voix + action) » ?
Des agents qui voient les écrans, entendent la parole et agissent dans le monde physique ou numérique : la prochaine frontière. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Agents ?
Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.
Combien de temps prend la leçon « Agents multimodaux (vision + voix + action) » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?
Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Raisonnement agentique (o1, o3, modèles de raisonnement)
- Agents hybrides symboliques et neuronaux
- Agents multimodaux (vision + voix + action)
- Problèmes ouverts : robustesse, alignement, mémoire à long horizon