Agenti multimodali (visione + voce + azione)
Agenti che vedono gli schermi, ascoltano il parlato e agiscono nel mondo fisico o digitale: la prossima frontiera
Agenti multimodali (visione + voce + azione) è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.
Oltre il testo
Gli agent moderni sono sempre più multimodali:
- Visione — vedono schermi, immagini e video
- Voce — parlano con gli utenti e li ascoltano
- Azione — controllano browser, robot e GUI
Agent visivi
Abbiamo trattato questo argomento nel Course 24. Riepilogo:
- GPT-4o, Claude Sonnet 4.5, Gemini per la comprensione degli schermi
- Annotazioni SoM per un'interazione affidabile
- Computer Use per il controllo end-to-end del desktop
Agent vocali
OpenAI Realtime API, Anthropic / Claude voice ed ElevenLabs Conversational AI permettono di creare agent con input e output vocali:
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])Obiettivi di latenza per la voce
La conversazione vocale richiede una risposta inferiore a 500 ms, altrimenti risulta innaturale. Strategie:
- ASR + TTS in streaming
- Eviti i modelli di ragionamento
- Metta in cache le frasi comuni
- Usi modelli leggeri
Voce + uso degli strumenti
Anche gli agent vocali possono usare strumenti: le Realtime API supportano le chiamate di funzione. Immagini: «Aggiungi il latte alla mia lista della spesa» -> l'agent chiama add_to_list.
Azione: Browser / Computer Use
Lo abbiamo già trattato nel Course 24. Computer Use di Anthropic, Operator di OpenAI e OpenInterpreter permettono agli agent di controllare una macchina reale.
Azione: robotica
Gli agent embodied sono la prossima frontiera. Google RT-2, Figure 02 e NVIDIA GR00T integrano VLM con il controllo dei robot. Siamo ancora soprattutto nella fase di ricerca; le implementazioni in produzione sono ancora poche.
Comprensione dei video
Gemini e GPT-4o accettano video. Casi d'uso:
- Riepiloghi di video di sorveglianza
- Estrazione di ricette da video di cucina
- Analisi sportive
- Riassunti delle riunioni a partire dalle registrazioni
Generazione di immagini come strumento
I modelli di diffusione (DALL-E 3, Imagen, Stable Diffusion) diventano strumenti che l'agent può chiamare:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]Ragionamento multimodale
Agent che combinano più modalità: «Guardi questo grafico, trascriva questi appunti e prepari una bozza di riepilogo per email». Ogni modalità svolge un ruolo.
OpenAI Realtime Toolkit
OpenAI distribuisce un SDK open source per agenti realtime, corredato da esempi. È un buon punto di partenza se l'obiettivo è creare agenti vocali.
Pipecat and LiveKit Agents
Framework open source per agenti vocali/video basati su WebRTC. Sono utilizzati da molte startup che sviluppano assistenti in stile Alexa.
Privacy nella multimodalità
Audio e video contengono una grande quantità di dati personali identificabili (PII). Li crittografi quando sono inattivi, oscuri le trascrizioni e offra agli utenti pulsanti per eliminarli. La biometria vocale potrebbe richiedere il consenso previsto dall'articolo 9 del GDPR.
Modelli per fascia di latenza
Per gli agenti vocali/video, preferisca i modelli più veloci (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) ed eviti i modelli di ragionamento nel percorso critico.
L'era degli smart glasses
Meta Ray-Ban, Apple Vision Pro e altri dispositivi indossabili stanno portando sul mercato agenti multimodali sempre attivi. Sono la prossima categoria di prodotti consumer per l'IA ambientale.
Latenza vocale
Qual è l'obiettivo di latenza tipico per gli agenti vocali conversazionali?
Riepilogo
Visione (schermi, immagini, video), voce (conversazione), azione (browser, computer, robot). Combini le modalità per ottenere agenti più ricchi. Tenga presenti latenza, privacy e costi.
Domande Frequenti
La lezione «Agenti multimodali (visione + voce + azione)» è gratuita?
Sì — il testo completo di «Agenti multimodali (visione + voce + azione)» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.
Cosa imparerò in «Agenti multimodali (visione + voce + azione)»?
Agenti che vedono gli schermi, ascoltano il parlato e agiscono nel mondo fisico o digitale: la prossima frontiera Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Agents?
Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.
Quanto tempo richiede la lezione «Agenti multimodali (visione + voce + azione)»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Agents?
Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Ragionamento agentico (o1, o3, modelli di ragionamento)
- Agenti ibridi simbolici + neurali
- Agenti multimodali (visione + voce + azione)
- Problemi aperti: robustezza, allineamento, memoria a lungo termine