AI Agents · Lección

Agentes multimodales (visión + voz + acción)

Agentes que ven pantallas, oyen el habla y actúan en el mundo físico o digital: la próxima frontera.

Lección 3 de 417 pasos

Agentes multimodales (visión + voz + acción) es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Más allá del texto

Los agentes modernos son cada vez más multimodales:

  • Visión — ver pantallas, imágenes y vídeos
  • Voz — hablar con los usuarios y escucharlos
  • Acción — controlar navegadores, robots y GUI

Agentes de visión

Ya lo vimos en el Curso 24. Recapitulación:

  • GPT-4o, Claude Sonnet 4.5 y Gemini para comprender pantallas
  • Anotaciones de SoM para una interacción fiable
  • Computer Use para el control integral del escritorio

Agentes de voz

OpenAI Realtime API, Anthropic / Claude voice y ElevenLabs Conversational AI permiten crear agentes con entrada y salida de voz:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

Objetivos de latencia para voz

La interacción por voz necesita respuestas en menos de 500 ms para resultar natural. Estrategias:

  • ASR + TTS en streaming
  • Evitar los modelos de razonamiento
  • Almacenar en caché las frases comunes
  • Usar modelos ligeros

Voz + uso de herramientas

Los agentes de voz también pueden usar herramientas; las API de Realtime admiten llamadas a funciones. Imagine: «Añada leche a mi lista de compras» -> el agente llama a add_to_list.

Acción: uso del navegador o del ordenador

Ya lo vimos en el Curso 24. Computer Use de Anthropic, Operator de OpenAI y OpenInterpreter permiten a los agentes controlar una máquina real.

Acción: robótica

Los agentes incorporados a cuerpos físicos son la próxima frontera. Google RT-2, Figure 02 y NVIDIA GR00T integran VLM con control robótico. Por ahora siguen siendo principalmente proyectos de investigación; todavía hay pocos despliegues en producción.

Comprensión de vídeo

Gemini y GPT-4o aceptan vídeo. Casos de uso:

  • Resúmenes de vigilancia
  • Extracción de recetas de vídeos de cocina
  • Análisis deportivo
  • Resúmenes de reuniones a partir de grabaciones

Generación de imágenes como herramienta

Los modelos de difusión (DALL-E 3, Imagen, Stable Diffusion) se convierten en herramientas que el agente puede invocar:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

Razonamiento entre modalidades

Agentes que combinan modalidades: «Mire este gráfico, transcriba estas notas y redacte un resumen para un correo electrónico». Cada modalidad cumple una función.

OpenAI Realtime Toolkit

OpenAI ofrece un SDK de agentes Realtime de código abierto con ejemplos. Es un buen punto de partida si su objetivo son los agentes de voz.

Pipecat y LiveKit Agents

Frameworks de código abierto para agentes de voz y vídeo mediante WebRTC. Muchas startups los utilizan para crear asistentes al estilo de Alexa.

Privacidad en sistemas multimodales

El audio y el vídeo contienen una gran cantidad de información personal identificable (PII). Cifre los datos en reposo, redacte las transcripciones y proporcione a los usuarios botones para eliminar sus datos. La biometría de voz puede requerir el consentimiento previsto en el artículo 9 del RGPD.

Modelos según el nivel de latencia

Para los agentes de voz y vídeo, prefiera los modelos más rápidos (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) y evite los modelos de razonamiento en la ruta crítica.

La era de las gafas inteligentes

Meta Ray-Ban, Apple Vision Pro y otros dispositivos portátiles están dando lugar a agentes multimodales siempre activos. Es la próxima categoría de consumo para la IA ambiental.

Latencia de voz

¿Cuál es el objetivo de latencia habitual para los agentes de voz conversacionales?

Resumen

Visión (pantallas, imágenes y vídeo), voz (conversación) y acción (navegadores, ordenadores y robots). Combine las modalidades para crear agentes más completos. Tenga en cuenta la latencia, la privacidad y el coste.

Gratis para empezar

Aprende AI Agents con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
60
Lecciones
239

Preguntas frecuentes

¿La lección «Agentes multimodales (visión + voz + acción)» es gratis?

Sí — el texto completo de «Agentes multimodales (visión + voz + acción)» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Agentes multimodales (visión + voz + acción)»?

Agentes que ven pantallas, oyen el habla y actúan en el mundo físico o digital: la próxima frontera. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Agentes multimodales (visión + voz + acción)»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Razonamiento agéntico (o1, o3, modelos de razonamiento)
  2. Agentes híbridos simbólicos y neuronales
  3. Agentes multimodales (visión + voz + acción)
  4. Problemas abiertos: robustez, alineación y memoria a largo plazo
← Volver a AI Agents