Agentes multimodais (visão + voz + ação)
Agentes que veem telas, ouvem falas e agem no mundo físico ou digital — a próxima fronteira.
Agentes multimodais (visão + voz + ação) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Além do texto
Os agentes modernos são cada vez mais multimodais:
- Visão — veem telas, imagens e vídeos
- Voz — conversam com os usuários e os escutam
- Ação — controlam navegadores, robôs e GUIs
Agentes de visão
Abordamos isso no curso 24. Recapitulação:
- GPT-4o, Claude Sonnet 4.5 e Gemini para compreensão de telas
- Anotações SoM para interação confiável
- Uso do computador para controle completo do ambiente de trabalho
Agentes de voz
A API em tempo real da OpenAI, a voz da Anthropic / Claude e a Conversational AI da ElevenLabs permitem criar agentes que recebem e produzem voz:
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])Metas de latência para voz
A voz conversacional precisa de uma resposta em menos de 500 ms para parecer natural. Estratégias:
- ASR + TTS em fluxo
- Evitar modelos de raciocínio
- Armazenar em cache frases comuns
- Usar modelos leves
Voz + uso de ferramentas
Agentes de voz também podem usar ferramentas — as APIs em tempo real oferecem chamada de funções. Imagine: "Adicione leite à minha lista de compras" -> o agente chama add_to_list.
Ação: navegador / uso do computador
Isso já foi abordado no curso 24. O Uso do computador da Anthropic, o Operador da OpenAI e o OpenInterpreter permitem que os agentes controlem uma máquina real.
Ação: robótica
Agentes incorporados são a próxima fronteira. Google RT-2, Figure 02 e NVIDIA GR00T integram VLMs ao controle de robôs. Ainda são, em grande parte, projetos de pesquisa; por enquanto, há poucas implantações em produção.
Compreensão de vídeo
Gemini e GPT-4o aceitam vídeos. Casos de uso:
- Resumos de vigilância
- Extração de receitas de vídeos de culinária
- Análise esportiva
- Resumo de reuniões a partir de gravações
Geração de imagens como ferramenta
Modelos de difusão (DALL-E 3, Imagen, Stable Diffusion) tornam-se ferramentas que o agente pode chamar:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]Raciocínio entre modalidades
Agentes que combinam modalidades: "Observe este gráfico, transcreva estas anotações e redija um resumo por e-mail." Cada modalidade desempenha uma função.
OpenAI Realtime Toolkit
A OpenAI disponibiliza um SDK de agentes em tempo real de código aberto, com exemplos. É um bom ponto de partida se o objetivo forem agentes de voz.
Pipecat e agentes do LiveKit
Estruturas de código aberto para agentes de voz e vídeo via WebRTC. São usadas por muitas startups que desenvolvem assistentes no estilo da Alexa.
Privacidade em sistemas multimodais
Áudio e vídeo concentram muitos dados PII. Criptografe os dados em repouso, mascare as transcrições e ofereça aos usuários botões de delete. A biometria de voz pode exigir consentimento para o Artigo 9 do GDPR.
Modelos por faixa de latência
Para agentes de voz e vídeo, prefira os modelos mais rápidos (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) e evite modelos de raciocínio no caminho crítico.
Era dos óculos inteligentes
Meta Ray-Ban, Apple Vision Pro e outros dispositivos vestíveis estão trazendo agentes multimodais sempre ativos. Essa é a próxima categoria de consumo para a IA ambiente.
Latência da voz
Qual é a meta típica de latência para agentes de voz conversacionais?
Recapitulação
Visão (telas, imagens, vídeo), voz (conversacional), ação (navegadores, computadores, robôs). Combine modalidades para criar agentes mais ricos. Tenha em mente a latência, a privacidade e o custo.
Aprenda AI Agents com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 60
- Aulas
- 239
Perguntas Frequentes
A aula “Agentes multimodais (visão + voz + ação)” é grátis?
Sim — o texto completo de “Agentes multimodais (visão + voz + ação)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Agentes multimodais (visão + voz + ação)”?
Agentes que veem telas, ouvem falas e agem no mundo físico ou digital — a próxima fronteira. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Agentes multimodais (visão + voz + ação)”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Raciocínio agêntico (o1, o3, modelos de raciocínio)
- Agentes híbridos simbólicos e neurais
- Agentes multimodais (visão + voz + ação)
- Problemas em aberto: robustez, alinhamento e memória de longo prazo