AI Agents · Aula

Agentes multimodais (visão + voz + ação)

Agentes que veem telas, ouvem falas e agem no mundo físico ou digital — a próxima fronteira.

Aula 3 de 417 etapas

Agentes multimodais (visão + voz + ação) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Além do texto

Os agentes modernos são cada vez mais multimodais:

  • Visão — veem telas, imagens e vídeos
  • Voz — conversam com os usuários e os escutam
  • Ação — controlam navegadores, robôs e GUIs

Agentes de visão

Abordamos isso no curso 24. Recapitulação:

  • GPT-4o, Claude Sonnet 4.5 e Gemini para compreensão de telas
  • Anotações SoM para interação confiável
  • Uso do computador para controle completo do ambiente de trabalho

Agentes de voz

A API em tempo real da OpenAI, a voz da Anthropic / Claude e a Conversational AI da ElevenLabs permitem criar agentes que recebem e produzem voz:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

Metas de latência para voz

A voz conversacional precisa de uma resposta em menos de 500 ms para parecer natural. Estratégias:

  • ASR + TTS em fluxo
  • Evitar modelos de raciocínio
  • Armazenar em cache frases comuns
  • Usar modelos leves

Voz + uso de ferramentas

Agentes de voz também podem usar ferramentas — as APIs em tempo real oferecem chamada de funções. Imagine: "Adicione leite à minha lista de compras" -> o agente chama add_to_list.

Ação: navegador / uso do computador

Isso já foi abordado no curso 24. O Uso do computador da Anthropic, o Operador da OpenAI e o OpenInterpreter permitem que os agentes controlem uma máquina real.

Ação: robótica

Agentes incorporados são a próxima fronteira. Google RT-2, Figure 02 e NVIDIA GR00T integram VLMs ao controle de robôs. Ainda são, em grande parte, projetos de pesquisa; por enquanto, há poucas implantações em produção.

Compreensão de vídeo

Gemini e GPT-4o aceitam vídeos. Casos de uso:

  • Resumos de vigilância
  • Extração de receitas de vídeos de culinária
  • Análise esportiva
  • Resumo de reuniões a partir de gravações

Geração de imagens como ferramenta

Modelos de difusão (DALL-E 3, Imagen, Stable Diffusion) tornam-se ferramentas que o agente pode chamar:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

Raciocínio entre modalidades

Agentes que combinam modalidades: "Observe este gráfico, transcreva estas anotações e redija um resumo por e-mail." Cada modalidade desempenha uma função.

OpenAI Realtime Toolkit

A OpenAI disponibiliza um SDK de agentes em tempo real de código aberto, com exemplos. É um bom ponto de partida se o objetivo forem agentes de voz.

Pipecat e agentes do LiveKit

Estruturas de código aberto para agentes de voz e vídeo via WebRTC. São usadas por muitas startups que desenvolvem assistentes no estilo da Alexa.

Privacidade em sistemas multimodais

Áudio e vídeo concentram muitos dados PII. Criptografe os dados em repouso, mascare as transcrições e ofereça aos usuários botões de delete. A biometria de voz pode exigir consentimento para o Artigo 9 do GDPR.

Modelos por faixa de latência

Para agentes de voz e vídeo, prefira os modelos mais rápidos (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) e evite modelos de raciocínio no caminho crítico.

Era dos óculos inteligentes

Meta Ray-Ban, Apple Vision Pro e outros dispositivos vestíveis estão trazendo agentes multimodais sempre ativos. Essa é a próxima categoria de consumo para a IA ambiente.

Latência da voz

Qual é a meta típica de latência para agentes de voz conversacionais?

Recapitulação

Visão (telas, imagens, vídeo), voz (conversacional), ação (navegadores, computadores, robôs). Combine modalidades para criar agentes mais ricos. Tenha em mente a latência, a privacidade e o custo.

Grátis para começar

Aprenda AI Agents com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
60
Aulas
239

Perguntas Frequentes

A aula “Agentes multimodais (visão + voz + ação)” é grátis?

Sim — o texto completo de “Agentes multimodais (visão + voz + ação)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Agentes multimodais (visão + voz + ação)”?

Agentes que veem telas, ouvem falas e agem no mundo físico ou digital — a próxima fronteira. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.

Quanto tempo leva a aula “Agentes multimodais (visão + voz + ação)”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Raciocínio agêntico (o1, o3, modelos de raciocínio)
  2. Agentes híbridos simbólicos e neurais
  3. Agentes multimodais (visão + voz + ação)
  4. Problemas em aberto: robustez, alinhamento e memória de longo prazo
← Voltar para AI Agents