AI Agents · 课时

多模态代理(视觉 + 语音 + 操作)

能够看懂屏幕、听懂语音,并在物理或数字世界中行动的代理——这是下一个前沿领域。

第 3 / 4 课17 个步骤

多模态代理(视觉 + 语音 + 操作) 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

超越文本

现代智能体正日益具备多模态能力:

  • 视觉 — 查看屏幕、图像和视频
  • 语音 — 与用户交谈并听取用户的声音
  • 动作 — 控制浏览器、机器人和 GUI

视觉智能体

我们在第 24 门课程中讲过这些内容。回顾如下:

  • GPT-4o、Claude Sonnet 4.5、Gemini 用于屏幕理解
  • 用于实现可靠交互的 SoM 标注
  • 用于端到端桌面控制的 Computer Use

语音智能体

OpenAI Realtime API、Anthropic / Claude 语音功能和 ElevenLabs Conversational AI 让您可以构建语音输入 / 语音输出的智能体:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

语音延迟目标

对话式语音需要低于 500 毫秒的响应时间,否则听起来会不自然。策略包括:

  • 流式 ASR + TTS
  • 跳过思考模型
  • 缓存常用短语
  • 使用轻量级模型

语音 + 工具使用

语音智能体也可以使用工具——Realtime API 支持函数调用。想象一下:“把牛奶加入我的购物清单”-> 智能体调用 add_to_list。

动作:浏览器 / 计算机使用

第 24 门课程已经讲过这些内容。Anthropic 的 Computer Use、OpenAI 的 Operator 和 OpenInterpreter 都能让智能体操控真实机器。

动作:机器人技术

具身智能体是下一个前沿方向。Google RT-2、Figure 02、NVIDIA GR00T 将 VLM 与机器人控制结合起来。目前仍主要处于研究阶段,投入生产环境的实例还很少。

视频理解

Gemini 和 GPT-4o 接受视频输入。应用场景包括:

  • 监控摘要
  • 从烹饪视频中提取食谱
  • 体育分析
  • 根据录音或录像生成会议摘要

图像生成作为工具

扩散模型(DALL-E 3、Imagen、Stable Diffusion)会成为智能体可以调用的工具:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

跨模态推理

结合多种模态的智能体:“查看这张图表,转录这些笔记,并起草一封邮件摘要。”每种模态都发挥着不同作用。

OpenAI 实时工具包

OpenAI 提供了一个开源的实时智能体 SDK,并附带示例。如果目标是构建语音智能体,这是一个很好的起点。

Pipecat 与 LiveKit 智能体

用于通过 WebRTC 构建语音和视频智能体的开源框架。许多初创公司都使用它们来构建类似 Alexa 的助手。

多模态隐私

音频和视频中包含大量 PII。请对静态数据加密、对转录文本进行脱敏,并为用户提供删除按钮。语音生物识别可能需要获得 GDPR 第 9 条所要求的同意。

按延迟分级的模型

对于语音和视频智能体,请优先使用速度最快的模型(Groq Llama 3.1、GPT-4o-realtime、Gemini Flash),并避免在关键路径上使用推理模型。

智能眼镜时代

Meta Ray-Ban、Apple Vision Pro 和其他可穿戴设备正在带来始终在线的多模态智能体。这是面向消费者的下一类环境式 AI 产品。

语音延迟

对话式语音智能体的典型延迟目标是多少?

回顾

视觉(屏幕、图像、视频)、语音(对话)和行动(浏览器、计算机、机器人)。组合多种模态,可以让智能体提供更丰富的能力。请关注延迟、隐私和成本。

免费开始

用 AI 导师学习 AI Agents — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
60
课程
239

常见问题解答

「多模态代理(视觉 + 语音 + 操作)」课时是免费的吗?

是的 — 「多模态代理(视觉 + 语音 + 操作)」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「多模态代理(视觉 + 语音 + 操作)」这节课中我会学到什么?

能够看懂屏幕、听懂语音,并在物理或数字世界中行动的代理——这是下一个前沿领域。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「多模态代理(视觉 + 语音 + 操作)」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 代理式推理(o1、o3、推理模型)
  2. 混合符号与神经代理
  3. 多模态代理(视觉 + 语音 + 操作)
  4. 开放问题:稳健性、对齐与长时记忆
← 返回 AI Agents