多模态代理(视觉 + 语音 + 操作)
能够看懂屏幕、听懂语音,并在物理或数字世界中行动的代理——这是下一个前沿领域。
多模态代理(视觉 + 语音 + 操作) 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
超越文本
现代智能体正日益具备多模态能力:
- 视觉 — 查看屏幕、图像和视频
- 语音 — 与用户交谈并听取用户的声音
- 动作 — 控制浏览器、机器人和 GUI
视觉智能体
我们在第 24 门课程中讲过这些内容。回顾如下:
- GPT-4o、Claude Sonnet 4.5、Gemini 用于屏幕理解
- 用于实现可靠交互的 SoM 标注
- 用于端到端桌面控制的 Computer Use
语音智能体
OpenAI Realtime API、Anthropic / Claude 语音功能和 ElevenLabs Conversational AI 让您可以构建语音输入 / 语音输出的智能体:
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])语音延迟目标
对话式语音需要低于 500 毫秒的响应时间,否则听起来会不自然。策略包括:
- 流式 ASR + TTS
- 跳过思考模型
- 缓存常用短语
- 使用轻量级模型
语音 + 工具使用
语音智能体也可以使用工具——Realtime API 支持函数调用。想象一下:“把牛奶加入我的购物清单”-> 智能体调用 add_to_list。
动作:浏览器 / 计算机使用
第 24 门课程已经讲过这些内容。Anthropic 的 Computer Use、OpenAI 的 Operator 和 OpenInterpreter 都能让智能体操控真实机器。
动作:机器人技术
具身智能体是下一个前沿方向。Google RT-2、Figure 02、NVIDIA GR00T 将 VLM 与机器人控制结合起来。目前仍主要处于研究阶段,投入生产环境的实例还很少。
视频理解
Gemini 和 GPT-4o 接受视频输入。应用场景包括:
- 监控摘要
- 从烹饪视频中提取食谱
- 体育分析
- 根据录音或录像生成会议摘要
图像生成作为工具
扩散模型(DALL-E 3、Imagen、Stable Diffusion)会成为智能体可以调用的工具:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]跨模态推理
结合多种模态的智能体:“查看这张图表,转录这些笔记,并起草一封邮件摘要。”每种模态都发挥着不同作用。
OpenAI 实时工具包
OpenAI 提供了一个开源的实时智能体 SDK,并附带示例。如果目标是构建语音智能体,这是一个很好的起点。
Pipecat 与 LiveKit 智能体
用于通过 WebRTC 构建语音和视频智能体的开源框架。许多初创公司都使用它们来构建类似 Alexa 的助手。
多模态隐私
音频和视频中包含大量 PII。请对静态数据加密、对转录文本进行脱敏,并为用户提供删除按钮。语音生物识别可能需要获得 GDPR 第 9 条所要求的同意。
按延迟分级的模型
对于语音和视频智能体,请优先使用速度最快的模型(Groq Llama 3.1、GPT-4o-realtime、Gemini Flash),并避免在关键路径上使用推理模型。
智能眼镜时代
Meta Ray-Ban、Apple Vision Pro 和其他可穿戴设备正在带来始终在线的多模态智能体。这是面向消费者的下一类环境式 AI 产品。
语音延迟
对话式语音智能体的典型延迟目标是多少?
回顾
视觉(屏幕、图像、视频)、语音(对话)和行动(浏览器、计算机、机器人)。组合多种模态,可以让智能体提供更丰富的能力。请关注延迟、隐私和成本。
用 AI 导师学习 AI Agents — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 60
- 课程
- 239
常见问题解答
「多模态代理(视觉 + 语音 + 操作)」课时是免费的吗?
是的 — 「多模态代理(视觉 + 语音 + 操作)」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「多模态代理(视觉 + 语音 + 操作)」这节课中我会学到什么?
能够看懂屏幕、听懂语音,并在物理或数字世界中行动的代理——这是下一个前沿领域。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「多模态代理(视觉 + 语音 + 操作)」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 代理式推理(o1、o3、推理模型)
- 混合符号与神经代理
- 多模态代理(视觉 + 语音 + 操作)
- 开放问题:稳健性、对齐与长时记忆