マルチモーダルエージェント(Vision + Voice + Action)
画面を見て、音声を聞き、物理世界やデジタル世界で行動するエージェント — 次なるフロンティアです。
「マルチモーダルエージェント(Vision + Voice + Action)」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン3/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
テキストを超えて
現代のエージェントは、ますますマルチモーダルになっています:
- Vision — 画面、画像、動画を見ます
- Voice — ユーザーと会話し、音声を聞きます
- Action — ブラウザー、ロボット、GUIを操作します
Visionエージェント
この内容はコース24で扱いました。振り返りです:
- 画面理解にはGPT-4o、Claude Sonnet 4.5、Gemini
- 信頼性の高い操作のためのSoMアノテーション
- エンドツーエンドのデスクトップ操作を可能にするComputer Use
Voiceエージェント
OpenAI Realtime API、Anthropic/Claude voice、ElevenLabs Conversational AIを使えば、音声入力と音声出力に対応したエージェントを構築できます:
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])音声のレイテンシー目標
会話型音声では、500ms未満で応答しないと不自然に感じられます。戦略は次のとおりです:
- ASR+TTSのストリーミング
- 思考モデルを使わない
- よく使うフレーズをキャッシュする
- 軽量なモデルを使う
音声+ツール利用
音声エージェントもツールを利用できます。Realtime APIはFunction Callingに対応しています。たとえば、「買い物リストに牛乳を追加して」-> エージェントがadd_to_listを呼び出します。
Action:ブラウザー/Computer Use
この内容はコース24ですでに扱いました。AnthropicのComputer Use、OpenAIのOperator、OpenInterpreterを使えば、エージェントが実際のマシンを操作できます。
Action:ロボティクス
身体性を持つエージェントは、次のフロンティアです。Google RT-2、Figure 02、NVIDIA GR00Tは、VLMとロボット制御を統合しています。まだほとんどが研究段階で、本番導入の例はまだ少数です。
動画理解
GeminiとGPT-4oは動画を受け付けます。ユースケースは次のとおりです:
- 監視映像の要約
- 料理動画からのレシピ抽出
- スポーツ分析
- 録画からの会議要約
画像生成をツールとして使う
拡散モデル(DALL-E 3、Imagen、Stable Diffusion)を、エージェントが呼び出せるツールとして利用します:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]クロスモーダル推論
複数のモダリティを組み合わせるエージェントです。「このグラフを見て、これらのメモを書き起こし、メールの要約を下書きしてください」のような処理を行います。それぞれのモダリティが役割を担います。
OpenAI Realtime Toolkit
OpenAIは、サンプルを含むオープンソースのRealtime Agent SDKを提供しています。音声エージェントを目指す場合の出発点として適しています。
PipecatとLiveKit Agents
WebRTC上で音声・動画エージェントを構築するためのオープンソースフレームワークです。Alexaのようなアシスタントを開発する多くのスタートアップで利用されています。
マルチモーダルにおけるプライバシー
音声と動画には大量の個人識別情報(PII)が含まれます。保存時には暗号化し、文字起こしからは機密情報を削除し、ユーザーがデータを削除できるボタンを用意してください。音声生体認証には、GDPR第9条に基づく同意が必要になる場合があります。
レイテンシー層別モデル
音声・動画エージェントでは、最も高速なモデル(Groq Llama 3.1、GPT-4o-realtime、Gemini Flash)を優先し、重要な処理経路では推論モデルを避けてください。
スマートグラス時代
Meta Ray-Ban、Apple Vision Proなどのウェアラブルデバイスによって、常時稼働するマルチモーダルエージェントが普及しつつあります。環境知能(ambient AI)における、次の消費者向けカテゴリです。
音声のレイテンシー
会話型音声エージェントにおける一般的なレイテンシーの目標値はどのくらいでしょうか。
まとめ
視覚(画面、画像、動画)、音声(会話)、アクション(ブラウザー、コンピューター、ロボット)があります。複数のモダリティを組み合わせると、より高度なエージェントを実現できます。レイテンシー、プライバシー、コストに注意してください。
よくある質問
「マルチモーダルエージェント(Vision + Voice + Action)」レッスンは無料ですか?
はい。「マルチモーダルエージェント(Vision + Voice + Action)」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「マルチモーダルエージェント(Vision + Voice + Action)」で何を学びますか?
画面を見て、音声を聞き、物理世界やデジタル世界で行動するエージェント — 次なるフロンティアです。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン3/4です。
「マルチモーダルエージェント(Vision + Voice + Action)」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- Agentic推論(o1、o3、Reasoning Models)
- シンボリックAIとニューラルエージェントの融合
- マルチモーダルエージェント(Vision + Voice + Action)
- 未解決の課題:堅牢性、アラインメント、長期記憶