Мультимодальные агенты (зрение, голос и действие)
Агенты, которые видят экраны, слышат речь и действуют в физическом или цифровом мире, — следующий рубеж развития
«Мультимодальные агенты (зрение, голос и действие)» — бесплатный урок AI Agents на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
За пределами текста
Современные агенты становятся всё более мультимодальными:
- Зрение — просмотр экранов, изображений и видео
- Голос — общение с пользователями и восприятие их речи
- Действия — управление браузерами, роботами и GUI
Агенты с компьютерным зрением
Мы рассмотрели это в курсе 24. Кратко напомним:
- GPT-4o, Claude Sonnet 4.5 и Gemini для понимания содержимого экрана
- Аннотации SoM для надёжного взаимодействия
- Computer Use для сквозного управления компьютером
Голосовые агенты
OpenAI Realtime API, голосовые возможности Anthropic и Claude, а также ElevenLabs Conversational AI позволяют создавать агентов, которые принимают и выдают голосовые данные:
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])Целевые показатели задержки для голоса
В голосовом диалоге ответ должен поступать менее чем за 500 мс, иначе речь звучит неестественно. Возможные стратегии:
- Потоковая передача ASR и TTS
- Отказ от моделей рассуждений
- Кэширование распространённых фраз
- Использование облегчённых моделей
Голос и использование инструментов
Голосовые агенты тоже могут использовать инструменты — API реального времени поддерживают вызов функций. Например: «Добавьте молоко в мой список покупок» → агент вызывает add_to_list.
Действия: браузер и компьютер
Мы уже рассматривали это в курсе 24. Computer Use от Anthropic, Operator от OpenAI и OpenInterpreter позволяют агентам управлять настоящим компьютером.
Действия: робототехника
Воплощённые агенты — следующее направление развития. Google RT-2, Figure 02 и NVIDIA GR00T объединяют VLM с управлением роботами. Пока это в основном исследовательские проекты; промышленных внедрений ещё мало.
Понимание видео
Gemini и GPT-4o принимают видео. Варианты использования:
- Краткие обзоры видеонаблюдения
- Извлечение рецептов из кулинарных видео
- Спортивная аналитика
- Создание краткого содержания записи встречи
Генерация изображений как инструмент
Диффузионные модели (DALL-E 3, Imagen, Stable Diffusion) становятся инструментами, которые может вызывать агент:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]Рассуждения между модальностями
Агенты, объединяющие разные модальности: «Посмотрите на эту диаграмму, расшифруйте эти заметки и составьте краткое содержание для электронного письма». Каждая модальность выполняет свою роль.
Инструментарий OpenAI для работы в реальном времени
OpenAI предоставляет SDK для агентов реального времени с открытым исходным кодом и примерами. Это хорошая отправная точка, если ваша цель — голосовые агенты.
Pipecat и агенты LiveKit
Фреймворки с открытым исходным кодом для голосовых и видеоагентов, работающих через WebRTC. Их используют многие стартапы, создающие ассистентов в стиле Alexa.
Конфиденциальность в мультимодальных системах
Аудио и видео содержат огромное количество PII. Шифруйте данные при хранении, удаляйте персональные данные из расшифровок и добавляйте для пользователей кнопки удаления. Для голосовой биометрии может потребоваться согласие в соответствии со статьёй 9 GDPR.
Модели, оптимизированные по задержке
Для голосовых и видеоагентов выбирайте самые быстрые модели (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) и не используйте модели с рассуждением в критическом пути обработки.
Эра умных очков
Meta Ray-Ban, Apple Vision Pro и другие носимые устройства открывают доступ к постоянно активным мультимодальным агентам. Это следующая потребительская категория для фонового ИИ.
Задержка голоса
Какова типичная целевая задержка для разговорных голосовых агентов?
Итоги
Визуальное восприятие (экраны, изображения, видео), голос (диалог), действия (браузеры, компьютеры, роботы). Сочетайте разные модальности, чтобы создавать более функциональных агентов. Учитывайте задержку, конфиденциальность и стоимость.
Часто задаваемые вопросы
Урок «Мультимодальные агенты (зрение, голос и действие)» бесплатный?
Да — полный текст урока «Мультимодальные агенты (зрение, голос и действие)» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Мультимодальные агенты (зрение, голос и действие)»?
Агенты, которые видят экраны, слышат речь и действуют в физическом или цифровом мире, — следующий рубеж развития Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Мультимодальные агенты (зрение, голос и действие)»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Агентное рассуждение (o1, o3, модели рассуждений)
- Гибридные символические и нейронные агенты
- Мультимодальные агенты (зрение, голос и действие)
- Открытые проблемы: устойчивость, согласованность, долговременная память