AI Agents · 강의

멀티모달 에이전트(비전 + 음성 + 행동)

화면을 보고, 음성을 듣고, 물리적 또는 디지털 세계에서 행동하는 에이전트입니다 — 다음 최전선의 기술입니다.

레슨 3/417개 단계

멀티모달 에이전트(비전 + 음성 + 행동)은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

텍스트를 넘어서

현대의 에이전트는 점점 더 멀티모달화되고 있습니다:

  • 시각 — 화면, 이미지, 동영상을 봄
  • 음성 — 사용자와 대화하고 사용자의 말을 들음
  • 동작 — 브라우저, 로봇, GUI를 제어함

시각 에이전트

과정 24에서 이 내용을 다뤘습니다. 복습해 보겠습니다:

  • 화면 이해를 위한 GPT-4o, Claude Sonnet 4.5, Gemini
  • 신뢰성 있는 상호작용을 위한 SoM 주석
  • 종단 간 데스크톱 제어를 위한 Computer Use

음성 에이전트

OpenAI Realtime API, Anthropic / Claude 음성 기능, ElevenLabs Conversational AI를 사용하면 음성 입력과 음성 출력을 모두 지원하는 에이전트를 구축할 수 있습니다:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

음성 지연 시간 목표

대화형 음성 기능은 응답 시간이 500ms 미만이어야 자연스럽게 느껴집니다. 전략은 다음과 같습니다:

  • 스트리밍 ASR + TTS
  • 사고 모델 사용 생략
  • 자주 사용하는 문구 캐시
  • 경량 모델 사용

음성 + 도구 사용

음성 에이전트도 도구를 사용할 수 있습니다. Realtime API는 함수 호출을 지원합니다. 예를 들어 "우유를 장보기 목록에 추가해 줘"라고 말하면 에이전트가 목록에 추가 기능을 호출합니다.

동작: 브라우저 / 컴퓨터 사용

이 내용은 과정 24에서 이미 다뤘습니다. Anthropic의 Computer Use, OpenAI의 Operator, OpenInterpreter를 사용하면 에이전트가 실제 컴퓨터를 조작할 수 있습니다.

동작: 로봇 공학

체화된 에이전트는 다음 연구의 최전선입니다. Google RT-2, Figure 02, NVIDIA GR00T는 VLM과 로봇 제어를 통합합니다. 아직 대부분 연구 단계이며, 프로덕션 배포 사례는 거의 없습니다.

동영상 이해

Gemini와 GPT-4o는 동영상을 입력으로 받을 수 있습니다. 사용 사례는 다음과 같습니다:

  • 감시 영상 요약
  • 요리 동영상에서 레시피 추출
  • 스포츠 분석
  • 녹화본에서 회의 요약

도구로 사용하는 이미지 생성

확산 모델(DALL-E 3, Imagen, Stable Diffusion)을 에이전트가 호출할 수 있는 도구로 사용할 수 있습니다:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

모달리티를 넘나드는 추론

여러 모달리티를 결합하는 에이전트의 예는 다음과 같습니다. "이 차트를 보고, 이 메모를 받아 적고, 이메일 요약 초안을 작성해 줘." 각 모달리티가 저마다의 역할을 합니다.

OpenAI 실시간 도구 모음

OpenAI는 예제가 포함된 오픈 소스 실시간 에이전트 SDK를 제공합니다. 음성 에이전트가 목표라면 시작하기에 좋습니다.

Pipecat 및 LiveKit 에이전트

WebRTC를 통해 음성 및 영상 에이전트를 구축할 수 있는 오픈 소스 프레임워크입니다. Alexa와 유사한 어시스턴트를 만드는 많은 스타트업에서 사용합니다.

멀티모달 환경의 개인정보 보호

오디오와 비디오는 PII가 많이 포함되어 있습니다. 저장된 데이터는 암호화하고, 전사 내용에서는 민감한 정보를 삭제하며, 사용자에게 삭제 버튼을 제공하십시오. 음성 생체 인식에는 GDPR 제9조에 따른 동의가 필요할 수 있습니다.

지연 시간 우선 모델

음성 및 영상 에이전트에는 가장 빠른 모델(Groq Llama 3.1, GPT-4o-realtime, Gemini Flash)을 우선 사용하고, 즉시 처리 경로에서는 추론 모델을 사용하지 않는 것이 좋습니다.

스마트 글라스 시대

Meta Ray-Ban, Apple Vision Pro 및 기타 웨어러블 기기가 항상 켜져 있는 멀티모달 에이전트를 선보이고 있습니다. 주변 환경을 이해하는 AI의 다음 소비자 제품 분야입니다.

음성 지연 시간

대화형 음성 에이전트의 일반적인 지연 시간 목표는 얼마입니까?

복습

비전(화면, 이미지, 비디오), 음성(대화형), 행동(브라우저, 컴퓨터, 로봇)입니다. 여러 양식을 결합하면 더 풍부한 에이전트를 만들 수 있습니다. 지연 시간, 개인정보 보호, 비용을 고려하십시오.

무료로 시작

AI 튜터와 함께 AI Agents을(를) 배우세요 — 무료

브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.

코스
60
레슨
239

자주 묻는 질문

“멀티모달 에이전트(비전 + 음성 + 행동)” 강의는 무료인가요?

네 — “멀티모달 에이전트(비전 + 음성 + 행동)” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“멀티모달 에이전트(비전 + 음성 + 행동)”에서 뭘 배우나요?

화면을 보고, 음성을 듣고, 물리적 또는 디지털 세계에서 행동하는 에이전트입니다 — 다음 최전선의 기술입니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.

“멀티모달 에이전트(비전 + 음성 + 행동)” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 에이전트 추론(o1, o3, 추론 모델)
  2. 하이브리드 기호 + 신경 에이전트
  3. 멀티모달 에이전트(비전 + 음성 + 행동)
  4. 미해결 과제: 견고성, 정렬, 장기 기억
← AI Agents(으)로 돌아가기