0Pricing
AI Agents · 강의

오디오 + 텍스트 에이전트 작업 흐름

전사 → 추론 → 오디오 응답 파이프라인을 처음부터 끝까지 구축합니다.

오디오 + 텍스트 에이전트 작업 흐름은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

음성-텍스트 에이전트 처리 흐름 개요

음성-텍스트 에이전트 처리 흐름은 음성 세계와 문자 세계를 서로 변환합니다. 표준 흐름은 다음과 같습니다. 음성 입력 → 위스퍼 전사 → 텍스트 에이전트 → TTS 음성 출력. 이를 통해 음성 비서, 통화 분석, 회의 요약, 핸즈프리 인터페이스를 구현할 수 있습니다.

지원되는 오디오 형식

OpenAI의 위스퍼는 다음 형식을 지원합니다: mp3, mp4, mpeg, mpga, m4a, wav, webm. 최대 파일 크기는 25 MB입니다. 더 큰 파일은 전송하기 전에 오디오를 분할하거나 압축해야 합니다.

최상의 텍스트 변환 품질과 가장 작은 파일 크기를 얻으려면 항상 16 kHz 모노로 녹음하거나 변환하십시오.

import os

SUPPORTED_FORMATS = {'.mp3', '.mp4', '.mpeg', '.mpga', '.m4a', '.wav', '.webm'}
MAX_FILE_SIZE_BYTES = 25 * 1024 * 1024  # 25 MB

def validate_audio_file(path: str) -> dict:
    ext = os.path.splitext(path)[1].lower()
    size = os.path.getsize(path) if os.path.exists(path) else 0
    return {
        'path': path,
        'format_ok': ext in SUPPORTED_FORMATS,
        'size_ok': size <= MAX_FILE_SIZE_BYTES,
        'size_mb': round(size / 1024 / 1024, 2),
        'extension': ext
    }

# Usage:
info = validate_audio_file('meeting.wav')
print(info)

위스퍼로 오디오 텍스트 변환

OpenAI의 audio.transcriptions.create 엔드포인트는 위스퍼를 감싸서 제공합니다. 파일 객체와 모델 이름을 전달하고, 선택적으로 언어 힌트(더 빠르고 잘못된 언어 감지를 방지함)와 프롬프트(특정 분야 용어에 맞게 어휘를 미리 설정함)를 전달할 수 있습니다.

from openai import OpenAI

client = OpenAI(api_key='YOUR_OPENAI_API_KEY')

def transcribe_audio(
    audio_path: str,
    language: str = 'en',
    prompt: str = ''
) -> str:
    with open(audio_path, 'rb') as audio_file:
        transcript = client.audio.transcriptions.create(
            model='whisper-1',
            file=audio_file,
            language=language,
            prompt=prompt,  # e.g. 'Python, NestJS, TypeScript, API'
            response_format='text'
        )
    return transcript

text = transcribe_audio('user_query.mp3', language='en',
                        prompt='Kubernetes, microservices, Docker')
print('Transcription:', text)

타임스탬프를 포함한 텍스트 변환

회의 분석이나 화자 분리를 위해 verbose_json 형식을 요청하십시오. 그러면 단어 단위 또는 구간 단위의 타임스탬프가 반환되므로, 오디오에서 참조하거나 잘라낼 정확한 시점을 찾을 수 있습니다.

def transcribe_with_timestamps(audio_path: str) -> dict:
    from openai import OpenAI
    client = OpenAI(api_key='YOUR_OPENAI_API_KEY')
    with open(audio_path, 'rb') as f:
        result = client.audio.transcriptions.create(
            model='whisper-1',
            file=f,
            response_format='verbose_json',
            timestamp_granularities=['segment']
        )
    # result.segments: list of {start, end, text}
    segments = [
        {'start': s.start, 'end': s.end, 'text': s.text}
        for s in result.segments
    ]
    return {'full_text': result.text, 'segments': segments}

# Example output structure:
# {'full_text': 'Hello team...', 'segments': [{'start': 0.0, 'end': 2.3, 'text': 'Hello team'}]}

텍스트 에이전트 처리

텍스트 변환이 끝나면 텍스트는 일반 텍스트 메시지로 LLM 에이전트를 거칩니다. 컨텍스트를 설정하는 시스템 프롬프트를 포함하십시오. 이 텍스트는 음성 발화에서 나온 것이므로 추임새와 불완전한 문장이 포함될 수 있음을 알려야 합니다.

import anthropic

VOICE_AGENT_SYSTEM = (
    'You are a helpful voice assistant. The user\'s message was transcribed from speech '
    'and may contain filler words ("um", "uh"), false starts, or incomplete sentences. '
    'Interpret the intent charitably and respond concisely in 1-3 sentences. '
    'Your response will be converted to speech, so avoid markdown, lists, or code blocks.'
)

def voice_agent_respond(transcription: str) -> str:
    client = anthropic.Anthropic(api_key='YOUR_ANTHROPIC_API_KEY')
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=256,
        system=VOICE_AGENT_SYSTEM,
        messages=[{'role': 'user', 'content': transcription}]
    )
    return response.content[0].text

OpenAI TTS를 사용한 음성 합성

OpenAI의 TTS API를 사용하여 에이전트의 텍스트 응답을 다시 음성으로 변환하십시오. 음성(alloy, echo, fable, onyx, nova, shimmer)과 모델(tts-1은 속도, tts-1-hd는 품질에 중점)을 선택하십시오. 결과를 mp3 파일로 저장하거나 직접 스트리밍할 수 있습니다.

from openai import OpenAI
from pathlib import Path

client = OpenAI(api_key='YOUR_OPENAI_API_KEY')

def text_to_speech(
    text: str,
    output_path: str = 'response.mp3',
    voice: str = 'nova',
    model: str = 'tts-1'
) -> str:
    response = client.audio.speech.create(
        model=model,
        voice=voice,
        input=text,
        response_format='mp3'
    )
    Path(output_path).write_bytes(response.content)
    print(f'TTS audio saved to {output_path}')
    return output_path

# Full pipeline:
tts_file = text_to_speech(
    'The weather in London is currently 15 degrees and partly cloudy.',
    voice='nova'
)

오디오 출력 스트리밍

실시간 음성 응답을 제공하려면 전체 파일이 완성될 때까지 기다리지 말고 TTS 오디오를 청크 단위로 스트리밍하십시오. OpenAI의 stream_to_file 도우미나 수동 청크 반복 처리를 사용하면 나머지 오디오가 계속 생성되는 동안 재생을 시작할 수 있습니다.

from openai import OpenAI

client = OpenAI(api_key='YOUR_OPENAI_API_KEY')

def stream_tts_to_file(text: str, output_path: str):
    # OpenAI SDK streams the audio response
    with client.audio.speech.with_streaming_response.create(
        model='tts-1',
        voice='nova',
        input=text,
        response_format='mp3'
    ) as response:
        response.stream_to_file(output_path)
    print(f'Streamed to {output_path}')

def stream_tts_chunks(text: str):
    """Yield raw audio bytes for piping to an audio player."""
    with client.audio.speech.with_streaming_response.create(
        model='tts-1',
        voice='nova',
        input=text
    ) as response:
        for chunk in response.iter_bytes(chunk_size=4096):
            yield chunk  # pipe to audio player or WebSocket

긴 오디오 파일 분할

25 MB보다 큰 오디오 파일은 위스퍼로 보내기 전에 분할해야 합니다. pydub 라이브러리를 사용하여 시간 간격을 기준으로 나누고 각 청크를 독립적으로 처리한 다음 텍스트 변환 결과를 이어 붙이십시오.

from pydub import AudioSegment
import os

def split_audio(
    path: str,
    chunk_minutes: int = 10
) -> list:
    audio = AudioSegment.from_file(path)
    chunk_ms = chunk_minutes * 60 * 1000
    chunks = []
    os.makedirs('audio_chunks', exist_ok=True)
    for i, start in enumerate(range(0, len(audio), chunk_ms)):
        chunk = audio[start:start + chunk_ms]
        chunk_path = f'audio_chunks/chunk_{i:03d}.mp3'
        chunk.export(chunk_path, format='mp3')
        chunks.append(chunk_path)
    return chunks

def transcribe_long_audio(path: str) -> str:
    chunks = split_audio(path, chunk_minutes=10)
    transcripts = []
    for chunk_path in chunks:
        text = transcribe_audio(chunk_path)
        transcripts.append(text)
    # Clean up chunks
    for chunk_path in chunks:
        os.remove(chunk_path)
    return ' '.join(transcripts)

실시간 오디오 처리 흐름

실시간 처리 흐름은 마이크 입력을 청크 단위로 캡처하고, 각 청크가 들어오는 즉시 위스퍼로 보내며, TTS 출력을 다시 스트리밍하여 거의 실시간으로 음성 대화를 가능하게 합니다. 핵심 과제는 각 단계의 지연 시간을 관리하는 것입니다.

import asyncio
import time

async def realtime_voice_loop(mic_stream, speaker_stream, client):
    """
    mic_stream: async generator yielding audio bytes
    speaker_stream: async callable accepting audio bytes
    """
    buffer = b''
    BUFFER_THRESHOLD = 50 * 1024  # ~3 seconds at 16kHz mono mp3

    async for audio_chunk in mic_stream:
        buffer += audio_chunk

        if len(buffer) >= BUFFER_THRESHOLD:
            t0 = time.time()
            # Save buffer to temp file
            with open('/tmp/voice_chunk.mp3', 'wb') as f:
                f.write(buffer)
            buffer = b''

            # Transcribe
            text = transcribe_audio('/tmp/voice_chunk.mp3')
            print(f'Transcribed ({time.time()-t0:.1f}s): {text}')

            # Agent response
            reply = voice_agent_respond(text)

            # TTS and stream to speaker
            for audio_bytes in stream_tts_chunks(reply):
                await speaker_stream(audio_bytes)

언어 감지 및 자동 전달

위스퍼는 음성 언어를 자동으로 감지합니다. 감지된 언어를 사용하여 대화를 올바른 에이전트 페르소나로 전달하거나 응답에 사용할 TTS 언어를 설정하십시오.

def transcribe_and_detect_language(audio_path: str) -> dict:
    from openai import OpenAI
    client = OpenAI(api_key='YOUR_OPENAI_API_KEY')
    with open(audio_path, 'rb') as f:
        result = client.audio.transcriptions.create(
            model='whisper-1',
            file=f,
            response_format='verbose_json'
        )
    return {
        'text': result.text,
        'language': result.language,  # e.g. 'english', 'spanish'
        'duration': result.duration
    }

LANGUAGE_VOICE_MAP = {
    'english': 'nova',
    'spanish': 'alloy',
    'french': 'echo',
    'german': 'fable'
}

def respond_in_detected_language(audio_path: str) -> str:
    info = transcribe_and_detect_language(audio_path)
    voice = LANGUAGE_VOICE_MAP.get(info['language'], 'nova')
    reply = voice_agent_respond(info['text'])
    return text_to_speech(reply, voice=voice)

배경 소음 및 저품질 오디오 처리

품질이 낮은 오디오는 텍스트 변환 정확도를 떨어뜨립니다. 실용적인 대응 방법은 다음과 같습니다. 노이즈 제거(noisereduce 라이브러리)로 사전 처리하고, 위스퍼의 prompt에 해당 분야의 어휘를 추가하며, 텍스트 변환 결과의 신뢰도를 검증하고, 신뢰도가 낮을 때는 명확한 설명을 요청하십시오.

def transcribe_with_quality_check(
    audio_path: str,
    min_confidence_words: int = 3
) -> dict:
    from openai import OpenAI
    import string
    client = OpenAI(api_key='YOUR_OPENAI_API_KEY')
    with open(audio_path, 'rb') as f:
        result = client.audio.transcriptions.create(
            model='whisper-1',
            file=f,
            response_format='verbose_json',
            timestamp_granularities=['word']
        )
    # Word count as a basic quality proxy
    words = result.text.translate(
        str.maketrans('', '', string.punctuation)
    ).split()
    quality_ok = len(words) >= min_confidence_words
    return {
        'text': result.text,
        'word_count': len(words),
        'quality_ok': quality_ok,
        'fallback_message': None if quality_ok else 'I could not hear you clearly. Please repeat.'
    }

지식 확인

위스퍼의 prompt 매개변수는 어떤 역할을 합니까?

복습: 오디오-텍스트 에이전트 작업 흐름

훌륭합니다! 핵심 내용은 다음과 같습니다.

  • 위스퍼: mp3/wav/m4a 등을 지원하며 최대 25 MB입니다. 큰 파일은 pydub으로 분할합니다.
  • 타임스탬프: 구간 시간을 얻으려면 verbose_json과 timestamp_granularities를 사용합니다.
  • TTS: 다양한 음성을 제공하는 OpenAI TTS를 사용하며, 지연 시간을 줄이려면 청크를 스트리밍합니다.
  • 언어 감지: 위스퍼가 자동으로 감지하며, 감지된 언어에 따라 올바른 음성이나 에이전트로 전달합니다.
  • 실시간 처리 흐름: 오디오 청크 버퍼링 → 텍스트 변환 → 에이전트 → TTS 스트리밍

다음 주제: 에이전트의 비디오 이해 — 프레임 추출과 시간적 추론입니다.

자주 묻는 질문

“오디오 + 텍스트 에이전트 작업 흐름” 강의는 무료인가요?

네 — “오디오 + 텍스트 에이전트 작업 흐름” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“오디오 + 텍스트 에이전트 작업 흐름”에서 뭘 배우나요?

전사 → 추론 → 오디오 응답 파이프라인을 처음부터 끝까지 구축합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“오디오 + 텍스트 에이전트 작업 흐름” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. Claude Vision과 GPT-4V를 활용한 이미지 + 텍스트 에이전트
  2. 오디오 + 텍스트 에이전트 작업 흐름
  3. 에이전트의 동영상 이해
  4. 교차 모달 추론 패턴
← AI Agents(으)로 돌아가기