0Pricing
AI Agents · 강의

응답 스트리밍(SSE)

Server-Sent Events를 통해 LLM 출력을 토큰 단위로 스트리밍하여 빠르게 반응하는 UI와 진행 상태 표시를 구현해보세요.

응답 스트리밍(SSE)은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

왜 스트리밍할까요

스트리밍하지 않으면 전체 응답이 완성될 때까지 아무것도 표시할 수 없습니다. 5초가 걸리는 50토큰 응답이라면 사용자는 5초 동안 아무것도 보지 못합니다.

스트리밍을 사용하면 토큰이 도착하는 즉시 표시합니다. 총 소요 시간은 같지만 사용자 경험은 즉각적으로 느껴집니다.

서버 전송 이벤트(SSE)

OpenAI와 Anthropic은 SSE를 통해 스트리밍합니다. SSE는 서버가 data: {...}\n\n 형식으로 이벤트를 전송하는 단방향 HTTP 프로토콜입니다.

대부분의 SDK는 반복자 인터페이스 뒤에 SSE를 숨깁니다.

OpenAI로 스트리밍하기

stream=True로 설정한 다음 응답을 반복 처리합니다:

stream = client.chat.completions.create(
    model='gpt-4o-mini',
    messages=messages,
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end='', flush=True)

전체 응답 수집

델타를 누적해 최종 문자열을 가져옵니다:

buf = []
for chunk in stream:
    delta = chunk.choices[0].delta.content or ''
    buf.append(delta)
    print(delta, end='', flush=True)

full_text = ''.join(buf)
messages.append({'role': 'assistant', 'content': full_text})

Anthropic으로 스트리밍하기

같은 패턴이지만 API가 약간 다릅니다:

with client.messages.stream(
    model='claude-sonnet-4-5',
    max_tokens=1024,
    messages=messages,
) as stream:
    for text in stream.text_stream:
        print(text, end='', flush=True)

    final = stream.get_final_message()
    print('\ndone, tokens:', final.usage.output_tokens)

도구 호출 스트리밍

도구 호출도 스트리밍할 수 있습니다. OpenAI에서는 함수 이름과 인수가 여러 조각으로 도착합니다:

for chunk in stream:
    delta = chunk.choices[0].delta
    if delta.tool_calls:
        for tc in delta.tool_calls:
            # tc.function.name and tc.function.arguments arrive as partial strings
            pass

역압과 취소

사용자가 페이지를 닫으면 토큰을 계속 소모하지 않도록 스트림을 중단합니다:

try:
    for chunk in stream:
        if request_was_cancelled():
            stream.close()
            break
finally:
    stream.close()

웹 서버를 통한 스트리밍

FastAPI에서는 StreamingResponse를 사용합니다:

from fastapi.responses import StreamingResponse

def token_generator():
    for chunk in stream:
        delta = chunk.choices[0].delta.content or ''
        yield f'data: {delta}\n\n'

return StreamingResponse(token_generator(), media_type='text/event-stream')

문장 단위 버퍼링

텍스트 음성 변환이나 청크 단위 표시를 위해 문장이 끝날 때까지 버퍼링합니다:

buf = ''
for chunk in stream:
    buf += chunk.choices[0].delta.content or ''
    while '. ' in buf:
        sentence, buf = buf.split('. ', 1)
        speak(sentence + '.')

스트리밍된 JSON 구문 분석

JSON 출력은 스트리밍 중간에 구문 분석할 수 없습니다. 다음과 같은 방법이 있습니다:

  • 전체 출력을 버퍼링한 다음 한 번만 구문 분석합니다
  • 스트리밍 JSON 구문 분석기(ijson)를 사용해 필드가 완성될 때마다 내보냅니다

지연 시간 지표: TTFT와 TPS

  • TTFT — 첫 토큰까지 걸리는 시간(체감 응답성)
  • TPS — 초당 토큰 수(처리량)

스트리밍은 총 소요 시간이 아니라 TTFT를 최적화합니다. 채팅 사용자 경험에서는 TTFT를 500ms 미만으로 목표로 하세요.

왜 스트리밍할까요

스트리밍의 가장 큰 이점은 무엇인가요?

복습

스트리밍은 속도를 높이는 것이 아니라 사용자 경험을 개선합니다. 사람과 실시간으로 대화하는 모든 에이전트에 스트리밍을 구현하세요.

자주 묻는 질문

“응답 스트리밍(SSE)” 강의는 무료인가요?

네 — “응답 스트리밍(SSE)” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“응답 스트리밍(SSE)”에서 뭘 배우나요?

Server-Sent Events를 통해 LLM 출력을 토큰 단위로 스트리밍하여 빠르게 반응하는 UI와 진행 상태 표시를 구현해보세요. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.

“응답 스트리밍(SSE)” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. OpenAI API 호출: chat.completions
  2. Anthropic API 호출: messages
  3. 응답 스트리밍(SSE)
  4. 비용 이해하기: 토큰 계산 및 예산
← AI Agents(으)로 돌아가기