응답 스트리밍(SSE)
Server-Sent Events를 통해 LLM 출력을 토큰 단위로 스트리밍하여 빠르게 반응하는 UI와 진행 상태 표시를 구현해보세요.
응답 스트리밍(SSE)은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
왜 스트리밍할까요
스트리밍하지 않으면 전체 응답이 완성될 때까지 아무것도 표시할 수 없습니다. 5초가 걸리는 50토큰 응답이라면 사용자는 5초 동안 아무것도 보지 못합니다.
스트리밍을 사용하면 토큰이 도착하는 즉시 표시합니다. 총 소요 시간은 같지만 사용자 경험은 즉각적으로 느껴집니다.
서버 전송 이벤트(SSE)
OpenAI와 Anthropic은 SSE를 통해 스트리밍합니다. SSE는 서버가 data: {...}\n\n 형식으로 이벤트를 전송하는 단방향 HTTP 프로토콜입니다.
대부분의 SDK는 반복자 인터페이스 뒤에 SSE를 숨깁니다.
OpenAI로 스트리밍하기
stream=True로 설정한 다음 응답을 반복 처리합니다:
stream = client.chat.completions.create(
model='gpt-4o-mini',
messages=messages,
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end='', flush=True)전체 응답 수집
델타를 누적해 최종 문자열을 가져옵니다:
buf = []
for chunk in stream:
delta = chunk.choices[0].delta.content or ''
buf.append(delta)
print(delta, end='', flush=True)
full_text = ''.join(buf)
messages.append({'role': 'assistant', 'content': full_text})Anthropic으로 스트리밍하기
같은 패턴이지만 API가 약간 다릅니다:
with client.messages.stream(
model='claude-sonnet-4-5',
max_tokens=1024,
messages=messages,
) as stream:
for text in stream.text_stream:
print(text, end='', flush=True)
final = stream.get_final_message()
print('\ndone, tokens:', final.usage.output_tokens)도구 호출 스트리밍
도구 호출도 스트리밍할 수 있습니다. OpenAI에서는 함수 이름과 인수가 여러 조각으로 도착합니다:
for chunk in stream:
delta = chunk.choices[0].delta
if delta.tool_calls:
for tc in delta.tool_calls:
# tc.function.name and tc.function.arguments arrive as partial strings
pass역압과 취소
사용자가 페이지를 닫으면 토큰을 계속 소모하지 않도록 스트림을 중단합니다:
try:
for chunk in stream:
if request_was_cancelled():
stream.close()
break
finally:
stream.close()웹 서버를 통한 스트리밍
FastAPI에서는 StreamingResponse를 사용합니다:
from fastapi.responses import StreamingResponse
def token_generator():
for chunk in stream:
delta = chunk.choices[0].delta.content or ''
yield f'data: {delta}\n\n'
return StreamingResponse(token_generator(), media_type='text/event-stream')문장 단위 버퍼링
텍스트 음성 변환이나 청크 단위 표시를 위해 문장이 끝날 때까지 버퍼링합니다:
buf = ''
for chunk in stream:
buf += chunk.choices[0].delta.content or ''
while '. ' in buf:
sentence, buf = buf.split('. ', 1)
speak(sentence + '.')스트리밍된 JSON 구문 분석
JSON 출력은 스트리밍 중간에 구문 분석할 수 없습니다. 다음과 같은 방법이 있습니다:
- 전체 출력을 버퍼링한 다음 한 번만 구문 분석합니다
- 스트리밍 JSON 구문 분석기(
ijson)를 사용해 필드가 완성될 때마다 내보냅니다
지연 시간 지표: TTFT와 TPS
- TTFT — 첫 토큰까지 걸리는 시간(체감 응답성)
- TPS — 초당 토큰 수(처리량)
스트리밍은 총 소요 시간이 아니라 TTFT를 최적화합니다. 채팅 사용자 경험에서는 TTFT를 500ms 미만으로 목표로 하세요.
왜 스트리밍할까요
스트리밍의 가장 큰 이점은 무엇인가요?
복습
스트리밍은 속도를 높이는 것이 아니라 사용자 경험을 개선합니다. 사람과 실시간으로 대화하는 모든 에이전트에 스트리밍을 구현하세요.
자주 묻는 질문
“응답 스트리밍(SSE)” 강의는 무료인가요?
네 — “응답 스트리밍(SSE)” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“응답 스트리밍(SSE)”에서 뭘 배우나요?
Server-Sent Events를 통해 LLM 출력을 토큰 단위로 스트리밍하여 빠르게 반응하는 UI와 진행 상태 표시를 구현해보세요. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“응답 스트리밍(SSE)” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.