단계별 토큰 예산
각 노드의 입력 및 출력 토큰 수에 상한을 두어 폭주하는 루프가 비용을 감당할 수 없을 정도로 키우지 못하게 합니다.
단계별 토큰 예산은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 1번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
토큰은 곧 비용
보내거나 받는 모든 토큰에는 비용과 시간이 듭니다. 운영 환경의 에이전트는 모든 단계에서 토큰 사용량을 추적하고 상한을 적용합니다.
모든 호출에서 최대 토큰 수 제한
모든 호출에서 항상 최대 토큰 수를 설정하세요. 그렇지 않으면 버그가 있는 프롬프트가 10,000개의 토큰 응답을 생성할 수 있습니다.
response = client.chat.completions.create(
model='gpt-4o-mini',
messages=messages,
max_tokens=1024, # cap per response
)에이전트 반복 과정의 단계별 상한
단계마다 필요한 예산이 다릅니다.
STEP_BUDGETS = {
'planner': 512,
'classifier': 64,
'final_synthesis': 2048,
'tool_call': 256
}
response = client.chat.completions.create(
model=model,
messages=messages,
max_tokens=STEP_BUDGETS[step_name]
)입력 토큰 줄이기
입력 토큰에도 비용이 듭니다. 과감하게 줄이세요.
import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')
def trim_to_budget(text, max_tokens=4000):
toks = enc.encode(text)
if len(toks) > max_tokens:
return enc.decode(toks[:max_tokens])
return text실행별 총예산
모든 단계의 입력과 출력을 합산하고, 초과하면 중단하세요.
MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
r = call_step(step)
total += r.usage.total_tokens
if total > MAX_TOKENS_PER_RUN:
return 'Budget exhausted; partial result'달러 기준 비용 상한
때로는 예산을 달러로 계산하는 편이 더 의미 있습니다.
PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}
for step in agent_steps:
r = call_step(step)
cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
total_cost += cost
if total_cost > MAX_COST_PER_RUN:
break적응형 예산
가장 어려운 단계에 더 많은 토큰을 사용하세요.
if step_difficulty == 'easy':
max_tokens = 256
elif step_difficulty == 'hard':
max_tokens = 2048출력 길이 추정
때로는 답변이 어느 정도 길어야 하는지 모델에 물어보세요.
preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)도구 출력 잘라내기
큰 도구 출력(HTML, 기록)은 문맥을 불필요하게 부풀립니다. 모델에 보내기 전에 잘라내세요.
tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
text = text[:4000] + '\n...[truncated]'대화 기록 압축
대화가 길어지면 토큰을 절약하기 위해 이전 대화 차례를 요약하세요.
if total_message_tokens(messages) > 8000:
messages = compact(messages)출력 형식이 토큰에 미치는 영향
JSON은 장황합니다. 짧고 구조화된 응답에는 다음을 고려해 보세요.
- 단일 도구 호출 인수
- 쉼표로 구분한 목록
- 간결한 사용자 지정 형식
토큰 분포 추적
단계별 히스토그램을 보면 어떤 단계를 최적화해야 하는지 알 수 있습니다.
metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})최대 토큰 수를 설정하는 이유
모든 LLM 호출에서 최대 토큰 수를 설정하는 이유는 무엇인가요?
복습
모든 호출에서 최대 토큰 수를 제한하세요. 입력을 줄이세요. 단계별 예산을 설정하세요. 실행별 총상한을 적용하세요. 분포를 추적하세요. 대화 기록을 압축하세요.
자주 묻는 질문
“단계별 토큰 예산” 강의는 무료인가요?
네 — “단계별 토큰 예산” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“단계별 토큰 예산”에서 뭘 배우나요?
각 노드의 입력 및 출력 토큰 수에 상한을 두어 폭주하는 루프가 비용을 감당할 수 없을 정도로 키우지 못하게 합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 1번째 강의입니다.
“단계별 토큰 예산” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.