0Pricing
AI Agents · 강의

모델 라우팅(저렴한 모델 -> 비싼 모델)

먼저 소형 모델을 사용하고, 소형 모델이 실패하거나 신뢰도가 낮을 때만 최첨단 모델로 전환합니다.

모델 라우팅(저렴한 모델 -> 비싼 모델)은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.

쉬운 작업에 대형 모델을 사용하지 마세요

“이 이메일은 스팸인가요?”라는 질문에 GPT-4o를 호출하는 것은 비용 낭비입니다. 쉬운 작업은 저비용 모델로, 어려운 작업은 고비용 모델로 보내세요.

라우팅 패턴

  1. 먼저 작고 저렴한 모델을 사용합니다
  2. 출력의 확신도가 낮거나 검증에 실패하면 대형 모델로 승격합니다
  3. 어떤 경로를 거쳤는지 기록합니다

Confidence-Based Routing

cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
    return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)

검증 기반 라우팅

저비용 모델의 출력이 스키마 검증에 실패하면 상위 모델로 승격하세요.

try:
    result = Schema.model_validate_json(cheap_response.content)
    return result
except ValidationError:
    return Schema.model_validate_json(call('gpt-4o', messages).content)

단계별 모델 선택

에이전트의 각 부분에는 서로 다른 모델이 필요합니다.

MODEL_BY_STEP = {
    'classify_intent': 'gpt-4o-mini',     # easy
    'plan': 'gpt-4o',                     # critical
    'extract': 'gpt-4o-mini',             # routine
    'write_response': 'claude-sonnet-4-5' # quality matters
}

# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
    print(f'{step:16s} -> {MODEL_BY_STEP[step]}')

제공업체 간 라우팅

지연 시간에는 Groq를, 품질에는 OpenAI를, 긴 문맥에는 Anthropic을 사용하세요.

if need_low_latency:
    return call_groq('llama-3.1-70b')
elif need_long_context:
    return call_anthropic('claude-sonnet-4-5')
else:
    return call_openai('gpt-4o-mini')

LLM을 라우터로 사용하기

작은 모델이 요청을 분류하고 다음 모델을 선택합니다.

router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
    return call('gpt-4o-mini', user_msg)
else:
    return call('gpt-4o', user_msg)

대체 경로 연쇄

주 모델이 실패하면(사용량 제한, 오류) 보조 모델을 시도하세요.

for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
    try:
        return call(model, messages)
    except RateLimitError:
        continue
raise AllModelsFailed()

임베딩 기반 라우팅

질의를 임베딩하세요. 알려진 쉬운 사례와 유사하면 저비용 모델을 사용하고, 그렇지 않으면 대형 모델을 사용하세요.

embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
    use_cheap_model()

라우팅 계층 예시

계층비용용도
1단계$ — Llama 8B분류, 추출
2단계$$ — gpt-4o-mini일반적인 에이전트 단계
3단계$$$ — gpt-4o / claude어려운 추론, 최종 종합

순절감액 측정

다음 항목을 추적하세요.

  • 각 계층이 처리한 요청의 비율
  • 계층별 품질(평가 통과율)
  • 요청당 총비용

라우팅이 실제로 도움이 되는지 확인하려면 기준선(항상 대형 모델을 사용하는 경우)과 비교하세요.

확신도 보정

자기 보고 확신도는 신뢰하기 어렵습니다. 평가 세트를 기준으로 보정하세요. 모델이 90%라고 말하지만 실제로는 60%만 맞힌다면 임계값을 조정하세요.

오픈 소스 라우터

RouteLLM(LMSYS)은 학습된 모델 라우터를 위한 OSS 프레임워크입니다. 라우팅이 비용 구조에서 중요하다면 살펴볼 가치가 있습니다.

라우팅 전략

가장 단순하면서 효과적인 라우팅 전략은 무엇인가요?

복습

계층형 모델, 저비용 모델 우선 사용 후 승격, 단계별 라우팅, 대체 경로 연쇄를 사용하세요. 계층별 사용 비율과 품질을 측정하세요. 라우팅은 운영 환경에서 비용을 조절하는 가장 큰 수단입니다.

자주 묻는 질문

“모델 라우팅(저렴한 모델 -> 비싼 모델)” 강의는 무료인가요?

네 — “모델 라우팅(저렴한 모델 -> 비싼 모델)” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“모델 라우팅(저렴한 모델 -> 비싼 모델)”에서 뭘 배우나요?

먼저 소형 모델을 사용하고, 소형 모델이 실패하거나 신뢰도가 낮을 때만 최첨단 모델로 전환합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.

“모델 라우팅(저렴한 모델 -> 비싼 모델)” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 단계별 토큰 예산
  2. 모델 라우팅(저렴한 모델 -> 비싼 모델)
  3. 프롬프트와 결과 캐싱(Anthropic, Vertex)
  4. 양자화와 추측 디코딩
← AI Agents(으)로 돌아가기