미세 조정 모델 평가 및 배포
분리해 둔 테스트 사례에서 기본 모델과 미세 조정 모델을 비교하는 정량 평가를 실행하고, 로컬 추론을 위해 GGUF로 변환한 뒤 llama.cpp 또는 vLLM으로 제공하는 방법을 학습합니다.
미세 조정 모델 평가 및 배포은(는) CoddyKit의 무료 AI Engineering Academy 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Engineering Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Engineering Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
배포 전에 반드시 평가해야 하는 이유
훈련 데이터에서 성능이 좋은 미세 조정 모델이 실제 프로덕션 사용 사례에서는 기본 모델보다 성능이 낮을 수 있습니다. 이를 확인하는 유일한 방법은 엄격한 평가입니다. 미세 조정은 치명적 망각(기본 모델이 갖고 있던 능력을 잃는 현상), 과도한 전문화(대상 작업은 잘 수행하지만 인접 작업은 더 못하는 현상), 안전 동작의 미묘한 회귀를 일으킬 수 있습니다. 대표성 있는 테스트 세트에서 기본 모델과 비교 평가하지 않은 미세 조정 모델은 절대 배포하지 마세요.
보류 테스트 세트 구축
테스트 세트는 훈련 및 검증 데이터와 완전히 분리되어야 합니다. 즉, 훈련의 어떤 단계에서도 모델이 본 적 없는 예시로 구성해야 합니다. 테스트 세트는 프로덕션 입력의 전체 분포를 대표해야 합니다. 일반적인 사례, 예외 사례, 적대적 입력을 모두 포함하세요. 명령 수행 작업에서는 가장 흔한 부분뿐 아니라 명령의 모든 측면을 따라야 하는 예시를 포함하세요. 신뢰할 수 있는 평가에는 일반적으로 100~500개의 예시로 구성된 테스트 세트면 충분합니다.
import json
from typing import TypedDict
class TestCase(TypedDict):
input: str # the user message
expected_output: str # the ideal response
category: str # e.g., 'format', 'accuracy', 'edge_case'
evaluation_method: str # 'exact_match', 'json_schema', 'llm_judge'
# Load test set (never used during training)
def load_test_set(path: str) -> list[TestCase]:
cases = []
with open(path) as f:
for line in f:
data = json.loads(line.strip())
cases.append({
'input': data['messages'][-2]['content'], # user message
'expected_output': data['messages'][-1]['content'], # assistant response
'category': data.get('metadata', {}).get('category', 'general'),
'evaluation_method': data.get('metadata', {}).get('eval_method', 'llm_judge')
})
return cases
test_set = load_test_set('test.jsonl')
print(f'Test set loaded: {len(test_set)} examples')작업별 정량 평가 지표
작업에 맞는 평가 지표를 선택하세요. JSON 추출에는 스키마 준수율과 필드별 정확도를 측정합니다. 분류에는 클래스별 정확도, 정밀도, 재현율을 측정합니다. 텍스트 생성에는 LLM을 평가자로 사용하는 점수 산정을 통해 품질을 측정합니다. 형식 준수에는 정확한 형식 준수율을 측정합니다. 개선 폭을 측정할 수 있도록 각 지표를 기본 모델과 미세 조정 모델 모두에 대해 실행하세요.
import json
def evaluate_json_extraction(model_output: str, expected: str, schema: dict) -> dict:
metrics = {'valid_json': False, 'schema_compliant': False, 'field_accuracy': 0.0}
try:
parsed = json.loads(model_output.strip())
metrics['valid_json'] = True
# Check schema compliance
required_fields = schema.get('required', [])
all_present = all(field in parsed for field in required_fields)
correct_types = all(
isinstance(parsed.get(field), schema['properties'][field]['expected_type'])
for field in required_fields if field in parsed
)
metrics['schema_compliant'] = all_present and correct_types
# Field-level accuracy against expected output
expected_parsed = json.loads(expected)
correct_fields = sum(1 for k in expected_parsed if parsed.get(k) == expected_parsed[k])
metrics['field_accuracy'] = correct_fields / len(expected_parsed) if expected_parsed else 0.0
except json.JSONDecodeError:
pass # valid_json stays False
return metricsLLM 평가자 평가
개방형 생성 작업에서는 LLM을 평가자로 사용해 미세 조정 모델의 출력을 기대 출력과 비교하여 점수를 매기세요. GPT-4o에 평가자 역할을 하도록 프롬프트를 작성하고, 입력, 기대 출력, 모델 출력을 제공한 다음 정확성, 완전성, 형식 준수를 1~5점 척도로 평가하도록 요청하세요. 테스트 세트 전체의 점수를 평균 내어 종합 품질 점수를 구합니다. 동일한 테스트 세트에서 미세 조정 모델의 점수를 기본 모델의 점수와 비교하세요.
from openai import OpenAI
client = OpenAI()
def llm_judge_score(instruction: str, expected: str, actual: str) -> dict:
judge_prompt = f'''Evaluate the quality of an AI assistant response.
Instruction given to assistant:
{instruction}
Expected ideal response:
{expected}
Actual response from model being evaluated:
{actual}
Rate the actual response on these criteria (1=poor, 5=excellent):
1. Correctness: Is the information accurate?
2. Format compliance: Does it follow the expected output format?
3. Completeness: Does it address all parts of the instruction?
Return JSON: {{"correctness": N, "format": N, "completeness": N, "overall": N, "reason": "brief explanation"}}'''
response = client.chat.completions.create(
model='gpt-4o',
messages=[{'role': 'user', 'content': judge_prompt}],
response_format={'type': 'json_object'}
)
return json.loads(response.choices[0].message.content)비교 평가 실행
모든 테스트 사례에서 기본 모델, 미세 조정 모델(선택적으로 강력한 프롬프트 기준선)을 정면으로 비교하는 평가를 실행하세요. 각 테스트 사례에 대해 각 모델의 출력을 생성한 다음, 평가 지표로 모든 출력에 점수를 매기세요. 지표 점수, 표준 편차, 기준선과 비교했을 때 미세 조정 모델이 우세하거나 열세인 사례를 보여 주는 비교 표를 작성하세요.
def run_full_evaluation(test_set: list, models: dict, system_prompt: str) -> dict:
results = {name: {'scores': [], 'errors': 0} for name in models}
for i, test_case in enumerate(test_set):
print(f'Evaluating test case {i+1}/{len(test_set)}')
for model_name, model_fn in models.items():
try:
output = model_fn(test_case['input'], system_prompt)
score = llm_judge_score(
test_case['input'],
test_case['expected_output'],
output
)
results[model_name]['scores'].append(score['overall'])
except Exception as e:
results[model_name]['errors'] += 1
results[model_name]['scores'].append(0)
# Summarize
summary = {}
for name, data in results.items():
scores = data['scores']
summary[name] = {
'mean_score': sum(scores) / len(scores),
'errors': data['errors']
}
print(f'{name}: mean={summary[name]["mean_score"]:.2f}, errors={data["errors"]}')
return summary치명적 망각을 위한 회귀 테스트
미세 조정은 모델의 일반적인 능력을 저하시킬 수 있으며, 이를 치명적 망각이라고 합니다. 대상 작업 외에 관심을 두는 작업을 포함하여 기본 모델과 미세 조정 모델 모두에서 회귀 테스트 모음을 실행하세요. 여기에는 일반 질의응답, 추론, 코드 생성, 명령 수행이 포함됩니다. 미세 조정 모델이 이러한 작업에서 크게 낮은 점수를 받는다면 LoRA 랭크가 너무 높거나 훈련한 에포크 수가 너무 많을 수 있습니다.
REGRESSION_TEST_CASES = [
# General QA
{'input': 'What is the capital of France?', 'expected_substring': 'Paris'},
{'input': 'What is 17 * 23?', 'expected_substring': '391'},
# Instruction following
{'input': 'List 3 planets. Format as: 1. Planet Name', 'expected_pattern': r'^1\. '},
# Reasoning
{'input': 'If all A are B and all B are C, are all A also C?', 'expected_substring': 'yes'},
]
def run_regression_tests(model_fn, test_cases: list) -> float:
passed = 0
for test in test_cases:
output = model_fn(test['input'], '')
if 'expected_substring' in test:
if test['expected_substring'].lower() in output.lower():
passed += 1
elif 'expected_pattern' in test:
import re
if re.search(test['expected_pattern'], output):
passed += 1
rate = passed / len(test_cases)
print(f'Regression test pass rate: {rate:.1%} ({passed}/{len(test_cases)})')
return rate로컬 추론을 위한 GGUF 변환
값비싼 GPU 인프라 없이 로컬에 배포하려면 병합한 모델을 GGUF 형식으로 변환하고 llama.cpp로 추론을 실행하세요. GGUF는 다양한 양자화 수준을 지원합니다. Q4_K_M(4비트, 품질과 속도의 균형이 좋음), Q8_0(8비트, 전체 정밀도에 가까운 품질), Q2_K(2비트, 매우 빠르지만 품질이 낮음) 등이 있습니다. Q4로 양자화한 7B 모델은 약 4GB의 RAM만 필요하며 CPU에서 초당 1~5토큰의 속도로 실행할 수 있습니다.
# Step 1: Convert merged HuggingFace model to GGUF
# git clone https://github.com/ggerganov/llama.cpp
# python llama.cpp/convert_hf_to_gguf.py ./merged-model --outtype f16 --outfile model-f16.gguf
# Step 2: Quantize to 4-bit
# ./llama.cpp/llama-quantize model-f16.gguf model-q4.gguf Q4_K_M
# Step 3: Run inference with llama.cpp Python bindings
# pip install llama-cpp-python
from llama_cpp import Llama
llm = Llama(
model_path='./model-q4.gguf',
n_ctx=4096, # context window
n_threads=8, # CPU threads
n_gpu_layers=0 # set > 0 to offload layers to GPU
)
output = llm.create_chat_completion(
messages=[{'role': 'user', 'content': 'What is the capital of France?'}],
temperature=0.1
)
print(output['choices'][0]['message']['content'])프로덕션을 위한 vLLM 서빙
미세 조정 모델을 대규모로 프로덕션에서 제공하려면 현재 표준은 vLLM입니다. vLLM은 PagedAttention을 사용해 여러 요청을 효율적으로 함께 배치하여 GPU 처리량을 크게 높입니다. OpenAI 호환 API 엔드포인트를 지원하므로 OpenAI API를 그대로 대체해 사용할 수 있습니다. 미세 조정한 7B 모델을 vLLM으로 실행하는 A100 GPU 한 대는 분당 수백 건의 요청을 처리할 수 있습니다.
# Start vLLM server (run from command line)
# pip install vllm
# python -m vllm.entrypoints.openai.api_server \
# --model ./merged-model \
# --host 0.0.0.0 \
# --port 8000 \
# --max-model-len 4096 \
# --tensor-parallel-size 1
# Use with OpenAI client (drop-in replacement)
from openai import OpenAI
client = OpenAI(
base_url='http://localhost:8000/v1',
api_key='not-needed' # vLLM doesn't require auth by default
)
response = client.chat.completions.create(
model='merged-model', # model name matches the path you passed to vLLM
messages=[{'role': 'user', 'content': 'Extract JSON from: "Alice, 30, NYC"'}]
)
print(response.choices[0].message.content)미세 조정 모델 A/B 테스트
프로덕션에서 미세 조정 모델로 완전히 전환하기 전에 A/B 테스트를 실행하세요. 프로덕션 트래픽의 일부(처음에는 5~10%)를 미세 조정 모델로 라우팅하고, 나머지는 기본 모델 또는 기존 프롬프트 방식을 계속 사용하게 하세요. 두 그룹의 품질 점수, 지연 시간, 사용자 만족도 지표를 모니터링하세요. 통계적으로 유의미한 요청 수를 확보한 뒤 A/B 테스트에서 개선이 확인된 경우에만 미세 조정 모델의 트래픽 비율을 높이세요.
import random
class ModelRouter:
def __init__(self, fine_tuned_traffic_fraction=0.1):
self.ft_fraction = fine_tuned_traffic_fraction
self.metrics = {'base': {'count': 0, 'quality_sum': 0}, 'fine_tuned': {'count': 0, 'quality_sum': 0}}
def route(self, user_id: str, request: str) -> dict:
# Deterministic routing by user_id (same user always goes to same model)
use_fine_tuned = (hash(user_id) % 100) < (self.ft_fraction * 100)
model_group = 'fine_tuned' if use_fine_tuned else 'base'
response = call_model(request, use_fine_tuned=use_fine_tuned)
return {'response': response, 'model_group': model_group}
def record_quality(self, model_group: str, quality_score: float):
self.metrics[model_group]['count'] += 1
self.metrics[model_group]['quality_sum'] += quality_score
def ab_test_summary(self) -> dict:
summary = {}
for group, data in self.metrics.items():
avg = data['quality_sum'] / data['count'] if data['count'] > 0 else 0
summary[group] = {'avg_quality': avg, 'n': data['count']}
return summary시간이 지나도 미세 조정 모델 유지 관리
미세 조정 모델은 지속적인 유지 관리가 필요합니다. 기본 모델이 업데이트되면(새로운 GPT-4o 버전, 새로운 Mistral 릴리스 등) 어댑터 가중치가 호환되지 않을 수 있으므로 다시 훈련해야 할 수 있습니다. 작업 요구 사항이 변경되면 훈련 데이터를 업데이트하고 다시 훈련해야 합니다. 프로덕션에서 새로운 실패 유형을 발견하면 훈련 세트에 예시를 추가하세요. 프로덕션 ML 운영 작업 흐름의 일부로 주기적인 재훈련을 계획하세요.
배포 결정 매트릭스
미세 조정한 모델의 배포 전략은 규모와 인프라 제약에 따라 달라집니다. 낮은 처리량(하루 1,000건 미만)에는 OpenAI의 미세 조정 API가 가장 간단합니다. 중간 처리량(하루 1,000~100,000건)에는 단일 GPU 인스턴스에서 vLLM을 사용하는 방안을 고려해 보십시오. 높은 처리량이 필요하거나 지연 시간에 민감한 애플리케이션에는 여러 GPU를 사용하는 vLLM을 활용하고, 텐서 병렬화를 고려하며, 앞단에 캐싱 계층을 추가하십시오. 개인 정보 보호가 중요한 데이터라면 GGUF/llama.cpp 또는 vLLM을 사용해 자체 인프라에서 호스팅하십시오.
빠른 확인
이 레슨에서 배운 미세 조정 모델의 평가와 배포에 대한 이해도를 확인해 보십시오.
레슨 요약
이 레슨에서는 다음을 배웠습니다. 엄격한 배포 전 평가에서는 별도로 확보한 테스트 사례를 사용해 미세 조정 모델과 기본 모델을 비교해야 하며, 이는 반드시 수행해야 합니다. 회귀 테스트는 과도한 전문화로 인해 일반적인 기능을 심각하게 잊는 현상을 감지합니다. 배포 방법은 간편한 OpenAI의 관리형 미세 조정 API부터 높은 처리량의 프로덕션 서비스에 적합한 vLLM, CPU 기반 로컬 추론에 적합한 GGUF/llama.cpp까지 다양합니다. AI 엔지니어링 트랙을 완료하신 것을 축하합니다!
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“미세 조정 모델 평가 및 배포” 강의는 무료인가요?
네 — “미세 조정 모델 평가 및 배포” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Engineering Academy 강의 전체를 잠금 해제할 수 있습니다. AI Engineering Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“미세 조정 모델 평가 및 배포”에서 뭘 배우나요?
분리해 둔 테스트 사례에서 기본 모델과 미세 조정 모델을 비교하는 정량 평가를 실행하고, 로컬 추론을 위해 GGUF로 변환한 뒤 llama.cpp 또는 vLLM으로 제공하는 방법을 학습합니다. 브라우저에서 직접 실행하는 실습 코드로 AI Engineering Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Engineering Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Engineering Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“미세 조정 모델 평가 및 배포” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Engineering Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Engineering Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 프롬프트보다 미세 조정이 뛰어난 경우
- 고품질 학습 데이터셋 준비
- Hugging Face PEFT로 LoRA 미세 조정
- 미세 조정 모델 평가 및 배포