비용 효율적인 튜닝을 위한 LoRA와 QLoRA
양자화된 기반 모델에는 저랭크 어댑터만 학습시킵니다 — 단일 GPU에서 70B 미세 조정을 수행할 수 있습니다.
비용 효율적인 튜닝을 위한 LoRA와 QLoRA은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 3번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.
PEFT를 사용하는 이유
Llama 70B를 전체 미세 조정하려면 H100이 8개 이상 필요하며 700억 개의 매개변수를 업데이트해야 합니다. PEFT(매개변수 효율적 미세 조정)는 비슷한 품질을 유지하면서 매개변수의 < 1%만 업데이트합니다. 비용을 크게 절약할 수 있습니다.
LoRA: 저랭크 적응
LoRA(Hu et al. 2021)는 동결된 기본 가중치와 함께 작은 "어댑터" 행렬을 학습합니다:
- A가 dxr이고 B가 rxd이며 r이 작은 값(8, 16, 64)인 A x B 행렬을 추가합니다
- 순전파: y = Wx + (BA)x
- A와 B만 학습하므로 매개변수가 몇 자릿수나 줄어듭니다
QLoRA: 양자화된 LoRA
QLoRA(Dettmers et al. 2023)는 학습 중 기본 모델을 4비트로 양자화하여 비용을 더욱 줄입니다:
- NF4(4비트)의 기본 모델
- 더 높은 정밀도의 LoRA 어댑터
- 단일 A100/H100에서 70B 미세 조정 가능
Setup with peft + transformers
# pip install peft transformers bitsandbytes
from peft import LoraConfig, get_peft_model
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
'meta-llama/Llama-3.1-8B-Instruct',
load_in_4bit=True, # QLoRA
device_map='auto'
)
lora_config = LoraConfig(
r=16, # rank
lora_alpha=32,
target_modules=['q_proj', 'v_proj'],
lora_dropout=0.05,
bias='none'
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters()
# trainable params: ~0.5% of totalTraining Loop with TRL
from trl import SFTTrainer
trainer = SFTTrainer(
model=model,
train_dataset=dataset,
tokenizer=tokenizer,
args=TrainingArguments(
per_device_train_batch_size=4,
gradient_accumulation_steps=4,
learning_rate=2e-4,
num_train_epochs=3,
output_dir='./lora-out'
)
)
trainer.train()
model.save_pretrained('./adapter')Unsloth 사용하기
Unsloth는 가장 빠른 LoRA 라이브러리로, 기본 peft보다 2배 빠릅니다. 그대로 사용할 수 있는 API입니다:
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
model_name='meta-llama/Llama-3.1-8B-Instruct',
load_in_4bit=True
)
model = FastLanguageModel.get_peft_model(
model,
r=16,
target_modules=['q_proj', 'k_proj', 'v_proj', 'o_proj', 'gate_proj', 'up_proj', 'down_proj']
)비용 추정
예시 1만 개를 사용하여 Llama 3.1 8B를 QLoRA로 학습하는 경우:
- 단일 H100에서 약 4시간
- 클라우드 GPU 비용 약 5~10달러
- 어댑터 파일: 100~300MB
랭크 r 선택
- r = 8 — 최소 수준, 형식·스타일 변경
- r = 16~32 — 대부분의 경우
- r = 64 이상 — 상당히 새로운 동작, 더 큰 용량
대상 모듈
기본값으로 어텐션 프로젝션(q, v)을 사용하십시오. 더 큰 용량이 필요하면 모든 선형 레이어를 포함하십시오. 품질은 좋아지지만 매개변수도 늘어납니다.
중요한 하이퍼파라미터
- 학습률 — 일반적으로 1e-4~5e-4
- 에폭 수 — SFT의 경우 2~5
- 배치 크기 — VRAM에 따라 다릅니다. 그래디언트 누적을 사용하여 더 큰 배치처럼 처리하십시오
어댑터를 기본 모델에 병합하기
추론을 위해 LoRA를 기본 가중치에 다시 병합할 수 있습니다:
merged = model.merge_and_unload()
merged.save_pretrained('./full-model')여러 LoRA 제공하기
vLLM은 추론 중 LoRA를 즉시 교체하는 기능을 지원합니다. 공유 기본 모델에서 고객별 미세 조정을 제공할 때 유용합니다:
llm = LLM(model='base', enable_lora=True, max_lora_rank=64)
response = llm.generate(prompt, lora_request=LoRARequest('customer-a', 1, './customer-a-adapter'))어댑터 평가
항상 조정한 모델에서 YOUR 평가 세트를 실행하십시오. 극단적인 사례에서는 조정한 모델의 성능이 더 나빠질 수 있으므로 성능 저하를 솔직하게 확인하십시오.
LoRA의 장점
전체 미세 조정과 비교했을 때 LoRA의 주요 실용적 장점은 무엇입니까?
복습
LoRA + QLoRA는 비용 효율적인 미세 조정을 제공합니다. 속도에는 Unsloth를, 폭넓은 기능에는 peft/TRL을 사용하십시오. 대부분의 경우 랭크 16~32가 적합합니다. 기준 데이터셋과 비교하여 평가하십시오.
AI 튜터와 함께 AI Agents을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 60
- 레슨
- 239
자주 묻는 질문
“비용 효율적인 튜닝을 위한 LoRA와 QLoRA” 강의는 무료인가요?
네 — “비용 효율적인 튜닝을 위한 LoRA와 QLoRA” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“비용 효율적인 튜닝을 위한 LoRA와 QLoRA”에서 뭘 배우나요?
양자화된 기반 모델에는 저랭크 어댑터만 학습시킵니다 — 단일 GPU에서 70B 미세 조정을 수행할 수 있습니다. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 3번째 강의입니다.
“비용 효율적인 튜닝을 위한 LoRA와 QLoRA” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 프롬프트보다 미세 조정이 효과적인 경우
- 데이터 수집: 궤적과 추적 재생
- 비용 효율적인 튜닝을 위한 LoRA와 QLoRA
- 튜닝 모델과 기반 모델 평가