AI एजेंट · पाठ

लागत-कुशल ट्यूनिंग के लिए LoRA और QLoRA

क्वांटाइज़ किए गए आधार पर केवल निम्न-रैंक अडैप्टर प्रशिक्षित कीजिए — इससे एकल GPU पर 70B फ़ाइन-ट्यूनिंग संभव है।

पाठ 3, कुल 4 में से15 चरण

लागत-कुशल ट्यूनिंग के लिए LoRA और QLoRA, CoddyKit पर AI एजेंट का एक निःशुल्क पाठ है। यह 4 में से 3वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह AI एजेंट सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

इस पाठ के कुछ हिस्सों का अभी तक अनुवाद नहीं हुआ है और वे अंग्रेज़ी में दिखाए गए हैं।

PEFT क्यों?

Llama 70B की पूर्ण फ़ाइन-ट्यूनिंग के लिए 8 से अधिक H100 और 70 अरब पैरामीटरों को अपडेट करना पड़ता है। PEFT (Parameter-Efficient Fine-Tuning) समान गुणवत्ता के साथ 1% से कम पैरामीटर अपडेट करता है। इससे लागत में भारी बचत होती है।

LoRA: निम्न-रैंक अनुकूलन

LoRA (Hu et al. 2021) स्थिर बेस वेट के साथ छोटे "एडाप्टर" मैट्रिक्स को प्रशिक्षित करता है:

  • A x B मैट्रिक्स जोड़ें, जहाँ A dxr और B rxd है तथा r छोटा है (8, 16, 64)
  • फ़ॉरवर्ड पास: y = Wx + (BA)x
  • केवल A और B को train करें—पैरामीटरों की संख्या कई गुणा कम होती है

QLoRA: परिमाणित LoRA

QLoRA (Dettmers et al. 2023) प्रशिक्षण के दौरान बेस मॉडल को 4-बिट में परिमाणित करके लागत को और कम करता है:

  • NF4 (4-बिट) में बेस मॉडल
  • उच्च परिशुद्धता में LoRA एडाप्टर
  • एकल A100/H100 पर 70B फ़ाइन-ट्यूनिंग संभव

Setup with peft + transformers

# pip install peft transformers bitsandbytes
from peft import LoraConfig, get_peft_model
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained(
    'meta-llama/Llama-3.1-8B-Instruct',
    load_in_4bit=True,        # QLoRA
    device_map='auto'
)

lora_config = LoraConfig(
    r=16,                     # rank
    lora_alpha=32,
    target_modules=['q_proj', 'v_proj'],
    lora_dropout=0.05,
    bias='none'
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters()
# trainable params: ~0.5% of total

Training Loop with TRL

from trl import SFTTrainer

trainer = SFTTrainer(
    model=model,
    train_dataset=dataset,
    tokenizer=tokenizer,
    args=TrainingArguments(
        per_device_train_batch_size=4,
        gradient_accumulation_steps=4,
        learning_rate=2e-4,
        num_train_epochs=3,
        output_dir='./lora-out'
    )
)
trainer.train()
model.save_pretrained('./adapter')

Unsloth का उपयोग करना

Unsloth सबसे तेज़ LoRA लाइब्रेरी है—साधारण peft से 2 गुना तेज़। सीधे उपयोग योग्य API:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name='meta-llama/Llama-3.1-8B-Instruct',
    load_in_4bit=True
)
model = FastLanguageModel.get_peft_model(
    model,
    r=16,
    target_modules=['q_proj', 'k_proj', 'v_proj', 'o_proj', 'gate_proj', 'up_proj', 'down_proj']
)

लागत अनुमान

10k उदाहरणों के साथ Llama 3.1 8B पर QLoRA:

  • एकल H100 पर लगभग 4 घंटे
  • क्लाउड GPU की लगभग $5-10 लागत
  • एडाप्टर फ़ाइल: 100-300 MB

रैंक r चुनना

  • r = 8 — न्यूनतम, प्रारूप/शैली में बदलाव
  • r = 16-32 — अधिकांश मामलों के लिए
  • r = 64+ — पर्याप्त नए व्यवहार के लिए अधिक क्षमता

लक्षित मॉड्यूल

डिफ़ॉल्ट रूप से अटेंशन प्रोजेक्शन (q, v) चुनें। अधिक क्षमता के लिए सभी रैखिक परतें शामिल करें—गुणवत्ता बेहतर होगी, लेकिन पैरामीटर अधिक होंगे।

महत्वपूर्ण हाइपरपैरामीटर

  • लर्निंग रेट — 1e-4 से 5e-4 सामान्य है
  • एपोक — SFT के लिए 2-5
  • बैच आकार — VRAM पर निर्भर करता है; बड़ा आकार दिखाने के लिए ग्रेडिएंट संचय का उपयोग करें

एडाप्टर को बेस में मिलाना

अनुमान के लिए आप LoRA को वापस बेस वेट में मिला सकते हैं:

merged = model.merge_and_unload()
merged.save_pretrained('./full-model')

कई LoRAs उपलब्ध कराना

vLLM अनुमान के समय LoRAs को तुरंत बदलने का समर्थन करता है। साझा बेस पर प्रति-ग्राहक फ़ाइन-ट्यूनिंग के लिए यह उपयोगी है:

llm = LLM(model='base', enable_lora=True, max_lora_rank=64)
response = llm.generate(prompt, lora_request=LoRARequest('customer-a', 1, './customer-a-adapter'))

एडाप्टर का मूल्यांकन

ट्यून किए गए मॉडल पर हमेशा YOUR मूल्यांकन सेट चलाएँ। कभी-कभी सीमांत मामलों में ट्यून किया गया मॉडल खराब होता है—प्रतिगमन के बारे में ईमानदार रहें।

LoRA का लाभ

पूर्ण फ़ाइन-ट्यूनिंग की तुलना में LoRA का मुख्य व्यावहारिक लाभ क्या है?

पुनरावलोकन

LoRA + QLoRA = लागत-कुशल फ़ाइन-ट्यूनिंग। गति के लिए Unsloth और व्यापक सुविधाओं के लिए peft/TRL का उपयोग करें। अधिकांश मामलों में रैंक 16-32 रखें। अपने स्वर्णिम सेट के विरुद्ध मूल्यांकन करें।

शुरुआत निःशुल्क

एआई शिक्षक के साथ AI एजेंट सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
60
पाठ
239

अक्सर पूछे जाने वाले प्रश्न

क्या “लागत-कुशल ट्यूनिंग के लिए LoRA और QLoRA” पाठ निःशुल्क है?

हाँ—“लागत-कुशल ट्यूनिंग के लिए LoRA और QLoRA” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और AI एजेंट पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। AI एजेंट पाठ्यक्रम में कुल 4 पाठ शामिल हैं।

“लागत-कुशल ट्यूनिंग के लिए LoRA और QLoRA” में मैं क्या सीखूँगा?

क्वांटाइज़ किए गए आधार पर केवल निम्न-रैंक अडैप्टर प्रशिक्षित कीजिए — इससे एकल GPU पर 70B फ़ाइन-ट्यूनिंग संभव है। आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ AI एजेंट का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या AI एजेंट शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर AI एजेंट शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 4 में से 3वाँ पाठ है।

“लागत-कुशल ट्यूनिंग के लिए LoRA और QLoRA” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस AI एजेंट पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर AI एजेंट पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. प्रॉम्प्टिंग से फ़ाइन-ट्यूनिंग कब बेहतर है
  2. डेटा संग्रह: ट्रैजेक्टरी और ट्रेस रीप्ले
  3. लागत-कुशल ट्यूनिंग के लिए LoRA और QLoRA
  4. ट्यून किए गए मॉडल बनाम आधार मॉडल का मूल्यांकन
← AI एजेंट पर वापस जाएँ