0Pricing
AI Engineering Academy · บทเรียน

การฝึก LLM

เรียนรู้ขั้นตอนการฝึก LLM ได้แก่ การฝึกเบื้องต้นด้วยคลังข้อมูลขนาดมหาศาล การปรับแต่งด้วยข้อมูลกำกับ และ RLHF พร้อมทำความเข้าใจว่าแต่ละขั้นตอนสำคัญต่อพฤติกรรมของโมเดลอย่างไร

การฝึก LLM เป็นบทเรียน AI Engineering Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Engineering Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Engineering Academy มีบทเรียนทั้งหมด 4 บทเรียน

สามระยะของการฝึก LLM

LLM ถูกสร้างขึ้นในสามระยะ ได้แก่ การฝึกล่วงหน้า ซึ่งสอนภาษาและความรู้ การปรับแต่ง ซึ่งสอนให้ทำตามคำสั่ง และ RLHF ซึ่งปรับแบบจำลองให้สอดคล้องกับสิ่งที่ผู้คนต้องการ

การฝึกล่วงหน้า: การทำนายโทเค็นถัดไปในระดับใหญ่

การฝึกล่วงหน้า ป้อนข้อความจำนวนมหาศาลให้แบบจำลอง โดยมีงานเดียวคือทำนายโทเค็นถัดไป เป้าหมายที่เรียบง่ายนี้เพียงพอที่จะสอนไวยากรณ์ ข้อเท็จจริง และการให้เหตุผลไปพร้อมกัน

คุณภาพและการคัดสรรข้อมูลฝึก

ข้อความจากอินเทอร์เน็ตดิบมักไม่เป็นระเบียบ ทีมงานทำความสะอาดข้อมูลด้วย กระบวนการข้อมูล ที่กรองข้อมูล ลบข้อมูลซ้ำ และให้คะแนนคุณภาพ หลักง่าย ๆ คือ ข้อมูลที่ดีย่อมสำคัญกว่าแบบจำลองที่ใหญ่กว่า

ฟังก์ชันความสูญเสียและการปรับให้เหมาะสม

การฝึกจะลด ความสูญเสียแบบเอนโทรปีไขว้ ซึ่งวัดว่าการเดาของแบบจำลองห่างจากโทเค็นถัดไปที่ถูกต้องเพียงใด จากนั้นจะปรับน้ำหนักเล็กน้อยซ้ำ ๆ หลายพันล้านครั้ง โค้ดแสดงสมการทางคณิตศาสตร์

# Illustrative cross-entropy loss for a single token prediction
import math

vocab_size = 50000
correct_token_index = 4217  # index for the word 'Paris'

# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size  # simplified uniform base
model_probs[correct_token_index] = 0.70  # model is 70% confident in 'Paris'

loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}')  # ~0.3567

ความสามารถที่เกิดขึ้นใหม่จากการขยายขนาด

เมื่อขยายขนาดมากพอ ความสามารถที่เกิดขึ้นใหม่ ก็ปรากฏขึ้น เช่น การให้เหตุผลทีละขั้น ซึ่งแบบจำลองขนาดเล็กไม่มีเลย ไม่มีใครสอนความสามารถเหล่านี้โดยตรง แต่การขยายขนาดทำให้เกิดขึ้น

การปรับแต่งแบบมีผู้ควบคุมด้วยคู่คำสั่ง

แบบจำลองดิบเพียงสร้างข้อความต่อไป การปรับแต่งแบบมีผู้ควบคุม จะฝึกด้วยคู่ (คำสั่ง, คำตอบที่เหมาะสม) ทำให้แบบจำลองเรียนรู้ที่จะตอบจริง ๆ แทนการพูดวกวนต่อไป

# Illustrative SFT data format
training_example = {
    'messages': [
        {'role': 'system', 'content': 'You are a helpful assistant.'},
        {'role': 'user', 'content': 'What is the capital of France?'},
        {'role': 'assistant', 'content': 'The capital of France is Paris.'}
    ]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained on

ระยะที่ 1 ของ RLHF: การฝึกแบบจำลองรางวัล

RLHF เริ่มต้นด้วย แบบจำลองรางวัล ผู้คนเลือกคำตอบที่ดีกว่าจากสองคำตอบ แล้วแบบจำลองรางวัลจะเรียนรู้เพื่อทำนายความชอบเหล่านั้น ทำหน้าที่แทนรสนิยมของมนุษย์

ระยะที่ 2 ของ RLHF: การปรับแต่งด้วย PPO

จากนั้น PPO จะปรับ LLM ให้ได้คะแนนสูงขึ้นจากแบบจำลองรางวัล บทลงโทษ KL ช่วยป้องกันไม่ให้แบบจำลองเปลี่ยนแปลงไปในทางแปลก ๆ หรือหาทางเอาเปรียบรางวัลแทนที่จะช่วยผู้ใช้จริง ๆ

การปรับให้เหมาะสมตามความชอบโดยตรง: RLHF ที่ง่ายกว่า

PPO มีความซับซ้อน ส่วน DPO เป็นทางเลือกที่ง่ายกว่า โดยฝึกแบบจำลองโดยตรงจากคู่คำตอบที่ได้รับความชอบและคำตอบที่ถูกปฏิเสธ ไม่จำเป็นต้องมีแบบจำลองรางวัลแยกต่างหาก

กฎการขยายขนาดของ Chinchilla: การฝึกที่เหมาะสมกับกำลังคำนวณ

ข้อค้นพบของ Chinchilla คือ แบบจำลองรุ่นเก่าฝึกไม่มากพอ สำหรับงบประมาณที่กำหนด ควรขยายข้อมูลและขนาดแบบจำลองไปพร้อมกัน โดยใช้ประมาณ 20 โทเค็นต่อพารามิเตอร์เพื่อให้ได้ผลลัพธ์ที่ดีที่สุด

สิ่งที่แต่ละระยะการฝึกส่งผล

แต่ละระยะควบคุมสิ่งที่แตกต่างกัน การฝึกล่วงหน้า กำหนดสิ่งที่แบบจำลองรู้ การปรับแต่งกำหนดพฤติกรรม และ RLHF กำหนดค่านิยม ข้อมูลนี้จะบอกว่าควรแก้ไขส่วนใด

ตรวจสอบความเข้าใจ

ทดสอบความเข้าใจแนวคิดด้านวิศวกรรม AI จากบทเรียนนี้

สรุปบทเรียน

สรุป: การฝึกล่วงหน้า สร้างความรู้ การปรับแต่งสร้างความสามารถในการทำตามคำสั่ง และ RLHF หรือ DPO ปรับแบบจำลองให้สอดคล้องกับค่านิยมของมนุษย์ ต่อไป: สิ่งที่ LLM ทำได้และทำไม่ได้ 💡

คำถามที่พบบ่อย

บทเรียน “การฝึก LLM” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การฝึก LLM” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Engineering Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Engineering Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การฝึก LLM”

เรียนรู้ขั้นตอนการฝึก LLM ได้แก่ การฝึกเบื้องต้นด้วยคลังข้อมูลขนาดมหาศาล การปรับแต่งด้วยข้อมูลกำกับ และ RLHF พร้อมทำความเข้าใจว่าแต่ละขั้นตอนสำคัญต่อพฤติกรรมของโมเดลอย่างไร คุณปฏิบัติ AI Engineering Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Engineering Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Engineering Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “การฝึก LLM” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Engineering Academy นี้ได้ไหม

ได้ บทเรียน AI Engineering Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. จากการเติมข้อความอัตโนมัติสู่ ChatGPT
  2. ทรานส์ฟอร์เมอร์และกลไกความสนใจในภาษาที่เข้าใจง่าย
  3. การฝึก LLM
  4. ความสามารถและข้อจำกัดของ LLM
← กลับไปที่ AI Engineering Academy