การฝึก LLM
เรียนรู้ขั้นตอนการฝึก LLM ได้แก่ การฝึกเบื้องต้นด้วยคลังข้อมูลขนาดมหาศาล การปรับแต่งด้วยข้อมูลกำกับ และ RLHF พร้อมทำความเข้าใจว่าแต่ละขั้นตอนสำคัญต่อพฤติกรรมของโมเดลอย่างไร
การฝึก LLM เป็นบทเรียน AI Engineering Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Engineering Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Engineering Academy มีบทเรียนทั้งหมด 4 บทเรียน
สามระยะของการฝึก LLM
LLM ถูกสร้างขึ้นในสามระยะ ได้แก่ การฝึกล่วงหน้า ซึ่งสอนภาษาและความรู้ การปรับแต่ง ซึ่งสอนให้ทำตามคำสั่ง และ RLHF ซึ่งปรับแบบจำลองให้สอดคล้องกับสิ่งที่ผู้คนต้องการ
การฝึกล่วงหน้า: การทำนายโทเค็นถัดไปในระดับใหญ่
การฝึกล่วงหน้า ป้อนข้อความจำนวนมหาศาลให้แบบจำลอง โดยมีงานเดียวคือทำนายโทเค็นถัดไป เป้าหมายที่เรียบง่ายนี้เพียงพอที่จะสอนไวยากรณ์ ข้อเท็จจริง และการให้เหตุผลไปพร้อมกัน
คุณภาพและการคัดสรรข้อมูลฝึก
ข้อความจากอินเทอร์เน็ตดิบมักไม่เป็นระเบียบ ทีมงานทำความสะอาดข้อมูลด้วย กระบวนการข้อมูล ที่กรองข้อมูล ลบข้อมูลซ้ำ และให้คะแนนคุณภาพ หลักง่าย ๆ คือ ข้อมูลที่ดีย่อมสำคัญกว่าแบบจำลองที่ใหญ่กว่า
ฟังก์ชันความสูญเสียและการปรับให้เหมาะสม
การฝึกจะลด ความสูญเสียแบบเอนโทรปีไขว้ ซึ่งวัดว่าการเดาของแบบจำลองห่างจากโทเค็นถัดไปที่ถูกต้องเพียงใด จากนั้นจะปรับน้ำหนักเล็กน้อยซ้ำ ๆ หลายพันล้านครั้ง โค้ดแสดงสมการทางคณิตศาสตร์
# Illustrative cross-entropy loss for a single token prediction
import math
vocab_size = 50000
correct_token_index = 4217 # index for the word 'Paris'
# Model output probabilities (softmax of logits)
model_probs = [0.00002] * vocab_size # simplified uniform base
model_probs[correct_token_index] = 0.70 # model is 70% confident in 'Paris'
loss = -math.log(model_probs[correct_token_index])
print(f'Cross-entropy loss: {loss:.4f}') # ~0.3567ความสามารถที่เกิดขึ้นใหม่จากการขยายขนาด
เมื่อขยายขนาดมากพอ ความสามารถที่เกิดขึ้นใหม่ ก็ปรากฏขึ้น เช่น การให้เหตุผลทีละขั้น ซึ่งแบบจำลองขนาดเล็กไม่มีเลย ไม่มีใครสอนความสามารถเหล่านี้โดยตรง แต่การขยายขนาดทำให้เกิดขึ้น
การปรับแต่งแบบมีผู้ควบคุมด้วยคู่คำสั่ง
แบบจำลองดิบเพียงสร้างข้อความต่อไป การปรับแต่งแบบมีผู้ควบคุม จะฝึกด้วยคู่ (คำสั่ง, คำตอบที่เหมาะสม) ทำให้แบบจำลองเรียนรู้ที่จะตอบจริง ๆ แทนการพูดวกวนต่อไป
# Illustrative SFT data format
training_example = {
'messages': [
{'role': 'system', 'content': 'You are a helpful assistant.'},
{'role': 'user', 'content': 'What is the capital of France?'},
{'role': 'assistant', 'content': 'The capital of France is Paris.'}
]
}
# During SFT, loss is computed only on the assistant turn tokens
# The system and user tokens are provided as context but not trained onระยะที่ 1 ของ RLHF: การฝึกแบบจำลองรางวัล
RLHF เริ่มต้นด้วย แบบจำลองรางวัล ผู้คนเลือกคำตอบที่ดีกว่าจากสองคำตอบ แล้วแบบจำลองรางวัลจะเรียนรู้เพื่อทำนายความชอบเหล่านั้น ทำหน้าที่แทนรสนิยมของมนุษย์
ระยะที่ 2 ของ RLHF: การปรับแต่งด้วย PPO
จากนั้น PPO จะปรับ LLM ให้ได้คะแนนสูงขึ้นจากแบบจำลองรางวัล บทลงโทษ KL ช่วยป้องกันไม่ให้แบบจำลองเปลี่ยนแปลงไปในทางแปลก ๆ หรือหาทางเอาเปรียบรางวัลแทนที่จะช่วยผู้ใช้จริง ๆ
การปรับให้เหมาะสมตามความชอบโดยตรง: RLHF ที่ง่ายกว่า
PPO มีความซับซ้อน ส่วน DPO เป็นทางเลือกที่ง่ายกว่า โดยฝึกแบบจำลองโดยตรงจากคู่คำตอบที่ได้รับความชอบและคำตอบที่ถูกปฏิเสธ ไม่จำเป็นต้องมีแบบจำลองรางวัลแยกต่างหาก
กฎการขยายขนาดของ Chinchilla: การฝึกที่เหมาะสมกับกำลังคำนวณ
ข้อค้นพบของ Chinchilla คือ แบบจำลองรุ่นเก่าฝึกไม่มากพอ สำหรับงบประมาณที่กำหนด ควรขยายข้อมูลและขนาดแบบจำลองไปพร้อมกัน โดยใช้ประมาณ 20 โทเค็นต่อพารามิเตอร์เพื่อให้ได้ผลลัพธ์ที่ดีที่สุด
สิ่งที่แต่ละระยะการฝึกส่งผล
แต่ละระยะควบคุมสิ่งที่แตกต่างกัน การฝึกล่วงหน้า กำหนดสิ่งที่แบบจำลองรู้ การปรับแต่งกำหนดพฤติกรรม และ RLHF กำหนดค่านิยม ข้อมูลนี้จะบอกว่าควรแก้ไขส่วนใด
ตรวจสอบความเข้าใจ
ทดสอบความเข้าใจแนวคิดด้านวิศวกรรม AI จากบทเรียนนี้
สรุปบทเรียน
สรุป: การฝึกล่วงหน้า สร้างความรู้ การปรับแต่งสร้างความสามารถในการทำตามคำสั่ง และ RLHF หรือ DPO ปรับแบบจำลองให้สอดคล้องกับค่านิยมของมนุษย์ ต่อไป: สิ่งที่ LLM ทำได้และทำไม่ได้ 💡
คำถามที่พบบ่อย
บทเรียน “การฝึก LLM” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การฝึก LLM” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Engineering Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Engineering Academy มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การฝึก LLM”
เรียนรู้ขั้นตอนการฝึก LLM ได้แก่ การฝึกเบื้องต้นด้วยคลังข้อมูลขนาดมหาศาล การปรับแต่งด้วยข้อมูลกำกับ และ RLHF พร้อมทำความเข้าใจว่าแต่ละขั้นตอนสำคัญต่อพฤติกรรมของโมเดลอย่างไร คุณปฏิบัติ AI Engineering Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Engineering Academy หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Engineering Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน
บทเรียน “การฝึก LLM” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Engineering Academy นี้ได้ไหม
ได้ บทเรียน AI Engineering Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- จากการเติมข้อความอัตโนมัติสู่ ChatGPT
- ทรานส์ฟอร์เมอร์และกลไกความสนใจในภาษาที่เข้าใจง่าย
- การฝึก LLM
- ความสามารถและข้อจำกัดของ LLM