แนวคิด Q-Table
การเรียนรู้แบบเสริมกำลังด้วยตาราง
แนวคิด Q-Table เป็นบทเรียน Learn AI with Python ฟรีบน CoddyKit นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Learn AI with Python และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน
ตาราง Q คืออะไร
แนวคิดตาราง Q
ตาราง Q เป็นแนวคิดหลักในการเรียนรู้แบบเสริมกำลัง ตารางนี้เป็นตารางค้นหาที่แต่ละรายการแสดงรางวัลที่คาดว่าจะได้รับจากการเลือกการกระทำหนึ่ง ๆ ในสถานะที่กำหนด
เป้าหมายคือการเรียนรู้ค่า Q ซึ่งช่วยชี้นำให้ตัวแทนเลือกการกระทำที่ดีที่สุดเพื่อให้ได้รับรางวัลสูงสุด

โครงสร้างของตาราง Q
โครงสร้างของตาราง Q
ตาราง Q มีโครงสร้างดังนี้
- แถว: แทนสถานะของสภาพแวดล้อม
- คอลัมน์: แทนการกระทำที่ตัวแทนสามารถดำเนินการได้
- ค่า: แทนค่า Q สำหรับคู่สถานะ-การกระทำ
ตัวแทนจะปรับปรุงค่าเหล่านี้ระหว่างการเรียนรู้
สูตรปรับปรุงค่า Q
สูตรปรับปรุงค่า Q
ค่า Q ได้รับการปรับปรุงโดยใช้สมการเบลล์แมน
Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]
โดยที่
- s: สถานะปัจจุบัน
- a: การกระทำปัจจุบัน
- r: รางวัลสำหรับการกระทำ
- s': สถานะถัดไป
- α: อัตราการเรียนรู้
- γ: ปัจจัยลดค่า
ตัวอย่างตาราง Q อย่างง่าย
ตัวอย่างตาราง Q อย่างง่าย
พิจารณาตาราง Q สำหรับโลกแบบตาราง
สถานะ: ตำแหน่งบนตาราง เช่น A1, B1
การกระทำ: เคลื่อนที่ขึ้น ลง ซ้าย ขวา
ในเบื้องต้น ค่า Q ทั้งหมดถูกกำหนดเป็นศูนย์
| สถานะ | ขึ้น | ลง | ซ้าย | ขวา |
|---|---|---|---|---|
| A1 | 0 | 0 | 0 | 0 |
| B1 | 0 | 0 | 0 | 0 |
การเริ่มต้นตาราง Q ในไพทอน
การเริ่มต้นตาราง Q ในไพทอน
เราสามารถแทนตาราง Q โดยใช้อาร์เรย์ของ NumPy หรือพจนานุกรมได้
import numpy as np
# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))
print("Initial Q-Table:")
print(q_table)การสำรวจในการเรียนรู้แบบ Q
การสำรวจในการเรียนรู้แบบ Q
ตัวแทนใช้นโยบายที่เลือกค่าดีที่สุดโดยมีความสุ่ม ε เพื่อสร้างสมดุลระหว่างการสำรวจและการใช้ประโยชน์
- ด้วยความน่าจะเป็น ε ให้เลือกการกระทำแบบสุ่ม (การสำรวจ)
- ด้วยความน่าจะเป็น 1-ε ให้เลือกการกระทำที่มีค่า Q สูงสุด (การใช้ประโยชน์)
ข้อดีของตาราง Q
ข้อดีของตาราง Q
ตาราง Q เรียบง่ายและมีประสิทธิภาพสำหรับสภาพแวดล้อมขนาดเล็ก ข้อดีของตาราง Q ได้แก่
- นำไปใช้และแก้จุดบกพร่องได้ง่าย
- ตีความความสัมพันธ์ระหว่างสถานะกับการกระทำได้อย่างชัดเจน
- ใช้ทรัพยากรในการคำนวณต่ำสำหรับปริภูมิสถานะ-การกระทำขนาดเล็ก
ข้อจำกัดของตาราง Q
ข้อจำกัดของตาราง Q
ตาราง Q มีข้อจำกัดบางประการ
- ไม่สามารถขยายรองรับสภาพแวดล้อมที่มีปริภูมิสถานะ-การกระทำขนาดใหญ่ได้
- ต้องใช้หน่วยความจำจำนวนมากสำหรับปัญหาที่มีหลายมิติ
- ไม่สามารถนำความรู้ทั่วไปไปใช้กับสถานะที่คล้ายกันได้
สรุปและขั้นตอนถัดไป
สรุปและขั้นตอนถัดไป
ในบทเรียนนี้ เราได้
- เรียนรู้แนวคิดและโครงสร้างของตาราง Q
- สำรวจวิธีปรับปรุงค่า Q โดยใช้สมการเบลล์แมน
- พูดคุยเกี่ยวกับข้อดีและข้อจำกัดของตาราง Q
ถัดไป เราจะนำอัลกอริทึมการเรียนรู้แบบ Q อย่างง่ายไปใช้ในไพทอน เพื่อดูการทำงานของตาราง Q

คำถามที่พบบ่อย
บทเรียน “แนวคิด Q-Table” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “แนวคิด Q-Table” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Learn AI with Python ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “แนวคิด Q-Table”
การเรียนรู้แบบเสริมกำลังด้วยตาราง คุณปฏิบัติ Learn AI with Python ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Learn AI with Python หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน Learn AI with Python บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 2 จากทั้งหมด 5 บทเรียน
บทเรียน “แนวคิด Q-Table” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน Learn AI with Python นี้ได้ไหม
ได้ บทเรียน Learn AI with Python ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- แนวคิดพื้นฐานของการเรียนรู้แบบเสริมกำลัง
- แนวคิด Q-Table
- การใช้งานตาราง Q ในไพทอน
- การเรียนรู้แบบ Q เชิงลึก
- สำรวจ OpenAI Gym