โมเดลโลกและการมองล่วงหน้า
ทำนายผลลัพธ์ของการกระทำก่อนลงมือ แล้วเลือกการกระทำที่มีผลลัพธ์คาดการณ์ดีที่สุด
โมเดลโลกและการมองล่วงหน้า เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ
คาดการณ์ก่อนลงมือทำ
เอเจนต์ที่ดีที่สุดไม่ได้เพียงลองทำสิ่งต่าง ๆ แต่จะคาดการณ์ผลลัพธ์ก่อน เลือกทางเลือกที่ดีที่สุด แล้วจึงลงมือทำ แนวคิดนี้เหมือนกับการค้นหาล่วงหน้าหลายตาในการเล่นหมากรุก
แบบจำลองโลกคืออะไร
แบบจำลองโลกใช้คาดการณ์ว่า เมื่อมีสถานะ current เป็น S และการกระทำเป็น A สถานะถัดไป S' จะเป็นอย่างไร
สำหรับเอเจนต์ที่ใช้ LLM ตัว LLM เองสามารถทำหน้าที่เป็นแบบจำลองโลกได้:
prediction_prompt = '''
Current state: {state}
Proposed action: {action}
What is the most likely outcome? Return JSON: {new_state, success_probability}.
'''เหตุใดการมองล่วงหน้าจึงช่วยได้
การกระทำบางอย่างย้อนกลับไม่ได้ (เช่น การส่งอีเมล การลบข้อมูล) การคาดการณ์ก่อนช่วยหลีกเลี่ยงความผิดพลาดที่มีต้นทุนสูงได้
การกระทำอื่น ๆ ให้ผลลัพธ์ที่ไม่ชัดเจน การคาดการณ์จะบังคับให้เอเจนต์คิดถึงผลที่ตามมา
Simple 1-Step Lookahead
candidates = [a1, a2, a3]
predictions = [predict(state, a) for a in candidates]
best = max(zip(predictions, candidates), key=lambda p: p[0].success_probability)[1]
act(best)การมองล่วงหน้าหลายขั้น (การค้นหาแบบต้นไม้)
ขยายการคาดการณ์ไปข้างหน้าหลายขั้น สำหรับตัวเลือกแต่ละรายการ ให้คาดการณ์ผลลัพธ์ แล้วคาดการณ์ผลลัพธ์ของผลลัพธ์เหล่านั้นต่อไป:
def search(state, depth=2):
if depth == 0:
return value(state)
actions = candidate_actions(state)
best_score = -math.inf
for a in actions:
next_state = predict(state, a)
score = search(next_state, depth - 1)
best_score = max(best_score, score)
return best_scoreต้นไม้แห่งความคิด
Yao และคณะ, 2023 — ขยายการให้เหตุผลเป็นลำดับไปเป็นต้นไม้ เอเจนต์สร้าง "เส้นทางความคิด" หลายเส้น ประเมินแต่ละเส้น แล้วขยายเส้นทางที่มีแนวโน้มดีที่สุด:
import random
def continue_thought(question):
return question + ' -> idea' + str(random.randint(1, 100))
def score(t):
return len(t)
def expand_top_k(thoughts, scores, k):
ranked = sorted(zip(thoughts, scores), key=lambda x: -x[1])
return [t for t, s in ranked[:k]]
def ToT(question):
thoughts = [continue_thought(question) for _ in range(5)]
for depth in range(2):
scores = [score(t) for t in thoughts]
thoughts = expand_top_k(thoughts, scores, k=3)
return thoughts
result = ToT('How to reduce agent latency?')
print('Top thoughts:', result)
การค้นหาต้นไม้แบบมอนติคาร์โล (MCTS)
สำหรับต้นไม้การค้นหาที่มีขนาดใหญ่มาก ให้สุ่มตัวอย่างเส้นทาง ให้คะแนนผลลัพธ์ แล้วส่งต่อคะแนนย้อนกลับขึ้นไปเพื่อช่วยเลือกครั้งต่อ ๆ ไป วิธีนี้ถูกใช้อย่างมากในปัญญาประดิษฐ์สำหรับการเล่นเกม และเริ่มมีการใช้ในการวิจัยเอเจนต์มากขึ้น
ต้นทุนของการมองล่วงหน้า
การกระทำที่คาดการณ์แต่ละครั้งคือการเรียกใช้ LLM หนึ่งครั้ง การมองล่วงหน้าด้วยความลึก=2 และจำนวนแขนง=3 ต้องใช้ 9 ครั้ง เพียงเพื่อตัดสินใจเลือกการกระทำ ONE อย่าง ใช้การมองล่วงหน้าเฉพาะกับการตัดสินใจที่มีความเสี่ยงสูง
การตัดแขนงด้วยหลักเกณฑ์
ข้ามการคาดการณ์สำหรับการกระทำที่เห็นได้ชัดว่าไม่ดี กรองการกระทำที่เป็นตัวเลือกเบื้องต้นด้วยตัวจำแนกราคาถูกหรือกฎ
ปรับเทียบการคาดการณ์
การคาดการณ์ของ LLM ไม่สมบูรณ์แบบ ควรปรับเทียบด้วยการเปรียบเทียบผลลัพธ์ที่คาดการณ์กับผลลัพธ์จริงเป็นครั้งคราว:
for trace in recent_traces:
predicted = trace.predicted_outcome
actual = trace.actual_outcome
log.info('prediction-accuracy', match=(predicted == actual))เมื่อ NOT ควรใช้การมองล่วงหน้า
- การกระทำที่มีต้นทุนต่ำและย้อนกลับได้ — ให้ลองทำเลย
- เส้นทางที่ไวต่อเวลาแฝง
- งานที่ผลลัพธ์เห็นได้ชัดเจน
เมื่อ TO ควรใช้การมองล่วงหน้า
- การกระทำที่ย้อนกลับไม่ได้ (ด้านการเงิน การสื่อสาร)
- แผนหลายขั้นที่ความผิดพลาดสะสมต่อเนื่อง
- สาขาที่มีความเสี่ยงสูง (การแพทย์ กฎหมาย)
- งานที่มีฝ่ายตรงข้าม (เกม การโต้วาที)
การมองล่วงหน้าภายในแบบ o1
โมเดลให้เหตุผล OpenAI o1 / o3 จะมองล่วงหน้าภายในโดยอัตโนมัติระหว่างช่วง "คิด" โมเดลจะสำรวจความต่อเนื่องที่เป็นไปได้หลายแบบก่อนตัดสินใจ คุณไม่จำเป็นต้องนำความสามารถนี้ไปสร้างภายนอก
ข้อแลกเปลี่ยนของการมองล่วงหน้า
ต้นทุนหลักของการมองล่วงหน้าหลายขั้นคืออะไร
ทบทวน
คาดการณ์ก่อนลงมือทำ การมองล่วงหน้า 1 ขั้นมีต้นทุนต่ำและมีประโยชน์ ส่วนการค้นหาแบบต้นไม้มีต้นทุนสูงแต่ทรงพลัง โมเดลให้เหตุผลอย่าง o1 และ o3 ทำสิ่งนี้โดยอัตโนมัติ ควรใช้อย่างพอเหมาะ
คำถามที่พบบ่อย
บทเรียน “โมเดลโลกและการมองล่วงหน้า” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “โมเดลโลกและการมองล่วงหน้า” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “โมเดลโลกและการมองล่วงหน้า”
ทำนายผลลัพธ์ของการกระทำก่อนลงมือ แล้วเลือกการกระทำที่มีผลลัพธ์คาดการณ์ดีที่สุด คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน
บทเรียน “โมเดลโลกและการมองล่วงหน้า” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การแบ่งงานแบบลำดับชั้น
- กองเป้าหมายและการย้อนกลับ
- โมเดลโลกและการมองล่วงหน้า
- วงจรการไตร่ตรองและวิจารณ์ตนเอง