0Pricing
AI Agents · บทเรียน

โมเดลโลกและการมองล่วงหน้า

ทำนายผลลัพธ์ของการกระทำก่อนลงมือ แล้วเลือกการกระทำที่มีผลลัพธ์คาดการณ์ดีที่สุด

โมเดลโลกและการมองล่วงหน้า เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

คาดการณ์ก่อนลงมือทำ

เอเจนต์ที่ดีที่สุดไม่ได้เพียงลองทำสิ่งต่าง ๆ แต่จะคาดการณ์ผลลัพธ์ก่อน เลือกทางเลือกที่ดีที่สุด แล้วจึงลงมือทำ แนวคิดนี้เหมือนกับการค้นหาล่วงหน้าหลายตาในการเล่นหมากรุก

แบบจำลองโลกคืออะไร

แบบจำลองโลกใช้คาดการณ์ว่า เมื่อมีสถานะ current เป็น S และการกระทำเป็น A สถานะถัดไป S' จะเป็นอย่างไร

สำหรับเอเจนต์ที่ใช้ LLM ตัว LLM เองสามารถทำหน้าที่เป็นแบบจำลองโลกได้:

prediction_prompt = '''
Current state: {state}
Proposed action: {action}
What is the most likely outcome? Return JSON: {new_state, success_probability}.
'''

เหตุใดการมองล่วงหน้าจึงช่วยได้

การกระทำบางอย่างย้อนกลับไม่ได้ (เช่น การส่งอีเมล การลบข้อมูล) การคาดการณ์ก่อนช่วยหลีกเลี่ยงความผิดพลาดที่มีต้นทุนสูงได้

การกระทำอื่น ๆ ให้ผลลัพธ์ที่ไม่ชัดเจน การคาดการณ์จะบังคับให้เอเจนต์คิดถึงผลที่ตามมา

Simple 1-Step Lookahead

candidates = [a1, a2, a3]
predictions = [predict(state, a) for a in candidates]
best = max(zip(predictions, candidates), key=lambda p: p[0].success_probability)[1]
act(best)

การมองล่วงหน้าหลายขั้น (การค้นหาแบบต้นไม้)

ขยายการคาดการณ์ไปข้างหน้าหลายขั้น สำหรับตัวเลือกแต่ละรายการ ให้คาดการณ์ผลลัพธ์ แล้วคาดการณ์ผลลัพธ์ของผลลัพธ์เหล่านั้นต่อไป:

def search(state, depth=2):
    if depth == 0:
        return value(state)
    actions = candidate_actions(state)
    best_score = -math.inf
    for a in actions:
        next_state = predict(state, a)
        score = search(next_state, depth - 1)
        best_score = max(best_score, score)
    return best_score

ต้นไม้แห่งความคิด

Yao และคณะ, 2023 — ขยายการให้เหตุผลเป็นลำดับไปเป็นต้นไม้ เอเจนต์สร้าง "เส้นทางความคิด" หลายเส้น ประเมินแต่ละเส้น แล้วขยายเส้นทางที่มีแนวโน้มดีที่สุด:

import random

def continue_thought(question):
    return question + ' -> idea' + str(random.randint(1, 100))

def score(t):
    return len(t)

def expand_top_k(thoughts, scores, k):
    ranked = sorted(zip(thoughts, scores), key=lambda x: -x[1])
    return [t for t, s in ranked[:k]]

def ToT(question):
    thoughts = [continue_thought(question) for _ in range(5)]
    for depth in range(2):
        scores = [score(t) for t in thoughts]
        thoughts = expand_top_k(thoughts, scores, k=3)
    return thoughts

result = ToT('How to reduce agent latency?')
print('Top thoughts:', result)

การค้นหาต้นไม้แบบมอนติคาร์โล (MCTS)

สำหรับต้นไม้การค้นหาที่มีขนาดใหญ่มาก ให้สุ่มตัวอย่างเส้นทาง ให้คะแนนผลลัพธ์ แล้วส่งต่อคะแนนย้อนกลับขึ้นไปเพื่อช่วยเลือกครั้งต่อ ๆ ไป วิธีนี้ถูกใช้อย่างมากในปัญญาประดิษฐ์สำหรับการเล่นเกม และเริ่มมีการใช้ในการวิจัยเอเจนต์มากขึ้น

ต้นทุนของการมองล่วงหน้า

การกระทำที่คาดการณ์แต่ละครั้งคือการเรียกใช้ LLM หนึ่งครั้ง การมองล่วงหน้าด้วยความลึก=2 และจำนวนแขนง=3 ต้องใช้ 9 ครั้ง เพียงเพื่อตัดสินใจเลือกการกระทำ ONE อย่าง ใช้การมองล่วงหน้าเฉพาะกับการตัดสินใจที่มีความเสี่ยงสูง

การตัดแขนงด้วยหลักเกณฑ์

ข้ามการคาดการณ์สำหรับการกระทำที่เห็นได้ชัดว่าไม่ดี กรองการกระทำที่เป็นตัวเลือกเบื้องต้นด้วยตัวจำแนกราคาถูกหรือกฎ

ปรับเทียบการคาดการณ์

การคาดการณ์ของ LLM ไม่สมบูรณ์แบบ ควรปรับเทียบด้วยการเปรียบเทียบผลลัพธ์ที่คาดการณ์กับผลลัพธ์จริงเป็นครั้งคราว:

for trace in recent_traces:
    predicted = trace.predicted_outcome
    actual = trace.actual_outcome
    log.info('prediction-accuracy', match=(predicted == actual))

เมื่อ NOT ควรใช้การมองล่วงหน้า

  • การกระทำที่มีต้นทุนต่ำและย้อนกลับได้ — ให้ลองทำเลย
  • เส้นทางที่ไวต่อเวลาแฝง
  • งานที่ผลลัพธ์เห็นได้ชัดเจน

เมื่อ TO ควรใช้การมองล่วงหน้า

  • การกระทำที่ย้อนกลับไม่ได้ (ด้านการเงิน การสื่อสาร)
  • แผนหลายขั้นที่ความผิดพลาดสะสมต่อเนื่อง
  • สาขาที่มีความเสี่ยงสูง (การแพทย์ กฎหมาย)
  • งานที่มีฝ่ายตรงข้าม (เกม การโต้วาที)

การมองล่วงหน้าภายในแบบ o1

โมเดลให้เหตุผล OpenAI o1 / o3 จะมองล่วงหน้าภายในโดยอัตโนมัติระหว่างช่วง "คิด" โมเดลจะสำรวจความต่อเนื่องที่เป็นไปได้หลายแบบก่อนตัดสินใจ คุณไม่จำเป็นต้องนำความสามารถนี้ไปสร้างภายนอก

ข้อแลกเปลี่ยนของการมองล่วงหน้า

ต้นทุนหลักของการมองล่วงหน้าหลายขั้นคืออะไร

ทบทวน

คาดการณ์ก่อนลงมือทำ การมองล่วงหน้า 1 ขั้นมีต้นทุนต่ำและมีประโยชน์ ส่วนการค้นหาแบบต้นไม้มีต้นทุนสูงแต่ทรงพลัง โมเดลให้เหตุผลอย่าง o1 และ o3 ทำสิ่งนี้โดยอัตโนมัติ ควรใช้อย่างพอเหมาะ

คำถามที่พบบ่อย

บทเรียน “โมเดลโลกและการมองล่วงหน้า” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “โมเดลโลกและการมองล่วงหน้า” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “โมเดลโลกและการมองล่วงหน้า”

ทำนายผลลัพธ์ของการกระทำก่อนลงมือ แล้วเลือกการกระทำที่มีผลลัพธ์คาดการณ์ดีที่สุด คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 3 จากทั้งหมด 4 บทเรียน

บทเรียน “โมเดลโลกและการมองล่วงหน้า” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การแบ่งงานแบบลำดับชั้น
  2. กองเป้าหมายและการย้อนกลับ
  3. โมเดลโลกและการมองล่วงหน้า
  4. วงจรการไตร่ตรองและวิจารณ์ตนเอง
← กลับไปที่ AI Agents