AI Agents · บทเรียน

การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)

โมเดลที่ “คิด” ก่อนตอบ — ห่วงโซ่ความคิดภายใน การคำนวณขณะทดสอบ และการแก้ไขตนเอง

บทเรียน 1 จาก 415 ขั้นตอน

การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล) เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

โมเดลประเภทใหม่

OpenAI o1 (กันยายน 2024) เปิดตัว «โมเดลการให้เหตุผล» — LLM ที่ให้เหตุผลทีละขั้นอย่างชัดเจนก่อนสร้างคำตอบที่ผู้ใช้มองเห็น รุ่นต่อมารวมถึง o3, DeepSeek R1, คลอดที่มีการคิดแบบขยาย, เจมินี 2.5 แบบคิด และรุ่นอื่น ๆ อีกมากมาย

โมเดลเหล่านี้ทำงานอย่างไร

แทนที่จะสร้างคำตอบทันที model จะ:

  1. สร้างลำดับ «การคิด» ภายในที่ยาว (รูปแบบ CoT)
  2. สำรวจแนวทางหลายแบบ
  3. แก้ไขตนเอง
  4. จากนั้นจึงส่งคำตอบสุดท้ายที่ผู้ใช้มองเห็น

การประมวลผลขณะทดสอบ

คุณเลือกได้ว่าจะให้ model «คิด» มากน้อยเพียงใด ยิ่งใช้โทเค็นในการคิดมาก คำตอบสำหรับปัญหายากก็ยิ่งดีขึ้น แต่ต้องแลกกับเวลาแฝงและค่าใช้จ่าย

OpenAI o-Series API

response = client.chat.completions.create(
    model='o3-mini',
    messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
    reasoning_effort='high'   # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens)   # how many 'thinking' tokens were used

Anthropic Extended Thinking

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=8192,
    thinking={'type': 'enabled', 'budget_tokens': 4096},
    messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answer

เมื่อใดที่โมเดลการให้เหตุผลโดดเด่น

  • คณิตศาสตร์หลายขั้นตอน
  • การสร้างโค้ดที่มีตรรกะซับซ้อน
  • การให้เหตุผลทางกฎหมาย / วิทยาศาสตร์
  • การวางแผนที่ต้องมองไปข้างหน้า

ผลการทดสอบ: o3 ได้คะแนนมากกว่า 90% ใน AIME และได้คะแนนสูงใน GPQA เหนือกว่าโมเดลที่ไม่ใช้การให้เหตุผลอย่างมาก

เมื่อใดที่โมเดลมาตรฐานดีกว่า

  • การสนทนา / ถามตอบง่าย ๆ — การให้เหตุผลเป็นสิ่งเกินจำเป็น
  • เส้นทางที่ไวต่อเวลาแฝง — การให้เหตุผลเพิ่มเวลาเป็นวินาที
  • งานจำนวนมากที่คำนึงถึงค่าใช้จ่าย — การให้เหตุผลทำให้ค่าใช้จ่ายเพิ่มขึ้นหลายเท่า
  • งานด้านรูปแบบ / การจัดรูปแบบ — ไม่ได้ประโยชน์เพิ่ม

โครงสร้างค่าใช้จ่าย

โทเค็นการให้เหตุผลถูกนับรวมในการคิดราคา o3-mini ที่ตั้งค่าความพยายามสูงอาจใช้โทเค็นการคิด 10,000–100,000 โทเค็นต่อคำถาม ซึ่งอาจมีค่าใช้จ่าย 0.10–1 ดอลลาร์ต่อคำถามสำหรับโมเดลการให้เหตุผลขนาดใหญ่

ภายในลูปของเอเจนต์

การใช้โมเดลการให้เหตุผลเป็นผู้วางแผนภายในเอเจนต์ขนาดใหญ่:

  • โมเดลการให้เหตุผล: วางแผน / ตัดสินใจ / ประเมิน
  • โมเดลมาตรฐาน: ดำเนินการตามขั้นตอน
  • การเรียกใช้เครื่องมือ: ดำเนินการตามปกติ

ได้ข้อดีจากทั้งสองแบบ: ใช้การให้เหตุผลเชิงลึกในจุดที่สำคัญ และใช้การดำเนินการราคาถูกในส่วนอื่น

อย่าบังคับใช้ CoT เพิ่มเติม

คุณไม่จำเป็นต้องใช้พรอมต์ «มาคิดทีละขั้นกัน» กับโมเดลการให้เหตุผลอีกต่อไป เพราะโมเดลเหล่านี้ทำ CoT ภายในอยู่แล้ว การเพิ่มพรอมต์ดังกล่าวอาจส่งผลเสียได้จริง

การให้เหตุผลแบบโอเพนซอร์ส

DeepSeek R1, R1-Distill และรุ่นอื่น ๆ นำความสามารถด้านการให้เหตุผลมาสู่โมเดลที่เปิดน้ำหนัก ใช้งานได้บน HuggingFace, Together AI และอื่น ๆ

แนวหน้าการวิจัย

  • การปรับแต่งด้วยการสะท้อนตนเอง — ฝึกโมเดลให้วิจารณ์ตนเอง
  • การอนุมานโดยอาศัยการค้นหา — Tree-of-Thoughts, MCTS ในขณะอนุมาน
  • การฝึกขณะทดสอบ — ปรับน้ำหนักตามแต่ละคำค้น

ข้อควรระวัง: การคิดแบบกล่องดำ

«ความคิด» ของโมเดลการให้เหตุผลมักถูกซ่อนไว้จากคุณ (OpenAI) หรือสรุปให้ดู (แอนโทรปิก) ความโปร่งใสที่จำกัดทำให้แก้ไขข้อผิดพลาดได้ยากขึ้น ดังนั้นให้พึ่งพาการประเมินอินพุต/เอาต์พุตแทน

เมื่อใดควรใช้โมเดลการให้เหตุผล

งานประเภทใดคุ้มค่ากับค่าใช้จ่ายเพิ่มเติมของโมเดลการให้เหตุผลมากที่สุด

สรุปทบทวน

โมเดลการให้เหตุผล (o1, o3, R1, คลอดที่มีการคิดแบบขยาย) แลกเวลาและค่าใช้จ่ายกับคุณภาพสำหรับงานยาก ใช้เป็นผู้วางแผนหรือผู้ตัดสินภายในเอเจนต์ และข้ามการใช้โมเดลเหล่านี้สำหรับการสนทนาแบบง่าย

เริ่มต้นได้ฟรี

เรียนรู้ AI Agents ด้วย AI tutor — ฟรี

เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป

คอร์ส
60
บทเรียน
239

คำถามที่พบบ่อย

บทเรียน “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)”

โมเดลที่ “คิด” ก่อนตอบ — ห่วงโซ่ความคิดภายใน การคำนวณขณะทดสอบ และการแก้ไขตนเอง คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน

บทเรียน “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)
  2. เอเจนต์เชิงสัญลักษณ์ผสมโครงข่ายประสาท
  3. เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)
  4. ปัญหาที่ยังเปิดอยู่: ความทนทาน การสอดคล้อง และหน่วยความจำระยะยาว
← กลับไปที่ AI Agents