การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)
โมเดลที่ “คิด” ก่อนตอบ — ห่วงโซ่ความคิดภายใน การคำนวณขณะทดสอบ และการแก้ไขตนเอง
การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล) เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ
โมเดลประเภทใหม่
OpenAI o1 (กันยายน 2024) เปิดตัว «โมเดลการให้เหตุผล» — LLM ที่ให้เหตุผลทีละขั้นอย่างชัดเจนก่อนสร้างคำตอบที่ผู้ใช้มองเห็น รุ่นต่อมารวมถึง o3, DeepSeek R1, คลอดที่มีการคิดแบบขยาย, เจมินี 2.5 แบบคิด และรุ่นอื่น ๆ อีกมากมาย
โมเดลเหล่านี้ทำงานอย่างไร
แทนที่จะสร้างคำตอบทันที model จะ:
- สร้างลำดับ «การคิด» ภายในที่ยาว (รูปแบบ CoT)
- สำรวจแนวทางหลายแบบ
- แก้ไขตนเอง
- จากนั้นจึงส่งคำตอบสุดท้ายที่ผู้ใช้มองเห็น
การประมวลผลขณะทดสอบ
คุณเลือกได้ว่าจะให้ model «คิด» มากน้อยเพียงใด ยิ่งใช้โทเค็นในการคิดมาก คำตอบสำหรับปัญหายากก็ยิ่งดีขึ้น แต่ต้องแลกกับเวลาแฝงและค่าใช้จ่าย
OpenAI o-Series API
response = client.chat.completions.create(
model='o3-mini',
messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
reasoning_effort='high' # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens) # how many 'thinking' tokens were usedAnthropic Extended Thinking
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=8192,
thinking={'type': 'enabled', 'budget_tokens': 4096},
messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answerเมื่อใดที่โมเดลการให้เหตุผลโดดเด่น
- คณิตศาสตร์หลายขั้นตอน
- การสร้างโค้ดที่มีตรรกะซับซ้อน
- การให้เหตุผลทางกฎหมาย / วิทยาศาสตร์
- การวางแผนที่ต้องมองไปข้างหน้า
ผลการทดสอบ: o3 ได้คะแนนมากกว่า 90% ใน AIME และได้คะแนนสูงใน GPQA เหนือกว่าโมเดลที่ไม่ใช้การให้เหตุผลอย่างมาก
เมื่อใดที่โมเดลมาตรฐานดีกว่า
- การสนทนา / ถามตอบง่าย ๆ — การให้เหตุผลเป็นสิ่งเกินจำเป็น
- เส้นทางที่ไวต่อเวลาแฝง — การให้เหตุผลเพิ่มเวลาเป็นวินาที
- งานจำนวนมากที่คำนึงถึงค่าใช้จ่าย — การให้เหตุผลทำให้ค่าใช้จ่ายเพิ่มขึ้นหลายเท่า
- งานด้านรูปแบบ / การจัดรูปแบบ — ไม่ได้ประโยชน์เพิ่ม
โครงสร้างค่าใช้จ่าย
โทเค็นการให้เหตุผลถูกนับรวมในการคิดราคา o3-mini ที่ตั้งค่าความพยายามสูงอาจใช้โทเค็นการคิด 10,000–100,000 โทเค็นต่อคำถาม ซึ่งอาจมีค่าใช้จ่าย 0.10–1 ดอลลาร์ต่อคำถามสำหรับโมเดลการให้เหตุผลขนาดใหญ่
ภายในลูปของเอเจนต์
การใช้โมเดลการให้เหตุผลเป็นผู้วางแผนภายในเอเจนต์ขนาดใหญ่:
- โมเดลการให้เหตุผล: วางแผน / ตัดสินใจ / ประเมิน
- โมเดลมาตรฐาน: ดำเนินการตามขั้นตอน
- การเรียกใช้เครื่องมือ: ดำเนินการตามปกติ
ได้ข้อดีจากทั้งสองแบบ: ใช้การให้เหตุผลเชิงลึกในจุดที่สำคัญ และใช้การดำเนินการราคาถูกในส่วนอื่น
อย่าบังคับใช้ CoT เพิ่มเติม
คุณไม่จำเป็นต้องใช้พรอมต์ «มาคิดทีละขั้นกัน» กับโมเดลการให้เหตุผลอีกต่อไป เพราะโมเดลเหล่านี้ทำ CoT ภายในอยู่แล้ว การเพิ่มพรอมต์ดังกล่าวอาจส่งผลเสียได้จริง
การให้เหตุผลแบบโอเพนซอร์ส
DeepSeek R1, R1-Distill และรุ่นอื่น ๆ นำความสามารถด้านการให้เหตุผลมาสู่โมเดลที่เปิดน้ำหนัก ใช้งานได้บน HuggingFace, Together AI และอื่น ๆ
แนวหน้าการวิจัย
- การปรับแต่งด้วยการสะท้อนตนเอง — ฝึกโมเดลให้วิจารณ์ตนเอง
- การอนุมานโดยอาศัยการค้นหา — Tree-of-Thoughts, MCTS ในขณะอนุมาน
- การฝึกขณะทดสอบ — ปรับน้ำหนักตามแต่ละคำค้น
ข้อควรระวัง: การคิดแบบกล่องดำ
«ความคิด» ของโมเดลการให้เหตุผลมักถูกซ่อนไว้จากคุณ (OpenAI) หรือสรุปให้ดู (แอนโทรปิก) ความโปร่งใสที่จำกัดทำให้แก้ไขข้อผิดพลาดได้ยากขึ้น ดังนั้นให้พึ่งพาการประเมินอินพุต/เอาต์พุตแทน
เมื่อใดควรใช้โมเดลการให้เหตุผล
งานประเภทใดคุ้มค่ากับค่าใช้จ่ายเพิ่มเติมของโมเดลการให้เหตุผลมากที่สุด
สรุปทบทวน
โมเดลการให้เหตุผล (o1, o3, R1, คลอดที่มีการคิดแบบขยาย) แลกเวลาและค่าใช้จ่ายกับคุณภาพสำหรับงานยาก ใช้เป็นผู้วางแผนหรือผู้ตัดสินภายในเอเจนต์ และข้ามการใช้โมเดลเหล่านี้สำหรับการสนทนาแบบง่าย
เรียนรู้ AI Agents ด้วย AI tutor — ฟรี
เขียนและเรียกใช้โค้ดจริงในเบราว์เซอร์ของคุณ รับความช่วยเหลือทันทีจาก AI tutor 24/7 และเรียนรู้ต่อจากที่คุณหยุดบนเว็บหรือในแอป
- คอร์ส
- 60
- บทเรียน
- 239
คำถามที่พบบ่อย
บทเรียน “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)”
โมเดลที่ “คิด” ก่อนตอบ — ห่วงโซ่ความคิดภายใน การคำนวณขณะทดสอบ และการแก้ไขตนเอง คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 1 จากทั้งหมด 4 บทเรียน
บทเรียน “การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การให้เหตุผลแบบเอเจนต์ (o1, o3, โมเดลให้เหตุผล)
- เอเจนต์เชิงสัญลักษณ์ผสมโครงข่ายประสาท
- เอเจนต์หลายรูปแบบ (การมองเห็น + เสียง + การกระทำ)
- ปัญหาที่ยังเปิดอยู่: ความทนทาน การสอดคล้อง และหน่วยความจำระยะยาว