ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench
ชุดทดสอบสาธารณะสำหรับเอเจนต์เขียนโค้ด (SWE-Bench) ผู้ช่วยทั่วไป (GAIA) และการใช้เครื่องมือ (ToolBench)
ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ
การทดสอบมาตรฐานสาธารณะ
สำหรับการเปรียบเทียบโมเดลและกรอบการทำงานระหว่างทีม การทดสอบมาตรฐานสาธารณะเป็นสิ่งจำเป็น โดยครอบคลุมความสามารถทั่วไปของตัวแทน:
- SWE-Bench — งานวิศวกรรมซอฟต์แวร์
- GAIA — งานผู้ช่วยทั่วไป
- ToolBench / BFCL — การใช้เครื่องมือ
- WebArena — การนำทางเบราว์เซอร์
SWE-Bench
SWE-Bench ทดสอบว่าตัวแทนสามารถแก้ปัญหาจริงใน GitHub ได้หรือไม่:
- ปัญหาจริง 2,294 รายการจากที่เก็บโค้ด Python ยอดนิยม
- ตัวแทนต้องสร้างแพตช์ที่ผ่านการทดสอบทั้งหมดที่ซ่อนไว้
- ปัจจุบันตัวแทนระดับแนวหน้าสามารถแก้ได้ 50-70% (จากเดิมต่ำกว่า 5% ในปี 2023)
SWE-Bench Verified
OpenAI เปิดตัวชุดย่อย 500 ปัญหาที่มีการตรวจสอบคุณภาพเข้มงวดยิ่งขึ้น (SWE-Bench Verified) ซึ่งเป็นมาตรฐานของอุตสาหกรรม
GAIA
การทดสอบมาตรฐานผู้ช่วย AI ทั่วไป (Meta + HF, 2023):
- คำถาม 466 ข้อในสามระดับความยาก
- ต้องใช้การเรียกดูเว็บ การเรียกใช้โค้ด และการให้เหตุผลกับข้อมูลหลายรูปแบบ
- ออกแบบให้มนุษย์ใช้เวลาประมาณ 30 วินาที และตัวแทนชั้นนำทำได้ประมาณ 60%
ตัวอย่างคำถาม GAIA
"อัลบั้มสตูดิโอของ Mercedes Sosa กี่อัลบั้มที่เผยแพร่ระหว่างปี 1972 ถึง 1985 โปรดใช้รายการจากหน้า Wikipedia ภาษาอังกฤษของเธอ"
ต้องใช้การเรียกดูเว็บ การอ่านตาราง และการนับ ซึ่งเป็นลักษณะทั่วไปของงานตัวแทนหลายขั้นตอน
กระดานผู้นำการเรียกใช้ฟังก์ชันของ Berkeley (BFCL)
มาตรฐานสำหรับการประเมินการเรียกใช้เครื่องมือ:
- ชุดสามสิ่งนับพันชุด ได้แก่ (คำค้น, นิยามเครื่องมือ, การเรียกที่คาดหวัง)
- ครอบคลุมสถานการณ์แบบง่าย แบบขนาน และแบบพลาดการใช้เครื่องมือ
- ปรับปรุงทุกไตรมาส
ToolBench
มีขนาดใหญ่กว่าแต่ยุ่งเหยิงกว่า: API มากกว่า 16,000 รายการจาก RapidAPI และห่วงโซ่เครื่องมือหลายขั้นตอน มีความเป็นมาตรฐานน้อยกว่า BFCL แต่ครอบคลุมได้กว้างกว่า
WebArena
การทดสอบมาตรฐานแบบโอเพนซอร์สสำหรับตัวแทนที่เรียกดูเว็บ โฮสต์เว็บไซต์ที่แยกตัวเองได้ 4 แห่ง (พาณิชย์อิเล็กทรอนิกส์ ฟอรัม พอร์ทัลสำหรับนักพัฒนา และ GitLab) โดยตัวแทนต้องทำงานที่สมจริงให้เสร็จ
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4ข้อจำกัดของการทดสอบมาตรฐาน
- การทดสอบมาตรฐานสาธารณะรั่วไหลเข้าไปในข้อมูลฝึก (เสี่ยงต่อการเล่นกับการทดสอบ)
- มีโดเมนเดียว — งานของคุณอาจยากหรือง่ายกว่า
- "แก้ได้ X%" บดบังว่าเป็น X% ใด — ส่วนหางยาวมีความสำคัญ
การทดสอบมาตรฐานของคุณเองสำคัญกว่า
การทดสอบมาตรฐานสาธารณะมีประโยชน์สำหรับเปรียบเทียบแนวทาง แต่ชุดข้อมูลมาตรฐานของคุณเองบนข้อมูลของคุณ (YOUR) คือตัวเลขเดียวที่สำคัญต่อผลิตภัณฑ์ของคุณ (YOUR)
การรวมการประเมินภายในและสาธารณะ
แนวปฏิบัติที่ดีของทีม:
- เรียกใช้การทดสอบมาตรฐานสาธารณะทุกไตรมาสเพื่อติดตามความสามารถระดับแนวหน้า
- เรียกใช้การประเมินภายในในทุก PR
- เชื่อถือตัวเลขภายในเมื่อตัดสินใจ และใช้ตัวเลขสาธารณะเพื่อดูภาพรวมของวงการ
การอ่านผลการทดสอบมาตรฐาน
เมื่อบทความวิจัยระบุว่า "ได้ 75% บน SWE-Bench":
- ตรวจสอบว่าเป็น SWE-Bench ชุดใด (Lite, Verified หรือเต็มชุด)
- ตรวจสอบว่าอนุญาตให้ลองหลายครั้งหรือไม่
- ตรวจสอบว่าใช้เครื่องมือหรือคำใบ้ที่ซ่อนไว้หรือไม่
ตัวเลขพาดหัวอ่านผิดได้ง่าย
การประเมินภายในเทียบกับสาธารณะ
สิ่งใดสำคัญกว่าสำหรับผลิตภัณฑ์ของคุณ
สรุป
SWE-Bench สำหรับตัวแทนเขียนโค้ด GAIA สำหรับผู้ช่วยทั่วไป BFCL สำหรับการใช้เครื่องมือ และ WebArena สำหรับเบราว์เซอร์ ใช้สิ่งเหล่านี้เพื่อดูภาพรวมของวงการ และเชื่อถือการประเมินของคุณเองเมื่อตัดสินใจ
คำถามที่พบบ่อย
บทเรียน “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench” ฟรีหรือไม่
ใช่ — ข้อความเต็มของ “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน
คุณจะเรียนรู้อะไรในบทเรียน “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench”
ชุดทดสอบสาธารณะสำหรับเอเจนต์เขียนโค้ด (SWE-Bench) ผู้ช่วยทั่วไป (GAIA) และการใช้เครื่องมือ (ToolBench) คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน
คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่
ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน
บทเรียน “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench” ใช้เวลานานแค่ไหน
บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย
ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม
ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ
บทเรียนทั้งหมดในหลักสูตรนี้
- การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน
- การสร้างชุดทดสอบมาตรฐาน
- ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน
- ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench