0Pricing
AI Agents · บทเรียน

ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench

ชุดทดสอบสาธารณะสำหรับเอเจนต์เขียนโค้ด (SWE-Bench) ผู้ช่วยทั่วไป (GAIA) และการใช้เครื่องมือ (ToolBench)

ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench เป็นบทเรียน AI Agents ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน AI Agents และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

บางส่วนของบทเรียนนี้ยังไม่ได้รับการแปล และแสดงเป็นภาษาอังกฤษ

การทดสอบมาตรฐานสาธารณะ

สำหรับการเปรียบเทียบโมเดลและกรอบการทำงานระหว่างทีม การทดสอบมาตรฐานสาธารณะเป็นสิ่งจำเป็น โดยครอบคลุมความสามารถทั่วไปของตัวแทน:

  • SWE-Bench — งานวิศวกรรมซอฟต์แวร์
  • GAIA — งานผู้ช่วยทั่วไป
  • ToolBench / BFCL — การใช้เครื่องมือ
  • WebArena — การนำทางเบราว์เซอร์

SWE-Bench

SWE-Bench ทดสอบว่าตัวแทนสามารถแก้ปัญหาจริงใน GitHub ได้หรือไม่:

  • ปัญหาจริง 2,294 รายการจากที่เก็บโค้ด Python ยอดนิยม
  • ตัวแทนต้องสร้างแพตช์ที่ผ่านการทดสอบทั้งหมดที่ซ่อนไว้
  • ปัจจุบันตัวแทนระดับแนวหน้าสามารถแก้ได้ 50-70% (จากเดิมต่ำกว่า 5% ในปี 2023)

SWE-Bench Verified

OpenAI เปิดตัวชุดย่อย 500 ปัญหาที่มีการตรวจสอบคุณภาพเข้มงวดยิ่งขึ้น (SWE-Bench Verified) ซึ่งเป็นมาตรฐานของอุตสาหกรรม

GAIA

การทดสอบมาตรฐานผู้ช่วย AI ทั่วไป (Meta + HF, 2023):

  • คำถาม 466 ข้อในสามระดับความยาก
  • ต้องใช้การเรียกดูเว็บ การเรียกใช้โค้ด และการให้เหตุผลกับข้อมูลหลายรูปแบบ
  • ออกแบบให้มนุษย์ใช้เวลาประมาณ 30 วินาที และตัวแทนชั้นนำทำได้ประมาณ 60%

ตัวอย่างคำถาม GAIA

"อัลบั้มสตูดิโอของ Mercedes Sosa กี่อัลบั้มที่เผยแพร่ระหว่างปี 1972 ถึง 1985 โปรดใช้รายการจากหน้า Wikipedia ภาษาอังกฤษของเธอ"

ต้องใช้การเรียกดูเว็บ การอ่านตาราง และการนับ ซึ่งเป็นลักษณะทั่วไปของงานตัวแทนหลายขั้นตอน

กระดานผู้นำการเรียกใช้ฟังก์ชันของ Berkeley (BFCL)

มาตรฐานสำหรับการประเมินการเรียกใช้เครื่องมือ:

  • ชุดสามสิ่งนับพันชุด ได้แก่ (คำค้น, นิยามเครื่องมือ, การเรียกที่คาดหวัง)
  • ครอบคลุมสถานการณ์แบบง่าย แบบขนาน และแบบพลาดการใช้เครื่องมือ
  • ปรับปรุงทุกไตรมาส

ToolBench

มีขนาดใหญ่กว่าแต่ยุ่งเหยิงกว่า: API มากกว่า 16,000 รายการจาก RapidAPI และห่วงโซ่เครื่องมือหลายขั้นตอน มีความเป็นมาตรฐานน้อยกว่า BFCL แต่ครอบคลุมได้กว้างกว่า

WebArena

การทดสอบมาตรฐานแบบโอเพนซอร์สสำหรับตัวแทนที่เรียกดูเว็บ โฮสต์เว็บไซต์ที่แยกตัวเองได้ 4 แห่ง (พาณิชย์อิเล็กทรอนิกส์ ฟอรัม พอร์ทัลสำหรับนักพัฒนา และ GitLab) โดยตัวแทนต้องทำงานที่สมจริงให้เสร็จ

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

ข้อจำกัดของการทดสอบมาตรฐาน

  • การทดสอบมาตรฐานสาธารณะรั่วไหลเข้าไปในข้อมูลฝึก (เสี่ยงต่อการเล่นกับการทดสอบ)
  • มีโดเมนเดียว — งานของคุณอาจยากหรือง่ายกว่า
  • "แก้ได้ X%" บดบังว่าเป็น X% ใด — ส่วนหางยาวมีความสำคัญ

การทดสอบมาตรฐานของคุณเองสำคัญกว่า

การทดสอบมาตรฐานสาธารณะมีประโยชน์สำหรับเปรียบเทียบแนวทาง แต่ชุดข้อมูลมาตรฐานของคุณเองบนข้อมูลของคุณ (YOUR) คือตัวเลขเดียวที่สำคัญต่อผลิตภัณฑ์ของคุณ (YOUR)

การรวมการประเมินภายในและสาธารณะ

แนวปฏิบัติที่ดีของทีม:

  • เรียกใช้การทดสอบมาตรฐานสาธารณะทุกไตรมาสเพื่อติดตามความสามารถระดับแนวหน้า
  • เรียกใช้การประเมินภายในในทุก PR
  • เชื่อถือตัวเลขภายในเมื่อตัดสินใจ และใช้ตัวเลขสาธารณะเพื่อดูภาพรวมของวงการ

การอ่านผลการทดสอบมาตรฐาน

เมื่อบทความวิจัยระบุว่า "ได้ 75% บน SWE-Bench":

  • ตรวจสอบว่าเป็น SWE-Bench ชุดใด (Lite, Verified หรือเต็มชุด)
  • ตรวจสอบว่าอนุญาตให้ลองหลายครั้งหรือไม่
  • ตรวจสอบว่าใช้เครื่องมือหรือคำใบ้ที่ซ่อนไว้หรือไม่

ตัวเลขพาดหัวอ่านผิดได้ง่าย

การประเมินภายในเทียบกับสาธารณะ

สิ่งใดสำคัญกว่าสำหรับผลิตภัณฑ์ของคุณ

สรุป

SWE-Bench สำหรับตัวแทนเขียนโค้ด GAIA สำหรับผู้ช่วยทั่วไป BFCL สำหรับการใช้เครื่องมือ และ WebArena สำหรับเบราว์เซอร์ ใช้สิ่งเหล่านี้เพื่อดูภาพรวมของวงการ และเชื่อถือการประเมินของคุณเองเมื่อตัดสินใจ

คำถามที่พบบ่อย

บทเรียน “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส AI Agents ให้อัปเกรดเป็น CoddyKit PRO คอร์ส AI Agents มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench”

ชุดทดสอบสาธารณะสำหรับเอเจนต์เขียนโค้ด (SWE-Bench) ผู้ช่วยทั่วไป (GAIA) และการใช้เครื่องมือ (ToolBench) คุณปฏิบัติ AI Agents ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน AI Agents หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน AI Agents บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน AI Agents นี้ได้ไหม

ได้ บทเรียน AI Agents ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การพัฒนาเอเจนต์โดยขับเคลื่อนด้วยการประเมิน
  2. การสร้างชุดทดสอบมาตรฐาน
  3. ข้อผิดพลาดของการใช้ LLM เป็นผู้ตัดสิน
  4. ชุดการทดสอบประสิทธิภาพ: SWE-Bench, GAIA, ToolBench
← กลับไปที่ AI Agents