0Pricing
AI Agents · 강의

벤치마크 모음: SWE-Bench, GAIA, ToolBench

코딩 에이전트(SWE-Bench), 범용 어시스턴트(GAIA), 도구 사용(ToolBench)을 위한 공개 벤치마크를 알아보세요.

벤치마크 모음: SWE-Bench, GAIA, ToolBench은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.

공개 벤치마크

팀 간에 모델과 프레임워크를 비교하려면 공개 벤치마크가 필수적입니다. 공개 벤치마크는 일반적인 에이전트 기능을 다룹니다:

  • SWE-Bench — 소프트웨어 공학 작업
  • GAIA — 범용 도우미 작업
  • ToolBench / BFCL — 도구 사용
  • WebArena — 브라우저 탐색

SWE-Bench

SWE-Bench는 에이전트가 실제 GitHub 이슈를 해결할 수 있는지 테스트합니다:

  • 인기 Python 저장소의 실제 이슈 2294개
  • 에이전트는 숨겨진 모든 테스트를 통과하는 패치를 만들어야 함
  • 현재 최첨단 에이전트는 50~70%를 해결함(2023년에는 5% 미만)

SWE-Bench Verified

OpenAI는 더 엄격한 품질 검사를 적용한 500개 이슈 하위 집합인 SWE-Bench Verified를 출시했습니다. 이는 업계 표준입니다.

GAIA

범용 AI 도우미 벤치마크(Meta + HF, 2023):

  • 세 가지 난이도에 걸친 466개 질문
  • 웹 탐색, 코드 실행, 멀티모달 추론이 필요함
  • 사람이 약 30초 걸리도록 설계되었으며, 최상위 에이전트는 약 60%에 도달함

GAIA 질문 예시

"Mercedes Sosa의 영어 Wikipedia 페이지에 있는 목록을 사용하여 1972년부터 1985년 사이에 발매된 스튜디오 앨범은 몇 장입니까?"

웹 탐색, 표 읽기, 개수 세기가 필요하며 다단계 에이전트 작업의 전형적인 예입니다.

버클리 함수 호출 리더보드(BFCL)

도구 호출 평가의 표준입니다:

  • 수천 개의 (질의, 도구 정의, 예상 호출) 조합
  • 단순 호출, 병렬 호출, 도구 누락 상황을 포함
  • 분기마다 업데이트

ToolBench

더 크지만 더 복잡합니다. RapidAPI의 16k개 이상의 API와 다단계 도구 연쇄를 포함합니다. BFCL보다 표준성은 낮지만 더 넓은 범위를 다룹니다.

WebArena

웹 탐색 에이전트를 위한 오픈 소스 벤치마크입니다. 서로 독립적인 웹사이트 4개(전자상거래, 포럼, 개발자 포털, GitLab)를 제공하며, 에이전트는 현실적인 작업을 완료해야 합니다.

Running SWE-Bench Locally

git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .

# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
    --predictions_path my_agent_preds.json \
    --max_workers 4

벤치마크의 한계

  • 공개 벤치마크가 학습 데이터에 포함됨(점수 조작 위험)
  • 단일 도메인으로 구성됨 — 사용자의 작업은 더 어려울 수도, 더 쉬울 수도 있음
  • "X% 해결"이라는 표현은 어떤 X%인지 अस्पष्ट하게 만듦 — 롱테일이 중요함

자체 벤치마크가 더 중요합니다

공개 벤치마크는 접근 방식을 비교하는 데 유용합니다. 하지만 YOUR 데이터로 만든 자체 골드 세트의 수치만이 YOUR 제품에 중요한 유일한 수치입니다.

내부 평가와 공개 평가 결합

건전한 팀의 관행은 다음과 같습니다:

  • 최첨단 기능을 추적하기 위해 분기마다 공개 벤치마크 실행
  • 모든 PR마다 내부 평가 실행
  • 의사 결정에는 내부 수치를 신뢰하고, 업계 동향 파악에는 공개 수치를 활용

벤치마크 결과 읽기

논문에서 "SWE-Bench 75%"라고 말할 때:

  • 어떤(WHICH) SWE-Bench인지 확인(Lite, Verified, 전체)
  • 여러 번 시도할 수 있었는지 확인
  • 숨겨진 도구나 힌트를 사용했는지 확인

눈에 띄는 수치는 쉽게 잘못 해석할 수 있습니다.

내부 평가와 공개 평가

제품에는 어느 쪽이 더 중요합니까(WHICH)?

요약

코드 에이전트에는 SWE-Bench, 범용 도우미에는 GAIA, 도구 사용에는 BFCL, 브라우저에는 WebArena를 사용합니다. 업계 동향을 파악하는 데 활용하되, 의사 결정에는 자체 평가를 신뢰하십시오.

자주 묻는 질문

“벤치마크 모음: SWE-Bench, GAIA, ToolBench” 강의는 무료인가요?

네 — “벤치마크 모음: SWE-Bench, GAIA, ToolBench” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.

“벤치마크 모음: SWE-Bench, GAIA, ToolBench”에서 뭘 배우나요?

코딩 에이전트(SWE-Bench), 범용 어시스턴트(GAIA), 도구 사용(ToolBench)을 위한 공개 벤치마크를 알아보세요. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.

AI Agents을(를) 시작하는 데 경험이 필요한가요?

사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.

“벤치마크 모음: SWE-Bench, GAIA, ToolBench” 강의는 얼마나 걸리나요?

대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.

이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?

네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.

이 강의의 모든 강의

  1. 에이전트를 위한 평가 주도 개발
  2. 골든 테스트 세트 구축
  3. LLM 심사자의 함정
  4. 벤치마크 모음: SWE-Bench, GAIA, ToolBench
← AI Agents(으)로 돌아가기