벤치마크 모음: SWE-Bench, GAIA, ToolBench
코딩 에이전트(SWE-Bench), 범용 어시스턴트(GAIA), 도구 사용(ToolBench)을 위한 공개 벤치마크를 알아보세요.
벤치마크 모음: SWE-Bench, GAIA, ToolBench은(는) CoddyKit의 무료 AI Agents 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 AI Agents 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
이 강의의 일부는 아직 번역되지 않았으며 영어로 표시됩니다.
공개 벤치마크
팀 간에 모델과 프레임워크를 비교하려면 공개 벤치마크가 필수적입니다. 공개 벤치마크는 일반적인 에이전트 기능을 다룹니다:
- SWE-Bench — 소프트웨어 공학 작업
- GAIA — 범용 도우미 작업
- ToolBench / BFCL — 도구 사용
- WebArena — 브라우저 탐색
SWE-Bench
SWE-Bench는 에이전트가 실제 GitHub 이슈를 해결할 수 있는지 테스트합니다:
- 인기 Python 저장소의 실제 이슈 2294개
- 에이전트는 숨겨진 모든 테스트를 통과하는 패치를 만들어야 함
- 현재 최첨단 에이전트는 50~70%를 해결함(2023년에는 5% 미만)
SWE-Bench Verified
OpenAI는 더 엄격한 품질 검사를 적용한 500개 이슈 하위 집합인 SWE-Bench Verified를 출시했습니다. 이는 업계 표준입니다.
GAIA
범용 AI 도우미 벤치마크(Meta + HF, 2023):
- 세 가지 난이도에 걸친 466개 질문
- 웹 탐색, 코드 실행, 멀티모달 추론이 필요함
- 사람이 약 30초 걸리도록 설계되었으며, 최상위 에이전트는 약 60%에 도달함
GAIA 질문 예시
"Mercedes Sosa의 영어 Wikipedia 페이지에 있는 목록을 사용하여 1972년부터 1985년 사이에 발매된 스튜디오 앨범은 몇 장입니까?"
웹 탐색, 표 읽기, 개수 세기가 필요하며 다단계 에이전트 작업의 전형적인 예입니다.
버클리 함수 호출 리더보드(BFCL)
도구 호출 평가의 표준입니다:
- 수천 개의 (질의, 도구 정의, 예상 호출) 조합
- 단순 호출, 병렬 호출, 도구 누락 상황을 포함
- 분기마다 업데이트
ToolBench
더 크지만 더 복잡합니다. RapidAPI의 16k개 이상의 API와 다단계 도구 연쇄를 포함합니다. BFCL보다 표준성은 낮지만 더 넓은 범위를 다룹니다.
WebArena
웹 탐색 에이전트를 위한 오픈 소스 벤치마크입니다. 서로 독립적인 웹사이트 4개(전자상거래, 포럼, 개발자 포털, GitLab)를 제공하며, 에이전트는 현실적인 작업을 완료해야 합니다.
Running SWE-Bench Locally
git clone https://github.com/princeton-nlp/SWE-bench
cd SWE-bench
pip install -e .
# Configure your agent as a 'model' adapter
python -m swebench.harness.run_evaluation \
--predictions_path my_agent_preds.json \
--max_workers 4벤치마크의 한계
- 공개 벤치마크가 학습 데이터에 포함됨(점수 조작 위험)
- 단일 도메인으로 구성됨 — 사용자의 작업은 더 어려울 수도, 더 쉬울 수도 있음
- "X% 해결"이라는 표현은 어떤 X%인지 अस्पष्ट하게 만듦 — 롱테일이 중요함
자체 벤치마크가 더 중요합니다
공개 벤치마크는 접근 방식을 비교하는 데 유용합니다. 하지만 YOUR 데이터로 만든 자체 골드 세트의 수치만이 YOUR 제품에 중요한 유일한 수치입니다.
내부 평가와 공개 평가 결합
건전한 팀의 관행은 다음과 같습니다:
- 최첨단 기능을 추적하기 위해 분기마다 공개 벤치마크 실행
- 모든 PR마다 내부 평가 실행
- 의사 결정에는 내부 수치를 신뢰하고, 업계 동향 파악에는 공개 수치를 활용
벤치마크 결과 읽기
논문에서 "SWE-Bench 75%"라고 말할 때:
- 어떤(WHICH) SWE-Bench인지 확인(Lite, Verified, 전체)
- 여러 번 시도할 수 있었는지 확인
- 숨겨진 도구나 힌트를 사용했는지 확인
눈에 띄는 수치는 쉽게 잘못 해석할 수 있습니다.
내부 평가와 공개 평가
제품에는 어느 쪽이 더 중요합니까(WHICH)?
요약
코드 에이전트에는 SWE-Bench, 범용 도우미에는 GAIA, 도구 사용에는 BFCL, 브라우저에는 WebArena를 사용합니다. 업계 동향을 파악하는 데 활용하되, 의사 결정에는 자체 평가를 신뢰하십시오.
자주 묻는 질문
“벤치마크 모음: SWE-Bench, GAIA, ToolBench” 강의는 무료인가요?
네 — “벤치마크 모음: SWE-Bench, GAIA, ToolBench” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 AI Agents 강의 전체를 잠금 해제할 수 있습니다. AI Agents 강의에는 총 4개의 강의가 포함되어 있습니다.
“벤치마크 모음: SWE-Bench, GAIA, ToolBench”에서 뭘 배우나요?
코딩 에이전트(SWE-Bench), 범용 어시스턴트(GAIA), 도구 사용(ToolBench)을 위한 공개 벤치마크를 알아보세요. 브라우저에서 직접 실행하는 실습 코드로 AI Agents을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
AI Agents을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 AI Agents은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“벤치마크 모음: SWE-Bench, GAIA, ToolBench” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 AI Agents 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 AI Agents 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 에이전트를 위한 평가 주도 개발
- 골든 테스트 세트 구축
- LLM 심사자의 함정
- 벤치마크 모음: SWE-Bench, GAIA, ToolBench