콘텐츠로 이동

터미널 벤치마크

Terminal Bench 2.1

스냅샷 2026-07-11 · 작업 89개 · 출처 · Harness results from Terminal-Bench; costs are estimates / API blends.

Snorkel 검증 Terminal-Bench 2.1 행 + 공개 GPT-5.6 수치의 예시 혼합. 비용은 근사 프록시입니다. OpenCodex 실시간 미터링 아님.

이 보드의 비용은 추정치이거나 API 단가 혼합입니다. 모든 행에 출처의 측정된 작업당 비용이 있을 때까지 점수/$ 순위와 최고 가성비는 비활성화됩니다.

모델노력점수작업당 비용용도
gpt-5.6-solxhigh88.8%$8.39프론티어, 플래너
gpt-5.6-terracodex78.4% ±1.3$4.95실무용, 프론티어
gpt-5.6-lunacodex75.7% ±1.3$3.03실무용, 저가 서브에이전트
claude-fable-5claude-code83.8% ±1.2$21.63플래너, 프론티어
gpt-5.5codex83.1% ±1.1$7.23프론티어, 실무용
grok-4.5cursor-cli79.3% ±1.5$2.42실무용, 저가 서브에이전트
claude-opus-4.8claude-code78.9% ±1.3$13.22프론티어, 플래너
muse-spark-1.1mini-swe-agent76.2% ±1.2$2.36실무용, 저가 서브에이전트
claude-sonnet-5claude-code74.6% ±1.6$12실무용
glm-5.2claude-code82.7%$3.92실무용, 저가 서브에이전트
claude-opus-4.7claude-code68.9% ±1.4$10프론티어
gemini-3.1-progemini-cli65.8% ±1.7$9.48프론티어
kimi-k388.3%$5프론티어, 실무용
hy371.7%$2저가 서브에이전트, 실무용
minimax-m366%$1.5저가 서브에이전트