터미널 벤치마크
Terminal Bench 2.1
Snorkel 검증 Terminal-Bench 2.1 행 + 공개 GPT-5.6 수치의 예시 혼합. 비용은 근사 프록시입니다. OpenCodex 실시간 미터링 아님.
이 보드의 비용은 추정치이거나 API 단가 혼합입니다. 모든 행에 출처의 측정된 작업당 비용이 있을 때까지 점수/$ 순위와 최고 가성비는 비활성화됩니다.
| 모델 | 노력 | 점수 | 작업당 비용 | 용도 |
|---|---|---|---|---|
| gpt-5.6-sol | xhigh | 88.8% | $8.39 | 프론티어, 플래너 |
| gpt-5.6-terra | codex | 78.4% ±1.3 | $4.95 | 실무용, 프론티어 |
| gpt-5.6-luna | codex | 75.7% ±1.3 | $3.03 | 실무용, 저가 서브에이전트 |
| claude-fable-5 | claude-code | 83.8% ±1.2 | $21.63 | 플래너, 프론티어 |
| gpt-5.5 | codex | 83.1% ±1.1 | $7.23 | 프론티어, 실무용 |
| grok-4.5 | cursor-cli | 79.3% ±1.5 | $2.42 | 실무용, 저가 서브에이전트 |
| claude-opus-4.8 | claude-code | 78.9% ±1.3 | $13.22 | 프론티어, 플래너 |
| muse-spark-1.1 | mini-swe-agent | 76.2% ±1.2 | $2.36 | 실무용, 저가 서브에이전트 |
| claude-sonnet-5 | claude-code | 74.6% ±1.6 | $12 | 실무용 |
| glm-5.2 | claude-code | 82.7% | $3.92 | 실무용, 저가 서브에이전트 |
| claude-opus-4.7 | claude-code | 68.9% ±1.4 | $10 | 프론티어 |
| gemini-3.1-pro | gemini-cli | 65.8% ±1.7 | $9.48 | 프론티어 |
| kimi-k3 | — | 88.3% | $5 | 프론티어, 실무용 |
| hy3 | — | 71.7% | $2 | 저가 서브에이전트, 실무용 |
| minimax-m3 | — | 66% | $1.5 | 저가 서브에이전트 |

