코딩 벤치마크
DeepSWE
공개 DeepSWE 리더보드(mini-swe-agent) 스냅샷입니다. 점수·비용은 OpenCodex 실시간 미터링이 아닙니다.
| 모델 | 노력 | 점수 | 작업당 비용 | 점수 / $ | 용도 |
|---|---|---|---|---|---|
| gpt-5.6-sol | max | 73% ±3 | $8.39 | 8.7 | 프론티어, 플래너 |
| claude-fable-5 | max | 70% ±4 | $21.63 | 3.2 | 플래너, 프론티어 |
| gpt-5.6-terra | max | 70% ±3 | $4.95 | 14.1 | 실무용, 프론티어 |
| gpt-5.6-luna | max | 67% ±4 | $3.03 | 22.1 | 실무용, 저가 서브에이전트 |
| gpt-5.5 | xhigh | 67% ±6 | $7.23 | 9.3 | 프론티어, 실무용 |
| claude-opus-4.8 | max | 59% ±2 | $13.22 | 4.5 | 프론티어, 플래너 |
| claude-sonnet-5 | max | 54% ±4 | $26.4 | 2.0 | 플래너 |
| grok-4.5 | high | 54% ±2 | $2.42 | 22.3 | 실무용, 저가 서브에이전트 |
| muse-spark-1.1최고 가성비 | xhigh | 53% ±3 | $2.36 | 22.5 | 실무용, 저가 서브에이전트 |
| gpt-5.4 | xhigh | 52% ±2 | $5.65 | 9.2 | 실무용 |
| glm-5.2 | max | 44% ±2 | $3.92 | 11.2 | 실무용, 저가 서브에이전트 |
| gemini-3.5-flash | medium | 37% ±2 | $7.34 | 5.0 | 빠름 |
| kimi-k2.7-code | — | 31% ±1 | $2.82 | 11.0 | 저가 서브에이전트, 실무용 |
| claude-sonnet-4.6 | high | 30% ±4 | $5.52 | 5.4 | 실무용 |
| gemini-3.1-pro | high | 12% ±2 | $9.48 | 1.3 | 프론티어 |
AA Coding Agent
Artificial Analysis Coding Agent Index 스냅샷(GPT-5.6 GA 이후, 2026-07-09). provenance.url 참고. OpenCodex 실시간 미터링 아님.
| 모델 | 노력 | 점수 | 작업당 비용 | 점수 / $ | 용도 |
|---|---|---|---|---|---|
| composer-2.5최고 가성비 | std | 62 | $0.07 | 885.7 | 실무용, 저가 서브에이전트, 빠름 |
| composer-2.5 | fast | 62 | $0.44 | 140.9 | 실무용, 빠름 |
| claude-opus-4.7 | max | 66 | $4.1 | 16.1 | 프론티어, 플래너 |
| gpt-5.5 | xhigh | 65 | $4.82 | 13.5 | 프론티어, 실무용 |
| gpt-5.6-luna | max | 75 | $1.55 | 48.4 | 실무용, 저가 서브에이전트 |
| gpt-5.6-terra | max | 77 | $2.4 | 32.1 | 실무용 |
| gpt-5.6-sol | max | 80 | $3.9 | 20.5 | 프론티어, 플래너 |
| grok-4.5 | high | 76 | $2.54 | 29.9 | 실무용, 저가 서브에이전트 |
| claude-sonnet-4.6 | high | 58 | $2.8 | 20.7 | 실무용 |
| claude-fable-5 | high | 64 | $9.5 | 6.7 | 플래너, 프론티어 |
FrontierCode
Cognition FrontierCode 스냅샷. 인용 전 cognition.com에서 확인하세요. OpenCodex 실시간 미터링 아님.
| 모델 | 노력 | 점수 | 작업당 비용 | 점수 / $ | 용도 |
|---|---|---|---|---|---|
| claude-fable-5 | xhigh | 53.5% | $13.09 | 4.1 | 프론티어, 실무용, 플래너 |
| claude-fable-5 | high | 52.7% | $9.48 | 5.6 | 프론티어, 실무용, 플래너 |
| claude-fable-5 | max | 51.6% | $19.07 | 2.7 | 프론티어, 실무용, 플래너 |
| claude-fable-5 | medium | 49.8% | $7.15 | 7.0 | 프론티어, 실무용, 플래너 |
| claude-fable-5 | low | 48% | $4.92 | 9.8 | 프론티어, 실무용, 플래너 |
| gpt-5.6-sol | max | 47.5% | $6.3 | 7.5 | 프론티어, 실무용, 플래너 |
| gpt-5.6-sol | xhigh | 46.8% | $5 | 9.4 | 프론티어, 실무용, 플래너 |
| claude-opus-4.8 | max | 46.5% | $9.62 | 4.8 | 프론티어, 실무용, 플래너 |
| claude-opus-4.8 | xhigh | 45.5% | $6.78 | 6.7 | 프론티어, 실무용, 플래너 |
| gpt-5.6-sol | high | 45.1% | $4.1 | 11.0 | 프론티어, 실무용, 플래너 |
| gpt-5.5 | xhigh | 43% | $4.03 | 10.7 | 프론티어, 실무용 |
| claude-sonnet-5 | xhigh | 42.7% | $9.06 | 4.7 | 프론티어, 실무용 |
| grok-4.5 | high | 42.4% | $1.3 | 32.6 | 실무용, 저가 서브에이전트, 빠름 |
| claude-sonnet-5 | max | 42.4% | $15.4 | 2.8 | 프론티어, 실무용 |
| swe-1.7 | — | 42.3% | $1.97 | 21.5 | 실무용, 저가 서브에이전트 |
| grok-4.5 | medium | 41.9% | $1.2 | 34.9 | 실무용, 저가 서브에이전트, 빠름 |
| gpt-5.6-terra | max | 41.3% | $2.3 | 18.0 | 실무용 |
| claude-opus-4.8 | high | 41% | $4.28 | 9.6 | 프론티어, 실무용, 플래너 |
| gpt-5.5 | high | 40.6% | $3.12 | 13.0 | 프론티어, 실무용 |
| claude-opus-4.8 | medium | 40.5% | $3.7 | 10.9 | 프론티어, 실무용, 플래너 |
| gpt-5.6-sol | medium | 39.9% | $3.1 | 12.9 | 프론티어, 실무용, 플래너 |
| gpt-5.6-luna | max | 39.8% | $1.8 | 22.1 | 실무용, 저가 서브에이전트 |
| claude-sonnet-5 | high | 39.4% | $5.49 | 7.2 | 프론티어, 실무용 |
| gpt-5.6-luna | xhigh | 38.9% | $1.5 | 25.9 | 실무용, 저가 서브에이전트 |
| gpt-5.6-terra | xhigh | 38.7% | $1.6 | 24.2 | 실무용, 저가 서브에이전트 |
| claude-opus-4.7 | max | 38.5% | $9.09 | 4.2 | 실무용 |
| grok-4.5 | low | 37.9% | $0.8 | 47.4 | 실무용, 저가 서브에이전트, 빠름 |
| gpt-5.6-terra | high | 36.9% | $1.4 | 26.4 | 실무용, 저가 서브에이전트, 빠름 |
| gpt-5.5 | medium | 36.6% | $2.35 | 15.6 | 프론티어, 실무용 |
| gpt-5.6-luna | high | 35.9% | $1.1 | 32.6 | 실무용, 저가 서브에이전트, 빠름 |
| gpt-5.6-sol | low | 35.4% | $2.1 | 16.9 | 프론티어, 실무용, 플래너 |
| claude-sonnet-5 | medium | 35.2% | $3.43 | 10.3 | 프론티어, 실무용 |
| claude-opus-4.7 | high | 35.2% | $5.03 | 7.0 | 실무용 |
| claude-opus-4.8 | low | 35.1% | $2.68 | 13.1 | 프론티어, 실무용, 플래너 |
| claude-opus-4.7 | xhigh | 34.9% | $6.87 | 5.1 | 실무용 |
| gpt-5.6-terra | medium | 33.9% | $0.9 | 37.7 | 실무용, 저가 서브에이전트, 빠름 |
| gpt-5.5 | low | 30.6% | $1.65 | 18.5 | 프론티어, 실무용, 저가 서브에이전트 |
| kimi-k2.7 | — | 30.1% | $3.01 | 10.0 | — |
| claude-opus-4.7 | medium | 28.9% | $3.22 | 9.0 | 실무용 |
| claude-sonnet-5 | low | 28.7% | $2.15 | 13.3 | 프론티어, 실무용 |
| claude-opus-4.7 | low | 27.6% | $2.47 | 11.2 | 실무용 |
| gpt-5.6-luna | medium | 25.7% | $0.6 | 42.8 | 실무용, 저가 서브에이전트, 빠름 |
| composer-2.5 | — | 25.6% | $3.09 | 8.3 | — |
| glm-5.2 | — | 24.5% | $2.47 | 9.9 | — |
| gpt-5.6-terra | low | 24.1% | $0.5 | 48.2 | 실무용, 저가 서브에이전트, 빠름 |
| deepseek-v4-pro | — | 17.6% | $1.6 | 11.0 | 저가 서브에이전트 |
| gpt-5.6-luna최고 가성비 | low | 15.4% | $0.2 | 77.0 | 실무용, 저가 서브에이전트, 빠름 |
| minimax-m3 | — | 14.7% | $0.7 | 21.0 | 저가 서브에이전트, 빠름 |
| inkling | 0.99 | 14% | $3.6 | 3.9 | — |
| qwen-3.7-plus | — | 10.2% | $0.2 | 51.0 | 저가 서브에이전트, 빠름 |
FrontierSWE
frontierswe.com 스냅샷(Mean@5 Dominance). X축은 공개 API $/MTok 상대 비용 — 측정된 $/task 아님. OpenCodex 실시간 미터링 아님.
이 보드의 비용은 추정치이거나 API 단가 혼합입니다. 모든 행에 출처의 측정된 작업당 비용이 있을 때까지 점수/$ 순위와 최고 가성비는 비활성화됩니다.
| 모델 | 노력 | 점수 | 작업당 비용 | 용도 |
|---|---|---|---|---|
| claude-fable-5 | claude-code | 89% | $30 | 플래너, 프론티어 |
| grok-4.5 | grok-cli | 78% | $4 | 실무용, 프론티어 |
| claude-opus-4.8 | claude-code | 73% | $15 | 프론티어, 플래너 |
| glm-5.2 | claude-code | 72% | $1.98 | 실무용, 저가 서브에이전트 |
| gpt-5.5 | codex | 70% | $17.5 | 프론티어, 실무용 |
| claude-opus-4.7 | claude-code | 61% | $15 | 프론티어 |
| claude-opus-4.6 | claude-code | 53% | $15 | 실무용 |
| gpt-5.4 | codex | 51% | $8.75 | 실무용 |
| composer-2.5 | cursor-cli | 38% | $1 | 실무용, 저가 서브에이전트, 빠름 |
| gemini-3.1-pro | gemini-cli | 37% | $8.75 | 프론티어 |
| glm-5.1 | claude-code | 29% | $2.9 | 실무용 |
| deepseek-v4-pro | claude-code | 27% | $2.4 | 저가 서브에이전트, 실무용 |
| kimi-k2.6 | kimi-cli | 25% | $2.13 | 저가 서브에이전트 |
| kimi-k2.5 | kimi-cli | 25% | $2.13 | 저가 서브에이전트 |
| qwen3.6-plus | qwen-code | 21% | $1.75 | 저가 서브에이전트 |
Program Bench
programbench.com 확장 리더보드 스냅샷(mini-SWE-agent, 200 과제). 점수 = almost-resolved(≥95% 테스트). 비용 = 게시된 평균 API $/task. OpenCodex 실시간 미터링 아님.
| 모델 | 노력 | 점수 | 작업당 비용 | 점수 / $ | 용도 |
|---|---|---|---|---|---|
| gpt-5.5최고 가성비 | xhigh | 13.5% | $8.85 | 1.5 | 프론티어, 플래너 |
| gpt-5.5 | high | 5% | $3.65 | 1.4 | 프론티어, 실무용 |
| claude-opus-4.7 | xhigh | 4.5% | $10.96 | 0.4 | 플래너, 프론티어 |
| claude-opus-4.7 | — | 3% | $3.81 | 0.8 | 프론티어 |
| claude-opus-4.6 | — | 2.5% | $11.38 | 0.2 | 실무용 |
| gpt-5.5 | — | 1.5% | $1.21 | 1.2 | 실무용 |
| claude-sonnet-4.6 | — | 1% | $26.73 | 0.0 | 실무용 |
| gpt-5.4 | — | 0% | $0.33 | 0.0 | 빠름, 저가 서브에이전트 |
| gemini-3.1-pro | — | 0% | $1.51 | 0.0 | 프론티어 |
| gemini-3-flash | — | 0% | $0.3 | 0.0 | 빠름, 저가 서브에이전트 |
| claude-haiku-4.5 | — | 0% | $0.8 | 0.0 | 빠름, 저가 서브에이전트 |
| gpt-5.4-mini | — | 0% | $0.04 | 0.0 | 빠름, 저가 서브에이전트 |
| gpt-5-mini | — | 0% | $0.03 | 0.0 | 빠름, 저가 서브에이전트 |
SWE Marathon
swe-marathon.org 스냅샷(초장기 20과제 pass@1). 비용 축은 추정 상대 실행 비용이며 게시된 $/task가 아닙니다. OpenCodex 실시간 미터링 아님.
이 보드의 비용은 추정치이거나 API 단가 혼합입니다. 모든 행에 출처의 측정된 작업당 비용이 있을 때까지 점수/$ 순위와 최고 가성비는 비활성화됩니다.
| 모델 | 노력 | 점수 | 작업당 비용 | 용도 |
|---|---|---|---|---|
| grok-4.5 | grok-build | 29% | $8 | 프론티어, 플래너 |
| claude-opus-4.8 | claude-code | 26% | $28 | 프론티어, 플래너 |
| claude-fable-5 | claude-code | 24% | $45 | 플래너, 프론티어 |
| claude-opus-4.7 | claude-code | 16% | $22 | 프론티어 |
| glm-5.2 | claude-code | 13% | $6 | 실무용, 저가 서브에이전트 |
| gpt-5.5 | codex | 12% | $18 | 프론티어, 실무용 |
| claude-opus-4.7 | terminus-2 | 11% | $20 | 실무용 |
| gemini-3.5-flash | gemini-cli | 7% | $5 | 빠름 |
| gpt-5.5 | terminus-2 | 6% | $16 | 실무용 |
| gemini-3.1-pro | terminus-2 | 4% | $12 | 프론티어 |
| deepseek-v4-pro | terminus-2 | 4% | $7 | 저가 서브에이전트 |
| gemini-3.1-pro | gemini-cli | 2% | $12 | 프론티어 |
| glm-5.1 | terminus-2 | 1% | $5 | 실무용 |
| minimax-m2.7 | terminus-2 | 0% | $3 | 저가 서브에이전트 |
| kimi-k2.6 | kimi-cli | 0% | $4 | 저가 서브에이전트 |

