编程基准
DeepSWE
来自公开 DeepSWE 排行榜(mini-swe-agent)的示意快照。分数与成本并非 OpenCodex 实时计量。
| 模型 | 推理力度 | 得分 | 每任务成本 | 分数 / $ | 用途 |
|---|---|---|---|---|---|
| gpt-5.6-sol | max | 73% ±3 | $8.39 | 8.7 | 前沿, 规划 |
| claude-fable-5 | max | 70% ±4 | $21.63 | 3.2 | 规划, 前沿 |
| gpt-5.6-terra | max | 70% ±3 | $4.95 | 14.1 | 主力, 前沿 |
| gpt-5.6-luna | max | 67% ±4 | $3.03 | 22.1 | 主力, 低价子代理 |
| gpt-5.5 | xhigh | 67% ±6 | $7.23 | 9.3 | 前沿, 主力 |
| claude-opus-4.8 | max | 59% ±2 | $13.22 | 4.5 | 前沿, 规划 |
| claude-sonnet-5 | max | 54% ±4 | $26.4 | 2.0 | 规划 |
| grok-4.5 | high | 54% ±2 | $2.42 | 22.3 | 主力, 低价子代理 |
| muse-spark-1.1最佳性价比 | xhigh | 53% ±3 | $2.36 | 22.5 | 主力, 低价子代理 |
| gpt-5.4 | xhigh | 52% ±2 | $5.65 | 9.2 | 主力 |
| glm-5.2 | max | 44% ±2 | $3.92 | 11.2 | 主力, 低价子代理 |
| gemini-3.5-flash | medium | 37% ±2 | $7.34 | 5.0 | 快速 |
| kimi-k2.7-code | — | 31% ±1 | $2.82 | 11.0 | 低价子代理, 主力 |
| claude-sonnet-4.6 | high | 30% ±4 | $5.52 | 5.4 | 主力 |
| gemini-3.1-pro | high | 12% ±2 | $9.48 | 1.3 | 前沿 |
AA Coding Agent
Artificial Analysis Coding Agent Index 快照(GPT-5.6 GA 之后,2026-07-09)。见 provenance.url。非 OpenCodex 实时计量。
| 模型 | 推理力度 | 得分 | 每任务成本 | 分数 / $ | 用途 |
|---|---|---|---|---|---|
| composer-2.5最佳性价比 | std | 62 | $0.07 | 885.7 | 主力, 低价子代理, 快速 |
| composer-2.5 | fast | 62 | $0.44 | 140.9 | 主力, 快速 |
| claude-opus-4.7 | max | 66 | $4.1 | 16.1 | 前沿, 规划 |
| gpt-5.5 | xhigh | 65 | $4.82 | 13.5 | 前沿, 主力 |
| gpt-5.6-luna | max | 75 | $1.55 | 48.4 | 主力, 低价子代理 |
| gpt-5.6-terra | max | 77 | $2.4 | 32.1 | 主力 |
| gpt-5.6-sol | max | 80 | $3.9 | 20.5 | 前沿, 规划 |
| grok-4.5 | high | 76 | $2.54 | 29.9 | 主力, 低价子代理 |
| claude-sonnet-4.6 | high | 58 | $2.8 | 20.7 | 主力 |
| claude-fable-5 | high | 64 | $9.5 | 6.7 | 规划, 前沿 |
FrontierCode
Cognition FrontierCode 快照;引用前请在 cognition.com 核对。非 OpenCodex 实时计量。
| 模型 | 推理力度 | 得分 | 每任务成本 | 分数 / $ | 用途 |
|---|---|---|---|---|---|
| claude-fable-5 | xhigh | 53.5% | $13.09 | 4.1 | 前沿, 主力, 规划 |
| claude-fable-5 | high | 52.7% | $9.48 | 5.6 | 前沿, 主力, 规划 |
| claude-fable-5 | max | 51.6% | $19.07 | 2.7 | 前沿, 主力, 规划 |
| claude-fable-5 | medium | 49.8% | $7.15 | 7.0 | 前沿, 主力, 规划 |
| claude-fable-5 | low | 48% | $4.92 | 9.8 | 前沿, 主力, 规划 |
| gpt-5.6-sol | max | 47.5% | $6.3 | 7.5 | 前沿, 主力, 规划 |
| gpt-5.6-sol | xhigh | 46.8% | $5 | 9.4 | 前沿, 主力, 规划 |
| claude-opus-4.8 | max | 46.5% | $9.62 | 4.8 | 前沿, 主力, 规划 |
| claude-opus-4.8 | xhigh | 45.5% | $6.78 | 6.7 | 前沿, 主力, 规划 |
| gpt-5.6-sol | high | 45.1% | $4.1 | 11.0 | 前沿, 主力, 规划 |
| gpt-5.5 | xhigh | 43% | $4.03 | 10.7 | 前沿, 主力 |
| claude-sonnet-5 | xhigh | 42.7% | $9.06 | 4.7 | 前沿, 主力 |
| grok-4.5 | high | 42.4% | $1.3 | 32.6 | 主力, 低价子代理, 快速 |
| claude-sonnet-5 | max | 42.4% | $15.4 | 2.8 | 前沿, 主力 |
| swe-1.7 | — | 42.3% | $1.97 | 21.5 | 主力, 低价子代理 |
| grok-4.5 | medium | 41.9% | $1.2 | 34.9 | 主力, 低价子代理, 快速 |
| gpt-5.6-terra | max | 41.3% | $2.3 | 18.0 | 主力 |
| claude-opus-4.8 | high | 41% | $4.28 | 9.6 | 前沿, 主力, 规划 |
| gpt-5.5 | high | 40.6% | $3.12 | 13.0 | 前沿, 主力 |
| claude-opus-4.8 | medium | 40.5% | $3.7 | 10.9 | 前沿, 主力, 规划 |
| gpt-5.6-sol | medium | 39.9% | $3.1 | 12.9 | 前沿, 主力, 规划 |
| gpt-5.6-luna | max | 39.8% | $1.8 | 22.1 | 主力, 低价子代理 |
| claude-sonnet-5 | high | 39.4% | $5.49 | 7.2 | 前沿, 主力 |
| gpt-5.6-luna | xhigh | 38.9% | $1.5 | 25.9 | 主力, 低价子代理 |
| gpt-5.6-terra | xhigh | 38.7% | $1.6 | 24.2 | 主力, 低价子代理 |
| claude-opus-4.7 | max | 38.5% | $9.09 | 4.2 | 主力 |
| grok-4.5 | low | 37.9% | $0.8 | 47.4 | 主力, 低价子代理, 快速 |
| gpt-5.6-terra | high | 36.9% | $1.4 | 26.4 | 主力, 低价子代理, 快速 |
| gpt-5.5 | medium | 36.6% | $2.35 | 15.6 | 前沿, 主力 |
| gpt-5.6-luna | high | 35.9% | $1.1 | 32.6 | 主力, 低价子代理, 快速 |
| gpt-5.6-sol | low | 35.4% | $2.1 | 16.9 | 前沿, 主力, 规划 |
| claude-sonnet-5 | medium | 35.2% | $3.43 | 10.3 | 前沿, 主力 |
| claude-opus-4.7 | high | 35.2% | $5.03 | 7.0 | 主力 |
| claude-opus-4.8 | low | 35.1% | $2.68 | 13.1 | 前沿, 主力, 规划 |
| claude-opus-4.7 | xhigh | 34.9% | $6.87 | 5.1 | 主力 |
| gpt-5.6-terra | medium | 33.9% | $0.9 | 37.7 | 主力, 低价子代理, 快速 |
| gpt-5.5 | low | 30.6% | $1.65 | 18.5 | 前沿, 主力, 低价子代理 |
| kimi-k2.7 | — | 30.1% | $3.01 | 10.0 | — |
| claude-opus-4.7 | medium | 28.9% | $3.22 | 9.0 | 主力 |
| claude-sonnet-5 | low | 28.7% | $2.15 | 13.3 | 前沿, 主力 |
| claude-opus-4.7 | low | 27.6% | $2.47 | 11.2 | 主力 |
| gpt-5.6-luna | medium | 25.7% | $0.6 | 42.8 | 主力, 低价子代理, 快速 |
| composer-2.5 | — | 25.6% | $3.09 | 8.3 | — |
| glm-5.2 | — | 24.5% | $2.47 | 9.9 | — |
| gpt-5.6-terra | low | 24.1% | $0.5 | 48.2 | 主力, 低价子代理, 快速 |
| deepseek-v4-pro | — | 17.6% | $1.6 | 11.0 | 低价子代理 |
| gpt-5.6-luna最佳性价比 | low | 15.4% | $0.2 | 77.0 | 主力, 低价子代理, 快速 |
| minimax-m3 | — | 14.7% | $0.7 | 21.0 | 低价子代理, 快速 |
| inkling | 0.99 | 14% | $3.6 | 3.9 | — |
| qwen-3.7-plus | — | 10.2% | $0.2 | 51.0 | 低价子代理, 快速 |
FrontierSWE
来自 frontierswe.com 的示意快照(Mean@5 Dominance)。X 轴为公开 API $/MTok 相对成本——非实测 $/task。非 OpenCodex 实时计量。
此榜单的成本为估算或 API 单价合成——在每一行都有来源实测的每任务成本之前,禁用分数/$ 排名与“最佳性价比”。
| 模型 | 推理力度 | 得分 | 每任务成本 | 用途 |
|---|---|---|---|---|
| claude-fable-5 | claude-code | 89% | $30 | 规划, 前沿 |
| grok-4.5 | grok-cli | 78% | $4 | 主力, 前沿 |
| claude-opus-4.8 | claude-code | 73% | $15 | 前沿, 规划 |
| glm-5.2 | claude-code | 72% | $1.98 | 主力, 低价子代理 |
| gpt-5.5 | codex | 70% | $17.5 | 前沿, 主力 |
| claude-opus-4.7 | claude-code | 61% | $15 | 前沿 |
| claude-opus-4.6 | claude-code | 53% | $15 | 主力 |
| gpt-5.4 | codex | 51% | $8.75 | 主力 |
| composer-2.5 | cursor-cli | 38% | $1 | 主力, 低价子代理, 快速 |
| gemini-3.1-pro | gemini-cli | 37% | $8.75 | 前沿 |
| glm-5.1 | claude-code | 29% | $2.9 | 主力 |
| deepseek-v4-pro | claude-code | 27% | $2.4 | 低价子代理, 主力 |
| kimi-k2.6 | kimi-cli | 25% | $2.13 | 低价子代理 |
| kimi-k2.5 | kimi-cli | 25% | $2.13 | 低价子代理 |
| qwen3.6-plus | qwen-code | 21% | $1.75 | 低价子代理 |
Program Bench
来自 programbench.com 扩展排行榜的快照(mini-SWE-agent,200 题)。分数 = almost-resolved(≥95% 测试)。成本 = 已发布的平均 API $/task。非 OpenCodex 实时计量。
| 模型 | 推理力度 | 得分 | 每任务成本 | 分数 / $ | 用途 |
|---|---|---|---|---|---|
| gpt-5.5最佳性价比 | xhigh | 13.5% | $8.85 | 1.5 | 前沿, 规划 |
| gpt-5.5 | high | 5% | $3.65 | 1.4 | 前沿, 主力 |
| claude-opus-4.7 | xhigh | 4.5% | $10.96 | 0.4 | 规划, 前沿 |
| claude-opus-4.7 | — | 3% | $3.81 | 0.8 | 前沿 |
| claude-opus-4.6 | — | 2.5% | $11.38 | 0.2 | 主力 |
| gpt-5.5 | — | 1.5% | $1.21 | 1.2 | 主力 |
| claude-sonnet-4.6 | — | 1% | $26.73 | 0.0 | 主力 |
| gpt-5.4 | — | 0% | $0.33 | 0.0 | 快速, 低价子代理 |
| gemini-3.1-pro | — | 0% | $1.51 | 0.0 | 前沿 |
| gemini-3-flash | — | 0% | $0.3 | 0.0 | 快速, 低价子代理 |
| claude-haiku-4.5 | — | 0% | $0.8 | 0.0 | 快速, 低价子代理 |
| gpt-5.4-mini | — | 0% | $0.04 | 0.0 | 快速, 低价子代理 |
| gpt-5-mini | — | 0% | $0.03 | 0.0 | 快速, 低价子代理 |
SWE Marathon
来自 swe-marathon.org 的示意快照(20 个超长程任务的 pass@1)。成本轴为估计相对运行成本,非已发布 $/task。非 OpenCodex 实时计量。
此榜单的成本为估算或 API 单价合成——在每一行都有来源实测的每任务成本之前,禁用分数/$ 排名与“最佳性价比”。
| 模型 | 推理力度 | 得分 | 每任务成本 | 用途 |
|---|---|---|---|---|
| grok-4.5 | grok-build | 29% | $8 | 前沿, 规划 |
| claude-opus-4.8 | claude-code | 26% | $28 | 前沿, 规划 |
| claude-fable-5 | claude-code | 24% | $45 | 规划, 前沿 |
| claude-opus-4.7 | claude-code | 16% | $22 | 前沿 |
| glm-5.2 | claude-code | 13% | $6 | 主力, 低价子代理 |
| gpt-5.5 | codex | 12% | $18 | 前沿, 主力 |
| claude-opus-4.7 | terminus-2 | 11% | $20 | 主力 |
| gemini-3.5-flash | gemini-cli | 7% | $5 | 快速 |
| gpt-5.5 | terminus-2 | 6% | $16 | 主力 |
| gemini-3.1-pro | terminus-2 | 4% | $12 | 前沿 |
| deepseek-v4-pro | terminus-2 | 4% | $7 | 低价子代理 |
| gemini-3.1-pro | gemini-cli | 2% | $12 | 前沿 |
| glm-5.1 | terminus-2 | 1% | $5 | 主力 |
| minimax-m2.7 | terminus-2 | 0% | $3 | 低价子代理 |
| kimi-k2.6 | kimi-cli | 0% | $4 | 低价子代理 |

