跳转到内容

编程基准

DeepSWE

快照 2026-07-16 · 113 项任务 · 来源 · Public leaderboard snapshot; verify current rankings on the source before citing.

来自公开 DeepSWE 排行榜(mini-swe-agent)的示意快照。分数与成本并非 OpenCodex 实时计量。

模型推理力度得分每任务成本分数 / $用途
gpt-5.6-solmax73% ±3$8.398.7前沿, 规划
claude-fable-5max70% ±4$21.633.2规划, 前沿
gpt-5.6-terramax70% ±3$4.9514.1主力, 前沿
gpt-5.6-lunamax67% ±4$3.0322.1主力, 低价子代理
gpt-5.5xhigh67% ±6$7.239.3前沿, 主力
claude-opus-4.8max59% ±2$13.224.5前沿, 规划
claude-sonnet-5max54% ±4$26.42.0规划
grok-4.5high54% ±2$2.4222.3主力, 低价子代理
muse-spark-1.1最佳性价比xhigh53% ±3$2.3622.5主力, 低价子代理
gpt-5.4xhigh52% ±2$5.659.2主力
glm-5.2max44% ±2$3.9211.2主力, 低价子代理
gemini-3.5-flashmedium37% ±2$7.345.0快速
kimi-k2.7-code31% ±1$2.8211.0低价子代理, 主力
claude-sonnet-4.6high30% ±4$5.525.4主力
gemini-3.1-prohigh12% ±2$9.481.3前沿

AA Coding Agent

快照 2026-07-09 · undefined 项任务 · 来源 · Figures from Artificial Analysis public pages; not affiliated with AA.

Artificial Analysis Coding Agent Index 快照(GPT-5.6 GA 之后,2026-07-09)。见 provenance.url。非 OpenCodex 实时计量。

模型推理力度得分每任务成本分数 / $用途
composer-2.5最佳性价比std62$0.07885.7主力, 低价子代理, 快速
composer-2.5fast62$0.44140.9主力, 快速
claude-opus-4.7max66$4.116.1前沿, 规划
gpt-5.5xhigh65$4.8213.5前沿, 主力
gpt-5.6-lunamax75$1.5548.4主力, 低价子代理
gpt-5.6-terramax77$2.432.1主力
gpt-5.6-solmax80$3.920.5前沿, 规划
grok-4.5high76$2.5429.9主力, 低价子代理
claude-sonnet-4.6high58$2.820.7主力
claude-fable-5high64$9.56.7规划, 前沿

FrontierCode

快照 2026-07-16 · 100 项任务 · 来源 · Public FrontierCode snapshot; verify on cognition.com before citing.

Cognition FrontierCode 快照;引用前请在 cognition.com 核对。非 OpenCodex 实时计量。

模型推理力度得分每任务成本分数 / $用途
claude-fable-5xhigh53.5%$13.094.1前沿, 主力, 规划
claude-fable-5high52.7%$9.485.6前沿, 主力, 规划
claude-fable-5max51.6%$19.072.7前沿, 主力, 规划
claude-fable-5medium49.8%$7.157.0前沿, 主力, 规划
claude-fable-5low48%$4.929.8前沿, 主力, 规划
gpt-5.6-solmax47.5%$6.37.5前沿, 主力, 规划
gpt-5.6-solxhigh46.8%$59.4前沿, 主力, 规划
claude-opus-4.8max46.5%$9.624.8前沿, 主力, 规划
claude-opus-4.8xhigh45.5%$6.786.7前沿, 主力, 规划
gpt-5.6-solhigh45.1%$4.111.0前沿, 主力, 规划
gpt-5.5xhigh43%$4.0310.7前沿, 主力
claude-sonnet-5xhigh42.7%$9.064.7前沿, 主力
grok-4.5high42.4%$1.332.6主力, 低价子代理, 快速
claude-sonnet-5max42.4%$15.42.8前沿, 主力
swe-1.742.3%$1.9721.5主力, 低价子代理
grok-4.5medium41.9%$1.234.9主力, 低价子代理, 快速
gpt-5.6-terramax41.3%$2.318.0主力
claude-opus-4.8high41%$4.289.6前沿, 主力, 规划
gpt-5.5high40.6%$3.1213.0前沿, 主力
claude-opus-4.8medium40.5%$3.710.9前沿, 主力, 规划
gpt-5.6-solmedium39.9%$3.112.9前沿, 主力, 规划
gpt-5.6-lunamax39.8%$1.822.1主力, 低价子代理
claude-sonnet-5high39.4%$5.497.2前沿, 主力
gpt-5.6-lunaxhigh38.9%$1.525.9主力, 低价子代理
gpt-5.6-terraxhigh38.7%$1.624.2主力, 低价子代理
claude-opus-4.7max38.5%$9.094.2主力
grok-4.5low37.9%$0.847.4主力, 低价子代理, 快速
gpt-5.6-terrahigh36.9%$1.426.4主力, 低价子代理, 快速
gpt-5.5medium36.6%$2.3515.6前沿, 主力
gpt-5.6-lunahigh35.9%$1.132.6主力, 低价子代理, 快速
gpt-5.6-sollow35.4%$2.116.9前沿, 主力, 规划
claude-sonnet-5medium35.2%$3.4310.3前沿, 主力
claude-opus-4.7high35.2%$5.037.0主力
claude-opus-4.8low35.1%$2.6813.1前沿, 主力, 规划
claude-opus-4.7xhigh34.9%$6.875.1主力
gpt-5.6-terramedium33.9%$0.937.7主力, 低价子代理, 快速
gpt-5.5low30.6%$1.6518.5前沿, 主力, 低价子代理
kimi-k2.730.1%$3.0110.0
claude-opus-4.7medium28.9%$3.229.0主力
claude-sonnet-5low28.7%$2.1513.3前沿, 主力
claude-opus-4.7low27.6%$2.4711.2主力
gpt-5.6-lunamedium25.7%$0.642.8主力, 低价子代理, 快速
composer-2.525.6%$3.098.3
glm-5.224.5%$2.479.9
gpt-5.6-terralow24.1%$0.548.2主力, 低价子代理, 快速
deepseek-v4-pro17.6%$1.611.0低价子代理
gpt-5.6-luna最佳性价比low15.4%$0.277.0主力, 低价子代理, 快速
minimax-m314.7%$0.721.0低价子代理, 快速
inkling0.9914%$3.63.9
qwen-3.7-plus10.2%$0.251.0低价子代理, 快速

FrontierSWE

快照 2026-07-16 · undefined 项任务 · 来源 · Scores from FrontierSWE; costs are illustrative API/relative blends, not measured $/task.

来自 frontierswe.com 的示意快照(Mean@5 Dominance)。X 轴为公开 API $/MTok 相对成本——非实测 $/task。非 OpenCodex 实时计量。

此榜单的成本为估算或 API 单价合成——在每一行都有来源实测的每任务成本之前,禁用分数/$ 排名与“最佳性价比”。

模型推理力度得分每任务成本用途
claude-fable-5claude-code89%$30规划, 前沿
grok-4.5grok-cli78%$4主力, 前沿
claude-opus-4.8claude-code73%$15前沿, 规划
glm-5.2claude-code72%$1.98主力, 低价子代理
gpt-5.5codex70%$17.5前沿, 主力
claude-opus-4.7claude-code61%$15前沿
claude-opus-4.6claude-code53%$15主力
gpt-5.4codex51%$8.75主力
composer-2.5cursor-cli38%$1主力, 低价子代理, 快速
gemini-3.1-progemini-cli37%$8.75前沿
glm-5.1claude-code29%$2.9主力
deepseek-v4-proclaude-code27%$2.4低价子代理, 主力
kimi-k2.6kimi-cli25%$2.13低价子代理
kimi-k2.5kimi-cli25%$2.13低价子代理
qwen3.6-plusqwen-code21%$1.75低价子代理

Program Bench

快照 2026-06-23 · 200 项任务 · 来源 · Scores and average API costs from ProgramBench extended leaderboard.

来自 programbench.com 扩展排行榜的快照(mini-SWE-agent,200 题)。分数 = almost-resolved(≥95% 测试)。成本 = 已发布的平均 API $/task。非 OpenCodex 实时计量。

模型推理力度得分每任务成本分数 / $用途
gpt-5.5最佳性价比xhigh13.5%$8.851.5前沿, 规划
gpt-5.5high5%$3.651.4前沿, 主力
claude-opus-4.7xhigh4.5%$10.960.4规划, 前沿
claude-opus-4.73%$3.810.8前沿
claude-opus-4.62.5%$11.380.2主力
gpt-5.51.5%$1.211.2主力
claude-sonnet-4.61%$26.730.0主力
gpt-5.40%$0.330.0快速, 低价子代理
gemini-3.1-pro0%$1.510.0前沿
gemini-3-flash0%$0.30.0快速, 低价子代理
claude-haiku-4.50%$0.80.0快速, 低价子代理
gpt-5.4-mini0%$0.040.0快速, 低价子代理
gpt-5-mini0%$0.030.0快速, 低价子代理

SWE Marathon

快照 2026-07-09 · 20 项任务 · 来源 · Scores from SWE-Marathon; costs are estimates.

来自 swe-marathon.org 的示意快照(20 个超长程任务的 pass@1)。成本轴为估计相对运行成本,非已发布 $/task。非 OpenCodex 实时计量。

此榜单的成本为估算或 API 单价合成——在每一行都有来源实测的每任务成本之前,禁用分数/$ 排名与“最佳性价比”。

模型推理力度得分每任务成本用途
grok-4.5grok-build29%$8前沿, 规划
claude-opus-4.8claude-code26%$28前沿, 规划
claude-fable-5claude-code24%$45规划, 前沿
claude-opus-4.7claude-code16%$22前沿
glm-5.2claude-code13%$6主力, 低价子代理
gpt-5.5codex12%$18前沿, 主力
claude-opus-4.7terminus-211%$20主力
gemini-3.5-flashgemini-cli7%$5快速
gpt-5.5terminus-26%$16主力
gemini-3.1-proterminus-24%$12前沿
deepseek-v4-proterminus-24%$7低价子代理
gemini-3.1-progemini-cli2%$12前沿
glm-5.1terminus-21%$5主力
minimax-m2.7terminus-20%$3低价子代理
kimi-k2.6kimi-cli0%$4低价子代理