Skip to content

Coding benchmarks

DeepSWE

Snapshot 2026-07-16 · 113 tasks · Source · Public leaderboard snapshot; verify current rankings on the source before citing.

Illustrative snapshot from the public DeepSWE leaderboard (mini-swe-agent). Scores and costs are not live OpenCodex metering.

ModelEffortScoreCost / taskScore / $Use case
gpt-5.6-solmax73% ±3$8.398.7Frontier, Planner
claude-fable-5max70% ±4$21.633.2Planner, Frontier
gpt-5.6-terramax70% ±3$4.9514.1Workhorse, Frontier
gpt-5.6-lunamax67% ±4$3.0322.1Workhorse, Cheap subagent
gpt-5.5xhigh67% ±6$7.239.3Frontier, Workhorse
claude-opus-4.8max59% ±2$13.224.5Frontier, Planner
claude-sonnet-5max54% ±4$26.42.0Planner
grok-4.5high54% ±2$2.4222.3Workhorse, Cheap subagent
muse-spark-1.1Best valuexhigh53% ±3$2.3622.5Workhorse, Cheap subagent
gpt-5.4xhigh52% ±2$5.659.2Workhorse
glm-5.2max44% ±2$3.9211.2Workhorse, Cheap subagent
gemini-3.5-flashmedium37% ±2$7.345.0Fast
kimi-k2.7-code31% ±1$2.8211.0Cheap subagent, Workhorse
claude-sonnet-4.6high30% ±4$5.525.4Workhorse
gemini-3.1-prohigh12% ±2$9.481.3Frontier

AA Coding Agent

Snapshot 2026-07-09 · undefined tasks · Source · Figures from Artificial Analysis public pages; not affiliated with AA.

Artificial Analysis Coding Agent Index snapshot (post GPT-5.6 GA, 2026-07-09). See provenance.url. Not live OpenCodex metering.

ModelEffortScoreCost / taskScore / $Use case
composer-2.5Best valuestd62$0.07885.7Workhorse, Cheap subagent, Fast
composer-2.5fast62$0.44140.9Workhorse, Fast
claude-opus-4.7max66$4.116.1Frontier, Planner
gpt-5.5xhigh65$4.8213.5Frontier, Workhorse
gpt-5.6-lunamax75$1.5548.4Workhorse, Cheap subagent
gpt-5.6-terramax77$2.432.1Workhorse
gpt-5.6-solmax80$3.920.5Frontier, Planner
grok-4.5high76$2.5429.9Workhorse, Cheap subagent
claude-sonnet-4.6high58$2.820.7Workhorse
claude-fable-5high64$9.56.7Planner, Frontier

FrontierCode

Snapshot 2026-07-16 · 100 tasks · Source · Public FrontierCode snapshot; verify on cognition.com before citing.

Illustrative snapshot from cognition.com/frontiercode (FrontierCode 1.1 Main, Jul 2026). Score = mergeability rubric; cost = mean USD per rollout. Best vs all reasoning modes match Cognition’s leaderboard toggle. Not live OpenCodex metering.

ModelEffortScoreCost / taskScore / $Use case
claude-fable-5xhigh53.5%$13.094.1Frontier, Workhorse, Planner
claude-fable-5high52.7%$9.485.6Frontier, Workhorse, Planner
claude-fable-5max51.6%$19.072.7Frontier, Workhorse, Planner
claude-fable-5medium49.8%$7.157.0Frontier, Workhorse, Planner
claude-fable-5low48%$4.929.8Frontier, Workhorse, Planner
gpt-5.6-solmax47.5%$6.37.5Frontier, Workhorse, Planner
gpt-5.6-solxhigh46.8%$59.4Frontier, Workhorse, Planner
claude-opus-4.8max46.5%$9.624.8Frontier, Workhorse, Planner
claude-opus-4.8xhigh45.5%$6.786.7Frontier, Workhorse, Planner
gpt-5.6-solhigh45.1%$4.111.0Frontier, Workhorse, Planner
gpt-5.5xhigh43%$4.0310.7Frontier, Workhorse
claude-sonnet-5xhigh42.7%$9.064.7Frontier, Workhorse
grok-4.5high42.4%$1.332.6Workhorse, Cheap subagent, Fast
claude-sonnet-5max42.4%$15.42.8Frontier, Workhorse
swe-1.742.3%$1.9721.5Workhorse, Cheap subagent
grok-4.5medium41.9%$1.234.9Workhorse, Cheap subagent, Fast
gpt-5.6-terramax41.3%$2.318.0Workhorse
claude-opus-4.8high41%$4.289.6Frontier, Workhorse, Planner
gpt-5.5high40.6%$3.1213.0Frontier, Workhorse
claude-opus-4.8medium40.5%$3.710.9Frontier, Workhorse, Planner
gpt-5.6-solmedium39.9%$3.112.9Frontier, Workhorse, Planner
gpt-5.6-lunamax39.8%$1.822.1Workhorse, Cheap subagent
claude-sonnet-5high39.4%$5.497.2Frontier, Workhorse
gpt-5.6-lunaxhigh38.9%$1.525.9Workhorse, Cheap subagent
gpt-5.6-terraxhigh38.7%$1.624.2Workhorse, Cheap subagent
claude-opus-4.7max38.5%$9.094.2Workhorse
grok-4.5low37.9%$0.847.4Workhorse, Cheap subagent, Fast
gpt-5.6-terrahigh36.9%$1.426.4Workhorse, Cheap subagent, Fast
gpt-5.5medium36.6%$2.3515.6Frontier, Workhorse
gpt-5.6-lunahigh35.9%$1.132.6Workhorse, Cheap subagent, Fast
gpt-5.6-sollow35.4%$2.116.9Frontier, Workhorse, Planner
claude-sonnet-5medium35.2%$3.4310.3Frontier, Workhorse
claude-opus-4.7high35.2%$5.037.0Workhorse
claude-opus-4.8low35.1%$2.6813.1Frontier, Workhorse, Planner
claude-opus-4.7xhigh34.9%$6.875.1Workhorse
gpt-5.6-terramedium33.9%$0.937.7Workhorse, Cheap subagent, Fast
gpt-5.5low30.6%$1.6518.5Frontier, Workhorse, Cheap subagent
kimi-k2.730.1%$3.0110.0
claude-opus-4.7medium28.9%$3.229.0Workhorse
claude-sonnet-5low28.7%$2.1513.3Frontier, Workhorse
claude-opus-4.7low27.6%$2.4711.2Workhorse
gpt-5.6-lunamedium25.7%$0.642.8Workhorse, Cheap subagent, Fast
composer-2.525.6%$3.098.3
glm-5.224.5%$2.479.9
gpt-5.6-terralow24.1%$0.548.2Workhorse, Cheap subagent, Fast
deepseek-v4-pro17.6%$1.611.0Cheap subagent
gpt-5.6-lunaBest valuelow15.4%$0.277.0Workhorse, Cheap subagent, Fast
minimax-m314.7%$0.721.0Cheap subagent, Fast
inkling0.9914%$3.63.9
qwen-3.7-plus10.2%$0.251.0Cheap subagent, Fast

FrontierSWE

Snapshot 2026-07-16 · undefined tasks · Source · Scores from FrontierSWE; costs are illustrative API/relative blends, not measured $/task.

Illustrative snapshot from frontierswe.com (Mean@5 dominance). X-axis uses blended public API $/MTok as a relative cost proxy — not measured $/task. Not live OpenCodex metering.

Costs on this board are estimates or API-price blends — score/$ ranking and Best value are disabled until every row has a measured cost-per-task from the source.

ModelEffortScoreCost / taskUse case
claude-fable-5claude-code89%$30Planner, Frontier
grok-4.5grok-cli78%$4Workhorse, Frontier
claude-opus-4.8claude-code73%$15Frontier, Planner
glm-5.2claude-code72%$1.98Workhorse, Cheap subagent
gpt-5.5codex70%$17.5Frontier, Workhorse
claude-opus-4.7claude-code61%$15Frontier
claude-opus-4.6claude-code53%$15Workhorse
gpt-5.4codex51%$8.75Workhorse
composer-2.5cursor-cli38%$1Workhorse, Cheap subagent, Fast
gemini-3.1-progemini-cli37%$8.75Frontier
glm-5.1claude-code29%$2.9Workhorse
deepseek-v4-proclaude-code27%$2.4Cheap subagent, Workhorse
kimi-k2.6kimi-cli25%$2.13Cheap subagent
kimi-k2.5kimi-cli25%$2.13Cheap subagent
qwen3.6-plusqwen-code21%$1.75Cheap subagent

Program Bench

Snapshot 2026-06-23 · 200 tasks · Source · Scores and average API costs from ProgramBench extended leaderboard.

Snapshot from programbench.com extended leaderboard (mini-SWE-agent, 200 tasks). Score = almost-resolved (≥95% tests). Costs = published average API $/task. Not live OpenCodex metering.

ModelEffortScoreCost / taskScore / $Use case
gpt-5.5Best valuexhigh13.5%$8.851.5Frontier, Planner
gpt-5.5high5%$3.651.4Frontier, Workhorse
claude-opus-4.7xhigh4.5%$10.960.4Planner, Frontier
claude-opus-4.73%$3.810.8Frontier
claude-opus-4.62.5%$11.380.2Workhorse
gpt-5.51.5%$1.211.2Workhorse
claude-sonnet-4.61%$26.730.0Workhorse
gpt-5.40%$0.330.0Fast, Cheap subagent
gemini-3.1-pro0%$1.510.0Frontier
gemini-3-flash0%$0.30.0Fast, Cheap subagent
claude-haiku-4.50%$0.80.0Fast, Cheap subagent
gpt-5.4-mini0%$0.040.0Fast, Cheap subagent
gpt-5-mini0%$0.030.0Fast, Cheap subagent

SWE Marathon

Snapshot 2026-07-09 · 20 tasks · Source · Scores from SWE-Marathon; costs are estimates.

Illustrative snapshot from swe-marathon.org (pass@1 on 20 ultra-long-horizon tasks). Cost axis is an estimated relative run cost (long trajectories); not published $/task. Not live OpenCodex metering.

Costs on this board are estimates or API-price blends — score/$ ranking and Best value are disabled until every row has a measured cost-per-task from the source.

ModelEffortScoreCost / taskUse case
grok-4.5grok-build29%$8Frontier, Planner
claude-opus-4.8claude-code26%$28Frontier, Planner
claude-fable-5claude-code24%$45Planner, Frontier
claude-opus-4.7claude-code16%$22Frontier
glm-5.2claude-code13%$6Workhorse, Cheap subagent
gpt-5.5codex12%$18Frontier, Workhorse
claude-opus-4.7terminus-211%$20Workhorse
gemini-3.5-flashgemini-cli7%$5Fast
gpt-5.5terminus-26%$16Workhorse
gemini-3.1-proterminus-24%$12Frontier
deepseek-v4-proterminus-24%$7Cheap subagent
gemini-3.1-progemini-cli2%$12Frontier
glm-5.1terminus-21%$5Workhorse
minimax-m2.7terminus-20%$3Cheap subagent
kimi-k2.6kimi-cli0%$4Cheap subagent