Skip to content

Terminal benchmarks

Terminal Bench 2.1

Snapshot 2026-07-11 · 89 tasks · Source · Harness results from Terminal-Bench; costs are estimates / API blends.

Illustrative mix of Snorkel-verified Terminal-Bench 2.1 rows + published GPT-5.6 figures. Costs are approximate proxies (DeepSWE overlap or API-tier estimates). Not live OpenCodex metering.

Costs on this board are estimates or API-price blends — score/$ ranking and Best value are disabled until every row has a measured cost-per-task from the source.

ModelEffortScoreCost / taskUse case
gpt-5.6-solxhigh88.8%$8.39Frontier, Planner
gpt-5.6-terracodex78.4% ±1.3$4.95Workhorse, Frontier
gpt-5.6-lunacodex75.7% ±1.3$3.03Workhorse, Cheap subagent
claude-fable-5claude-code83.8% ±1.2$21.63Planner, Frontier
gpt-5.5codex83.1% ±1.1$7.23Frontier, Workhorse
grok-4.5cursor-cli79.3% ±1.5$2.42Workhorse, Cheap subagent
claude-opus-4.8claude-code78.9% ±1.3$13.22Frontier, Planner
muse-spark-1.1mini-swe-agent76.2% ±1.2$2.36Workhorse, Cheap subagent
claude-sonnet-5claude-code74.6% ±1.6$12Workhorse
glm-5.2claude-code82.7%$3.92Workhorse, Cheap subagent
claude-opus-4.7claude-code68.9% ±1.4$10Frontier
gemini-3.1-progemini-cli65.8% ±1.7$9.48Frontier
kimi-k388.3%$5Frontier, Workhorse
hy371.7%$2Cheap subagent, Workhorse
minimax-m366%$1.5Cheap subagent