跳转到内容

终端基准

Terminal Bench 2.1

快照 2026-07-11 · 89 项任务 · 来源 · Harness results from Terminal-Bench; costs are estimates / API blends.

Snorkel 验证的 Terminal-Bench 2.1 行与已发布 GPT-5.6 数据的示意混合。成本为近似代理。非 OpenCodex 实时计量。

此榜单的成本为估算或 API 单价合成——在每一行都有来源实测的每任务成本之前,禁用分数/$ 排名与“最佳性价比”。

模型推理力度得分每任务成本用途
gpt-5.6-solxhigh88.8%$8.39前沿, 规划
gpt-5.6-terracodex78.4% ±1.3$4.95主力, 前沿
gpt-5.6-lunacodex75.7% ±1.3$3.03主力, 低价子代理
claude-fable-5claude-code83.8% ±1.2$21.63规划, 前沿
gpt-5.5codex83.1% ±1.1$7.23前沿, 主力
grok-4.5cursor-cli79.3% ±1.5$2.42主力, 低价子代理
claude-opus-4.8claude-code78.9% ±1.3$13.22前沿, 规划
muse-spark-1.1mini-swe-agent76.2% ±1.2$2.36主力, 低价子代理
claude-sonnet-5claude-code74.6% ±1.6$12主力
glm-5.2claude-code82.7%$3.92主力, 低价子代理
claude-opus-4.7claude-code68.9% ±1.4$10前沿
gemini-3.1-progemini-cli65.8% ±1.7$9.48前沿
kimi-k388.3%$5前沿, 主力
hy371.7%$2低价子代理, 主力
minimax-m366%$1.5低价子代理