Security benchmarks
Cybench
Illustrative snapshot from cybench.github.io (unguided % solved on professional CTF tasks). Many rows are system-card / subset results, not one uniform full-suite run. Costs are relative agent-run estimates — Cybench does not publish $/task. Not live OpenCodex metering.
Costs on this board are estimates or API-price blends — score/$ ranking and Best value are disabled until every row has a measured cost-per-task from the source.
| Model | Effort | Score | Cost / task | Use case |
|---|---|---|---|---|
| claude-mythos-preview | — | 100% | $18 | Frontier, Planner |
| claude-opus-4.7 | — | 96% | $14 | Frontier, Planner |
| claude-opus-4.6 | — | 93% | $12 | Frontier, Planner |
| claude-opus-4.5 | — | 82% | $11 | Frontier |
| muse-spark | — | 65.4% | $3.2 | Workhorse, Frontier |
| claude-sonnet-4.5 | — | 60% | $5.5 | Workhorse |
| grok-4 | — | 43% | $2.8 | Workhorse, Cheap subagent |
| claude-opus-4.1 | — | 42% | $9 | Workhorse |
| grok-4.1 | thinking | 39% | $2.4 | Workhorse, Cheap subagent |
| claude-opus-4 | — | 38% | $8 | Workhorse |
| claude-sonnet-4 | — | 35% | $4.5 | Workhorse |
| grok-4 | fast | 30% | $1.2 | Fast, Cheap subagent |
| o3-mini | — | 22.5% | $1.5 | Cheap subagent |
| claude-3.7-sonnet | — | 20% | $3.5 | Workhorse |
| gpt-4.5-preview | — | 17.5% | $6 | Frontier |

