Skip to content

Security benchmarks

Cybench

Snapshot 2026-07-16 · 40 tasks · Source · Please cite Cybench when republishing results (see cybench.github.io).

Illustrative snapshot from cybench.github.io (unguided % solved on professional CTF tasks). Many rows are system-card / subset results, not one uniform full-suite run. Costs are relative agent-run estimates — Cybench does not publish $/task. Not live OpenCodex metering.

Costs on this board are estimates or API-price blends — score/$ ranking and Best value are disabled until every row has a measured cost-per-task from the source.

ModelEffortScoreCost / taskUse case
claude-mythos-preview100%$18Frontier, Planner
claude-opus-4.796%$14Frontier, Planner
claude-opus-4.693%$12Frontier, Planner
claude-opus-4.582%$11Frontier
muse-spark65.4%$3.2Workhorse, Frontier
claude-sonnet-4.560%$5.5Workhorse
grok-443%$2.8Workhorse, Cheap subagent
claude-opus-4.142%$9Workhorse
grok-4.1thinking39%$2.4Workhorse, Cheap subagent
claude-opus-438%$8Workhorse
claude-sonnet-435%$4.5Workhorse
grok-4fast30%$1.2Fast, Cheap subagent
o3-mini22.5%$1.5Cheap subagent
claude-3.7-sonnet20%$3.5Workhorse
gpt-4.5-preview17.5%$6Frontier