보안 벤치마크
Cybench
Cybench unguided 해결률 예시. 비용은 상대 추정입니다. 재게시 시 Cybench를 인용하세요. OpenCodex 실시간 미터링 아님.
이 보드의 비용은 추정치이거나 API 단가 혼합입니다. 모든 행에 출처의 측정된 작업당 비용이 있을 때까지 점수/$ 순위와 최고 가성비는 비활성화됩니다.
| 모델 | 노력 | 점수 | 작업당 비용 | 용도 |
|---|---|---|---|---|
| claude-mythos-preview | — | 100% | $18 | 프론티어, 플래너 |
| claude-opus-4.7 | — | 96% | $14 | 프론티어, 플래너 |
| claude-opus-4.6 | — | 93% | $12 | 프론티어, 플래너 |
| claude-opus-4.5 | — | 82% | $11 | 프론티어 |
| muse-spark | — | 65.4% | $3.2 | 실무용, 프론티어 |
| claude-sonnet-4.5 | — | 60% | $5.5 | 실무용 |
| grok-4 | — | 43% | $2.8 | 실무용, 저가 서브에이전트 |
| claude-opus-4.1 | — | 42% | $9 | 실무용 |
| grok-4.1 | thinking | 39% | $2.4 | 실무용, 저가 서브에이전트 |
| claude-opus-4 | — | 38% | $8 | 실무용 |
| claude-sonnet-4 | — | 35% | $4.5 | 실무용 |
| grok-4 | fast | 30% | $1.2 | 빠름, 저가 서브에이전트 |
| o3-mini | — | 22.5% | $1.5 | 저가 서브에이전트 |
| claude-3.7-sonnet | — | 20% | $3.5 | 실무용 |
| gpt-4.5-preview | — | 17.5% | $6 | 프론티어 |

