跳转到内容

基准测试

这些是公开榜单的静态快照,手动更新 — 并非 OpenCodex 的实时计量。每个榜单都 标注了来源、抓取日期和许可说明。只有当榜单中所有行都带有来源实测的每任务成本时, 才会显示得分/$ 排名。

按任务领域查看:

  • 编程 — DeepSWE, AA Coding Agent, FrontierCode, FrontierSWE, Program Bench, SWE Marathon
  • 前端 — Frontend Code Arena
  • 终端 — Terminal Bench 2.1
  • 安全 — Cybench
  • 智能指数 — AA Intelligence Index