FrontierCode

Cognition 编码基准:AI 代码能否达到可合并标准

基本信息

类别
代码与工程
官网 / 数据集
https://cognition.com/blog/frontier-code

30 秒看懂

分数为 score(rubric 加权得分率)与 pass rate 两口径(0-100%,越高越好),题面是「维护者会不会合并这个 PR」;Diamond(最难 50 题)Opus 4.8 仅 13.4%、Main 34.3%、Extended 51.8%——分数普遍很低属当前常态,远未饱和。

采用格局:Google/xAI/Anthropic 引用;v1.1 Main/Extended 两档;与 Frontier-Bench、APEX-SWE 均不同

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 7 场模型发布(收录 10 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-28 Anthropic·国际

Claude Sonnet 5.5

价格$2/$10 每百万 tokens · 缓存读取 $0.20/百万 token

面向日常任务、缺陷修复与文档、幻灯片、表格制作的更快更省的 Sonnet 模型,官方称比 Sonnet 5 快 30% 以上、多数任务成本最多低 30%。收录的 9 项评测以智能体编码与知识工作为主,如 Terminal-Bench 4.0 70.6%、GDPval-AA v2.1 1844。

速度更快成本更低日常编码文档与表格

查看模型变体与证据

FrontierCode 1.1 (Main), Max 46.2%FrontierCode 1.1 (Main), Xhigh 52.1%
2026-09-22 Anthropic·国际

Claude Opus 5.5

价格$4/$20 每百万 tokens

面向代码、计算机操作和知识工作的模型。官方表格提供不同任务的分数,但协议与回退模型影响比较范围。

代码计算机操作知识工作

查看模型变体与证据

FrontierCode v1.1 (Main) 54.4%FrontierCode v1.1 (Main), medium 54.6%
2026-09-22 OpenAI·国际

GPT-6 Sol / GPT-6 Luna

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 GPT-6 Sol 定位为日常复杂高价值任务的旗舰级高性价比工作马,以 GPT-5.6 Sol 一半的价格提供接近 Astra 的智能;收录评测覆盖企业自动化、软件工程、计算机操作与专业考试,AutomationBench 达 33.2%、DeepSWE 达 68.8%。

高性价比工作马长程自主代理软件工程GUI计算机操作

查看模型变体与证据

GPT-6 Sol · 1.1 Main 49.3%GPT-6 Luna · 1.1 Main 42.4%
2026-08-13 Google DeepMind / Gemini·国际

Gemini 3.7 Flash

价格$0.75/$3.75 每百万 tokens · 促销价(原 3.6 Flash 半价),2026-12-31 到期;2027-01-01 起 $1.50/$7.50模态文本·图像·视频

Gemini 3.7 Flash 被定位为面向编码与代理的旗舰 workhorse 模型(most intelligent workhorse model for coding and agents)。评测聚焦编码与代理工作流并延伸到文档/视频理解:DeepSWE v1.1 65.3%、Terminal-bench 2.1 85.8%、WebDev Arena 1588 Elo、GDP.pdf 34.0%。

多模态代理编码文档理解

查看模型变体与证据

1.1 Main 43.6%
2026-08-12 xAI / Grok·国际

Grok 4.6

价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·图像

发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。

长程智能体编码视觉任务

查看模型变体与证据

v1.1 (Extended) 61.3%
2026-07-24 Anthropic·国际

Claude Opus 5

模态文本·图像

Anthropic 发布 Claude Opus 5,effort 分档 high/xhigh/max 并提供 Fast 模式;页面数值多为图表与对比性表述(含大量内部评测)。已收录 18 项评测覆盖前沿编码、Agent 操作与法律/健康/生物专业域:亮点 DeepSWE v1.1 68.8、BrowseComp 90.8。

旗舰effort 分档Fast 模式编码与 Agent

查看模型变体与证据

v1.1, Main 53.4
2026-06-09 Anthropic·国际

Claude Fable 5 / Claude Mythos 5

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 以「Claude Fable 5 与 Claude Mythos 5」联合公告发布 Fable 5:一款带安全护栏的 Mythos 级模型,在网络安全/生物化学/蒸馏话题上按分类器回退到 Opus 4.8(影响 <5% 会话)。评测覆盖智能体编码、知识工作、计算机使用与生物安全,亮点如 SWE-Bench Pro 80.3%、OSWorld-Verified 85.0%。

前沿旗舰安全护栏智能体编码多模态

查看模型变体与证据

Claude Fable 5 · Diamond, xhigh 29.3

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。