ExploitBench

CMU 携手 Bugcrowd 出品的漏洞利用阶梯基准:单漏洞任务上度量 Agent 沿 16 个可测 flag 的推进距离

基本信息

类别
Agent 与环境
官网 / 数据集
https://exploitbench.ai/
论文
https://arxiv.org/abs/2605.14153

30 秒看懂

CMU/Bugcrowd 漏洞利用阶梯基准:在 41 个 V8 真实 bug 上沿 16 级可验证 flag(触发→崩溃→沙箱原语→任意读写→劫持→任意代码执行)计推进度,越高越好;公开前沿模型普遍能触发崩溃、稳定做到任意代码执行的极少——低分≠找不到漏洞,而是卡在武器化后半程。

采用格局:证据账本中 6 次引用;与 CyberGym(发现/复现)和 ExploitGym(武器化)构成同一谱系不同环节

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 5 场模型发布(收录 14 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-22 Xiaomi / 小米·国内

MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed

本发布含 3 个变体,各变体规格见模型详情。

小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。

开源权重1.02T MoE1M 上下文原生全模态

查看模型变体与证据

MiMo-V2.6-Pro · ExploitBench 47.9MiMo-V2.6-Flash · ExploitBench 25.3
2026-09-03 OpenAI·国际

GPT-6 Astra

上下文1M价格$10/$50 每百万 tokens · API 定价每百万输入 10 美元,输出 50 美元模态文本·图像·代码·计算机操作

OpenAI 首个将 Preparedness 框架推至 Critical 等级的旗舰前沿模型,在计算机直接操控、复杂多步长程自主 Agent、软件工程与零日(zero-day)漏洞挖掘上实现重大跃迁;在 ARC-AGI-3 和 ExploitBench 达到饱和得分。

旗舰前沿计算机操作(GUI)Preparedness Critical长程自主代理

查看模型变体与证据

ExploitBench 100%
2026-08-26 OpenAI·国际

GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。

旗舰多档努力智能体安全防护

查看模型变体与证据

GPT-5.6 Sol · ExploitBench 73.5%gpt-5-5 · ExploitBench 47.9%GPT-5.6 Terra · ExploitBench 52.9%GPT-5.6 Luna · ExploitBench 33.2%claude-mythos-5 · ExploitBench 78%claude-mythos-preview · ExploitBench 74.2%claude-opus-4-8 · ExploitBench 40%
2026-08 Z.ai / 智谱 GLM·国内

GLM-5.3

模态文本

GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。

开源权重思考默认开启编码专精网络安全

查看模型变体与证据

ExploitBench 54.4ExploitBench 78.0%ExploitBench 76.5%
2026-06-09 Anthropic·国际

Claude Fable 5 / Claude Mythos 5

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 以「Claude Fable 5 与 Claude Mythos 5」联合公告发布 Fable 5:一款带安全护栏的 Mythos 级模型,在网络安全/生物化学/蒸馏话题上按分类器回退到 Opus 4.8(影响 <5% 会话)。评测覆盖智能体编码、知识工作、计算机使用与生物安全,亮点如 SWE-Bench Pro 80.3%、OSWorld-Verified 85.0%。

前沿旗舰安全护栏智能体编码多模态

查看模型变体与证据

Claude Fable 5 · Cap% (starred) 78.0

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。