CyberGym

UC Berkeley 出品的网络安全 Agent 基准:188 个真实开源项目中的 1507 个真实漏洞,执行级判定漏洞发现与复现

基本信息

类别
Agent 与环境
官网 / 数据集
https://www.cybergym.io/
论文
https://arxiv.org/abs/2506.02548

30 秒看懂

UC Berkeley 网络安全 Agent 基准:188 个真实开源项目中的 1507 个真实漏洞,须在沙箱里实际触发/复现漏洞才算得分(执行级判定),成功率越高越好;比「纸面答题」式安全评测更硬。

采用格局:证据账本中 12 次引用;安全叙事厂商的执行级安全评测首选

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 15 场模型发布(收录 20 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-22 Xiaomi / 小米·国内

MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed

本发布含 3 个变体,各变体规格见模型详情。

小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。

开源权重1.02T MoE1M 上下文原生全模态

查看模型变体与证据

MiMo-V2.6-Pro · CyberGym 94.0MiMo-V2.6-Flash · CyberGym 95.1
2026-09-19 StepFun / 阶跃星辰·国内

Step 5 Preview

参数600B total / 27B active MoE上下文1M模态文本·图像

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

稀疏 MoE 600B/27B1M 上下文视觉输入Agentic 长程任务

查看模型变体与证据

CyberGym 84.7%
2026-09-10 DeepSeek·国内

DeepSeek-V4.1-Flash

参数552B (8B prefill / 16B decode active)上下文1M价格$0.15/$0.3 每百万 tokens · 高峰时段 $0.15/$0.30 每百万 tokens,闲时(00:30-08:30 UTC)减半至 $0.075/$0.15,缓存命中 $0.003-$0.006模态文本·图像·代码

DeepSeek 新一代非对称 Causal-Encoder-Decoder (CED) 架构的首款多模态 MoE 模型,总参 552B 仅激活 8B 输入与 16B 输出,KV Cache 显存缩减至 1/4;在 Terminal-Bench 2.1 达到 90.6%、GPQA Diamond 90.9%、DeepSWE v1.1 74.2% 与 CyberGym 88.1%,全面替代并下线 V4-Pro。

因果编解码器CED架构超高KV Cache压缩原生多模态视觉峰谷定价策略

查看模型变体与证据

CyberGym 88.1%
2026-08-28 Tencent / 腾讯混元·国内

Hy4 preview

参数770B-A49B MoE上下文1M模态文本

发布文将 Hy4 preview 定位为 770B 总参/49B 激活、1M 上下文、Apache 2.0 开源的旗舰预览版(各模型均按最高推理档评测)。46 项评测集中于智能体编码与搜索、工作智能体及 STEM 推理,亮点为 Terminal-Bench 2.1 85.4 与 SWE-bench Multilingual 82.9。

开源权重长上下文智能体

查看模型变体与证据

CyberGym 78.4
2026-08-21 DeepSeek·国内

DeepSeek-V4-Flash-Vision-Exp

模态文本·图像

DeepSeek 将 V4-Flash-Vision-Exp 定位为开启多模态 API 服务的实验性多模态模型,官方称其纯文本能力与 V4-Flash 持平、向 Opus-4.8 收敛多模态 Agent 差距。已收录 11 项评测(文本 Agent 与多模态 Agent 两组):亮点 Terminal-Bench 2.1 83.9、CyberGym 75.3。

实验性多模态API 模型Agent 增强

查看模型变体与证据

CyberGym 75.3
2026-08-13 DeepSeek·国内

DeepSeek V4 Pro

模态文本

DeepSeek 发布 V4 Pro 正式版,同步上线 APP/网页端/API(API 模型名不变),官方定位为正式版增强了 Agent 能力、在生产环境中的性能表现提升尤为显著。本发布收录的 10 项评测全部为 Agent 向(编码智能体、网络安全、工具调用、数据科学与自动化智能体),官方以单张对比图给出与 GLM-5.2 / Kimi-K3 / Opus-4.8 / Fable 5 的对比,数值以人工读图确认前不计入公开计数。

正式版 GAAgent 能力增强Responses API 原生支持三档思考强度

查看模型变体与证据

GA 快照 0813 图表尚无可读数值
2026-08 Z.ai / 智谱 GLM·国内

GLM-5.3

模态文本

GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。

开源权重思考默认开启编码专精网络安全

查看模型变体与证据

CyberGym 84.5CyberGym 83.8%CyberGym 83.6%
2026-07-21 Google DeepMind / Gemini·国际

Gemini 3.6 Flash / Gemini 3.5 Flash-Lite / Gemini 3.5 Flash Cyber

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Flash 系列定位为以效率、时延与可靠性支撑规模化 AI 智能体的主力款,3.6 Flash 在 3.5 Flash 基础上提升编码与知识工作且输出 token 减少 17%。4 项评测集中于代码、机器学习工程与计算机使用,亮点为 OSWorld-Verified 83.0% 与 MLE-Bench 63.9%。

高效智能体编码性价比

查看模型变体与证据

Gemini 3.5 Flash Cyber · within CodeMender, multi-agent 83.2%
2026-07-09 Meta / Llama·国际

Muse Spark 1.1

上下文1M模态文本·图像

Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。

智能体基础1M 上下文公测 API安全评估覆盖

查看模型变体与证据

pass@1 59.0%
2026-06-23 ByteDance Seed / 豆包·国内

Seed2.1 Pro / Seed2.1 Turbo / Seed2.1 Preview

本发布含 3 个变体,各变体规格见模型详情。

字节 Seed2.1 发布将 Pro 定位为系列最高档,官方称评估优先考察真实工作流表现而非静态榜单分数。已收录评测横跨通用 Agent、编码、多模态与视频理解:亮点 GDPval 87.9、OSWorld 78.8。

Pro 档Agent 向多模态视频理解

查看模型变体与证据

Seed2.1 Pro · CyberGym 68.7
2026-04-23 OpenAI·国际

GPT-5.5 / GPT-5.5 Pro

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 发布 GPT-5.5,提供 low/medium/high/xhigh 推理档(另有非推理模式)。评测横跨智能体编码、知识工作、长上下文与科学/网络安全,亮点如 Terminal-Bench 2.0 82.7%、ARC-AGI-2 85.0%。

智能体编码知识工作长上下文网络安全

查看模型变体与证据

GPT-5.5 · CyberGym 81.8%gpt-5-4 · CyberGym 79.0%claude-opus-4-7 · CyberGym 73.1%
2026-04-16 Anthropic·国际

Claude Opus 4.7 / Claude Opus 4.7 (fast)

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 将 Claude Opus 4.7 定位为在高级软件工程上较 Opus 4.6 显著提升、最难任务上增益尤为明显的旗舰模型,同时大幅增强视觉分辨率;这也是首个按 Project Glasswing 分级防护方案发布的模型。已收录评测覆盖智能体编码与终端、长上下文检索、计算机操作、网络安全与多学科推理等领域,SWE-bench Verified 87.6、GPQA Diamond 94.2。

智能体编码高分辨率视觉推理档位控制分级网络安全防护

查看模型变体与证据

Claude Opus 4.7 · CyberGym 73.1
2026-04-07 Z.ai / 智谱 GLM·国内

GLM-5.1

模态文本

GLM-5.1 被 z.ai 定位为面向长程任务(Towards Long-Horizon Tasks)的代理工程旗舰,强调数百轮持续优化与长时程任务能力。评测集中在推理、编码与代理三类:SWE-Bench Pro 58.4、Terminal-Bench 2.0(Terminus-2)63.5、BrowseComp(w/ 上下文管理)79.3、HLE w/ Tools 52.3。

开源权重长程任务代理工程

查看模型变体与证据

CyberGym 68.7
2026-02-11 Z.ai / 智谱 GLM·国内

GLM-5

参数744B-A40B MoE上下文200K模态文本

智谱以「From Vibe Coding to Agentic Engineering」为主题发布 GLM-5:744B 总参/40B 激活的 MoE(DSA 架构,28.5T 预训练 tokens),MIT 许可开源。评测覆盖推理、编码与通用智能体,亮点如 HMMT 2025.11 96.9%、τ²-Bench 89.7%。

开源权重智能体工程推理编码

查看模型变体与证据

CyberGym 43.2
2026-01-27 Moonshot AI / Kimi·国内

Kimi K2.5

上下文256K模态文本·图像·视频

发布文以“视觉智能体智能”为题,将 K2.5 定位为在 K2 基础上经 15T 视觉+文本混合语料继续预训练的原生多模态模型,Agent Swarm 最多 100 个子智能体/1500 步。45 项评测覆盖视觉理解、视频、智能体搜索与编码,亮点为 OCRBench 92.3 与 BrowseComp(Agent Swarm 模式)78.4。

原生多模态Agent Swarm长上下文视频理解

查看模型变体与证据

CyberGym 41.3

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。