MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed
本发布含 3 个变体,各变体规格见模型详情。
小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。
CMU 携手 Bugcrowd 出品的漏洞利用阶梯基准:单漏洞任务上度量 Agent 沿 16 个可测 flag 的推进距离
CMU/Bugcrowd 漏洞利用阶梯基准:在 41 个 V8 真实 bug 上沿 16 级可验证 flag(触发→崩溃→沙箱原语→任意读写→劫持→任意代码执行)计推进度,越高越好;公开前沿模型普遍能触发崩溃、稳定做到任意代码执行的极少——低分≠找不到漏洞,而是卡在武器化后半程。
这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。
共收录 5 场模型发布(收录 14 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
本发布含 3 个变体,各变体规格见模型详情。
小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。
OpenAI 首个将 Preparedness 框架推至 Critical 等级的旗舰前沿模型,在计算机直接操控、复杂多步长程自主 Agent、软件工程与零日(zero-day)漏洞挖掘上实现重大跃迁;在 ARC-AGI-3 和 ExploitBench 达到饱和得分。
本发布含 3 个变体,各变体规格见模型详情。
发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。
GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。
本发布含 2 个变体,各变体规格见模型详情。
Anthropic 以「Claude Fable 5 与 Claude Mythos 5」联合公告发布 Fable 5:一款带安全护栏的 Mythos 级模型,在网络安全/生物化学/蒸馏话题上按分类器回退到 Opus 4.8(影响 <5% 会话)。评测覆盖智能体编码、知识工作、计算机使用与生物安全,亮点如 SWE-Bench Pro 80.3%、OSWorld-Verified 85.0%。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。