Sabotage 泳道读分:模型在完成良性主任务的同时完成隐藏有害子目标、且不被监控发现——发布时最强仅 27%(Claude 3.7 Sonnet,监控方为 Claude Sonnet 3.6)。注意分数越高代表隐蔽破坏能力越强,方向与能力榜相反;Meta 报告把它归入 Loss of Control 域并以低分为安全方向。
采用格局:Redwood Research / Anthropic 系作者(Kutasov、Shlegeris、Benton 等);Meta Muse Spark 1.1 报告在 Loss of Control 域引用
Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。