Step 5 Preview
阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。
Artificial Analysis 长上下文多文档推理指数
Artificial Analysis 长上下文推理评测:100 道题、文档长 10k–100k token(财报/法律/学术论文等),开放式作答由 LLM 判定是否等价于官方答案、取平均通过率;2024 中期前沿模型不足 50%,如今榜首约 83%——考跨分散章节的综合推理而非单点检索。
这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。
共收录 6 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20
阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。
Muse Glimmer 30B 被 Meta 定位为可在消费级设备上运行的开源代理模型(Apache 2.0,由 Muse Spark 蒸馏,24-32GB 显存可跑)。评测覆盖通用代理、代理编码、多模态与安全:MCP Atlas 75.5%、SWE-bench Verified 76.0%、AIME 2026 94.7%;另提供 K-Quant 量化档与 DFlash 投机解码加速。
腾讯发布混元 Hy3:295B 总参/21B 激活 MoE、256K 上下文、三种思考模式,Apache 2.0 开源。评测覆盖编码、智能体搜索与推理,亮点如 SWE-bench Verified 78%、BrowseComp 84.2%。
Step 3.7 Flash 被阶跃星辰定位为面向真实场景代理的高效率 Flash 模型,支持三档推理级别、最高 400 tok/s。评测覆盖通用代理、编码与长上下文/视觉:BrowseComp 75.8%、HLE w. tool 47.2%、SWE-bench Verified 76.5%、V* 95.29%。
MiniMax 将 M2.5 定位为「为真实生产力打造」,披露 20 万+ 真实环境 RL 训练与 Forge 智能体原生框架,并随附同能力 2 倍速的 M2.5-Lightning 档。已收录 22 项评测集中于编码、搜索与 Agent 工具调用:亮点 SWE-bench Verified 80.2%、tau2-Bench Telecom 97.8%。
发布文以“视觉智能体智能”为题,将 K2.5 定位为在 K2 基础上经 15T 视觉+文本混合语料继续预训练的原生多模态模型,Agent Swarm 最多 100 个子智能体/1500 步。45 项评测覆盖视觉理解、视频、智能体搜索与编码,亮点为 OCRBench 92.3 与 BrowseComp(Agent Swarm 模式)78.4。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。