Claude Sonnet 5.5
面向日常任务、缺陷修复与文档、幻灯片、表格制作的更快更省的 Sonnet 模型,官方称比 Sonnet 5 快 30% 以上、多数任务成本最多低 30%。收录的 9 项评测以智能体编码与知识工作为主,如 Terminal-Bench 4.0 70.6%、GDPval-AA v2.1 1844。
Artificial Analysis 长程知识工作评测(4 个多周项目)
Artificial Analysis 私有长程知识工作评测:91 个任务(4 个多周项目)要求产出表格/PPT/备忘录等交付物,综合 Elo=分析质量 Elo+呈现质量 Elo+rubric 通过率,越高越好(锚点 GPT-5.5 medium=1000);评测集私有、榜单公开。
这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。
共收录 5 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20
面向日常任务、缺陷修复与文档、幻灯片、表格制作的更快更省的 Sonnet 模型,官方称比 Sonnet 5 快 30% 以上、多数任务成本最多低 30%。收录的 9 项评测以智能体编码与知识工作为主,如 Terminal-Bench 4.0 70.6%、GDPval-AA v2.1 1844。
xAI 发布的最新旗舰编码与知识工作模型,基于 2.1T 参数底座与长程强化学习,在 CursorBench 4.0 (46.3%)、DeepSWE v1.1 (71.0%) 与 Terminal-Bench 4.0 (38.0%) 等多小时自主长程任务上展现出更强的自我检验与 500K 上下文管理能力。
阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。
发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。
Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。