AA-Briefcase

Artificial Analysis 长程知识工作评测(4 个多周项目)

基本信息

类别
Agent 与环境
官网 / 数据集
https://artificialanalysis.ai/evaluations/aa-briefcase

30 秒看懂

Artificial Analysis 私有长程知识工作评测:91 个任务(4 个多周项目)要求产出表格/PPT/备忘录等交付物,综合 Elo=分析质量 Elo+呈现质量 Elo+rubric 通过率,越高越好(锚点 GPT-5.5 medium=1000);评测集私有、榜单公开。

采用格局:Kimi/xAI 引用;91 任务、数千输入文件,评测集私有榜单公开

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 5 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-28 Anthropic·国际

Claude Sonnet 5.5

价格$2/$10 每百万 tokens · 缓存读取 $0.20/百万 token

面向日常任务、缺陷修复与文档、幻灯片、表格制作的更快更省的 Sonnet 模型,官方称比 Sonnet 5 快 30% 以上、多数任务成本最多低 30%。收录的 9 项评测以智能体编码与知识工作为主,如 Terminal-Bench 4.0 70.6%、GDPval-AA v2.1 1844。

速度更快成本更低日常编码文档与表格

查看模型变体与证据

AA-Briefcase v1.1 1811
2026-09-21 xAI / Grok·国际

Grok 4.7

参数2.1T上下文500K价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·代码·图像

xAI 发布的最新旗舰编码与知识工作模型,基于 2.1T 参数底座与长程强化学习,在 CursorBench 4.0 (46.3%)、DeepSWE v1.1 (71.0%) 与 Terminal-Bench 4.0 (38.0%) 等多小时自主长程任务上展现出更强的自我检验与 500K 上下文管理能力。

2.1T 参数500K 上下文长程自主任务强化自我检验

查看模型变体与证据

1.1 1,657
2026-09-19 StepFun / 阶跃星辰·国内

Step 5 Preview

参数600B total / 27B active MoE上下文1M模态文本·图像

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

稀疏 MoE 600B/27B1M 上下文视觉输入Agentic 长程任务

查看模型变体与证据

AA-Briefcase 1417
2026-08-12 xAI / Grok·国际

Grok 4.6

价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·图像

发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。

长程智能体编码视觉任务

查看模型变体与证据

AA-Briefcase 1577
2026-07 Moonshot AI / Kimi·国内

Kimi K3

上下文1M模态文本·图像

Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。

开源权重推理增强1M 长上下文Agentic

查看模型变体与证据

AA-Briefcase 1548

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。