AutomationBench

Zapier 出品的业务自动化基准:通过 REST API 跨应用编排销售/市场/运营/支持/财务/HR 的真实工作流

基本信息

类别
Agent 与环境
官网 / 数据集
https://arxiv.org/abs/2604.18934
论文
https://arxiv.org/abs/2604.18934

30 秒看懂

Zapier 业务自动化基准:销售/市场/运营/支持/财务/HR 六域各 100 题(公开集 600 题、47 个模拟 SaaS 工具),严格口径=全部断言通过才计 1 分,越高越好;2026 年中最强约 50%——真实业务工作流远未攻破。

采用格局:证据账本中 8 次引用;『业务自动化 Agent』叙事锚点

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 19 场模型发布(收录 29 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-30 Google DeepMind / Gemini·国际

Gemini 4 Argon

价格$2/$10 每百万 tokens · 介绍期价格,缓存输入价比输入价低 95%;介绍期结束后为输入 $4、输出 $20

Google 的新前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络安全防御,输出 token 上限提升到 1M。收录的 7 项评测以编码、智能体与安全为主,如 DeepSWE v1.1 77.9%、LVBench 91.7%;目前仅向可信网络防御者开放。

前沿模型网络安全防御1M 输出上限分阶段开放

查看模型变体与证据

AutomationBench 51.3%
2026-09-29 OpenAI·国际

GPT-6.1 Sol

价格$2/$10 每百万 tokens · 缓存输入 $0.10/百万 token

GPT-6 Sol 的升级版,定位是在智能体编程、计算机使用和专业工作上更接近 GPT-6 Astra,而标准价格仅为 Astra 的五分之一。收录的 7 项评测中 5 项为图表行(数值未读出),正文明示的事实错误率为 4.1%。

智能体编码计算机使用专业工作价格为 Astra 的五分之一

查看模型变体与证据

AutomationBench 1.0.6, medium reasoning 图表尚无可读数值
2026-09-22 Anthropic·国际

Claude Opus 5.5

价格$4/$20 每百万 tokens

面向代码、计算机操作和知识工作的模型。官方表格提供不同任务的分数,但协议与回退模型影响比较范围。

代码计算机操作知识工作

查看模型变体与证据

AutomationBench 40.0%
2026-09-22 OpenAI·国际

GPT-6 Sol / GPT-6 Luna

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 GPT-6 Sol 定位为日常复杂高价值任务的旗舰级高性价比工作马,以 GPT-5.6 Sol 一半的价格提供接近 Astra 的智能;收录评测覆盖企业自动化、软件工程、计算机操作与专业考试,AutomationBench 达 33.2%、DeepSWE 达 68.8%。

高性价比工作马长程自主代理软件工程GUI计算机操作

查看模型变体与证据

GPT-6 Sol · 1.0.6 33.2%GPT-6 Luna · 1.0.6 14.5%GPT-6 Luna · 1.0.6 20.7%
2026-09-22 Xiaomi / 小米·国内

MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed

本发布含 3 个变体,各变体规格见模型详情。

小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。

开源权重1.02T MoE1M 上下文原生全模态

查看模型变体与证据

MiMo-V2.6-Pro · v1.0.6 53.1MiMo-V2.6-Flash · v1.0.6 52.3
2026-09-19 StepFun / 阶跃星辰·国内

Step 5 Preview

参数600B total / 27B active MoE上下文1M模态文本·图像

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

稀疏 MoE 600B/27B1M 上下文视觉输入Agentic 长程任务

查看模型变体与证据

AutomationBench 51.0%public 44.0%
2026-09-10 DeepSeek·国内

DeepSeek-V4.1-Flash

参数552B (8B prefill / 16B decode active)上下文1M价格$0.15/$0.3 每百万 tokens · 高峰时段 $0.15/$0.30 每百万 tokens,闲时(00:30-08:30 UTC)减半至 $0.075/$0.15,缓存命中 $0.003-$0.006模态文本·图像·代码

DeepSeek 新一代非对称 Causal-Encoder-Decoder (CED) 架构的首款多模态 MoE 模型,总参 552B 仅激活 8B 输入与 16B 输出,KV Cache 显存缩减至 1/4;在 Terminal-Bench 2.1 达到 90.6%、GPQA Diamond 90.9%、DeepSWE v1.1 74.2% 与 CyberGym 88.1%,全面替代并下线 V4-Pro。

因果编解码器CED架构超高KV Cache压缩原生多模态视觉峰谷定价策略

查看模型变体与证据

AutomationBench 54.8%
2026-09-01 Anthropic·国际

Claude Fable 5.1 / Claude Mythos 5.1

本发布含 2 个变体,各变体规格见模型详情。

发布文定位:编码与知识工作上世界最先进的模型,其研究能力是 AI 将参与科学进步的早期一瞥。本档已收录 9 项基准,覆盖智能体科研、智能体编码、知识工作、计算机操作与商业工作流;亮点:Terminal-Bench 4.0 55.8%、Humanity's Last Exam(with tools)65.0%。

编码与知识工作旗舰长时程问题求解生产安全护栏下评测缓存读降价 75%

查看模型变体与证据

Claude Fable 5.1 · AutomationBench 31.4%
2026-08-28 Tencent / 腾讯混元·国内

Hy4 preview

参数770B-A49B MoE上下文1M模态文本

发布文将 Hy4 preview 定位为 770B 总参/49B 激活、1M 上下文、Apache 2.0 开源的旗舰预览版(各模型均按最高推理档评测)。46 项评测集中于智能体编码与搜索、工作智能体及 STEM 推理,亮点为 Terminal-Bench 2.1 85.4 与 SWE-bench Multilingual 82.9。

开源权重长上下文智能体

查看模型变体与证据

v1.0.6 32.1
2026-08-26 Z.ai / 智谱 GLM·国内

GLM-5.3-Flash

参数320B-A18B MoE模态文本·图像·视频

GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。

开源权重原生多模态高性价比编码与 Agent

查看模型变体与证据

v1.0.6 48.8
2026-08-26 OpenAI·国际

GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。

旗舰多档努力智能体安全防护

查看模型变体与证据

GPT-5.6 Sol · AutomationBench 18.1%GPT-5.6 Terra · AutomationBench 15.2%GPT-5.6 Luna · AutomationBench 14.9%gpt-5-5 · AutomationBench 12.9%claude-fable-5 · AutomationBench 17.4%claude-opus-4-8 · AutomationBench 15.5%gemini-3-5-flash · AutomationBench 14.5%
2026-08-21 DeepSeek·国内

DeepSeek-V4-Flash-Vision-Exp

模态文本·图像

DeepSeek 将 V4-Flash-Vision-Exp 定位为开启多模态 API 服务的实验性多模态模型,官方称其纯文本能力与 V4-Flash 持平、向 Opus-4.8 收敛多模态 Agent 差距。已收录 11 项评测(文本 Agent 与多模态 Agent 两组):亮点 Terminal-Bench 2.1 83.9、CyberGym 75.3。

实验性多模态API 模型Agent 增强

查看模型变体与证据

public subset 25.7
2026-08-13 DeepSeek·国内

DeepSeek V4 Pro

模态文本

DeepSeek 发布 V4 Pro 正式版,同步上线 APP/网页端/API(API 模型名不变),官方定位为正式版增强了 Agent 能力、在生产环境中的性能表现提升尤为显著。本发布收录的 10 项评测全部为 Agent 向(编码智能体、网络安全、工具调用、数据科学与自动化智能体),官方以单张对比图给出与 GLM-5.2 / Kimi-K3 / Opus-4.8 / Fable 5 的对比,数值以人工读图确认前不计入公开计数。

正式版 GAAgent 能力增强Responses API 原生支持三档思考强度

查看模型变体与证据

Public, GA 快照 0813 图表尚无可读数值
2026-08-13 Google DeepMind / Gemini·国际

Gemini 3.7 Flash

价格$0.75/$3.75 每百万 tokens · 促销价(原 3.6 Flash 半价),2026-12-31 到期;2027-01-01 起 $1.50/$7.50模态文本·图像·视频

Gemini 3.7 Flash 被定位为面向编码与代理的旗舰 workhorse 模型(most intelligent workhorse model for coding and agents)。评测聚焦编码与代理工作流并延伸到文档/视频理解:DeepSWE v1.1 65.3%、Terminal-bench 2.1 85.8%、WebDev Arena 1588 Elo、GDP.pdf 34.0%。

多模态代理编码文档理解

查看模型变体与证据

AutomationBench 30.4%
2026-08-03 Alibaba / Qwen·国内

Qwen3.8-Max

参数2.4T(激活 95B)模态文本·图像·视频

通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。

开源权重(预告)多模态智能体长周期任务编程与办公

查看模型变体与证据

Pass@1 27.3
2026-08 Z.ai / 智谱 GLM·国内

GLM-5.3

模态文本

GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。

开源权重思考默认开启编码专精网络安全

查看模型变体与证据

v1.0.6 48.2
2026-07-24 Anthropic·国际

Claude Opus 5

模态文本·图像

Anthropic 发布 Claude Opus 5,effort 分档 high/xhigh/max 并提供 Fast 模式;页面数值多为图表与对比性表述(含大量内部评测)。已收录 18 项评测覆盖前沿编码、Agent 操作与法律/健康/生物专业域:亮点 DeepSWE v1.1 68.8、BrowseComp 90.8。

旗舰effort 分档Fast 模式编码与 Agent

查看模型变体与证据

AutomationBench 26.0
2026-07 Moonshot AI / Kimi·国内

Kimi K3

上下文1M模态文本·图像

Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。

开源权重推理增强1M 长上下文Agentic

查看模型变体与证据

600-task public subset 30.8
2026-06-09 Anthropic·国际

Claude Fable 5 / Claude Mythos 5

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 以「Claude Fable 5 与 Claude Mythos 5」联合公告发布 Fable 5:一款带安全护栏的 Mythos 级模型,在网络安全/生物化学/蒸馏话题上按分类器回退到 Opus 4.8(影响 <5% 会话)。评测覆盖智能体编码、知识工作、计算机使用与生物安全,亮点如 SWE-Bench Pro 80.3%、OSWorld-Verified 85.0%。

前沿旗舰安全护栏智能体编码多模态

查看模型变体与证据

Claude Fable 5 · AutomationBench 17.4

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。