Toolathlon

HKUST NLP 出品的工具 Agent 基准(论文题 The Tool Decathlon):32 个仿真真实软件 App、600+ 工具上的长程任务执行

基本信息

类别
Agent 与环境
官网 / 数据集
https://arxiv.org/abs/2510.25726
论文
https://arxiv.org/abs/2510.25726

30 秒看懂

108 个跨应用长程工具任务(32 个仿真软件、604 个工具,平均约 20 轮交互),每题用专用脚本严格判定,任务成功率越高越好;发布时 Claude-4.5-Sonnet 仅 38.6%。

采用格局:证据账本中 toolathlon(14 次)与 tool-decathlon(5 次)同指此基准,已合并建档

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 25 场模型发布(收录 39 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-22 Xiaomi / 小米·国内

MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed

本发布含 3 个变体,各变体规格见模型详情。

小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。

开源权重1.02T MoE1M 上下文原生全模态

查看模型变体与证据

MiMo-V2.6-Pro · verified 76.9MiMo-V2.6-Flash · verified 73.6
2026-09-19 StepFun / 阶跃星辰·国内

Step 5 Preview

参数600B total / 27B active MoE上下文1M模态文本·图像

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

稀疏 MoE 600B/27B1M 上下文视觉输入Agentic 长程任务

查看模型变体与证据

Verified 74.1%
2026-08-28 Tencent / 腾讯混元·国内

Hy4 preview

参数770B-A49B MoE上下文1M模态文本

发布文将 Hy4 preview 定位为 770B 总参/49B 激活、1M 上下文、Apache 2.0 开源的旗舰预览版(各模型均按最高推理档评测)。46 项评测集中于智能体编码与搜索、工作智能体及 STEM 推理,亮点为 Terminal-Bench 2.1 85.4 与 SWE-bench Multilingual 82.9。

开源权重长上下文智能体

查看模型变体与证据

Verified (108 tasks) 74.1
2026-08-26 Z.ai / 智谱 GLM·国内

GLM-5.3-Flash

参数320B-A18B MoE模态文本·图像·视频

GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。

开源权重原生多模态高性价比编码与 Agent

查看模型变体与证据

Verified 78.4
2026-08-26 OpenAI·国际

GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。

旗舰多档努力智能体安全防护

查看模型变体与证据

GPT-5.6 Sol · Toolathlon 58%GPT-5.6 Terra · Toolathlon 53.1%GPT-5.6 Luna · Toolathlon 53.4%gpt-5-5 · Toolathlon 55.6%claude-mythos-5 · Toolathlon 61.7%claude-mythos-preview · Toolathlon 61.1%claude-fable-5 · Toolathlon 61.7%claude-opus-4-8 · Toolathlon 59.9%gemini-3-1-pro · Toolathlon 48.8%
2026-08-26 Alibaba / Qwen·国内

Qwen3.8-Flash-Next / Qwen3.8-Flash-Next-Base

本发布含 2 个变体,各变体规格见模型详情。

Qwen3.8-Flash-Next 被发布文定位为迈向极致性价比的全新架构预览(GDN+QSA 混合注意力、N-gram Embedding、Muon 优化器),为 Qwen4 架构探路。评测覆盖代理编码/办公、多模态代理与通用推理:SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、AndroidWorld 84.5。

MoE 稀疏激活原生 256K 上下文多模态架构预览

查看模型变体与证据

Qwen3.8-Flash-Next · Verified, Pass@1 73.5
2026-08-21 DeepSeek·国内

DeepSeek-V4-Flash-Vision-Exp

模态文本·图像

DeepSeek 将 V4-Flash-Vision-Exp 定位为开启多模态 API 服务的实验性多模态模型,官方称其纯文本能力与 V4-Flash 持平、向 Opus-4.8 收敛多模态 Agent 差距。已收录 11 项评测(文本 Agent 与多模态 Agent 两组):亮点 Terminal-Bench 2.1 83.9、CyberGym 75.3。

实验性多模态API 模型Agent 增强

查看模型变体与证据

Verified 75.9
2026-08-13 DeepSeek·国内

DeepSeek V4 Pro

模态文本

DeepSeek 发布 V4 Pro 正式版,同步上线 APP/网页端/API(API 模型名不变),官方定位为正式版增强了 Agent 能力、在生产环境中的性能表现提升尤为显著。本发布收录的 10 项评测全部为 Agent 向(编码智能体、网络安全、工具调用、数据科学与自动化智能体),官方以单张对比图给出与 GLM-5.2 / Kimi-K3 / Opus-4.8 / Fable 5 的对比,数值以人工读图确认前不计入公开计数。

正式版 GAAgent 能力增强Responses API 原生支持三档思考强度

查看模型变体与证据

Verified, GA 快照 0813 图表尚无可读数值
2026-08-03 Alibaba / Qwen·国内

Qwen3.8-Max

参数2.4T(激活 95B)模态文本·图像·视频

通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。

开源权重(预告)多模态智能体长周期任务编程与办公

查看模型变体与证据

Verified, Pass@1 72.5
2026-08 Z.ai / 智谱 GLM·国内

GLM-5.3

模态文本

GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。

开源权重思考默认开启编码专精网络安全

查看模型变体与证据

Verified 73.0
2026-07-06 Tencent / 腾讯混元·国内

Hy3

参数295B-A21B MoE上下文256K价格¥1/¥4 每百万 tokens · 页面原文为 1/4/0.25 元/百万 tokens 三档报价,第三档含义未标注模态文本

腾讯发布混元 Hy3:295B 总参/21B 激活 MoE、256K 上下文、三种思考模式,Apache 2.0 开源。评测覆盖编码、智能体搜索与推理,亮点如 SWE-bench Verified 78%、BrowseComp 84.2%。

开源权重长上下文三档思考智能体

查看模型变体与证据

Toolathlon 48.5
2026-07 Moonshot AI / Kimi·国内

Kimi K3

上下文1M模态文本·图像

Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。

开源权重推理增强1M 长上下文Agentic

查看模型变体与证据

Verified 73.2
2026-06-23 ByteDance Seed / 豆包·国内

Seed2.1 Pro / Seed2.1 Turbo / Seed2.1 Preview

本发布含 3 个变体,各变体规格见模型详情。

字节 Seed2.1 发布将 Pro 定位为系列最高档,官方称评估优先考察真实工作流表现而非静态榜单分数。已收录评测横跨通用 Agent、编码、多模态与视频理解:亮点 GDPval 87.9、OSWorld 78.8。

Pro 档Agent 向多模态视频理解

查看模型变体与证据

Seed2.1 Pro · Toolathlon 50.6
2026-06-16 Z.ai / 智谱 GLM·国内

GLM-5.2

上下文1M模态文本

智谱将 GLM-5.2 定位为面向长周期任务构建的模型,提供稳固支撑长程工作的 1M 上下文与更强编码能力(High/Max 档位控制),权重以 MIT 协议完全开源。已收录评测聚焦智能体编码与工具调用、长程软件工程与数学推理等领域,AIME 2026 99.2、Terminal-Bench 2.1(Terminus-2)81。

开源权重1M 长上下文推理档位控制智能体编码

查看模型变体与证据

Toolathlon 48.2
2026-05-29 StepFun / 阶跃星辰·国内

Step 3.7 Flash

参数196B-A11B(另含 1.8B ViT)上下文256K模态文本·图像

Step 3.7 Flash 被阶跃星辰定位为面向真实场景代理的高效率 Flash 模型,支持三档推理级别、最高 400 tok/s。评测覆盖通用代理、编码与长上下文/视觉:BrowseComp 75.8%、HLE w. tool 47.2%、SWE-bench Verified 76.5%、V* 95.29%。

MoE 稀疏激活多模态高效率256K 上下文

查看模型变体与证据

Toolathlon 49.5
2026-05-19 Google DeepMind / Gemini·国际

Gemini 3.5 Flash

上下文1M模态文本·图像

Google 在 I/O 2026 发布 Gemini 3.5 首个模型 Gemini 3.5 Flash,定位「frontier intelligence with action」,并成为 Gemini 应用与 Search AI Mode 的默认模型。评测横跨终端智能体、多模态理解与抽象推理,亮点如 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%,页面并称输出速度约为其他前沿模型 4 倍。

多模态高速输出智能体长上下文

查看模型变体与证据

Toolathlon 56.5%
2026-04-24 DeepSeek·国内

DeepSeek-V4-Pro / DeepSeek-V4-Flash

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 发布 V4 预览版「迈入百万上下文普惠时代」,V4-Pro 为旗舰:1M 上下文、思考/非思考双模式、reasoning_effort high/max。评测覆盖推理、编码、智能体与百万级长上下文,亮点如 GPQA Diamond 90.1%、Codeforces 3206。

开源权重长上下文推理增强预览版

查看模型变体与证据

DeepSeek-V4-Pro · Pro max effort 51.8DeepSeek-V4-Flash · Flash max effort 47.8
2026-04-23 OpenAI·国际

GPT-5.5 / GPT-5.5 Pro

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 发布 GPT-5.5,提供 low/medium/high/xhigh 推理档(另有非推理模式)。评测横跨智能体编码、知识工作、长上下文与科学/网络安全,亮点如 Terminal-Bench 2.0 82.7%、ARC-AGI-2 85.0%。

智能体编码知识工作长上下文网络安全

查看模型变体与证据

GPT-5.5 · Toolathlon 55.6%gpt-5-4 · Toolathlon 54.6%gemini-3-1-pro · Toolathlon 48.8%
2026-04-20 Moonshot AI / Kimi·国内

Kimi K2.6

上下文256K模态文本·图像

Kimi K2.6 是月之暗面的开源编码旗舰(Advancing Open-Source Coding),主打长程编码与代理蜂群(300 子代理 / 4000 步)。评测横跨编码、代理、数学与视觉:SWE-bench Verified 80.2、SWE-Bench Pro 58.6、Terminal-Bench 2.0(Terminus-2)66.7、HLE-Full w/ tools 54.0。

开源权重编码增强代理蜂群多模态

查看模型变体与证据

Toolathlon 50.0
2026-04-07 Z.ai / 智谱 GLM·国内

GLM-5.1

模态文本

GLM-5.1 被 z.ai 定位为面向长程任务(Towards Long-Horizon Tasks)的代理工程旗舰,强调数百轮持续优化与长时程任务能力。评测集中在推理、编码与代理三类:SWE-Bench Pro 58.4、Terminal-Bench 2.0(Terminus-2)63.5、BrowseComp(w/ 上下文管理)79.3、HLE w/ Tools 52.3。

开源权重长程任务代理工程

查看模型变体与证据

Toolathlon 40.7
2026-03-18 MiniMax·国内

MiniMax-M2.7

模态文本

MiniMax 发布 M2.7「Early Echoes of Self-Evolution」,定位为首个深度参与自身进化的 M 系列模型,支持 Agent Teams、复杂 Skills 与动态工具搜索。评测集中在智能体与编码,亮点如 SWE-Bench Pro 56.2%、MLE-Bench Lite 66.6%。

开源权重智能体自我进化办公

查看模型变体与证据

Toolathlon 46.3%
2026-03-05 OpenAI·国际

GPT-5.4 / GPT-5.4 Pro / GPT-5.4 mini / GPT-5.4 nano

本发布含 4 个变体,各变体规格见模型详情。

OpenAI 将 GPT-5.4 定位为融合 GPT-5.3-Codex 编码谱系的新旗舰(ChatGPT 内 Thinking 模式,effort none/low/medium/high/xhigh,1M 上下文,原生计算机操作与工具搜索)。已收录 90 余项评测横跨知识工作、编码、计算机操作与长上下文:亮点 GDPval 83.0%、OSWorld-Verified 75.0%。

旗舰1M 长上下文原生计算机操作工具搜索

查看模型变体与证据

GPT-5.4 · Toolathlon 54.6%gpt-5-3-codex · Toolathlon 51.9%gpt-5-2 · Toolathlon 46.3%
2026-02-11 Z.ai / 智谱 GLM·国内

GLM-5

参数744B-A40B MoE上下文200K模态文本

智谱以「From Vibe Coding to Agentic Engineering」为主题发布 GLM-5:744B 总参/40B 激活的 MoE(DSA 架构,28.5T 预训练 tokens),MIT 许可开源。评测覆盖推理、编码与通用智能体,亮点如 HMMT 2025.11 96.9%、τ²-Bench 89.7%。

开源权重智能体工程推理编码

查看模型变体与证据

Toolathlon 39.2
2025
2025-12-17 Google DeepMind / Gemini·国际

Gemini 3 Flash

上下文1M价格$0.5/$3 每百万 tokens模态文本·图像·视频

Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。

速度优先多模态1M 长上下文编码与 Agent

查看模型变体与证据

Toolathlon 49.4%
2025-12-01 DeepSeek·国内

DeepSeek-V3.2 / DeepSeek-V3.2-Speciale

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 官方将 V3.2 正式版定位为「强化 Agent 能力、融入思考推理」,是 DeepSeek 首个将思考与工具调用融合的模型。已收录 26 项评测覆盖数学竞赛、代码、知识与工具/Agent 使用:亮点 AIME 2025(Thinking)93.1、Codeforces(Thinking)2386。

开源权重思考融合工具调用Agent 增强

查看模型变体与证据

DeepSeek-V3.2 · Toolathlon 35.2

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。