τ-bench

客服场景多轮对话+工具调用,用户模拟器评分

基本信息

类别
Agent 与环境
官网 / 数据集
https://github.com/sierra-research/tau-bench
论文
https://arxiv.org/abs/2406.12045

30 秒看懂

模拟客服场景:多轮对话 + 调工具 + 不把用户惹毛。pass^k 要求连续 k 次都成功,是对稳定性的苛刻要求。

采用格局:Agent 叙事厂商的工具调用标配(5/11 家)

评分协议

零售/航空域,pass^k(全部轨迹一致成功)

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 15 场模型发布(收录 29 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-04-02 Google DeepMind / Gemini·国际

Gemma 4 E2B / Gemma 4 E4B / Gemma 4 26B MoE / Gemma 4 31B Dense

本发布含 4 个变体,各变体规格见模型详情。

面向本地运行的开放权重模型,支持推理与工具调用;本变体输入能力和上下文按官方发布页记录。

开放权重本地运行

查看模型变体与证据

Gemma 4 31B Dense · Tau2 (average over 3) 76.9%Gemma 4 26B MoE · Tau2 (average over 3) 68.2%Gemma 4 E4B · Tau2 (average over 3) 42.2%Gemma 4 E2B · Tau2 (average over 3) 24.5%
2026-02-11 Z.ai / 智谱 GLM·国内

GLM-5

参数744B-A40B MoE上下文200K模态文本

智谱以「From Vibe Coding to Agentic Engineering」为主题发布 GLM-5:744B 总参/40B 激活的 MoE(DSA 架构,28.5T 预训练 tokens),MIT 许可开源。评测覆盖推理、编码与通用智能体,亮点如 HMMT 2025.11 96.9%、τ²-Bench 89.7%。

开源权重智能体工程推理编码

查看模型变体与证据

2 (with domain prompt fixes) 89.7
2025
2025-12-22 Z.ai / 智谱 GLM·国内

GLM-4.7

模态文本

发布文以“推进编码能力”为题,将 GLM-4.7 定位为编码与智能体任务导向的模型,支持交错/保留/回合级思考模式。17 项评测覆盖数理推理、代码智能体与通用智能体,亮点为 HMMT 2025 二月场 97.1 与 τ²-Bench 87.4(SWE-bench Verified 73.8)。

编码开源权重思考模式智能体

查看模型变体与证据

2, temp 0 + domain prompt fixes 87.4
2025-12-01 DeepSeek·国内

DeepSeek-V3.2 / DeepSeek-V3.2-Speciale

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 官方将 V3.2 正式版定位为「强化 Agent 能力、融入思考推理」,是 DeepSeek 首个将思考与工具调用融合的模型。已收录 26 项评测覆盖数学竞赛、代码、知识与工具/Agent 使用:亮点 AIME 2025(Thinking)93.1、Codeforces(Thinking)2386。

开源权重思考融合工具调用Agent 增强

查看模型变体与证据

DeepSeek-V3.2 · 2, Thinking 80.3
2025-10-27 MiniMax·国内

MiniMax-M2

价格$0.3/$1.2 每百万 tokens · 页面同时给出人民币定价:输入 ¥2.1、输出 ¥8.4 每百万 tokens;另载限时免费试用至 2025-11-07模态文本

发布文以“简中之巧(Ingenious in Simplicity)”为题,将 M2 定位为 agent 优先的开源权重模型,价格约为 Claude Sonnet 的 8%、速度约 2 倍。9 项评测集中于智能体编码、工具调用与搜索,亮点为 GAIA(纯文本)75.7 与 τ²-Bench 77.2。

开源权重智能体优先高性价比

查看模型变体与证据

2 77.2
2025-09-30 Z.ai / 智谱 GLM·国内

GLM-4.6

上下文200K模态文本

智谱将 GLM-4.6 定位为具备高级 Agentic、推理与编程能力的模型,上下文由 128K 扩展至 200K,推理中可交织工具调用。评测以编码与智能体为主,亮点如 CC-Bench 对 Claude Sonnet 4 胜率 48.6%、AIME 25 93.9%。

开源权重编码智能体推理

查看模型变体与证据

2, weighted 75.9
2025-09-24 Alibaba / Qwen·国内

Qwen3-Max-Instruct / Qwen3-Max-Thinking

本发布含 2 个变体,各变体规格见模型详情。

Qwen3-Max 发布以「大就是好(Just Scale it)」为题,Instruct 为超 1T 总参 MoE 旗舰(36T 预训练 tokens、全局 batch 负载均衡损失,ChunkFlow 支持 1M 长上下文训练)。已收录 9 项评测:亮点 SWE-bench Verified 69.6、LMArena 文本榜 1430。

超大规模 MoEAPI 旗舰1M 长上下文

查看模型变体与证据

Qwen3-Max-Instruct · 2, weighted (Tau2-Bench) 74.8
2025-07-28 Z.ai / 智谱 GLM·国内

GLM-4-Air

参数未公开上下文128K tokens价格$1/$1 每百万 tokens模态文本

智谱 AI 高性能极致性价比基座大模型,面向企业级大规模并发场景提供强大的文本理解与智能体调用能力。

企业级高并发长上下文推理工具调用强化高性价比底座

查看模型变体与证据

τ-bench 图表尚无可读数值
2025-07-22 Alibaba / Qwen·国内

Qwen3-Coder-480B-A35B-Instruct

参数480B-A35B MoE上下文256K(YaRN 可扩至 1M)模态文本

Qwen3-Coder-480B-A35B-Instruct 以「Agentic Coding in the World」为定位发布,480B MoE/35B 激活,原生 256K 上下文(YaRN 可扩至 1M)。已收录 15 项评测集中于代码仓库、终端与浏览器/工具 Agent:亮点 SWE-bench Verified(OpenHands 500 turns)69.6、Terminal-Bench 37.5。

开源权重代码专精Agentic Coding长上下文

查看模型变体与证据

retail 77.5airline 60
2025-07-11 Moonshot AI / Kimi·国内

Kimi-K2-Instruct / Kimi-K2-Base

本发布含 2 个变体,各变体规格见模型详情。

Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。

开源权重1T MoE非思考 reflex 档Agentic

查看模型变体与证据

Kimi-K2-Instruct · Tau2 retail 70.6Kimi-K2-Instruct · Tau2 airline 56.5Kimi-K2-Instruct · Tau2 telecom 65.8
2025-06-27 Tencent / 腾讯混元·国内

Hunyuan-A13B-Instruct / Hunyuan-A13B-Pretrain / Hunyuan-A13B-Instruct-FP8 / Hunyuan-A13B-Instruct-GPTQ-Int4

本发布含 4 个变体,各变体规格见模型详情。

腾讯混元以「细粒度 MoE、80B 总参/13B 激活」开源 A13B 系列,Instruct 为指令版(256K 上下文,/think 与 /no_think 双模式,默认慢思考)。已收录 21 项 Instruct 表评测覆盖知识、数学、代码与 Agent 工具调用:亮点 AIME24 87.3、GPQA Diamond 71.2。

开源权重细粒度 MoE256K 长上下文快慢思考双模式

查看模型变体与证据

Hunyuan-A13B-Instruct · τ-bench 54.7
2025-06-16 MiniMax·国内

MiniMax abab 6.5

参数千亿 MoE上下文245K tokens模态文本

MiniMax 稀疏混合专家大语言模型,支持 245K 超长上下文窗口与万级汉字复杂指令遵循。

千亿稀疏MoE245K超长上下文复杂指令遵循自研线性注意力

查看模型变体与证据

τ-bench 图表尚无可读数值
2025-05-22 Anthropic·国际

Claude Opus 4 / Claude Sonnet 4

本发布含 2 个变体,各变体规格见模型详情。

Claude 4 发布中 Opus 4 为最强编码档,采用混合模式(近即时回答 + 扩展思考,扩展思考可与工具调用结合,beta)。已收录 22 项评测覆盖软件工程、终端、知识与 Agent:亮点 SWE-bench Verified 72.5%(并行测试时计算 79.4%)。

旗舰编码扩展思考工具调用融合

查看模型变体与证据

Claude Opus 4 · Retail / Airline split Retail 81.4 / Airline 59.6Claude Sonnet 4 · Retail / Airline split Retail 80.5 / Airline 60.0
2025-04-16 OpenAI·国际

OpenAI o3 / OpenAI o4-mini

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 o3 定位为其最强推理模型,在编码、数学、科学与视觉感知等领域推进前沿,并支持以图思考(Thinking with images)。该发布已收录评测覆盖数学、编程竞赛、科学推理、软件工程与智能体工具使用等领域,AIME 2025 配 Python 工具 pass@1 98.4%、100% consensus@8。

推理旗舰以图思考智能体工具使用

查看模型变体与证据

o1 · Airline (high effort) 50%o1 · Retail (high effort) 70.8%o3-mini · Airline (high effort) 32.4%o3-mini · Retail (high effort) 57.6%OpenAI o3 · Airline (high effort) 52%OpenAI o3 · Retail (high effort) 70.4%OpenAI o4-mini · Airline (high effort) 49.2%OpenAI o4-mini · Retail (high effort) 65.6%
2025-01-20 Moonshot AI / Kimi·国内

Kimi k1.5

参数未公开上下文128K tokens模态文本·图像

月之暗面面向深度推理的长思维链强化学习大模型,在数学奥林匹克、复杂编程与视觉长程推理任务上展现出突破性表现。

强化学习深度推理长思维链思考数学竞赛突破图文多模态推理

查看模型变体与证据

τ-bench 图表尚无可读数值

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。