MCP-Atlas

Scale AI 出品的 MCP 工具能力基准:1000 道人写任务横跨 36 个真实 MCP 服务器与 220 个工具,claim 级评分

基本信息

类别
Agent 与环境
官网 / 数据集
https://labs.scale.com/leaderboard/mcp_atlas
论文
https://arxiv.org/abs/2602.00933

30 秒看懂

0.75 claim 覆盖阈值下旗舰最高 82.2 分;63.3% 的诊断失败是认知性(综合/提前停止)而非工具调用本身——分数低不等于不会调工具。

采用格局:证据账本中 18 次引用,是 MCP 工具叙事的高频锚点

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 21 场模型发布(收录 26 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-19 StepFun / 阶跃星辰·国内

Step 5 Preview

参数600B total / 27B active MoE上下文1M模态文本·图像

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

稀疏 MoE 600B/27B1M 上下文视觉输入Agentic 长程任务

查看模型变体与证据

MCP-Atlas 85.6%
2026-08-28 Tencent / 腾讯混元·国内

Hy4 preview

参数770B-A49B MoE上下文1M模态文本

发布文将 Hy4 preview 定位为 770B 总参/49B 激活、1M 上下文、Apache 2.0 开源的旗舰预览版(各模型均按最高推理档评测)。46 项评测集中于智能体编码与搜索、工作智能体及 STEM 推理,亮点为 Terminal-Bench 2.1 85.4 与 SWE-bench Multilingual 82.9。

开源权重长上下文智能体

查看模型变体与证据

500-task public set 83.7
2026-08-10 Meta / Llama·国际

Muse Glimmer 30B

参数29.6B(dense)+ 1.8B ViT模态文本·图像

Muse Glimmer 30B 被 Meta 定位为可在消费级设备上运行的开源代理模型(Apache 2.0,由 Muse Spark 蒸馏,24-32GB 显存可跑)。评测覆盖通用代理、代理编码、多模态与安全:MCP Atlas 75.5%、SWE-bench Verified 76.0%、AIME 2026 94.7%;另提供 K-Quant 量化档与 DFlash 投机解码加速。

开源权重端侧可运行代理增强多模态

查看模型变体与证据

Public 75.5%
2026-08-05 Meta / Llama·国际

Muse Spark 1.2 / Muse Code

本发布含 2 个变体,各变体规格见模型详情。

Meta 将 Muse Spark 1.2 定位为 Muse Spark 1.1 的编码向升级版,与 Muse Code 终端代理协同训练,经 Muse Code、Meta Model API、OpenRouter 提供。已收录 5 项评测集中于终端与软件工程 Agent:亮点 Terminal-Bench 2.1 82.9、DeepSWE 1.1 59.3,另含 GDPval-AA v2 与 MCP Atlas 第三方条目(未录数值)。

编码专精与 Muse Code 协同训练长程任务

查看模型变体与证据

Muse Spark 1.2 · MCP-Atlas 该来源尚无可读数值
2026-07-09 Meta / Llama·国际

Muse Spark 1.1

上下文1M模态文本·图像

Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。

智能体基础1M 上下文公测 API安全评估覆盖

查看模型变体与证据

Scaled tool use 88.1%
2026-07-06 Tencent / 腾讯混元·国内

Hy3

参数295B-A21B MoE上下文256K价格¥1/¥4 每百万 tokens · 页面原文为 1/4/0.25 元/百万 tokens 三档报价,第三档含义未标注模态文本

腾讯发布混元 Hy3:295B 总参/21B 激活 MoE、256K 上下文、三种思考模式,Apache 2.0 开源。评测覆盖编码、智能体搜索与推理,亮点如 SWE-bench Verified 78%、BrowseComp 84.2%。

开源权重长上下文三档思考智能体

查看模型变体与证据

500-task public set 79.1
2026-07 Moonshot AI / Kimi·国内

Kimi K3

上下文1M模态文本·图像

Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。

开源权重推理增强1M 长上下文Agentic

查看模型变体与证据

500-task public subset 84.2
2026-06-23 ByteDance Seed / 豆包·国内

Seed2.1 Pro / Seed2.1 Turbo / Seed2.1 Preview

本发布含 3 个变体,各变体规格见模型详情。

字节 Seed2.1 发布将 Pro 定位为系列最高档,官方称评估优先考察真实工作流表现而非静态榜单分数。已收录评测横跨通用 Agent、编码、多模态与视频理解:亮点 GDPval 87.9、OSWorld 78.8。

Pro 档Agent 向多模态视频理解

查看模型变体与证据

Seed2.1 Pro · MCP-Atlas 83.8
2026-06-16 Z.ai / 智谱 GLM·国内

GLM-5.2

上下文1M模态文本

智谱将 GLM-5.2 定位为面向长周期任务构建的模型,提供稳固支撑长程工作的 1M 上下文与更强编码能力(High/Max 档位控制),权重以 MIT 协议完全开源。已收录评测聚焦智能体编码与工具调用、长程软件工程与数学推理等领域,AIME 2026 99.2、Terminal-Bench 2.1(Terminus-2)81。

开源权重1M 长上下文推理档位控制智能体编码

查看模型变体与证据

500-task public set 76.8
2026-06-01 MiniMax·国内

MiniMax-M3 / MiniMax-M2.7

本发布含 2 个变体,各变体规格见模型详情。

MiniMax M3 被发布文定位为将前沿编码、1M 上下文与原生多模态合一的单模型(Frontier Coding, 1M Context, Native Multimodality - All in One Model),采用 MSA 稀疏注意力并支持思考开关。评测覆盖编码、协作代理、GUI 与多模态:SWE-Bench Verified 80.5、BrowseComp 83.52、OSWorld-Verified 70.06、IMO 2025 35/42。

1M 上下文原生多模态编码增强MSA 稀疏注意力

查看模型变体与证据

MiniMax-M3 · MCP-Atlas 74.2%
2026-05-19 Google DeepMind / Gemini·国际

Gemini 3.5 Flash

上下文1M模态文本·图像

Google 在 I/O 2026 发布 Gemini 3.5 首个模型 Gemini 3.5 Flash,定位「frontier intelligence with action」,并成为 Gemini 应用与 Search AI Mode 的默认模型。评测横跨终端智能体、多模态理解与抽象推理,亮点如 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%,页面并称输出速度约为其他前沿模型 4 倍。

多模态高速输出智能体长上下文

查看模型变体与证据

MCP-Atlas 83.6%
2026-05 Alibaba / Qwen·国内

Qwen3.7-Max

上下文1M模态文本

发布文以“智能体新前沿”为题,将 Qwen3.7-Max 定位为面向智能体时代的新一代旗舰(经阿里云百炼 API 提供,在 Claude Code/OpenClaw/Qwen Code 间泛化)。40 余项评测覆盖智能体编码、工具与办公场景及数理推理,亮点为 HMMT 2026 二月场 97.1 与 SWE-bench Verified 80.4。

旗舰智能体跨框架泛化

查看模型变体与证据

MCP-Atlas 76.4
2026-04-24 DeepSeek·国内

DeepSeek-V4-Pro / DeepSeek-V4-Flash

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 发布 V4 预览版「迈入百万上下文普惠时代」,V4-Pro 为旗舰:1M 上下文、思考/非思考双模式、reasoning_effort high/max。评测覆盖推理、编码、智能体与百万级长上下文,亮点如 GPQA Diamond 90.1%、Codeforces 3206。

开源权重长上下文推理增强预览版

查看模型变体与证据

DeepSeek-V4-Pro · public set, Pro max effort 73.6DeepSeek-V4-Flash · public set, Flash max effort 69.0
2026-04-23 OpenAI·国际

GPT-5.5 / GPT-5.5 Pro

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 发布 GPT-5.5,提供 low/medium/high/xhigh 推理档(另有非推理模式)。评测横跨智能体编码、知识工作、长上下文与科学/网络安全,亮点如 Terminal-Bench 2.0 82.7%、ARC-AGI-2 85.0%。

智能体编码知识工作长上下文网络安全

查看模型变体与证据

GPT-5.5 · MCP-Atlas 75.3%gpt-5-4 · MCP-Atlas 70.6%claude-opus-4-7 · MCP-Atlas 79.1%gemini-3-1-pro · MCP-Atlas 78.2%
2026-04-16 Anthropic·国际

Claude Opus 4.7 / Claude Opus 4.7 (fast)

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 将 Claude Opus 4.7 定位为在高级软件工程上较 Opus 4.6 显著提升、最难任务上增益尤为明显的旗舰模型,同时大幅增强视觉分辨率;这也是首个按 Project Glasswing 分级防护方案发布的模型。已收录评测覆盖智能体编码与终端、长上下文检索、计算机操作、网络安全与多学科推理等领域,SWE-bench Verified 87.6、GPQA Diamond 94.2。

智能体编码高分辨率视觉推理档位控制分级网络安全防护

查看模型变体与证据

Claude Opus 4.7 · MCP-Atlas 77.3
2026-04-07 Z.ai / 智谱 GLM·国内

GLM-5.1

模态文本

GLM-5.1 被 z.ai 定位为面向长程任务(Towards Long-Horizon Tasks)的代理工程旗舰,强调数百轮持续优化与长时程任务能力。评测集中在推理、编码与代理三类:SWE-Bench Pro 58.4、Terminal-Bench 2.0(Terminus-2)63.5、BrowseComp(w/ 上下文管理)79.3、HLE w/ Tools 52.3。

开源权重长程任务代理工程

查看模型变体与证据

500-task public set 71.8
2026-03-05 OpenAI·国际

GPT-5.4 / GPT-5.4 Pro / GPT-5.4 mini / GPT-5.4 nano

本发布含 4 个变体,各变体规格见模型详情。

OpenAI 将 GPT-5.4 定位为融合 GPT-5.3-Codex 编码谱系的新旗舰(ChatGPT 内 Thinking 模式,effort none/low/medium/high/xhigh,1M 上下文,原生计算机操作与工具搜索)。已收录 90 余项评测横跨知识工作、编码、计算机操作与长上下文:亮点 GDPval 83.0%、OSWorld-Verified 75.0%。

旗舰1M 长上下文原生计算机操作工具搜索

查看模型变体与证据

GPT-5.4 · MCP-Atlas 67.2%gpt-5-2 · MCP-Atlas 60.6%
2026-02-19 Google DeepMind / Gemini·国际

Gemini 3.1 Pro

上下文1M模态文本·图像

Google 将 Gemini 3.1 Pro 定位为「为最复杂任务打造的更聪明模型」,基于 Gemini 3 Pro,发布时为 preview(thinking 档 low/medium/high)。已收录 19 项评测横跨推理、代码、多模态与长上下文:亮点 GPQA 94.3%、SWE-bench Verified 80.6%。

旗舰1M 长上下文多模态Preview

查看模型变体与证据

MCP-Atlas 69.2%
2026-02-11 Z.ai / 智谱 GLM·国内

GLM-5

参数744B-A40B MoE上下文200K模态文本

智谱以「From Vibe Coding to Agentic Engineering」为主题发布 GLM-5:744B 总参/40B 激活的 MoE(DSA 架构,28.5T 预训练 tokens),MIT 许可开源。评测覆盖推理、编码与通用智能体,亮点如 HMMT 2025.11 96.9%、τ²-Bench 89.7%。

开源权重智能体工程推理编码

查看模型变体与证据

500-task public set 67.8
2026-02-05 Anthropic·国际

Claude Opus 4.6

上下文1M(beta)价格$10/$37.5 每百万 tokens · 发布文给出的 premium 1M 上下文(beta)档定价;标准档定价发布文未给出模态文本·图像

Claude Opus 4.6 是 Anthropic 的旗舰模型,引入多档推理努力(low/medium/high/max)、自适应思考、上下文压缩与 1M 上下文 beta。评测覆盖代理编码/工具/搜索、法律与多语言问答:SWE-bench Verified 80.8、GPQA Diamond 91.3、ARC-AGI-2 68.8、BrowseComp 84.0。

长上下文推理努力分级代理工具调用多模态

查看模型变体与证据

MCP-Atlas 59.5
2025
2025-12-17 Google DeepMind / Gemini·国际

Gemini 3 Flash

上下文1M价格$0.5/$3 每百万 tokens模态文本·图像·视频

Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。

速度优先多模态1M 长上下文编码与 Agent

查看模型变体与证据

MCP-Atlas 57.4%

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。