MAI-Thinking-1
Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。
2025 年美国数学邀请赛 I/II 共 30 题,竞赛数学的年度无污染风向标
题量仅 30,单题权重 3.3 分;满分已成旗舰入场券,区分度转移到解题步数与稳定性。
这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。
共收录 28 场模型发布(收录 54 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。
MiniMax 将 M2.5 定位为「为真实生产力打造」,披露 20 万+ 真实环境 RL 训练与 Forge 智能体原生框架,并随附同能力 2 倍速的 M2.5-Lightning 档。已收录 22 项评测集中于编码、搜索与 Agent 工具调用:亮点 SWE-bench Verified 80.2%、tau2-Bench Telecom 97.8%。
发布文将其定位为“快、准、稳”的智能体智能模型(Apache 2.0 开源,196B 总参/约 11B 激活稀疏 MoE,MTP-3,256K 上下文)。16 项评测以智能体搜索、数学与编码为主,亮点为 HMMT 2025 二月场 98.4 与 AIME 2025 97.3。
发布文以“视觉智能体智能”为题,将 K2.5 定位为在 K2 基础上经 15T 视觉+文本混合语料继续预训练的原生多模态模型,Agent Swarm 最多 100 个子智能体/1500 步。45 项评测覆盖视觉理解、视频、智能体搜索与编码,亮点为 OCRBench 92.3 与 BrowseComp(Agent Swarm 模式)78.4。
发布文以“推进编码能力”为题,将 GLM-4.7 定位为编码与智能体任务导向的模型,支持交错/保留/回合级思考模式。17 项评测覆盖数理推理、代码智能体与通用智能体,亮点为 HMMT 2025 二月场 97.1 与 τ²-Bench 87.4(SWE-bench Verified 73.8)。
Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。
本发布含 4 个变体,各变体规格见模型详情。
Mistral 将 Large 3 定位为其迄今最强模型,也是 Mixtral 系列之后首个稀疏 MoE(41B 激活/675B 总参,Apache 2.0 开源,旗舰多模态多语言定位)。已收录评测为榜单类定位:LMArena 开源非推理类第 2、开源总榜第 6。
本发布含 2 个变体,各变体规格见模型详情。
DeepSeek 官方将 V3.2 正式版定位为「强化 Agent 能力、融入思考推理」,是 DeepSeek 首个将思考与工具调用融合的模型。已收录 26 项评测覆盖数学竞赛、代码、知识与工具/Agent 使用:亮点 AIME 2025(Thinking)93.1、Codeforces(Thinking)2386。
本发布含 3 个变体,各变体规格见模型详情。
Seed1.8 被发布文定位为通用化 Agentic 模型,覆盖 GUI/浏览器/移动操作、代理搜索、代理编码与经济价值领域任务,并提供三种思考模式。评测横跨代理、数学、STEM、知识、多模态与长视频等约 13 组:GAIA 87.4、BrowseComp-zh 81.3、AIME-25 94.3。
本发布含 2 个变体,各变体规格见模型详情。
Gemini 3 发布以「智能新纪元」为题呈现,Gemini 3 Pro 为旗舰型号(发布时 preview)。已收录评测横跨推理、代码、多模态与 Agent:亮点 LMArena 1501 Elo、AIME 2025(带代码执行)100%。
月之暗面将 Kimi K2 Thinking 定位为思考型智能体(thinking agent),通过同时扩展思考 token 与工具调用步数推进测试时扩展前沿,可跨数百步规划、推理、执行与调整,全部评测结果以 INT4 QAT 精度报告。已收录评测覆盖通用推理、数学、智能体检索、编码与终端等领域,HLE 带工具 44.9(Heavy Mode 51.0)、SWE-bench Verified 71.3。
发布文将其定位为小而快的轻量档模型,编码性能接近 Sonnet 4 而成本仅约三分之一、速度快一倍以上,计算机使用能力超过 Sonnet 4。11 项评测覆盖智能体编码、工具调用、计算机使用与数学推理,亮点为 AIME 2025(带 Python 工具)96.3% 与 τ2-bench Telecom 83.0%。
智谱将 GLM-4.6 定位为具备高级 Agentic、推理与编程能力的模型,上下文由 128K 扩展至 200K,推理中可交织工具调用。评测以编码与智能体为主,亮点如 CC-Bench 对 Claude Sonnet 4 胜率 48.6%、AIME 25 93.9%。
Anthropic 发布 Claude Sonnet 4.5,作为面向编码、智能体与计算机使用场景的 Sonnet 新代,并同步推出 Claude Agent SDK。评测集中在编码与智能体领域,亮点如 SWE-bench Verified 77.2%(并行测试期计算 82.0%)、τ2-bench Telecom 98.0%。
DeepSeek 将 V3.2-Exp 定位为引入 DeepSeek 稀疏注意力(DSA)、聚焦长上下文训练与推理提效的实验性版本,训练设置与 V3.1-Terminus 严格对齐、公开评测表现基本持平,API 价格同步下调超 50%(页面未给出具体单价)。已收录评测覆盖通用知识、数学推理、代码与中英文检索等领域,Codeforces Div1 2121、AIME 2025 89.3。
本发布含 2 个变体,各变体规格见模型详情。
Qwen3-Max 发布以「大就是好(Just Scale it)」为题,Instruct 为超 1T 总参 MoE 旗舰(36T 预训练 tokens、全局 batch 负载均衡损失,ChunkFlow 支持 1M 长上下文训练)。已收录 9 项评测:亮点 SWE-bench Verified 69.6、LMArena 文本榜 1430。
DeepSeek-V3.1 发布文定位为首个混合推理架构模型:同一模型同时服务 deepseek-chat(非思考)与 deepseek-reasoner(思考),主打思考效率提升与 Agent 能力增强。评测分编码代理、搜索代理与思考效率三组:SWE-bench Verified 66、BrowseComp 30、AIME 2025(V3.1-Think)88.4。
本发布含 2 个变体,各变体规格见模型详情。
GPT-5 是 OpenAI 的统一思考模型,发布文称其在 AIME 2025(无工具 94.6%)、SWE-bench Verified 74.9%、HealthBench Hard 46.2% 等刷新 SOTA,并大幅降低事实错误与谄媚率。评测覆盖竞赛数学、编码、指令跟随与代理、多模态与健康:GPQA Diamond 88.4%、MMMU 84.2%、BrowseComp 54.9%。
StepFun 将 Step 3 定位为高性价比的多模态智能模型,以 38B 激活的 MoE 架构与 MFA 注意力 + AFD 并行设计平衡性能与推理成本,并以 Apache 2.0 开源。已收录评测覆盖多模态理解、数学与科学推理、代码等领域,AIME 2025 82.9、MMMU 74.2。
本发布含 2 个变体,各变体规格见模型详情。
Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。
本发布含 2 个变体,各变体规格见模型详情。
Grok 4 是 xAI 具备原生工具调用与实时搜索的模型,官方称其为 HLE text-only 子集首个突破 50%(50.7%)的模型。评测集中于数学、科学与编码:AIME'25 91.7%(无工具)、HMMT 2025 90%、GPQA 87.5%、ARC-AGI-2 15.9%(闭源 SOTA)。
本发布含 4 个变体,各变体规格见模型详情。
腾讯混元以「细粒度 MoE、80B 总参/13B 激活」开源 A13B 系列,Instruct 为指令版(256K 上下文,/think 与 /no_think 双模式,默认慢思考)。已收录 21 项 Instruct 表评测覆盖知识、数学、代码与 Agent 工具调用:亮点 AIME24 87.3、GPQA Diamond 71.2。
本发布含 2 个变体,各变体规格见模型详情。
Gemini 2.5 Flash 是 Gemini 2.5 家族 GA 扩容公告中的主力 Flash 档模型,默认开启思考并同时报告非思考配置。评测覆盖科学/数学/编码/事实性/视觉与多语言:思考配置 GPQA Diamond 82.8%、AIME 2025 72.0%、MRCR v2 8-needle(1M)21.0%。
本发布含 2 个变体,各变体规格见模型详情。
Claude 4 发布中 Opus 4 为最强编码档,采用混合模式(近即时回答 + 扩展思考,扩展思考可与工具调用结合,beta)。已收录 22 项评测覆盖软件工程、终端、知识与 Agent:亮点 SWE-bench Verified 72.5%(并行测试时计算 79.4%)。
本发布含 8 个变体,各变体规格见模型详情。
Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。
本发布含 2 个变体,各变体规格见模型详情。
OpenAI 将 o3 定位为其最强推理模型,在编码、数学、科学与视觉感知等领域推进前沿,并支持以图思考(Thinking with images)。该发布已收录评测覆盖数学、编程竞赛、科学推理、软件工程与智能体工具使用等领域,AIME 2025 配 Python 工具 pass@1 98.4%、100% consensus@8。
谷歌将 Gemini 2.5 Pro 实验版定位为其最智能的 AI 模型与 2.5 系列首个思维(thinking)模型,原生多模态并配备 1M token 上下文窗口(200 万即将推出)。已收录评测覆盖推理、代码、长上下文与多模态理解等领域,HLE 无工具 18.8%、SWE-bench Verified 63.8%。
本发布含 2 个变体,各变体规格见模型详情。
Grok 3 被 xAI 定位为开启『推理代理时代』的 Beta 模型,主打 (Think) 深度推理配置并曾以代号 chocolate 登顶 LMArena。评测覆盖推理、编码、多模态理解与长上下文 RAG:AIME'25 93.3%、GPQA 84.6%、LCB 79.4%、Chatbot Arena 1402 Elo、LOFT(128k)83.3%。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。