MAI-Thinking-1
Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。
2026 年 2 月哈佛-MIT 数学锦标赛赛题评测
HMMT 是高中数学最高难度赛事之一,当年卷抗污染,与 AIME 搭档区分顶级推理档位。
这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。
共收录 6 场模型发布(收录 7 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。
智谱将 GLM-5.2 定位为面向长周期任务构建的模型,提供稳固支撑长程工作的 1M 上下文与更强编码能力(High/Max 档位控制),权重以 MIT 协议完全开源。已收录评测聚焦智能体编码与工具调用、长程软件工程与数学推理等领域,AIME 2026 99.2、Terminal-Bench 2.1(Terminus-2)81。
发布文以“智能体新前沿”为题,将 Qwen3.7-Max 定位为面向智能体时代的新一代旗舰(经阿里云百炼 API 提供,在 Claude Code/OpenClaw/Qwen Code 间泛化)。40 余项评测覆盖智能体编码、工具与办公场景及数理推理,亮点为 HMMT 2026 二月场 97.1 与 SWE-bench Verified 80.4。
本发布含 2 个变体,各变体规格见模型详情。
DeepSeek 发布 V4 预览版「迈入百万上下文普惠时代」,V4-Pro 为旗舰:1M 上下文、思考/非思考双模式、reasoning_effort high/max。评测覆盖推理、编码、智能体与百万级长上下文,亮点如 GPQA Diamond 90.1%、Codeforces 3206。
Kimi K2.6 是月之暗面的开源编码旗舰(Advancing Open-Source Coding),主打长程编码与代理蜂群(300 子代理 / 4000 步)。评测横跨编码、代理、数学与视觉:SWE-bench Verified 80.2、SWE-Bench Pro 58.6、Terminal-Bench 2.0(Terminus-2)66.7、HLE-Full w/ tools 54.0。
GLM-5.1 被 z.ai 定位为面向长程任务(Towards Long-Horizon Tasks)的代理工程旗舰,强调数百轮持续优化与长时程任务能力。评测集中在推理、编码与代理三类:SWE-Bench Pro 58.4、Terminal-Bench 2.0(Terminus-2)63.5、BrowseComp(w/ 上下文管理)79.3、HLE w/ Tools 52.3。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。