MAI-Thinking-1
Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。
500 个真实 GitHub Issue 修复,代码 Agent 金标准
给模型一个真实 GitHub 仓库 + 一个真 Issue,看它能不能提交能过测试的修复。50 分 ≈ 一半的真实工程任务能独立完成。
给 Issue+仓库,生成 patch,跑仓库测试判定;Docker 沙箱
共收录 45 场模型发布(收录 64 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。
发布文自述定位是内置在 GitHub Copilot 与 VS Code 里的 "small, efficient, coding workhorse"(小而高效的编码工作马)。卡上收录的 5 项评测覆盖真实 Issue 修复、终端操作与视觉建站:SWE-bench Verified 72.6%、Terminal Bench 2.1 62.9%(与前代同在 GitHub Copilot 生产 VS Code harness 下自报,1.0 为 71.6%/51.7%),价格约为 1.0 的四分之一。
Muse Glimmer 30B 被 Meta 定位为可在消费级设备上运行的开源代理模型(Apache 2.0,由 Muse Spark 蒸馏,24-32GB 显存可跑)。评测覆盖通用代理、代理编码、多模态与安全:MCP Atlas 75.5%、SWE-bench Verified 76.0%、AIME 2026 94.7%;另提供 K-Quant 量化档与 DFlash 投机解码加速。
Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。
腾讯发布混元 Hy3:295B 总参/21B 激活 MoE、256K 上下文、三种思考模式,Apache 2.0 开源。评测覆盖编码、智能体搜索与推理,亮点如 SWE-bench Verified 78%、BrowseComp 84.2%。
本发布含 2 个变体,各变体规格见模型详情。
MiniMax M3 被发布文定位为将前沿编码、1M 上下文与原生多模态合一的单模型(Frontier Coding, 1M Context, Native Multimodality - All in One Model),采用 MSA 稀疏注意力并支持思考开关。评测覆盖编码、协作代理、GUI 与多模态:SWE-Bench Verified 80.5、BrowseComp 83.52、OSWorld-Verified 70.06、IMO 2025 35/42。
Step 3.7 Flash 被阶跃星辰定位为面向真实场景代理的高效率 Flash 模型,支持三档推理级别、最高 400 tok/s。评测覆盖通用代理、编码与长上下文/视觉:BrowseComp 75.8%、HLE w. tool 47.2%、SWE-bench Verified 76.5%、V* 95.29%。
发布文以“智能体新前沿”为题,将 Qwen3.7-Max 定位为面向智能体时代的新一代旗舰(经阿里云百炼 API 提供,在 Claude Code/OpenClaw/Qwen Code 间泛化)。40 余项评测覆盖智能体编码、工具与办公场景及数理推理,亮点为 HMMT 2026 二月场 97.1 与 SWE-bench Verified 80.4。
本发布含 2 个变体,各变体规格见模型详情。
DeepSeek 发布 V4 预览版「迈入百万上下文普惠时代」,V4-Pro 为旗舰:1M 上下文、思考/非思考双模式、reasoning_effort high/max。评测覆盖推理、编码、智能体与百万级长上下文,亮点如 GPQA Diamond 90.1%、Codeforces 3206。
Kimi K2.6 是月之暗面的开源编码旗舰(Advancing Open-Source Coding),主打长程编码与代理蜂群(300 子代理 / 4000 步)。评测横跨编码、代理、数学与视觉:SWE-bench Verified 80.2、SWE-Bench Pro 58.6、Terminal-Bench 2.0(Terminus-2)66.7、HLE-Full w/ tools 54.0。
本发布含 2 个变体,各变体规格见模型详情。
Anthropic 将 Claude Opus 4.7 定位为在高级软件工程上较 Opus 4.6 显著提升、最难任务上增益尤为明显的旗舰模型,同时大幅增强视觉分辨率;这也是首个按 Project Glasswing 分级防护方案发布的模型。已收录评测覆盖智能体编码与终端、长上下文检索、计算机操作、网络安全与多学科推理等领域,SWE-bench Verified 87.6、GPQA Diamond 94.2。
MiMo-V2.5-Pro 是小米万亿级参数旗舰混合专家大模型,总参数 1.02T,激活 42B,支持 100 万 token 上下文。评测全面对标国际前沿:MMLU 89.4、GSM8K 99.6、MATH 86.2、SWE-bench Verified 78.9%、C-Eval 91.5、BBH 88.4。
Google 将 Gemini 3.1 Pro 定位为「为最复杂任务打造的更聪明模型」,基于 Gemini 3 Pro,发布时为 preview(thinking 档 low/medium/high)。已收录 19 项评测横跨推理、代码、多模态与长上下文:亮点 GPQA 94.3%、SWE-bench Verified 80.6%。
MiniMax 将 M2.5 定位为「为真实生产力打造」,披露 20 万+ 真实环境 RL 训练与 Forge 智能体原生框架,并随附同能力 2 倍速的 M2.5-Lightning 档。已收录 22 项评测集中于编码、搜索与 Agent 工具调用:亮点 SWE-bench Verified 80.2%、tau2-Bench Telecom 97.8%。
智谱以「From Vibe Coding to Agentic Engineering」为主题发布 GLM-5:744B 总参/40B 激活的 MoE(DSA 架构,28.5T 预训练 tokens),MIT 许可开源。评测覆盖推理、编码与通用智能体,亮点如 HMMT 2025.11 96.9%、τ²-Bench 89.7%。
Claude Opus 4.6 是 Anthropic 的旗舰模型,引入多档推理努力(low/medium/high/max)、自适应思考、上下文压缩与 1M 上下文 beta。评测覆盖代理编码/工具/搜索、法律与多语言问答:SWE-bench Verified 80.8、GPQA Diamond 91.3、ARC-AGI-2 68.8、BrowseComp 84.0。
发布文将其定位为“快、准、稳”的智能体智能模型(Apache 2.0 开源,196B 总参/约 11B 激活稀疏 MoE,MTP-3,256K 上下文)。16 项评测以智能体搜索、数学与编码为主,亮点为 HMMT 2025 二月场 98.4 与 AIME 2025 97.3。
发布文以“视觉智能体智能”为题,将 K2.5 定位为在 K2 基础上经 15T 视觉+文本混合语料继续预训练的原生多模态模型,Agent Swarm 最多 100 个子智能体/1500 步。45 项评测覆盖视觉理解、视频、智能体搜索与编码,亮点为 OCRBench 92.3 与 BrowseComp(Agent Swarm 模式)78.4。
发布文以“推进编码能力”为题,将 GLM-4.7 定位为编码与智能体任务导向的模型,支持交错/保留/回合级思考模式。17 项评测覆盖数理推理、代码智能体与通用智能体,亮点为 HMMT 2025 二月场 97.1 与 τ²-Bench 87.4(SWE-bench Verified 73.8)。
Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。
本发布含 2 个变体,各变体规格见模型详情。
Mistral 将 Devstral 2 定位为面向智能体编码的下一代开源 SOTA 编码模型(modified MIT 协议),并随发布配套推出 Mistral Vibe CLI。已收录评测为软件工程与人评胜率两项,SWE-bench Verified 72.2%、人评 42.8% 胜 / 28.6% 负。
本发布含 2 个变体,各变体规格见模型详情。
DeepSeek 官方将 V3.2 正式版定位为「强化 Agent 能力、融入思考推理」,是 DeepSeek 首个将思考与工具调用融合的模型。已收录 26 项评测覆盖数学竞赛、代码、知识与工具/Agent 使用:亮点 AIME 2025(Thinking)93.1、Codeforces(Thinking)2386。
本发布含 3 个变体,各变体规格见模型详情。
Seed1.8 被发布文定位为通用化 Agentic 模型,覆盖 GUI/浏览器/移动操作、代理搜索、代理编码与经济价值领域任务,并提供三种思考模式。评测横跨代理、数学、STEM、知识、多模态与长视频等约 13 组:GAIA 87.4、BrowseComp-zh 81.3、AIME-25 94.3。
本发布含 2 个变体,各变体规格见模型详情。
Gemini 3 发布以「智能新纪元」为题呈现,Gemini 3 Pro 为旗舰型号(发布时 preview)。已收录评测横跨推理、代码、多模态与 Agent:亮点 LMArena 1501 Elo、AIME 2025(带代码执行)100%。
月之暗面将 Kimi K2 Thinking 定位为思考型智能体(thinking agent),通过同时扩展思考 token 与工具调用步数推进测试时扩展前沿,可跨数百步规划、推理、执行与调整,全部评测结果以 INT4 QAT 精度报告。已收录评测覆盖通用推理、数学、智能体检索、编码与终端等领域,HLE 带工具 44.9(Heavy Mode 51.0)、SWE-bench Verified 71.3。
发布文以“简中之巧(Ingenious in Simplicity)”为题,将 M2 定位为 agent 优先的开源权重模型,价格约为 Claude Sonnet 的 8%、速度约 2 倍。9 项评测集中于智能体编码、工具调用与搜索,亮点为 GAIA(纯文本)75.7 与 τ²-Bench 77.2。
发布文将其定位为小而快的轻量档模型,编码性能接近 Sonnet 4 而成本仅约三分之一、速度快一倍以上,计算机使用能力超过 Sonnet 4。11 项评测覆盖智能体编码、工具调用、计算机使用与数学推理,亮点为 AIME 2025(带 Python 工具)96.3% 与 τ2-bench Telecom 83.0%。
智谱将 GLM-4.6 定位为具备高级 Agentic、推理与编程能力的模型,上下文由 128K 扩展至 200K,推理中可交织工具调用。评测以编码与智能体为主,亮点如 CC-Bench 对 Claude Sonnet 4 胜率 48.6%、AIME 25 93.9%。
Anthropic 发布 Claude Sonnet 4.5,作为面向编码、智能体与计算机使用场景的 Sonnet 新代,并同步推出 Claude Agent SDK。评测集中在编码与智能体领域,亮点如 SWE-bench Verified 77.2%(并行测试期计算 82.0%)、τ2-bench Telecom 98.0%。
DeepSeek 将 V3.2-Exp 定位为引入 DeepSeek 稀疏注意力(DSA)、聚焦长上下文训练与推理提效的实验性版本,训练设置与 V3.1-Terminus 严格对齐、公开评测表现基本持平,API 价格同步下调超 50%(页面未给出具体单价)。已收录评测覆盖通用知识、数学推理、代码与中英文检索等领域,Codeforces Div1 2121、AIME 2025 89.3。
本发布含 2 个变体,各变体规格见模型详情。
Qwen3-Max 发布以「大就是好(Just Scale it)」为题,Instruct 为超 1T 总参 MoE 旗舰(36T 预训练 tokens、全局 batch 负载均衡损失,ChunkFlow 支持 1M 长上下文训练)。已收录 9 项评测:亮点 SWE-bench Verified 69.6、LMArena 文本榜 1430。
Moonshot 通过 Hugging Face 官方模型卡发布 Kimi-K2-Instruct-0905:K2 权重更新,上下文 128K→256K,强化智能体编码。评测集中于编码与智能体任务,亮点如 SWE-Bench Verified 69.2%、SWE-Dev 66.6%(五次全量重跑均值±标准差)。
DeepSeek-V3.1 发布文定位为首个混合推理架构模型:同一模型同时服务 deepseek-chat(非思考)与 deepseek-reasoner(思考),主打思考效率提升与 Agent 能力增强。评测分编码代理、搜索代理与思考效率三组:SWE-bench Verified 66、BrowseComp 30、AIME 2025(V3.1-Think)88.4。
本发布含 2 个变体,各变体规格见模型详情。
GPT-5 是 OpenAI 的统一思考模型,发布文称其在 AIME 2025(无工具 94.6%)、SWE-bench Verified 74.9%、HealthBench Hard 46.2% 等刷新 SOTA,并大幅降低事实错误与谄媚率。评测覆盖竞赛数学、编码、指令跟随与代理、多模态与健康:GPQA Diamond 88.4%、MMMU 84.2%、BrowseComp 54.9%。
智谱 AI 高性能极致性价比基座大模型,面向企业级大规模并发场景提供强大的文本理解与智能体调用能力。
Qwen3-Coder-480B-A35B-Instruct 以「Agentic Coding in the World」为定位发布,480B MoE/35B 激活,原生 256K 上下文(YaRN 可扩至 1M)。已收录 15 项评测集中于代码仓库、终端与浏览器/工具 Agent:亮点 SWE-bench Verified(OpenHands 500 turns)69.6、Terminal-Bench 37.5。
本发布含 2 个变体,各变体规格见模型详情。
Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。
本发布含 2 个变体,各变体规格见模型详情。
Gemini 2.5 Flash 是 Gemini 2.5 家族 GA 扩容公告中的主力 Flash 档模型,默认开启思考并同时报告非思考配置。评测覆盖科学/数学/编码/事实性/视觉与多语言:思考配置 GPQA Diamond 82.8%、AIME 2025 72.0%、MRCR v2 8-needle(1M)21.0%。
MiniMax 稀疏混合专家大语言模型,支持 245K 超长上下文窗口与万级汉字复杂指令遵循。
本发布含 2 个变体,各变体规格见模型详情。
Claude 4 发布中 Opus 4 为最强编码档,采用混合模式(近即时回答 + 扩展思考,扩展思考可与工具调用结合,beta)。已收录 22 项评测覆盖软件工程、终端、知识与 Agent:亮点 SWE-bench Verified 72.5%(并行测试时计算 79.4%)。
本发布含 2 个变体,各变体规格见模型详情。
OpenAI 将 o3 定位为其最强推理模型,在编码、数学、科学与视觉感知等领域推进前沿,并支持以图思考(Thinking with images)。该发布已收录评测覆盖数学、编程竞赛、科学推理、软件工程与智能体工具使用等领域,AIME 2025 配 Python 工具 pass@1 98.4%、100% consensus@8。
谷歌将 Gemini 2.5 Pro 实验版定位为其最智能的 AI 模型与 2.5 系列首个思维(thinking)模型,原生多模态并配备 1M token 上下文窗口(200 万即将推出)。已收录评测覆盖推理、代码、长上下文与多模态理解等领域,HLE 无工具 18.8%、SWE-bench Verified 63.8%。
深度求索开源的纯强化学习驱动推理大模型,开创性采用大规模强化学习与多阶段冷启动蒸馏技术,在数学竞赛、代码工程与复杂推理任务上达到与 OpenAI o1 相当的前沿水准。
月之暗面面向深度推理的长思维链强化学习大模型,在数学奥林匹克、复杂编程与视觉长程推理任务上展现出突破性表现。
Google DeepMind 原生多模态大模型开篇之作,其中 Gemini 1.0 Ultra 成为全球首个在 MMLU 基准上超越人类专家的前沿大模型。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。