Evaluation Ledger · 2022 — 2026

模型发布时间轴

按模态浏览模型与变体 · 覆盖与缺口 · 按需求选型

收录 2022 年至今国内外主流厂商核心模型的官方发布档案与实测评测数据,逐条对账技术报告中的基准引用、实测得分与评测协议;提供官方出处与架构规格说明;覆盖范围和历史缺口可在模型目录中查看。
证据数据来源标识:绿色 官方表格原始数据、琥珀色 图表数据采点、灰色 未披露量化分值的评测提及。支持按厂商、基准名称与分值阈值快速检索。← 返回评估大全

2026
2026-10-01 Microsoft AI / MAI·国际

MAI-Transcribe-2-Streaming

模态音频·文本

微软 AI 的首款流式语音识别模型,支持 60 种语言的低延迟实时转写与自动连续语种检测,约 100ms 给出首批预测假设,Artificial Analysis 流式最终词错误率 2.50%、首部词错误率 2.80% 均位列第一,最终时间延迟 0.130s 位于帕累托前沿。

流式语音转写60 种语言自动语种检测100ms 首部假设WER 居首

查看模型变体与证据

2026-10-01 Microsoft AI / MAI·国际

MAI-Voice-2.1 / MAI-Voice-2.1-Flash

本发布含 2 个变体,各变体规格见模型详情。

微软 AI 的富表现力文本转语音模型,模型推理延迟约 550ms,每百万字符 $22,支持 23 种语言,适合重视音质与表现力的场景。本次发布未报告评测数值。

文本转语音23 种语言情感控制零样本音色

查看模型变体与证据 · 所收录来源未披露量化评测

2026-09-30 Google DeepMind / Gemini·国际

Gemini 4 Argon

价格$2/$10 每百万 tokens · 介绍期价格,缓存输入价比输入价低 95%;介绍期结束后为输入 $4、输出 $20

Google 的新前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络安全防御,输出 token 上限提升到 1M。收录的 7 项评测以编码、智能体与安全为主,如 DeepSWE v1.1 77.9%、LVBench 91.7%;目前仅向可信网络防御者开放。

前沿模型网络安全防御1M 输出上限分阶段开放

查看模型变体与证据

2026-09-29 OpenAI·国际

GPT-6.1 Sol

价格$2/$10 每百万 tokens · 缓存输入 $0.10/百万 token

GPT-6 Sol 的升级版,定位是在智能体编程、计算机使用和专业工作上更接近 GPT-6 Astra,而标准价格仅为 Astra 的五分之一。收录的 7 项评测中 5 项为图表行(数值未读出),正文明示的事实错误率为 4.1%。

智能体编码计算机使用专业工作价格为 Astra 的五分之一

查看模型变体与证据

2026-09-28 Anthropic·国际

Claude Sonnet 5.5

价格$2/$10 每百万 tokens · 缓存读取 $0.20/百万 token

面向日常任务、缺陷修复与文档、幻灯片、表格制作的更快更省的 Sonnet 模型,官方称比 Sonnet 5 快 30% 以上、多数任务成本最多低 30%。收录的 9 项评测以智能体编码与知识工作为主,如 Terminal-Bench 4.0 70.6%、GDPval-AA v2.1 1844。

速度更快成本更低日常编码文档与表格

查看模型变体与证据

2026-09-28 MiniMax·国内

MiniMax-M3.1-Flash-Preview

参数428B (23B active)上下文1M模态文本·图像·视频

MiniMax 面向编码、长文分析与复杂推理推出的 Flash Preview 级 MoE 思考大模型。总参数 428B,激活约 23B,支持 1M 上下文与约 150 tokens/s 推理速度;具备原生多模态视觉编码器与独立 reasoning_content 思考字段。官方页面提供性能对比与四个实战案例(Flowdesk 故障排查、贵州茅台财务 DCF 估值、图像差异分析、流体模拟代码生成),未披露标准化离散基准跑分。

1M 上下文428B MoE 架构常开思考模式原生多模态输入超快推理速度

查看模型变体与证据 · 所收录来源未披露量化评测

2026-09-23 Meta / Llama·国际

Muse Realtime Avatar

模态音频·图像·视频

Meta 音频驱动的实时数字人模型,基于因果 Diffusion Transformer 架构,通过自强迫分布匹配蒸馏将推理评估从 120 次减少到 2 次(60x 加速),支持 448x768 25fps 视频流式生成,端到端延迟约 870ms,真人双向盲测相对 Runway Characters 偏好度 78%:22%、相对 HeyGen LiveAvatar 偏好度 88%:12%。

音频驱动Diffusion Transformer448x768 25fps870ms 延迟60x 蒸馏加速

查看模型变体与证据

2026-09-22 Anthropic·国际

Claude Opus 5.5

价格$4/$20 每百万 tokens

面向代码、计算机操作和知识工作的模型。官方表格提供不同任务的分数,但协议与回退模型影响比较范围。

代码计算机操作知识工作

查看模型变体与证据

2026-09-22 OpenAI·国际

GPT-6 Sol / GPT-6 Luna

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 GPT-6 Sol 定位为日常复杂高价值任务的旗舰级高性价比工作马,以 GPT-5.6 Sol 一半的价格提供接近 Astra 的智能;收录评测覆盖企业自动化、软件工程、计算机操作与专业考试,AutomationBench 达 33.2%、DeepSWE 达 68.8%。

高性价比工作马长程自主代理软件工程GUI计算机操作

查看模型变体与证据

2026-09-22 Tencent / 腾讯混元·国内

Hy Image3.5 preview

模态文本·图像

腾讯混元专业级图像生成预览模型,支持文生图与图生图、单次最多 5 张参考图以及最高 2K 分辨率输出,中英文字渲染与小字号排版能力显著提升,专业设计师 GSB 盲测对比上一代胜率综合提升 30% 以上。

文生图/图生图最高 2K 分辨率中英文字渲染最多 5 张参考图GSB 胜率提升 30%

查看模型变体与证据

2026-09-22 Xiaomi / 小米·国内

MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed

本发布含 3 个变体,各变体规格见模型详情。

小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。

开源权重1.02T MoE1M 上下文原生全模态

查看模型变体与证据

2026-09-21 xAI / Grok·国际

Grok 4.7

参数2.1T上下文500K价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·代码·图像

xAI 发布的最新旗舰编码与知识工作模型,基于 2.1T 参数底座与长程强化学习,在 CursorBench 4.0 (46.3%)、DeepSWE v1.1 (71.0%) 与 Terminal-Bench 4.0 (38.0%) 等多小时自主长程任务上展现出更强的自我检验与 500K 上下文管理能力。

2.1T 参数500K 上下文长程自主任务强化自我检验

查看模型变体与证据

2026-09-19 StepFun / 阶跃星辰·国内

Step 5 Preview

参数600B total / 27B active MoE上下文1M模态文本·图像

阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。

稀疏 MoE 600B/27B1M 上下文视觉输入Agentic 长程任务

查看模型变体与证据

2026-09-18 Alibaba / Qwen·国内

Qwen3.8-LiveTranslate

模态音频·文本·视频

通义千问基于 Hybrid MoE Thinker-Talker 架构重构的端到端实时同传模型,支持 60 种语言输入与 29 种语音输出,字均延迟(LAAL)降至 2.3 秒,具备实时说话人分离、双语同帧同出与长上下文消歧能力,在 Omnilingua-MSpeaker 与 FLEURS 上取得领先。

Interleave 架构字均延迟 2.3s实时说话人分离双语同帧同出长上下文消歧

查看模型变体与证据

2026-09-18 Alibaba / Qwen·国内

Qwen3.8-Omni-Flash

上下文1M模态文本·图像·音频·视频

Qwen 团队发布的新一代原生全模态大模型,支持 1M 上下文,具备从多模态内容理解到主动规划、工具调用与长程音视频创作的 Agentic 交付能力;在 29 项基准中平均较前代提升 25%,并大幅降低音视频 API 成本。

原生全模态1M 上下文音视频 Agent端到端交互

查看模型变体与证据

2026-09-15 Google DeepMind / Gemini·国际

Gemini 3.8 Live / Gemini 3.8 Live Extended Thinking

本发布含 2 个变体,各变体规格见模型详情。

Google 最新原生语音到语音实时对话模型,专为低延迟自然人机交互优化,支持异步工具调用、实时视觉对齐与 97+ 语言无缝流转切换。

原生语音交互异步工具调用全双工对话实时视觉对齐

查看模型变体与证据

2026-09-11 Moonshot AI / Kimi·国内

Kimi K2.8 Preview

上下文1M

Kimi Code 中的代码与智能体模型预览版,提供可调思考档位。发布说明未给出量化评测。

代码智能体

查看模型变体与证据 · 所收录来源未披露量化评测

2026-09-10 DeepSeek·国内

DeepSeek-V4.1-Flash

参数552B (8B prefill / 16B decode active)上下文1M价格$0.15/$0.3 每百万 tokens · 高峰时段 $0.15/$0.30 每百万 tokens,闲时(00:30-08:30 UTC)减半至 $0.075/$0.15,缓存命中 $0.003-$0.006模态文本·图像·代码

DeepSeek 新一代非对称 Causal-Encoder-Decoder (CED) 架构的首款多模态 MoE 模型,总参 552B 仅激活 8B 输入与 16B 输出,KV Cache 显存缩减至 1/4;在 Terminal-Bench 2.1 达到 90.6%、GPQA Diamond 90.9%、DeepSWE v1.1 74.2% 与 CyberGym 88.1%,全面替代并下线 V4-Pro。

因果编解码器CED架构超高KV Cache压缩原生多模态视觉峰谷定价策略

查看模型变体与证据

2026-09-03 OpenAI·国际

GPT-6 Astra

上下文1M价格$10/$50 每百万 tokens · API 定价每百万输入 10 美元,输出 50 美元模态文本·图像·代码·计算机操作

OpenAI 首个将 Preparedness 框架推至 Critical 等级的旗舰前沿模型,在计算机直接操控、复杂多步长程自主 Agent、软件工程与零日(zero-day)漏洞挖掘上实现重大跃迁;在 ARC-AGI-3 和 ExploitBench 达到饱和得分。

旗舰前沿计算机操作(GUI)Preparedness Critical长程自主代理

查看模型变体与证据

2026-09-02 Google DeepMind / Gemini·国际

Gemini 3.8 Flash / Gemini 3.8 Flash Cyber

本发布含 2 个变体,各变体规格见模型详情。

Google DeepMind Flash 阶梯新一代工作主力模型,针对长时程软件工程与智能体工具循环调优;在 Terminal-Bench 2.1 达到 90.8%、SWE-Bench Pro 61.6%、SWE-Atlas 51.9%,支持按任务自定义思维等级。

长程代理编码可调思维等级高性价比主力原生多模态

查看模型变体与证据

2026-09-02 Meta / Llama·国际

Muse Spark 1.3

上下文1M价格$1.25/$4.25 每百万 tokens · Meta Model API / OpenRouter 定价:输入 $1.25 / 输出 $4.25 每百万 tokens模态文本·代码·多模态

Meta 专为长程软件工程与智能体工具循环优化的前沿多模态大模型,相较 1.2 版本减少 20% 工具调用与 25% 输出 token;在 DeepSWE v1.1 达到 75.4%、Terminal-Bench 2.1 88.8%、SWE-Atlas Codebase QnA 59.4% 以及 1M 上下文 MRCR 98.1%,支持 max 与 xhigh 双推理档位。

长程代理编码工具调用效率优化1M 上下文Cursor 集成

查看模型变体与证据

2026-09-02 Alibaba / Qwen·国内

Qwen3.8-Max-0902

参数2.4T(激活 95B)MoE上下文1M价格¥12/¥36 每百万 tokens · 千问AI平台模型页定价区 DOM 明示:输入 ¥12/M、输出 ¥36/M,另有输入缓存命中 ¥1.5/M、显式缓存创建 ¥15/M、显式缓存命中 ¥1/M(每百万 tokens);最大输入 991K / 最大输出 131K(思考模式 983K / 131K),TPM 1M。微博公告另引 CodeArena 性价比榜(帕累托前沿):新版本每百万 Tokens 综合平均约 5 美元——综合均价口径(榜单图 tooltip 视觉读数 $5.00/M blended, 3:1 ratio),非 input/output 拆分价,与平台挂牌价两口径并存未做换算调和。模态文本·图像·视频

千问官方将 Qwen3.8-Max-0902 定位为 Qwen3.8-Max 围绕编程(Coding)与专业办公(Cowork)进一步后训练的升级版本,更适合企业真实复杂任务、科研与长周期任务。本次发布已收录评测为第三方 CodeArena 前端编程总榜一行:提升 22 分至 1691(Elo)夺冠,公告并引该榜性价比(帕累托前沿)称每百万 Tokens 综合均价约 5 美元。

Coding 与 Cowork 后训练强化企业复杂任务与长周期任务1M 上下文内置工具生态(代码解释器/以图搜图)

查看模型变体与证据

2026-09-01 Anthropic·国际

Claude Fable 5.1 / Claude Mythos 5.1

本发布含 2 个变体,各变体规格见模型详情。

发布文定位:编码与知识工作上世界最先进的模型,其研究能力是 AI 将参与科学进步的早期一瞥。本档已收录 9 项基准,覆盖智能体科研、智能体编码、知识工作、计算机操作与商业工作流;亮点:Terminal-Bench 4.0 55.8%、Humanity's Last Exam(with tools)65.0%。

编码与知识工作旗舰长时程问题求解生产安全护栏下评测缓存读降价 75%

查看模型变体与证据

2026-08-28 Tencent / 腾讯混元·国内

Hy4 preview

参数770B-A49B MoE上下文1M模态文本

发布文将 Hy4 preview 定位为 770B 总参/49B 激活、1M 上下文、Apache 2.0 开源的旗舰预览版(各模型均按最高推理档评测)。46 项评测集中于智能体编码与搜索、工作智能体及 STEM 推理,亮点为 Terminal-Bench 2.1 85.4 与 SWE-bench Multilingual 82.9。

开源权重长上下文智能体

查看模型变体与证据

2026-08-26 Z.ai / 智谱 GLM·国内

GLM-5.3-Flash

参数320B-A18B MoE模态文本·图像·视频

GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。

开源权重原生多模态高性价比编码与 Agent

查看模型变体与证据

2026-08-26 OpenAI·国际

GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。

旗舰多档努力智能体安全防护

查看模型变体与证据

GPT-5.6 Sol · agents-last-exam 52.7%GPT-5.6 Sol · aa-intelligence-index 58.9GPT-5.6 Sol · aa-coding-agent-index 80GPT-5.6 Sol · terminalbench 2.1 88.8%GPT-5.6 Sol · deepswe v1.1 72.7%GPT-5.6 Sol · browsecomp 90.4%GPT-5.6 Sol · osworld 2.0 62.6%GPT-5.6 Sol · exploitbench 73.5%gpt-5-5 · exploitbench 47.9%GPT-5.6 Sol · exploitgym 2h cap 24.9%GPT-5.6 Sol · exploitgym 6h 33.7%gpt-5-5 · exploitgym 2h cap 15.1%GPT-5.6 Sol · sec-bench-pro 71.2%gpt-5-5 · sec-bench-pro 45.8%GPT-5.6 Terra · agents-last-exam 50.4%GPT-5.6 Luna · agents-last-exam 50.3%gpt-5-5 · agents-last-exam 46.9%claude-fable-5 · agents-last-exam 40.5%claude-opus-4-8 · agents-last-exam 45.2%gemini-3-1-pro · agents-last-exam 32.1%GPT-5.6 Sol · gdpval-aa v2 1,747.8 EloGPT-5.6 Terra · gdpval-aa v2 1,593 EloGPT-5.6 Luna · gdpval-aa v2 1,591.8 Elogpt-5-5 · gdpval-aa v2 1,493.7 Eloclaude-fable-5 · gdpval-aa v2 1,759.6 Eloclaude-opus-4-8 · gdpval-aa v2 1,600.1 Elogemini-3-1-pro · gdpval-aa v2 962.3 Elogemini-3-5-flash · gdpval-aa v2 1,348.8 EloGPT-5.6 Sol · big-finance-bench 53%GPT-5.6 Terra · big-finance-bench 51%GPT-5.6 Luna · big-finance-bench 36%gpt-5-5 · big-finance-bench 49%claude-opus-4-8 · big-finance-bench 44%GPT-5.6 Sol · genebench Pro 28.7%GPT-5.6 Terra · genebench Pro 23.3%GPT-5.6 Luna · genebench Pro 10.8%gpt-5-5 · genebench Pro 12%claude-opus-4-8 · genebench Pro 16%gemini-3-1-pro · genebench Pro 3.1%gemini-3-5-flash · genebench Pro 8.14%GPT-5.6 Sol · lifescibench 59.9%GPT-5.6 Terra · lifescibench 56%GPT-5.6 Luna · lifescibench 51.2%gpt-5-5 · lifescibench 50.4%claude-opus-4-8 · lifescibench 53.6%GPT-5.6 Sol · healthbench Professional 60.5%GPT-5.6 Terra · healthbench Professional 57.7%GPT-5.6 Luna · healthbench Professional 55.7%gpt-5-5 · healthbench Professional 49.5%claude-fable-5 · healthbench Professional 60.9%claude-opus-4-8 · healthbench Professional 53%GPT-5.6 Terra · aa-coding-agent-index 77.4GPT-5.6 Luna · aa-coding-agent-index 74.6gpt-5-5 · aa-coding-agent-index 76.4claude-fable-5 · aa-coding-agent-index 77.2claude-opus-4-8 · aa-coding-agent-index 72.5gemini-3-1-pro · aa-coding-agent-index 42.7GPT-5.6 Sol · swebench-pro 64.6%GPT-5.6 Terra · swebench-pro 63.4%GPT-5.6 Luna · swebench-pro 62.7%gpt-5-5 · swebench-pro 59.4%claude-mythos-5 · swebench-pro 80.3%claude-mythos-preview · swebench-pro 77.8%claude-fable-5 · swebench-pro 80%claude-opus-4-8 · swebench-pro 69.2%gemini-3-1-pro · swebench-pro 54.2%gpt-5-6-sol-ultra · terminalbench 2.1 91.9%GPT-5.6 Terra · terminalbench 2.1 87.4%GPT-5.6 Luna · terminalbench 2.1 84.7%gpt-5-5 · terminalbench 2.1 85.6%claude-mythos-5 · terminalbench 2.1 88%claude-fable-5 · terminalbench 2.1 83.1%claude-opus-4-8 · terminalbench 2.1 78.9%gemini-3-1-pro · terminalbench 2.1 70.7%GPT-5.6 Terra · deepswe v1.1 69.6%GPT-5.6 Luna · deepswe v1.1 67.2%gpt-5-5 · deepswe v1.1 67%claude-fable-5 · deepswe v1.1 69.7%claude-opus-4-8 · deepswe v1.1 59%gemini-3-1-pro · deepswe v1.1 11.8%GPT-5.6 Terra · osworld 2.0 50.2%GPT-5.6 Luna · osworld 2.0 45.6%gpt-5-5 · osworld 2.0 47.5%claude-opus-4-8 · osworld 2.0 54.8%gpt-5-6-sol-ultra · browsecomp 92.2%GPT-5.6 Terra · browsecomp 87.5%GPT-5.6 Luna · browsecomp 83.3%gpt-5-5 · browsecomp 84.4%claude-mythos-5 · browsecomp 88%claude-mythos-preview · browsecomp 87.9%claude-opus-4-8 · browsecomp 84.3%gemini-3-1-pro · browsecomp 85.9%GPT-5.6 Sol · benchcad 70.6%GPT-5.6 Terra · benchcad 62.3%GPT-5.6 Luna · benchcad 63.1%gpt-5-5 · benchcad 44.4%claude-mythos-5 · benchcad 38.4%claude-mythos-preview · benchcad 35.5%claude-opus-4-8 · benchcad 27.3%GPT-5.6 Sol · benchcad python tool 83.4%GPT-5.6 Terra · benchcad python tool 78.2%GPT-5.6 Luna · benchcad python tool 73.9%gpt-5-5 · benchcad python tool 55.8%claude-mythos-5 · benchcad python tool 65%claude-mythos-preview · benchcad python tool 61%claude-opus-4-8 · benchcad python tool 51.8%GPT-5.6 Terra · exploitbench 52.9%GPT-5.6 Luna · exploitbench 33.2%claude-mythos-5 · exploitbench 78%claude-mythos-preview · exploitbench 74.2%claude-opus-4-8 · exploitbench 40%GPT-5.6 Terra · exploitgym 23.2%GPT-5.6 Luna · exploitgym 12.4%gpt-5-6-sol-ultra · sec-bench-pro 74.3%GPT-5.6 Terra · sec-bench-pro 57.7%GPT-5.6 Luna · sec-bench-pro 48.9%GPT-5.6 Sol · mmmu-pro no tools 83%GPT-5.6 Terra · mmmu-pro no tools 80.7%GPT-5.6 Luna · mmmu-pro no tools 78.4%gpt-5-5 · mmmu-pro no tools 81.2%gemini-3-1-pro · mmmu-pro no tools 80.5%GPT-5.6 Sol · mmmu-pro with tools 84.6%GPT-5.6 Terra · mmmu-pro with tools 82%GPT-5.6 Luna · mmmu-pro with tools 79.5%gpt-5-5 · mmmu-pro with tools 83.2%GPT-5.6 Sol · gdp-pdf 30.7%GPT-5.6 Terra · gdp-pdf 24.7%GPT-5.6 Luna · gdp-pdf 22.7%gpt-5-5 · gdp-pdf 26%claude-fable-5 · gdp-pdf 29.8%claude-opus-4-8 · gdp-pdf 22.5%gemini-3-1-pro · gdp-pdf 16.7%GPT-5.6 Sol · gpqa Diamond 94.6%GPT-5.6 Terra · gpqa Diamond 92.9%GPT-5.6 Luna · gpqa Diamond 92.3%gpt-5-5 · gpqa Diamond 93.6%claude-mythos-5 · gpqa Diamond 94.1%claude-mythos-preview · gpqa Diamond 94.6%claude-fable-5 · gpqa Diamond 92.6%claude-opus-4-8 · gpqa Diamond 92%gemini-3-1-pro · gpqa Diamond 94.3%GPT-5.6 Sol · frontiermath Tier 1-3 (v2) 89%GPT-5.6 Terra · frontiermath Tier 1-3 (v2) 84.9%GPT-5.6 Luna · frontiermath Tier 1-3 (v2) 78.6%gpt-5-5 · frontiermath Tier 1-3 (v2) 85.3%claude-fable-5 · frontiermath Tier 1-3 (v2) 87%claude-opus-4-8 · frontiermath Tier 1-3 (v2) 80%gemini-3-1-pro · frontiermath Tier 1-3 (v2) 59.6%GPT-5.6 Sol · frontiermath Tier 4 (v2) 83%GPT-5.6 Terra · frontiermath Tier 4 (v2) 68.3%GPT-5.6 Luna · frontiermath Tier 4 (v2) 58.5%gpt-5-5 · frontiermath Tier 4 (v2) 72.5%claude-fable-5 · frontiermath Tier 4 (v2) 87.8%claude-opus-4-8 · frontiermath Tier 4 (v2) 56.1%GPT-5.6 Sol · automationbench 18.1%GPT-5.6 Terra · automationbench 15.2%GPT-5.6 Luna · automationbench 14.9%gpt-5-5 · automationbench 12.9%claude-fable-5 · automationbench 17.4%claude-opus-4-8 · automationbench 15.5%gemini-3-5-flash · automationbench 14.5%GPT-5.6 Sol · toolathlon 58%GPT-5.6 Terra · toolathlon 53.1%GPT-5.6 Luna · toolathlon 53.4%gpt-5-5 · toolathlon 55.6%claude-mythos-5 · toolathlon 61.7%claude-mythos-preview · toolathlon 61.1%claude-fable-5 · toolathlon 61.7%claude-opus-4-8 · toolathlon 59.9%gemini-3-1-pro · toolathlon 48.8%GPT-5.6 Sol · mrcr v2 8-needle 256K-512K 91.5%GPT-5.6 Terra · mrcr v2 8-needle 256K-512K 89.6%GPT-5.6 Luna · mrcr v2 8-needle 256K-512K 41.3%gpt-5-5 · mrcr v2 8-needle 256K-512K 81.5%GPT-5.6 Sol · mrcr v2 8-needle 512K-1M 73.8%GPT-5.6 Terra · mrcr v2 8-needle 512K-1M 72.5%GPT-5.6 Luna · mrcr v2 8-needle 512K-1M 41.3%gpt-5-5 · mrcr v2 8-needle 512K-1M 74%GPT-5.6 Sol · graphwalks BFS 256k f1 90.7%GPT-5.6 Terra · graphwalks BFS 256k f1 76.9%GPT-5.6 Luna · graphwalks BFS 256k f1 81.3%gpt-5-5 · graphwalks BFS 256k f1 73.7%claude-mythos-5 · graphwalks BFS 256k f1 91.1%claude-mythos-preview · graphwalks BFS 256k f1 85.7%claude-opus-4-8 · graphwalks BFS 256k f1 85.9%GPT-5.6 Sol · graphwalks BFS 1mil f1 77.1%GPT-5.6 Terra · graphwalks BFS 1mil f1 71.2%GPT-5.6 Luna · graphwalks BFS 1mil f1 51.2%gpt-5-5 · graphwalks BFS 1mil f1 45.4%claude-mythos-5 · graphwalks BFS 1mil f1 79.4%claude-mythos-preview · graphwalks BFS 1mil f1 74.3%claude-opus-4-8 · graphwalks BFS 1mil f1 68.1%GPT-5.6 Sol · arc-agi 3 7.78%GPT-5.6 Terra · arc-agi 3 0.8%GPT-5.6 Luna · arc-agi 3 0.18%gpt-5-5 · arc-agi 3 0.43%claude-opus-4-8 · arc-agi 3 1.5%gemini-3-1-pro · arc-agi 3 0.42%GPT-5.6 Sol · kernelgen 1P 61.1%GPT-5.6 Terra · kernelgen 1P 49.2%GPT-5.6 Luna · kernelgen 1P 22.4%gpt-5-5 · kernelgen 1P 29.3%GPT-5.6 Sol · nanogpt 9.69%GPT-5.6 Terra · nanogpt 14.5%GPT-5.6 Luna · nanogpt 1.66%gpt-5-5 · nanogpt 2.65%GPT-5.6 Sol · rsi-index 57.9%GPT-5.6 Terra · rsi-index 56.3%GPT-5.6 Luna · rsi-index 41.9%gpt-5-5 · rsi-index 41.7%GPT-5.6 Sol · posttrain-bench Lite 50.3%GPT-5.6 Terra · posttrain-bench Lite 51.5%GPT-5.6 Luna · posttrain-bench Lite 29.6%gpt-5-5 · posttrain-bench Lite 38.8%
2026-08-26 Alibaba / Qwen·国内

Qwen3.8-Flash-Next / Qwen3.8-Flash-Next-Base

本发布含 2 个变体,各变体规格见模型详情。

Qwen3.8-Flash-Next 被发布文定位为迈向极致性价比的全新架构预览(GDN+QSA 混合注意力、N-gram Embedding、Muon 优化器),为 Qwen4 架构探路。评测覆盖代理编码/办公、多模态代理与通用推理:SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、AndroidWorld 84.5。

MoE 稀疏激活原生 256K 上下文多模态架构预览

查看模型变体与证据

Qwen3.8-Flash-Next · deepswe 1.1 58.7Qwen3.8-Flash-Next · swebench-pro 62.5Qwen3.8-Flash-Next · swebench-multilingual 81Qwen3.8-Flash-Next · nl2repo 48.1Qwen3.8-Flash-Next · coworkbench 73.9Qwen3.8-Flash-Next · jobbench 55.7Qwen3.8-Flash-Next · agents-last-exam Pass@1 / Score dual 24.3 / 51.2Qwen3.8-Flash-Next · toolathlon Verified, Pass@1 73.5Qwen3.8-Flash-Next · ifbench 81.3Qwen3.8-Flash-Next · gpqa Diamond 91.7Qwen3.8-Flash-Next · hlehle 35.9Qwen3.8-Flash-Next · lcb v6 91.9Qwen3.8-Flash-Next · claw-eval Pass@3 / Average dual 64.4 / 60.4Qwen3.8-Flash-Next · recreationbench 49.9Qwen3.8-Flash-Next · androidworld 84.5Qwen3.8-Flash-Next · osworld 2.0, Binary/Partial dual 19.4 / 52.3Qwen3.8-Flash-Next · vision2web 64Qwen3.8-Flash-Next · erqa 72.3Qwen3.8-Flash-Next · lvbench 76.6Qwen3.8-Flash-Next · realworldqa 88.5Qwen3.8-Flash-Next · mathvision Without CI / With CI dual 90.6 / 95.7Qwen3.8-Flash-Next · charxiv-reasoning RQ, Without CI / With CI dual 84.6 / 90.6Qwen3.8-Flash-Next-Base · mmlu Base model 90.36Qwen3.8-Flash-Next-Base · mmlu-redux Base model 90.68Qwen3.8-Flash-Next-Base · mmlu-pro Base model 73.23Qwen3.8-Flash-Next-Base · supergpqa Base model 51.36Qwen3.8-Flash-Next-Base · bbh Base model 90.87Qwen3.8-Flash-Next-Base · gpqa Base model 51.42Qwen3.8-Flash-Next-Base · gsm8k Base model 93.29Qwen3.8-Flash-Next-Base · math Base model 72.78Qwen3.8-Flash-Next-Base · evalplus Base model 78.76Qwen3.8-Flash-Next-Base · multipl-e Base model 79.09Qwen3.8-Flash-Next-Base · swebench-pretrain Base model 50.99Qwen3.8-Flash-Next-Base · mgsm Base model 89.33Qwen3.8-Flash-Next-Base · mmmlu Base model 84.86Qwen3.8-Flash-Next-Base · include Base model 78.4
2026-08-25 Microsoft AI / MAI·国际

MAI-Image-2.6

参数Flagship Image Generation Model模态文本·图像

微软旗舰图像生成与编辑模型,在 Chatbot Arena 图像生成竞技场位居前列,支持高质量美学渲染与复杂提示词排版。

图像生成复杂排版高保真渲染

查看模型变体与证据 · 所收录来源未披露量化评测

2026-08-21 DeepSeek·国内

DeepSeek-V4-Flash-Vision-Exp

模态文本·图像

DeepSeek 将 V4-Flash-Vision-Exp 定位为开启多模态 API 服务的实验性多模态模型,官方称其纯文本能力与 V4-Flash 持平、向 Opus-4.8 收敛多模态 Agent 差距。已收录 11 项评测(文本 Agent 与多模态 Agent 两组):亮点 Terminal-Bench 2.1 83.9、CyberGym 75.3。

实验性多模态API 模型Agent 增强

查看模型变体与证据

2026-08-20 Microsoft AI / MAI·国际

MAI-Transcribe-2

参数Speech Recognition Model模态音频·文本

微软推出的端到端高精度、超低延迟通用语音识别与转录模型,具有业界顶尖的多语言辨识精度与吞吐表现。

语音识别端到端转录低延迟高吞吐

查看模型变体与证据 · 所收录来源未披露量化评测

2026-08-13 DeepSeek·国内

DeepSeek V4 Pro

模态文本

DeepSeek 发布 V4 Pro 正式版,同步上线 APP/网页端/API(API 模型名不变),官方定位为正式版增强了 Agent 能力、在生产环境中的性能表现提升尤为显著。本发布收录的 10 项评测全部为 Agent 向(编码智能体、网络安全、工具调用、数据科学与自动化智能体),官方以单张对比图给出与 GLM-5.2 / Kimi-K3 / Opus-4.8 / Fable 5 的对比,数值以人工读图确认前不计入公开计数。

正式版 GAAgent 能力增强Responses API 原生支持三档思考强度

查看模型变体与证据

2026-08-13 Google DeepMind / Gemini·国际

Gemini 3.7 Flash

价格$0.75/$3.75 每百万 tokens · 促销价(原 3.6 Flash 半价),2026-12-31 到期;2027-01-01 起 $1.50/$7.50模态文本·图像·视频

Gemini 3.7 Flash 被定位为面向编码与代理的旗舰 workhorse 模型(most intelligent workhorse model for coding and agents)。评测聚焦编码与代理工作流并延伸到文档/视频理解:DeepSWE v1.1 65.3%、Terminal-bench 2.1 85.8%、WebDev Arena 1588 Elo、GDP.pdf 34.0%。

多模态代理编码文档理解

查看模型变体与证据

2026-08-12 xAI / Grok·国际

Grok 4.6

价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·图像

发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。

长程智能体编码视觉任务

查看模型变体与证据

2026-08-12 Microsoft AI / MAI·国际

MAI-Thinking-1

参数~1T 总参(35B 激活),稀疏 MoE上下文256K模态文本

Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。

推理增强MoE 中量级企业级数据Function Calling

查看模型变体与证据

2026-08-11 Microsoft AI / MAI·国际

MAI-Code-1.1-Flash

参数138B 总参(5B 激活),稀疏 MoE上下文256K价格$0.2/$1.2 每百万 tokens · 缓存输入 $0.02/M;GitHub Copilot 列表价(model card 定价栏标 "To be finalized",以 GitHub 列表价为准);annual Copilot 订阅 0.25× premium request multiplier;较 MAI-Code-1-Flash($0.75/$0.075/$4.50)降价约 73%模态文本·图像

发布文自述定位是内置在 GitHub Copilot 与 VS Code 里的 "small, efficient, coding workhorse"(小而高效的编码工作马)。卡上收录的 5 项评测覆盖真实 Issue 修复、终端操作与视觉建站:SWE-bench Verified 72.6%、Terminal Bench 2.1 62.9%(与前代同在 GitHub Copilot 生产 VS Code harness 下自报,1.0 为 71.6%/51.7%),价格约为 1.0 的四分之一。

轻量小模型档(GitHub Lightweight 类目)原生视觉输入Copilot 生产 harness 训练稀疏 MoE(5B 激活)

查看模型变体与证据

2026-08-10 Meta / Llama·国际

Muse Glimmer 30B

参数29.6B(dense)+ 1.8B ViT模态文本·图像

Muse Glimmer 30B 被 Meta 定位为可在消费级设备上运行的开源代理模型(Apache 2.0,由 Muse Spark 蒸馏,24-32GB 显存可跑)。评测覆盖通用代理、代理编码、多模态与安全:MCP Atlas 75.5%、SWE-bench Verified 76.0%、AIME 2026 94.7%;另提供 K-Quant 量化档与 DFlash 投机解码加速。

开源权重端侧可运行代理增强多模态

查看模型变体与证据

2026-08-05 Meta / Llama·国际

Muse Spark 1.2 / Muse Code

本发布含 2 个变体,各变体规格见模型详情。

Meta 将 Muse Spark 1.2 定位为 Muse Spark 1.1 的编码向升级版,与 Muse Code 终端代理协同训练,经 Muse Code、Meta Model API、OpenRouter 提供。已收录 5 项评测集中于终端与软件工程 Agent:亮点 Terminal-Bench 2.1 82.9、DeepSWE 1.1 59.3,另含 GDPval-AA v2 与 MCP Atlas 第三方条目(未录数值)。

编码专精与 Muse Code 协同训练长程任务

查看模型变体与证据

2026-08-05 ByteDance Seed / 豆包·国内

SeedRealtime

模态文本·图像·视频·音频

原生音视频全双工端到端交互大模型,采用统一架构实现低延迟实时多模态交互。官方页面以交互演示和产品能力为主,未披露基准分数。

全双工交互音视频原生端到端超低延迟实时对话

查看模型变体与证据 · 所收录来源未披露量化评测

2026-08-03 Alibaba / Qwen·国内

Qwen3.8-Max

参数2.4T(激活 95B)模态文本·图像·视频

通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。

开源权重(预告)多模态智能体长周期任务编程与办公

查看模型变体与证据

terminalbench 2.1 86.6swebench-pro 67.7deepswe 1.1 56.6nl2repo 55.9frontierswe 73.5mls-bench-lite 41paperbench 93androidbench 75.1qwen-swe-bench 80.7qwen-qoder-bench 58.4qwen-react-bench 1724qwen-svg-bench 1713coworkbench 74.8workspace-bench 67.7jobbench 53.4skillsbench 70.2agents-last-exam Pass / Score dual metric 27.0 / 52.4automationbench Pass@1 27.3toolathlon Verified, Pass@1 72.5widesearch 81.9hlehle w/ tools 56.2gpqa Diamond 92.6hlehle no tools (table default) 43.6ifbench IFBench 82.8one-million-bench expert score 52.5healthbench 60.2plawbench 73.2prbench-legal 57.6prbench-finance 58.3mrcr 256K, 8-needle 92.9longbench v2 66.3mmmu-pro 82.3mathvision Without CI / With CI dual 95.2 / 97.7babyvision Without CI / With CI dual (footnote 1) 82.0 / 91.3hle-vl w/ Tools (code interpreter + search) 52.2zerobench Pass@5, Without CI / With CI dual 24.0 / 49.0zerobench-sub visual-subset 48.5logicvista 91.9hipho 90.0phyx 83.5slake 90.8medxpertqa-mm 80.4pmc-vqa 66.2osworld Verified 86.1osworld 2.0, Binary / Partial dual 19.4 / 46.7screenspot-pro 84.5webarena Verified 66.8androidworld 85.3mobileworld 77.8claw-eval Pass@3 / Average dual 77.2 / 74.8vision2web 69.0qwen-blender-bench 69.9parametric-cad-bench 91.5recreationbench 5 platforms (Ubuntu/macOS/Windows/Android/Web) 51.7present-bench 79.6charxiv-reasoning RQ, Without CI / With CI dual 88.4 / 93.5omnidocbench 1.5 92.1ocr-bench-v2 EN / ZH dual 74.2 / 68.3cc-ocr-bench-v2 79.6mtvqa Test 56.6madqa 91.8qwen-visual-office 44.6realworldqa 88.0erqa 77.8lingoqa 84.8surds 77.8simplevqa 75.0worldvqa 53.2mmstar 85.9perception-bench 63.5countqa 82.4refadv-s 80.2dense200 87.0coco 78.7visfactor 60.8vlmsarebiased 88.3video-mme w/ Subtitles 90.4video-mme-v2 w/ Subtitles 68.3video-mmmu 88.7mmvu 82.4mlvu M-Avg 90.8tvbench 81.9lvbench default 81.8lvbench w/ Mem. (Qwen-MM-Plugins video memory) 85.6egolife w/ Mem. 80.3videodr w/ Search 73.2
2026-08 Z.ai / 智谱 GLM·国内

GLM-5.3

模态文本

GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。

开源权重思考默认开启编码专精网络安全

查看模型变体与证据

2026-07-31 ByteDance Seed / 豆包·国内

Seedance 2.5

模态文本·图像·视频·音频

音视频联合生成模型,支持参考素材控制和定点编辑。所收录官方页面未披露量化评测。

视频生成音视频联合生成

查看模型变体与证据 · 所收录来源未披露量化评测

2026-07-27 Alibaba / Qwen·国内

Qwen3.7-Flash

上下文1M模态文本·图像·视频

Qwen3.7-Flash 是 Qwen3.7 世代的经济档 Flash 系列(阿里云百炼口径:原生视觉语言 Flash 系列),在多模态理解与智能体执行能力上相对 3.6-Flash 全面升级。

高效档多模态智能体原生视觉语言

查看模型变体与证据 · 所收录来源未披露量化评测

2026-07-24 Anthropic·国际

Claude Opus 5

模态文本·图像

Anthropic 发布 Claude Opus 5,effort 分档 high/xhigh/max 并提供 Fast 模式;页面数值多为图表与对比性表述(含大量内部评测)。已收录 18 项评测覆盖前沿编码、Agent 操作与法律/健康/生物专业域:亮点 DeepSWE v1.1 68.8、BrowseComp 90.8。

旗舰effort 分档Fast 模式编码与 Agent

查看模型变体与证据

2026-07-21 Google DeepMind / Gemini·国际

Gemini 3.6 Flash / Gemini 3.5 Flash-Lite / Gemini 3.5 Flash Cyber

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Flash 系列定位为以效率、时延与可靠性支撑规模化 AI 智能体的主力款,3.6 Flash 在 3.5 Flash 基础上提升编码与知识工作且输出 token 减少 17%。4 项评测集中于代码、机器学习工程与计算机使用,亮点为 OSWorld-Verified 83.0% 与 MLE-Bench 63.9%。

高效智能体编码性价比

查看模型变体与证据

2026-07-20 ByteDance Seed / 豆包·国内

Seed Audio 1.0

模态文本·音频

全场景音频与声音创作模型,覆盖高保真语音合成、环境音效与音乐联合生成。官方页面未披露第三方量化 Benchmark 表格。

音频生成全场景声音创作语音合成

查看模型变体与证据 · 所收录来源未披露量化评测

2026-07-16 xAI / Grok·国际

Grok 4.5

价格$2/$6 每百万 tokens模态文本

xAI 发布 Grok 4.5,定位为面向编码、智能体任务与知识工作的最强模型,并与 Cursor 联合训练。评测集中于智能体编码,亮点如 DeepSWE 1.0 62.0%、Terminal-Bench 2.1 83.3%,并称平均输出 tokens 约为 Opus 4.8 (max) 的 1/4.2。

编码智能体知识工作高输出效率

查看模型变体与证据

2026-07-09 Meta / Llama·国际

Muse Spark 1.1

上下文1M模态文本·图像

Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。

智能体基础1M 上下文公测 API安全评估覆盖

查看模型变体与证据

2026-07-08 ByteDance Seed / 豆包·国内

Seedream 5.0 Pro

模态文本·图像

字节跳动推出的高品质图像生成与专业设计理解大模型,支持精准图文排版、设计层级理解与多风格创作。所收录官方博客页面未披露量化评测大表。

图像生成设计理解高分辨率排版

查看模型变体与证据 · 所收录来源未披露量化评测

2026-07-07 Meta / Llama·国际

Muse Image / Muse Video

本发布含 2 个变体,各变体规格见模型详情。

Meta Superintelligence Labs 打造的图像生成模型,具备强指令遵循、精确定点编辑与多图参考合成能力。

图像生成精准编辑多参考合成

查看模型变体与证据 · 所收录来源未披露量化评测

2026-07-06 Tencent / 腾讯混元·国内

Hy3

参数295B-A21B MoE上下文256K价格¥1/¥4 每百万 tokens · 页面原文为 1/4/0.25 元/百万 tokens 三档报价,第三档含义未标注模态文本

腾讯发布混元 Hy3:295B 总参/21B 激活 MoE、256K 上下文、三种思考模式,Apache 2.0 开源。评测覆盖编码、智能体搜索与推理,亮点如 SWE-bench Verified 78%、BrowseComp 84.2%。

开源权重长上下文三档思考智能体

查看模型变体与证据

2026-07 Moonshot AI / Kimi·国内

Kimi K3

上下文1M模态文本·图像

Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。

开源权重推理增强1M 长上下文Agentic

查看模型变体与证据

2026-06-30 Anthropic·国际

Claude Sonnet 5

价格$2/$10 每百万 tokens · 初上市定价 USD 2/10,原计划 2026-09-01 起的 USD 3/15 未生效,现已转为永久定价模态文本

发布文将其定位为最具智能体能力(most agentic)的 Sonnet,支持可选努力档位、默认开启网络安全防护,并作为 Free/Pro 默认模型全量提供。评测集中于智能体编码、计算机使用、知识工作与安全评估,亮点为 Terminal-Bench 2.1 80.4% 与 OSWorld-Verified 81.2%。

智能体编码计算机使用安全防护

查看模型变体与证据

2026-06-23 Mistral AI·国际

Mistral OCR 4

参数Specialized document OCR model模态图像·文本

SOTA 级文档智能与 OCR 专项模型,专为复杂版面解析、表格与多语言文档抽取设计。

文档智能OCR高精度版面解析

查看模型变体与证据 · 所收录来源未披露量化评测

2026-06-23 ByteDance Seed / 豆包·国内

Seed2.1 Pro / Seed2.1 Turbo / Seed2.1 Preview

本发布含 3 个变体,各变体规格见模型详情。

字节 Seed2.1 发布将 Pro 定位为系列最高档,官方称评估优先考察真实工作流表现而非静态榜单分数。已收录评测横跨通用 Agent、编码、多模态与视频理解:亮点 GDPval 87.9、OSWorld 78.8。

Pro 档Agent 向多模态视频理解

查看模型变体与证据

Seed2.1 Pro · workspace-bench 53Seed2.1 Pro · present-bench 54.6Seed2.1 Pro · agent-startup-bench 68.8Seed2.1 Pro · agents-last-exam full pass rate (left panel) 19.5Seed2.1 Pro · agents-last-exam average overall score (right panel) 41.4Seed2.1 Pro · one-million-bench 68.8Seed2.1 Pro · officeqa-pro 70.9Seed2.1 Pro · gdpval 87.9Seed2.1 Pro · finance-agent v1.1 60.7Seed2.1 Pro · apex-agents 33.8Seed2.1 Pro · xdailybench 61Seed2.1 Pro · doubao-multi-turn-bench 52.5Seed2.1 Pro · mcp-atlas 83.8Seed2.1 Pro · toolathlon 50.6Seed2.1 Pro · clawbench 66.6Seed2.1 Pro · claw-eval MM (metric Pass^3) 51Seed2.1 Pro · officeqa-pro MM (metric Avg Score) 72.2Seed2.1 Pro · wildclawbench 61.7Seed2.1 Pro · image2floorplan 48Seed2.1 Pro · mobileworld 73.1Seed2.1 Pro · osworld 78.8Seed2.1 Pro · creativework 42.5Seed2.1 Pro · gameworld 31.2Seed2.1 Pro · terminalbench 2.1 71Seed2.1 Pro · swebench-pro 57.5Seed2.1 Pro · cybergym 68.7Seed2.1 Pro · program-bench 50.3Seed2.1 Pro · nl2repo 47Seed2.1 Pro · swe-atlas 35.2Seed2.1 Pro · deepswe 32.7Seed2.1 Pro · code-arena-frontend 1539Seed2.1 Pro · charxiv-reasoning RQ (w. Tool) 85.4Seed2.1 Pro · measurebench avg. real & synthetic 62.9Seed2.1 Pro · mathvision w. Tool 92.6Seed2.1 Pro · mmmu Pro (w. Tool) 81.6Seed2.1 Pro · zerobench w. Tool 18Seed2.1 Pro · realworldqa 86.7Seed2.1 Pro · babyvision 73.7Seed2.1 Pro · erqa 72Seed2.1 Pro · embspatial-bench 83.4Seed2.1 Pro · mmlongbench 128K 78.3Seed2.1 Pro · tomato 79.5Seed2.1 Pro · tvbench 80.5Seed2.1 Pro · video-mme 89.2Seed2.1 Pro · lvbench 78Seed2.1 Pro · ovobench 80.7Seed2.1 Pro · ovbench 70Seed2.1 Pro · supergpqa 70.8Seed2.1 Pro · kina 48.3Seed2.1 Pro · hlehle Verified 42.9Seed2.1 Pro · scicode 59.8Seed2.1 Pro · frontier-science-olympiad 75Seed2.1 Pro · msqa 50.2Seed2.1 Pro · hlehle text-only with Search 55.7Seed2.1 Pro · browsecomp with Search 86.2Seed2.1 Pro · posttrain-bench 16.5Seed2.1 Pro · frontier-science-research 28.3Seed2.1 Pro · frontiercs 46.3Seed2.1 Pro · horizonmath 2
2026-06-16 Z.ai / 智谱 GLM·国内

GLM-5.2

上下文1M模态文本

智谱将 GLM-5.2 定位为面向长周期任务构建的模型,提供稳固支撑长程工作的 1M 上下文与更强编码能力(High/Max 档位控制),权重以 MIT 协议完全开源。已收录评测聚焦智能体编码与工具调用、长程软件工程与数学推理等领域,AIME 2026 99.2、Terminal-Bench 2.1(Terminus-2)81。

开源权重1M 长上下文推理档位控制智能体编码

查看模型变体与证据

2026-06-09 Anthropic·国际

Claude Fable 5 / Claude Mythos 5

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 以「Claude Fable 5 与 Claude Mythos 5」联合公告发布 Fable 5:一款带安全护栏的 Mythos 级模型,在网络安全/生物化学/蒸馏话题上按分类器回退到 Opus 4.8(影响 <5% 会话)。评测覆盖智能体编码、知识工作、计算机使用与生物安全,亮点如 SWE-Bench Pro 80.3%、OSWorld-Verified 85.0%。

前沿旗舰安全护栏智能体编码多模态

查看模型变体与证据

2026-06-01 MiniMax·国内

MiniMax-M3 / MiniMax-M2.7

本发布含 2 个变体,各变体规格见模型详情。

MiniMax M3 被发布文定位为将前沿编码、1M 上下文与原生多模态合一的单模型(Frontier Coding, 1M Context, Native Multimodality - All in One Model),采用 MSA 稀疏注意力并支持思考开关。评测覆盖编码、协作代理、GUI 与多模态:SWE-Bench Verified 80.5、BrowseComp 83.52、OSWorld-Verified 70.06、IMO 2025 35/42。

1M 上下文原生多模态编码增强MSA 稀疏注意力

查看模型变体与证据

2026-05-29 StepFun / 阶跃星辰·国内

Step 3.7 Flash

参数196B-A11B(另含 1.8B ViT)上下文256K模态文本·图像

Step 3.7 Flash 被阶跃星辰定位为面向真实场景代理的高效率 Flash 模型,支持三档推理级别、最高 400 tok/s。评测覆盖通用代理、编码与长上下文/视觉:BrowseComp 75.8%、HLE w. tool 47.2%、SWE-bench Verified 76.5%、V* 95.29%。

MoE 稀疏激活多模态高效率256K 上下文

查看模型变体与证据

2026-05-28 Anthropic·国际

Claude Opus 4.8 / Claude Opus 4.8 (fast)

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 发布文将 Claude Opus 4.8 定位为 Opus 系列新旗舰,主打诚实性训练(放行自写代码缺陷的概率约为上代 1/4)与 effort 分档(默认 high,另有 extra/max),并随发布推出 Claude Code 动态工作流。已收录 9 项评测集中于编码、终端与计算机/知识工作 Agent:亮点 SWE-bench Pro 69.2、GDPval-AA Elo 1890。

旗舰诚实性对齐effort 分档编码与计算机操作

查看模型变体与证据

2026-05-19 Google DeepMind / Gemini·国际

Gemini 3.5 Flash

上下文1M模态文本·图像

Google 在 I/O 2026 发布 Gemini 3.5 首个模型 Gemini 3.5 Flash,定位「frontier intelligence with action」,并成为 Gemini 应用与 Search AI Mode 的默认模型。评测横跨终端智能体、多模态理解与抽象推理,亮点如 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%,页面并称输出速度约为其他前沿模型 4 倍。

多模态高速输出智能体长上下文

查看模型变体与证据

2026-05-08 Google DeepMind / Gemini·国际

Gemini 3.1 Flash-Lite

价格$0.25/$1.5 每百万 tokens · 定价出自 2026-03-03 预览公告,GA 页未重列模态文本·图像

Google 将 Gemini 3.1 Flash-Lite 定位为 Gemini 3 系列中最快、最具成本效率的型号,2026-03-03 预览、2026-05-07/08 转正(GA)。已收录 3 项评测(均出自预览公告)覆盖对话竞技场、科学与多模态推理:亮点 Arena.ai 排行 1432 Elo、GPQA 86.9%。

极速档高性价比GA 转正

查看模型变体与证据

2026-05 Alibaba / Qwen·国内

Qwen3.7-Max

上下文1M模态文本

发布文以“智能体新前沿”为题,将 Qwen3.7-Max 定位为面向智能体时代的新一代旗舰(经阿里云百炼 API 提供,在 Claude Code/OpenClaw/Qwen Code 间泛化)。40 余项评测覆盖智能体编码、工具与办公场景及数理推理,亮点为 HMMT 2026 二月场 97.1 与 SWE-bench Verified 80.4。

旗舰智能体跨框架泛化

查看模型变体与证据

2026-04-30 xAI / Grok·国际

Grok 4.3

上下文1M模态文本·视频

Grok 4.3 为旗舰推理模型,分级推出(SuperGrok Heavy beta 2026-04-17、公开 API 2026-04-30),具备 1M 超长上下文、常开推理与原生视频多模态输入能力。

静默发布常开推理1M 长上下文原生视频输入

查看模型变体与证据 · 所收录来源未披露量化评测

2026-04-27 Alibaba / Qwen·国内

Qwen3.6-Flash

模态文本·图像

Qwen3.6-Flash 为原生视觉语言 Flash 系列经济档,相对 3.5-Flash 在代理式编码、数学/代码推理、空间智能与目标定位上显著提升。

占位条目视觉语言经济档位即将下线

查看模型变体与证据 · 所收录来源未披露量化评测

2026-04-24 DeepSeek·国内

DeepSeek-V4-Pro / DeepSeek-V4-Flash

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 发布 V4 预览版「迈入百万上下文普惠时代」,V4-Pro 为旗舰:1M 上下文、思考/非思考双模式、reasoning_effort high/max。评测覆盖推理、编码、智能体与百万级长上下文,亮点如 GPQA Diamond 90.1%、Codeforces 3206。

开源权重长上下文推理增强预览版

查看模型变体与证据

DeepSeek-V4-Pro · mmlu-pro Pro, max effort 87.5DeepSeek-V4-Pro · simpleqa-verified Pro, max effort 57.9DeepSeek-V4-Pro · chinese-simpleqa Pro, max effort 84.4DeepSeek-V4-Pro · gpqa Diamond, Pro max effort 90.1DeepSeek-V4-Pro · hlehle Pro, max effort 37.7DeepSeek-V4-Pro · lcb Pro, max effort 93.5DeepSeek-V4-Pro · codeforces Pro, max effort 3206DeepSeek-V4-Pro · hmmt-26 February 2026, Pro max effort 95.2DeepSeek-V4-Pro · imo-answerbench Pro, max effort 89.8DeepSeek-V4-Pro · apex Pro, max effort 38.3DeepSeek-V4-Pro · apex-shortlist Pro, max effort 90.2DeepSeek-V4-Pro · mrcr Pro 83.5DeepSeek-V4-Pro · corpusqa-1m Pro 62.0DeepSeek-V4-Pro · terminalbench 2.0, Pro max effort 67.9DeepSeek-V4-Pro · swebench Verified, Pro max effort 80.6DeepSeek-V4-Pro · swebench-pro Pro max effort 55.4DeepSeek-V4-Pro · swebench-multilingual Pro max effort 76.2DeepSeek-V4-Pro · browsecomp Pro max effort 83.4DeepSeek-V4-Pro · hlehle w/ tools, Pro max effort 48.2DeepSeek-V4-Pro · gdpval-aa Pro max effort 1554DeepSeek-V4-Pro · mcp-atlas public set, Pro max effort 73.6DeepSeek-V4-Pro · toolathlon Pro max effort 51.8DeepSeek-V4-Flash · mmlu-pro Flash, max effort 86.2DeepSeek-V4-Flash · simpleqa-verified Flash, max effort 34.1DeepSeek-V4-Flash · chinese-simpleqa Flash, max effort 78.9DeepSeek-V4-Flash · gpqa Diamond, Flash max effort 88.1DeepSeek-V4-Flash · hlehle Flash, max effort 34.8DeepSeek-V4-Flash · lcb Flash, max effort 91.6DeepSeek-V4-Flash · codeforces Flash, max effort 3052DeepSeek-V4-Flash · hmmt-26 February 2026, Flash max effort 94.8DeepSeek-V4-Flash · imo-answerbench Flash, max effort 88.4DeepSeek-V4-Flash · apex Flash, max effort 33.0DeepSeek-V4-Flash · apex-shortlist Flash, max effort 85.7DeepSeek-V4-Flash · mrcr Flash 78.7DeepSeek-V4-Flash · corpusqa-1m Flash 60.5DeepSeek-V4-Flash · terminalbench 2.0, Flash max effort 56.9DeepSeek-V4-Flash · swebench Verified, Flash max effort 79.0DeepSeek-V4-Flash · swebench-pro Flash max effort 52.6DeepSeek-V4-Flash · swebench-multilingual Flash max effort 73.3DeepSeek-V4-Flash · browsecomp Flash max effort 73.2DeepSeek-V4-Flash · hlehle w/ tools, Flash max effort 45.1DeepSeek-V4-Flash · gdpval-aa Flash max effort 1395DeepSeek-V4-Flash · mcp-atlas public set, Flash max effort 69.0DeepSeek-V4-Flash · toolathlon Flash max effort 47.8
2026-04-23 OpenAI·国际

GPT-5.5 / GPT-5.5 Pro

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 发布 GPT-5.5,提供 low/medium/high/xhigh 推理档(另有非推理模式)。评测横跨智能体编码、知识工作、长上下文与科学/网络安全,亮点如 Terminal-Bench 2.0 82.7%、ARC-AGI-2 85.0%。

智能体编码知识工作长上下文网络安全

查看模型变体与证据

GPT-5.5 · swebench-pro Public 58.6%gpt-5-4 · swebench-pro Public 57.7%claude-opus-4-7 · swebench-pro Public 64.3%gemini-3-1-pro · swebench-pro Public 54.2%GPT-5.5 · terminalbench 2.0 82.7%gpt-5-4 · terminalbench 2.0 75.1%claude-opus-4-7 · terminalbench 2.0 69.4%gemini-3-1-pro · terminalbench 2.0 68.5%GPT-5.5 · expert-swe 73.1%gpt-5-4 · expert-swe 68.5%GPT-5.5 · gdpval 84.9%gpt-5-4 · gdpval 83.0%GPT-5.5 Pro · gdpval 82.3%gpt-5-4-pro · gdpval 82.0%claude-opus-4-7 · gdpval 80.3%gemini-3-1-pro · gdpval 67.3%GPT-5.5 · finance-agent v1.1 60.0%gpt-5-4 · finance-agent v1.1 56.0%gpt-5-4-pro · finance-agent v1.1 61.5%claude-opus-4-7 · finance-agent v1.1 64.4%gemini-3-1-pro · finance-agent v1.1 59.7%GPT-5.5 · officeqa-pro 54.1%gpt-5-4 · officeqa-pro 53.2%claude-opus-4-7 · officeqa-pro 43.6%gemini-3-1-pro · officeqa-pro 18.1%GPT-5.5 · osworld Verified 78.7%gpt-5-4 · osworld Verified 75.0%claude-opus-4-7 · osworld Verified 78.0%GPT-5.5 · mmmu-pro no tools 81.2%gemini-3-1-pro · mmmu-pro no tools 80.5%GPT-5.5 · mmmu-pro with tools 83.2%gpt-5-4 · mmmu-pro with tools 82.1%GPT-5.5 · browsecomp 84.4%GPT-5.5 Pro · browsecomp 90.1%gpt-5-4 · browsecomp 82.7%gpt-5-4-pro · browsecomp 89.3%claude-opus-4-7 · browsecomp 79.3%gemini-3-1-pro · browsecomp 85.9%GPT-5.5 · mcp-atlas 75.3%gpt-5-4 · mcp-atlas 70.6%claude-opus-4-7 · mcp-atlas 79.1%gemini-3-1-pro · mcp-atlas 78.2%GPT-5.5 · toolathlon 55.6%gpt-5-4 · toolathlon 54.6%gemini-3-1-pro · toolathlon 48.8%GPT-5.5 · tau2-bench Telecom, original prompts 98.0%gpt-5-4 · tau2-bench Telecom, original prompts 92.8%GPT-5.5 · genebench 25.0%GPT-5.5 Pro · genebench 33.2%gpt-5-4 · genebench 19.0%gpt-5-4-pro · genebench 25.6%GPT-5.5 · frontiermath Tier 1-3 51.7%GPT-5.5 Pro · frontiermath Tier 1-3 52.4%gpt-5-4 · frontiermath Tier 1-3 47.6%gpt-5-4-pro · frontiermath Tier 1-3 50.0%claude-opus-4-7 · frontiermath Tier 1-3 43.8%gemini-3-1-pro · frontiermath Tier 1-3 36.9%GPT-5.5 · frontiermath Tier 4 35.4%GPT-5.5 Pro · frontiermath Tier 4 39.6%gpt-5-4 · frontiermath Tier 4 27.1%gpt-5-4-pro · frontiermath Tier 4 38.0%claude-opus-4-7 · frontiermath Tier 4 22.9%gemini-3-1-pro · frontiermath Tier 4 16.7%GPT-5.5 · bixbench 80.5%gpt-5-4 · bixbench 74.0%GPT-5.5 · gpqa Diamond 93.6%gpt-5-4 · gpqa Diamond 92.8%gpt-5-4-pro · gpqa Diamond 94.4%claude-opus-4-7 · gpqa Diamond 94.2%gemini-3-1-pro · gpqa Diamond 94.3%GPT-5.5 · hlehle no tools 41.4%GPT-5.5 Pro · hlehle no tools 43.1%gpt-5-4 · hlehle no tools 39.8%gpt-5-4-pro · hlehle no tools 42.7%claude-opus-4-7 · hlehle no tools 46.9%gemini-3-1-pro · hlehle no tools 44.4%GPT-5.5 · hlehle with tools 52.2%GPT-5.5 Pro · hlehle with tools 57.2%gpt-5-4 · hlehle with tools 52.1%gpt-5-4-pro · hlehle with tools 58.7%claude-opus-4-7 · hlehle with tools 54.7%gemini-3-1-pro · hlehle with tools 51.4%GPT-5.5 · cybergym 81.8%gpt-5-4 · cybergym 79.0%claude-opus-4-7 · cybergym 73.1%GPT-5.5 · graphwalks BFS 256k 73.7%gpt-5-4 · graphwalks BFS 256k 62.5%claude-opus-4-7 · graphwalks BFS 256k 76.9%GPT-5.5 · graphwalks BFS 1mil 45.4%gpt-5-4 · graphwalks BFS 1mil 9.4%claude-opus-4-6 · graphwalks BFS 1mil 41.2%GPT-5.5 · graphwalks parents 256k 90.1%gpt-5-4 · graphwalks parents 256k 82.8%claude-opus-4-7 · graphwalks parents 256k 93.6%GPT-5.5 · graphwalks parents 1mil 58.5%gpt-5-4 · graphwalks parents 1mil 44.4%claude-opus-4-6 · graphwalks parents 1mil 72.0%GPT-5.5 · mrcr v2 8-needle 512K-1M 74.0%gpt-5-4 · mrcr v2 8-needle 512K-1M 36.6%GPT-5.5 · arc-agi 1 (Verified) 95.0%gpt-5-4 · arc-agi 1 (Verified) 93.7%gpt-5-4-pro · arc-agi 1 (Verified) 94.5%claude-opus-4-7 · arc-agi 1 (Verified) 93.5%gemini-3-1-pro · arc-agi 1 (Verified) 98.0%GPT-5.5 · arc-agi 2 (Verified) 85.0%gpt-5-4 · arc-agi 2 (Verified) 73.3%gpt-5-4-pro · arc-agi 2 (Verified) 83.3%claude-opus-4-7 · arc-agi 2 (Verified) 75.8%gemini-3-1-pro · arc-agi 2 (Verified) 77.1%GPT-5.5 · aa-intelligence-index 60.2claude-opus-4-7 · aa-intelligence-index 57.3GPT-5.5 · mrcr v2 8-needle 4K-8K 98.1%gpt-5-4 · mrcr v2 8-needle 4K-8K 97.3%GPT-5.5 · mrcr v2 8-needle 8K-16K 93.0%gpt-5-4 · mrcr v2 8-needle 8K-16K 91.4%GPT-5.5 · mrcr v2 8-needle 16K-32K 96.5%gpt-5-4 · mrcr v2 8-needle 16K-32K 97.2%GPT-5.5 · mrcr v2 8-needle 32K-64K 90.0%gpt-5-4 · mrcr v2 8-needle 32K-64K 90.5%GPT-5.5 · mrcr v2 8-needle 64K-128K 83.1%gpt-5-4 · mrcr v2 8-needle 64K-128K 86.0%GPT-5.5 · mrcr v2 8-needle 128K-256K 87.5%gpt-5-4 · mrcr v2 8-needle 128K-256K 79.3%GPT-5.5 · mrcr v2 8-needle 256K-512K 81.5%gpt-5-4 · mrcr v2 8-needle 256K-512K 57.5%claude-opus-4-7 · mrcr v2 8-needle 128K-256K 59.2%claude-opus-4-7 · mrcr v2 8-needle 512K-1M 32.2%gpt-5-4 · mmmu-pro no tools 81.2%
2026-04-20 Moonshot AI / Kimi·国内

Kimi K2.6

上下文256K模态文本·图像

Kimi K2.6 是月之暗面的开源编码旗舰(Advancing Open-Source Coding),主打长程编码与代理蜂群(300 子代理 / 4000 步)。评测横跨编码、代理、数学与视觉:SWE-bench Verified 80.2、SWE-Bench Pro 58.6、Terminal-Bench 2.0(Terminus-2)66.7、HLE-Full w/ tools 54.0。

开源权重编码增强代理蜂群多模态

查看模型变体与证据

2026-04-16 Anthropic·国际

Claude Opus 4.7 / Claude Opus 4.7 (fast)

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 将 Claude Opus 4.7 定位为在高级软件工程上较 Opus 4.6 显著提升、最难任务上增益尤为明显的旗舰模型,同时大幅增强视觉分辨率;这也是首个按 Project Glasswing 分级防护方案发布的模型。已收录评测覆盖智能体编码与终端、长上下文检索、计算机操作、网络安全与多学科推理等领域,SWE-bench Verified 87.6、GPQA Diamond 94.2。

智能体编码高分辨率视觉推理档位控制分级网络安全防护

查看模型变体与证据

2026-04-07 Z.ai / 智谱 GLM·国内

GLM-5.1

模态文本

GLM-5.1 被 z.ai 定位为面向长程任务(Towards Long-Horizon Tasks)的代理工程旗舰,强调数百轮持续优化与长时程任务能力。评测集中在推理、编码与代理三类:SWE-Bench Pro 58.4、Terminal-Bench 2.0(Terminus-2)63.5、BrowseComp(w/ 上下文管理)79.3、HLE w/ Tools 52.3。

开源权重长程任务代理工程

查看模型变体与证据

2026-04-02 Google DeepMind / Gemini·国际

Gemma 4 E2B / Gemma 4 E4B / Gemma 4 26B MoE / Gemma 4 31B Dense

本发布含 4 个变体,各变体规格见模型详情。

面向本地运行的开放权重模型,支持推理与工具调用;本变体输入能力和上下文按官方发布页记录。

开放权重本地运行

查看模型变体与证据

Gemma 4 31B Dense · mmlu-pro MMLU Pro 85.2%Gemma 4 26B MoE · mmlu-pro MMLU Pro 82.6%Gemma 4 E4B · mmlu-pro MMLU Pro 69.4%Gemma 4 E2B · mmlu-pro MMLU Pro 60.0%Gemma 4 31B Dense · aime-26 AIME 2026 no tools 89.2%Gemma 4 26B MoE · aime-26 AIME 2026 no tools 88.3%Gemma 4 E4B · aime-26 AIME 2026 no tools 42.5%Gemma 4 E2B · aime-26 AIME 2026 no tools 37.5%Gemma 4 31B Dense · lcb LiveCodeBench v6 80.0%Gemma 4 26B MoE · lcb LiveCodeBench v6 77.1%Gemma 4 E4B · lcb LiveCodeBench v6 52.0%Gemma 4 E2B · lcb LiveCodeBench v6 44.0%Gemma 4 31B Dense · codeforces Codeforces ELO 2150Gemma 4 26B MoE · codeforces Codeforces ELO 1718Gemma 4 E4B · codeforces Codeforces ELO 940Gemma 4 E2B · codeforces Codeforces ELO 633Gemma 4 31B Dense · gpqa GPQA Diamond 84.3%Gemma 4 26B MoE · gpqa GPQA Diamond 82.3%Gemma 4 E4B · gpqa GPQA Diamond 58.6%Gemma 4 E2B · gpqa GPQA Diamond 43.4%Gemma 4 31B Dense · tau-bench Tau2 (average over 3) 76.9%Gemma 4 26B MoE · tau-bench Tau2 (average over 3) 68.2%Gemma 4 E4B · tau-bench Tau2 (average over 3) 42.2%Gemma 4 E2B · tau-bench Tau2 (average over 3) 24.5%Gemma 4 31B Dense · hlehle HLE no tools 19.5%Gemma 4 26B MoE · hlehle HLE no tools 8.7%Gemma 4 31B Dense · hlehle HLE with search 26.5%Gemma 4 26B MoE · hlehle HLE with search 17.2%Gemma 4 31B Dense · bbeh BigBench Extra Hard 74.4%Gemma 4 26B MoE · bbeh BigBench Extra Hard 64.8%Gemma 4 E4B · bbeh BigBench Extra Hard 33.1%Gemma 4 E2B · bbeh BigBench Extra Hard 21.9%Gemma 4 31B Dense · mmmlu MMMLU 88.4%Gemma 4 26B MoE · mmmlu MMMLU 86.3%Gemma 4 E4B · mmmlu MMMLU 76.6%Gemma 4 E2B · mmmlu MMMLU 67.4%Gemma 4 31B Dense · mmmu MMMU Pro 76.9%Gemma 4 26B MoE · mmmu MMMU Pro 73.8%Gemma 4 E4B · mmmu MMMU Pro 52.6%Gemma 4 E2B · mmmu MMMU Pro 44.2%Gemma 4 31B Dense · omnidocbench OmniDocBench 1.5 (average edit distance, lower is better) 0.131Gemma 4 26B MoE · omnidocbench OmniDocBench 1.5 (average edit distance, lower is better) 0.149Gemma 4 E4B · omnidocbench OmniDocBench 1.5 (average edit distance, lower is better) 0.181Gemma 4 E2B · omnidocbench OmniDocBench 1.5 (average edit distance, lower is better) 0.290Gemma 4 31B Dense · mathvision MATH-Vision 85.6%Gemma 4 26B MoE · mathvision MATH-Vision 82.4%Gemma 4 E4B · mathvision MATH-Vision 59.5%Gemma 4 E2B · mathvision MATH-Vision 52.4%Gemma 4 31B Dense · medxpertqa-mm MedXPertQA MM 61.3%Gemma 4 26B MoE · medxpertqa-mm MedXPertQA MM 58.1%Gemma 4 E4B · medxpertqa-mm MedXPertQA MM 28.7%Gemma 4 E2B · medxpertqa-mm MedXPertQA MM 23.5%Gemma 4 E4B · covost CoVoST 35.54Gemma 4 E2B · covost CoVoST 33.47Gemma 4 E4B · fleurs FLEURS (lower is better) 0.08Gemma 4 E2B · fleurs FLEURS (lower is better) 0.09Gemma 4 31B Dense · mrcr MRCR v2 8 needle 128k (average) 66.4%Gemma 4 26B MoE · mrcr MRCR v2 8 needle 128k (average) 44.1%Gemma 4 E4B · mrcr MRCR v2 8 needle 128k (average) 25.4%Gemma 4 E2B · mrcr MRCR v2 8 needle 128k (average) 19.1%
2026-03-31 xAI / Grok·国际

Grok 4.20

Grok 4.20 为介于 Grok 4.1 与 Grok 4.3 之间的推理旗舰,采用多代理 Heavy 配置,面向高难度逻辑推理与复杂代理任务。

静默发布多代理 Heavy 配置

查看模型变体与证据 · 所收录来源未披露量化评测

2026-03-19 Xiaomi / 小米·国内

MiMo-V2.5-Pro

参数1.02T-A42B上下文1M模态文本·代码·多模态

MiMo-V2.5-Pro 是小米万亿级参数旗舰混合专家大模型,总参数 1.02T,激活 42B,支持 100 万 token 上下文。评测全面对标国际前沿:MMLU 89.4、GSM8K 99.6、MATH 86.2、SWE-bench Verified 78.9%、C-Eval 91.5、BBH 88.4。

万亿 MoE1M 上下文SWE-bench 高分全场景智能代理

查看模型变体与证据

2026-03-18 MiniMax·国内

MiniMax-M2.7

模态文本

MiniMax 发布 M2.7「Early Echoes of Self-Evolution」,定位为首个深度参与自身进化的 M 系列模型,支持 Agent Teams、复杂 Skills 与动态工具搜索。评测集中在智能体与编码,亮点如 SWE-Bench Pro 56.2%、MLE-Bench Lite 66.6%。

开源权重智能体自我进化办公

查看模型变体与证据

2026-03-16 Mistral AI·国际

Mistral Small 4

参数Small dense architecture上下文128K模态文本

Mistral 官方高效轻量模型,专为企业级低成本高通量推理与端侧部署优化。

轻量端侧高吞吐低延迟代码与推理增强

查看模型变体与证据 · 所收录来源未披露量化评测

2026-03-10 ByteDance Seed / 豆包·国内

Seed 2.0-Lite

模态文本·图像·音频·视频

字节 Seed 系列页将 Seed2.0 Lite 定位为 Seed 基础模型系列首个全模态(omni-modal)理解模型,原生支持视频、图像、音频与文本的统一理解,并升级 Agent、Coding 与 GUI 能力,兼顾输出质量与响应速度,适合通用生产级场景。已收录评测覆盖文本智能体与编码、多模态理解、GUI 操作及视频与音频理解等领域,GPQA Diamond 88.4%、OSWorld Verified 64.4%。

全模态理解生产级通用GUI 操作智能体

查看模型变体与证据

gpqa Diamond 88.4%supergpqa 69.6%hlehle no tool, text only 25.7%beyondaime 79.0%frontier-science-olympiad 72.0%superchem text-only 55.0%babe 57.9%cl-bench 20.1%multichallenge 69.9%widesearch 70.3%browsecomp 64.0%researchrubrics 59.2%xpertbench 56.8%skillsbench 43.7%gdpval 53.1%finsearchcomp 63.8%tob-agent 51.4%swebench-multilingual 66.6%swebench-pro 46.6%nl2repo 28.7%paperbench 52.5%terminalbench 2.0 43.3%vibe-coding-human-eval human evaluation 49.4%mathvision STEM 89.8mmmu-pro STEM 78.4hipho STEM 83.8medxpertqa-mm STEM 79.6babyvision Perception 64.7vlmsarebiased Perception 80.6simplevqa Visual Knowledge 72.7worldvqa Visual Knowledge 50.2charxiv-descriptive InfoGraphics 94.5charxiv-reasoning InfoGraphics 82.4erqa Embodied 71.5osworld Verified 64.4%mobileworld 64.6%video-mmmu Video Knowledge 88.3mmvu Video Knowledge 76.7videosimpleqa-v2 Video Knowledge 69videosimpleqa Video Knowledge 71.7scivideo Video Knowledge 70.3videoreasonbench Video Reasoning 59.4videoholmes Video Reasoning 67.4minerva Video Reasoning 68.5tvbench Motion & Perception 80.4tomato Motion & Perception 72.5egotempo Motion & Perception 68.4motionbench Motion & Perception 72.4contphy Motion & Perception 62.4morse-500 Motion & Perception 34.6video-mme Long Video 89video-mme-v2 Long Video 64.9cgbench Long Video 65.5longvideobench Long Video 79lvbench Long Video 76.4videoeval-pro Long Video 49.5ovbench Streaming Video 63.2odvbench Streaming Video 66livesports-3k Streaming Video 78.1ovobench Streaming Video 75.4vispeak Streaming Video 87crossvid Multi-video 63.7omnivideobench Visual-Audio Understanding 61.7avmeme Visual-Audio Understanding 69.5jointavbench Visual-Audio Understanding 69.5worldsense Visual-Audio Understanding 67.3mmsu Audio Understanding 86.54wildspeech Audio Understanding 75.81wenetspeech ASR, WenetSpeech test-net 4.47wenetspeech ASR, WenetSpeech test-meeting 5.31librispeech ASR, LibriSpeech test-clean 1.07librispeech ASR, LibriSpeech test-other 2.17fleurs S2TT, Fleurs 15 langs (zh/en <-> xx) 74.7
2026-03-05 OpenAI·国际

GPT-5.4 / GPT-5.4 Pro / GPT-5.4 mini / GPT-5.4 nano

本发布含 4 个变体,各变体规格见模型详情。

OpenAI 将 GPT-5.4 定位为融合 GPT-5.3-Codex 编码谱系的新旗舰(ChatGPT 内 Thinking 模式,effort none/low/medium/high/xhigh,1M 上下文,原生计算机操作与工具搜索)。已收录 90 余项评测横跨知识工作、编码、计算机操作与长上下文:亮点 GDPval 83.0%、OSWorld-Verified 75.0%。

旗舰1M 长上下文原生计算机操作工具搜索

查看模型变体与证据

GPT-5.4 · gdpval 83.0%gpt-5-3-codex · gdpval 70.9%gpt-5-2 · gdpval 70.9%GPT-5.4 · swebench-pro Public 57.7%gpt-5-3-codex · swebench-pro Public 56.8%gpt-5-2 · swebench-pro Public 55.6%GPT-5.4 · osworld Verified 75.0%gpt-5-3-codex · osworld Verified 74.0%*gpt-5-2 · osworld Verified 47.3%GPT-5.4 · toolathlon 54.6%gpt-5-3-codex · toolathlon 51.9%gpt-5-2 · toolathlon 46.3%GPT-5.4 · browsecomp 82.7%GPT-5.4 Pro · browsecomp 89.3%gpt-5-3-codex · browsecomp 77.3%gpt-5-2 · browsecomp 65.8%GPT-5.4 · webarena Verified 67.3%gpt-5-2 · webarena Verified 65.4%GPT-5.4 · online-mind2web 92.8%chatgpt-atlas-agent · online-mind2web 70.9%GPT-5.4 · mmmu-pro no tools 81.2%gpt-5-2 · mmmu-pro no tools 79.5%GPT-5.4 · omnidocbench 0.109gpt-5-2 · omnidocbench 0.140GPT-5.4 Pro · gdpval 82.0%gpt-5-2-pro · gdpval 74.1%GPT-5.4 · finance-agent v1.1 56.0%GPT-5.4 Pro · finance-agent v1.1 61.5%gpt-5-3-codex · finance-agent v1.1 54.0%gpt-5-2 · finance-agent v1.1 59.5%GPT-5.4 · officeqa 68.1%gpt-5-3-codex · officeqa 65.1%gpt-5-2 · officeqa 63.1%GPT-5.4 · terminalbench 2.0 75.1%gpt-5-3-codex · terminalbench 2.0 77.3%gpt-5-2 · terminalbench 2.0 62.2%GPT-5.4 · mmmu-pro with tools 82.1%gpt-5-2 · mmmu-pro with tools 80.4%gpt-5-2-pro · browsecomp 77.9%GPT-5.4 · mcp-atlas 67.2%gpt-5-2 · mcp-atlas 60.6%GPT-5.4 · tau2-bench 98.9%gpt-5-2 · tau2-bench 98.7%GPT-5.4 · frontier-science-research 33.0%GPT-5.4 Pro · frontier-science-research 36.7%gpt-5-2 · frontier-science-research 25.2%GPT-5.4 · frontiermath Tier 1-3 47.6%GPT-5.4 Pro · frontiermath Tier 1-3 50.0%gpt-5-2 · frontiermath Tier 1-3 40.7%GPT-5.4 · frontiermath Tier 4 27.1%GPT-5.4 Pro · frontiermath Tier 4 38.0%gpt-5-2 · frontiermath Tier 4 18.8%gpt-5-2-pro · frontiermath Tier 4 31.3%GPT-5.4 · gpqa Diamond 92.8%GPT-5.4 Pro · gpqa Diamond 94.4%gpt-5-3-codex · gpqa Diamond 92.6%gpt-5-2 · gpqa Diamond 92.4%gpt-5-2-pro · gpqa Diamond 93.2%GPT-5.4 · hlehle no tools 39.8%GPT-5.4 Pro · hlehle no tools 42.7%gpt-5-2 · hlehle no tools 34.5%gpt-5-2-pro · hlehle no tools 36.6%GPT-5.4 · hlehle with tools 52.1%GPT-5.4 Pro · hlehle with tools 58.7%gpt-5-2 · hlehle with tools 45.5%gpt-5-2-pro · hlehle with tools 50.0%GPT-5.4 · graphwalks BFS 0K–128K 93.0%gpt-5-2 · graphwalks BFS 0K–128K 94.0%GPT-5.4 · graphwalks BFS 256K–1M 21.4%GPT-5.4 · graphwalks parents 0–128K 89.8%gpt-5-2 · graphwalks parents 0–128K 89.0%GPT-5.4 · graphwalks parents 256K–1M 32.4%GPT-5.4 · mrcr v2 8-needle 4K–8K 97.3%gpt-5-2 · mrcr v2 8-needle 4K–8K 98.2%GPT-5.4 · mrcr v2 8-needle 8K–16K 91.4%gpt-5-2 · mrcr v2 8-needle 8K–16K 89.3%GPT-5.4 · mrcr v2 8-needle 16K–32K 97.2%gpt-5-2 · mrcr v2 8-needle 16K–32K 95.3%GPT-5.4 · mrcr v2 8-needle 32K–64K 90.5%gpt-5-2 · mrcr v2 8-needle 32K–64K 92.0%GPT-5.4 · mrcr v2 8-needle 64K–128K 86.0%gpt-5-2 · mrcr v2 8-needle 64K–128K 85.6%GPT-5.4 · mrcr v2 8-needle 128K–256K 79.3%gpt-5-2 · mrcr v2 8-needle 128K–256K 77.0%GPT-5.4 · mrcr v2 8-needle 256K–512K 57.5%GPT-5.4 · mrcr v2 8-needle 512K–1M 36.6%GPT-5.4 · arc-agi 1 (Verified) 93.7%GPT-5.4 Pro · arc-agi 1 (Verified) 94.5%gpt-5-2 · arc-agi 1 (Verified) 86.2%gpt-5-2-pro · arc-agi 1 (Verified) 90.5%GPT-5.4 · arc-agi 2 (Verified) 73.3%GPT-5.4 Pro · arc-agi 2 (Verified) 83.3%gpt-5-2 · arc-agi 2 (Verified) 52.9%gpt-5-2-pro · arc-agi 2 (Verified) 54.2% (high)gpt-4-1 · tau2-bench no tools 43.6%GPT-5.4 · tau2-bench no tools 64.3%gpt-5-2 · tau2-bench no tools 57.2%
2026-02-26 ByteDance Seed / 豆包·国内

Seed 2.0-Mini

模态文本·视频·音频

官方 Seed2 系列页将 Mini 列为该代更小档位(Seed2.0 Mini 0215 快照),本页仅在视频/视听理解评测表收录其数据。已收录 28 项评测集中于长视频、流式视频与视听理解:亮点 Video-MMMU(Video Knowledge)80.6、Video-MME(Long Video)81.2。

小尺寸档位视频理解视听理解

查看模型变体与证据

2026-02-19 Google DeepMind / Gemini·国际

Gemini 3.1 Pro

上下文1M模态文本·图像

Google 将 Gemini 3.1 Pro 定位为「为最复杂任务打造的更聪明模型」,基于 Gemini 3 Pro,发布时为 preview(thinking 档 low/medium/high)。已收录 19 项评测横跨推理、代码、多模态与长上下文:亮点 GPQA 94.3%、SWE-bench Verified 80.6%。

旗舰1M 长上下文多模态Preview

查看模型变体与证据

2026-02-12 MiniMax·国内

MiniMax-M2.5

价格$0.15/$1.2 每百万 tokens · M2.5 为 50 TPS 档、价格为 M2.5-Lightning(100 TPS,$0.3/$2.4 每百万 tokens)的一半模态文本

MiniMax 将 M2.5 定位为「为真实生产力打造」,披露 20 万+ 真实环境 RL 训练与 Forge 智能体原生框架,并随附同能力 2 倍速的 M2.5-Lightning 档。已收录 22 项评测集中于编码、搜索与 Agent 工具调用:亮点 SWE-bench Verified 80.2%、tau2-Bench Telecom 97.8%。

开源权重Agent RL 训练高效编码

查看模型变体与证据

2026-02-11 Z.ai / 智谱 GLM·国内

GLM-5

参数744B-A40B MoE上下文200K模态文本

智谱以「From Vibe Coding to Agentic Engineering」为主题发布 GLM-5:744B 总参/40B 激活的 MoE(DSA 架构,28.5T 预训练 tokens),MIT 许可开源。评测覆盖推理、编码与通用智能体,亮点如 HMMT 2025.11 96.9%、τ²-Bench 89.7%。

开源权重智能体工程推理编码

查看模型变体与证据

2026-02-05 Anthropic·国际

Claude Opus 4.6

上下文1M(beta)价格$10/$37.5 每百万 tokens · 发布文给出的 premium 1M 上下文(beta)档定价;标准档定价发布文未给出模态文本·图像

Claude Opus 4.6 是 Anthropic 的旗舰模型,引入多档推理努力(low/medium/high/max)、自适应思考、上下文压缩与 1M 上下文 beta。评测覆盖代理编码/工具/搜索、法律与多语言问答:SWE-bench Verified 80.8、GPQA Diamond 91.3、ARC-AGI-2 68.8、BrowseComp 84.0。

长上下文推理努力分级代理工具调用多模态

查看模型变体与证据

2026-01-31 StepFun / 阶跃星辰·国内

Step 3.5 Flash

参数196B-A11B MoE上下文256K模态文本

发布文将其定位为“快、准、稳”的智能体智能模型(Apache 2.0 开源,196B 总参/约 11B 激活稀疏 MoE,MTP-3,256K 上下文)。16 项评测以智能体搜索、数学与编码为主,亮点为 HMMT 2025 二月场 98.4 与 AIME 2025 97.3。

开源权重高效 MoE智能体搜索MTP-3

查看模型变体与证据

2026-01-27 Moonshot AI / Kimi·国内

Kimi K2.5

上下文256K模态文本·图像·视频

发布文以“视觉智能体智能”为题,将 K2.5 定位为在 K2 基础上经 15T 视觉+文本混合语料继续预训练的原生多模态模型,Agent Swarm 最多 100 个子智能体/1500 步。45 项评测覆盖视觉理解、视频、智能体搜索与编码,亮点为 OCRBench 92.3 与 BrowseComp(Agent Swarm 模式)78.4。

原生多模态Agent Swarm长上下文视频理解

查看模型变体与证据

2025
2025-12-22 Z.ai / 智谱 GLM·国内

GLM-4.7

模态文本

发布文以“推进编码能力”为题,将 GLM-4.7 定位为编码与智能体任务导向的模型,支持交错/保留/回合级思考模式。17 项评测覆盖数理推理、代码智能体与通用智能体,亮点为 HMMT 2025 二月场 97.1 与 τ²-Bench 87.4(SWE-bench Verified 73.8)。

编码开源权重思考模式智能体

查看模型变体与证据

2025-12-17 Google DeepMind / Gemini·国际

Gemini 3 Flash

上下文1M价格$0.5/$3 每百万 tokens模态文本·图像·视频

Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。

速度优先多模态1M 长上下文编码与 Agent

查看模型变体与证据

2025-12-09 Mistral AI·国际

Devstral 2 / Devstral Small 2

本发布含 2 个变体,各变体规格见模型详情。

Mistral 将 Devstral 2 定位为面向智能体编码的下一代开源 SOTA 编码模型(modified MIT 协议),并随发布配套推出 Mistral Vibe CLI。已收录评测为软件工程与人评胜率两项,SWE-bench Verified 72.2%、人评 42.8% 胜 / 28.6% 负。

开源权重智能体编码稠密架构CLI 配套

查看模型变体与证据

2025-12-04 Google DeepMind / Gemini·国际

Gemini 3 Deep Think

模态文本

谷歌将 Gemini 3 Deep Think 定位为 Gemini 应用内面向 Google AI Ultra 订阅用户推出的增强推理模式,专攻挑战最先进模型的复杂数学、科学与逻辑问题。已收录评测为通用推理与抽象推理两项,HLE 41.0%(无工具)、ARC-AGI-2 45.1%(带代码执行)。

增强推理模式并行推理订阅可用

查看模型变体与证据

2025-12-02 Mistral AI·国际

Mistral Large 3 / Ministral 3 14B / Ministral 3 8B / Ministral 3 3B

本发布含 4 个变体,各变体规格见模型详情。

Mistral 将 Large 3 定位为其迄今最强模型,也是 Mixtral 系列之后首个稀疏 MoE(41B 激活/675B 总参,Apache 2.0 开源,旗舰多模态多语言定位)。已收录评测为榜单类定位:LMArena 开源非推理类第 2、开源总榜第 6。

开源权重 Apache 2.0675B MoE多模态多语言

查看模型变体与证据

2025-12-01 DeepSeek·国内

DeepSeek-V3.2 / DeepSeek-V3.2-Speciale

本发布含 2 个变体,各变体规格见模型详情。

DeepSeek 官方将 V3.2 正式版定位为「强化 Agent 能力、融入思考推理」,是 DeepSeek 首个将思考与工具调用融合的模型。已收录 26 项评测覆盖数学竞赛、代码、知识与工具/Agent 使用:亮点 AIME 2025(Thinking)93.1、Codeforces(Thinking)2386。

开源权重思考融合工具调用Agent 增强

查看模型变体与证据

2025-12 ByteDance Seed / 豆包·国内

Seed1.8 / Seed1.8 Thinking / Seed1.5-VL

本发布含 3 个变体,各变体规格见模型详情。

Seed1.8 被发布文定位为通用化 Agentic 模型,覆盖 GUI/浏览器/移动操作、代理搜索、代理编码与经济价值领域任务,并提供三种思考模式。评测横跨代理、数学、STEM、知识、多模态与长视频等约 13 组:GAIA 87.4、BrowseComp-zh 81.3、AIME-25 94.3。

通用代理多模态三档思考模式

查看模型变体与证据

Seed1.8 · osworld 61.9Seed1.8 · realbench 49.1Seed1.8 · online-mind2web 85.9Seed1.8 · androidworld 70.7Seed1.8 · browsecomp en 67.6Seed1.8 · browsecomp zh 81.3Seed1.8 · gaia 87.4Seed1.8 · widesearch 63.8Seed1.8 · hlehle text-only 40.9Seed1.8 · mm-browsecomp 46.3Seed1.8 · hlehle VL (visual) 31.5Seed1.8 · swebench 72.9Seed1.8 · multi-swe-bench 42Seed1.8 · ainstein-swe-bench 36.7Seed1.8 · terminalbench 2.0 45.2Seed1.8 · u-artifacts 49.2Seed1.8 · finsearchcomp T2&T3 62.8Seed1.8 · xpertbench 该来源尚无可读数值Seed1.8 · worldtravel multi-modal 47.2Seed1.8 · worldtravel text 52.1Seed1.8 · aime-25 94.3Seed1.8 · hmmt25 Feb 2025 89.7Seed1.8 · beyondaime 77Seed1.8 · amo-bench 60Seed1.8 · imo-answerbench w/ code tools 76.3Seed1.8 · gpqa 83.8Seed1.8 · phybench 41Seed1.8 · biobench 42.3Seed1.8 · kor-bench 76.2Seed1.8 · arc-agi 1 67.9Seed1.8 · mmlu 92.3Seed1.8 · mmlu-pro 84.9Seed1.8 · supergpqa 64.8Seed1.8 · lpfqa 49.1Seed1.8 · inverse-ifeval 80.3Seed1.8 · mars-bench 70.1Seed1.8 · multichallenge 66.7Seed1.8 · collie Hard 72.6Seed1.8 · eifbench 48.6Seed1.8 Thinking · mmmu 83.4Seed1.8 Thinking · mmmu Pro 73.2Seed1.8 Thinking · mathvista 87.7Seed1.8 Thinking · mathvision 81.3Seed1.8 Thinking · dyna-math 61.5Seed1.8 Thinking · logicvista 78.3Seed1.8 Thinking · emma 60.9Seed1.8 Thinking · sfe 51.2Seed1.8 Thinking · zerobench main 11.0Seed1.8 Thinking · vpct 61Seed1.8 Thinking · vlmsarebiased 62.0Seed1.8 Thinking · vlmsareblind 93Seed1.8 Thinking · simplevqa 65.4Seed1.8 Thinking · hallusionbench 63.9Seed1.8 Thinking · mmstar 79.9Seed1.8 Thinking · mmbench v1.1 EN 91.6Seed1.8 Thinking · mmbench v1.1 CN 90.6Seed1.8 Thinking · mme-cc 43.4Seed1.8 Thinking · muirbench 78.7Seed1.8 Thinking · mmvp 86Seed1.8 Thinking · blink 74.3Seed1.8 Thinking · mmsi-bench circular 25.8Seed1.8 Thinking · refspatialbench 56.3Seed1.8 Thinking · erqa 58.8Seed1.8 Thinking · da-2k 90.7Seed1.8 Thinking · cv-bench 88Seed1.8 · tvbench 71.5Seed1.8 · tempcompass 86.9Seed1.8 · tomato 60.8Seed1.8 · egotempo 67Seed1.8 · motionbench 70.6Seed1.8 · countix 31Seed1.8 · video-mme with subtitles (double-dagger footnote) 87.8Seed1.8 · cgbench 62.4Seed1.8 · longvideobench 77.4Seed1.8 · lvbench 73
2025-11-18 Google DeepMind / Gemini·国际

Gemini 3 Pro / Gemini 3 Deep Think

本发布含 2 个变体,各变体规格见模型详情。

Gemini 3 发布以「智能新纪元」为题呈现,Gemini 3 Pro 为旗舰型号(发布时 preview)。已收录评测横跨推理、代码、多模态与 Agent:亮点 LMArena 1501 Elo、AIME 2025(带代码执行)100%。

旗舰多模态1M 长上下文Agent

查看模型变体与证据

2025-11-17 xAI / Grok·国际

Grok 4.1

模态文本

xAI 将 Grok 4.1 定位为一次可用性导向的风格升级:复用驱动 Grok 4 的大规模强化学习基础设施来优化风格、人格、有用性与对齐,使其更敏锐捕捉细微意图、更具对话魅力且人格连贯,同时完全保留前代的锋利智能与可靠性。已收录评测覆盖竞技场 Elo、情商、创意写作与事实性等领域,Text Arena Thinking 配置 1483 Elo(总榜第一)、EQ-Bench3 1586 Elo(归一化)。

风格与人格优化双配置(Thinking/即时响应)非可验证奖励 RL

查看模型变体与证据

2025-11-06 Moonshot AI / Kimi·国内

Kimi K2 Thinking

上下文256K模态文本

月之暗面将 Kimi K2 Thinking 定位为思考型智能体(thinking agent),通过同时扩展思考 token 与工具调用步数推进测试时扩展前沿,可跨数百步规划、推理、执行与调整,全部评测结果以 INT4 QAT 精度报告。已收录评测覆盖通用推理、数学、智能体检索、编码与终端等领域,HLE 带工具 44.9(Heavy Mode 51.0)、SWE-bench Verified 71.3。

思考型智能体INT4 QAT开源权重工具调用扩展

查看模型变体与证据

2025-10-27 MiniMax·国内

MiniMax-M2

价格$0.3/$1.2 每百万 tokens · 页面同时给出人民币定价:输入 ¥2.1、输出 ¥8.4 每百万 tokens;另载限时免费试用至 2025-11-07模态文本

发布文以“简中之巧(Ingenious in Simplicity)”为题,将 M2 定位为 agent 优先的开源权重模型,价格约为 Claude Sonnet 的 8%、速度约 2 倍。9 项评测集中于智能体编码、工具调用与搜索,亮点为 GAIA(纯文本)75.7 与 τ²-Bench 77.2。

开源权重智能体优先高性价比

查看模型变体与证据

2025-10-15 Anthropic·国际

Claude Haiku 4.5

价格$1/$5 每百万 tokens模态文本·图像

发布文将其定位为小而快的轻量档模型,编码性能接近 Sonnet 4 而成本仅约三分之一、速度快一倍以上,计算机使用能力超过 Sonnet 4。11 项评测覆盖智能体编码、工具调用、计算机使用与数学推理,亮点为 AIME 2025(带 Python 工具)96.3% 与 τ2-bench Telecom 83.0%。

轻量高速编码计算机使用扩展思考

查看模型变体与证据

2025-09-30 Z.ai / 智谱 GLM·国内

GLM-4.6

上下文200K模态文本

智谱将 GLM-4.6 定位为具备高级 Agentic、推理与编程能力的模型,上下文由 128K 扩展至 200K,推理中可交织工具调用。评测以编码与智能体为主,亮点如 CC-Bench 对 Claude Sonnet 4 胜率 48.6%、AIME 25 93.9%。

开源权重编码智能体推理

查看模型变体与证据

2025-09-29 Anthropic·国际

Claude Sonnet 4.5

价格$3/$15 每百万 tokens · 与 Sonnet 4 同价模态文本·图像

Anthropic 发布 Claude Sonnet 4.5,作为面向编码、智能体与计算机使用场景的 Sonnet 新代,并同步推出 Claude Agent SDK。评测集中在编码与智能体领域,亮点如 SWE-bench Verified 77.2%(并行测试期计算 82.0%)、τ2-bench Telecom 98.0%。

编码智能体计算机使用推理

查看模型变体与证据

2025-09-29 DeepSeek·国内

DeepSeek-V3.2-Exp

模态文本

DeepSeek 将 V3.2-Exp 定位为引入 DeepSeek 稀疏注意力(DSA)、聚焦长上下文训练与推理提效的实验性版本,训练设置与 V3.1-Terminus 严格对齐、公开评测表现基本持平,API 价格同步下调超 50%(页面未给出具体单价)。已收录评测覆盖通用知识、数学推理、代码与中英文检索等领域,Codeforces Div1 2121、AIME 2025 89.3。

实验性版本稀疏注意力开源权重推理提效

查看模型变体与证据

2025-09-24 Alibaba / Qwen·国内

Qwen3-Max-Instruct / Qwen3-Max-Thinking

本发布含 2 个变体,各变体规格见模型详情。

Qwen3-Max 发布以「大就是好(Just Scale it)」为题,Instruct 为超 1T 总参 MoE 旗舰(36T 预训练 tokens、全局 batch 负载均衡损失,ChunkFlow 支持 1M 长上下文训练)。已收录 9 项评测:亮点 SWE-bench Verified 69.6、LMArena 文本榜 1430。

超大规模 MoEAPI 旗舰1M 长上下文

查看模型变体与证据

2025-09-05 Moonshot AI / Kimi·国内

Kimi-K2-Instruct-0905

参数1T-A32B MoE上下文256K模态文本

Moonshot 通过 Hugging Face 官方模型卡发布 Kimi-K2-Instruct-0905:K2 权重更新,上下文 128K→256K,强化智能体编码。评测集中于编码与智能体任务,亮点如 SWE-Bench Verified 69.2%、SWE-Dev 66.6%(五次全量重跑均值±标准差)。

开源权重智能体编码长上下文

查看模型变体与证据

2025-08-21 DeepSeek·国内

DeepSeek-V3.1

上下文128K模态文本

DeepSeek-V3.1 发布文定位为首个混合推理架构模型:同一模型同时服务 deepseek-chat(非思考)与 deepseek-reasoner(思考),主打思考效率提升与 Agent 能力增强。评测分编码代理、搜索代理与思考效率三组:SWE-bench Verified 66、BrowseComp 30、AIME 2025(V3.1-Think)88.4。

开源权重混合推理Agent 增强

查看模型变体与证据

2025-08-07 OpenAI·国际

GPT-5 / GPT-5 Pro

本发布含 2 个变体,各变体规格见模型详情。

GPT-5 是 OpenAI 的统一思考模型,发布文称其在 AIME 2025(无工具 94.6%)、SWE-bench Verified 74.9%、HealthBench Hard 46.2% 等刷新 SOTA,并大幅降低事实错误与谄媚率。评测覆盖竞赛数学、编码、指令跟随与代理、多模态与健康:GPQA Diamond 88.4%、MMMU 84.2%、BrowseComp 54.9%。

思考模型多模态代理工具调用幻觉抑制

查看模型变体与证据

GPT-5 · aime-25 94.6GPT-5 · aime-25 with python tool 99.6GPT-5 Pro · aime-25 96.7GPT-5 Pro · aime-25 with python tool 100o3 · aime-25 with python tool 98.4o3 · aime-25 88.9gpt-4o · aime-25 with python tool 42.1GPT-5 Pro · frontiermath Tier 1-3 32.1GPT-5 · frontiermath Tier 1-3 26.3GPT-5 · frontiermath Tier 1-3 13.5chatgpt-agent · frontiermath Tier 1-3 27.4o4-mini · frontiermath Tier 1-3 19.3o3 · frontiermath Tier 1-3 15.8GPT-5 Pro · hmmt25 100GPT-5 · hmmt25 96.7GPT-5 · hmmt25 93.3o3 · hmmt25 93.3GPT-5 Pro · gpqa Diamond 88.4GPT-5 Pro · gpqa Diamond 89.4GPT-5 · gpqa Diamond 87.3GPT-5 · gpqa Diamond 85.7o3 · gpqa Diamond 83.3gpt-4o · gpqa Diamond 70.1GPT-5 · hlehle Full Set 24.8GPT-5 · hlehle Full Set, python + search with blocklist 35.2GPT-5 Pro · hlehle Full Set, python + search with blocklist 42GPT-5 Pro · hlehle Full Set 30.7chatgpt-agent · hlehle Full Set 41.6o3 · hlehle Full Set 14.7gpt-4o · hlehle Full Set 5.3GPT-5 · swebench Verified (fixed subset n=477) 74.9GPT-5 · swebench Verified (fixed subset n=477) 52.8o3 · swebench Verified (fixed subset n=477) 69.1gpt-4o · swebench Verified (fixed subset n=477) 30.8GPT-5 · aider Polyglot 88o3 · aider Polyglot 79.6gpt-4o · aider Polyglot 25.8GPT-5 · multichallenge 69.6o3 · multichallenge 60.4gpt-4o · multichallenge 40.3GPT-5 · browsecomp 54.9chatgpt-agent · browsecomp 68.9o3 · browsecomp with python + browsing tools 49.7GPT-5 · mmmu 84.2o3 · mmmu 82.9gpt-4o · mmmu 72.2GPT-5 · mmmu-pro 78.4o3 · mmmu-pro 76.4GPT-5 · charxiv-reasoning 81.1o3 · charxiv-reasoning 78.6GPT-5 · erqa 65.7o3 · erqa 64GPT-5 · collie 99o3 · collie 98.4GPT-5 · video-mmmu max frame 256 84.6GPT-5 · healthbench 67.2o3 · healthbench 59.8GPT-5 · healthbench Hard 46.2o3 · healthbench Hard 31.6GPT-5 · aime-25 61.9GPT-5 · aime-25 71GPT-5 · aider 26.7GPT-5 · mmmu 74.4GPT-5 · mmmu-pro 62.7GPT-5 · charxiv-reasoning 57.8GPT-5 · erqa 42GPT-5 · healthbench 54.3GPT-5 · video-mmmu 61.6GPT-5 · collie 70.5GPT-5 · gpqa 77.8GPT-5 · hlehle 6.3o3 · video-mmmu max frame 256 83.3gpt-4o · video-mmmu max frame 256 61.2gpt-4o · mmmu-pro 59.9gpt-4o · charxiv-reasoning 58.8gpt-4o · erqa 35.2gpt-4o · healthbench 32gpt-4o · healthbench Hard 0o3 · hlehle Full Set, python + browser 24.3chatgpt-agent · hlehle Full Set (no tools) 23GPT-5 · tau2-bench airline, without thinking 0.55GPT-5 · tau2-bench airline, with thinking 0.076GPT-5 · tau2-bench retail, without thinking 0.728GPT-5 · tau2-bench retail, with thinking 0.083GPT-5 · tau2-bench telecom, without thinking 0.386GPT-5 · tau2-bench telecom, with thinking 0.581o3 · tau2-bench airline 0.648o3 · tau2-bench retail 0.802o3 · tau2-bench telecom 0.582gpt-4o · tau2-bench airline 0.455gpt-4o · tau2-bench retail 0.634gpt-4o · tau2-bench telecom 0.235GPT-5 · healthbench Hard Hallucinations 1.6GPT-5 · healthbench Hard Hallucinations 3.6o3 · healthbench Hard Hallucinations 12.9gpt-4o · healthbench Hard Hallucinations 15.8GPT-5 · factscore LongFact-Concepts 0.007o3 · factscore LongFact-Concepts 0.045GPT-5 · factscore LongFact-Objects 0.008o3 · factscore LongFact-Objects 0.051GPT-5 · factscore FActScore 0.01o3 · factscore FActScore 0.057GPT-5 · economically-important-tasks 47.1%o3 · economically-important-tasks 33.5%chatgpt-agent · economically-important-tasks 43.5%
2025-07-31 StepFun / 阶跃星辰·国内

Step 3

参数321B-A38B MoE(VLM 321B / LLM 316B)上下文64K(65536)模态文本·图像

StepFun 将 Step 3 定位为高性价比的多模态智能模型,以 38B 激活的 MoE 架构与 MFA 注意力 + AFD 并行设计平衡性能与推理成本,并以 Apache 2.0 开源。已收录评测覆盖多模态理解、数学与科学推理、代码等领域,AIME 2025 82.9、MMMU 74.2。

开源权重多模态高性价比 MoEMFA 注意力架构

查看模型变体与证据

2025-07-28 Z.ai / 智谱 GLM·国内

GLM-4-Air

参数未公开上下文128K tokens价格$1/$1 每百万 tokens模态文本

智谱 AI 高性能极致性价比基座大模型,面向企业级大规模并发场景提供强大的文本理解与智能体调用能力。

企业级高并发长上下文推理工具调用强化高性价比底座

查看模型变体与证据

2025-07-22 Alibaba / Qwen·国内

Qwen3-Coder-480B-A35B-Instruct

参数480B-A35B MoE上下文256K(YaRN 可扩至 1M)模态文本

Qwen3-Coder-480B-A35B-Instruct 以「Agentic Coding in the World」为定位发布,480B MoE/35B 激活,原生 256K 上下文(YaRN 可扩至 1M)。已收录 15 项评测集中于代码仓库、终端与浏览器/工具 Agent:亮点 SWE-bench Verified(OpenHands 500 turns)69.6、Terminal-Bench 37.5。

开源权重代码专精Agentic Coding长上下文

查看模型变体与证据

2025-07-11 Moonshot AI / Kimi·国内

Kimi-K2-Instruct / Kimi-K2-Base

本发布含 2 个变体,各变体规格见模型详情。

Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。

开源权重1T MoE非思考 reflex 档Agentic

查看模型变体与证据

2025-07-09 xAI / Grok·国际

Grok 4 / Grok 4 Heavy

本发布含 2 个变体,各变体规格见模型详情。

Grok 4 是 xAI 具备原生工具调用与实时搜索的模型,官方称其为 HLE text-only 子集首个突破 50%(50.7%)的模型。评测集中于数学、科学与编码:AIME'25 91.7%(无工具)、HMMT 2025 90%、GPQA 87.5%、ARC-AGI-2 15.9%(闭源 SOTA)。

原生工具调用实时搜索推理增强

查看模型变体与证据

2025-06-27 Tencent / 腾讯混元·国内

Hunyuan-A13B-Instruct / Hunyuan-A13B-Pretrain / Hunyuan-A13B-Instruct-FP8 / Hunyuan-A13B-Instruct-GPTQ-Int4

本发布含 4 个变体,各变体规格见模型详情。

腾讯混元以「细粒度 MoE、80B 总参/13B 激活」开源 A13B 系列,Instruct 为指令版(256K 上下文,/think 与 /no_think 双模式,默认慢思考)。已收录 21 项 Instruct 表评测覆盖知识、数学、代码与 Agent 工具调用:亮点 AIME24 87.3、GPQA Diamond 71.2。

开源权重细粒度 MoE256K 长上下文快慢思考双模式

查看模型变体与证据

Hunyuan-A13B-Pretrain · mmlu 88.17Hunyuan-A13B-Pretrain · mmlu-pro 67.23Hunyuan-A13B-Pretrain · mmlu-redux 87.67Hunyuan-A13B-Pretrain · bbh 87.56Hunyuan-A13B-Pretrain · supergpqa 41.32Hunyuan-A13B-Pretrain · evalplus 78.64Hunyuan-A13B-Pretrain · multipl-e 69.33Hunyuan-A13B-Pretrain · mbpp 83.86Hunyuan-A13B-Pretrain · cruxeval 70.13Hunyuan-A13B-Pretrain · cruxeval 77Hunyuan-A13B-Pretrain · math 72.35Hunyuan-A13B-Pretrain · cmath 91.17Hunyuan-A13B-Pretrain · gsm8k 91.83Hunyuan-A13B-Pretrain · gpqa 49.12Hunyuan-A13B-Instruct · aime24 87.3Hunyuan-A13B-Instruct · aime-25 76.8Hunyuan-A13B-Instruct · math 94.3Hunyuan-A13B-Instruct · gpqa Diamond 71.2Hunyuan-A13B-Instruct · olympiadbench 82.7Hunyuan-A13B-Instruct · lcb 63.9Hunyuan-A13B-Instruct · fullstackbench 67.8Hunyuan-A13B-Instruct · artifactsbench 43Hunyuan-A13B-Instruct · bbh 89.1Hunyuan-A13B-Instruct · drop 91.1Hunyuan-A13B-Instruct · zebralogic 84.7Hunyuan-A13B-Instruct · ifeval 84.7Hunyuan-A13B-Instruct · sysbench 76.1Hunyuan-A13B-Instruct · lengthctrl 55.4Hunyuan-A13B-Instruct · insctrl 71.9Hunyuan-A13B-Instruct · complexnlu 61.2Hunyuan-A13B-Instruct · word-task 62.9Hunyuan-A13B-Instruct · bfcl v3 78.3Hunyuan-A13B-Instruct · tau-bench 54.7Hunyuan-A13B-Instruct · complexfuncbench 61.2Hunyuan-A13B-Instruct · c3-bench 63.5Hunyuan-A13B-Instruct-FP8 · aime24 86.7Hunyuan-A13B-Instruct-FP8 · gsm8k 94.01Hunyuan-A13B-Instruct-FP8 · bbh 88.34Hunyuan-A13B-Instruct-FP8 · drop 91.1Hunyuan-A13B-Instruct-GPTQ-Int4 · olympiadbench 84Hunyuan-A13B-Instruct-GPTQ-Int4 · aime24 86.7Hunyuan-A13B-Instruct-GPTQ-Int4 · gsm8k 94.24Hunyuan-A13B-Instruct-GPTQ-Int4 · bbh 87.91Hunyuan-A13B-Instruct-GPTQ-Int4 · drop 91.05
2025-06-25 ByteDance Seed / 豆包·国内

Seed1.6

参数230B-A23B MoE上下文256K模态文本·图像

发布文将其定位为带自适应思考(AdaCoT)的多模态通用系列,称视觉任务追平甚至超过 Seed1.5-VL。已收录的 8 项数值均来自 Seed1.6 Base 列的知识与数理基础评测,亮点为 BBH 92.08 与 MMLU 88.83;多模态旗舰版本身未给出数值。

多模态自适应思考长上下文GUI 交互

查看模型变体与证据

2025-06-17 Google DeepMind / Gemini·国际

Gemini 2.5 Flash / Gemini 2.5 Flash-Lite

本发布含 2 个变体,各变体规格见模型详情。

Gemini 2.5 Flash 是 Gemini 2.5 家族 GA 扩容公告中的主力 Flash 档模型,默认开启思考并同时报告非思考配置。评测覆盖科学/数学/编码/事实性/视觉与多语言:思考配置 GPQA Diamond 82.8%、AIME 2025 72.0%、MRCR v2 8-needle(1M)21.0%。

思考模式多模态高性价比

查看模型变体与证据

2025-06-16 MiniMax·国内

MiniMax abab 6.5

参数千亿 MoE上下文245K tokens模态文本

MiniMax 稀疏混合专家大语言模型,支持 245K 超长上下文窗口与万级汉字复杂指令遵循。

千亿稀疏MoE245K超长上下文复杂指令遵循自研线性注意力

查看模型变体与证据

2025-05-22 Anthropic·国际

Claude Opus 4 / Claude Sonnet 4

本发布含 2 个变体,各变体规格见模型详情。

Claude 4 发布中 Opus 4 为最强编码档,采用混合模式(近即时回答 + 扩展思考,扩展思考可与工具调用结合,beta)。已收录 22 项评测覆盖软件工程、终端、知识与 Agent:亮点 SWE-bench Verified 72.5%(并行测试时计算 79.4%)。

旗舰编码扩展思考工具调用融合

查看模型变体与证据

2025-04-29 Alibaba / Qwen·国内

Qwen3-235B-A22B / Qwen3-30B-A3B / Qwen3-32B / Qwen3-4B / Qwen3-14B / Qwen3-8B / Qwen3-1.7B / Qwen3-0.6B

本发布含 8 个变体,各变体规格见模型详情。

Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。

开源权重混合思考推理多语言

查看模型变体与证据

2025-04-16 OpenAI·国际

OpenAI o3 / OpenAI o4-mini

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 o3 定位为其最强推理模型,在编码、数学、科学与视觉感知等领域推进前沿,并支持以图思考(Thinking with images)。该发布已收录评测覆盖数学、编程竞赛、科学推理、软件工程与智能体工具使用等领域,AIME 2025 配 Python 工具 pass@1 98.4%、100% consensus@8。

推理旗舰以图思考智能体工具使用

查看模型变体与证据

OpenAI o3 · aime24 91.6OpenAI o4-mini · aime24 93.4o1 · aime24 74.3o3-mini · aime24 87.3OpenAI o3 · aime-25 88.9OpenAI o3 · aime-25 with python tool 98.4% pass@1, 100% consensus@8OpenAI o4-mini · aime-25 92.7OpenAI o4-mini · aime-25 with python tool 99.5% pass@1, 100% consensus@8o1 · aime-25 79.2o3-mini · aime-25 86.5OpenAI o3 · codeforces 2706OpenAI o4-mini · codeforces 2719o1 · codeforces 1891o3-mini · codeforces 2073OpenAI o3 · gpqa Diamond 83.3OpenAI o4-mini · gpqa Diamond 81.4o1 · gpqa Diamond 78o3-mini · gpqa Diamond 77OpenAI o3 · hlehle 20.32OpenAI o3 · hlehle with python + browsing tools 24.9OpenAI o4-mini · hlehle 14.28OpenAI o4-mini · hlehle with python + browsing tools 17.7openai-deep-research · hlehle python + browser tools 26.6o3-mini · hlehle 13.4OpenAI o3 · swebench Verified (fixed subset n=477) 69.1OpenAI o4-mini · swebench Verified (fixed subset n=477) 68.1o1 · swebench Verified (fixed subset n=477) 48.9o3-mini · swebench Verified (fixed subset n=477) 49.3OpenAI o3 · mmmu 82.9OpenAI o4-mini · mmmu 81.6o1 · mmmu 77.6OpenAI o3 · mathvista 86.8OpenAI o4-mini · mathvista 84.3o1 · mathvista 71.8OpenAI o3 · charxiv-reasoning 78.6OpenAI o4-mini · charxiv-reasoning 72o1 · charxiv-reasoning 55.1OpenAI o3 · swe-lancer IC SWE Diamond $86,100OpenAI o4-mini · swe-lancer IC SWE Diamond $65,792o1 · swe-lancer IC SWE Diamond $43,958o3-mini · swe-lancer IC SWE Diamond $33,833OpenAI o3 · multichallenge 56.51OpenAI o4-mini · multichallenge 42.99o1 · multichallenge 44.93o3-mini · multichallenge 39.89OpenAI o3 · browsecomp with python + browsing tools 49.7OpenAI o4-mini · browsecomp with python + browsing tools 28.3gpt-4o · browsecomp with browsing tool 1.9openai-deep-research · browsecomp deep research agent 51.5o1 · aider Polyglot (whole) 64.4%o1 · aider Polyglot (diff) 61.7%o3-mini · aider Polyglot (whole) 66.7%o3-mini · aider Polyglot (diff) 60.4%OpenAI o3 · aider Polyglot (whole) 81.3%OpenAI o3 · aider Polyglot (diff) 79.6%OpenAI o4-mini · aider Polyglot (whole) 68.9%OpenAI o4-mini · aider Polyglot (diff) 58.2%o1 · tau-bench Airline (high effort) 50%o1 · tau-bench Retail (high effort) 70.8%o3-mini · tau-bench Airline (high effort) 32.4%o3-mini · tau-bench Retail (high effort) 57.6%OpenAI o3 · tau-bench Airline (high effort) 52%OpenAI o3 · tau-bench Retail (high effort) 70.4%OpenAI o4-mini · tau-bench Airline (high effort) 49.2%OpenAI o4-mini · tau-bench Retail (high effort) 65.6%o1-pro · hlehle 8.12%
2025-04-05 Meta / Llama·国际

Llama 4 Maverick / Llama 4 Scout / Llama 4 Behemoth

本发布含 3 个变体,各变体规格见模型详情。

发布文称 Maverick 为 Llama 4 herd 中的主力多模态模型(17B 激活、128 专家、400B 总参,MoE 架构)。评测覆盖多模态理解、知识、代码与克丘亚语翻译,亮点为 DocVQA 94.4 与 ChartQA 90.0(LMArena Elo 1417 归属于实验性聊天版本)。

开源权重MoE多模态

查看模型变体与证据

2025-03-25 Google DeepMind / Gemini·国际

Gemini 2.5 Pro

上下文1M模态文本·图像·音频·视频

谷歌将 Gemini 2.5 Pro 实验版定位为其最智能的 AI 模型与 2.5 系列首个思维(thinking)模型,原生多模态并配备 1M token 上下文窗口(200 万即将推出)。已收录评测覆盖推理、代码、长上下文与多模态理解等领域,HLE 无工具 18.8%、SWE-bench Verified 63.8%。

思维模型原生多模态1M 上下文实验版首发

查看模型变体与证据

2025-03-21 Tencent / 腾讯混元·国内

Hunyuan T1 (混元-T1 正式版)

模态文本

腾讯混元-T1 正式版定位为业内首个超大规模混合 Mamba 推理模型(TurboS 混合 Transformer-Mamba MoE 底座,96.7% 后训练算力用于强化学习)。已收录 14 项评测覆盖知识、数学、代码与中文能力:亮点 MMLU-Pro 87.2、AIME24 78.2。

混合 Mamba 架构强化学习驱动推理模型开源权重

查看模型变体与证据

2025-02-19 xAI / Grok·国际

Grok 3 / Grok 3 mini

本发布含 2 个变体,各变体规格见模型详情。

Grok 3 被 xAI 定位为开启『推理代理时代』的 Beta 模型,主打 (Think) 深度推理配置并曾以代号 chocolate 登顶 LMArena。评测覆盖推理、编码、多模态理解与长上下文 RAG:AIME'25 93.3%、GPQA 84.6%、LCB 79.4%、Chatbot Arena 1402 Elo、LOFT(128k)83.3%。

推理增强Beta

查看模型变体与证据

2025-01-26 Alibaba / Qwen·国内

Qwen2.5-VL-72B

参数72B 稠密上下文128K tokens模态文本·图像·视频

通义千问新一代开源视觉语言大模型,支持动态分辨率图像输入与小时级超长视频理解,在多模态基准榜单上领跑开源阵营。

动态分辨率视觉小时级长视频理解多模态开源旗舰精准文档与图表解析

查看模型变体与证据

2025-01-20 DeepSeek·国内

DeepSeek-R1

参数671B (37B active)上下文128K tokens价格$0.55/$2.19 每百万 tokens模态文本

深度求索开源的纯强化学习驱动推理大模型,开创性采用大规模强化学习与多阶段冷启动蒸馏技术,在数学竞赛、代码工程与复杂推理任务上达到与 OpenAI o1 相当的前沿水准。

纯RL强化学习自主长思维链开源推理范式蒸馏全系列小模型

查看模型变体与证据

2025-01-20 Moonshot AI / Kimi·国内

Kimi k1.5

参数未公开上下文128K tokens模态文本·图像

月之暗面面向深度推理的长思维链强化学习大模型,在数学奥林匹克、复杂编程与视觉长程推理任务上展现出突破性表现。

强化学习深度推理长思维链思考数学竞赛突破图文多模态推理

查看模型变体与证据

2025-01-16 MiniMax·国内

MiniMax-Text-01

参数456B-A45.9B上下文4M tokens模态文本·代码

MiniMax 采用自研混合线性注意力(Lightning Attention)架构的大模型,总参数 456B,激活 45.9B,支持高达 400 万 tokens(约 400 万字)超长文本一次性输入,大海捞针检索测试准确率 100%。MMLU 达 86.5%,HumanEval 达 84.1%,MATH 达 70.3%。

4M超长上下文Lightning Attention线性注意力大海捞针100%

查看模型变体与证据 · 所收录来源未披露量化评测

2024
2024-12-26 DeepSeek·国内

DeepSeek-V3

参数671B (37B active)上下文128K tokens价格$0.14/$0.28 每百万 tokens模态文本

深度求索自研 MoE 架构大语言模型,首创多头潜在注意力(MLA)与 DeepSeek 稀疏注意力(DSA),以极高训练与推理效率成为全球开源基座代表作。

MLA潜在注意力稀疏MoE架构超低训练推理成本开源权重巅峰

查看模型变体与证据

2024-12-20 ByteDance Seed / 豆包·国内

Doubao-1.5-pro

参数未公开上下文128K tokens模态文本·多模态

字节跳动最新一代通用主力基座,总参数扩充,在复杂指令遵循、长文本理解、工具调用及结构化数据生成上达到国内第一梯队。MMLU 达 82.5%,GSM8K 达 89.2%,HumanEval 达 83.1%。

128K上下文全能多模态复杂指令遵循

查看模型变体与证据 · 所收录来源未披露量化评测

2024-12-12 Microsoft AI / MAI·国际

Phi-4 (14B)

参数14B上下文16K tokens模态文本·代码·数学

微软 14B 参数专攻复杂推理的开源大模型,采用合成数据增强与多阶段对齐,在 MATH 达 80.4%,GPQA 达 56.1%,MMLU 达 84.8%,HumanEval 达 82.3%,推理能力媲美大尺寸前沿闭源模型。

14B数学推理标杆合成数据优化高分GPQA

查看模型变体与证据

2024-12-11 Google DeepMind / Gemini·国际

Gemini 2.0 Flash / Project Mariner

本发布含 2 个变体,各变体规格见模型详情。

发布文称其为面向智能体时代(agentic era)的 Gemini 2.0 家族首个模型。13 项评测横跨知识、代码、数学、多模态与长上下文,亮点为 Natural2Code 92.9% 与 MATH 89.7%。

多模态长上下文智能体实验版本

查看模型变体与证据

2024-11-05 Tencent / 腾讯混元·国内

Hunyuan-Large

参数389B-A52B上下文256K tokens模态文本·代码

腾讯开源业界最大规模 Transformer 架构混合专家模型,总参数 389B,激活 52B,支持 256K 长文本,在 MMLU 达 89.9%,GSM8K 达 89.9%,MATH 达 66.8%,HumanEval 达 78.7%,位居开源前沿阵营。

最大开源Transformer MoE256K长上下文高分数学推理

查看模型变体与证据

2024-10-11 Moonshot AI / Kimi·国内

k0-math

参数未公开上下文128K tokens模态文本

月之暗面首款长思维链强化学习推理模型,对标 OpenAI o1-preview,在 MATH 基准测试达 93.8%,GSM8K 达 97.4%,在中高考数学及奥数竞赛题中展现出极高推理上限。

长思维链强化学习对标o1数学专项突破

查看模型变体与证据 · 所收录来源未披露量化评测

2024-09-25 Meta / Llama·国际

Llama 3.2 90B Vision

参数90B上下文128K tokens模态文本·视觉多模态

Meta 首度推出的多模态视觉 Llama 模型系列,包含 11B/90B 视觉版与 1B/3B 端侧极小尺寸版,支持 128K 上下文与图像理解,90B 视觉模型在 MMLU 达 88.5%,MGSM 达 88.6%,MATH 达 71.2%。

原生多模态128K上下文端侧与云端全覆盖

查看模型变体与证据

2024-09-19 Alibaba / Qwen·国内

Qwen2.5-72B-Instruct / Qwen2.5-Coder-7B-Instruct / Qwen2.5-Math-72B-Instruct / Qwen2.5-Math-7B-Instruct / Qwen2.5-Math-1.5B-Instruct

本发布含 5 个变体,各变体规格见模型详情。

Qwen2.5 发布文以「A Party of Foundation Models」呈现全家族,72B-Instruct 为其中最大开源指令模型(稠密解码器,18T 预训练 tokens)。已收录 14 项评测覆盖知识、数学、代码与对齐:亮点 GSM8K 95.8、MMLU-Pro 71.1。

开源权重稠密架构指令微调旗舰

查看模型变体与证据

2024-09-12 OpenAI·国际

OpenAI o1

参数未公开上下文128K tokens价格$15/$60 每百万 tokens模态文本·图像

OpenAI 首款强化学习驱动思维链(Chain of Thought)推理模型,在科学、编程与数学竞争性基准测试中展现出突破性的深度思考能力。

强化学习驱动推理思维链竞赛级数学与代码慢思考范式

查看模型变体与证据

2024-08-14 xAI / Grok·国际

Grok-2

参数未公开上下文128K tokens模态文本·多模态

xAI 第二代推理旗舰,在 LMSYS Chatbot Arena 盲测榜上一跃进入全球前三,在指令遵循、学术测试及多模态图像理解与生成上全面逼近 Claude 3.5 Sonnet 与 GPT-4o。GPQA 达 56.0%,MATH 达 76.1%,HumanEval 达 88.4%,MMLU 达 87.5%。

LMSYS前三128K长上下文多模态Flux集成

查看模型变体与证据

2024-07-23 Meta / Llama·国际

Llama 3.1 405B / Llama 3.1 70B / Llama 3.1 8B

本发布含 3 个变体,各变体规格见模型详情。

Meta 以「迄今最强模型」发布 Llama 3.1 系列,405B 为首个前沿级开源模型(dense decoder-only)。评测覆盖知识、数学、编码、多语言与长上下文,亮点如 MMLU 88.6%、GSM8K 96.8%。

开源权重长上下文多语言旗舰

查看模型变体与证据

Llama 3.1 405B · mmlu 0-shot CoT 88.6Llama 3.1 405B · mmlu-pro 5-shot CoT 73.3Llama 3.1 405B · ifeval 88.6Llama 3.1 405B · humaneval 0-shot 89.0Llama 3.1 405B · mbpp-evalplus base, 0-shot 88.6Llama 3.1 405B · gsm8k 8-shot CoT 96.8Llama 3.1 405B · math 0-shot CoT 73.8Llama 3.1 405B · arc-challenge 0-shot 96.9Llama 3.1 405B · gpqa 0-shot CoT 51.1Llama 3.1 405B · bfcl 88.5Llama 3.1 405B · nexus 58.7Llama 3.1 405B · zeroscrolls-quality 95.2Llama 3.1 405B · infinitebench-en-mc 83.4Llama 3.1 405B · niah NIH/Multi-needle 98.1Llama 3.1 405B · mgsm Multilingual, 0-shot 91.6Llama 3.1 8B · mmlu 0-shot CoT 73Llama 3.1 8B · mmlu-pro 5-shot CoT 48.3Llama 3.1 8B · ifeval 80.4Llama 3.1 8B · humaneval 0-shot 72.6Llama 3.1 8B · mbpp-evalplus base, 0-shot 72.8Llama 3.1 8B · gsm8k 8-shot CoT 84.5Llama 3.1 8B · math 0-shot CoT 51.9Llama 3.1 8B · arc-challenge 0-shot 83.4Llama 3.1 8B · gpqa 0-shot CoT 32.8Llama 3.1 8B · bfcl 76.1Llama 3.1 8B · nexus 38.5Llama 3.1 8B · zeroscrolls-quality 81Llama 3.1 8B · infinitebench-en-mc 65.1Llama 3.1 8B · niah NIH/Multi-needle 98.8Llama 3.1 8B · mgsm Multilingual, 0-shot 68.9Llama 3.1 70B · mmlu 0-shot CoT 86Llama 3.1 70B · mmlu-pro 5-shot CoT 66.4Llama 3.1 70B · ifeval 87.5Llama 3.1 70B · humaneval 0-shot 80.5Llama 3.1 70B · mbpp-evalplus base, 0-shot 86Llama 3.1 70B · gsm8k 8-shot CoT 95.1Llama 3.1 70B · math 0-shot CoT 68Llama 3.1 70B · arc-challenge 0-shot 94.8Llama 3.1 70B · gpqa 0-shot CoT 46.7Llama 3.1 70B · bfcl 84.8Llama 3.1 70B · nexus 56.7Llama 3.1 70B · zeroscrolls-quality 90.5Llama 3.1 70B · infinitebench-en-mc 78.2Llama 3.1 70B · niah NIH/Multi-needle 97.5Llama 3.1 70B · mgsm Multilingual, 0-shot 86.9
2024-07-04 StepFun / 阶跃星辰·国内

Step-2

参数万亿参数 MoE上下文64K tokens模态文本·代码

阶跃星辰在 2024 世界人工智能大会(WAIC)发布的国内首个万亿参数混合专家大模型,极具辨识度的高智能逻辑推理中枢。MMLU 达 85.3%,GSM8K 达 92.4%。

国内首个万亿MoEWAIC发布高阶逻辑推理

查看模型变体与证据 · 所收录来源未披露量化评测

2024-06-27 Google DeepMind / Gemini·国际

Gemma 2 27B

参数27B上下文8K tokens模态文本

Google 开源轻量级旗舰系列,采用交错滑动窗口局部注意力与知识蒸馏优化,27B 参数版本在 MMLU 达 75.2%,GSM8K 达 84.0%,MATH 达 50.2%,在 LMSYS 盲测竞技场匹敌 70B 开源模型。

滑动窗口注意力知识蒸馏27B匹敌70B

查看模型变体与证据

2024-06-20 Anthropic·国际

Claude 3.5 Sonnet

参数未公开上下文200K tokens价格$3/$15 每百万 tokens模态文本·图像

Anthropic 旗舰中杯模型,在代码生成、多步复杂推理与视觉理解上全面超越上一代 Opus 与同代旗舰,是智能体与工程编程的行业标杆。

编程代码标杆多步长程推理智能体核心底座超高推理性价比

查看模型变体与证据

2024-05-15 ByteDance Seed / 豆包·国内

豆包主力模型 (Doubao-pro)

参数未公开上下文128K tokens价格¥0.8/¥2 每百万 tokens模态文本·语音·视觉

字节跳动火山引擎在 2024 春季 FORCE 原动力大会正式推出豆包大模型家族,公布日均千亿 tokens 吞吐量,将大模型推理价格拉低至厘时代(比行业便宜 99%),开启大模型普惠落地与商业化普及浪潮。

一厘钱千tokens全场景字节生态API极致性价比

查看模型变体与证据 · 所收录来源未披露量化评测

2024-05-13 OpenAI·国际

GPT-4o

参数未公开上下文128K tokens价格$5/$15 每百万 tokens模态文本·图像·音频

OpenAI 原生端到端多模态旗舰大模型,支持文本、语音与视觉的实时低延迟无缝交互,在具备 GPT-4 Turbo 级别智能的同时将推理速度提升 2 倍、API 成本降低 50%。

端到端全模态实时低延迟交互视觉理解跃升高性价比旗舰

查看模型变体与证据

2024-05-06 DeepSeek·国内

DeepSeek-V2

参数236B-A21B上下文128K tokens模态文本·代码

深度求索开创性自研 MLA(多头潜在注意力)与 DeepSeekMoE 架构的首秀之作,236B 总参数仅激活 21B,KV Cache 显存节省 93.3%,以极致低价与高智力引爆国内大模型价格战。MMLU 78.5%,GSM8K 79.2%,HumanEval 81.1%,C-Eval 81.4%。

首创MLA架构DeepSeekMoEKV Cache压缩93%价格战奇点

查看模型变体与证据

2024-04-18 Meta / Llama·国际

Llama 3 70B

参数70B上下文8K tokens模态文本

Meta 开源 Llama 3 家族,采用 15T tokens 优质数据预训练,70B 版本在常识推理、代码与数学能力上达到 GPT-4 级水准。

15T tokens预训练开源商用许可开源大模型分水岭高效稠密架构

查看模型变体与证据

2024-03-23 StepFun / 阶跃星辰·国内

Step-1 / Step-1V

参数千亿级上下文32K tokens模态文本·视觉多模态

姜大昕创立的阶跃星辰首次公开亮相,推出千亿参数基础语言大模型 Step-1 与多模态大模型 Step-1V,展示精准的中文图文多模态推理能力,并驱动跃问与冒泡鸭应用生态。

千亿自研基座Step-1V多模态阶跃星辰首发

查看模型变体与证据 · 所收录来源未披露量化评测

2024-02-15 Google DeepMind / Gemini·国际

Gemini 1.5 Pro

参数未公开上下文1M-2M tokens价格$3.5/$10.5 每百万 tokens模态文本·图像·音频·视频

Google DeepMind 突破性百万上下文多模态旗舰,首次实现 100 万至 200 万超长上下文检索与跨模态无损长程推理。

百万超长上下文跨模态长程推理针大海近完美检索多模态视频音频分析

查看模型变体与证据

2024-01-16 Z.ai / 智谱 GLM·国内

GLM-4

参数未公开上下文128K tokens模态文本·代码·多模态

智谱 AI 在 2024 开发者大会发布的新一代基座旗舰,全面逼近 GPT-4。支持 128K 上下文、自主 Agent 工具调用、代码解释器及多模态,MMLU 达 81.4%,GSM8K 达 87.6%,HumanEval 达 72.0%,MATH 达 46.2%,C-Eval 达 85.8%。

全面对齐GPT-4All Tools自主Agent128K长文本

查看模型变体与证据

2024-01-16 MiniMax·国内

abab 6

参数千亿级 MoE上下文32K tokens模态文本

MiniMax 发布的国内首款千亿参数 MoE 架构语言大模型,总参数量达千亿级,通过稀疏专家网络动态路由,在保持计算效率的同时显著提升了复杂逻辑推理与代码生成能力。MMLU 达 73.2%,GSM8K 达 76.5%。

国内首个千亿MoE稀疏专家路由推理代码强化

查看模型变体与证据 · 所收录来源未披露量化评测

2023
2023-12-11 Mistral AI·国际

Mixtral 8x7B

参数46.7B-A12.9B上下文32K tokens模态文本

开创全球开源稀疏混合专家(MoE)潮流的现象级模型,总参数 46.7B、每个 token 仅激活 12.9B,在 MMLU(70.6%)、GSM8K(74.4%)、HumanEval(40.2%)上全面击败 Llama 2 70B,推理吞吐提升 6 倍。

稀疏MoE先驱8专家路由超越Llama2-70B

查看模型变体与证据

2023-12-06 Google DeepMind / Gemini·国际

Gemini 1.0 Ultra

参数未公开上下文32K tokens模态文本·图像·音频·视频

Google DeepMind 原生多模态大模型开篇之作,其中 Gemini 1.0 Ultra 成为全球首个在 MMLU 基准上超越人类专家的前沿大模型。

原生跨模态超越人类专家多模态推理Ultra旗舰

查看模型变体与证据

2023-11-06 OpenAI·国际

GPT-4 Turbo

参数未公开上下文128K tokens价格$10/$30 每百万 tokens模态文本·代码·图像

OpenAI 开发者大会(DevDay 2023)发布的重大升级旗舰,上下文大幅扩充至 128K tokens,支持 JSON 模式、可复现输出(seed)与多工具并行调用,价格相比初代 GPT-4 降低 3 倍。

128K上下文JSON模式多工具并行调用DevDay2023

查看模型变体与证据 · 所收录来源未披露量化评测

2023-11-04 xAI / Grok·国际

Grok-1

参数314B-A86B MoE上下文8K tokens模态文本

马斯克旗下 xAI 创立后的首款大语言模型,采用 314B 总参数稀疏混合专家架构,以幽默叛逆风格和 X 平台实时知识接入为特色。在 MMLU 达 73.0%,GSM8K 达 62.9%,HumanEval 达 63.2%,MATH 达 23.9%。

314B MoExAI首代大模型X平台实时知识

查看模型变体与证据

2023-10-10 Moonshot AI / Kimi·国内

Kimi Chat (Moonshot-v1)

参数未公开上下文200K tokens模态文本

月之暗面成立后首款正式面世的产品,以 20 万汉字无损长上下文(Long Context)引爆国内行业,奠定了月之暗面在长文本技术上的先锋地位。

20万字长上下文无损记忆长文本破局者

查看模型变体与证据 · 所收录来源未披露量化评测

2023-09-27 Mistral AI·国际

Mistral 7B

参数7B上下文8K tokens模态文本

欧洲 AI 领军企业 Mistral 开山之作,开创性采用分组查询注意力(GQA)与滑动窗口注意力(SWA),以仅 7B 参数在所有基准上全面击败 Llama 2 13B,MMLU 达 60.1%,GSM8K 达 52.2%,HumanEval 达 30.5%。

分组查询注意力GQA滑动窗口SWA7B越级标杆

查看模型变体与证据

2023-09-11 Microsoft AI / MAI·国际

phi-1.5

参数1.3B上下文2K tokens模态文本

微软研究院高质量合成教学数据(Textbooks Are All You Need)学派代表作,仅 1.3B 参数在常识推理上与 10 倍于己的开源大模型相当。ARC-Challenge 达 55.4%,HellaSwag 达 63.8%。

教材式合成数据1.3B小模型常识推理跃迁

查看模型变体与证据

2023-09-07 Tencent / 腾讯混元·国内

腾讯混元 1.0 (Hunyuan-1.0)

参数千亿级上下文4K tokens模态文本

腾讯自研全链路千亿参数大语言模型首次正式对外亮相,深度接入腾讯会议、腾讯文档、微信读书等数十个腾讯核心生态产品,具备强大的中文多轮对话、长文创作与复杂任务理解能力。

全链路自研千亿基座腾讯生态全面接入

查看模型变体与证据 · 所收录来源未披露量化评测

2023-08-11 Xiaomi / 小米·国内

MiLM-6B

参数6.4B上下文4K模态文本

MiLM-6B 是小米开源自研的 64 亿参数通用轻量大模型,在 C-Eval 取得 60.2 分(同参数量级第一、总榜第十),CMMLU 取得 60.37 分,主打端侧智能与高效端云协同部署。

轻量级端侧部署开源权重开源中文评测榜首

查看模型变体与证据

2023-07-11 Anthropic·国际

Claude 2

参数未公开上下文100K tokens模态文本·代码

Anthropic 第二代旗舰模型,首发支持 100K 超长上下文(可一次性读入数十页技术文档或一整本书),HumanEval 达 71.2%,GSM8K 达 88.0%,全美律师资格考多选题 76.5%。

100K长上下文长文本先驱高分律师考

查看模型变体与证据

2023-05-10 Google DeepMind / Gemini·国际

PaLM 2

参数未公开上下文8K tokens模态文本·代码·多语言

Google I/O 2023 发布的重磅基座大模型,强化了多语言、数学逻辑与代码生成能力,MMLU 达 81.2%,GSM8K 达 80.7%,MATH 达 34.3%,HumanEval 达 50.0%,全面驱动初代 Google Bard。

Google基座大模型强多语言能力Google IO 2023

查看模型变体与证据

2023-03-14 Z.ai / 智谱 GLM·国内

ChatGLM-6B

参数6.2B上下文2K tokens模态文本

清华大学与智谱 AI 联合开源的双语对话模型,在单张消费级显卡(INT4 仅需 6GB 显存)即可本地部署,引爆国内开源对话模型与微调生态。

国内开源对话鼻祖单卡INT4低门槛清华智谱联合研制

查看模型变体与证据 · 所收录来源未披露量化评测

2023-03-14 Anthropic·国际

Claude 1

参数未公开上下文9K tokens模态文本

Anthropic 正式公开首款对话大模型 Claude 1 与轻量版 Claude Instant,基于宪法 AI(Constitutional AI)对齐训练,主打帮助性与无害性原则,标志着 Anthropic 独立大模型体系的开篇。

宪法AI首代Claude人类价值观对齐

查看模型变体与证据 · 所收录来源未披露量化评测

2023-03-14 OpenAI·国际

GPT-4

参数MoE ~1.8T (行业估计)上下文8K / 32K tokens价格$30/$60 每百万 tokens模态文本·图像

OpenAI 划时代多模态旗舰大语言模型,首次在大规模复杂推理、代码生成与人类专业考试(如统一律师资格考试、GRE、生物奥赛等)中达到人类顶尖水平,为现代大语言模型评估奠定了黄金标准。

多模态旗舰人类考试标杆复杂逻辑推理行业基准基石

查看模型变体与证据

2022
2022-11-30 OpenAI·国际

ChatGPT (GPT-3.5)

参数175B (估计值,基于 InstructGPT 架构)上下文4K tokens模态文本

OpenAI 划时代对话大模型,基于 GPT-3.5 谱系(InstructGPT)经人类反馈强化学习(RLHF)微调,开启生成式人工智能爆发奇点。在后续 GPT-4 技术报告中披露基线水准:MMLU 70.0%、GSM8K 57.1%、HumanEval 48.1%、MATH 34.1%。

对话RLHF对齐人类偏好微调基准原点大模型爆发奇点

查看模型变体与证据