MAI-Transcribe-2-Streaming
微软 AI 的首款流式语音识别模型,支持 60 种语言的低延迟实时转写与自动连续语种检测,约 100ms 给出首批预测假设,Artificial Analysis 流式最终词错误率 2.50%、首部词错误率 2.80% 均位列第一,最终时间延迟 0.130s 位于帕累托前沿。
Evaluation Ledger · 2022 — 2026
按模态浏览模型与变体 · 覆盖与缺口 · 按需求选型
收录 2022 年至今国内外主流厂商核心模型的官方发布档案与实测评测数据,逐条对账技术报告中的基准引用、实测得分与评测协议;提供官方出处与架构规格说明;覆盖范围和历史缺口可在模型目录中查看。
证据数据来源标识:绿色 官方表格原始数据、琥珀色 图表数据采点、灰色 未披露量化分值的评测提及。支持按厂商、基准名称与分值阈值快速检索。← 返回评估大全
微软 AI 的首款流式语音识别模型,支持 60 种语言的低延迟实时转写与自动连续语种检测,约 100ms 给出首批预测假设,Artificial Analysis 流式最终词错误率 2.50%、首部词错误率 2.80% 均位列第一,最终时间延迟 0.130s 位于帕累托前沿。
本发布含 2 个变体,各变体规格见模型详情。
微软 AI 的富表现力文本转语音模型,模型推理延迟约 550ms,每百万字符 $22,支持 23 种语言,适合重视音质与表现力的场景。本次发布未报告评测数值。
查看模型变体与证据 · 所收录来源未披露量化评测
Google 的新前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络安全防御,输出 token 上限提升到 1M。收录的 7 项评测以编码、智能体与安全为主,如 DeepSWE v1.1 77.9%、LVBench 91.7%;目前仅向可信网络防御者开放。
GPT-6 Sol 的升级版,定位是在智能体编程、计算机使用和专业工作上更接近 GPT-6 Astra,而标准价格仅为 Astra 的五分之一。收录的 7 项评测中 5 项为图表行(数值未读出),正文明示的事实错误率为 4.1%。
面向日常任务、缺陷修复与文档、幻灯片、表格制作的更快更省的 Sonnet 模型,官方称比 Sonnet 5 快 30% 以上、多数任务成本最多低 30%。收录的 9 项评测以智能体编码与知识工作为主,如 Terminal-Bench 4.0 70.6%、GDPval-AA v2.1 1844。
MiniMax 面向编码、长文分析与复杂推理推出的 Flash Preview 级 MoE 思考大模型。总参数 428B,激活约 23B,支持 1M 上下文与约 150 tokens/s 推理速度;具备原生多模态视觉编码器与独立 reasoning_content 思考字段。官方页面提供性能对比与四个实战案例(Flowdesk 故障排查、贵州茅台财务 DCF 估值、图像差异分析、流体模拟代码生成),未披露标准化离散基准跑分。
查看模型变体与证据 · 所收录来源未披露量化评测
Meta 音频驱动的实时数字人模型,基于因果 Diffusion Transformer 架构,通过自强迫分布匹配蒸馏将推理评估从 120 次减少到 2 次(60x 加速),支持 448x768 25fps 视频流式生成,端到端延迟约 870ms,真人双向盲测相对 Runway Characters 偏好度 78%:22%、相对 HeyGen LiveAvatar 偏好度 88%:12%。
面向代码、计算机操作和知识工作的模型。官方表格提供不同任务的分数,但协议与回退模型影响比较范围。
本发布含 2 个变体,各变体规格见模型详情。
OpenAI 将 GPT-6 Sol 定位为日常复杂高价值任务的旗舰级高性价比工作马,以 GPT-5.6 Sol 一半的价格提供接近 Astra 的智能;收录评测覆盖企业自动化、软件工程、计算机操作与专业考试,AutomationBench 达 33.2%、DeepSWE 达 68.8%。
腾讯混元专业级图像生成预览模型,支持文生图与图生图、单次最多 5 张参考图以及最高 2K 分辨率输出,中英文字渲染与小字号排版能力显著提升,专业设计师 GSB 盲测对比上一代胜率综合提升 30% 以上。
本发布含 3 个变体,各变体规格见模型详情。
小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。
xAI 发布的最新旗舰编码与知识工作模型,基于 2.1T 参数底座与长程强化学习,在 CursorBench 4.0 (46.3%)、DeepSWE v1.1 (71.0%) 与 Terminal-Bench 4.0 (38.0%) 等多小时自主长程任务上展现出更强的自我检验与 500K 上下文管理能力。
统一图像生成与编辑,支持透明图层和多参考图。官方评测以图片呈现,尚无完成转录的数值。
阶跃星辰发布的旗舰基座模型 Step 5 Preview,面向真实世界 Agentic 任务,在编程、软件工程、专业工作与金融方向上达到前沿水平。AA Intelligence Index 44 分;DeepSWE v1.1 67.7%、Terminal-Bench v2.1 85.0%、StepCodeBench 49.0%、FrontierFinance 66.4%、GDPval-AA v2 1571;模型将于 2026-10-15 正式开源。
语音转文字模型,支持批量和流式转录、说话人分离与词级时间戳。官方提供短语识别错误率读数。
通义千问基于 Hybrid MoE Thinker-Talker 架构重构的端到端实时同传模型,支持 60 种语言输入与 29 种语音输出,字均延迟(LAAL)降至 2.3 秒,具备实时说话人分离、双语同帧同出与长上下文消歧能力,在 Omnilingua-MSpeaker 与 FLEURS 上取得领先。
Qwen 团队发布的新一代原生全模态大模型,支持 1M 上下文,具备从多模态内容理解到主动规划、工具调用与长程音视频创作的 Agentic 交付能力;在 29 项基准中平均较前代提升 25%,并大幅降低音视频 API 成本。
本发布含 2 个变体,各变体规格见模型详情。
Google 最新原生语音到语音实时对话模型,专为低延迟自然人机交互优化,支持异步工具调用、实时视觉对齐与 97+ 语言无缝流转切换。
Kimi Code 中的代码与智能体模型预览版,提供可调思考档位。发布说明未给出量化评测。
查看模型变体与证据 · 所收录来源未披露量化评测
DeepSeek 新一代非对称 Causal-Encoder-Decoder (CED) 架构的首款多模态 MoE 模型,总参 552B 仅激活 8B 输入与 16B 输出,KV Cache 显存缩减至 1/4;在 Terminal-Bench 2.1 达到 90.6%、GPQA Diamond 90.9%、DeepSWE v1.1 74.2% 与 CyberGym 88.1%,全面替代并下线 V4-Pro。
OpenAI 首个将 Preparedness 框架推至 Critical 等级的旗舰前沿模型,在计算机直接操控、复杂多步长程自主 Agent、软件工程与零日(zero-day)漏洞挖掘上实现重大跃迁;在 ARC-AGI-3 和 ExploitBench 达到饱和得分。
本发布含 2 个变体,各变体规格见模型详情。
Google DeepMind Flash 阶梯新一代工作主力模型,针对长时程软件工程与智能体工具循环调优;在 Terminal-Bench 2.1 达到 90.8%、SWE-Bench Pro 61.6%、SWE-Atlas 51.9%,支持按任务自定义思维等级。
Meta 专为长程软件工程与智能体工具循环优化的前沿多模态大模型,相较 1.2 版本减少 20% 工具调用与 25% 输出 token;在 DeepSWE v1.1 达到 75.4%、Terminal-Bench 2.1 88.8%、SWE-Atlas Codebase QnA 59.4% 以及 1M 上下文 MRCR 98.1%,支持 max 与 xhigh 双推理档位。
千问官方将 Qwen3.8-Max-0902 定位为 Qwen3.8-Max 围绕编程(Coding)与专业办公(Cowork)进一步后训练的升级版本,更适合企业真实复杂任务、科研与长周期任务。本次发布已收录评测为第三方 CodeArena 前端编程总榜一行:提升 22 分至 1691(Elo)夺冠,公告并引该榜性价比(帕累托前沿)称每百万 Tokens 综合均价约 5 美元。
本发布含 2 个变体,各变体规格见模型详情。
发布文定位:编码与知识工作上世界最先进的模型,其研究能力是 AI 将参与科学进步的早期一瞥。本档已收录 9 项基准,覆盖智能体科研、智能体编码、知识工作、计算机操作与商业工作流;亮点:Terminal-Bench 4.0 55.8%、Humanity's Last Exam(with tools)65.0%。
发布文将 Hy4 preview 定位为 770B 总参/49B 激活、1M 上下文、Apache 2.0 开源的旗舰预览版(各模型均按最高推理档评测)。46 项评测集中于智能体编码与搜索、工作智能体及 STEM 推理,亮点为 Terminal-Bench 2.1 85.4 与 SWE-bench Multilingual 82.9。
GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。
本发布含 3 个变体,各变体规格见模型详情。
发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。
本发布含 2 个变体,各变体规格见模型详情。
Qwen3.8-Flash-Next 被发布文定位为迈向极致性价比的全新架构预览(GDN+QSA 混合注意力、N-gram Embedding、Muon 优化器),为 Qwen4 架构探路。评测覆盖代理编码/办公、多模态代理与通用推理:SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、AndroidWorld 84.5。
微软旗舰图像生成与编辑模型,在 Chatbot Arena 图像生成竞技场位居前列,支持高质量美学渲染与复杂提示词排版。
查看模型变体与证据 · 所收录来源未披露量化评测
DeepSeek 将 V4-Flash-Vision-Exp 定位为开启多模态 API 服务的实验性多模态模型,官方称其纯文本能力与 V4-Flash 持平、向 Opus-4.8 收敛多模态 Agent 差距。已收录 11 项评测(文本 Agent 与多模态 Agent 两组):亮点 Terminal-Bench 2.1 83.9、CyberGym 75.3。
微软推出的端到端高精度、超低延迟通用语音识别与转录模型,具有业界顶尖的多语言辨识精度与吞吐表现。
查看模型变体与证据 · 所收录来源未披露量化评测
DeepSeek 发布 V4 Pro 正式版,同步上线 APP/网页端/API(API 模型名不变),官方定位为正式版增强了 Agent 能力、在生产环境中的性能表现提升尤为显著。本发布收录的 10 项评测全部为 Agent 向(编码智能体、网络安全、工具调用、数据科学与自动化智能体),官方以单张对比图给出与 GLM-5.2 / Kimi-K3 / Opus-4.8 / Fable 5 的对比,数值以人工读图确认前不计入公开计数。
Gemini 3.7 Flash 被定位为面向编码与代理的旗舰 workhorse 模型(most intelligent workhorse model for coding and agents)。评测聚焦编码与代理工作流并延伸到文档/视频理解:DeepSWE v1.1 65.3%、Terminal-bench 2.1 85.8%、WebDev Arena 1588 Elo、GDP.pdf 34.0%。
发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。
Microsoft AI 将 MAI-Thinking-1 定位为面向复杂企业任务的推理模型——以成本高效的推理覆盖密集企业任务,在同级(weight class)数学、知识与编码上达到 SOTA。本次发布可核验的评测以数学与智能体编码为主:AIME 2025 97.0%、AIME 2026 94.5%(散文明文),SWE-Bench Pro 未报数值,散文以 toe-to-toe with Claude Opus 4.6 定位。
发布文自述定位是内置在 GitHub Copilot 与 VS Code 里的 "small, efficient, coding workhorse"(小而高效的编码工作马)。卡上收录的 5 项评测覆盖真实 Issue 修复、终端操作与视觉建站:SWE-bench Verified 72.6%、Terminal Bench 2.1 62.9%(与前代同在 GitHub Copilot 生产 VS Code harness 下自报,1.0 为 71.6%/51.7%),价格约为 1.0 的四分之一。
Muse Glimmer 30B 被 Meta 定位为可在消费级设备上运行的开源代理模型(Apache 2.0,由 Muse Spark 蒸馏,24-32GB 显存可跑)。评测覆盖通用代理、代理编码、多模态与安全:MCP Atlas 75.5%、SWE-bench Verified 76.0%、AIME 2026 94.7%;另提供 K-Quant 量化档与 DFlash 投机解码加速。
本发布含 2 个变体,各变体规格见模型详情。
Meta 将 Muse Spark 1.2 定位为 Muse Spark 1.1 的编码向升级版,与 Muse Code 终端代理协同训练,经 Muse Code、Meta Model API、OpenRouter 提供。已收录 5 项评测集中于终端与软件工程 Agent:亮点 Terminal-Bench 2.1 82.9、DeepSWE 1.1 59.3,另含 GDPval-AA v2 与 MCP Atlas 第三方条目(未录数值)。
原生音视频全双工端到端交互大模型,采用统一架构实现低延迟实时多模态交互。官方页面以交互演示和产品能力为主,未披露基准分数。
查看模型变体与证据 · 所收录来源未披露量化评测
通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。
GLM-5.3 以「Frontier Coding with Emergent Cyber Capabilities」为定位发布(API thinking 档 low/high/max、默认 max 且不再支持关闭思考;权重承诺发布两周内开源)。已收录 22 项评测集中于编码与网络安全攻防:亮点 Terminal-Bench 2.1 88.2、CyberGym 84.5。
音视频联合生成模型,支持参考素材控制和定点编辑。所收录官方页面未披露量化评测。
查看模型变体与证据 · 所收录来源未披露量化评测
Qwen3.7-Flash 是 Qwen3.7 世代的经济档 Flash 系列(阿里云百炼口径:原生视觉语言 Flash 系列),在多模态理解与智能体执行能力上相对 3.6-Flash 全面升级。
查看模型变体与证据 · 所收录来源未披露量化评测
Anthropic 发布 Claude Opus 5,effort 分档 high/xhigh/max 并提供 Fast 模式;页面数值多为图表与对比性表述(含大量内部评测)。已收录 18 项评测覆盖前沿编码、Agent 操作与法律/健康/生物专业域:亮点 DeepSWE v1.1 68.8、BrowseComp 90.8。
本发布含 3 个变体,各变体规格见模型详情。
发布文将 Flash 系列定位为以效率、时延与可靠性支撑规模化 AI 智能体的主力款,3.6 Flash 在 3.5 Flash 基础上提升编码与知识工作且输出 token 减少 17%。4 项评测集中于代码、机器学习工程与计算机使用,亮点为 OSWorld-Verified 83.0% 与 MLE-Bench 63.9%。
全场景音频与声音创作模型,覆盖高保真语音合成、环境音效与音乐联合生成。官方页面未披露第三方量化 Benchmark 表格。
查看模型变体与证据 · 所收录来源未披露量化评测
xAI 发布 Grok 4.5,定位为面向编码、智能体任务与知识工作的最强模型,并与 Cursor 联合训练。评测集中于智能体编码,亮点如 DeepSWE 1.0 62.0%、Terminal-Bench 2.1 83.3%,并称平均输出 tokens 约为 Opus 4.8 (max) 的 1/4.2。
Meta 将 Muse Spark 1.1 定位为可主动管理自身 1M token 上下文窗口的智能体基础模型,随发布同步上线 Meta Model API 公测,并已在 Meta AI 应用与 meta.ai 的 Thinking 模式可用。已收录评测覆盖智能体编码与工具调用、计算机操作、网络安全及生物/化学安全评估等领域,Terminal-Bench 2.1 80.0%、OSWorld Verified 80.8%。
字节跳动推出的高品质图像生成与专业设计理解大模型,支持精准图文排版、设计层级理解与多风格创作。所收录官方博客页面未披露量化评测大表。
查看模型变体与证据 · 所收录来源未披露量化评测
本发布含 2 个变体,各变体规格见模型详情。
Meta Superintelligence Labs 打造的图像生成模型,具备强指令遵循、精确定点编辑与多图参考合成能力。
查看模型变体与证据 · 所收录来源未披露量化评测
腾讯发布混元 Hy3:295B 总参/21B 激活 MoE、256K 上下文、三种思考模式,Apache 2.0 开源。评测覆盖编码、智能体搜索与推理,亮点如 SWE-bench Verified 78%、BrowseComp 84.2%。
Kimi K3 以「Open Frontier Intelligence」为定位发布(权重承诺 2026-07-27 前开源),评测统一 reasoning effort=max、temperature=1.0。已收录 35 项以上评测覆盖编码、Agent、搜索与多模态:亮点 Terminal-Bench 2.1 88.3、BrowseComp(1M 上下文)90.4。
发布文将其定位为最具智能体能力(most agentic)的 Sonnet,支持可选努力档位、默认开启网络安全防护,并作为 Free/Pro 默认模型全量提供。评测集中于智能体编码、计算机使用、知识工作与安全评估,亮点为 Terminal-Bench 2.1 80.4% 与 OSWorld-Verified 81.2%。
SOTA 级文档智能与 OCR 专项模型,专为复杂版面解析、表格与多语言文档抽取设计。
查看模型变体与证据 · 所收录来源未披露量化评测
本发布含 3 个变体,各变体规格见模型详情。
字节 Seed2.1 发布将 Pro 定位为系列最高档,官方称评估优先考察真实工作流表现而非静态榜单分数。已收录评测横跨通用 Agent、编码、多模态与视频理解:亮点 GDPval 87.9、OSWorld 78.8。
智谱将 GLM-5.2 定位为面向长周期任务构建的模型,提供稳固支撑长程工作的 1M 上下文与更强编码能力(High/Max 档位控制),权重以 MIT 协议完全开源。已收录评测聚焦智能体编码与工具调用、长程软件工程与数学推理等领域,AIME 2026 99.2、Terminal-Bench 2.1(Terminus-2)81。
本发布含 2 个变体,各变体规格见模型详情。
Anthropic 以「Claude Fable 5 与 Claude Mythos 5」联合公告发布 Fable 5:一款带安全护栏的 Mythos 级模型,在网络安全/生物化学/蒸馏话题上按分类器回退到 Opus 4.8(影响 <5% 会话)。评测覆盖智能体编码、知识工作、计算机使用与生物安全,亮点如 SWE-Bench Pro 80.3%、OSWorld-Verified 85.0%。
本发布含 2 个变体,各变体规格见模型详情。
MiniMax M3 被发布文定位为将前沿编码、1M 上下文与原生多模态合一的单模型(Frontier Coding, 1M Context, Native Multimodality - All in One Model),采用 MSA 稀疏注意力并支持思考开关。评测覆盖编码、协作代理、GUI 与多模态:SWE-Bench Verified 80.5、BrowseComp 83.52、OSWorld-Verified 70.06、IMO 2025 35/42。
Step 3.7 Flash 被阶跃星辰定位为面向真实场景代理的高效率 Flash 模型,支持三档推理级别、最高 400 tok/s。评测覆盖通用代理、编码与长上下文/视觉:BrowseComp 75.8%、HLE w. tool 47.2%、SWE-bench Verified 76.5%、V* 95.29%。
本发布含 2 个变体,各变体规格见模型详情。
Anthropic 发布文将 Claude Opus 4.8 定位为 Opus 系列新旗舰,主打诚实性训练(放行自写代码缺陷的概率约为上代 1/4)与 effort 分档(默认 high,另有 extra/max),并随发布推出 Claude Code 动态工作流。已收录 9 项评测集中于编码、终端与计算机/知识工作 Agent:亮点 SWE-bench Pro 69.2、GDPval-AA Elo 1890。
Google 在 I/O 2026 发布 Gemini 3.5 首个模型 Gemini 3.5 Flash,定位「frontier intelligence with action」,并成为 Gemini 应用与 Search AI Mode 的默认模型。评测横跨终端智能体、多模态理解与抽象推理,亮点如 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%,页面并称输出速度约为其他前沿模型 4 倍。
Google 将 Gemini 3.1 Flash-Lite 定位为 Gemini 3 系列中最快、最具成本效率的型号,2026-03-03 预览、2026-05-07/08 转正(GA)。已收录 3 项评测(均出自预览公告)覆盖对话竞技场、科学与多模态推理:亮点 Arena.ai 排行 1432 Elo、GPQA 86.9%。
发布文以“智能体新前沿”为题,将 Qwen3.7-Max 定位为面向智能体时代的新一代旗舰(经阿里云百炼 API 提供,在 Claude Code/OpenClaw/Qwen Code 间泛化)。40 余项评测覆盖智能体编码、工具与办公场景及数理推理,亮点为 HMMT 2026 二月场 97.1 与 SWE-bench Verified 80.4。
Grok 4.3 为旗舰推理模型,分级推出(SuperGrok Heavy beta 2026-04-17、公开 API 2026-04-30),具备 1M 超长上下文、常开推理与原生视频多模态输入能力。
查看模型变体与证据 · 所收录来源未披露量化评测
Qwen3.6-Flash 为原生视觉语言 Flash 系列经济档,相对 3.5-Flash 在代理式编码、数学/代码推理、空间智能与目标定位上显著提升。
查看模型变体与证据 · 所收录来源未披露量化评测
本发布含 2 个变体,各变体规格见模型详情。
DeepSeek 发布 V4 预览版「迈入百万上下文普惠时代」,V4-Pro 为旗舰:1M 上下文、思考/非思考双模式、reasoning_effort high/max。评测覆盖推理、编码、智能体与百万级长上下文,亮点如 GPQA Diamond 90.1%、Codeforces 3206。
本发布含 2 个变体,各变体规格见模型详情。
OpenAI 发布 GPT-5.5,提供 low/medium/high/xhigh 推理档(另有非推理模式)。评测横跨智能体编码、知识工作、长上下文与科学/网络安全,亮点如 Terminal-Bench 2.0 82.7%、ARC-AGI-2 85.0%。
Kimi K2.6 是月之暗面的开源编码旗舰(Advancing Open-Source Coding),主打长程编码与代理蜂群(300 子代理 / 4000 步)。评测横跨编码、代理、数学与视觉:SWE-bench Verified 80.2、SWE-Bench Pro 58.6、Terminal-Bench 2.0(Terminus-2)66.7、HLE-Full w/ tools 54.0。
本发布含 2 个变体,各变体规格见模型详情。
Anthropic 将 Claude Opus 4.7 定位为在高级软件工程上较 Opus 4.6 显著提升、最难任务上增益尤为明显的旗舰模型,同时大幅增强视觉分辨率;这也是首个按 Project Glasswing 分级防护方案发布的模型。已收录评测覆盖智能体编码与终端、长上下文检索、计算机操作、网络安全与多学科推理等领域,SWE-bench Verified 87.6、GPQA Diamond 94.2。
GLM-5.1 被 z.ai 定位为面向长程任务(Towards Long-Horizon Tasks)的代理工程旗舰,强调数百轮持续优化与长时程任务能力。评测集中在推理、编码与代理三类:SWE-Bench Pro 58.4、Terminal-Bench 2.0(Terminus-2)63.5、BrowseComp(w/ 上下文管理)79.3、HLE w/ Tools 52.3。
本发布含 4 个变体,各变体规格见模型详情。
面向本地运行的开放权重模型,支持推理与工具调用;本变体输入能力和上下文按官方发布页记录。
Grok 4.20 为介于 Grok 4.1 与 Grok 4.3 之间的推理旗舰,采用多代理 Heavy 配置,面向高难度逻辑推理与复杂代理任务。
查看模型变体与证据 · 所收录来源未披露量化评测
MiMo-V2.5-Pro 是小米万亿级参数旗舰混合专家大模型,总参数 1.02T,激活 42B,支持 100 万 token 上下文。评测全面对标国际前沿:MMLU 89.4、GSM8K 99.6、MATH 86.2、SWE-bench Verified 78.9%、C-Eval 91.5、BBH 88.4。
MiniMax 发布 M2.7「Early Echoes of Self-Evolution」,定位为首个深度参与自身进化的 M 系列模型,支持 Agent Teams、复杂 Skills 与动态工具搜索。评测集中在智能体与编码,亮点如 SWE-Bench Pro 56.2%、MLE-Bench Lite 66.6%。
Mistral 官方高效轻量模型,专为企业级低成本高通量推理与端侧部署优化。
查看模型变体与证据 · 所收录来源未披露量化评测
字节 Seed 系列页将 Seed2.0 Lite 定位为 Seed 基础模型系列首个全模态(omni-modal)理解模型,原生支持视频、图像、音频与文本的统一理解,并升级 Agent、Coding 与 GUI 能力,兼顾输出质量与响应速度,适合通用生产级场景。已收录评测覆盖文本智能体与编码、多模态理解、GUI 操作及视频与音频理解等领域,GPQA Diamond 88.4%、OSWorld Verified 64.4%。
本发布含 4 个变体,各变体规格见模型详情。
OpenAI 将 GPT-5.4 定位为融合 GPT-5.3-Codex 编码谱系的新旗舰(ChatGPT 内 Thinking 模式,effort none/low/medium/high/xhigh,1M 上下文,原生计算机操作与工具搜索)。已收录 90 余项评测横跨知识工作、编码、计算机操作与长上下文:亮点 GDPval 83.0%、OSWorld-Verified 75.0%。
官方 Seed2 系列页将 Mini 列为该代更小档位(Seed2.0 Mini 0215 快照),本页仅在视频/视听理解评测表收录其数据。已收录 28 项评测集中于长视频、流式视频与视听理解:亮点 Video-MMMU(Video Knowledge)80.6、Video-MME(Long Video)81.2。
Google 将 Gemini 3.1 Pro 定位为「为最复杂任务打造的更聪明模型」,基于 Gemini 3 Pro,发布时为 preview(thinking 档 low/medium/high)。已收录 19 项评测横跨推理、代码、多模态与长上下文:亮点 GPQA 94.3%、SWE-bench Verified 80.6%。
MiniMax 将 M2.5 定位为「为真实生产力打造」,披露 20 万+ 真实环境 RL 训练与 Forge 智能体原生框架,并随附同能力 2 倍速的 M2.5-Lightning 档。已收录 22 项评测集中于编码、搜索与 Agent 工具调用:亮点 SWE-bench Verified 80.2%、tau2-Bench Telecom 97.8%。
智谱以「From Vibe Coding to Agentic Engineering」为主题发布 GLM-5:744B 总参/40B 激活的 MoE(DSA 架构,28.5T 预训练 tokens),MIT 许可开源。评测覆盖推理、编码与通用智能体,亮点如 HMMT 2025.11 96.9%、τ²-Bench 89.7%。
Claude Opus 4.6 是 Anthropic 的旗舰模型,引入多档推理努力(low/medium/high/max)、自适应思考、上下文压缩与 1M 上下文 beta。评测覆盖代理编码/工具/搜索、法律与多语言问答:SWE-bench Verified 80.8、GPQA Diamond 91.3、ARC-AGI-2 68.8、BrowseComp 84.0。
发布文将其定位为“快、准、稳”的智能体智能模型(Apache 2.0 开源,196B 总参/约 11B 激活稀疏 MoE,MTP-3,256K 上下文)。16 项评测以智能体搜索、数学与编码为主,亮点为 HMMT 2025 二月场 98.4 与 AIME 2025 97.3。
发布文以“视觉智能体智能”为题,将 K2.5 定位为在 K2 基础上经 15T 视觉+文本混合语料继续预训练的原生多模态模型,Agent Swarm 最多 100 个子智能体/1500 步。45 项评测覆盖视觉理解、视频、智能体搜索与编码,亮点为 OCRBench 92.3 与 BrowseComp(Agent Swarm 模式)78.4。
发布文以“推进编码能力”为题,将 GLM-4.7 定位为编码与智能体任务导向的模型,支持交错/保留/回合级思考模式。17 项评测覆盖数理推理、代码智能体与通用智能体,亮点为 HMMT 2025 二月场 97.1 与 τ²-Bench 87.4(SWE-bench Verified 73.8)。
MiMo-V2-Flash 是小米自研开源的稀疏混合专家(MoE)超快大模型,总参数 309B,激活仅 15B,主打极速首词响应与高并发吞吐,面向端云协同与代理推理场景。
Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。
本发布含 2 个变体,各变体规格见模型详情。
Mistral 将 Devstral 2 定位为面向智能体编码的下一代开源 SOTA 编码模型(modified MIT 协议),并随发布配套推出 Mistral Vibe CLI。已收录评测为软件工程与人评胜率两项,SWE-bench Verified 72.2%、人评 42.8% 胜 / 28.6% 负。
谷歌将 Gemini 3 Deep Think 定位为 Gemini 应用内面向 Google AI Ultra 订阅用户推出的增强推理模式,专攻挑战最先进模型的复杂数学、科学与逻辑问题。已收录评测为通用推理与抽象推理两项,HLE 41.0%(无工具)、ARC-AGI-2 45.1%(带代码执行)。
本发布含 4 个变体,各变体规格见模型详情。
Mistral 将 Large 3 定位为其迄今最强模型,也是 Mixtral 系列之后首个稀疏 MoE(41B 激活/675B 总参,Apache 2.0 开源,旗舰多模态多语言定位)。已收录评测为榜单类定位:LMArena 开源非推理类第 2、开源总榜第 6。
本发布含 2 个变体,各变体规格见模型详情。
DeepSeek 官方将 V3.2 正式版定位为「强化 Agent 能力、融入思考推理」,是 DeepSeek 首个将思考与工具调用融合的模型。已收录 26 项评测覆盖数学竞赛、代码、知识与工具/Agent 使用:亮点 AIME 2025(Thinking)93.1、Codeforces(Thinking)2386。
本发布含 3 个变体,各变体规格见模型详情。
Seed1.8 被发布文定位为通用化 Agentic 模型,覆盖 GUI/浏览器/移动操作、代理搜索、代理编码与经济价值领域任务,并提供三种思考模式。评测横跨代理、数学、STEM、知识、多模态与长视频等约 13 组:GAIA 87.4、BrowseComp-zh 81.3、AIME-25 94.3。
本发布含 2 个变体,各变体规格见模型详情。
Gemini 3 发布以「智能新纪元」为题呈现,Gemini 3 Pro 为旗舰型号(发布时 preview)。已收录评测横跨推理、代码、多模态与 Agent:亮点 LMArena 1501 Elo、AIME 2025(带代码执行)100%。
xAI 将 Grok 4.1 定位为一次可用性导向的风格升级:复用驱动 Grok 4 的大规模强化学习基础设施来优化风格、人格、有用性与对齐,使其更敏锐捕捉细微意图、更具对话魅力且人格连贯,同时完全保留前代的锋利智能与可靠性。已收录评测覆盖竞技场 Elo、情商、创意写作与事实性等领域,Text Arena Thinking 配置 1483 Elo(总榜第一)、EQ-Bench3 1586 Elo(归一化)。
月之暗面将 Kimi K2 Thinking 定位为思考型智能体(thinking agent),通过同时扩展思考 token 与工具调用步数推进测试时扩展前沿,可跨数百步规划、推理、执行与调整,全部评测结果以 INT4 QAT 精度报告。已收录评测覆盖通用推理、数学、智能体检索、编码与终端等领域,HLE 带工具 44.9(Heavy Mode 51.0)、SWE-bench Verified 71.3。
发布文以“简中之巧(Ingenious in Simplicity)”为题,将 M2 定位为 agent 优先的开源权重模型,价格约为 Claude Sonnet 的 8%、速度约 2 倍。9 项评测集中于智能体编码、工具调用与搜索,亮点为 GAIA(纯文本)75.7 与 τ²-Bench 77.2。
发布文将其定位为小而快的轻量档模型,编码性能接近 Sonnet 4 而成本仅约三分之一、速度快一倍以上,计算机使用能力超过 Sonnet 4。11 项评测覆盖智能体编码、工具调用、计算机使用与数学推理,亮点为 AIME 2025(带 Python 工具)96.3% 与 τ2-bench Telecom 83.0%。
智谱将 GLM-4.6 定位为具备高级 Agentic、推理与编程能力的模型,上下文由 128K 扩展至 200K,推理中可交织工具调用。评测以编码与智能体为主,亮点如 CC-Bench 对 Claude Sonnet 4 胜率 48.6%、AIME 25 93.9%。
Anthropic 发布 Claude Sonnet 4.5,作为面向编码、智能体与计算机使用场景的 Sonnet 新代,并同步推出 Claude Agent SDK。评测集中在编码与智能体领域,亮点如 SWE-bench Verified 77.2%(并行测试期计算 82.0%)、τ2-bench Telecom 98.0%。
DeepSeek 将 V3.2-Exp 定位为引入 DeepSeek 稀疏注意力(DSA)、聚焦长上下文训练与推理提效的实验性版本,训练设置与 V3.1-Terminus 严格对齐、公开评测表现基本持平,API 价格同步下调超 50%(页面未给出具体单价)。已收录评测覆盖通用知识、数学推理、代码与中英文检索等领域,Codeforces Div1 2121、AIME 2025 89.3。
本发布含 2 个变体,各变体规格见模型详情。
Qwen3-Max 发布以「大就是好(Just Scale it)」为题,Instruct 为超 1T 总参 MoE 旗舰(36T 预训练 tokens、全局 batch 负载均衡损失,ChunkFlow 支持 1M 长上下文训练)。已收录 9 项评测:亮点 SWE-bench Verified 69.6、LMArena 文本榜 1430。
Moonshot 通过 Hugging Face 官方模型卡发布 Kimi-K2-Instruct-0905:K2 权重更新,上下文 128K→256K,强化智能体编码。评测集中于编码与智能体任务,亮点如 SWE-Bench Verified 69.2%、SWE-Dev 66.6%(五次全量重跑均值±标准差)。
DeepSeek-V3.1 发布文定位为首个混合推理架构模型:同一模型同时服务 deepseek-chat(非思考)与 deepseek-reasoner(思考),主打思考效率提升与 Agent 能力增强。评测分编码代理、搜索代理与思考效率三组:SWE-bench Verified 66、BrowseComp 30、AIME 2025(V3.1-Think)88.4。
本发布含 2 个变体,各变体规格见模型详情。
GPT-5 是 OpenAI 的统一思考模型,发布文称其在 AIME 2025(无工具 94.6%)、SWE-bench Verified 74.9%、HealthBench Hard 46.2% 等刷新 SOTA,并大幅降低事实错误与谄媚率。评测覆盖竞赛数学、编码、指令跟随与代理、多模态与健康:GPQA Diamond 88.4%、MMMU 84.2%、BrowseComp 54.9%。
StepFun 将 Step 3 定位为高性价比的多模态智能模型,以 38B 激活的 MoE 架构与 MFA 注意力 + AFD 并行设计平衡性能与推理成本,并以 Apache 2.0 开源。已收录评测覆盖多模态理解、数学与科学推理、代码等领域,AIME 2025 82.9、MMMU 74.2。
智谱 AI 高性能极致性价比基座大模型,面向企业级大规模并发场景提供强大的文本理解与智能体调用能力。
Qwen3-Coder-480B-A35B-Instruct 以「Agentic Coding in the World」为定位发布,480B MoE/35B 激活,原生 256K 上下文(YaRN 可扩至 1M)。已收录 15 项评测集中于代码仓库、终端与浏览器/工具 Agent:亮点 SWE-bench Verified(OpenHands 500 turns)69.6、Terminal-Bench 37.5。
本发布含 2 个变体,各变体规格见模型详情。
Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。
本发布含 2 个变体,各变体规格见模型详情。
Grok 4 是 xAI 具备原生工具调用与实时搜索的模型,官方称其为 HLE text-only 子集首个突破 50%(50.7%)的模型。评测集中于数学、科学与编码:AIME'25 91.7%(无工具)、HMMT 2025 90%、GPQA 87.5%、ARC-AGI-2 15.9%(闭源 SOTA)。
本发布含 4 个变体,各变体规格见模型详情。
腾讯混元以「细粒度 MoE、80B 总参/13B 激活」开源 A13B 系列,Instruct 为指令版(256K 上下文,/think 与 /no_think 双模式,默认慢思考)。已收录 21 项 Instruct 表评测覆盖知识、数学、代码与 Agent 工具调用:亮点 AIME24 87.3、GPQA Diamond 71.2。
发布文将其定位为带自适应思考(AdaCoT)的多模态通用系列,称视觉任务追平甚至超过 Seed1.5-VL。已收录的 8 项数值均来自 Seed1.6 Base 列的知识与数理基础评测,亮点为 BBH 92.08 与 MMLU 88.83;多模态旗舰版本身未给出数值。
本发布含 2 个变体,各变体规格见模型详情。
Gemini 2.5 Flash 是 Gemini 2.5 家族 GA 扩容公告中的主力 Flash 档模型,默认开启思考并同时报告非思考配置。评测覆盖科学/数学/编码/事实性/视觉与多语言:思考配置 GPQA Diamond 82.8%、AIME 2025 72.0%、MRCR v2 8-needle(1M)21.0%。
MiniMax 稀疏混合专家大语言模型,支持 245K 超长上下文窗口与万级汉字复杂指令遵循。
本发布含 2 个变体,各变体规格见模型详情。
Claude 4 发布中 Opus 4 为最强编码档,采用混合模式(近即时回答 + 扩展思考,扩展思考可与工具调用结合,beta)。已收录 22 项评测覆盖软件工程、终端、知识与 Agent:亮点 SWE-bench Verified 72.5%(并行测试时计算 79.4%)。
MiMo-7B-RL 是小米开源的 7B 强化学习对齐大模型,在 MMLU 达到 70.3 分,MATH-500 71.2 分,GSM8K 87.8 分,显著强化长思维链与代码数学逻辑能力。
本发布含 8 个变体,各变体规格见模型详情。
Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。
字节跳动火山引擎主力通用大模型,具备高性价比、低延迟响应与出色的中文上下文理解能力。
本发布含 2 个变体,各变体规格见模型详情。
OpenAI 将 o3 定位为其最强推理模型,在编码、数学、科学与视觉感知等领域推进前沿,并支持以图思考(Thinking with images)。该发布已收录评测覆盖数学、编程竞赛、科学推理、软件工程与智能体工具使用等领域,AIME 2025 配 Python 工具 pass@1 98.4%、100% consensus@8。
本发布含 3 个变体,各变体规格见模型详情。
发布文称 Maverick 为 Llama 4 herd 中的主力多模态模型(17B 激活、128 专家、400B 总参,MoE 架构)。评测覆盖多模态理解、知识、代码与克丘亚语翻译,亮点为 DocVQA 94.4 与 ChartQA 90.0(LMArena Elo 1417 归属于实验性聊天版本)。
谷歌将 Gemini 2.5 Pro 实验版定位为其最智能的 AI 模型与 2.5 系列首个思维(thinking)模型,原生多模态并配备 1M token 上下文窗口(200 万即将推出)。已收录评测覆盖推理、代码、长上下文与多模态理解等领域,HLE 无工具 18.8%、SWE-bench Verified 63.8%。
腾讯混元-T1 正式版定位为业内首个超大规模混合 Mamba 推理模型(TurboS 混合 Transformer-Mamba MoE 底座,96.7% 后训练算力用于强化学习)。已收录 14 项评测覆盖知识、数学、代码与中文能力:亮点 MMLU-Pro 87.2、AIME24 78.2。
本发布含 2 个变体,各变体规格见模型详情。
Grok 3 被 xAI 定位为开启『推理代理时代』的 Beta 模型,主打 (Think) 深度推理配置并曾以代号 chocolate 登顶 LMArena。评测覆盖推理、编码、多模态理解与长上下文 RAG:AIME'25 93.3%、GPQA 84.6%、LCB 79.4%、Chatbot Arena 1402 Elo、LOFT(128k)83.3%。
通义千问新一代开源视觉语言大模型,支持动态分辨率图像输入与小时级超长视频理解,在多模态基准榜单上领跑开源阵营。
深度求索开源的纯强化学习驱动推理大模型,开创性采用大规模强化学习与多阶段冷启动蒸馏技术,在数学竞赛、代码工程与复杂推理任务上达到与 OpenAI o1 相当的前沿水准。
月之暗面面向深度推理的长思维链强化学习大模型,在数学奥林匹克、复杂编程与视觉长程推理任务上展现出突破性表现。
MiniMax 采用自研混合线性注意力(Lightning Attention)架构的大模型,总参数 456B,激活 45.9B,支持高达 400 万 tokens(约 400 万字)超长文本一次性输入,大海捞针检索测试准确率 100%。MMLU 达 86.5%,HumanEval 达 84.1%,MATH 达 70.3%。
查看模型变体与证据 · 所收录来源未披露量化评测
深度求索自研 MoE 架构大语言模型,首创多头潜在注意力(MLA)与 DeepSeek 稀疏注意力(DSA),以极高训练与推理效率成为全球开源基座代表作。
字节跳动最新一代通用主力基座,总参数扩充,在复杂指令遵循、长文本理解、工具调用及结构化数据生成上达到国内第一梯队。MMLU 达 82.5%,GSM8K 达 89.2%,HumanEval 达 83.1%。
查看模型变体与证据 · 所收录来源未披露量化评测
微软 14B 参数专攻复杂推理的开源大模型,采用合成数据增强与多阶段对齐,在 MATH 达 80.4%,GPQA 达 56.1%,MMLU 达 84.8%,HumanEval 达 82.3%,推理能力媲美大尺寸前沿闭源模型。
本发布含 2 个变体,各变体规格见模型详情。
发布文称其为面向智能体时代(agentic era)的 Gemini 2.0 家族首个模型。13 项评测横跨知识、代码、数学、多模态与长上下文,亮点为 Natural2Code 92.9% 与 MATH 89.7%。
腾讯开源业界最大规模 Transformer 架构混合专家模型,总参数 389B,激活 52B,支持 256K 长文本,在 MMLU 达 89.9%,GSM8K 达 89.9%,MATH 达 66.8%,HumanEval 达 78.7%,位居开源前沿阵营。
月之暗面首款长思维链强化学习推理模型,对标 OpenAI o1-preview,在 MATH 基准测试达 93.8%,GSM8K 达 97.4%,在中高考数学及奥数竞赛题中展现出极高推理上限。
查看模型变体与证据 · 所收录来源未披露量化评测
Meta 首度推出的多模态视觉 Llama 模型系列,包含 11B/90B 视觉版与 1B/3B 端侧极小尺寸版,支持 128K 上下文与图像理解,90B 视觉模型在 MMLU 达 88.5%,MGSM 达 88.6%,MATH 达 71.2%。
本发布含 5 个变体,各变体规格见模型详情。
Qwen2.5 发布文以「A Party of Foundation Models」呈现全家族,72B-Instruct 为其中最大开源指令模型(稠密解码器,18T 预训练 tokens)。已收录 14 项评测覆盖知识、数学、代码与对齐:亮点 GSM8K 95.8、MMLU-Pro 71.1。
OpenAI 首款强化学习驱动思维链(Chain of Thought)推理模型,在科学、编程与数学竞争性基准测试中展现出突破性的深度思考能力。
xAI 第二代推理旗舰,在 LMSYS Chatbot Arena 盲测榜上一跃进入全球前三,在指令遵循、学术测试及多模态图像理解与生成上全面逼近 Claude 3.5 Sonnet 与 GPT-4o。GPQA 达 56.0%,MATH 达 76.1%,HumanEval 达 88.4%,MMLU 达 87.5%。
Mistral 123B 参数旗舰模型,支持 128K 超长上下文与 80+ 种编程语言,MMLU 达 84.0%,HumanEval 达 92.0%,GSM8K 达 91.2%,MATH 达 63.3%,代码能力跻身全球最强阵营。
本发布含 3 个变体,各变体规格见模型详情。
Meta 以「迄今最强模型」发布 Llama 3.1 系列,405B 为首个前沿级开源模型(dense decoder-only)。评测覆盖知识、数学、编码、多语言与长上下文,亮点如 MMLU 88.6%、GSM8K 96.8%。
OpenAI 推出的小尺寸高性价比多模态主力,全面替代 GPT-3.5 Turbo,在 MMLU 达到 82.0%,MGSM 87.0%,HumanEval 87.2%,MATH 70.2%,GPQA 40.2%。
阶跃星辰在 2024 世界人工智能大会(WAIC)发布的国内首个万亿参数混合专家大模型,极具辨识度的高智能逻辑推理中枢。MMLU 达 85.3%,GSM8K 达 92.4%。
查看模型变体与证据 · 所收录来源未披露量化评测
Google 开源轻量级旗舰系列,采用交错滑动窗口局部注意力与知识蒸馏优化,27B 参数版本在 MMLU 达 75.2%,GSM8K 达 84.0%,MATH 达 50.2%,在 LMSYS 盲测竞技场匹敌 70B 开源模型。
Anthropic 旗舰中杯模型,在代码生成、多步复杂推理与视觉理解上全面超越上一代 Opus 与同代旗舰,是智能体与工程编程的行业标杆。
字节跳动火山引擎在 2024 春季 FORCE 原动力大会正式推出豆包大模型家族,公布日均千亿 tokens 吞吐量,将大模型推理价格拉低至厘时代(比行业便宜 99%),开启大模型普惠落地与商业化普及浪潮。
查看模型变体与证据 · 所收录来源未披露量化评测
OpenAI 原生端到端多模态旗舰大模型,支持文本、语音与视觉的实时低延迟无缝交互,在具备 GPT-4 Turbo 级别智能的同时将推理速度提升 2 倍、API 成本降低 50%。
深度求索开创性自研 MLA(多头潜在注意力)与 DeepSeekMoE 架构的首秀之作,236B 总参数仅激活 21B,KV Cache 显存节省 93.3%,以极致低价与高智力引爆国内大模型价格战。MMLU 78.5%,GSM8K 79.2%,HumanEval 81.1%,C-Eval 81.4%。
微软端侧小模型巅峰之作,3.8B Mini 模型能在 iPhone 上流畅离线运行,在 MMLU 达 68.8%、GSM8K 达 82.5%、HumanEval 达 58.5%、MATH 达 43.4%,性能逼近 Mixtral 8x7B。
Meta 开源 Llama 3 家族,采用 15T tokens 优质数据预训练,70B 版本在常识推理、代码与数学能力上达到 GPT-4 级水准。
姜大昕创立的阶跃星辰首次公开亮相,推出千亿参数基础语言大模型 Step-1 与多模态大模型 Step-1V,展示精准的中文图文多模态推理能力,并驱动跃问与冒泡鸭应用生态。
查看模型变体与证据 · 所收录来源未披露量化评测
Anthropic 第三代大模型家族旗舰 Claude 3 Opus,具备行业顶尖的复杂分析与编程能力,在 MMLU 达到 86.8%,GPQA 50.4%,MATH 60.1%,HumanEval 84.9%,GSM8K 95.0%,多项指标首次全面超越 GPT-4。
Google DeepMind 突破性百万上下文多模态旗舰,首次实现 100 万至 200 万超长上下文检索与跨模态无损长程推理。
智谱 AI 在 2024 开发者大会发布的新一代基座旗舰,全面逼近 GPT-4。支持 128K 上下文、自主 Agent 工具调用、代码解释器及多模态,MMLU 达 81.4%,GSM8K 达 87.6%,HumanEval 达 72.0%,MATH 达 46.2%,C-Eval 达 85.8%。
MiniMax 发布的国内首款千亿参数 MoE 架构语言大模型,总参数量达千亿级,通过稀疏专家网络动态路由,在保持计算效率的同时显著提升了复杂逻辑推理与代码生成能力。MMLU 达 73.2%,GSM8K 达 76.5%。
查看模型变体与证据 · 所收录来源未披露量化评测
开创全球开源稀疏混合专家(MoE)潮流的现象级模型,总参数 46.7B、每个 token 仅激活 12.9B,在 MMLU(70.6%)、GSM8K(74.4%)、HumanEval(40.2%)上全面击败 Llama 2 70B,推理吞吐提升 6 倍。
Google DeepMind 原生多模态大模型开篇之作,其中 Gemini 1.0 Ultra 成为全球首个在 MMLU 基准上超越人类专家的前沿大模型。
阿里通义千问初代开源最强版,72B 参数在 3T token 上预训练,支持 32K 上下文,在 MMLU(77.4%)、GSM8K(78.9%)、C-Eval(83.3%)上全面登顶当时全球开源模型第一。
深度求索(DeepSeek)首款全开源双语密集大模型,从头训练 2T token,MMLU 达 71.4%,GSM8K 达 68.3%,C-Eval 达 66.1%,CMMLU 达 66.6%,在多项中英推理基准上全面超越 Llama 2 70B。
OpenAI 开发者大会(DevDay 2023)发布的重大升级旗舰,上下文大幅扩充至 128K tokens,支持 JSON 模式、可复现输出(seed)与多工具并行调用,价格相比初代 GPT-4 降低 3 倍。
查看模型变体与证据 · 所收录来源未披露量化评测
马斯克旗下 xAI 创立后的首款大语言模型,采用 314B 总参数稀疏混合专家架构,以幽默叛逆风格和 X 平台实时知识接入为特色。在 MMLU 达 73.0%,GSM8K 达 62.9%,HumanEval 达 63.2%,MATH 达 23.9%。
月之暗面成立后首款正式面世的产品,以 20 万汉字无损长上下文(Long Context)引爆国内行业,奠定了月之暗面在长文本技术上的先锋地位。
查看模型变体与证据 · 所收录来源未披露量化评测
欧洲 AI 领军企业 Mistral 开山之作,开创性采用分组查询注意力(GQA)与滑动窗口注意力(SWA),以仅 7B 参数在所有基准上全面击败 Llama 2 13B,MMLU 达 60.1%,GSM8K 达 52.2%,HumanEval 达 30.5%。
微软研究院高质量合成教学数据(Textbooks Are All You Need)学派代表作,仅 1.3B 参数在常识推理上与 10 倍于己的开源大模型相当。ARC-Challenge 达 55.4%,HellaSwag 达 63.8%。
腾讯自研全链路千亿参数大语言模型首次正式对外亮相,深度接入腾讯会议、腾讯文档、微信读书等数十个腾讯核心生态产品,具备强大的中文多轮对话、长文创作与复杂任务理解能力。
查看模型变体与证据 · 所收录来源未披露量化评测
MiLM-6B 是小米开源自研的 64 亿参数通用轻量大模型,在 C-Eval 取得 60.2 分(同参数量级第一、总榜第十),CMMLU 取得 60.37 分,主打端侧智能与高效端云协同部署。
Meta 首个允许免费商业化使用的开源大模型家族,预训练 token 达 2T,深度融合 RLHF(PPO + 拒绝采样)对齐策略,70B 版本的 MMLU 达 68.9%,GSM8K 56.8%,成为工业界落地应用最广泛的开源标杆。
Anthropic 第二代旗舰模型,首发支持 100K 超长上下文(可一次性读入数十页技术文档或一整本书),HumanEval 达 71.2%,GSM8K 达 88.0%,全美律师资格考多选题 76.5%。
Google I/O 2023 发布的重磅基座大模型,强化了多语言、数学逻辑与代码生成能力,MMLU 达 81.2%,GSM8K 达 80.7%,MATH 达 34.3%,HumanEval 达 50.0%,全面驱动初代 Google Bard。
清华大学与智谱 AI 联合开源的双语对话模型,在单张消费级显卡(INT4 仅需 6GB 显存)即可本地部署,引爆国内开源对话模型与微调生态。
查看模型变体与证据 · 所收录来源未披露量化评测
Anthropic 正式公开首款对话大模型 Claude 1 与轻量版 Claude Instant,基于宪法 AI(Constitutional AI)对齐训练,主打帮助性与无害性原则,标志着 Anthropic 独立大模型体系的开篇。
查看模型变体与证据 · 所收录来源未披露量化评测
OpenAI 划时代多模态旗舰大语言模型,首次在大规模复杂推理、代码生成与人类专业考试(如统一律师资格考试、GRE、生物奥赛等)中达到人类顶尖水平,为现代大语言模型评估奠定了黄金标准。
Meta 开源大模型奠基之作,证明了在海量 token(1.4T)上充分预训练的 65B 模型可以在 MMLU(63.4%)、GSM8K(50.9%)等诸多任务上媲美甚至战胜 175B 的 GPT-3,开启了全球开源大模型繁荣时代。
OpenAI 划时代对话大模型,基于 GPT-3.5 谱系(InstructGPT)经人类反馈强化学习(RLHF)微调,开启生成式人工智能爆发奇点。在后续 GPT-4 技术报告中披露基线水准:MMLU 70.0%、GSM8K 57.1%、HumanEval 48.1%、MATH 34.1%。