MMLU

Near saturation · 接近饱和

57 学科四选一,测通识知识覆盖面(已近饱和)

基本信息

类别
知识与学科
状态
Near saturation · 接近饱和
官网 / 数据集
https://huggingface.co/datasets/cais/mmlu
论文
https://arxiv.org/abs/2009.03300

30 秒看懂

90 分 ≈ 通识知识面接近顶尖本科生水平;但它考“记住了吗”,不考“会用吗”。80+ 之后各家差距主要是噪声。

采用格局:13 家抓取中 8 家出现(多为 ○ 级图表/提及)——老牌基准正让位 MMLU-Pro

评分协议

5-shot,选 A/B/C/D

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 34 场模型发布(收录 36 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-08-26 Alibaba / Qwen·国内

Qwen3.8-Flash-Next / Qwen3.8-Flash-Next-Base

本发布含 2 个变体,各变体规格见模型详情。

Qwen3.8-Flash-Next 被发布文定位为迈向极致性价比的全新架构预览(GDN+QSA 混合注意力、N-gram Embedding、Muon 优化器),为 Qwen4 架构探路。评测覆盖代理编码/办公、多模态代理与通用推理:SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、AndroidWorld 84.5。

MoE 稀疏激活原生 256K 上下文多模态架构预览

查看模型变体与证据

Qwen3.8-Flash-Next-Base · Base model 90.36
2026-03-19 Xiaomi / 小米·国内

MiMo-V2.5-Pro

参数1.02T-A42B上下文1M模态文本·代码·多模态

MiMo-V2.5-Pro 是小米万亿级参数旗舰混合专家大模型,总参数 1.02T,激活 42B,支持 100 万 token 上下文。评测全面对标国际前沿:MMLU 89.4、GSM8K 99.6、MATH 86.2、SWE-bench Verified 78.9%、C-Eval 91.5、BBH 88.4。

万亿 MoE1M 上下文SWE-bench 高分全场景智能代理

查看模型变体与证据

MMLU 89.4
2025
2025-12-18 Xiaomi / 小米·国内

MiMo-V2-Flash

参数309B-A15B上下文128K模态文本

MiMo-V2-Flash 是小米自研开源的稀疏混合专家(MoE)超快大模型,总参数 309B,激活仅 15B,主打极速首词响应与高并发吞吐,面向端云协同与代理推理场景。

MoE 稀疏激活超低延迟端云协同高并发吞吐

查看模型变体与证据

MMLU 82.6
2025-12 ByteDance Seed / 豆包·国内

Seed1.8 / Seed1.8 Thinking / Seed1.5-VL

本发布含 3 个变体,各变体规格见模型详情。

Seed1.8 被发布文定位为通用化 Agentic 模型,覆盖 GUI/浏览器/移动操作、代理搜索、代理编码与经济价值领域任务,并提供三种思考模式。评测横跨代理、数学、STEM、知识、多模态与长视频等约 13 组:GAIA 87.4、BrowseComp-zh 81.3、AIME-25 94.3。

通用代理多模态三档思考模式

查看模型变体与证据

Seed1.8 · MMLU 92.3
2025-07-11 Moonshot AI / Kimi·国内

Kimi-K2-Instruct / Kimi-K2-Base

本发布含 2 个变体,各变体规格见模型详情。

Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。

开源权重1T MoE非思考 reflex 档Agentic

查看模型变体与证据

Kimi-K2-Instruct · MMLU 89.5
2025-06-27 Tencent / 腾讯混元·国内

Hunyuan-A13B-Instruct / Hunyuan-A13B-Pretrain / Hunyuan-A13B-Instruct-FP8 / Hunyuan-A13B-Instruct-GPTQ-Int4

本发布含 4 个变体,各变体规格见模型详情。

腾讯混元以「细粒度 MoE、80B 总参/13B 激活」开源 A13B 系列,Instruct 为指令版(256K 上下文,/think 与 /no_think 双模式,默认慢思考)。已收录 21 项 Instruct 表评测覆盖知识、数学、代码与 Agent 工具调用:亮点 AIME24 87.3、GPQA Diamond 71.2。

开源权重细粒度 MoE256K 长上下文快慢思考双模式

查看模型变体与证据

Hunyuan-A13B-Pretrain · MMLU 88.17
2025-06-25 ByteDance Seed / 豆包·国内

Seed1.6

参数230B-A23B MoE上下文256K模态文本·图像

发布文将其定位为带自适应思考(AdaCoT)的多模态通用系列,称视觉任务追平甚至超过 Seed1.5-VL。已收录的 8 项数值均来自 Seed1.6 Base 列的知识与数理基础评测,亮点为 BBH 92.08 与 MMLU 88.83;多模态旗舰版本身未给出数值。

多模态自适应思考长上下文GUI 交互

查看模型变体与证据

MMLU 88.83
2025-06-16 MiniMax·国内

MiniMax abab 6.5

参数千亿 MoE上下文245K tokens模态文本

MiniMax 稀疏混合专家大语言模型,支持 245K 超长上下文窗口与万级汉字复杂指令遵循。

千亿稀疏MoE245K超长上下文复杂指令遵循自研线性注意力

查看模型变体与证据

MMLU 图表尚无可读数值
2025-04-30 Xiaomi / 小米·国内

MiMo-7B-RL

参数7B上下文32K模态文本

MiMo-7B-RL 是小米开源的 7B 强化学习对齐大模型,在 MMLU 达到 70.3 分,MATH-500 71.2 分,GSM8K 87.8 分,显著强化长思维链与代码数学逻辑能力。

开源权重强化学习对齐高性价比推理数学与代码增强

查看模型变体与证据

MMLU 70.3
2025-01-20 DeepSeek·国内

DeepSeek-R1

参数671B (37B active)上下文128K tokens价格$0.55/$2.19 每百万 tokens模态文本

深度求索开源的纯强化学习驱动推理大模型,开创性采用大规模强化学习与多阶段冷启动蒸馏技术,在数学竞赛、代码工程与复杂推理任务上达到与 OpenAI o1 相当的前沿水准。

纯RL强化学习自主长思维链开源推理范式蒸馏全系列小模型

查看模型变体与证据

MMLU 90.8%
2024
2024-12-12 Microsoft AI / MAI·国际

Phi-4 (14B)

参数14B上下文16K tokens模态文本·代码·数学

微软 14B 参数专攻复杂推理的开源大模型,采用合成数据增强与多阶段对齐,在 MATH 达 80.4%,GPQA 达 56.1%,MMLU 达 84.8%,HumanEval 达 82.3%,推理能力媲美大尺寸前沿闭源模型。

14B数学推理标杆合成数据优化高分GPQA

查看模型变体与证据

MMLU 84.8%
2024-11-05 Tencent / 腾讯混元·国内

Hunyuan-Large

参数389B-A52B上下文256K tokens模态文本·代码

腾讯开源业界最大规模 Transformer 架构混合专家模型,总参数 389B,激活 52B,支持 256K 长文本,在 MMLU 达 89.9%,GSM8K 达 89.9%,MATH 达 66.8%,HumanEval 达 78.7%,位居开源前沿阵营。

最大开源Transformer MoE256K长上下文高分数学推理

查看模型变体与证据

MMLU 89.9%
2024-09-25 Meta / Llama·国际

Llama 3.2 90B Vision

参数90B上下文128K tokens模态文本·视觉多模态

Meta 首度推出的多模态视觉 Llama 模型系列,包含 11B/90B 视觉版与 1B/3B 端侧极小尺寸版,支持 128K 上下文与图像理解,90B 视觉模型在 MMLU 达 88.5%,MGSM 达 88.6%,MATH 达 71.2%。

原生多模态128K上下文端侧与云端全覆盖

查看模型变体与证据

MMLU 88.5%
2024-09-12 OpenAI·国际

OpenAI o1

参数未公开上下文128K tokens价格$15/$60 每百万 tokens模态文本·图像

OpenAI 首款强化学习驱动思维链(Chain of Thought)推理模型,在科学、编程与数学竞争性基准测试中展现出突破性的深度思考能力。

强化学习驱动推理思维链竞赛级数学与代码慢思考范式

查看模型变体与证据

MMLU 92.3
2024-08-14 xAI / Grok·国际

Grok-2

参数未公开上下文128K tokens模态文本·多模态

xAI 第二代推理旗舰,在 LMSYS Chatbot Arena 盲测榜上一跃进入全球前三,在指令遵循、学术测试及多模态图像理解与生成上全面逼近 Claude 3.5 Sonnet 与 GPT-4o。GPQA 达 56.0%,MATH 达 76.1%,HumanEval 达 88.4%,MMLU 达 87.5%。

LMSYS前三128K长上下文多模态Flux集成

查看模型变体与证据

MMLU 87.5%
2024-07-24 Mistral AI·国际

Mistral Large 2 (123B)

参数123B上下文128K tokens模态文本·代码

Mistral 123B 参数旗舰模型,支持 128K 超长上下文与 80+ 种编程语言,MMLU 达 84.0%,HumanEval 达 92.0%,GSM8K 达 91.2%,MATH 达 63.3%,代码能力跻身全球最强阵营。

123B开源旗舰代码92%HumanEval128K上下文

查看模型变体与证据

MMLU 84.0%
2024-07-23 Meta / Llama·国际

Llama 3.1 405B / Llama 3.1 70B / Llama 3.1 8B

本发布含 3 个变体,各变体规格见模型详情。

Meta 以「迄今最强模型」发布 Llama 3.1 系列,405B 为首个前沿级开源模型(dense decoder-only)。评测覆盖知识、数学、编码、多语言与长上下文,亮点如 MMLU 88.6%、GSM8K 96.8%。

开源权重长上下文多语言旗舰

查看模型变体与证据

Llama 3.1 405B · 0-shot CoT 88.6Llama 3.1 8B · 0-shot CoT 73Llama 3.1 70B · 0-shot CoT 86
2024-07-18 OpenAI·国际

GPT-4o mini

参数轻量化(未公开规模)上下文128K tokens价格$0.15/$0.6 每百万 tokens模态文本·多模态

OpenAI 推出的小尺寸高性价比多模态主力,全面替代 GPT-3.5 Turbo,在 MMLU 达到 82.0%,MGSM 87.0%,HumanEval 87.2%,MATH 70.2%,GPQA 40.2%。

极致性价比小模型128K上下文多模态

查看模型变体与证据

MMLU 82.0%
2024-06-27 Google DeepMind / Gemini·国际

Gemma 2 27B

参数27B上下文8K tokens模态文本

Google 开源轻量级旗舰系列,采用交错滑动窗口局部注意力与知识蒸馏优化,27B 参数版本在 MMLU 达 75.2%,GSM8K 达 84.0%,MATH 达 50.2%,在 LMSYS 盲测竞技场匹敌 70B 开源模型。

滑动窗口注意力知识蒸馏27B匹敌70B

查看模型变体与证据

MMLU 75.2%
2024-06-20 Anthropic·国际

Claude 3.5 Sonnet

参数未公开上下文200K tokens价格$3/$15 每百万 tokens模态文本·图像

Anthropic 旗舰中杯模型,在代码生成、多步复杂推理与视觉理解上全面超越上一代 Opus 与同代旗舰,是智能体与工程编程的行业标杆。

编程代码标杆多步长程推理智能体核心底座超高推理性价比

查看模型变体与证据

MMLU 88.7% (5-shot) / 88.3% (0-shot CoT)
2024-05-06 DeepSeek·国内

DeepSeek-V2

参数236B-A21B上下文128K tokens模态文本·代码

深度求索开创性自研 MLA(多头潜在注意力)与 DeepSeekMoE 架构的首秀之作,236B 总参数仅激活 21B,KV Cache 显存节省 93.3%,以极致低价与高智力引爆国内大模型价格战。MMLU 78.5%,GSM8K 79.2%,HumanEval 81.1%,C-Eval 81.4%。

首创MLA架构DeepSeekMoEKV Cache压缩93%价格战奇点

查看模型变体与证据

MMLU 78.5%
2024-04-23 Microsoft AI / MAI·国际

Phi-3-mini

参数3.8B上下文128K tokens模态文本

微软端侧小模型巅峰之作,3.8B Mini 模型能在 iPhone 上流畅离线运行,在 MMLU 达 68.8%、GSM8K 达 82.5%、HumanEval 达 58.5%、MATH 达 43.4%,性能逼近 Mixtral 8x7B。

手机端侧离线3.8B越级战力128K上下文

查看模型变体与证据

MMLU 68.8%
2024-03-04 Anthropic·国际

Claude 3 Opus

参数旗舰上下文200K tokens模态文本·多模态

Anthropic 第三代大模型家族旗舰 Claude 3 Opus,具备行业顶尖的复杂分析与编程能力,在 MMLU 达到 86.8%,GPQA 50.4%,MATH 60.1%,HumanEval 84.9%,GSM8K 95.0%,多项指标首次全面超越 GPT-4。

全能旗舰超越GPT-4200K上下文多模态视觉

查看模型变体与证据

MMLU 86.8%
2024-01-16 Z.ai / 智谱 GLM·国内

GLM-4

参数未公开上下文128K tokens模态文本·代码·多模态

智谱 AI 在 2024 开发者大会发布的新一代基座旗舰,全面逼近 GPT-4。支持 128K 上下文、自主 Agent 工具调用、代码解释器及多模态,MMLU 达 81.4%,GSM8K 达 87.6%,HumanEval 达 72.0%,MATH 达 46.2%,C-Eval 达 85.8%。

全面对齐GPT-4All Tools自主Agent128K长文本

查看模型变体与证据

MMLU 图表尚无可读数值
2023
2023-12-11 Mistral AI·国际

Mixtral 8x7B

参数46.7B-A12.9B上下文32K tokens模态文本

开创全球开源稀疏混合专家(MoE)潮流的现象级模型,总参数 46.7B、每个 token 仅激活 12.9B,在 MMLU(70.6%)、GSM8K(74.4%)、HumanEval(40.2%)上全面击败 Llama 2 70B,推理吞吐提升 6 倍。

稀疏MoE先驱8专家路由超越Llama2-70B

查看模型变体与证据

MMLU 70.6%
2023-12-06 Google DeepMind / Gemini·国际

Gemini 1.0 Ultra

参数未公开上下文32K tokens模态文本·图像·音频·视频

Google DeepMind 原生多模态大模型开篇之作,其中 Gemini 1.0 Ultra 成为全球首个在 MMLU 基准上超越人类专家的前沿大模型。

原生跨模态超越人类专家多模态推理Ultra旗舰

查看模型变体与证据

MMLU 90.0%
2023-11-30 Alibaba / Qwen·国内

Qwen-72B

参数72B上下文32K tokens模态文本·代码

阿里通义千问初代开源最强版,72B 参数在 3T token 上预训练,支持 32K 上下文,在 MMLU(77.4%)、GSM8K(78.9%)、C-Eval(83.3%)上全面登顶当时全球开源模型第一。

通义千问初代开源旗舰全球开源第一32K长文本

查看模型变体与证据

MMLU 77.4%
2023-11-29 DeepSeek·国内

DeepSeek LLM 67B

参数67B上下文4K tokens模态文本

深度求索(DeepSeek)首款全开源双语密集大模型,从头训练 2T token,MMLU 达 71.4%,GSM8K 达 68.3%,C-Eval 达 66.1%,CMMLU 达 66.6%,在多项中英推理基准上全面超越 Llama 2 70B。

DeepSeek开山之作2T预训练token超越Llama2-70B

查看模型变体与证据

MMLU 71.4%
2023-11-04 xAI / Grok·国际

Grok-1

参数314B-A86B MoE上下文8K tokens模态文本

马斯克旗下 xAI 创立后的首款大语言模型,采用 314B 总参数稀疏混合专家架构,以幽默叛逆风格和 X 平台实时知识接入为特色。在 MMLU 达 73.0%,GSM8K 达 62.9%,HumanEval 达 63.2%,MATH 达 23.9%。

314B MoExAI首代大模型X平台实时知识

查看模型变体与证据

MMLU 73.0%
2023-09-27 Mistral AI·国际

Mistral 7B

参数7B上下文8K tokens模态文本

欧洲 AI 领军企业 Mistral 开山之作,开创性采用分组查询注意力(GQA)与滑动窗口注意力(SWA),以仅 7B 参数在所有基准上全面击败 Llama 2 13B,MMLU 达 60.1%,GSM8K 达 52.2%,HumanEval 达 30.5%。

分组查询注意力GQA滑动窗口SWA7B越级标杆

查看模型变体与证据

MMLU 60.1%
2023-07-18 Meta / Llama·国际

Llama 2 70B

参数70B上下文4K tokens模态文本

Meta 首个允许免费商业化使用的开源大模型家族,预训练 token 达 2T,深度融合 RLHF(PPO + 拒绝采样)对齐策略,70B 版本的 MMLU 达 68.9%,GSM8K 56.8%,成为工业界落地应用最广泛的开源标杆。

商用开源深度RLHF对齐全球工业基准

查看模型变体与证据

MMLU 68.9%
2023-05-10 Google DeepMind / Gemini·国际

PaLM 2

参数未公开上下文8K tokens模态文本·代码·多语言

Google I/O 2023 发布的重磅基座大模型,强化了多语言、数学逻辑与代码生成能力,MMLU 达 81.2%,GSM8K 达 80.7%,MATH 达 34.3%,HumanEval 达 50.0%,全面驱动初代 Google Bard。

Google基座大模型强多语言能力Google IO 2023

查看模型变体与证据

MMLU 81.2%
2023-02-24 Meta / Llama·国际

LLaMA-65B

参数65B上下文2K tokens模态文本

Meta 开源大模型奠基之作,证明了在海量 token(1.4T)上充分预训练的 65B 模型可以在 MMLU(63.4%)、GSM8K(50.9%)等诸多任务上媲美甚至战胜 175B 的 GPT-3,开启了全球开源大模型繁荣时代。

开源奠基之作Chinchilla扩展法则验证全球生态基石

查看模型变体与证据

MMLU 63.4%
2022
2022-11-30 OpenAI·国际

ChatGPT (GPT-3.5)

参数175B (估计值,基于 InstructGPT 架构)上下文4K tokens模态文本

OpenAI 划时代对话大模型,基于 GPT-3.5 谱系(InstructGPT)经人类反馈强化学习(RLHF)微调,开启生成式人工智能爆发奇点。在后续 GPT-4 技术报告中披露基线水准:MMLU 70.0%、GSM8K 57.1%、HumanEval 48.1%、MATH 34.1%。

对话RLHF对齐人类偏好微调基准原点大模型爆发奇点

查看模型变体与证据

MMLU 70.0%

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。