MMMLU
OpenAI 用专业人工译者把 MMLU 测试集译成 14 种语言(含简体中文)的多语种知识基准
基本信息
30 秒看懂
OpenAI 用专业人工译者把 MMLU 测试集译成 14 语种,4 选项准确率(随机基线 25%);国内厂商引用的「多语言/中文能力」常指其 ZH_CN 子集,读分前先确认具体语种口径。
采用格局:证据账本中 7 次引用;国内厂商的『多语言/中文能力』引用常指向其 ZH_CN 子集
评分协议
这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。
可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。
模型发布采用时间轴
共收录 11 场模型发布(收录 15 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
2026
2026-08-26
Alibaba / Qwen·国内
本发布含 2 个变体,各变体规格见模型详情。
Qwen3.8-Flash-Next 被发布文定位为迈向极致性价比的全新架构预览(GDN+QSA 混合注意力、N-gram Embedding、Muon 优化器),为 Qwen4 架构探路。评测覆盖代理编码/办公、多模态代理与通用推理:SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、AndroidWorld 84.5。
MoE 稀疏激活原生 256K 上下文多模态架构预览
查看模型变体与证据
Qwen3.8-Flash-Next-Base · Base model 84.86
2026-05
Alibaba / Qwen·国内
上下文1M模态文本
发布文以“智能体新前沿”为题,将 Qwen3.7-Max 定位为面向智能体时代的新一代旗舰(经阿里云百炼 API 提供,在 Claude Code/OpenClaw/Qwen Code 间泛化)。40 余项评测覆盖智能体编码、工具与办公场景及数理推理,亮点为 HMMT 2026 二月场 97.1 与 SWE-bench Verified 80.4。
旗舰智能体跨框架泛化
查看模型变体与证据
MMMLU 90.3
2026-04-16
Anthropic·国际
本发布含 2 个变体,各变体规格见模型详情。
Anthropic 将 Claude Opus 4.7 定位为在高级软件工程上较 Opus 4.6 显著提升、最难任务上增益尤为明显的旗舰模型,同时大幅增强视觉分辨率;这也是首个按 Project Glasswing 分级防护方案发布的模型。已收录评测覆盖智能体编码与终端、长上下文检索、计算机操作、网络安全与多学科推理等领域,SWE-bench Verified 87.6、GPQA Diamond 94.2。
智能体编码高分辨率视觉推理档位控制分级网络安全防护
查看模型变体与证据
Claude Opus 4.7 · MMMLU 91.5
2026-04-02
Google DeepMind / Gemini·国际
本发布含 4 个变体,各变体规格见模型详情。
面向本地运行的开放权重模型,支持推理与工具调用;本变体输入能力和上下文按官方发布页记录。
开放权重本地运行
查看模型变体与证据
Gemma 4 31B Dense · MMMLU 88.4%Gemma 4 26B MoE · MMMLU 86.3%Gemma 4 E4B · MMMLU 76.6%Gemma 4 E2B · MMMLU 67.4%
2026-02-19
Google DeepMind / Gemini·国际
上下文1M模态文本·图像
Google 将 Gemini 3.1 Pro 定位为「为最复杂任务打造的更聪明模型」,基于 Gemini 3 Pro,发布时为 preview(thinking 档 low/medium/high)。已收录 19 项评测横跨推理、代码、多模态与长上下文:亮点 GPQA 94.3%、SWE-bench Verified 80.6%。
旗舰1M 长上下文多模态Preview
查看模型变体与证据
MMMLU 92.6%
2026-02-05
Anthropic·国际
上下文1M(beta)价格$10/$37.5 每百万 tokens · 发布文给出的 premium 1M 上下文(beta)档定价;标准档定价发布文未给出模态文本·图像
Claude Opus 4.6 是 Anthropic 的旗舰模型,引入多档推理努力(low/medium/high/max)、自适应思考、上下文压缩与 1M 上下文 beta。评测覆盖代理编码/工具/搜索、法律与多语言问答:SWE-bench Verified 80.8、GPQA Diamond 91.3、ARC-AGI-2 68.8、BrowseComp 84.0。
长上下文推理努力分级代理工具调用多模态
查看模型变体与证据
MMMLU 91.1
2025
2025-12-17
Google DeepMind / Gemini·国际
上下文1M价格$0.5/$3 每百万 tokens模态文本·图像·视频
Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。
速度优先多模态1M 长上下文编码与 Agent
查看模型变体与证据
MMMLU 91.8%
2025-11-18
Google DeepMind / Gemini·国际
本发布含 2 个变体,各变体规格见模型详情。
Gemini 3 发布以「智能新纪元」为题呈现,Gemini 3 Pro 为旗舰型号(发布时 preview)。已收录评测横跨推理、代码、多模态与 Agent:亮点 LMArena 1501 Elo、AIME 2025(带代码执行)100%。
旗舰多模态1M 长上下文Agent
查看模型变体与证据
Gemini 3 Pro · MMMLU 91.8%
2025-10-15
Anthropic·国际
价格$1/$5 每百万 tokens模态文本·图像
发布文将其定位为小而快的轻量档模型,编码性能接近 Sonnet 4 而成本仅约三分之一、速度快一倍以上,计算机使用能力超过 Sonnet 4。11 项评测覆盖智能体编码、工具调用、计算机使用与数学推理,亮点为 AIME 2025(带 Python 工具)96.3% 与 τ2-bench Telecom 83.0%。
轻量高速编码计算机使用扩展思考
查看模型变体与证据
MMMLU 83.0
2025-09-29
Anthropic·国际
价格$3/$15 每百万 tokens · 与 Sonnet 4 同价模态文本·图像
Anthropic 发布 Claude Sonnet 4.5,作为面向编码、智能体与计算机使用场景的 Sonnet 新代,并同步推出 Claude Agent SDK。评测集中在编码与智能体领域,亮点如 SWE-bench Verified 77.2%(并行测试期计算 82.0%)、τ2-bench Telecom 98.0%。
编码智能体计算机使用推理
查看模型变体与证据
MMMLU 89.1
2025-05-22
Anthropic·国际
本发布含 2 个变体,各变体规格见模型详情。
Claude 4 发布中 Opus 4 为最强编码档,采用混合模式(近即时回答 + 扩展思考,扩展思考可与工具调用结合,beta)。已收录 22 项评测覆盖软件工程、终端、知识与 Agent:亮点 SWE-bench Verified 72.5%(并行测试时计算 79.4%)。
旗舰编码扩展思考工具调用融合
查看模型变体与证据
Claude Opus 4 · MMMLU 88.8Claude Sonnet 4 · MMMLU 86.5
数据缺口(本页暂未收录)
- 评测版本与子集(例如部分评测有 Diamond、Verified 等官方变体)以及数据集规模
- 各厂商使用的执行框架(harness / scaffold)与 Agent 工具配置
- 推理档位(reasoning effort)、采样参数(temperature / top-p)、运行次数与分数聚合方式
- 指标对应的随机猜测基线(chance baseline)与人类基线的实验条件
- 测试集污染检测结论,以及是否已饱和的结构化标注
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
复现入口
引用
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。