MATH-500

MATH 精选 500 题,推理模型标准对比集

基本信息

类别
推理与数学
官网 / 数据集
https://huggingface.co/datasets/HuggingFaceH4/MATH-500
论文
https://arxiv.org/abs/2103.03874

30 秒看懂

高中竞赛数学 500 题。95+ 分只说明“教科书级数学题基本全对”,不说明能做原创数学。

采用格局:国产推理模型标配(6/11 家)

评分协议

0-shot CoT,boxed 答案抽取

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 8 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20

2025
2025-12-18 Xiaomi / 小米·国内

MiMo-V2-Flash

参数309B-A15B上下文128K模态文本

MiMo-V2-Flash 是小米自研开源的稀疏混合专家(MoE)超快大模型,总参数 309B,激活仅 15B,主打极速首词响应与高并发吞吐,面向端云协同与代理推理场景。

MoE 稀疏激活超低延迟端云协同高并发吞吐

查看模型变体与证据

MATH-500 79.4
2025-07-11 Moonshot AI / Kimi·国内

Kimi-K2-Instruct / Kimi-K2-Base

本发布含 2 个变体,各变体规格见模型详情。

Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。

开源权重1T MoE非思考 reflex 档Agentic

查看模型变体与证据

Kimi-K2-Instruct · MATH-500 97.4
2025-06-16 MiniMax·国内

MiniMax abab 6.5

参数千亿 MoE上下文245K tokens模态文本

MiniMax 稀疏混合专家大语言模型,支持 245K 超长上下文窗口与万级汉字复杂指令遵循。

千亿稀疏MoE245K超长上下文复杂指令遵循自研线性注意力

查看模型变体与证据

MATH-500 图表尚无可读数值
2025-04-30 Xiaomi / 小米·国内

MiMo-7B-RL

参数7B上下文32K模态文本

MiMo-7B-RL 是小米开源的 7B 强化学习对齐大模型,在 MMLU 达到 70.3 分,MATH-500 71.2 分,GSM8K 87.8 分,显著强化长思维链与代码数学逻辑能力。

开源权重强化学习对齐高性价比推理数学与代码增强

查看模型变体与证据

MATH-500 71.2
2025-04-05 Meta / Llama·国际

Llama 4 Maverick / Llama 4 Scout / Llama 4 Behemoth

本发布含 3 个变体,各变体规格见模型详情。

发布文称 Maverick 为 Llama 4 herd 中的主力多模态模型(17B 激活、128 专家、400B 总参,MoE 架构)。评测覆盖多模态理解、知识、代码与克丘亚语翻译,亮点为 DocVQA 94.4 与 ChartQA 90.0(LMArena Elo 1417 归属于实验性聊天版本)。

开源权重MoE多模态

查看模型变体与证据

Llama 4 Behemoth · MATH-500 95.0
2025-03-21 Tencent / 腾讯混元·国内

Hunyuan T1 (混元-T1 正式版)

模态文本

腾讯混元-T1 正式版定位为业内首个超大规模混合 Mamba 推理模型(TurboS 混合 Transformer-Mamba MoE 底座,96.7% 后训练算力用于强化学习)。已收录 14 项评测覆盖知识、数学、代码与中文能力:亮点 MMLU-Pro 87.2、AIME24 78.2。

混合 Mamba 架构强化学习驱动推理模型开源权重

查看模型变体与证据

MATH-500 96.2
2025-01-20 DeepSeek·国内

DeepSeek-R1

参数671B (37B active)上下文128K tokens价格$0.55/$2.19 每百万 tokens模态文本

深度求索开源的纯强化学习驱动推理大模型,开创性采用大规模强化学习与多阶段冷启动蒸馏技术,在数学竞赛、代码工程与复杂推理任务上达到与 OpenAI o1 相当的前沿水准。

纯RL强化学习自主长思维链开源推理范式蒸馏全系列小模型

查看模型变体与证据

MATH-500 97.3%
2025-01-20 Moonshot AI / Kimi·国内

Kimi k1.5

参数未公开上下文128K tokens模态文本·图像

月之暗面面向深度推理的长思维链强化学习大模型,在数学奥林匹克、复杂编程与视觉长程推理任务上展现出突破性表现。

强化学习深度推理长思维链思考数学竞赛突破图文多模态推理

查看模型变体与证据

MATH-500 图表尚无可读数值

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。