AIME 2024

美国数学邀请赛 30 题,奥赛级推理试金石

基本信息

类别
推理与数学
官网 / 数据集
https://huggingface.co/datasets/HuggingFaceH4/aime_2024
论文
https://artofproblemsolving.com/wiki/index.php/2024_AIME

30 秒看懂

奥赛级数学,30 题。注意报法:pass@1 是“一次做对”,cons@64 是“做 64 次投票”——同一模型分数能差一倍,看分数必须先看报法。

采用格局:推理模型发布几乎必报(9/11 家)——共识榜

评分协议

报法差异大:pass@1 / cons@64(多数投票)/ pass@64——同模型分数可差 3 倍

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 15 场模型发布(收录 24 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-03-19 Xiaomi / 小米·国内

MiMo-V2.5-Pro

参数1.02T-A42B上下文1M模态文本·代码·多模态

MiMo-V2.5-Pro 是小米万亿级参数旗舰混合专家大模型,总参数 1.02T,激活 42B,支持 100 万 token 上下文。评测全面对标国际前沿:MMLU 89.4、GSM8K 99.6、MATH 86.2、SWE-bench Verified 78.9%、C-Eval 91.5、BBH 88.4。

万亿 MoE1M 上下文SWE-bench 高分全场景智能代理

查看模型变体与证据

AIME 2024 37.3
2025
2025-07-11 Moonshot AI / Kimi·国内

Kimi-K2-Instruct / Kimi-K2-Base

本发布含 2 个变体,各变体规格见模型详情。

Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。

开源权重1T MoE非思考 reflex 档Agentic

查看模型变体与证据

Kimi-K2-Instruct · AIME 2024 69.6
2025-06-27 Tencent / 腾讯混元·国内

Hunyuan-A13B-Instruct / Hunyuan-A13B-Pretrain / Hunyuan-A13B-Instruct-FP8 / Hunyuan-A13B-Instruct-GPTQ-Int4

本发布含 4 个变体,各变体规格见模型详情。

腾讯混元以「细粒度 MoE、80B 总参/13B 激活」开源 A13B 系列,Instruct 为指令版(256K 上下文,/think 与 /no_think 双模式,默认慢思考)。已收录 21 项 Instruct 表评测覆盖知识、数学、代码与 Agent 工具调用:亮点 AIME24 87.3、GPQA Diamond 71.2。

开源权重细粒度 MoE256K 长上下文快慢思考双模式

查看模型变体与证据

Hunyuan-A13B-Instruct · AIME 2024 87.3Hunyuan-A13B-Instruct-FP8 · AIME 2024 86.7Hunyuan-A13B-Instruct-GPTQ-Int4 · AIME 2024 86.7
2025-06-16 MiniMax·国内

MiniMax abab 6.5

参数千亿 MoE上下文245K tokens模态文本

MiniMax 稀疏混合专家大语言模型,支持 245K 超长上下文窗口与万级汉字复杂指令遵循。

千亿稀疏MoE245K超长上下文复杂指令遵循自研线性注意力

查看模型变体与证据

AIME 2024 图表尚无可读数值
2025-04-30 Xiaomi / 小米·国内

MiMo-7B-RL

参数7B上下文32K模态文本

MiMo-7B-RL 是小米开源的 7B 强化学习对齐大模型,在 MMLU 达到 70.3 分,MATH-500 71.2 分,GSM8K 87.8 分,显著强化长思维链与代码数学逻辑能力。

开源权重强化学习对齐高性价比推理数学与代码增强

查看模型变体与证据

AIME 2024 26.7
2025-04-29 Alibaba / Qwen·国内

Qwen3-235B-A22B / Qwen3-30B-A3B / Qwen3-32B / Qwen3-4B / Qwen3-14B / Qwen3-8B / Qwen3-1.7B / Qwen3-0.6B

本发布含 8 个变体,各变体规格见模型详情。

Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。

开源权重混合思考推理多语言

查看模型变体与证据

Qwen3-235B-A22B · 2024 85.7Qwen3-30B-A3B · 2024 80.4
2025-04-17 ByteDance Seed / 豆包·国内

豆包 Pro

参数未公开上下文128K tokens价格$0.8/$2 每百万 tokens模态文本

字节跳动火山引擎主力通用大模型,具备高性价比、低延迟响应与出色的中文上下文理解能力。

火山引擎主力超高并发支持中文综合能力极低推理成本

查看模型变体与证据

AIME 2024 图表尚无可读数值
2025-04-16 OpenAI·国际

OpenAI o3 / OpenAI o4-mini

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 o3 定位为其最强推理模型,在编码、数学、科学与视觉感知等领域推进前沿,并支持以图思考(Thinking with images)。该发布已收录评测覆盖数学、编程竞赛、科学推理、软件工程与智能体工具使用等领域,AIME 2025 配 Python 工具 pass@1 98.4%、100% consensus@8。

推理旗舰以图思考智能体工具使用

查看模型变体与证据

OpenAI o3 · AIME 2024 91.6OpenAI o4-mini · AIME 2024 93.4o1 · AIME 2024 74.3o3-mini · AIME 2024 87.3
2025-03-25 Google DeepMind / Gemini·国际

Gemini 2.5 Pro

上下文1M模态文本·图像·音频·视频

谷歌将 Gemini 2.5 Pro 实验版定位为其最智能的 AI 模型与 2.5 系列首个思维(thinking)模型,原生多模态并配备 1M token 上下文窗口(200 万即将推出)。已收录评测覆盖推理、代码、长上下文与多模态理解等领域,HLE 无工具 18.8%、SWE-bench Verified 63.8%。

思维模型原生多模态1M 上下文实验版首发

查看模型变体与证据

single attempt (pass@1) 92.0% (single attempt, pass@1)
2025-03-21 Tencent / 腾讯混元·国内

Hunyuan T1 (混元-T1 正式版)

模态文本

腾讯混元-T1 正式版定位为业内首个超大规模混合 Mamba 推理模型(TurboS 混合 Transformer-Mamba MoE 底座,96.7% 后训练算力用于强化学习)。已收录 14 项评测覆盖知识、数学、代码与中文能力:亮点 MMLU-Pro 87.2、AIME24 78.2。

混合 Mamba 架构强化学习驱动推理模型开源权重

查看模型变体与证据

AIME 2024 78.2
2025-02-19 xAI / Grok·国际

Grok 3 / Grok 3 mini

本发布含 2 个变体,各变体规格见模型详情。

Grok 3 被 xAI 定位为开启『推理代理时代』的 Beta 模型,主打 (Think) 深度推理配置并曾以代号 chocolate 登顶 LMArena。评测覆盖推理、编码、多模态理解与长上下文 RAG:AIME'25 93.3%、GPQA 84.6%、LCB 79.4%、Chatbot Arena 1402 Elo、LOFT(128k)83.3%。

推理增强Beta

查看模型变体与证据

Grok 3 mini · AIME 2024 95.8%Grok 3 · non-reasoning 52.2%Grok 3 · Think chart 93.3%Grok 3 mini · AIME 2024 39.7%
2025-01-20 DeepSeek·国内

DeepSeek-R1

参数671B (37B active)上下文128K tokens价格$0.55/$2.19 每百万 tokens模态文本

深度求索开源的纯强化学习驱动推理大模型,开创性采用大规模强化学习与多阶段冷启动蒸馏技术,在数学竞赛、代码工程与复杂推理任务上达到与 OpenAI o1 相当的前沿水准。

纯RL强化学习自主长思维链开源推理范式蒸馏全系列小模型

查看模型变体与证据

AIME 2024 79.8%
2025-01-20 Moonshot AI / Kimi·国内

Kimi k1.5

参数未公开上下文128K tokens模态文本·图像

月之暗面面向深度推理的长思维链强化学习大模型,在数学奥林匹克、复杂编程与视觉长程推理任务上展现出突破性表现。

强化学习深度推理长思维链思考数学竞赛突破图文多模态推理

查看模型变体与证据

AIME 2024 图表尚无可读数值
2024
2024-09-12 OpenAI·国际

OpenAI o1

参数未公开上下文128K tokens价格$15/$60 每百万 tokens模态文本·图像

OpenAI 首款强化学习驱动思维链(Chain of Thought)推理模型,在科学、编程与数学竞争性基准测试中展现出突破性的深度思考能力。

强化学习驱动推理思维链竞赛级数学与代码慢思考范式

查看模型变体与证据

AIME 2024 44.6
2023
2023-12-06 Google DeepMind / Gemini·国际

Gemini 1.0 Ultra

参数未公开上下文32K tokens模态文本·图像·音频·视频

Google DeepMind 原生多模态大模型开篇之作,其中 Gemini 1.0 Ultra 成为全球首个在 MMLU 基准上超越人类专家的前沿大模型。

原生跨模态超越人类专家多模态推理Ultra旗舰

查看模型变体与证据

AIME 2024 图表尚无可读数值

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。