MiMo-V2.5-Pro
MiMo-V2.5-Pro 是小米万亿级参数旗舰混合专家大模型,总参数 1.02T,激活 42B,支持 100 万 token 上下文。评测全面对标国际前沿:MMLU 89.4、GSM8K 99.6、MATH 86.2、SWE-bench Verified 78.9%、C-Eval 91.5、BBH 88.4。
段落阅读+数值推理(计数/排序/算术)
读一段文字做数值推理(数数/排序/算术)。
F1 + EM
共收录 6 场模型发布(收录 8 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
MiMo-V2.5-Pro 是小米万亿级参数旗舰混合专家大模型,总参数 1.02T,激活 42B,支持 100 万 token 上下文。评测全面对标国际前沿:MMLU 89.4、GSM8K 99.6、MATH 86.2、SWE-bench Verified 78.9%、C-Eval 91.5、BBH 88.4。
本发布含 4 个变体,各变体规格见模型详情。
腾讯混元以「细粒度 MoE、80B 总参/13B 激活」开源 A13B 系列,Instruct 为指令版(256K 上下文,/think 与 /no_think 双模式,默认慢思考)。已收录 21 项 Instruct 表评测覆盖知识、数学、代码与 Agent 工具调用:亮点 AIME24 87.3、GPQA Diamond 71.2。
腾讯混元-T1 正式版定位为业内首个超大规模混合 Mamba 推理模型(TurboS 混合 Transformer-Mamba MoE 底座,96.7% 后训练算力用于强化学习)。已收录 14 项评测覆盖知识、数学、代码与中文能力:亮点 MMLU-Pro 87.2、AIME24 78.2。
Anthropic 旗舰中杯模型,在代码生成、多步复杂推理与视觉理解上全面超越上一代 Opus 与同代旗舰,是智能体与工程编程的行业标杆。
OpenAI 划时代多模态旗舰大语言模型,首次在大规模复杂推理、代码生成与人类专业考试(如统一律师资格考试、GRE、生物奥赛等)中达到人类顶尖水平,为现代大语言模型评估奠定了黄金标准。
OpenAI 划时代对话大模型,基于 GPT-3.5 谱系(InstructGPT)经人类反馈强化学习(RLHF)微调,开启生成式人工智能爆发奇点。在后续 GPT-4 技术报告中披露基线水准:MMLU 70.0%、GSM8K 57.1%、HumanEval 48.1%、MATH 34.1%。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。