Kimi-K2-Instruct / Kimi-K2-Base
本发布含 2 个变体,各变体规格见模型详情。
Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。
每月换题的综合抗污染基准(数学/代码/推理/语言/数据网)
每月换新题的综合榜,从源头断绝“背题”。分数每月重算,看趋势比看单期有意义。
题目来自当月竞赛/新闻,时间戳防泄漏
共收录 3 场模型发布(收录 4 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
本发布含 2 个变体,各变体规格见模型详情。
Kimi K2 以「Open Agentic Intelligence」为定位发布,Kimi-K2-Instruct 为后训练的非思考(reflex-grade)MoE 模型(1T 总参/32B 激活)。已收录 32 项评测覆盖代码、数学、知识与 Agent 工具使用:亮点 SWE-bench Verified(Agentic Coding)65.8、MMLU 89.5。
本发布含 8 个变体,各变体规格见模型详情。
Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。
本发布含 5 个变体,各变体规格见模型详情。
Qwen2.5 发布文以「A Party of Foundation Models」呈现全家族,72B-Instruct 为其中最大开源指令模型(稠密解码器,18T 预训练 tokens)。已收录 14 项评测覆盖知识、数学、代码与对齐:亮点 GSM8K 95.8、MMLU-Pro 71.1。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。