Qwen3-235B-A22B / Qwen3-30B-A3B / Qwen3-32B / Qwen3-4B / Qwen3-14B / Qwen3-8B / Qwen3-1.7B / Qwen3-0.6B
本发布含 8 个变体,各变体规格见模型详情。
Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。
从 Arena 真实难题中抽 500 道,LLM judge 离线复现
从 Arena 真实难题抽 500 道,离线用裁判复现 Arena 排名。
测什么:从 Arena 真实难题中抽 500 道,LLM judge 离线复现
不测什么:不能证明中文长文业务任务的整体质量;需用自己的文体、长度和事实要求复核。
语言与文体:当前账本未完整披露语言和文体分布
指标与单位:见逐条记录,未披露项不能比较 / 以原始来源为准
可比性:当前没有完整、同快照的可比协议与可靠归一化边界,仅展示原始证据。
说明日期:2026-08-28;具体分数的协议、来源等级和核对日期以每条发布记录为准。
进入写作需求选型GPT-4 judge + 风格控制
共收录 3 场模型发布(收录 4 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
本发布含 8 个变体,各变体规格见模型详情。
Qwen3 以「Think Deeper, Act Faster」发布,Qwen3-235B-A22B 为混合思考 MoE 旗舰。评测覆盖推理、编码与多语言,亮点如 ArenaHard 95.6%、AIME'24 85.7%。
腾讯混元-T1 正式版定位为业内首个超大规模混合 Mamba 推理模型(TurboS 混合 Transformer-Mamba MoE 底座,96.7% 后训练算力用于强化学习)。已收录 14 项评测覆盖知识、数学、代码与中文能力:亮点 MMLU-Pro 87.2、AIME24 78.2。
本发布含 5 个变体,各变体规格见模型详情。
Qwen2.5 发布文以「A Party of Foundation Models」呈现全家族,72B-Instruct 为其中最大开源指令模型(稠密解码器,18T 预训练 tokens)。已收录 14 项评测覆盖知识、数学、代码与对齐:亮点 GSM8K 95.8、MMLU-Pro 71.1。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。