← 模型目录

Grok-2

xAI / Grok · 2024-08-14 · 类别未确认

官方发布来源 · 按需求选型 · 查看覆盖缺口

Grok-2

xAI 第二代推理旗舰,在 LMSYS Chatbot Arena 盲测榜上一跃进入全球前三,在指令遵循、学术测试及多模态图像理解与生成上全面逼近 Claude 3.5 Sonnet 与 GPT-4o。GPQA 达 56.0%,MATH 达 76.1%,HumanEval 达 88.4%,MMLU 达 87.5%。

输入模态
文本 / 多模态
上下文
128K tokens
参数
未公开
价格(每百万 tokens)
无此口径报价;不等于免费

本变体的评测证据

mmlu 87.5% 模型 grok-2 · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{}

官方博客公布 Grok-2 MMLU 得分

打开官方来源

gpqa 56.0% 模型 grok-2 · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{}

官方博客公布 Grok-2 GPQA 得分

打开官方来源

math 76.1% 模型 grok-2 · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{}

官方博客公布 Grok-2 MATH 得分

打开官方来源

humaneval 88.4% 模型 grok-2 · 版本 未说明 · 指标 pass@1 · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{}

官方博客公布 Grok-2 HumanEval 得分

打开官方来源