← 模型目录Grok-2
xAI / Grok · 2024-08-14 · 类别未确认
官方发布来源 · 按需求选型 · 查看覆盖缺口
Grok-2
xAI 第二代推理旗舰,在 LMSYS Chatbot Arena 盲测榜上一跃进入全球前三,在指令遵循、学术测试及多模态图像理解与生成上全面逼近 Claude 3.5 Sonnet 与 GPT-4o。GPQA 达 56.0%,MATH 达 76.1%,HumanEval 达 88.4%,MMLU 达 87.5%。
- 输入模态
- 文本 / 多模态
- 上下文
- 128K tokens
- 参数
- 未公开
- 价格(每百万 tokens)
- 无此口径报价;不等于免费
本变体的评测证据
mmlu 87.5%
模型 grok-2 · 版本 未说明 · 指标 accuracy · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{}官方博客公布 Grok-2 MMLU 得分
打开官方来源
gpqa 56.0%
模型 grok-2 · 版本 未说明 · 指标 accuracy · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{}官方博客公布 Grok-2 GPQA 得分
打开官方来源
math 76.1%
模型 grok-2 · 版本 未说明 · 指标 accuracy · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{}官方博客公布 Grok-2 MATH 得分
打开官方来源
humaneval 88.4%
模型 grok-2 · 版本 未说明 · 指标 pass@1 · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{}官方博客公布 Grok-2 HumanEval 得分
打开官方来源