← 模型目录PaLM 2
Google DeepMind / Gemini · 2023-05-10 · 类别未确认
官方发布来源 · 按需求选型 · 查看覆盖缺口
PaLM 2
Google I/O 2023 发布的重磅基座大模型,强化了多语言、数学逻辑与代码生成能力,MMLU 达 81.2%,GSM8K 达 80.7%,MATH 达 34.3%,HumanEval 达 50.0%,全面驱动初代 Google Bard。
- 输入模态
- 文本 / 代码 / 多语言
- 上下文
- 8K tokens
- 参数
- 未公开
- 价格(每百万 tokens)
- 无此口径报价;不等于免费
本变体的评测证据
mmlu 81.2%
模型 palm-2 · 版本 未说明 · 指标 accuracy · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{
"harness": "5-shot"
}技术报告 Table 4 PaLM 2 得分
打开官方来源
gsm8k 80.7%
模型 palm-2 · 版本 未说明 · 指标 accuracy · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{
"harness": "8-shot"
}技术报告 Table 7 PaLM 2 得分
打开官方来源
math 34.3%
模型 palm-2 · 版本 未说明 · 指标 accuracy · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{
"harness": "4-shot"
}技术报告 Table 7 PaLM 2 得分
打开官方来源
humaneval 50.0%
模型 palm-2 · 版本 未说明 · 指标 pass@1 · 单位 %
来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
未提供原文定位
{
"harness": "0-shot"
}技术报告 Table 9 PaLM 2 得分
打开官方来源