← 模型目录

ChatGPT (GPT-3.5)

OpenAI · 2022-11-30 · 类别未确认

官方发布来源 · 按需求选型 · 查看覆盖缺口

ChatGPT (GPT-3.5)

OpenAI 划时代对话大模型,基于 GPT-3.5 谱系(InstructGPT)经人类反馈强化学习(RLHF)微调,开启生成式人工智能爆发奇点。在后续 GPT-4 技术报告中披露基线水准:MMLU 70.0%、GSM8K 57.1%、HumanEval 48.1%、MATH 34.1%。

输入模态
文本
上下文
4K tokens
参数
175B (估计值,基于 InstructGPT 架构)
价格(每百万 tokens)
无此口径报价;不等于免费

本变体的评测证据

mmlu 70.0% 模型 chatgpt · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "5-shot"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源

gsm8k 57.1% 模型 chatgpt · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "5-shot"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源

math 34.1% 模型 chatgpt · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "4-shot"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源

humaneval 48.1% 模型 chatgpt · 版本 未说明 · 指标 pass@1 · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "0-shot"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源

drop 64.3% 模型 chatgpt · 版本 未说明 · 指标 f1 · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "3-shot F1"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源

hellaswag 85.5% 模型 chatgpt · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "10-shot"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源

arc-challenge 85.2% 模型 chatgpt · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "25-shot"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源

winogrande 81.6% 模型 chatgpt · 版本 未说明 · 指标 accuracy · 单位 % 来源等级 A · vendor_reported · 核对日期 2026-09-12 · 距快照 22 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{
  "harness": "5-shot"
}

来源:GPT-4 Technical Report (arXiv:2303.08774) Table 2

打开官方来源