openai-factuality

由发布引用自动生成

这个评测在官方模型发布中被引用了 1 场发布(共 2 项分值)(来自OpenAI)。本页由这些发布引用自动生成:逐条列出每次引用的分数、协议与原文链接;完整的评测定义、数据集与指标介绍仍在补全,缺失的信息不会编造。

下面每张「发布」卡片记录了主流模型在该基准上的官方实测得分、评测协议与模型核心能力介绍。

模型发布引用时间轴

共收录 1 场模型发布(收录 2 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-22 OpenAI·国际

GPT-6 Sol / GPT-6 Luna

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 将 GPT-6 Sol 定位为日常复杂高价值任务的旗舰级高性价比工作马,以 GPT-5.6 Sol 一半的价格提供接近 Astra 的智能;收录评测覆盖企业自动化、软件工程、计算机操作与专业考试,AutomationBench 达 33.2%、DeepSWE 达 68.8%。

高性价比工作马长程自主代理软件工程GUI计算机操作

查看模型变体与证据

GPT-6 Sol · ChatGPT flagged error conversations 4.5%GPT-6 Luna · ChatGPT flagged error conversations 7.6%

来源

发现本页数据问题?欢迎在 GitHub 提 Issue。