HealthBench

OpenAI 出品的健康对话基准:5000 段多轮对话,262 名医生编写的 48,562 条 rubric 细则评分

基本信息

类别
安全与事实
官网 / 数据集
https://openai.com/index/healthbench/
论文
https://arxiv.org/abs/2505.08775

30 秒看懂

论文口径:GPT-3.5 Turbo 16 分 → GPT-4o 32 分 → o3 60 分;Hard 档当前最高约 32 分——健康场景仍有大量提升空间。

采用格局:证据账本中 7 次引用;医疗垂域与安全叙事的双料锚点

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 7 场模型发布(收录 22 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-21 xAI / Grok·国际

Grok 4.7

参数2.1T上下文500K价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·代码·图像

xAI 发布的最新旗舰编码与知识工作模型,基于 2.1T 参数底座与长程强化学习,在 CursorBench 4.0 (46.3%)、DeepSWE v1.1 (71.0%) 与 Terminal-Bench 4.0 (38.0%) 等多小时自主长程任务上展现出更强的自我检验与 500K 上下文管理能力。

2.1T 参数500K 上下文长程自主任务强化自我检验

查看模型变体与证据

Professional 56.7%
2026-08-26 OpenAI·国际

GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。

旗舰多档努力智能体安全防护

查看模型变体与证据

GPT-5.6 Sol · Professional 60.5%GPT-5.6 Terra · Professional 57.7%GPT-5.6 Luna · Professional 55.7%gpt-5-5 · Professional 49.5%claude-fable-5 · Professional 60.9%claude-opus-4-8 · Professional 53%
2026-08-03 Alibaba / Qwen·国内

Qwen3.8-Max

参数2.4T(激活 95B)模态文本·图像·视频

通义将 Qwen3.8-Max 定位为当前 Qwen 家族最强大的模型,基于 Qwen 3.5 架构将参数规模扩展至 2.4 万亿(激活参数 95B),在编程、办公、科研与长周期任务上全面提升,并成为首个开源权重的 Qwen-Max 级模型(权重于下周发布)。已收录评测覆盖智能体编码与办公、多模态理解与操作、视频理解及长上下文等领域,Terminal-Bench 2.1 86.6、PaperBench 93。

开源权重(预告)多模态智能体长周期任务编程与办公

查看模型变体与证据

HealthBench 60.2
2026-07-24 Anthropic·国际

Claude Opus 5

模态文本·图像

Anthropic 发布 Claude Opus 5,effort 分档 high/xhigh/max 并提供 Fast 模式;页面数值多为图表与对比性表述(含大量内部评测)。已收录 18 项评测覆盖前沿编码、Agent 操作与法律/健康/生物专业域:亮点 DeepSWE v1.1 68.8、BrowseComp 90.8。

旗舰effort 分档Fast 模式编码与 Agent

查看模型变体与证据

Professional 59.8
2026-06-09 Anthropic·国际

Claude Fable 5 / Claude Mythos 5

本发布含 2 个变体,各变体规格见模型详情。

Anthropic 以「Claude Fable 5 与 Claude Mythos 5」联合公告发布 Fable 5:一款带安全护栏的 Mythos 级模型,在网络安全/生物化学/蒸馏话题上按分类器回退到 Opus 4.8(影响 <5% 会话)。评测覆盖智能体编码、知识工作、计算机使用与生物安全,亮点如 SWE-Bench Pro 80.3%、OSWorld-Verified 85.0%。

前沿旗舰安全护栏智能体编码多模态

查看模型变体与证据

Claude Fable 5 · Professional (starred) 66.0
2025
2025-11-06 Moonshot AI / Kimi·国内

Kimi K2 Thinking

上下文256K模态文本

月之暗面将 Kimi K2 Thinking 定位为思考型智能体(thinking agent),通过同时扩展思考 token 与工具调用步数推进测试时扩展前沿,可跨数百步规划、推理、执行与调整,全部评测结果以 INT4 QAT 精度报告。已收录评测覆盖通用推理、数学、智能体检索、编码与终端等领域,HLE 带工具 44.9(Heavy Mode 51.0)、SWE-bench Verified 71.3。

思考型智能体INT4 QAT开源权重工具调用扩展

查看模型变体与证据

no tools 58.0
2025-08-07 OpenAI·国际

GPT-5 / GPT-5 Pro

本发布含 2 个变体,各变体规格见模型详情。

GPT-5 是 OpenAI 的统一思考模型,发布文称其在 AIME 2025(无工具 94.6%)、SWE-bench Verified 74.9%、HealthBench Hard 46.2% 等刷新 SOTA,并大幅降低事实错误与谄媚率。评测覆盖竞赛数学、编码、指令跟随与代理、多模态与健康:GPQA Diamond 88.4%、MMMU 84.2%、BrowseComp 54.9%。

思考模型多模态代理工具调用幻觉抑制

查看模型变体与证据

GPT-5 · HealthBench 67.2o3 · HealthBench 59.8GPT-5 · Hard 46.2o3 · Hard 31.6GPT-5 · HealthBench 54.3gpt-4o · HealthBench 32gpt-4o · Hard 0GPT-5 · Hard Hallucinations 1.6GPT-5 · Hard Hallucinations 3.6o3 · Hard Hallucinations 12.9gpt-4o · Hard Hallucinations 15.8

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。