15. 行业垂直评测:医疗、法律、金融、电商

如果只读一节:读 11.8 的决策表与 11.3.3 的合规边界。垂直评测的全部结论可以压缩成一句话:公开考试类基准能证明"模型懂这个行业",永远不能证明"模型能在这个行业上岗"——从前者到后者隔着真实任务分布、专家评审与法律责任三道门,而这三道门里没有一道是基准分数能替你关上的。

15.1 本章目标与读者

前置知识:读完第 9 章(拆解模板)与第 12 章 8.9(按场景选基准)。本章延续同一个模板,但每个评测多回答一个问题:它离"上岗可用"还差几步

读完后你能:

15.2 概念引入:考试分数与岗位胜任力是两个构念

第 9 章 MMLU 的分数能推出"知识面广",因为四选题本身就是知识面的操作化定义。但把同样的逻辑搬到垂直行业,推断链就断了:

MMLU 90% → 知识面广                (推断成立)
MedQA 90% → 医学知识面广           (推断基本成立)
MedQA 90% → 能辅助临床决策         (推断不成立——差着三道门)

前端类比:LeetCode 高分候选人不等于能独立负责一个五年历史的电商前端系统。算法题考"能不能解题",岗位考"能不能在约束下交付"——面试官不会只让你刷题,因为两者是不同的构念。

三道门分别是什么:

  1. 任务分布门:考试题是"结构化好的问题 + 唯一正确答案",真实工作是"含糊的主诉 + 多种可能 + 需要追问";
  2. 专家评审门:考试成绩是客观对错,工作产出质量需要专家按 rubric 评——Med-PaLM 2 论文专门做了这一步(见 11.3.3);
  3. 责任门:错一道选择题扣分,错一个临床建议、一份合同条款、一笔投资建议是事故。责任主体决定了 AI 能站到流程的哪一段。

一个垂直评测项目的数据结构,比通用基准多出三个必填字段——没有它们,分数无法转化为业务决策:

// vertical-eval.ts —— 垂直评测的必需字段(对比第 12 章 8.2 的通用结构)
interface VerticalSample {
  id: string;
  question: string;
  answer: string;
  domain: "medical" | "legal" | "finance" | "ecommerce";
  sourceType: "exam" | "real_case" | "expert_authored"; // 关键 1:题目来源层级
  reviewedBy?: string;                                  // 关键 2:专家审核人
  asOfDate: string;                                     // 关键 3:知识与法规的时间戳
  riskTier: "low" | "medium" | "high";                  // 错误的业务后果分级
}
// 没有这三个字段,你只能得到一个"看起来像能力"的数字。

15.3 医疗:MedQA 与 PubMedQA

15.3.1 MedQA 深拆

15.3.2 PubMedQA:文献理解

15.3.3 合规边界:考试通过为什么不能行医

Med-PaLM 2 论文补上了本书反复强调的那一步——让医师按临床标准给长文本回答打分,而不是只看选择题分数:在长文本健康问答的医师评估中,Med-PaLM 2 的回答好评率约 92.6%,已接近临床医师的 92.9%(来源:arXiv:2305.09617)。

即便如此,它仍不能上岗,原因都在评测框架之外:

  1. 责任主体:临床决策的法律责任由执业医师承担;AI 的输出没有署名担责的资格。美国按医疗器械(SaMD)路径监管临床决策软件,中国对应药品监管部门对辅助诊断软件的分类管理——具体类别取决于厂商宣称的用途;
  2. 数据合规:训练与评测用真实病历受 HIPAA(美)与个保法/医疗数据管理规定(中)约束,公开评测集因此只能是"考试题",与真实工作负载脱节——这是医疗评测永远到不了"上岗级"的结构性原因;
  3. 风险不对称:诊断建议错误的代价不是"回答错误"而是"医疗事故"。同一个准确率水平,在闲聊产品里可接受,在这里不可接受。

给工程师的落点:如果你的产品涉及健康信息,评测清单里除了分数,必须有:免责与边界提示是否触发(用户问"我是不是得了癌"时)、高危问题是否转人工、以及一层医师抽检 rubric。工具与方法见第 22 章(安全评估)与第 24 章(自建评测集)。

15.4 法律:LegalBench 的 162 个小任务

为什么"162 个小任务"值得抄:它是"岗位胜任力"的操作化——把"AI 会不会做法律"这个无法回答的问题,拆成 162 个能回答的问题。你为自己的业务设计评测时,用同样的方法拆(第 23 章 22.x 的任务分解方法)。

合规边界:执业法律服务的主体资格受各国律师制度约束(美国为 Unauthorized Practice of Law 规则,中国为律师法框架);面向公众的法律 AI 产品必须明示"不构成法律意见"。评测层面,这意味着"免责与转介触发"是必测项,与 11.3.3 同构。

15.5 金融:FinBen 与 FinEval

金融是垂直评测里结构最分裂的:一半是"考试知识",一半是"表格与数值"。两个基准正好各占一半。

FinBen(英文,学术向):

FinEval(中文,考试向):

金融评测的特有陷阱

  1. 数值容差:金融计算对舍入规则极敏感,评测协议必须写死精度(小数位、货币单位、百分比 vs 小数);
  2. 时效与版本:会计准则、监管口径(如披露规则)会变,评测集必须带 11.2 的 asOfDate
  3. 合规红线:投资建议的输出责任受证券监管约束(适当性管理、投顾牌照)。任何评测分数都不能支撑"AI 独立做投资决策"——这一条的优先级高于一切分数。

15.6 电商:EcomInstruct 与领域事实更新

15.7 垂直评测的共同困境:三难三角

四个行业看下来,困境是同构的。三个约束互相挤压,构成一个不可兼得的三角:

flowchart TB
    P["数据隐私<br/>患者病历 / 客户合同 / 交易数据<br/>合规限制采集与流通"]
    C["专家成本<br/>医师 / 律师 / 精算师时薪高<br/>标注与评审都贵"]
    F["更新时效<br/>法规 / 指南 / 准则 / 平台规则<br/>持续变化,题库易过期"]
    P -->|"隐私越严,越只能用<br/>公开考试题 → 离真实负载越远"| F
    C -->|"专家越贵,越难做<br/>滚动更新 → 题库越旧"| F
    P -->|"可用数据越少,越依赖<br/>专家造题 → 成本越高"| C

三个推论,直接决定你的评测策略:

  1. 公开垂直基准的天花板是"考试级"——隐私约束决定了它们拿不到真实工作负载数据,因此分数到顶也只是"懂行"的证据;
  2. 专家预算应该花在"评审"而不是"出题"上——出题可以半自动(从真实案例脱敏改造),评审必须真人专家(Med-PaLM 2 的医师评审、LegalBench 的从业者贡献都是这个模式);
  3. 时效问题用滚动更新解决,不用更大的静态集解决——把题库做成带 asOfDate 的流水线(第 16 章三步法),比一次性扩题量有用得多。

15.8 决策表:高风险行业 = AI 辅助 + 人类把关

行业关键约束对应公开评测AI 能承接必须留给人额外必测项
医疗患者安全、SaMD/HIPAA 类监管、数据合规MedQA、PubMedQA文献检索与摘要、病历结构化、患者教育文案诊断、处方、病情告知、风险沟通高危问题识别与转介触发、医师抽检 rubric
法律执业资格(UPL 类规则)、责任承担LegalBench(分任务看)条款分类、文书初稿、案例检索法律意见出具、签字、策略决策免责提示触发、引证真实性核验(防编造判例)
金融适当性管理、投顾牌照、审计留痕FinBen(子任务)、FinEval信息抽取、研报摘要、报表核对投资建议、授信决定、合规签字数值精度协议、知识时间戳、拒答策略
电商客户体验、品牌、平台规则EcomInstruct 类商品文案、客服首轮应答、评论聚类价格与库存承诺、纠纷终审、公关响应领域事实滚动更新、裁判偏差监控
教育未成年人保护、教学效果学科类基准 + 自建讲解、出题、批改辅助升学建议、心理相关话题分层讲解质量评审、内容安全

金科玉律:高风险行业 = AI 辅助 + 人类把关。评测的作用是把"辅助"与"把关"的边界从直觉变成可测量的清单——最后一列(额外必测项)比分数列更重要。

15.9 实战与陷阱:为你的行业搭一个最小垂直评测

五步法(总预算控制在两周内):

1. 选 30-50 个真实任务样本(从工单/咨询记录脱敏,覆盖高中低风险各一档)
2. 请一位领域专家把每个样本改写成"有标准答案或评分 rubric 的题"
3. 每题打 riskTier 标签 + asOfDate(用 11.2 的数据结构)
4. 跑 3 个候选模型,高风险题失败直接一票否决
5. 每月滚动补 5-10 道新题,旧题按时间分层对比(防知识过期假象)

最小判分器(高风险题一票否决逻辑):

// vertical-grader.ts —— 垂直评测的最小判分:分层 + 一票否决
// 运行命令:npx tsx vertical-grader.ts(无外部依赖,需联网调用模型的版本见注释)

interface GradeResult { overall: number; highRiskPass: boolean; blocked: string[] }

function gradeVertical(samples: VerticalSample[], answers: Map<string, string>): GradeResult {
  const correct = samples.filter(s => answers.get(s.id) === s.answer);
  const overall = correct.length / samples.length;

  const blocked: string[] = [];
  for (const s of samples.filter(s => s.riskTier === "high")) {
    if (answers.get(s.id) !== s.answer) blocked.push(s.id); // 高风险题答错 → 记入否决名单
  }
  return { overall, highRiskPass: blocked.length === 0, blocked };
}

// 期望输出:overall 是给管理层的数字;blocked 是给评审会的一票否决名单。
// 两者必须分开呈现——平均分好看、高危题答错,结论只能是"不可上线"。

三个陷阱:

  1. 只看总分,不看风险分层——overall 88% 但高危题错了 2 道,产品结论应该是"不能上",这个信息会被平均分吞掉;
  2. 用真实患者/客户数据直接建评测集——评测数据同样受数据合规约束,脱敏与授权流程要在建集之前走完;
  3. 跳过专家评审直接用公开基准分数汇报——"MedQA 90%"在医疗产品立项会上没有证据力,医师评审记录才有。

15.10 章节汇总

行业基准任务形态判分离上岗的距离
医疗MedQAUSMLE 风格多选,约 6.1 万题精确匹配考试级;隔着任务分布/专家评审/责任三道门
医疗PubMedQA文献摘要三分类精确匹配(含 maybe)文献级;可用作弊路径多
法律LegalBench162 个小任务逐任务准确率岗位分项级;看切片不看总分
金融FinBen文本+数值任务谱混合子任务级;预测类解释要谨慎
金融FinEval34 学科考试,约 4,600 题四选一考试级
电商EcomInstruct 类真实平台指令任务LLM 裁判/人工最接近上岗;时效是主要风险

(厂商采用记录:四个行业的公开垂直基准在抓取的 13 家旗舰发布正文中均未出现,来源:vendor-blog-evals.md 覆盖矩阵。垂直评测由垂直厂商与行业采购方主导,而非通用模型厂商。)

15.11 验收自测

  1. 选择:LegalBench 用 162 个小任务而不是一张大考卷,最主要的好处是?
  • A. 评分更快
  • B. 能得到分任务的能力画像,贴合真实法律工作的分工
  • C. 题目更难
  • D. 避免数据污染
  1. 选择:MedQA 分数很高但医疗产品仍不能让 AI 直接给诊断,评测框架之外的原因是?
  • A. 题目太简单
  • B. 责任主体、数据合规与风险不对称——这三道门在基准分数之外
  • C. 模型不会说中文
  • D. MedQA 不是英文考试
  1. 选择:金融垂直评测最容易被忽视的协议细节是?
  • A. 模型温度
  • B. 数值精度与舍入规则、知识时间戳
  • C. few-shot 数量
  • D. 提示词长度
  1. 简答:为什么公开垂直基准(MedQA/LegalBench)都停留在"考试级",到不了"真实工作负载级"?用三难三角解释。
  1. 简答:电商是四个行业里最接近"AI 直接上岗"的,从错误代价的角度解释为什么,并指出它自己的主要风险。
  1. 实操:按 11.9 的五步法为你的业务域建一个 30 题的最小评测,用 11.2 的数据结构落盘,跑三个模型后输出"overall + 高风险否决名单"两张表。

15.12 📋 本章 Cheat Sheet

概念一句话详见
三道门任务分布 → 专家评审 → 责任承担,分数到不了最后一级§15.2
MedQAUSMLE 风格多选,GPT-4/Med-PaLM 2 均约 86%§15.3.1
PubMedQA文献三分类,maybe 是合法答案§15.3.2
医师评审Med-PaLM 2 好评率 92.6% vs 医师 92.9%,仍不能上岗§15.3.3
LegalBench162 个小任务,看切片不看总分§15.4
FinBen / FinEval任务谱 vs 学科考试,金融的两半§15.5
EcomInstruct最接近上岗,但领域事实每周过期§15.6
三难三角隐私 / 专家成本 / 时效,互相挤压不可兼得§15.7
一票否决高风险题答错,总分再高也不能上线§15.9

15.13 ⚠️ 5 个常见错误

  1. 拿 MMLU 或 MedQA 分数向业务方证明"AI 能胜任" — 考试分数只覆盖三道门中的第一道;立项汇报需要的是分风险层级的实测与专家评审记录。
  2. 只看垂直评测总分 — LegalBench 的价值在任务级切片,金融的价值在子任务;总分掩盖的恰恰是你要知道的短板分布。
  3. 用未脱敏的真实行业数据直接建评测集 — 医疗与金融数据的采集、存储、使用都有合规流程,评测集不是法外之地。
  4. 静态垂直评测集用过半年 — 法规、指南、商品知识过期后,分数的下降会被误判为"模型退化";给每道题加 asOfDate 并滚动更新。
  5. 高风险题和普通题混在一个平均分里 — 一票否决逻辑必须独立于总分呈现,否则"88% 但高危题错了"会被读成"可以上线"。

15.14 延伸阅读

⭐⭐⭐

⭐⭐