31. 结课自测与 FAQ

如果只读一节:8 道场景题检验你是不是"真的会做",22 个 FAQ 处理落地时最容易卡住的疑问。所有参考答案都折叠了——先自己作答,再展开对照;直接看答案等于没测。Web 版答案可点击展开,电子书与 Markdown 用同一种原生折叠标签。

前置知识:全书。第 27-29 章的案例会被场景题直接引用。

31.1 本章目标与使用方法

读完全书想验收 → 做 31.2 的 8 道场景题;落地时卡住 → 按关键词查 31.3 的 FAQ;带团队读书 → 把 31.2 当工作坊题,每人先写答案再对照讨论。场景题的判定标准是能不能产出题目要求的交付物——一段话术、一张指标表、一段可运行代码、一份路线图。做不出交付物的"懂",在需求评审会上不值钱。

31.2 结课自测:8 道场景题

每题 5 分,建议总用时 90 分钟,先作答再展开。

题目 1(概念表达):产品经理在评审会上问:"我们花两周建评估,到底是在干什么?"用 30 秒说清楚,要求包含一个前端类比和一个反面案例。

查看参考答案

评估 = 用固定的题目 + 固定的规则,反复给模型打分。前端类比:单测 + 性能预算 + 灰度监控三件套,只是被测对象每次可能返回不同答案(第 1 章 1.7)。反面案例:没有评估时,换模型、改 prompt 全靠"看几个例子感觉不错"——GSM1k 实验证明模型可能在旧基准上靠记忆得分(来源:arXiv:2405.00332),"感觉"在评估缺席时是系统性失真的。

题目 2(客服 RAG):你的 AI 客服下周灰度上线。给出上线前必须通过的质量门禁:至少 5 个指标、各自目标值与检查层(PR 门禁 / 夜间全量 / 发版安全集 / 在线采样),并说明哪个指标走 0 容忍。

查看参考答案

按第 27 章 27.4 与 27.7:faithfulness ≥ 0.95(判官,夜间全量 + 发版);answer relevancy ≥ 0.90(判官);检索召回 ≥ 0.90(金标文档命中);超纲拒答正确率 ≥ 0.90(确定性);会话解决率 ≥ 0.75(判官 + 人工抽检)。合规红线走发版安全集全量 + 在线 100% 确定性扫描,0 容忍——0 容忍的事不交给采样判官(第 20 章 17.6.2)。加分项:判官上岗前与人工一致率 ci95 下界 ≥ 0.8(第 7 章)。

题目 3(代码 Agent):团队给 VS Code 插件接入了新模型,只有一周和约 50 美元预算验证"能不能替换现有模型"。给出三层评估的最小可行方案:每层用什么数据、多少条、多少人力、产出什么读数。

查看参考答案

自动层:自建 50-200 题 TS 集跑 pass 率,成本数美元(第 28 章 28.4)。业务层:挑 5 个已修复 Issue 造 SWE-bench 风格内测集,先 golden patch 自检再测两模型,约 10-20 美元(28.6)。人工层:两模型各采 30 条建议,3 名工程师四维 rubric 盲评,约 3 小时(28.7)。决策规则:自动层不倒退 3 个百分点 + 内测集不倒退 + 人工层均分不降才切换。最大风险不是预算,是内测集没做自检就出结论。

题目 4(多模态归因):拍照解题 App 端到端正确率从 0.81 掉到 0.74。分层数据:识别层字符 F1 保持 0.96,公式等价率保持 0.92,解题 pass@1 从 0.85 掉到 0.77。给出归因结论和前三个排查动作。

查看参考答案

识别与公式层达标、推理层下滑 → 按第 29 章 29.3 归因表,问题在解题推理层。排查:① 查变更清单(推理 prompt、模型版本、温度/max tokens);② 拉错题明细按题型聚类,确认是否某一题型塌方;③ 若解题判分也换了判官,先跑判官金标准集排除评估链路漂移——指标骤降而其他层无感,先怀疑评估自己(第 27 章 27.9)。禁止:基于一个聚合数字直接改 prompt。

题目 5(编码):写一个不超过 40 行的 TypeScript 评估器,测"模型能否正确计算阶乘",要求符合第 1 章 1.7 的规范(密钥处理、运行方式、评分归一化),并说明为什么不能直接用 includes() 判对。

查看参考答案
// factorial-eval.ts —— 评估"模型能否正确计算阶乘"
// 运行:npx tsx factorial-eval.ts   (需联网 + API 费用,5 次调用成本可忽略)
// 前提:npm install openai;export OPENAI_API_KEY=sk-你的密钥
import OpenAI from "openai";

// SDK 默认读取 process.env.OPENAI_API_KEY;显式校验,报错更友好(第 1 章 1.7)
if (!process.env.OPENAI_API_KEY) {
  throw new Error("请先设置环境变量 OPENAI_API_KEY");
}
const openai = new OpenAI();

const tasks = [
  { input: "5 的阶乘是多少?", expected: 120 },
  { input: "10 的阶乘是多少?", expected: 3628800 },
  { input: "0 的阶乘是多少?", expected: 1 },
];

// 归一化评分:提取输出里全部数字(兼容千分位逗号),取最后一个与真值比对
function extractNumbers(s: string): number[] {
  return [...s.matchAll(/\d[\d,]*/g)].map(m => Number(m[0].replace(/,/g, "")));
}

let correct = 0;
for (const t of tasks) {
  const r = await openai.chat.completions.create({
    model: "gpt-4o-mini",   // 占位模型名:替换为你账号可用的 snapshot
    temperature: 0,          // 评估必须可复现
    messages: [{ role: "user", content: t.input }],
  });
  const output = r.choices[0].message.content ?? "";
  const nums = extractNumbers(output);
  const hit = nums.length > 0 && nums[nums.length - 1] === t.expected;
  if (hit) correct++;
  console.log(`Q: ${t.input} → A: ${output.trim()} | ${hit ? "✓" : "✗"}`);
}
console.log(`Accuracy: ${((correct / tasks.length) * 100).toFixed(1)}%`);

不能用 includes():输出"120 的因数有……"会误判为对,"约 3,628,800"带千分位会误判为错——归一化(提取数字、去标点)是评分正确性的前提(第 1 章 1.7"exactMatch 太脆")。另外 3 道题只能算冒烟,少于 100 题的分数不要用于决策(第 3 章样本量)。

题目 6(选型):公司要在 A、B、C 三个模型里给客服 RAG 选一个。给出完整选型评估计划:基准层怎么缩圈、自建层怎么决策、灰度怎么收尾,以及"基准分最高但自建分最低"时怎么判。

查看参考答案

① 拆能力:检索/忠实度/拒答/延迟/成本五维(第 27 章 27.4.1);② 基准缩圈:知识 MMLU-Pro、事实 SimpleQA、中文 C-Eval,配第 8 章五问法核口径;③ 自建决策:500 题四来源测试集,按能力维度分桶报告(带 Wilson 区间);④ 灰度收尾:按第 27 章 27.8 四档灰度,档位有进入与回滚条件。"基准分最高但自建分最低"时以自建分为准——基准是"厂商声称 + 通用分布"的双重代理,与业务分布脱节是常态(第 1 章 1.9 陷阱 4)。

题目 7(事故应急):周一早上,在线 faithfulness(1% 采样)从 0.94 掉到 0.62,差评率不变、转人工率不变。写出:最可能的三个根因假设、当天止血动作、下周前的长期防线。

查看参考答案

三个假设按概率排(第 27 章 27.9 根因树):① 评估链路漂移——判官 snapshot 被静默更换或 prompt 被改;② 被测系统变更——周末发布改了生成 prompt 或检索参数;③ 数据管道变更——知识库重建改了分块/索引(最易漏登记的"隐性发版")。止血:先跑判官金标准集 50 条,一致率破线就暂停采信在线判分并回滚判官配置;判官正常则回滚周末全部变更(含数据管道),重跑 500 题全量确认恢复。长期防线:金标准集每日 cron;数据管道变更进审批清单;告警带失败样本明细(第 20 章 17.7.2)。

题目 8(综合路线图):你加入一个没有评估体系的 5 人 AI 产品团队。给出 90 天评估路线图:四个里程碑、各自的验收标准、人力与预算量级。

查看参考答案

M1(第 1 月)指标登记表 + 50 题核心集 + 判官校准,验收 = 一致率 ci95 下界 ≥ 0.8;M2(第 2 月)L1 PR 门禁 + L2 夜间全量,验收 = 门禁生效且每周误报 < 1 次;M3(第 3 月)L3 发版安全集 + 坏例回流通道,验收 = 能追溯一次"评估拦下坏版本";M4(第 3 月末)灰度剧本 + 值班手册,验收 = 每档有书面进入/回滚条件。人力约 0.5-1 名工程师 + 业务方每周 1-2 小时(标注与坏例确认)。预算量级:判官单次 0.01-0.10 美元(来源:Langfuse 文档自述),离线各层每月数美元到数十美元,L4 按 1% 采样另计。

31.3 FAQ:22 个常见疑问

Q1:评估分数达到多少算"好"?

查看参考答案

公开基准没有永恒分数线——它随时间通胀(HumanEval 已饱和,第 11 章 7.3)。判读三步:看相对位置(同代模型分差与排序)→ 看协议(第 8 章五问法)→ 回到自己的业务 hold-out 定线。业务目标值从失败代价倒推(第 23 章 22.5),"准确率 ≥ 90%"只是常见起点。

Q2:开源模型 vs 闭源模型怎么选?

查看参考答案

过五维:成本(自部署摊销 vs API 费)、隐私与数据边界、质量上限、运维能力、可定制性。经验方向:数据不能出境或需深度定制 → 开源;质量优先且无运维带宽 → 闭源 API。决定用你的自建集做,不用榜单(第 15、23 章)。

Q3:可以用 LLM Judge 评估自己家的模型吗?

查看参考答案

不推荐判官与被测同源——自增强偏差有实验数据(第 17 章 13.4)。对策:判官模型 ≠ 被测模型,且上岗前过人工校准(一致率 ≥ 80%,第 7 章)。退而求其次"同源判官 + 大规模人工抽查"也比没有评估好,但报告必须声明口径。

Q4:评估跑得很慢、很贵,怎么办?

查看参考答案

四招(第 20 章 17.8):缓存(键含 rubricVersion 与判官模型);模型分级(便宜判官全量筛 + 贴线贵判官复核);批处理(Batch API 价格减半);分层(PR 50 题 / 夜间 500 题 / 发版 100 题,别把全量塞进 PR)。并发必须有界——限流之下无限并发是静默丢数据,不是报错。

Q5:测试集要多大才够?

查看参考答案

按想检测的最小效应量估(第 3 章与 17.7.1 的经验法则,量级估算):5 个百分点的差异要数百条;稳到 ±2 个百分点要 2,000+ 条;判官校准至少 50 条人工标注。比规模更重要的是分桶覆盖(高频 + 边界 + 对抗)、时间切分防泄漏、版本化(第 24 章)。

Q6:人工评估每道题要几个人?

查看参考答案

每题 ≥ 3 人独立盲评;一致性用 Cohen's Kappa(第 6 章 19.3),≥ 0.7 高度一致,低于 0.4 先修 rubric 再评。评分员要先培训 + 试评,统一对分档的理解。

Q7:开源评估框架怎么选?

查看参考答案

按被测物选(第 19 章决策树、第 30 章 30.3 速查):学术基准 lm-eval-harness;中文 OpenCompass;多模态 VLMEvalKit;RAG 指标 RAGAS / DeepEval;Agent 沙箱 Inspect AI 或自建;红队 Garak / PyRIT;TS 起步 Promptfoo / Evalite / Langfuse。三条判据:函数还是轨迹、陪不陪生产、数据能否出境。

Q8:两次评估结果不一致,先查什么?

查看参考答案

按可复现性清单查(第 4 章 3.7):温度是否 0、prompt 是否逐字一致、模型 snapshot、数据集版本、判官版本。都没变仍不一致 → 看 Wilson 区间,重叠即按噪声处理,扩样本而不是重跑碰运气(第 20 章 17.7.1)。

Q9:模型 MMLU 很高,用户就是不满意,为什么?

查看参考答案

MMLU 测"记住了吗",不测会话体验(第 9 章)。补三类读数:偏好(Arena / MT-Bench,第 17 章)、任务(业务 hold-out)、体验(在线 CSAT 与差评率,第 26 章)。通用知识与业务分布脱节是常态,这正是自建集存在的理由。

Q10:怎么测模型"幻觉"?

查看参考答案

分两层:模型层事实性 TruthfulQA / SimpleQA(第 14 章 10.4);应用层 grounding 用 RAGAS faithfulness / FACTS Grounding(第 21 章);多模态幻觉用 POPE / HallusionBench(第 12 章 8.6)。业务上最有效的往往是超纲拒答率——故意问知识库里没有的事(第 27 章 27.5)。

Q11:多语言能力怎么测?

查看参考答案

中文知识 C-Eval / CMMLU,跨语言推理 MGSM,翻译 Flores-200。落地时按语言拆子集、拆阈值、拆告警(第 29 章 29.8)——混合统计会把长尾语言的窟窿平均掉。

Q12:怎么选 embedding 模型?

查看参考答案

MTEB 榜缩圈,但必须用自己的检索集复测:100 条真实查询 + 金标文档算 recall@k——embedding 在中文/垂直域的表现与英文通用榜可能严重脱节(第 21 章检索层视角)。

Q13:什么时候需要统计显著性检验?

查看参考答案

先看区间:pass 率都应带 Wilson 区间(第 20 章 17.7.1)。经验法则:差异远大于区间半宽 → 不必检验;同量级 → 配对检验或扩样本;小于半宽 → 按噪声处理,禁止下结论。在线 A/B 的检验见第 26 章 25.6。

Q14:Agent 能力怎么测?

查看参考答案

三层(第 21 章 20.5 + 第 14 章 10.6):单步工具调用 BFCL;多步任务 AgentBench / GAIA / τ-bench;真实工程 SWE-bench。产品落地加第四层:自建轨迹评估——必需工具、参数 schema、步数预算三个确定性判官先上全量(第 3 章 4.6.4)。

Q15:怎么参与 LMArena(原 LMSYS Arena)?

查看参考答案

用户侧 lmarena.ai 直接匿名投票;厂商侧经官方渠道提交 API。读榜时带 style control 两种口径与置信区间(第 17 章 13.5)。

Q16:评估结果要不要对外公开?

查看参考答案

分对象:方法论与外部对比建议公开(可复现可审计);业务分布与自建集细节保密(防污染防逆向);学术产出必须公开协议与数据来源(第 4 章 3.7)。对内全量透明——评估数据不透明的地方会长出政治。

Q17:判官用什么模型?

查看参考答案

三原则(第 5 章):能力天花板——判官判分不足时评的是噪声(第 17 章 13.4.4),判官至少不弱于被测;异源——与被测不同家,防自增强;分级——便宜判官全量筛 + 强判官复核贴线样本(第 20 章 17.8)。最省钱的姿势:客观判分走规则,开放生成才走判官;判官配置版本化,改一次跑一次金标准集。

Q18:预算很有限,第一个月先建什么?

查看参考答案

最小闭环三件套(第 23 章 22.7):50 题核心集(高频 + 超纲拒答)+ 确定性判分优先的脚本 + 一个真实生效的决策点(PR 门禁或发版检查二选一)。第一优先级是"评估真的挡住过一次错误决策"——一个被拦下的坏版本,比 5,000 题没人看的测试集更能建立信用。判官、在线采样、红队都往后排。

Q19:怎么说服老板投入评估?

查看参考答案

一页纸三笔账:事故账(一次编造政策的事故成本 vs 评估月成本,判官单次 0.01-0.10 美元量级,来源:Langfuse 文档自述);迭代账(换模型从"手感讨论一周"变成"一次 run 两小时出结论");承诺账(对外宣称准确率需要可复现证据链,否则是合规风险)。最有效的辅助:先花两天做 50 题门禁,用一次"拦住坏版本"的真实事件说话。

Q20:评估团队要多大?

查看参考答案

没有可靠行业统计(未能查证),给工程量级:起步期 0.5-1 名工程师覆盖 50 题集 + 门禁 + 周报(第 27 章 90 天剧本按此估算);成熟期趋向"每周半天复盘 + 坏例归因"。真正的大头是业务方配合标注的时间,要写进路线图。

Q21:这本书的局限是什么?

查看参考答案

四条边界:① 时间快照——分数与链接抓取时间多为 2026-08-28,基准生命周期短(第 1 章 1.2),用前核时效;② 案例是合成剧本——第 27-29 章公司与数字为教学构造,方法论可迁移,数字不可引用;③ 深度取舍——训练侧评估、视频理解评估、Agent 长程任务只有入门覆盖;④ 语言偏差——一手资料以英文为主,重要结论回原文复核。

Q22:未来评估的趋势是什么?

查看参考答案

五个方向(第 9、12 章证据为主):静态 → 持续更新(LiveBench 路线);单分数 → 多维并列(HELM 路线);离线 → 离线 + 在线一体(四层流水线);人类评 → 判官 + 人类校准混合;通用 → 垂直行业基准(第 15 章)。不变的是倒推链与"评估必须接进决策"。

31.4 下一步学习路径

第 1 周(跑通基础):装 lm-eval-harness 跑 MMLU 与 GSM8K 各一次,读懂口径与样本量;用第 1 章 1.7 的 30 行脚本自建一个 10 题业务小集。

第 2-4 周(自建评估):选一个业务场景拆能力(第 23 章)→ 造 100-200 题测试集(第 24 章)→ 接判官并校准一致率(第 18、26 章)→ 挂进 CI(第 25 章)。

第 2-3 月(完整流水线):补齐 L1-L4 四层(第 20 章 17.6)→ 接在线采样与坏例回流 → 做第一次灰度发布(第 27 章 27.8 模板)。

第 4-6 月(进阶):RAG / Agent 专项评估(第 21 章 + Inspect AI)→ 红队常态化(第 22 章)→ 元评估季度化(第 7 章)。

持续:新基准(第 16 章)、厂商报告口径(第 8 章)、榜单对账(第 18 章)。

31.5 推荐学习资源

入门:本书第 0、1、2、4、3 章;Designing ML Evaluation Systems(Chip Huyen)lm-evaluation-harness

进阶:第 30 章 L0/L1 论文清单;Anthropic Engineering BlogOpenAI Cookbook

高级:NeurIPS / ICML / ICLR 评测方向论文;第 30 章 L2 厂商技术报告(练五问法)。

31.6 关键金句

  1. 评估 = 单元测试 + E2E + 性能基准,但被测对象是概率性的
  2. 业务目标 → 能力 → 指标 → 测试集(倒推链)
  3. 阈值从失败代价倒推,不从论文抄
  4. 判官上岗要考试:与人类一致率 ≥ 80%
  5. 判官四偏差:位置 / 冗长 / 自增强 / 能力天花板
  6. 四层流水线:PR 50 题 / 夜间 500 题 / 发版 0 容忍 / 在线采样
  7. 四来源测试集:公开 20% + 人工 30% + 回流 30% + 合成 20%
  8. 分层归因优先于端到端分数
  9. 没有 CI 的评估 = 不会被使用的评估
  10. 评估是投影:投影越贴近业务,越有用

31.7 验收自测(终极 3 问)

不写代码、不查资料,口头回答:

  1. 用 30 秒向老板解释评估的价值(Q19 的三笔账你会算吗)。
  2. 写下你下周一要在自己业务上跑的第一个评估(数据、判分、决策点三要素齐全)。
  3. 从本书挑一章讲给同事——讲不清的那章就是你还没真懂的那章。

31.8 本章 Cheat Sheet

概念一句话详见
8 道场景题以交付物检验掌握度§41.2
22 问 FAQ落地疑问速查(答案可折叠)§41.3
学习路径1 周 → 1 月 → 3 月 → 6 月§41.4
终极 3 问向老板讲价值 / 下周一的行动 / 讲一章§41.7
金句 10 条全书压缩§41.6

31.9 5 个常见错误

  1. 做一遍自测就过——错题不复盘等于没做;每道错题写一句"我原来以为 X,实际是 Y"。
  2. 把 FAQ 当标准答案——FAQ 是常见场景的常见解法,你的业务要按第 23 章方法论重新倒推。
  3. 学习路径跳章——跳过基础直接上红队或 Agent 评估,会在判分协议上摔跤。
  4. 只读中文资料——一手基准论文与厂商报告以英文为主,关键结论必须回原文核对(第 8 章)。
  5. 学完不落地——知识的半衰期以周计;本周不跑第一个评估,一个月后本章只剩金句。

31.10 延伸阅读

⭐⭐⭐

⭐⭐


31.11 结语

评估是 AI 产品的质量门。没有评估 = 盲飞——这句话在第 1 章出现时是口号,现在它应该是一条你可以执行的流程。

下一步行动:

  1. 收藏本书:evals.zenheart.site
  2. 在你的项目里跑第一个评估(50 题即可)
  3. 三个月后回来重做 31.2 的 8 道题,对比两次答案的差距

评估不是终点,是起点。 — ZenHeart 2026