第 0 部分:术语速查(建议先读)
第 1 部分:建立框架认知 —— 评估的历史、问题域与方法版图
第 2 部分:方法论与标准流程 —— 每个环节的工程细节
- 044. 标准评估流程:数据集 → 推理 → 评分 → 报告
- 055. LLM-as-Judge 工程化:从判官 prompt 到偏差控制
- 066. 人类评估设计:招募、盲评与一致性工程
- 077. 元评估:怎么知道你的评估是对的
第 3 部分:厂商发布评测全景 —— 按维度深度拆解典型框架
- 088. 解读厂商报告:看懂发布会上的每一个数字
- 099. 学科知识基准:MMLU 与它的继任者们
- 1010. 数学与逻辑推理基准:难度阶梯与报法战争
- 1111. 代码能力基准:从函数补全到仓库修复
- 1212. 多模态评估基准
- 1313. 硬核新兴评测:当 AI 被扔进真实环境
- 1414. 长上下文、事实性与安全:三类可靠性评测
- 1515. 行业垂直评测:医疗、法律、金融、电商
- 1616. 持续更新评测:当题库本身成为流水线
- 1717. 人类偏好评估:MT-Bench、LLM-as-Judge 与 Chatbot Arena
- 1818. 第三方排行榜:生态地图与交叉验证
第 4 部分:评估框架实战 —— 从使用到自建
- 1919. 评估框架全景图:用设计哲学选对你的工具
- 2020. 用 Node.js 自建 Mini Evaluator:从 30 行到四层评估流水线
- 2121. RAG / Agent / 应用层评估:评估你自己建的系统
- 2222. 红队与安全评估:在用户发现漏洞之前先发现它
- 2323. 我的应用需要评估什么:业务目标 → 能力 → 指标
- 2424. 构建测试集:四来源混合、数据飞轮与版本锁定
- 2525. 评估流水线工程:四层接入 CI/CD
- 2626. 在线评估与 A/B 实验:从分流到显著性
- 2727. 案例研究(一):客服 RAG 从 0 到上线的 90 天评估剧本
- 2828. 案例研究(二):代码 Agent 的三层评估落地
- 2929. 案例研究(三):拍照解题 App 的多模态评估
- 3030. 资源速查:按场景查基准、框架与公式
- 3131. 结课自测与 FAQ