0. 前置:核心术语速查(请先读本章)

概览:全书 20 个高频评估术语工程字典与速查索引。核心节次:§0.3 核心术语(20 个)、§0.5 全书术语地图。

0.1 本章目标

读完后你能:

前置知识:无。本章是通读全书评测方法论的速查钥匙。

0.2 为什么先讲术语

在大模型工程化落地中,概念混淆是评测失真的最大源头:有人把“基准(Benchmark)”当成“任务(Task)”,把“生成温度(Temperature)”与“发散能力”粗暴等同,或者在读厂商报告时对“pass@1”与“cons@64”的协议断层毫无察觉。

本书的专业原则:每一个核心术语均从系统架构与度量科学(Measurement Science)视角给出严密定义,厘清其在评测流水线中的输入约束、计算逻辑与边界陷阱。

0.3 核心术语(20 个)

1. LLM(Large Language Model,大语言模型)

系统与评测定位:基于自回归或编码解码架构的参数化概率生成系统。评估的核心任务是度量其在不同提示、外部工具与协议约束下的条件概率输出质量,以及在多步推理中的任务完成确定性。

具体:一种基于 Transformer 架构、利用海量图文语料预训练并经历对齐调优,具备上下文理解、逻辑推演与指令遵循能力的深度神经网络系统。

代表:GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro、DeepSeek-V3、Qwen2.5、Llama 3.1。

详见:第 1 章(定义与心智)、第 3 章(能力版图)。

2. Token(标记 / 词元)

系统与评测定位:模型输入输出与自注意力计算的离散基本单元。在评测中,Token 既是上下文窗口预算(Context Budget)与有效注意力衰减的物理边界,也是度量推理吞吐率(Tokens/s)与部署经济学(API Cost/MTok)的结算基准。

具体:模型分词器(Tokenizer,如 Byte-Pair Encoding 或 SentencePiece)切分出的词元。通常 1 个英文单词对应 1-3 个 token,1 个汉字对应 1-2 个 token。

示例:

"Hello, world!" → ["Hello", ",", " world", "!"]
"你好世界" → ["你", "好", "世", "界"]

详见:第 1 章、第 4 章。

3. Prompt(提示词 / 输入序列)

系统与评测定位:激活模型特定注意力表征与生成轨迹的上下文先验。在评测工程中,Prompt 必须作为严格受控的测试协议输入,微小的格式差异(如结尾标点、空格、前缀系统角色设定)均会导致生成概率分布产生可测量的漂移。

具体:向模型提供的全部文本输入,涵盖任务指令、背景上下文、约束条件与少样本示例(Few-shot demonstrations)。

示例:

const prompt = "请把以下英文翻译成中文:'Hello, world!'";
const output = await llm.generate(prompt);

详见:第 2 章、第 4 章。

4. Prompt Template(提示模板)

系统与评测定位:结构化的提示词工厂契约。通过固化上下文框架与留出动态插槽,评测系统得以对大批量测试用例施加无偏、可控的统一评测协议。

具体:将静态指令逻辑与动态用例变量解耦的模板定义。

示例:

const PROMPT_TEMPLATE = (question: string, context: string) => `
基于以下参考资料回答问题。保持客观事实一致,若资料未提及请回答'未知'。
[参考资料]: ${context}
[用户问题]: ${question}
[回答要求]: 严格基于资料,禁止推测。
`;

详见:第 4 章、第 20 章。

5. Embedding(向量嵌入)

系统与评测定位:高维语义潜空间映射。将离散文本投射为固定维度的稠密实数向量(Dense Vector),使得文本相似度转化为余弦相似度或欧氏距离计算,是构建 RAG 语义检索评测的底层度量标尺。

具体:将词、句或文档转换为数值向量的数学变换,向量几何空间的临近程度反映语义特征的关联度。

示例:

"退款政策申请流程" → [0.12, 0.85, -0.34, ...]  (1536 维)
"如何申请退费"     → [0.15, 0.78, -0.28, ...]  (空间余弦相似度 = 0.94)
"宇宙大爆炸理论"   → [-0.45, 0.12, 0.89, ...] (空间余弦相似度 = 0.12)

详见:第 21 章、第 24 章。

6. RAG(Retrieval-Augmented Generation,检索增强生成)

系统与评测定位:非参数化外部知识增强架构。评测体系要求对其执行双重解耦评测:检索阶段评估召回精度(Context Precision / Recall),生成阶段评估事实保真度(Faithfulness / Answer Relevance)。

具体:在模型生成回答前,利用检索器(Retriever)在向量库或倒排索引库中动态召回权威文档片段,并将知识注入 Prompt 上下文以大幅抑制幻觉。

流程:

[用户查询] → [检索外挂知识库] → [多路重排与Top-K过滤] → [装配上下文Prompt] → [模型生成受控回答]

详见:第 21 章(RAG 评估指标)、第 27 章(实战案例)。

7. Chunk(文档分块)

系统与评测定位:文档切分的离散语义颗粒度。Chunk 的大小(Token Size)与重叠步长(Overlap)是检索召回率与上下文信噪比之间的核心权衡参数,直接影响 RAG 评测中的上下文精度。

具体:将长文本按固定长度或语义段落划分的文本切片(通常 200-1000 tokens)。

详见:第 21 章、第 27 章。

8. Temperature(生成温度)

系统与评测定位:Logits 缩放超参数。控制 Softmax 概率分布的熵值:评测标准基准(如 MMLU/HumanEval)时必须强制温度设为 0 以消除随机采样带来的方差,确保评测的可复现性;而在多样性创新评测中则需固定温度与随机种子(Seed)并进行多轮重复抽样。

具体:数学公式为 P(w_i) = exp(z_i / T) / sum_j exp(z_j / T)。T -> 0 时退化为贪婪搜索(Greedy Search,取最高概率词);T 升高时分布平滑,长尾词被采样的概率增加。

详见:第 4 章、第 8 章。

9. Agent(自主智能体)

系统与评测定位:具备自主感知、状态维护、多步推理规划与环境工具交互的闭环执行系统。对 Agent 的评测超越了单轮文本判分,重点度量多轮轨迹(Trajectory)完成率、工具调度准确性与长程上下文自愈鲁棒性。

具体:以大模型为决策中枢,编排外部 API、代码解释器、终端环境或浏览器操作,自主分解并逐步执行复杂任务的软件系统。

详见:第 13 章、第 14 章、第 28 章。

10. Tool Use(工具调用 / Function Calling)

系统与评测定位:模型的结构化输出与外部系统交互契约。评测维度包括:工具识别召回率、参数 Schema 守卫合规率、幻觉参数防御能力以及错误响应后的自我修正率。

具体:模型遵循 JSON Schema 规范生成结构化调用参数,交由外部运行时执行后再将执行结果写回上下文。

详见:第 13 章、第 20 章、第 28 章。

11. Judge(评分器 / 判定模型)

系统与评测定位:评测管线中的裁决引擎。依据确定的准则(Rubric)或真实标签(Ground Truth),对模型输出执行严格判分。可以是基于规则的确定性匹配器,也可以是具备自然语言理解能力的判官。

具体:自动化打分程序或模型,输出布尔值、标量评分或结构化定性归因。

详见:第 4 章、第 5 章、第 20 章。

12. LLM-as-Judge(模型裁判)

系统与评测定位:以高阶前沿大模型替代人工标注的自动化语义评估方法。具备高吞吐、低边际成本优势,但在工程实施中必须建立针对位置偏差(Position Bias)、自偏好偏差(Self-enhancement Bias)与长度偏差(Verbosity Bias)的消偏护栏。

具体:利用 GPT-4、Claude 等高能力模型遵循精细 Rubric 对待测模型输出执行单答案评分(Single Answer Grading)或成对胜负判决(Pairwise Comparison)。

详见:第 5 章(单答案打分)、第 17 章(成对偏好)。

13. Benchmark(评测基准)

系统与评测定位:标准化测量标尺。完整的基准三要素为:标准化任务数据集(Dataset)、封闭严密的运行协议(Protocol/Harness)以及无歧义的评分度量函数(Metric)。

具体:针对特定认知或工程能力设计的标准化测试集合,用于衡量不同模型在该维度上的相对优劣。

示例:MMLU(通识多学科知识)、HumanEval / SWE-bench(代码修复与软件工程)。

详见:第 1 章、第 8-18 章。

14. Metric(度量指标)

系统与评测定位:评估目标的操作化数学映射。定义如何将模型实际响应与预期标准转化为具体数值标量,其选择决定了整个优化闭环的导向。

具体:常见的指标族包括 Exact Match(精确匹配)、F1-Score、Pass@k(执行通过率)、Elo / Bradley-Terry(相对天梯分)及 ECE(校准误差)。

详见:第 3 章、第 4 章、第 7 章。

15. Pass@k

系统与评测定位:代码生成与可验证推理领域的核心度量。表示在为每道题目采样 k 个候选解时,至少有 1 个解能通过完整单元测试套件的无偏概率估计。

具体:经典无偏估计公式为 pass@k = E[1 - C(n-c, k) / C(n, k)],其中 n 为生成总样本数,c 为通过测试的正确样本数。

详见:第 11 章。

16. Elo / Bradley-Terry 评分模型

系统与评测定位:基于概率图模型的相对技能估计系统。将无固定标准答案的开放式两两对战数据,转化为连续可比较的潜在能力值标量。

具体:若模型 A 的能力分值为 R_A,模型 B 为 R_B,则模型 A 战胜 B 的期望胜率为 P(A > B) = 1 / (1 + 10^((R_B - R_A) / 400))。

详见:第 17 章、第 18 章。

17. Context Window(上下文窗口)

系统与评测定位:模型自注意力机制能够进行直接前向关联的最大 Token 序列跨度。评测工程需警惕“标称窗口”与“有效检索窗口”的断层,严密排查注意力稀释(Needle-in-a-Haystack 衰减)现象。

具体:模型单次前向传播所能容纳的提示与生成 Token 之和(如 128k、200k、1M)。

详见:第 14 章。

18. Fine-tuning(参数微调)

系统与评测定位:参数化知识与行为模式的注入过程。评测必须设立“专用能力提升”与“通用能力衰减(灾难性遗忘)”的双边对账门禁。

具体:在已预训练的基础权重上,使用特定领域或任务语料通过反向传播调整部分或全量参数。

详见:第 8 章。

19. RLHF(基于人类反馈的强化学习)

系统与评测定位:大模型对齐(Alignment)阶段的核心方法。评测需重点检验奖励模型(Reward Model)的评分边界,防范策略模型为了“讨好”评测指标而产生“虚假冗长”或“谄媚性作答(Sycophancy)”等奖励黑客(Reward Hacking)现象。

具体:收集人类标注的成对偏好数据,拟合奖励模型,再使用 PPO(Proximal Policy Optimization)或 DPO(Direct Preference Optimization)优化语言模型策略。

详见:第 1 章、第 17 章。

20. Retrieval(信息检索)

系统与评测定位:非参数化知识供给链路。评测重点在于建立 Golden Query-Document 标注集,度量倒排搜索(BM25)或稠密向量搜索(Dense Retrieval)在排序衰减下的召回表现。

具体:从海量未结构化或半结构化文档库中,根据用户查询向量快速筛选 Top-K 相关片段的操作。

详见:第 21 章、第 27 章。

0.4 进阶术语(15 个,遇到再翻)

21. SFT(Supervised Fine-Tuning,监督微调)

用人工精心校验的高质量“指令-回答”成对数据微调基础模型,使模型掌握规范的问答交互范式与输出结构。

22. BLEU / ROUGE

基于 n-gram 重叠统计的早期自然语言处理指标。BLEU 侧重精确率(常用于机器翻译),ROUGE 侧重召回率(常用于摘要评估)。二者均只度量字面表层相似度,不度量语义正确性。

23. BERTScore

利用预训练语言模型的词嵌入空间计算候选文本与参考文本之间的最大余弦相似度均值,具备比 BLEU 更优的语义容错能力。

24. Cohen's Kappa(评分一致性系数)

评测裁判间可靠性(Inter-rater Reliability)的黄金统计量。从表面一致率中彻底剔除由于“随机瞎猜”造成的机遇一致率,kappa > 0.7 方可视为合格评测判官。

25. hold-out(隔离保留集)

严格与研发、提示词迭代、微调训练物理隔离的基准测试集,任何研发人员不得窥探试题。评测上线前的最终验收必须在 hold-out 集上进行,是防止数据过拟合的最后防线。

26. cons@k(一致性/多数投票口径)

自一致性采样策略:让模型在同一道题上独立推演 k 次,提取最终答案并执行多数投票(Majority Voting)。读技术报告时必须防范将 cons@64 分数与单次推理(pass@1)混淆。

27. n-gram 重叠检测与数据污染

通过滑动词窗口检测评估集题目与训练集语料的子序列重合。行业通常将“命中任一连续 13-gram 共享”作为高危数据污染(Contamination)的警示红线。

28. RAGAS

RAG 应用评测的事实标准开源框架,通过解耦提供 Faithfulness(忠实度)、Answer Relevancy(回答切题度)、Context Precision(检索精度)与 Context Recall(检索召回率)四大闭环指标。详见第 21 章。

29. SWE-bench

取自真实开源代码仓库 GitHub Issue 的端到端软件工程基准。模型必须自主理解代码库结构、定位代码缺陷、编写补丁并通过原本失败的单元测试用例,是 Agentic 编码能力的最高权威基准。详见第 11 章。

30. Self-consistency(自一致性思维链)

一种测试时计算(Test-time Compute)扩展技术。通过引入非零采样温度生成多样化的解题思维路径,并按最终结论的众数投票输出,显著提升复杂数学与逻辑任务准确率。

31. Top-p / Top-k 采样

核采样(Nucleus Sampling)与截断采样策略。Top-p 动态截取累积概率达到 p 的候选词子集,Top-k 强制保留概率前 k 的词,共同规避极低概率异常词的产生。

32. CoT(Chain of Thought,思维链)

诱导模型生成显式中间推理步骤的提示或架构策略(形如“逐步推导”)。将单跳直接预测转化为多步自回归路径,释放深度推理潜力。

33. Few-shot / Zero-shot

少样本提示与零样本提示。Zero-shot 考验纯粹指令理解与通用泛化力;Few-shot 在上下文内展示若干规范输入输出范例,是校准模型输出格式与边界的重要手段。

34. Hallucination(模型幻觉)

模型生成的文本在语法上严密流畅,但在事实层面与现实世界客观知识违背,或脱离输入上下文产生编造性事实的现象。

35. Jailbreak(对抗越狱)

攻击者构造特殊的对抗提示(Adversarial Prompt),诱使模型绕过预设的安全对齐防护,输出违禁内容或执行未授权动作的现象。

0.5 全书术语地图

部分涵盖章节重点术语与技术核心
第 0 部分:术语速查第 0 章全书 20+15 个核心概念严密字典、系统评测对照
第 1 部分:建立框架认知第 1-3 章评估定义、5W1H 原则、不可度量不可优化、能力构念效度
第 2 部分:方法论与标准流程第 4-7 章标准流水线、LLM-as-Judge 判官工程、人工评估与盲测、元评估(Cohen's Kappa / 相关性)
第 3 部分:厂商发布评测全景第 8-18 章厂商报告五问法、MMLU、MATH/AIME、HumanEval/SWE-bench、多模态、HLE、长上下文、垂直基准、LiveBench、偏好与 Chatbot Arena
第 4 部分:评估框架实战第 19-31 章开源框架横向选型、Node.js 自建评测器、RAG/Agent 评测、红蓝对抗、测试集构建、CI/CD 自动化门禁、A/B 实验、真实业务案例实战(客服/代码/多模态)与总结自测

0.6 验收自测

简答1. 用一句话阐述为什么传统的确定性单元测试断言(assert actual === expected)无法直接覆盖大模型应用的评估?
参考要点
参考要点(整理自正文):参考要点:相同点——两者都是给系统输出定对错的自动化判分流程(题集 + 判据 + 报告)。不同点——前端单元测试测确定性函数,同一输入永远同一输出,断言可精确到值;LLM 输出是概率性、开放式的,同一 prompt 可产生不同正确表述,判定常需要语义等价、规则抽取或裁判模型。依据 §0.3(术语表:Benchmark/Metric/LLM-as-Judge)、§0.4(Hallucination 与概率性输出的不确定性)。
简答2. Token 在评测工程中除了决定 API 计费成本,对有效上下文窗口(Effective Context Window)有什么物理影响?
参考要点
参考要点(整理自正文):参考要点:Token 是模型处理文本的最小单位,不等于汉字也不等于单词;一个汉字可能是 1 个或多个 token,一个英文单词常被切成多段。API 计费与上下文长度都按 token 计,所以"1000 字"与"1000 token"是两个数量概念,估算成本与塞得下多少上下文时必须按 token 算。依据 §0.3(Token 词条)。
简答3. 在 RAG 系统评测中,为什么必须将“检索召回质量”与“模型生成质量”解耦度量?
参考要点
参考要点(整理自正文):参考要点:RAG 里的"检索"指先从知识库中找出与用户问题最相关的片段(embedding 相似度或关键词匹配),再把片段拼进 prompt 让模型基于片段作答。相当于把闭卷考试改成开卷考试——模型的知识来自你给的资料,而不是训练时背下的参数化记忆。依据 §0.3(RAG 词条:检索增强生成,开卷考试)。

0.7 📋 本章 Cheat Sheet

概念专业度量核心详见
LLM参数化条件概率生成系统§0.3
Token注意力与计算复杂度的物理度量基准§0.3
Prompt激活生成分布的严格受控输入协议§0.3
Benchmark任务集 + 封闭协议(Harness)+ 度量函数§0.3
Metric映射输出至标量分数的数学函数§0.3
LLM-as-Judge高阶模型替代人工标注的自动化语义裁决§0.3
RAG解耦评估:检索召回率 + 生成忠实度§0.3
Agent感知-规划-工具调用-自愈的多轮轨迹闭环§0.3
Hallucination偏离事实证据的统计生成失真§0.4

0.8 ⚠️ 5 个常见错误

  1. 把术语当口语用 — 区分工程与口语:RLHF、Loss、Perplexity 均有严密数学定义,严禁用模糊套话代替指标。
  2. 只看名词不看度量细节 — 每个评估术语必须结合具体的评分协议(Harness)与边界条件理解,脱离协议的孤立分值没有对比价值。
  3. 跳过术语直接看代码 — 尚未建立 Token、Temperature、Sampling 方差等基本心智前阅读评测代码容易误解逻辑。
  4. 中英文混用术语 — 定下规范术语后在同一评估报告中全链路统一,避免前后表述歧义。
  5. 把基准当成孤立任务 — MMLU 是复合基准套件而不是单一测试任务,严禁以偏概全。

0.9 延伸阅读


下一步:读完本章后请进入第 1 章开始正式内容。在阅读后续深度章节时,可随时返回本章检索核心术语。