0. 前置:核心术语速查(请先读本章)

如果只读一节:本章列出全书的 20 个核心术语,每个都给你一个"前端视角"的解释。遇到不懂的术语先来翻这里

0.1 本章目标

读完后你能:

前置知识:无。本章是阅读全书的钥匙。

0.2 为什么先讲术语

很多 LLM 资料一上来就堆术语:"transformer 用自注意力机制,在 13T token 上预训练,经过 SFT/DPO/RLHF……" 前端工程师听完只想关掉浏览器。

本书的承诺:每个术语首次出现就有定义。——如果你跳读,可能会错过。所以本章集中定义。

0.3 核心术语(20 个)

1. LLM(Large Language Model,大语言模型)

前端类比:LLM ≈ 拥有"通识知识 + 文字接龙"能力的超级 autocomplete。

具体:一种基于 Transformer 架构、用海量文本训练、能理解和生成自然语言的 AI 模型。

代表:GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro、DeepSeek-V3、Qwen2.5、Llama 3.1。

详见:第 1、5 章。

2. Token(标记)

前端类比:Token ≈ 文本的"字"或"词",但比"字"更细。

具体:模型处理文本的最小单位。中文约 1 个字 = 1-2 个 token;英文约 1 个单词 = 1-3 个 token。

示例

"Hello, world!" → ["Hello", ",", " world", "!"]
"你好世界" → ["你", "好", "世", "界"]

为什么重要:API 按 token 收费;上下文窗口按 token 计数。

详见:第 4、10 章。

3. Prompt(提示)

前端类比:Prompt ≈ 你给模型的"输入字符串",相当于调用函数时传的参数。

具体:你发给模型的输入文本,包括指令、上下文、问题等。

示例

const prompt = "请把以下英文翻译成中文:'Hello, world!'";
const output = await llm.generate(prompt);

详见:第 2、14 章。

4. Prompt Template(提示模板)

前端类比:Prompt Template ≈ React 里的组件模板(<HelloWorld name="..." />)。

具体:把 prompt 里的变量用占位符表示的模板。

示例

const PROMPT = (question: string) => `
你是一个耐心的客服。
问题:${question}
回答:
`;

详见:第 3、14 章。

5. Embedding(嵌入)

前端类比:Embedding ≈ 把"文字"翻译成"数字坐标"。距离近 = 语义近。

具体:把文本转成一个高维向量(一串数字),让模型能"算"两段文字的相似度。

示例

"猫" → [0.12, 0.85, -0.34, ...]  (1536 维)
"狗" → [0.15, 0.78, -0.28, ...]  (距离很近)
"飞机" → [-0.45, 0.12, 0.89, ...] (距离远)

详见:第 20、23 章。

6. RAG(Retrieval-Augmented Generation,检索增强生成)

前端类比:RAG ≈ 模型的"开卷考试"。先查资料,再答题。

具体:让模型回答前,先从一个文档库里"检索"相关资料,把资料和问题一起给模型,让模型基于资料回答。

流程

[用户问题] → [检索文档库] → [找到相关文档] → [问题+文档给模型] → [答案]

详见:第 20、27 章。

7. Chunk(分块)

前端类比:Chunk ≈ 把一篇长文章切成"段落"。

具体:把文档切成小段(每段 200-1000 token),便于检索和塞进 prompt。

为什么需要:模型上下文窗口有限,必须切块。

详见:第 21 章。

8. Temperature(温度)

前端类比:Temperature ≈ "随机程度"。0 = 稳定复读机,1 = 自由发挥。

具体:控制模型输出的随机性。0 = 每次选概率最高的词;1 = 按概率采样。

使用

详见:第 3、4 章。

9. Agent(智能体)

前端类比:Agent ≈ 拥有"工具箱"的员工。不只会说,还会做。

具体:能调用工具(搜索、代码执行、API)的 LLM 系统。

示例

[用户] "北京今天多少度?"
[Agent] "我需要查天气" → 调用天气 API → 拿到数据 → 生成回答

详见:第 9、10、20 章。

10. Tool Use(工具使用)

前端类比:Tool Use ≈ 模型调用的"API 端点"。

具体:模型能识别的"函数 schema",模型决定何时调用、传什么参数。

示例

{
  "name": "get_weather",
  "description": "查询某地天气",
  "parameters": {
    "type": "object",
    "properties": {
      "city": { "type": "string" }
    }
  }
}

详见:第 7、20 章。

11. Judge(评分器)

前端类比:Judge ≈ 单元测试里的"assertion"。

具体:给模型输出打分的程序或模型。可以是规则(exact match),也可以是另一个 LLM(LLM-as-Judge)。

详见:第 3、18、26 章。

12. LLM-as-Judge(用 LLM 当评分器)

前端类比:LLM-as-Judge ≈ 让 GPT-4 当"高级测试工程师"给模型输出打分。

具体:用更强的 LLM 评估另一个 LLM 的输出。便宜、可扩展,但有偏差。

详见:第 13、18 章。

13. Benchmark(基准)

前端类比:Benchmark ≈ 单元测试套件(tests/ 目录里的所有测试)。

具体:一组评估任务 + 评分规则,用来测模型在某个能力上的水平。

示例:MMLU(57 学科 14k 多选题)、HumanEval(164 道编程题)。

详见:第 1、5-12 章。

14. Metric(指标)

前端类比:Metric ≈ 单元测试里的 expect().toBe(...) 函数。

具体:打分的具体规则。常见:accuracy、F1、pass@k、Elo。

详见:第 3 章。

15. Pass@k

前端类比:Pass@k ≈ "k 次提交里至少 1 次通过"。

具体:代码生成评估指标。pass@1 = 一次就对;pass@10 = 10 次里至少 1 次对。

详见:第 11 章。

16. Elo / Bradley-Terry

前端类比:Elo ≈ 王者荣耀的"排位分"。赢了加分,输了减分。

具体:偏好类评估的评分系统。模型 A 胜 B → A 加分 B 减分。

详见:第 17 章。

17. Context Window(上下文窗口)

前端类比:Context Window ≈ 模型的"工作记忆"。能一次处理多少 token。

具体:模型一次能"看到"的最大 token 数。GPT-4o = 128k;Claude 3.5 = 200k;Gemini 1.5 Pro = 1M。

详见:第 14 章。

18. Fine-tuning(微调)

前端类比:Fine-tuning ≈ 给员工做"岗前培训"。

具体:在基础模型上用自己的数据再训练,让模型擅长某个垂直领域。

详见:第 8 章。

19. RLHF(Reinforcement Learning from Human Feedback)

前端类比:RLHF ≈ 用"用户评分"当老师,训练模型。

具体:用人类对模型输出的偏好数据训练奖励模型,再用奖励模型优化 LLM。

详见:第 1、14 章。

20. Retrieval(检索)

前端类比:Retrieval ≈ 搜索引擎的"找资料"。

具体:从文档库中找与查询最相关的文档(通常用 embedding 余弦相似度)。

详见:第 20、27 章。

0.4 进阶术语(15 个,遇到再翻)

21. SFT(Supervised Fine-Tuning,监督微调)

SFT ≈ 用"标准问答范例"做岗前培训:拿人工写好的高质量问答对微调模型,让它学会按指令对话。通常发生在 RLHF 之前。

22. BLEU / ROUGE

翻译/摘要评估指标。BLEU 测 n-gram 精度,ROUGE 测召回率。

23. BERTScore

用 BERT embedding 算语义相似度,比 BLEU/ROUGE 更智能。

24. Cohen's Kappa

人类评估员一致性指标。> 0.7 = 高度一致。

25. hold-out(保留集)

从测试集里再划出一块"从不给任何人看"的数据。评估分数再漂亮,最后都要在 hold-out 上验一次——它是防自欺的最后一道闸。

26. cons@k(多数投票口径)

让模型对同一道题生成 k 次,取出现最多的答案算正确率。与 pass@1(只做一次)口径不同——同一个模型 cons@64 的分数可能比 pass@1 高出一倍,读报告必看口径。

27. n-gram 重叠检测

把文本切成 n 个连续词的窗口比对重合。13-gram 是污染检测的业界惯例(出自 GPT-3 论文):评估题与训练语料共享任一 13-gram 即判为污染。

28. RAGAS

RAG 评估的事实标准框架,四大指标:Faithfulness(忠于检索内容)、Answer Relevancy(切题)、Context Precision/Recall(检索质量)。详见第 21 章。

29. SWE-bench

真实 GitHub Issue 修复基准:给模型仓库和 Issue,它要提交能通过测试的补丁。代码 Agent 的金标准,详见第 11 章。

30. self-consistency

多次采样 + 投票取众数。是 LLM 数学推理的常用技巧(与 26 条的 cons@k 同族)。

31. Top-p / Top-k

采样策略。Top-p = 概率最高的 p 比例里选;Top-k = 概率最高 k 个里选。

32. CoT(Chain of Thought)

让模型"逐步思考"再给答案。提升数学/推理能力。

33. Few-shot / Zero-shot

Zero-shot = 不给例子直接问。Few-shot = 给几个例子再问。

34. Hallucination(幻觉)

模型"一本正经地胡说"。编造不存在的事实。

35. Jailbreak(越狱)

用特殊 prompt 绕过模型的安全限制。

0.5 全书术语地图

部分章节重点术语
术语速查0本书 20+15 个核心术语
1 评估的世界观1-4评估定义, 5W1H, 四步法, 指标/统计/人类一致性
2 基准家族图谱5-12学科/数学/代码/多模态基准, 硬核新兴评测, 长上下文/安全/Agent, 行业垂直, 持续更新评测
3 偏好与排行榜13-15LLM-as-Judge, Arena Elo, 厂商报告解读, 榜单对账
4 评估工程实践16-21框架全景, 自建 evaluator, Judge 工程化, 人类评估, RAG/Agent 评估, 红队
5 自定义评估设计22-26能力拆解, 测试集构建, CI/CD 流水线, A/B 实验, 元评估
6 实战案例27-29客服 RAG, 代码 Agent, 多模态 App
7 资源与自测30-3180+ 基准速查, 术语表, Cheat Sheet, 结课自测, FAQ

0.6 验收自测

  1. 简答:用一句话向同事解释"LLM 评估"和"前端单元测试"的异同。
  2. 简答:Token 和"字"有什么区别?
  3. 简答:RAG 里的"检索"是什么?

0.7 📋 本章 Cheat Sheet

概念一句话详见
LLM大语言模型,通识 + 文字接龙§0.3
Token模型处理的最小文本单位§0.3
Prompt给模型的输入§0.3
Benchmark一组任务 + 评分规则§0.3
Metric具体评分规则§0.3
LLM-as-Judge用 LLM 评估 LLM§0.3
RAG检索增强生成,开卷考试§0.3
Agent能调工具的 LLM 系统§0.3
Hallucination一本正经地胡说§0.4

0.8 ⚠️ 5 个常见错误

  1. 把术语当口语用 — RLHF/Loss 都有精确含义,不要用'AI 训练得好'代替,区分术语和业务语言。
  2. 只看名词不看示例 — 首次出现必须配前端类比,只看定义等于没看。
  3. 跳过术语直接看代码 — 没理解 Token/Temperature 之前看代码会一直卡壳。
  4. 中英文混用术语 — 定下中文译法后在全章统一,避免一会 Token 一会标记。
  5. 把术语当万能解释 — MMLU 是基准不是任务,'用 MMLU 评估'这种说法是病句。

0.9 延伸阅读


下一步:读完本章后请去第 1 章开始正式内容。如果遇到不懂的术语,先回本章查。