0. 前置:核心术语速查(请先读本章)
如果只读一节:本章列出全书的 20 个核心术语,每个都给你一个"前端视角"的解释。遇到不懂的术语先来翻这里。
0.1 本章目标
读完后你能:
- 用 30 秒向同事解释每个核心术语
- 知道哪个术语在哪一章深入讲解
- 不再被 LLM 黑话劝退
前置知识:无。本章是阅读全书的钥匙。
0.2 为什么先讲术语
很多 LLM 资料一上来就堆术语:"transformer 用自注意力机制,在 13T token 上预训练,经过 SFT/DPO/RLHF……" 前端工程师听完只想关掉浏览器。
本书的承诺:每个术语首次出现就有定义。但——如果你跳读,可能会错过。所以本章集中定义。
0.3 核心术语(20 个)
1. LLM(Large Language Model,大语言模型)
前端类比:LLM ≈ 拥有"通识知识 + 文字接龙"能力的超级 autocomplete。
具体:一种基于 Transformer 架构、用海量文本训练、能理解和生成自然语言的 AI 模型。
代表:GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro、DeepSeek-V3、Qwen2.5、Llama 3.1。
详见:第 1、5 章。
2. Token(标记)
前端类比:Token ≈ 文本的"字"或"词",但比"字"更细。
具体:模型处理文本的最小单位。中文约 1 个字 = 1-2 个 token;英文约 1 个单词 = 1-3 个 token。
示例:
"Hello, world!" → ["Hello", ",", " world", "!"]
"你好世界" → ["你", "好", "世", "界"]为什么重要:API 按 token 收费;上下文窗口按 token 计数。
详见:第 4、10 章。
3. Prompt(提示)
前端类比:Prompt ≈ 你给模型的"输入字符串",相当于调用函数时传的参数。
具体:你发给模型的输入文本,包括指令、上下文、问题等。
示例:
const prompt = "请把以下英文翻译成中文:'Hello, world!'";
const output = await llm.generate(prompt);详见:第 2、14 章。
4. Prompt Template(提示模板)
前端类比:Prompt Template ≈ React 里的组件模板(
<HelloWorld name="..." />)。
具体:把 prompt 里的变量用占位符表示的模板。
示例:
const PROMPT = (question: string) => `
你是一个耐心的客服。
问题:${question}
回答:
`;详见:第 3、14 章。
5. Embedding(嵌入)
前端类比:Embedding ≈ 把"文字"翻译成"数字坐标"。距离近 = 语义近。
具体:把文本转成一个高维向量(一串数字),让模型能"算"两段文字的相似度。
示例:
"猫" → [0.12, 0.85, -0.34, ...] (1536 维)
"狗" → [0.15, 0.78, -0.28, ...] (距离很近)
"飞机" → [-0.45, 0.12, 0.89, ...] (距离远)详见:第 20、23 章。
6. RAG(Retrieval-Augmented Generation,检索增强生成)
前端类比:RAG ≈ 模型的"开卷考试"。先查资料,再答题。
具体:让模型回答前,先从一个文档库里"检索"相关资料,把资料和问题一起给模型,让模型基于资料回答。
流程:
[用户问题] → [检索文档库] → [找到相关文档] → [问题+文档给模型] → [答案]详见:第 20、27 章。
7. Chunk(分块)
前端类比:Chunk ≈ 把一篇长文章切成"段落"。
具体:把文档切成小段(每段 200-1000 token),便于检索和塞进 prompt。
为什么需要:模型上下文窗口有限,必须切块。
详见:第 21 章。
8. Temperature(温度)
前端类比:Temperature ≈ "随机程度"。0 = 稳定复读机,1 = 自由发挥。
具体:控制模型输出的随机性。0 = 每次选概率最高的词;1 = 按概率采样。
使用:
- 评估:temperature = 0(确保可复现)
- 创作:temperature = 0.7-1.0(更自然)
详见:第 3、4 章。
9. Agent(智能体)
前端类比:Agent ≈ 拥有"工具箱"的员工。不只会说,还会做。
具体:能调用工具(搜索、代码执行、API)的 LLM 系统。
示例:
[用户] "北京今天多少度?"
[Agent] "我需要查天气" → 调用天气 API → 拿到数据 → 生成回答详见:第 9、10、20 章。
10. Tool Use(工具使用)
前端类比:Tool Use ≈ 模型调用的"API 端点"。
具体:模型能识别的"函数 schema",模型决定何时调用、传什么参数。
示例:
{
"name": "get_weather",
"description": "查询某地天气",
"parameters": {
"type": "object",
"properties": {
"city": { "type": "string" }
}
}
}详见:第 7、20 章。
11. Judge(评分器)
前端类比:Judge ≈ 单元测试里的"assertion"。
具体:给模型输出打分的程序或模型。可以是规则(exact match),也可以是另一个 LLM(LLM-as-Judge)。
详见:第 3、18、26 章。
12. LLM-as-Judge(用 LLM 当评分器)
前端类比:LLM-as-Judge ≈ 让 GPT-4 当"高级测试工程师"给模型输出打分。
具体:用更强的 LLM 评估另一个 LLM 的输出。便宜、可扩展,但有偏差。
详见:第 13、18 章。
13. Benchmark(基准)
前端类比:Benchmark ≈ 单元测试套件(
tests/目录里的所有测试)。
具体:一组评估任务 + 评分规则,用来测模型在某个能力上的水平。
示例:MMLU(57 学科 14k 多选题)、HumanEval(164 道编程题)。
详见:第 1、5-12 章。
14. Metric(指标)
前端类比:Metric ≈ 单元测试里的
expect().toBe(...)函数。
具体:打分的具体规则。常见:accuracy、F1、pass@k、Elo。
详见:第 3 章。
15. Pass@k
前端类比:Pass@k ≈ "k 次提交里至少 1 次通过"。
具体:代码生成评估指标。pass@1 = 一次就对;pass@10 = 10 次里至少 1 次对。
详见:第 11 章。
16. Elo / Bradley-Terry
前端类比:Elo ≈ 王者荣耀的"排位分"。赢了加分,输了减分。
具体:偏好类评估的评分系统。模型 A 胜 B → A 加分 B 减分。
详见:第 17 章。
17. Context Window(上下文窗口)
前端类比:Context Window ≈ 模型的"工作记忆"。能一次处理多少 token。
具体:模型一次能"看到"的最大 token 数。GPT-4o = 128k;Claude 3.5 = 200k;Gemini 1.5 Pro = 1M。
详见:第 14 章。
18. Fine-tuning(微调)
前端类比:Fine-tuning ≈ 给员工做"岗前培训"。
具体:在基础模型上用自己的数据再训练,让模型擅长某个垂直领域。
详见:第 8 章。
19. RLHF(Reinforcement Learning from Human Feedback)
前端类比:RLHF ≈ 用"用户评分"当老师,训练模型。
具体:用人类对模型输出的偏好数据训练奖励模型,再用奖励模型优化 LLM。
详见:第 1、14 章。
20. Retrieval(检索)
前端类比:Retrieval ≈ 搜索引擎的"找资料"。
具体:从文档库中找与查询最相关的文档(通常用 embedding 余弦相似度)。
详见:第 20、27 章。
0.4 进阶术语(15 个,遇到再翻)
21. SFT(Supervised Fine-Tuning,监督微调)
SFT ≈ 用"标准问答范例"做岗前培训:拿人工写好的高质量问答对微调模型,让它学会按指令对话。通常发生在 RLHF 之前。
22. BLEU / ROUGE
翻译/摘要评估指标。BLEU 测 n-gram 精度,ROUGE 测召回率。
23. BERTScore
用 BERT embedding 算语义相似度,比 BLEU/ROUGE 更智能。
24. Cohen's Kappa
人类评估员一致性指标。> 0.7 = 高度一致。
25. hold-out(保留集)
从测试集里再划出一块"从不给任何人看"的数据。评估分数再漂亮,最后都要在 hold-out 上验一次——它是防自欺的最后一道闸。
26. cons@k(多数投票口径)
让模型对同一道题生成 k 次,取出现最多的答案算正确率。与 pass@1(只做一次)口径不同——同一个模型 cons@64 的分数可能比 pass@1 高出一倍,读报告必看口径。
27. n-gram 重叠检测
把文本切成 n 个连续词的窗口比对重合。13-gram 是污染检测的业界惯例(出自 GPT-3 论文):评估题与训练语料共享任一 13-gram 即判为污染。
28. RAGAS
RAG 评估的事实标准框架,四大指标:Faithfulness(忠于检索内容)、Answer Relevancy(切题)、Context Precision/Recall(检索质量)。详见第 21 章。
29. SWE-bench
真实 GitHub Issue 修复基准:给模型仓库和 Issue,它要提交能通过测试的补丁。代码 Agent 的金标准,详见第 11 章。
30. self-consistency
多次采样 + 投票取众数。是 LLM 数学推理的常用技巧(与 26 条的 cons@k 同族)。
31. Top-p / Top-k
采样策略。Top-p = 概率最高的 p 比例里选;Top-k = 概率最高 k 个里选。
32. CoT(Chain of Thought)
让模型"逐步思考"再给答案。提升数学/推理能力。
33. Few-shot / Zero-shot
Zero-shot = 不给例子直接问。Few-shot = 给几个例子再问。
34. Hallucination(幻觉)
模型"一本正经地胡说"。编造不存在的事实。
35. Jailbreak(越狱)
用特殊 prompt 绕过模型的安全限制。
0.5 全书术语地图
| 部分 | 章节 | 重点术语 |
|---|---|---|
| 术语速查 | 0 | 本书 20+15 个核心术语 |
| 1 评估的世界观 | 1-4 | 评估定义, 5W1H, 四步法, 指标/统计/人类一致性 |
| 2 基准家族图谱 | 5-12 | 学科/数学/代码/多模态基准, 硬核新兴评测, 长上下文/安全/Agent, 行业垂直, 持续更新评测 |
| 3 偏好与排行榜 | 13-15 | LLM-as-Judge, Arena Elo, 厂商报告解读, 榜单对账 |
| 4 评估工程实践 | 16-21 | 框架全景, 自建 evaluator, Judge 工程化, 人类评估, RAG/Agent 评估, 红队 |
| 5 自定义评估设计 | 22-26 | 能力拆解, 测试集构建, CI/CD 流水线, A/B 实验, 元评估 |
| 6 实战案例 | 27-29 | 客服 RAG, 代码 Agent, 多模态 App |
| 7 资源与自测 | 30-31 | 80+ 基准速查, 术语表, Cheat Sheet, 结课自测, FAQ |
0.6 验收自测
- 简答:用一句话向同事解释"LLM 评估"和"前端单元测试"的异同。
- 简答:Token 和"字"有什么区别?
- 简答:RAG 里的"检索"是什么?
0.7 📋 本章 Cheat Sheet
| 概念 | 一句话 | 详见 |
|---|---|---|
| LLM | 大语言模型,通识 + 文字接龙 | §0.3 |
| Token | 模型处理的最小文本单位 | §0.3 |
| Prompt | 给模型的输入 | §0.3 |
| Benchmark | 一组任务 + 评分规则 | §0.3 |
| Metric | 具体评分规则 | §0.3 |
| LLM-as-Judge | 用 LLM 评估 LLM | §0.3 |
| RAG | 检索增强生成,开卷考试 | §0.3 |
| Agent | 能调工具的 LLM 系统 | §0.3 |
| Hallucination | 一本正经地胡说 | §0.4 |
0.8 ⚠️ 5 个常见错误
- 把术语当口语用 — RLHF/Loss 都有精确含义,不要用'AI 训练得好'代替,区分术语和业务语言。
- 只看名词不看示例 — 首次出现必须配前端类比,只看定义等于没看。
- 跳过术语直接看代码 — 没理解 Token/Temperature 之前看代码会一直卡壳。
- 中英文混用术语 — 定下中文译法后在全章统一,避免一会 Token 一会标记。
- 把术语当万能解释 — MMLU 是基准不是任务,'用 MMLU 评估'这种说法是病句。
0.9 延伸阅读
- 本书各章内对应术语的深入讲解
- DeepLearning.AI: ChatGPT Prompt Engineering
下一步:读完本章后请去第 1 章开始正式内容。如果遇到不懂的术语,先回本章查。