30. 资源速查:按场景查基准、框架与公式

如果只读一节:本章是"工具书"——按你手头的任务查:要选基准看 30.2 总表,要选框架看 30.3,要核对指标公式看 30.4,忘了术语回第 0 章,要速查贴墙的看 30.8 Cheat Sheet。资源只在"用过一次"之后才变成你的

前置知识:无硬性要求;建议先读完第 0 章术语速查,否则部分一行式定义读起来吃力。

30.1 本章定位与使用方法

三个使用场景对应三张不同的表:

你现在的处境去哪查
要给模型选基准(选型 / 回归 / 红队)§40.2 基准速查总表
要搭评估流水线(选框架 / 选判官工具)§40.3 框架速查
要核对指标口径(公式怎么算、什么时候用)§40.4 指标公式卡
忘了术语(Benchmark / pass@k / cons@k…)§40.5 术语指针 → 第 0 章
要找工具、平台、数据集下载源§40.6 生态速查
要按顺序补论文§40.7 必读论文清单(L0/L1/L2)
打印贴墙§40.8 一页 Cheat Sheet

两条使用纪律:第一,本章的表是索引不是结论——选型决策必须回到对应章节的方法论(选基准的第 9 章、选框架的第 19 章、元评估的第 7 章);第二,资源列表会腐烂,本章所有条目标注了收录时间(2026-08-28),每 6 个月应复核一次。

30.2 基准速查总表(65 项)

本表数据源:data/benchmarks.json(updated 2026-08-28,依据 13 家厂商发布材料真实抓取的覆盖矩阵)。交互版(按类别筛选、含各基准协议与厂商采用记录)见站点"评估大全"页:evals.zenheart.site/benchmarks/。表中一句话考点为速记版,协议细节(shot 数、判分口径、时间窗)以交互版与对应章节为准。

30.2.1 知识与学科(9 项)

基准一句话考点官方入口深入
MMLU57 学科四选一,测通识知识覆盖面(已近饱和)huggingface.co/datasets/cais/mmlu第 9 章
MMLU-Pro10 选项 + 强制 CoT 的 MMLU 强化版,抗猜测与饱和huggingface.co/datasets/TIGER-Lab/MMLU-Pro第 9 章
MMLU-Redux人工修订 MMLU 错标注子集,修复噪声标签github.com/Felhof/MMLU-Redux第 9 章
WinoGrande44k 代词消歧常识题leaderboard.allenai.org/winogrande第 9 章
HellaSwag情境续写常识推理(已饱和 95%+)rowanzellers.com/hellaswag第 9 章
DROP段落阅读 + 数值推理(计数/排序/算术)allenai.org/data/drop第 9 章
GPQA 主站GPQA 官方主站与论文入口gpqa.github.io第 10 章
MedQA (USMLE)美国医师执照考试题,医疗 AI 入场券github.com/jind11/MedQA第 15 章
LegalBench162 个真实法律任务(合同/IRAC/条款检索)huggingface.co/datasets/nguha/legalbench第 15 章

30.2.2 推理与数学(9 项)

基准一句话考点官方入口深入
GPQA Diamond博士级科学多选(物理/化学/生物),人类专家约 65%huggingface.co/datasets/Idavidrein/gpqa第 10 章
AIME 2024美国数学邀请赛 30 题,奥赛级推理试金石huggingface.co/datasets/HuggingFaceH4/aime_2024第 10 章
MATH-500MATH 精选 500 题,推理模型标准对比集huggingface.co/datasets/HuggingFaceH4/MATH-500第 10 章
GSM8K8500 道小学应用题,CoT 时代开山基准(已饱和)huggingface.co/datasets/openai/gsm8k第 10 章
FrontierMath研究级数学难题,数学家出题、题目保密epoch.ai/frontiermath第 13 章
LiveBench每月换题的综合抗污染基准livebench.ai第 16 章
Humanity's Last Exam人类专家联合出的超难跨学科闭卷考试agi.safe.ai第 13 章
GSM1kGSM8K 同源对照集——专测过拟合与污染github.com/scaleapi/gsm1k_eval第 16 章
ARC-AGI抽象图形规则归纳,AGI 试金石arcprize.org第 13 章

30.2.3 代码与工程(10 项)

基准一句话考点官方入口深入
HumanEval164 道 Python 函数补全,代码评估起点(已饱和)github.com/openai/human-eval第 11 章
LiveCodeBench持续收录竞赛新题,按时间窗切分防污染livecodebench.github.io第 11 章
SWE-bench Verified500 个真实 GitHub Issue 修复,代码 Agent 金标准www.swebench.com第 11 章
SWE-Lancer用真实外包任务定价衡量代码价值(美元计)github.com/openai/swelancer第 11 章
Aider Polyglot多语言 Exercism 题,真实编辑器 diff 工作流aider.chat/docs/leaderboards第 11 章
HumanEval+HumanEval 增强 80 倍测试用例,防漏判github.com/evalplus/evalplus第 11 章
APPS10k 编程竞赛题(入门→IOI)huggingface.co/datasets/codeparrot/apps第 11 章
BigCodeBench调用真实库完成复杂任务(139 库)bigcode-bench.github.io第 11 章
SWE-bench Multimodal含截图 / UI 的真实 Issue 修复www.swebench.com/multimodal.html第 11 章
KernelBenchPyTorch 算子改写 CUDA kernel(正确性 + 速度)github.com/ScalingIntelligence/KernelBench第 11 章

30.2.4 Agent 与环境(10 项)

基准一句话考点官方入口深入
Terminal-Bench真实终端环境任务,测 CLI 操作而非写代码www.tbench.ai第 14 章
τ-bench客服场景多轮对话 + 工具调用,用户模拟器评分github.com/sierra-research/tau-bench第 14 章
WebArena自托管真实网站上的长程网页任务webarena.dev第 14 章
OSWorld真实操作系统(Ubuntu/Windows/macOS)任务执行os-world.github.io第 14 章
GAIA通用助手多步推理 + 工具使用huggingface.co/spaces/gaia-benchmark/leaderboard第 14 章
BFCL v3函数调用能力专项(单/并行/嵌套/多轮)gorilla.cs.berkeley.edu/leaderboard.html第 11 章
MLE-bench75 个 Kaggle 真实比赛端到端github.com/openai/mle-bench第 14 章
Cybench40 个真实 CTF 网络安全任务cybench.cs.berkeley.edu第 14 章
AndroidWorldAndroid 真机 / 模拟器 116 任务android-world.github.io第 14 章
AgentBench8 环境综合 Agent 评测(OS/DB/网页/游戏)github.com/THUDM/AgentBench第 14 章

30.2.5 多模态(7 项)

基准一句话考点官方入口深入
MMMU大学多学科图文题,多模态版 MMLUmmmu-benchmark.github.io第 12 章
MathVista图表/几何/视觉数学推理(arXiv:2310.02255)mathvista.github.io第 12 章
POPE视觉幻觉检测(图中无物问有)github.com/RUCAIBox/POPE第 12 章
ChartQA图表问答(读数 + 计算)github.com/vis-nlp/ChartQA第 12 章
DocVQA文档图片问答(发票/表单)www.docvqa.org第 12 章
MM-Vet多模态综合能力(6 维集成评测)github.com/yuweihao/MM-Vet第 12 章
AI2D科学示意图理解allenai.org/data/diagrams第 12 章

30.2.6 长上下文(3 项)

基准一句话考点官方入口深入
Needle-in-a-Haystack长文检索单针测试——营销常用但只测检索一维github.com/gkamradt/LLMTest_NeedleInAHaystack第 14 章
RULER13 任务长上下文有效长度,比 NIAH 严格github.com/NVIDIA/RULER第 14 章
LongBench中英双语 21 任务长文理解longbench.github.io第 14 章

30.2.7 中文特色(7 项)

基准一句话考点官方入口深入
C-Eval中文 52 学科(初中到专业),国产模型标配cevalbenchmark.com第 9 章
CMMLU中文 67 学科,MMLU 中文对照github.com/haonan-li/CMMLU第 9 章
SuperCLUE中文综合能力榜单(国内媒体常用)www.superclueai.com第 18 章
CompassRank (OpenCompass)上海 AI Lab 中英综合榜单rank.opencompass.org.cn第 18 章
MGSMGSM8K 多语言版(含中文),跨语言数学推理huggingface.co/datasets/juletxara/mgsm第 15 章
Flores-200200 语言翻译质量huggingface.co/datasets/facebook/flores第 15 章
FinBen金融任务全景(财报/风控/量化)github.com/TheFINBench/FinBen第 15 章

30.2.8 偏好与排行(6 项)

基准一句话考点官方入口深入
Chatbot Arena真实人类盲评对战,Bradley-Terry 排名lmarena.ai第 17 章
MT-Bench80 道多轮对话题,强模型当裁判打分github.com/lm-sys/FastChat第 17 章
AlpacaEval 2.0805 题 vs 参考答案的胜率(LC 控制长度偏倚)tatsu-lab.github.io/alpaca_eval第 17 章
IFEval可验证指令遵循(字数/格式/关键词约束)github.com/google-research/instruction-following-eval第 16 章
Arena Hard从 Arena 真实难题抽 500 道,判官离线复现github.com/lm-sys/arena-hard第 17 章
WildBench真实用户难任务 1k 条,多判官聚合github.com/allenai/WildBench第 16 章

30.2.9 安全与事实(4 项)

基准一句话考点官方入口深入
TruthfulQA817 道对抗事实题,测一本正经胡说倾向github.com/sylinrl/TruthfulQA第 14 章
SimpleQA短事实问答,测知识边界与幻觉率github.com/openai/simple-evals第 14 章
HarmBench标准化有害行为红队(攻击成功率越低越好)www.harmbench.org第 10/21 章
FACTS Grounding答案必须基于给定文档的 grounding 评估www.kaggle.com/facts-leaderboard第 21 章

表外补充(应用层常用但未入 65 项总表):AdvBench(来源:GCG 越狱论文 arXiv:2307.15043)——约 520 个有害行为描述 + 100 个对抗 prompt,是最常用的越狱成功率测试底座,与第 14 章 10.5、第 22 章口径一致;另注意它测的是"攻击底座",需要自行定义成功率判分。

30.3 框架速查(15 + 2 项)

选型方法论(被测物是函数还是轨迹、要不要陪生产、数据能否出境)见第 19 章与第 20 章 17.11 的决策树;本表只做"装什么、跑什么"的索引:

框架语言定位安装起步命令
lm-eval-harnessPython学术基准全家桶pip install lm-evallm_eval --model hf --tasks mmlu
OpenCompassPython中文综合评测pip install opencompassopencompass --datasets cmmlu
HELMPython多指标全景(七维并列)见官网helm-run
LightEvalPython轻量学术评测pip install lightevallighteval --tasks mmlu
Inspect AIPythonAgent / 沙箱评估pip install inspect-aiinspect eval mmlu
RAGASPythonRAG 四指标pip install ragasragas.evaluate()(第 21 章)
DeepEvalPythonpytest 风格应用评估pip install deepevaldeepeval test run
TruLensPythonRAG 追踪 + 三元组反馈pip install trulenstru.run_dashboard()
Phoenix (Arize)Python/TS可观测 + 在线评估pip install arize-phoenixphoenix serve
LangSmithSaaSLangChain 生态 trace + 评估webvitest 集成(第 20 章)
LangfuseTS/Python开源可自托管可观测npm i langfuseOTel SDK(第 20 章)
SWE-bench harnessPython仓库级修复评测pip install swebenchpython -m swebench.harness.run_evaluation
VLMEvalKitPython多模态评测套件pip install vlmevalpython run.py --model ... --data MMMU
GarakPythonLLM 漏洞扫描(红队)pip install garakgarak --model_type openai(第 22 章)
PyRITPython微软红队自动化框架pip install pyrit脚本化攻击链(第 22 章)
PromptfooTS声明式 prompt/模型对比矩阵npm i -g promptfoopromptfoo eval
EvaliteTS复用 Vitest 基建的轻量评估npm i evaliteevalite(第 19 章)

选型的三条一句话判据(第 20 章 17.11):被测物是函数还是轨迹?评估要陪生产还是只陪开发?数据与模型能不能出境?

30.4 指标公式卡

公式只在这里汇总一次,详细解读与失效场景见"深入"列:

指标公式(先读文字)什么时候用深入
Accuracy判对数 / 总数类别均衡的分类题第 3 章
Precision预测为正且真为正 / 全部预测为正误报代价高(拦截正常用户)第 3 章
Recall被抓到的真正例 / 全部真例漏报代价高(漏掉有害内容)第 3 章
F12 × P × R / (P + R)P 与 R 要同时看时第 3 章
pass@k1 − C(n−c,k) / C(n,k):k 次里至少一次过代码生成(记录 k!)第 11 章
BLEU / ROUGEn-gram 精确率 / 召回型重叠翻译与摘要的粗筛第 0 章 #22
BERTScore语义向量相似度措辞不同语义同第 0 章 #23
MRR1 / 第一个相关结果排名检索排序质量第 21 章
NDCG按排名折损的相关性累加多级相关性的排序第 21 章
Cohen's Kappa校正了随机一致的一致率多人标注一致性第 6 章
ECE预测置信与实际正确率的校准误差模型自报信心时第 3 章
Elo / Bradley-Terry对战胜率拟合的相对强度偏好排名(Arena)第 17 章
Wilson 区间二项比例的置信区间一切 pass 率类读数必带第 20 章

30.5 术语:一律回第 0 章查

第 0 章集中定义了 20 个核心术语 + 15 个进阶术语(条目号 1-35),本章不再复制任何定义——同一术语只有一个定义所有者。这里只给"术语 → 第 0 章条目 → 深入章节"的指针,外加第 0 章未收录的少量应用层术语:

术语第 0 章条目深入章节
Benchmark / Metric / Judge#13 / #14 / #11第 1、3 章
LLM-as-Judge#12第 13、18 章
Pass@k / cons@k#15 / #26第 6、7 章
Elo / Bradley-Terry#16第 17 章
RAG / Retrieval / Chunk#6 / #20 / #7第 21 章
Temperature / CoT / Few-shot#8 / #32 / #33第 3、4 章
Hallucination / Jailbreak#34 / #35第 10、21 章
RAGAS / SWE-bench#28 / #29第 20、7 章
hold-out / n-gram 污染检测#25 / #27第 24 章
Cohen's Kappa#24第 19、26 章
Faithfulness(忠于上下文)—(第 0 章未收)第 21 章 20.2
Context Precision / Recall第 21 章 20.2
Prompt Injection(注入)第 22 章 21.7
Red Team(红队)第 22 章
Wilson 置信区间第 20 章 17.7.1
分层评估(L1-L4)第 20 章 17.6

30.6 生态速查:工具、平台与数据源

标注工具:Label Studio(labelstud.io,自托管标注);Argilla(argilla.io,偏好标注)。 实验追踪:Weights & Biases(wandb.ai);MLflow(mlflow.org)。 本地运行:Ollama(ollama.com);LM Studio(lmstudio.ai)。 数据集下载:Hugging Face Datasets(huggingface.co/datasets);Papers with Code(paperswithcode.com/datasets);arXiv(arxiv.org)。 榜单聚合(对账方法论见第 18 章):Chatbot Arena(lmarena.ai);Artificial Analysis(artificialanalysis.ai);SEAL(scale.com/leaderboard);OpenCompass(opencompass.org.cn);HF Open LLM Leaderboard(huggingface.co/spaces/open-llm-leaderboard)。

厂商 API 与模型版本迭代极快,本章不维护版本对照表——读厂商报告的方法论(五问法、锚点策略)见第 8 章,第三方榜单对账见第 18 章;写代码时的最新模型名以各厂商官方文档为准。

30.7 必读论文清单(L0 / L1 / L2)

分级原则(沿用全书可信度标记):L0 = 不读会误解全书概念;L1 = 建好体系前应该读过;L2 = 按需查阅。全部为真实链接。

L0 必读(5 篇)

  1. MMLU(Hendrycks et al. 2020) — 知识评测的原点,理解"多选一"范式
  2. HumanEval(Chen et al. 2021) — pass@k 与执行验证信仰的出处
  3. GSM8K(Cobbe et al. 2021) — CoT 评测与"验证器"思想
  4. Judging LLM-as-a-Judge(Zheng et al. 2023) — 判官范式与四大偏差的原始实验
  5. HELM(Liang et al. 2022) — 多维并列评测,破"单一分数"迷思

L1 推荐(10 篇)

L2 按需(方法论 + 厂商报告)

必读长文(博客级但含金量高):Designing ML Evaluation Systems(Chip Huyen)Anthropic Engineering BlogOpenAI Cookbook

30.8 一页 Cheat Sheet(速查卡)

┌──────────────────────────────────────────────────────┐
│ LLM 评估速查卡 · evals.zenheart.site                  │
├──────────────────────────────────────────────────────┤
│ 4 步评估法:数据集 → 推理 → 评分 → 报告(第 4 章)    │
│ 5W1H:Why / What / Who / When / Where / How(第 2 章)│
│ 黄金公式:业务 → 能力 → 指标 → 测试集(第 23 章)     │
│                                                      │
│ 必看 4 类基准:                                       │
│   学科 MMLU-Pro · 推理 GPQA Diamond                  │
│   代码 LiveCodeBench + SWE-bench Verified            │
│   偏好 Arena Elo(来源:第 5/6/7/13 章)             │
│                                                      │
│ 判官 4 偏差(来源:arXiv:2306.05685):              │
│   位置 · 冗长 · 自增强 · 能力天花板                  │
│   (数学判分失败率 91.3% vs GPT-4 8.7%)             │
│   缓解:换位跑两次 · rubric 长度中立                  │
│         · 判官模型 ≠ 被测模型 · 数学走规则判分        │
│                                                      │
│ 评估时机:PR 50 题门禁 / 每晚 500 题 /                │
│           发版 100 题 0 容忍 / 在线 1% 采样(第 20 章)│
│                                                      │
│ 测试集 4 来源:公开 20% + 人工 30% +                  │
│               回流 30% + 合成 20%(第 24 章)         │
│                                                      │
│ 安全底座:HarmBench(标准化红队)·                    │
│   AdvBench = 520 有害行为 + 100 对抗 prompt           │
│   (来源:arXiv:2307.15043,第 10/21 章)             │
│                                                      │
│ 核心指标:Accuracy / F1 / pass@k /                    │
│           Elo / Cohen's κ / Wilson 区间               │
│                                                      │
│ 元评估门槛:与人类一致率 ≥ 80%(第 7 章)           │
│ 选型对账:Arena / Artificial Analysis / SEAL /        │
│           OpenCompass / HF 榜(第 18 章)             │
│                                                      │
│ 一句话:没有 CI 的评估 = 不会被使用的评估            │
└──────────────────────────────────────────────────────┘

与旧版速查卡的两处正典对齐说明:判官偏差从"位置/长度/自偏好/格式"更正为位置 / 冗长 / 自增强 / 能力天花板(与第 3 章 4.9、第 17 章 13.4 的实验数据一致);AdvBench 规模从"1000"更正为 520 行为 + 100 对抗 prompt(与第 14 章 10.5、第 22 章一致)。

30.9 验收自测

  1. 选择:下面哪个基准测"博士级科学推理"?
  • A. MMLU
  • B. GPQA Diamond
  • C. TruthfulQA
  • D. HellaSwag
  1. 选择:你的团队主栈是 TypeScript、要给 RAG 应用做在线评估且要求数据不出境,最顺的组合是?
  • A. lm-eval-harness + HELM
  • B. Langfuse 自托管 + TS SDK
  • C. PyRIT + Garak
  • D. SWE-bench harness
  1. 选择:报告里两个模型的 AIME 分数差 13 个点,第一步应该?
  • A. 直接采信高分模型
  • B. 核对口径(pass@1 还是 cons@64、时间窗、子集)再下结论
  • C. 换 GPQA 重跑
  • D. 取平均分
  1. 简答:为什么本章把"术语定义"全部指向第 0 章而不再写一遍?
  1. 简答:从 30.2 总表里为"客服 RAG 上线前回归"挑 3 个基准并说明理由;再说明哪些场景必须用自建集而不是总表里的任何基准。
  1. 实操:打开 evals.zenheart.site/benchmarks/,按"Agent 与环境"类别筛选,挑 1 个基准点进官方入口,记录它的判分协议(判分器是什么、要不要沙箱、几次采样),对照第 14 章验证你的理解。

30.10 本章 Cheat Sheet

要查什么去哪详见
65 项基准一句话版§40.2 总表(交互版见 /benchmarks/)§40.2
17 个框架安装与起步命令§40.3§40.3
13 个指标公式§40.4§40.4
术语定义第 0 章(唯一所有者)§40.5
论文清单 L0/L1/L2§40.7§40.7
贴墙速查卡§40.8§40.8

30.11 5 个常见错误

  1. 收藏等于用过——收藏 100 个仓库不如完整跑通 1 个基准 + 1 个框架;每季度清一次"零使用"收藏。
  2. 把速查表当方法论——本章每张表都是索引,选型与阈值决策必须回到对应章节的推理;表答"是什么",章节答"为什么"。
  3. 榜单分数当真理——任何分数先问口径(第 8 章五问法:协议 / 采样 / 子集 / 锚点 / 缺席项);2026 年还在引用 2024 年静态榜的对比报告应直接存疑。
  4. 术语自造第二定义——团队文档里"faithfulness"写出了与第 21 章不同的定义,两周后没人知道哪个是真的;定义只允许一个所有者。
  5. 资源列表永不更新——本章收录时间 2026-08-28,工具迭代以月计;把"资源复核"放进季度例行,而不是等链接失效才发现。

30.12 延伸阅读

⭐⭐⭐(官方一手)

⭐⭐(方法论)