LLMStart|持续课程 · 不追玄学
模块 7 · 7.3
进阶级60 分钟

7.3Benchmark 的价值与局限

本课只解决一个主问题:本单元只解决一个主问题:

模型排行榜和 Benchmark 能看,但为什么不能只看它们?

学习目标

学完本单元后,学习者应该能够:

  • 解释 Benchmark 是什么。
  • 理解 Benchmark 对模型选择的价值。
  • 识别公开排行榜的局限。
  • 区分通用能力评测和业务任务评测。
  • 设计自己的小型任务评测集。

先给直觉

Benchmark 像考试。

考试有价值:

  • 能比较不同学生。
  • 能发现一些能力差异。
  • 能提供基本参考。

但考试不等于真实工作。

一个人考试分高,不代表他一定适合你的项目。

模型也是一样。公开 Benchmark 可以帮助你了解模型大致能力,但不能替代你自己的任务评估。

Benchmark 是什么

Benchmark 是一套标准化测试任务,用来比较模型表现。

它通常包括:

  • 问题集。
  • 标准答案或评分规则。
  • 评估指标。
  • 排行榜或报告。

常见评估方向:

  • 语言理解。
  • 数学推理。
  • 代码能力。
  • 知识问答。
  • 多模态理解。
  • 工具使用。
  • 安全性。

Benchmark 的价值

1. 快速了解模型能力

当模型很多时,Benchmark 提供第一层参考。

2. 比较同类模型

可以初步判断某个模型在数学、代码、推理、多模态等方向的强弱。

3. 观察能力趋势

长期看 Benchmark,可以了解模型能力发展方向。

4. 辅助选型

Benchmark 可以帮你筛掉明显不合适的候选模型。

但它只能辅助,不能替你做最终决定。

Benchmark 的局限

1. 不等于你的业务

公开测试题和你的真实任务不同。

一个模型在通用问答里很强,不代表它能准确总结你的合同、课程或客户工单。

2. 测试集可能被污染

如果模型训练数据中见过测试题,分数可能被抬高。

3. 指标可能过于单一

一个分数无法反映:

  • 成本。
  • 延迟。
  • 稳定性。
  • 输出风格。
  • 安全性。
  • 可控性。
  • 工具调用能力。

4. 不覆盖产品体验

用户体验包括:

  • 等待时间。
  • 失败提示。
  • 引用质量。
  • 可编辑性。
  • 与工作流结合。

Benchmark 通常不测这些。

5. 排行榜容易诱导错误决策

排行榜第一不等于你的最佳选择。

产品选型要看任务,不是给模型颁奖。

通用 Benchmark 与任务评测

通用 Benchmark

适合回答:

这个模型大致强不强?

任务评测

适合回答:

这个模型适不适合我的具体任务?

例如你的任务是课程问答,应该测:

  • 是否引用课程资料。
  • 是否适合目标学习者。
  • 是否承认资料不足。
  • 是否解释清楚。
  • 成本和延迟是否可接受。

这些不一定在公开 Benchmark 里体现。

如何读排行榜

读排行榜时,不要只看总分。

要看:

  • 测的是什么任务。
  • 样本是否代表你的场景。
  • 评估方式是否可靠。
  • 是否有人工评估。
  • 是否公开测试集。
  • 模型成本和延迟。
  • 是否支持你需要的模态和工具。

如果排行榜只给一个漂亮总分,要谨慎。

自建小型评测集

每个 AI 项目都应该有自己的小型评测集。

步骤:

  1. 收集真实用户问题。
  2. 按类型分类。
  3. 标注理想答案或评分标准。
  4. 覆盖正常、边界和失败场景。
  5. 用候选模型测试。
  6. 记录成本、延迟和失败类型。

评测集不需要一开始很大。

20 到 50 个高质量问题,往往比随便看排行榜更有价值。

评测集应该包含什么

以课程问答助手为例:

类型 示例
概念解释 Token 是什么?
对比问题 RAG 和微调有什么区别?
应用问题 什么时候该用 Agent?
边界问题 RAG 能彻底解决幻觉吗?
资料不足 课程有没有讲某个未覆盖模型?
错误前提 爱因斯坦是否参与 Transformer 论文?
风格要求 用高中生能懂的话解释 Attention

业务评测指标

业务评测应该看:

  • 正确性。
  • 完整性。
  • 引用准确率。
  • 是否基于资料。
  • 是否承认不确定。
  • 输出是否可用。
  • 用户是否采纳。
  • 成本。
  • 延迟。

不同业务权重不同。

Benchmark 和模型营销

模型发布时常常强调某些分数。

读这些信息时要问:

  • 这个分数来自哪里?
  • 是否和我的任务相关?
  • 有没有成本和延迟信息?
  • 有没有失败案例?
  • 有没有安全和隐私说明?

不要被单个高分带走判断。

案例:选择课程问答模型

候选模型 A:

  • 通用 Benchmark 高。
  • 成本高。
  • 回答很流畅。

候选模型 B:

  • 通用 Benchmark 稍低。
  • 成本低。
  • 引用课程资料更稳定。

如果任务是课程问答,B 可能更适合。

因为你的关键指标不是“看起来多聪明”,而是:

  • 是否基于课程资料。
  • 是否适合学习者。
  • 是否引用准确。
  • 是否成本可控。

常见误区

误区 1:Benchmark 第一就是最好

不是。它只是某些测试上的第一。

误区 2:自建评测集太麻烦,不值得

不做自己的评测,很容易选到不适合业务的模型。

误区 3:只看准确率就够了

还要看成本、延迟、安全、引用、稳定性和用户体验。

误区 4:评测集做一次就结束

评测集应该随着真实失败案例更新。

误区 5:Benchmark 没用

也不对。Benchmark 有参考价值,只是不能单独决定。

动手练习

为一个 AI 功能设计 30 条小型评测集。

要求:

类型 数量
正常问题 10
边界问题 5
资料不足问题 5
错误前提问题 5
高风险问题 5

并为每类写评分标准。

检查题(自测)
  1. Benchmark 的主要价值是什么?
  2. 为什么公开排行榜不能替代自己的任务评测?
  3. 一个小型业务评测集至少应该包含哪些类型问题?
参考答案
  1. 提供标准化、可对比的基准,衡量模型的通用能力水平和相对变化。
  2. 公开榜单的测试分布可能和你的任务不同,且存在数据污染风险,不能替代在自己任务集上的评测。
  3. 至少应包含:正常问题(覆盖典型输入)、边界问题(极端长度/模糊输入)、易错问题(陷阱与失败模式),并记录每条测什么。

Takeaway

Benchmark 是有用的参考,不是模型选型的最终答案。真正决定模型是否适合你的,是它在你的任务、你的数据、你的成本和你的风险约束下表现如何。