LLMStart|持续课程 · 不追玄学
模块 2 · 2.4
进阶级45 分钟

2.4Scaling Law 与能力增长

本课只解决一个主问题:本单元只解决一个主问题:

为什么模型变大、数据变多、计算变强后,能力通常会提升,但这件事又不是无限魔法?

学习目标

学完本单元后,学习者应该能够:

  • 解释 Scaling Law 的基本含义。
  • 理解参数、数据、算力之间的关系。
  • 知道为什么大模型会表现出更强能力。
  • 理解小模型仍然有价值。
  • 初步理解 Test-time Compute 的意义。

先给直觉

学习一个复杂技能,通常需要三样东西:

  • 足够大的脑容量。
  • 足够多、足够好的练习材料。
  • 足够长、足够有效的训练。

模型也类似:

  • 参数:模型容量。
  • 数据:学习材料。
  • 训练算力:学习过程中的计算投入。

Scaling Law 研究的是:当这些因素扩大时,模型性能如何变化。

直觉上,模型更大、数据更多、训练更充分,通常会更强。但“通常”不是“必然”,更不是“无限变强”。

Scaling Law 是什么

Scaling Law 可以理解为模型规模与性能之间的经验规律。

研究者观察到,在一定范围内:

  • 模型参数增加。
  • 训练数据增加。
  • 计算量增加。

模型在某些指标上的表现会按相对可预测的方式改善。

这让训练大模型从“拍脑袋试试”变得更像工程规划:投入多少计算,大概能获得什么性能提升。

注意:Scaling Law 是经验规律,不是宇宙保证书。

参数、数据、算力

参数

参数是模型内部可学习的数字。

参数越多,模型表达复杂模式的容量通常越强。

但参数多也带来:

  • 训练成本高。
  • 推理成本高。
  • 部署难度高。
  • 延迟可能增加。

数据

数据是模型学习的材料。

数据不只是越多越好,还要:

  • 质量高。
  • 覆盖面广。
  • 重复少。
  • 噪音低。
  • 风险内容可控。

如果数据质量差,模型可能学到错误、偏见或低质量表达。

算力

算力是训练和推理所需的计算资源。

训练算力决定模型学习过程能跑多大规模。

推理算力影响用户使用时的速度、成本和能力。后面会讲 Test-time Compute,也就是在回答时投入更多计算,让模型有机会做更复杂的推理。

能力为什么会出现跳跃感

有些能力在模型较小时不明显,模型变大后突然看起来出现了。

比如:

  • 更好的上下文理解。
  • 更强的代码能力。
  • 更复杂的指令遵循。
  • 更好的多步推理。
  • 更自然的对话。

这常被称为“涌现”。但要谨慎理解:

  • 有些能力确实在规模扩大后明显增强。
  • 有些“突然出现”可能来自评估指标的门槛效应。
  • 不同任务的增长曲线不同。

所以不要把“涌现”讲成玄学。它更像复杂系统在规模变化后表现出的能力变化。

小模型为什么仍然重要

如果大模型更强,为什么还要小模型?

因为真实产品不只看能力,还看:

  • 成本
  • 延迟
  • 隐私
  • 部署环境
  • 任务复杂度
  • 可控性
  • 并发量

简单任务没必要每次都请最强模型出场。

例子:

  • 文本分类可以用小模型。
  • 本地输入法可以用端侧模型。
  • 高频客服意图识别可以用便宜模型。
  • 隐私敏感场景可能需要本地部署。

大模型像重型设备,小模型像常用工具。你不会用挖掘机夹菜,虽然它力气很大。

Test-time Compute

传统上,我们常关注训练时投入多少计算。

但近年来,推理时投入更多计算也变得重要。可以粗略理解为:模型回答问题时,不是马上给一个答案,而是花更多步骤进行推理、检查、搜索或规划。

常见形式:

  • 多步推理。
  • 自我检查。
  • 生成多个候选再选择。
  • 调用工具验证。
  • 更长的思考过程。

它的价值:

  • 对复杂推理任务更有帮助。
  • 可以改善答案质量。
  • 适合高价值、低频、需要准确性的任务。

代价:

  • 更慢。
  • 更贵。
  • 系统更复杂。
  • 仍然需要评估和边界控制。

模型能力增长的现实边界

Scaling 带来了巨大进步,但也有边界:

  • 数据质量瓶颈。
  • 算力成本瓶颈。
  • 能源和硬件约束。
  • 推理延迟和价格压力。
  • 评估越来越难。
  • 安全与合规要求更高。

更大的模型也不自动解决:

  • 私有知识缺失。
  • 实时信息缺失。
  • 幻觉。
  • 权限控制。
  • 产品体验。
  • 用户信任。

这些问题需要 RAG、工具、评估、产品设计和安全机制共同解决。

案例

做一个“合同审阅助手”。

模型选择可能是:

  • 简单条款分类:小模型或规则足够。
  • 合同摘要:中等或强模型。
  • 高风险条款解释:强模型 + RAG + 引用 + 人工确认。
  • 法律建议:不能只靠模型,需要专业人员审核。

这里的关键不是“用最大的模型”,而是按任务风险和价值分配模型与计算资源。

常见误区

误区 1:模型越大一定越好

能力通常更强,但成本、延迟、部署和任务适配也要考虑。

误区 2:小模型没有价值

小模型在低成本、低延迟、私有部署和特定任务中非常有价值。

误区 3:Scaling Law 等于能力无限增长

Scaling Law 是经验规律,不代表没有边界。

误区 4:推理时多想就一定更准

更多推理计算可能改善复杂任务,但也会增加成本,并且不能保证永远正确。

动手练习

选择一个 AI 功能,填写表格:

任务 是否需要强模型 原因 可接受延迟 风险等级
用户评论情感分类
根据公司制度回答员工问题
自动发送法律意见
生成 20 个广告标题

然后思考:哪些任务值得花更多模型能力和推理成本?

检查题(自测)
  1. Scaling Law 主要描述什么关系?
  2. 为什么小模型仍然重要?
  3. Test-time Compute 的价值和代价分别是什么?
参考答案
  1. 主要描述模型性能随参数、数据、算力规模增长而提升的关系:在未饱和区间,规模越大能力越强,但增长会放缓,且需要三者按比例配合。
  2. 小模型成本低、延迟低、便于私有部署,适合高频、简单、稳定的任务;大模型不是所有场景的正确答案。
  3. 价值:在推理时投入更多计算(多次采样、逐步思考)能提升复杂任务表现;代价:延迟和成本明显增加,只适合对质量要求高的场景。

Takeaway

模型规模、数据和算力推动了 LLM 能力增长,但真实应用不能只崇拜“大”。好的 AI 系统会根据任务价值、风险、成本和延迟分配模型能力。