LLMStart|持续课程 · 不追玄学
模块 1 · 1.2
入门级60 分钟样板课精修版

1.2LLM 到底是什么

本课只解决一个主问题:本单元只解决一个主问题:

LLM 到底是什么,它为什么能回答问题、写文章、写代码,又为什么会一本正经地出错?

学习目标

学完本单元后,学习者应该能够:

  • 用自己的话解释什么是语言模型和大语言模型。
  • 理解“预测下一个 Token”为什么能表现出问答、总结、写作和代码能力。
  • 说清楚 Token、参数、上下文窗口、训练和推理之间的关系。
  • 区分 LLM、搜索引擎、数据库和聊天产品。
  • 理解 LLM 为什么既强大又会出错。

开场场景

想象一个学习者第一次打开 AI 助手,输入:

请用 5 分钟讲清楚 RAG 是什么。

模型很快给出一段结构清楚的回答。

这会让人产生一个直觉:

它是不是在某个地方查到了答案?

但 LLM 默认并不是搜索引擎,也不是数据库。它更像一个经过大规模训练的文本生成系统:根据上下文,预测接下来最合适出现的内容。

这个说法听起来朴素,却是理解 LLM 的入口。

先给直觉

LLM 可以先粗略理解为一个超级强的“续写器”。

你给它一段文本:

牛顿看到苹果落下,于是开始思考

它会预测接下来最可能出现什么内容。

如果只是短句续写,这看起来没什么神奇。但如果训练数据包含大量书籍、网页、代码、问答、论文、对话,模型为了做好“续写”,就必须学到很多语言规律、知识结构和任务模式。

比如它要续写:

请用三句话解释牛顿第一定律:

为了生成合理答案,它需要学会:

  • 什么是“解释”。
  • 什么是“三句话”。
  • 什么是“牛顿第一定律”。
  • 什么样的回答符合教学场景。
  • 什么样的语言适合初学者。

于是,一个看似简单的训练目标,在大规模数据、模型结构和训练方法下,表现出了复杂能力。

这里要注意:说它是“续写器”只是入门类比。真实 LLM 不是简单接龙,而是在高维数学空间里处理 Token 之间的关系。

语言模型是什么

语言模型的核心任务是估计一段文本出现的概率。

更直观地说,它会根据前面的内容,判断后面哪些 Token 更可能出现。

例子:

今天下雨了,我出门前应该带一把 ____

“伞”比“飞机”更可能出现。

如果上下文变成:

今天下雨了,我出门前应该带一把折叠 ____

“伞”的概率会更高。

模型生成回答时,不是一次性把完整答案从仓库里拿出来,而是一步步预测、选择、继续预测。

LLM 的“大”在哪里

LLM 是 Large Language Model,大语言模型。

“大”主要体现在几个方面:

  • 参数规模大。
  • 训练数据规模大。
  • 计算量大。
  • 能处理的任务范围广。

但“大”不自动等于“适合所有任务”。

一个大模型可能更擅长复杂推理和通用任务,但在高频、简单、低成本任务上,小模型或规则系统可能更合适。

这会在模块 7 的模型选择中继续展开。

Token 是什么

模型不是直接按人类看到的“字”或“词”处理文本,而是先把文本切成 Token。

Token 可能是:

  • 一个汉字。
  • 一个英文单词。
  • 一个单词的一部分。
  • 标点。
  • 空格或特殊符号。

文本会先经过 Tokenizer,变成一串 Token ID,然后模型处理这些数字。

这会影响三个实际问题:

1. 成本

很多模型 API 按 Token 计费。

输入越长、输出越长,成本通常越高。

2. 上下文长度

模型一次能处理的 Token 有上限。

系统提示、用户问题、历史对话、检索资料和模型回答都占用上下文。

3. 输出节奏

模型生成时通常也是一个 Token 一个 Token 输出。

这就是为什么你经常看到 AI 回答像打字一样逐步出现。

参数是什么

参数可以粗略理解为模型内部学到的数字。

训练过程中,模型不断调整这些数字,让自己更擅长预测下一个 Token。

参数不是一条条人类可读规则。模型内部不会写着:

如果用户问法国首都,就回答巴黎。

它更像是把大量语言模式、知识痕迹和任务模式编码进一个巨大的数学结构里。

这个说法也是类比,不要误解成模型真的像压缩包一样保存网页。

训练是什么

训练是让模型从大量数据中学习模式的过程。

入门阶段可以先理解三类训练:

1. 预训练

模型在大规模文本和代码数据上学习语言规律、知识关联和通用能力。

预训练解决的是:

模型如何获得基础语言能力和世界知识痕迹?

2. 指令微调

模型学习如何按人类指令完成任务。

例如:

  • 总结。
  • 翻译。
  • 问答。
  • 改写。
  • 写代码。
  • 按格式输出。

预训练让模型“会说话”,指令微调让模型更像“会听任务”。

3. 偏好优化

模型学习人类更喜欢什么样的回答。

例如:

  • 更有帮助。
  • 更安全。
  • 更清楚。
  • 更少胡编。
  • 更符合对话习惯。

这些过程的具体算法以后再讲。入门阶段先抓住一点:模型不是天生会聊天,而是经过多阶段训练,逐步变成更适合人类使用的助手。

推理是什么

训练完成后,用户输入 Prompt,模型开始生成回答,这个过程叫推理。

推理时大致发生:

  1. Prompt 被切成 Token。
  2. Token 进入模型。
  3. 模型计算下一个 Token 的概率分布。
  4. 系统根据采样规则选出一个 Token。
  5. 新 Token 加到上下文里。
  6. 模型继续预测下一个 Token。
  7. 直到生成结束。

这解释了两个现象:

  • 模型输出通常是逐步出现的。
  • 同一个问题多问几次,回答可能不完全一样。

因为生成时可能存在采样和随机性。

Prompt 如何变成回答的完整流程

图:用户输入经过 Tokenizer、上下文窗口、模型计算与 Token 生成循环,最终输出回答。模型不是从数据库取答案,而是在上下文中一步步预测。

上下文窗口是什么

上下文窗口是模型一次能处理的 Token 总量,包括:

  • 系统提示。
  • 用户输入。
  • 历史对话。
  • 检索资料。
  • 工具返回结果。
  • 模型正在生成的回答。

如果资料太长,超出上下文窗口,模型就不能完整看到。它不是“懒得看”,是真的放不进去。

这也是 RAG 很重要的原因之一:不要把所有资料都塞给模型,而是先检索相关片段,再放进上下文。

为什么 LLM 能做很多事

很多任务都可以转成文本输入输出:

  • 翻译:把中文转成英文。
  • 总结:把长文转成短文。
  • 写代码:把需求转成代码。
  • 问答:把问题转成答案。
  • 分类:把文本转成标签。
  • 规划:把目标转成步骤。
  • 解释:把复杂概念转成易懂表达。

LLM 作为通用文本接口,就能覆盖大量任务。

但这也带来问题:模型擅长生成合理文本,不等于它总能保证事实正确。

为什么 LLM 会出错

LLM 的训练目标不是“只说真话”,而是“生成在上下文中合理的内容”。

当它不知道答案、上下文缺少资料、问题本身有陷阱,或者生成过程走到了错误路径,它仍然可能生成一个看起来很顺的回答。

这就是幻觉。

幻觉不是简单的“模型坏了”。它是生成式模型的固有风险之一。

常见原因包括:

  • 训练数据里没有相关信息。
  • 用户没有提供必要上下文。
  • 问题包含错误前提。
  • 模型把相似概念混在一起。
  • 输出被要求得太确定。
  • 采样导致生成路径偏离。
  • 模型没有实时访问最新资料。

缓解方法包括:

  • 给模型可靠资料。
  • 要求引用来源。
  • 使用 RAG。
  • 限制回答范围。
  • 做事实核查。
  • 对高风险场景增加人工确认。

LLM 不是这些东西

不是搜索引擎

搜索引擎会查找网页和索引。

LLM 默认是在已有模型能力和上下文中生成回答。

带联网或检索功能的 AI 产品,是在 LLM 外面加了工具。

不是数据库

数据库适合精确存储和查询。

LLM 参数中包含知识痕迹,但不是可精确查询的数据表。

不是人

LLM 能模拟对话,不代表它有人的意识、动机或真实理解体验。

把模型当成人,容易高估它的可靠性。

不是万能工具

LLM 很通用,但通用不等于无边界。

在隐私、安全、医疗、法律、金融、教育评价等场景中,需要更严格的资料、评估和人工审核。

案例:合同总结

用户问:

请总结这份合同里甲方的付款义务。

如果没有上传合同,模型可能会根据常见合同模式编出一个看似合理的回答。

如果上传了合同,模型才有机会根据真实文本总结。

即使上传了合同,也仍然需要检查:

  • 是否漏掉条款。
  • 是否误解条件。
  • 是否把乙方义务写成甲方义务。
  • 是否引用了不存在的章节。
  • 是否把一般性建议说成法律结论。

这就是为什么严肃场景中,LLM 输出不能直接当最终事实。

案例:课程学习助手

学习者问:

我刚学完 Prompt 基础,下一节应该学什么?

如果模型只根据常识回答,可能会推荐一堆泛泛主题。

如果系统提供了课程目录,它就可以根据课程路径推荐:

  • 继续学高质量提示词模式。
  • 再学与 LLM 协作的方法。
  • 后续进入 RAG 或 Agent。

这说明:LLM 的回答质量不仅取决于模型本身,也取决于它看到的上下文。

术语卡片

术语 人话解释
LLM 大语言模型,擅长处理和生成文本的 AI 模型
Token 模型处理文本的基本单位
Tokenizer 把文本切成 Token 的工具
参数 模型内部学到的大量数字
训练 调整参数,让模型学会语言和任务模式
推理 用户输入后,模型生成回答的过程
上下文窗口 模型一次能看到的 Token 总量
Prompt 用户或系统给模型的输入和指令
幻觉 模型生成看似合理但不可靠或错误的内容

常见误区

误区 1:LLM 是搜索引擎

LLM 可以回答很多问题,但默认不是实时查网页。需要最新事实时,必须使用检索、联网工具或人工核查。

误区 2:LLM 是数据库

模型不是精确存储系统。它可能记得很多知识模式,但不能保证像数据库一样稳定查询。

误区 3:LLM 会聊天,所以它真的懂我

模型能模拟对话,不等于它有人的意识和真实理解体验。

误区 4:模型说得越自信,越可信

自信语气和事实正确没有必然关系。模型可以很有礼貌地胡说,甚至胡说得很有格式。

误区 5:上下文越多越好

给模型更多资料不一定更好。无关资料会增加成本、延迟和干扰。关键是给它完成任务所需的资料。

动手练习

选择一个你正在使用的 LLM 产品,做三个小测试。

测试 1:常识问题

提问:

请用三句话解释什么是光合作用。

观察:

  • 回答是否清楚?
  • 是否适合初学者?
  • 是否有明显错误?

测试 2:资料依赖问题

找一段你自己的资料,例如课程说明、会议记录或文章片段,先不发给模型,问:

请总结这份资料的核心观点。

再把资料发给模型,重复提问。

观察:

  • 没有资料时它是否承认不知道?
  • 有资料后回答是否更具体?
  • 是否引用或复述了真实内容?

测试 3:错误前提问题

提问:

请解释为什么 2020 年诺贝尔物理学奖颁给了牛顿。

观察:

  • 它是否纠正错误前提?
  • 还是顺着问题编下去?
检查题(自测)
  1. 为什么“预测下一个 Token”能产生问答、总结、写代码等能力?
  2. Token 会影响哪些实际问题?
  3. LLM 为什么会幻觉?至少说出两个原因。
  4. LLM 和搜索引擎有什么区别?
  5. 为什么上下文会影响回答质量?
参考答案
  1. 因为大量任务都可以表现为“根据上下文生成合适文本”。模型为了做好预测,需要学习语言规律、知识关联、任务格式和对话模式,所以能表现出问答、总结、写代码等能力。
  2. Token 会影响成本、上下文长度和输出过程。输入和输出越长,通常成本越高;超出上下文窗口的内容模型看不到;模型生成回答时也是逐步生成 Token。
  3. 原因包括缺少可靠资料、问题有错误前提、模型没有实时信息、概念混淆、采样路径错误、被要求给确定答案等。
  4. 搜索引擎查找已有网页或索引,LLM 默认根据模型能力和上下文生成回答。带搜索功能的 AI 产品,是把搜索工具接在 LLM 外面。
  5. 模型只能基于它看到的上下文生成回答。上下文包含资料、历史对话和任务要求。资料不足会让模型猜测,资料相关且清楚会提高回答质量。

Takeaway

LLM 的强大来自大规模训练、模型结构和文本任务的通用性;它的风险也来自同一个地方:它擅长生成合理文本,但合理不等于真实。理解 LLM,第一步不是崇拜它或怀疑它,而是知道它在根据上下文生成内容。