1.2LLM 到底是什么
本课只解决一个主问题:本单元只解决一个主问题:LLM 到底是什么,它为什么能回答问题、写文章、写代码,又为什么会一本正经地出错?
学习目标
学完本单元后,学习者应该能够:
- 用自己的话解释什么是语言模型和大语言模型。
- 理解“预测下一个 Token”为什么能表现出问答、总结、写作和代码能力。
- 说清楚 Token、参数、上下文窗口、训练和推理之间的关系。
- 区分 LLM、搜索引擎、数据库和聊天产品。
- 理解 LLM 为什么既强大又会出错。
开场场景
想象一个学习者第一次打开 AI 助手,输入:
请用 5 分钟讲清楚 RAG 是什么。
模型很快给出一段结构清楚的回答。
这会让人产生一个直觉:
它是不是在某个地方查到了答案?
但 LLM 默认并不是搜索引擎,也不是数据库。它更像一个经过大规模训练的文本生成系统:根据上下文,预测接下来最合适出现的内容。
这个说法听起来朴素,却是理解 LLM 的入口。
先给直觉
LLM 可以先粗略理解为一个超级强的“续写器”。
你给它一段文本:
牛顿看到苹果落下,于是开始思考
它会预测接下来最可能出现什么内容。
如果只是短句续写,这看起来没什么神奇。但如果训练数据包含大量书籍、网页、代码、问答、论文、对话,模型为了做好“续写”,就必须学到很多语言规律、知识结构和任务模式。
比如它要续写:
请用三句话解释牛顿第一定律:
为了生成合理答案,它需要学会:
- 什么是“解释”。
- 什么是“三句话”。
- 什么是“牛顿第一定律”。
- 什么样的回答符合教学场景。
- 什么样的语言适合初学者。
于是,一个看似简单的训练目标,在大规模数据、模型结构和训练方法下,表现出了复杂能力。
这里要注意:说它是“续写器”只是入门类比。真实 LLM 不是简单接龙,而是在高维数学空间里处理 Token 之间的关系。
语言模型是什么
语言模型的核心任务是估计一段文本出现的概率。
更直观地说,它会根据前面的内容,判断后面哪些 Token 更可能出现。
例子:
今天下雨了,我出门前应该带一把 ____
“伞”比“飞机”更可能出现。
如果上下文变成:
今天下雨了,我出门前应该带一把折叠 ____
“伞”的概率会更高。
模型生成回答时,不是一次性把完整答案从仓库里拿出来,而是一步步预测、选择、继续预测。
LLM 的“大”在哪里
LLM 是 Large Language Model,大语言模型。
“大”主要体现在几个方面:
- 参数规模大。
- 训练数据规模大。
- 计算量大。
- 能处理的任务范围广。
但“大”不自动等于“适合所有任务”。
一个大模型可能更擅长复杂推理和通用任务,但在高频、简单、低成本任务上,小模型或规则系统可能更合适。
这会在模块 7 的模型选择中继续展开。
Token 是什么
模型不是直接按人类看到的“字”或“词”处理文本,而是先把文本切成 Token。
Token 可能是:
- 一个汉字。
- 一个英文单词。
- 一个单词的一部分。
- 标点。
- 空格或特殊符号。
文本会先经过 Tokenizer,变成一串 Token ID,然后模型处理这些数字。
这会影响三个实际问题:
1. 成本
很多模型 API 按 Token 计费。
输入越长、输出越长,成本通常越高。
2. 上下文长度
模型一次能处理的 Token 有上限。
系统提示、用户问题、历史对话、检索资料和模型回答都占用上下文。
3. 输出节奏
模型生成时通常也是一个 Token 一个 Token 输出。
这就是为什么你经常看到 AI 回答像打字一样逐步出现。
参数是什么
参数可以粗略理解为模型内部学到的数字。
训练过程中,模型不断调整这些数字,让自己更擅长预测下一个 Token。
参数不是一条条人类可读规则。模型内部不会写着:
如果用户问法国首都,就回答巴黎。
它更像是把大量语言模式、知识痕迹和任务模式编码进一个巨大的数学结构里。
这个说法也是类比,不要误解成模型真的像压缩包一样保存网页。
训练是什么
训练是让模型从大量数据中学习模式的过程。
入门阶段可以先理解三类训练:
1. 预训练
模型在大规模文本和代码数据上学习语言规律、知识关联和通用能力。
预训练解决的是:
模型如何获得基础语言能力和世界知识痕迹?
2. 指令微调
模型学习如何按人类指令完成任务。
例如:
- 总结。
- 翻译。
- 问答。
- 改写。
- 写代码。
- 按格式输出。
预训练让模型“会说话”,指令微调让模型更像“会听任务”。
3. 偏好优化
模型学习人类更喜欢什么样的回答。
例如:
- 更有帮助。
- 更安全。
- 更清楚。
- 更少胡编。
- 更符合对话习惯。
这些过程的具体算法以后再讲。入门阶段先抓住一点:模型不是天生会聊天,而是经过多阶段训练,逐步变成更适合人类使用的助手。
推理是什么
训练完成后,用户输入 Prompt,模型开始生成回答,这个过程叫推理。
推理时大致发生:
- Prompt 被切成 Token。
- Token 进入模型。
- 模型计算下一个 Token 的概率分布。
- 系统根据采样规则选出一个 Token。
- 新 Token 加到上下文里。
- 模型继续预测下一个 Token。
- 直到生成结束。
这解释了两个现象:
- 模型输出通常是逐步出现的。
- 同一个问题多问几次,回答可能不完全一样。
因为生成时可能存在采样和随机性。
图:用户输入经过 Tokenizer、上下文窗口、模型计算与 Token 生成循环,最终输出回答。模型不是从数据库取答案,而是在上下文中一步步预测。
上下文窗口是什么
上下文窗口是模型一次能处理的 Token 总量,包括:
- 系统提示。
- 用户输入。
- 历史对话。
- 检索资料。
- 工具返回结果。
- 模型正在生成的回答。
如果资料太长,超出上下文窗口,模型就不能完整看到。它不是“懒得看”,是真的放不进去。
这也是 RAG 很重要的原因之一:不要把所有资料都塞给模型,而是先检索相关片段,再放进上下文。
为什么 LLM 能做很多事
很多任务都可以转成文本输入输出:
- 翻译:把中文转成英文。
- 总结:把长文转成短文。
- 写代码:把需求转成代码。
- 问答:把问题转成答案。
- 分类:把文本转成标签。
- 规划:把目标转成步骤。
- 解释:把复杂概念转成易懂表达。
LLM 作为通用文本接口,就能覆盖大量任务。
但这也带来问题:模型擅长生成合理文本,不等于它总能保证事实正确。
为什么 LLM 会出错
LLM 的训练目标不是“只说真话”,而是“生成在上下文中合理的内容”。
当它不知道答案、上下文缺少资料、问题本身有陷阱,或者生成过程走到了错误路径,它仍然可能生成一个看起来很顺的回答。
这就是幻觉。
幻觉不是简单的“模型坏了”。它是生成式模型的固有风险之一。
常见原因包括:
- 训练数据里没有相关信息。
- 用户没有提供必要上下文。
- 问题包含错误前提。
- 模型把相似概念混在一起。
- 输出被要求得太确定。
- 采样导致生成路径偏离。
- 模型没有实时访问最新资料。
缓解方法包括:
- 给模型可靠资料。
- 要求引用来源。
- 使用 RAG。
- 限制回答范围。
- 做事实核查。
- 对高风险场景增加人工确认。
LLM 不是这些东西
不是搜索引擎
搜索引擎会查找网页和索引。
LLM 默认是在已有模型能力和上下文中生成回答。
带联网或检索功能的 AI 产品,是在 LLM 外面加了工具。
不是数据库
数据库适合精确存储和查询。
LLM 参数中包含知识痕迹,但不是可精确查询的数据表。
不是人
LLM 能模拟对话,不代表它有人的意识、动机或真实理解体验。
把模型当成人,容易高估它的可靠性。
不是万能工具
LLM 很通用,但通用不等于无边界。
在隐私、安全、医疗、法律、金融、教育评价等场景中,需要更严格的资料、评估和人工审核。
案例:合同总结
用户问:
请总结这份合同里甲方的付款义务。
如果没有上传合同,模型可能会根据常见合同模式编出一个看似合理的回答。
如果上传了合同,模型才有机会根据真实文本总结。
即使上传了合同,也仍然需要检查:
- 是否漏掉条款。
- 是否误解条件。
- 是否把乙方义务写成甲方义务。
- 是否引用了不存在的章节。
- 是否把一般性建议说成法律结论。
这就是为什么严肃场景中,LLM 输出不能直接当最终事实。
案例:课程学习助手
学习者问:
我刚学完 Prompt 基础,下一节应该学什么?
如果模型只根据常识回答,可能会推荐一堆泛泛主题。
如果系统提供了课程目录,它就可以根据课程路径推荐:
- 继续学高质量提示词模式。
- 再学与 LLM 协作的方法。
- 后续进入 RAG 或 Agent。
这说明:LLM 的回答质量不仅取决于模型本身,也取决于它看到的上下文。
术语卡片
| 术语 | 人话解释 |
|---|---|
| LLM | 大语言模型,擅长处理和生成文本的 AI 模型 |
| Token | 模型处理文本的基本单位 |
| Tokenizer | 把文本切成 Token 的工具 |
| 参数 | 模型内部学到的大量数字 |
| 训练 | 调整参数,让模型学会语言和任务模式 |
| 推理 | 用户输入后,模型生成回答的过程 |
| 上下文窗口 | 模型一次能看到的 Token 总量 |
| Prompt | 用户或系统给模型的输入和指令 |
| 幻觉 | 模型生成看似合理但不可靠或错误的内容 |
常见误区
误区 1:LLM 是搜索引擎
LLM 可以回答很多问题,但默认不是实时查网页。需要最新事实时,必须使用检索、联网工具或人工核查。
误区 2:LLM 是数据库
模型不是精确存储系统。它可能记得很多知识模式,但不能保证像数据库一样稳定查询。
误区 3:LLM 会聊天,所以它真的懂我
模型能模拟对话,不等于它有人的意识和真实理解体验。
误区 4:模型说得越自信,越可信
自信语气和事实正确没有必然关系。模型可以很有礼貌地胡说,甚至胡说得很有格式。
误区 5:上下文越多越好
给模型更多资料不一定更好。无关资料会增加成本、延迟和干扰。关键是给它完成任务所需的资料。
动手练习
选择一个你正在使用的 LLM 产品,做三个小测试。
测试 1:常识问题
提问:
请用三句话解释什么是光合作用。
观察:
- 回答是否清楚?
- 是否适合初学者?
- 是否有明显错误?
测试 2:资料依赖问题
找一段你自己的资料,例如课程说明、会议记录或文章片段,先不发给模型,问:
请总结这份资料的核心观点。
再把资料发给模型,重复提问。
观察:
- 没有资料时它是否承认不知道?
- 有资料后回答是否更具体?
- 是否引用或复述了真实内容?
测试 3:错误前提问题
提问:
请解释为什么 2020 年诺贝尔物理学奖颁给了牛顿。
观察:
- 它是否纠正错误前提?
- 还是顺着问题编下去?
检查题(自测)
- 为什么“预测下一个 Token”能产生问答、总结、写代码等能力?
- Token 会影响哪些实际问题?
- LLM 为什么会幻觉?至少说出两个原因。
- LLM 和搜索引擎有什么区别?
- 为什么上下文会影响回答质量?
参考答案
- 因为大量任务都可以表现为“根据上下文生成合适文本”。模型为了做好预测,需要学习语言规律、知识关联、任务格式和对话模式,所以能表现出问答、总结、写代码等能力。
- Token 会影响成本、上下文长度和输出过程。输入和输出越长,通常成本越高;超出上下文窗口的内容模型看不到;模型生成回答时也是逐步生成 Token。
- 原因包括缺少可靠资料、问题有错误前提、模型没有实时信息、概念混淆、采样路径错误、被要求给确定答案等。
- 搜索引擎查找已有网页或索引,LLM 默认根据模型能力和上下文生成回答。带搜索功能的 AI 产品,是把搜索工具接在 LLM 外面。
- 模型只能基于它看到的上下文生成回答。上下文包含资料、历史对话和任务要求。资料不足会让模型猜测,资料相关且清楚会提高回答质量。
Takeaway
LLM 的强大来自大规模训练、模型结构和文本任务的通用性;它的风险也来自同一个地方:它擅长生成合理文本,但合理不等于真实。理解 LLM,第一步不是崇拜它或怀疑它,而是知道它在根据上下文生成内容。