LLMStart|持续课程 · 不追玄学
模块 1 · 1.3
入门级40 分钟

1.3当代 AI 生态地图

本课只解决一个主问题:本单元只解决一个主问题:

今天的 AI 生态里,到底有哪些主要组成部分,它们之间是什么关系?

学习目标

学完本单元后,学习者应该能够:

  • 识别 AI 生态中的主要角色:模型、应用、工具、数据、基础设施。
  • 区分基座模型、Chatbot、Copilot、Agent、多模态模型。
  • 理解开源模型、闭源模型、云端 API、本地部署的基本取舍。
  • 建立后续学习的全局地图。

先给直觉

如果把 AI 生态看成一个城市,基座模型像发电厂,应用像商店和工厂,数据像原材料,工具和平台像道路、电网、物流系统。

普通用户看到的是应用:

  • ChatGPT
  • AI 搜索
  • AI 编程助手
  • AI 写作工具
  • AI 图片工具

但应用背后还有一整套结构:

  • 模型提供能力。
  • 数据提供上下文。
  • 工具连接外部世界。
  • 平台负责部署、计费、权限和监控。
  • 产品设计决定用户如何使用。

只看聊天窗口,很容易误以为 AI 就是一个问答框。

当代 AI 生态地图:应用层、模型层、基础设施层与支撑层

图:一个 AI 产品从模型到用户,要经过应用层、模型层、基础设施层,并由支撑层托底。

生态组件

1. 基座模型

基座模型是很多 AI 应用的能力来源。

它们可以是:

  • 文本模型
  • 代码模型
  • 多模态模型
  • 图像生成模型
  • 语音模型

基座模型通常不是最终产品。它更像发动机,需要被装进具体产品和工作流。

2. Chatbot

Chatbot 是最容易理解的 AI 应用形态:用户提问,模型回答。

优点:

  • 上手容易。
  • 适合开放式探索。
  • 适合解释、总结、改写、头脑风暴。

局限:

  • 对任务流程控制弱。
  • 输出质量依赖用户提问能力。
  • 严肃任务需要额外验证。

3. Copilot

Copilot 是嵌入工作场景的 AI 助手。

例如:

  • 编程工具里的代码补全。
  • 文档工具里的写作建议。
  • 设计工具里的生成辅助。
  • 数据分析工具里的公式或图表建议。

Copilot 的特点是:它不要求用户离开原本工作环境,而是在流程中提供辅助。

4. Agent

Agent 不只是回答,还会围绕目标采取行动。

典型能力包括:

  • 拆解任务。
  • 调用工具。
  • 读取结果。
  • 调整下一步。
  • 在必要时请求人类确认。

Agent 很有吸引力,但也更容易出错。因为它不只是“说错”,还可能“做错”。

5. 多模态模型

多模态模型可以处理不止一种输入或输出。

常见形式:

  • 文本 + 图像输入。
  • 文本生成图像。
  • 语音输入、文本输出。
  • 视频理解与总结。

多模态的重要性在于:真实工作不是只有文字。截图、表格、图片、语音、视频都是上下文。

6. RAG 与知识库

很多 AI 应用需要回答私有、实时或专业资料中的问题。

这时就需要 RAG:

  1. 用户提问。
  2. 系统检索相关资料。
  3. 把资料放进上下文。
  4. 模型根据资料回答。

RAG 是很多企业知识库、AI 搜索、客服助手的基础结构。

7. 工具调用

模型本身只能生成文本或结构化输出。要让它获取实时信息或执行动作,就需要工具。

工具可以是:

  • 搜索网页
  • 查询数据库
  • 调用日历
  • 发送邮件
  • 执行代码
  • 生成图片

工具调用让模型从“会说”走向“能办事”,但也引入权限和安全问题。

8. 开源模型与闭源模型

闭源模型通常通过 API 或产品使用。

优点:

  • 能力强。
  • 使用方便。
  • 运维压力小。

风险:

  • 成本依赖供应商。
  • 数据和合规需要评估。
  • 产品策略变化会影响使用。

开源模型可以下载、微调或私有部署。

优点:

  • 可控性强。
  • 适合私有化和定制。
  • 生态透明度更高。

挑战:

  • 部署和优化门槛更高。
  • 综合能力未必适合所有任务。
  • 需要工程团队维护。

9. 云端 API、本地部署与边缘模型

云端 API 适合快速开发和能力验证。

本地部署适合数据敏感、成本可控或需要深度定制的场景。

边缘模型适合手机、电脑、设备端的低延迟和隐私场景。

没有绝对最好,只有任务约束不同。

案例

假设你要做一个“AI 课程学习助手”。

可能架构是:

  • 基座模型:负责对话和解释。
  • RAG:检索课程讲义和资料。
  • 工具调用:生成练习题、记录学习进度。
  • 多模态:读取截图或手写笔记。
  • 产品层:提供课程路径、答疑、复习和测评。
  • 评估系统:检查回答是否引用课程资料、是否误导学习者。

这比“接一个聊天 API”复杂得多,但也更像真正的课程产品。

常见误区

误区 1:有了强模型,就有了强产品

强模型只是起点。产品还需要场景、数据、流程、评估和用户体验。

误区 2:Agent 可以自动解决所有流程问题

Agent 适合有明确目标、可观察结果和可控工具的任务。开放、模糊、高风险任务需要谨慎。

误区 3:开源一定便宜

开源模型没有 API 单次费用,不代表总成本低。部署、显卡、优化、监控和维护都要成本。

误区 4:多模态只是“看图聊天”

多模态真正重要的是把真实工作材料变成上下文,比如截图、票据、视频、白板和手写笔记。

动手练习

选择一个你熟悉的 AI 产品,尝试拆成以下部分:

组件 你的判断
它是 Chatbot、Copilot 还是 Agent?
它可能使用了哪些模型能力?
它是否需要外部知识库?
它是否调用工具?
它最大的风险是什么?

术语卡片

术语 人话解释
基座模型 经过大规模预训练、可支撑多种应用的通用模型
Chatbot 以"提问-回答"对话为主的 AI 产品形态
Copilot 嵌入工作流程、在旁边辅助人类操作的 AI 形态
Agent 能规划、调用工具、自主执行多步骤任务的 AI 形态
多模态模型 能处理文本、图像、音频等多种输入的模型
开源模型 权重公开、可自己部署的模型
闭源模型 只能通过官方接口(API)使用的模型
云端 API 通过网络远程调用模型能力的方式
本地部署 把模型运行在自己服务器或设备上
边缘模型 运行在手机等端侧设备上的轻量模型
检查题(自测)
  1. 基座模型和 AI 应用有什么区别?
  2. Chatbot、Copilot、Agent 的差异是什么?
  3. 为什么开源模型不一定总成本更低?
参考答案
  1. 基座模型是提供通用能力的底层模型,例如文本生成、代码生成、图像理解、多模态处理等。AI 应用是在基座模型之上,结合产品界面、业务流程、数据、工具、权限、计费和评估形成的用户可用产品。简单说,基座模型提供能力,AI 应用把能力放进具体场景。
  2. Chatbot 主要是对话问答,用户提问,模型回答。Copilot 是嵌入具体工作场景中的辅助工具,例如代码编辑器、文档工具、设计工具中的 AI 辅助。Agent 则围绕目标动态规划步骤,调用工具,观察结果,并继续执行任务。
  3. 开源模型可能没有闭源 API 的单次调用费用,但仍然有部署、显卡、存储、推理优化、监控、维护、升级和工程人力成本。如果使用量不大,或者团队缺少模型部署经验,开源模型的总成本可能并不低。

Takeaway

当代 AI 生态不是一个聊天框,而是一套由模型、数据、工具、产品、基础设施和评估组成的系统。理解这张地图,后面学 RAG、Agent、模型评估才不会迷路。