6.1多模态模型入门
本课只解决一个主问题:本单元只解决一个主问题:多模态 AI 到底是什么,它为什么不只是“让模型看图”?
学习目标
学完本单元后,学习者应该能够:
- 解释什么是多模态模型。
- 区分文本、图像、音频、视频作为输入和输出的不同场景。
- 理解多模态模型为什么对真实工作重要。
- 判断一个产品是否真的需要多模态能力。
- 识别多模态应用的常见风险和评估难点。
先给直觉
人类工作时,很少只处理纯文字。
我们会看:
- 截图
- 表格
- 图片
- 白板
- 视频
- 语音
- 手写笔记
- 网页界面
如果 AI 只能处理文字,它就像一个很聪明但只能听电话的人。你可以描述图片,但描述本身会丢信息,也很费劲。
多模态 AI 的价值是:让模型能直接处理更多类型的信息。
什么是模态
模态可以理解为信息的形式。
常见模态:
- 文本
- 图像
- 音频
- 视频
- 表格
- 代码
- 传感器数据
多模态模型就是能处理多种模态输入或输出的模型。
例如:
- 输入图片,输出文字描述。
- 输入截图和问题,输出操作建议。
- 输入语音,输出文字和总结。
- 输入文本,输出图片。
- 输入视频,输出摘要。
输入多模态与输出多模态
多模态可以从输入和输出两个方向理解。
多模态输入
模型能接收不同类型的输入。
例子:
- 上传截图问:“这个报错是什么意思?”
- 上传图表问:“这张图说明了什么趋势?”
- 上传照片问:“这是什么植物?”
- 上传音频问:“帮我总结会议重点。”
多模态输出
模型能生成不同类型的输出。
例子:
- 根据文字生成图片。
- 根据文本生成语音。
- 根据脚本生成视频草稿。
- 根据数据生成图表。
同一个产品可能同时用到多模态输入和多模态输出。
多模态为什么重要
1. 真实上下文不只是文字
很多问题用文字描述很麻烦。
例如:
这个网页右上角那个蓝色按钮旁边弹出的错误提示是什么意思?
不如直接发截图。
2. 降低用户表达成本
用户不用把看到的东西全部描述出来。
截图、照片、录音、视频都可以成为上下文。
3. 支持更自然的工作流
多模态让 AI 更容易进入真实场景:
- 看合同截图。
- 看设计稿。
- 听会议录音。
- 读手写白板。
- 分析图表。
- 总结视频。
4. 增强产品体验
很多产品的关键体验来自“直接把材料丢进去”。
用户不想先整理成完美文本。用户想说:
你看这个,帮我处理一下。
常见多模态能力
OCR
OCR 是从图片中识别文字。
例如:
- 识别票据。
- 识别截图文字。
- 识别扫描 PDF。
OCR 只是多模态能力的一部分。识别出文字不等于理解图片。
图像描述
模型描述图片内容。
例如:
这张图里有一个人站在白板前,白板上画着流程图。
视觉问答
用户围绕图片提问。
例如:
这张图表里哪一项增长最快?
视觉推理
模型需要结合视觉信息做判断。
例如:
这张产品截图中,用户下一步应该点哪里?
图像生成
根据文本或参考图生成图片。
例如:
生成一张解释 RAG 流程的教学插图。
音频理解
处理语音、会议、访谈或环境音。
常见任务:
- 语音转文字。
- 会议摘要。
- 说话人区分。
- 音频问答。
视频理解
处理视频中的画面、声音和时间结构。
常见任务:
- 视频摘要。
- 章节切分。
- 关键片段定位。
- 教学视频问答。
多模态不等于万能理解
模型能看图,不代表它总能准确理解图。
常见问题:
- 看漏细节。
- 误读图表。
- OCR 错字。
- 空间关系判断错误。
- 对专业图像理解不足。
- 无法可靠识别非常小的文字。
- 对视频长时间关系把握不稳。
多模态能力很有用,但不能把“能看”直接等同于“看得准”。
什么时候需要多模态
适合多模态的场景:
- 用户材料本身是图片、音频或视频。
- 用文字描述成本太高。
- 视觉信息对判断很关键。
- 需要把截图、图表、票据、白板作为上下文。
- 输出需要图片、语音或视频。
不一定需要多模态的场景:
- 纯文本问答。
- 结构化数据查询。
- 简单分类。
- 用户输入已经足够清楚。
多模态不是高级装饰。能用文本稳定解决,就不用强行上传一堆素材给模型开盲盒。
产品设计注意点
输入质量
图片是否清晰?
音频是否有噪音?
视频是否太长?
截图是否包含敏感信息?
输入质量直接影响输出质量。
隐私
图片和音频里经常包含隐私:
- 人脸
- 地址
- 手机号
- 证件
- 公司内部信息
- 客户数据
产品要设计脱敏、权限和提醒。
成本与延迟
多模态输入通常更贵、更慢。
视频尤其明显。
输出可检查性
多模态回答要能让用户检查依据。
例如图表分析,可以说明:
- 它看到了哪些数据。
- 它的结论来自哪里。
- 哪些地方不确定。
案例:课程学习中的多模态
在 AI 课程产品里,多模态可以这样用:
截图答疑
学员上传报错截图。
模型识别错误信息,结合课程内容解释原因。
白板理解
学员上传手写流程图。
模型整理成文字结构。
图示生成
根据课程单元生成教学插图需求。
视频摘要
对录课视频生成章节和复习提纲。
语音问答
学员语音提问,系统转成文本并回答。
这些能力都服务学习任务,而不是为了显得产品“很 AI”。
常见误区
误区 1:多模态就是图片生成
不是。多模态包括理解图片、处理音频、分析视频、生成语音等多种能力。
误区 2:OCR 等于图像理解
OCR 只是识别文字。理解图像还包括布局、对象、关系、趋势和上下文。
误区 3:模型能看图,就能看懂专业图
专业图像需要领域知识和评估,不能只看通用表现。
误区 4:多模态一定提升体验
如果输入麻烦、输出不准、延迟很高,体验反而会下降。
误区 5:图片和音频没有隐私风险
恰恰相反,它们常常包含更多隐私细节。
动手练习
选择一个你熟悉的工作场景,判断是否需要多模态。
填写:
| 问题 | 你的答案 |
|---|---|
| 用户材料是什么模态? | |
| 用文字描述是否麻烦? | |
| 哪些信息必须从图片/音频/视频中获得? | |
| 模型输出如何被验证? | |
| 是否涉及隐私? | |
| 延迟和成本是否可接受? | |
| 如果不用多模态,有没有更简单方案? |
检查题(自测)
- 多模态模型和纯文本模型的核心区别是什么?
- OCR 为什么不等于完整图像理解?
- 判断一个产品是否需要多模态时,至少要考虑哪些因素?
参考答案
- 多模态模型能同时处理文本、图像、音频、视频等多种输入,并统一理解它们;纯文本模型只能处理文字。
- OCR 只负责把图片里的文字提取出来,不理解图像的内容、构图、物体关系和语义。
- 至少考虑:任务是否真的需要多模态输入、数据与成本、评估难度、隐私与版权风险、延迟与体验。
Takeaway
多模态 AI 的价值不是炫技,而是把真实世界里的图片、声音、视频和文本一起变成 AI 可以处理的上下文。它能显著降低用户表达成本,但也带来评估、隐私、成本和可靠性问题。