6.4多模态产品设计
本课只解决一个主问题:本单元只解决一个主问题:设计多模态 AI 产品时,为什么不能只是在文本框旁边加一个上传按钮?
学习目标
学完本单元后,学习者应该能够:
- 判断一个 AI 功能是否真的需要多模态。
- 设计文本、图片、音频、视频混合输入的用户流程。
- 理解多模态产品在权限、成本、延迟和评估上的变化。
- 识别多模态功能常见的体验问题和风险。
- 为课程产品设计可落地的多模态学习场景。
先给直觉
文本产品的输入通常很清楚:
用户输入一段话,模型返回一段话。
多模态产品的输入会变复杂:
用户上传图片、录音、视频、截图、文档,再提出问题。
这时产品要回答更多问题:
- 用户上传的是什么?
- 模型应该看哪一部分?
- 用户想要理解、生成、修改,还是检索?
- 文件是否包含隐私信息?
- 处理需要多久?
- 结果怎么验证?
- 失败时如何解释?
多模态不是界面小改动,而是任务、数据、交互和风险一起变化。
先判断是否需要多模态
不是所有产品都需要多模态。
真正需要多模态的情况:
- 用户的信息本来就在图片、音频或视频里。
- 用文字描述太慢或不准确。
- 需要理解视觉布局、声音、动作或时间线。
- 输出需要视觉素材或音频内容。
- 学习、创作、检查等任务依赖非文本信息。
不一定需要多模态的情况:
- 用户只需要普通问答。
- 图片只是装饰,不影响任务。
- 上传文件后其实只读取文字。
- 视频只需要字幕摘要。
- 成本和延迟无法接受。
多模态能力很强,但不要为了看起来高级而加。课程产品不需要“科技味摆件”。
输入设计
多模态输入需要明确:
| 输入类型 | 产品要问的问题 |
|---|---|
| 图片 | 用户要识别、分析、编辑还是生成相似图? |
| 截图 | 用户想排查错误、评审界面还是提取信息? |
| 音频 | 是否需要转写、说话人区分、摘要或情绪分析? |
| 视频 | 是否需要章节、时间戳、关键片段或问答? |
| 文档 | 是否要抽取文字、理解版面、进入知识库? |
上传入口之外,还要让用户说明任务。
例如:
请上传截图,并选择:
- 解释截图内容
- 找出界面问题
- 提取文字
- 根据截图生成操作步骤
任务越明确,模型输出越稳定。
输出设计
多模态输出不一定是文本。
常见输出:
- 文字解释。
- 结构化表格。
- 引用区域。
- 时间戳。
- 标注图。
- 生成图片。
- 修改后的图片。
- 音频文件。
- 视频片段。
产品要根据任务选择合适输出。
例如视频学习助手最好输出:
- 章节标题。
- 每章时间戳。
- 核心概念。
- 复习题。
- 可跳转片段。
如果只给一段摘要,用户还是很难复习。
交互流程
多模态功能常见流程:
上传素材
↓
选择任务
↓
补充问题或目标
↓
系统预处理
↓
模型分析或生成
↓
展示结果
↓
用户确认、追问或编辑
预处理可能包括:
- 图片压缩。
- OCR。
- 音频转写。
- 视频切片。
- 关键帧抽取。
- 文件安全检查。
- 权限检查。
用户不一定要看到这些技术步骤,但产品必须处理它们。
成本与延迟
多模态通常比纯文本更贵、更慢。
原因:
- 图片和视频包含更多信息。
- 音视频需要转写或切片。
- 文件上传和存储有成本。
- 生成图片、语音、视频可能需要额外模型。
- 长视频可能需要异步任务。
产品设计要区分:
- 即时任务:截图问答、图片 OCR、短音频转写。
- 中等任务:图片分析、会议摘要、图像编辑。
- 长任务:视频总结、批量素材处理、课程视频索引。
长任务不要假装能立刻完成。给用户进度、预计时间和完成提醒,比让界面转圈更诚实。
权限与隐私
多模态文件常包含敏感信息。
图片可能有:
- 身份证件。
- 地址。
- 人脸。
- 聊天记录。
- 后台系统截图。
音视频可能有:
- 声纹。
- 会议内容。
- 未公开课程。
- 学生信息。
- 客户信息。
产品需要:
- 告诉用户文件如何处理。
- 限制可上传文件类型和大小。
- 对敏感文件做提示。
- 控制存储时间。
- 提供删除机制。
- 避免把隐私文件用于不必要的训练或分析。
隐私不是法务文件里的一段话,而是用户流程里的真实保护。
评估多模态功能
多模态评估更难,因为输出类型更多。
图片理解
检查:
- 是否看到了关键区域。
- 是否正确识别文字。
- 是否误读图表。
- 是否把不确定内容说成确定结论。
图片生成
检查:
- 是否符合主题。
- 是否符合画幅和风格。
- 是否出现奇怪文字。
- 是否有版权或品牌风险。
- 是否能用于真实场景。
音频
检查:
- 转写准确率。
- 说话人区分。
- 行动项提取。
- 关键内容是否遗漏。
视频
检查:
- 章节是否合理。
- 时间戳是否准确。
- 摘要是否覆盖关键画面。
- 是否把字幕外的信息纳入判断。
多模态评估最好用真实样本,而不是只看模型演示。
课程产品场景
多模态很适合课程产品。
可设计场景:
1. 截图答疑
学习者上传报错截图或工具界面截图,AI 帮助解释问题。
注意:
- 要提醒用户遮挡敏感信息。
- 输出应包含原因、下一步、风险。
2. 视频课自动笔记
AI 根据课程视频生成章节、知识点和复习题。
注意:
- 必须保留时间戳。
- 需要人工抽查关键概念。
3. 作业图片点评
学习者上传草图、流程图、截图或表格,AI 给反馈。
注意:
- 反馈要基于评分 Rubric。
- 不要只给泛泛鼓励。
4. 文章配图生成
把课程概念转成插图、封面或图文卡片。
注意:
- 视觉要服务理解,不只是好看。
- 含文字的图片要检查可读性。
5. 语音复习
把课程笔记生成音频,或让用户用语音回答检查题。
注意:
- 语音回答要允许重录。
- 评估要区分表达问题和理解问题。
常见误区
误区 1:上传按钮就是多模态产品
上传只是入口,任务、权限、预处理、输出和评估才决定产品质量。
误区 2:多模态一定比文本更好
如果文本已经能准确表达任务,多模态可能只是增加成本和复杂度。
误区 3:模型看图就一定看对了
模型可能漏看细节、误读图表、看错文字或忽略上下文。
误区 4:生成图片只要好看就行
课程图片要服务理解,还要考虑版权、文字可读性和事实准确性。
误区 5:音视频摘要可以完全自动发布
课程、会议和访谈摘要需要抽查,尤其是结论、时间戳和责任归属。
动手练习
为一个课程产品设计多模态功能。
填写:
| 项目 | 内容 |
|---|---|
| 功能名称 | |
| 目标用户 | |
| 使用场景 | |
| 输入类型 | 图片 / 音频 / 视频 / 文档 |
| 用户任务 | |
| 输出形式 | |
| 预处理步骤 | |
| 隐私风险 | |
| 成本和延迟 | |
| 评估方法 | |
| 失败提示 |
检查题(自测)
- 为什么多模态产品不能只靠“上传文件”完成设计?
- 多模态功能有哪些成本和延迟来源?
- 为课程视频摘要设计评估时,为什么时间戳很重要?
参考答案
- 因为产品体验还包括输入边界、上传与预处理、失败兜底、隐私提示、结果展示与评估方式,文件上传只是入口之一。
- 成本:多模态 API 调用费、预处理、存储、传输;延迟:上传耗时、预处理耗时、模型推理耗时,都明显高于纯文本。
- 时间戳能定位"哪一秒说了什么",是视频摘要可追溯、可跳转、可评估的关键;没有时间戳的摘要无法验证。
Takeaway
多模态产品设计的核心,是让模型处理真实世界里的图片、声音和视频,同时让用户知道系统能做什么、不能做什么、需要等多久、如何保护隐私、如何验证结果。能力越强,产品边界越要清楚。