LLMStart|持续课程 · 不追玄学
模块 6 · 6.4
进阶级75 分钟

6.4多模态产品设计

本课只解决一个主问题:本单元只解决一个主问题:

设计多模态 AI 产品时,为什么不能只是在文本框旁边加一个上传按钮?

学习目标

学完本单元后,学习者应该能够:

  • 判断一个 AI 功能是否真的需要多模态。
  • 设计文本、图片、音频、视频混合输入的用户流程。
  • 理解多模态产品在权限、成本、延迟和评估上的变化。
  • 识别多模态功能常见的体验问题和风险。
  • 为课程产品设计可落地的多模态学习场景。

先给直觉

文本产品的输入通常很清楚:

用户输入一段话,模型返回一段话。

多模态产品的输入会变复杂:

用户上传图片、录音、视频、截图、文档,再提出问题。

这时产品要回答更多问题:

  • 用户上传的是什么?
  • 模型应该看哪一部分?
  • 用户想要理解、生成、修改,还是检索?
  • 文件是否包含隐私信息?
  • 处理需要多久?
  • 结果怎么验证?
  • 失败时如何解释?

多模态不是界面小改动,而是任务、数据、交互和风险一起变化。

先判断是否需要多模态

不是所有产品都需要多模态。

真正需要多模态的情况:

  • 用户的信息本来就在图片、音频或视频里。
  • 用文字描述太慢或不准确。
  • 需要理解视觉布局、声音、动作或时间线。
  • 输出需要视觉素材或音频内容。
  • 学习、创作、检查等任务依赖非文本信息。

不一定需要多模态的情况:

  • 用户只需要普通问答。
  • 图片只是装饰,不影响任务。
  • 上传文件后其实只读取文字。
  • 视频只需要字幕摘要。
  • 成本和延迟无法接受。

多模态能力很强,但不要为了看起来高级而加。课程产品不需要“科技味摆件”。

输入设计

多模态输入需要明确:

输入类型 产品要问的问题
图片 用户要识别、分析、编辑还是生成相似图?
截图 用户想排查错误、评审界面还是提取信息?
音频 是否需要转写、说话人区分、摘要或情绪分析?
视频 是否需要章节、时间戳、关键片段或问答?
文档 是否要抽取文字、理解版面、进入知识库?

上传入口之外,还要让用户说明任务。

例如:

请上传截图,并选择:
- 解释截图内容
- 找出界面问题
- 提取文字
- 根据截图生成操作步骤

任务越明确,模型输出越稳定。

输出设计

多模态输出不一定是文本。

常见输出:

  • 文字解释。
  • 结构化表格。
  • 引用区域。
  • 时间戳。
  • 标注图。
  • 生成图片。
  • 修改后的图片。
  • 音频文件。
  • 视频片段。

产品要根据任务选择合适输出。

例如视频学习助手最好输出:

  • 章节标题。
  • 每章时间戳。
  • 核心概念。
  • 复习题。
  • 可跳转片段。

如果只给一段摘要,用户还是很难复习。

交互流程

多模态功能常见流程:

上传素材
  ↓
选择任务
  ↓
补充问题或目标
  ↓
系统预处理
  ↓
模型分析或生成
  ↓
展示结果
  ↓
用户确认、追问或编辑

预处理可能包括:

  • 图片压缩。
  • OCR。
  • 音频转写。
  • 视频切片。
  • 关键帧抽取。
  • 文件安全检查。
  • 权限检查。

用户不一定要看到这些技术步骤,但产品必须处理它们。

成本与延迟

多模态通常比纯文本更贵、更慢。

原因:

  • 图片和视频包含更多信息。
  • 音视频需要转写或切片。
  • 文件上传和存储有成本。
  • 生成图片、语音、视频可能需要额外模型。
  • 长视频可能需要异步任务。

产品设计要区分:

  • 即时任务:截图问答、图片 OCR、短音频转写。
  • 中等任务:图片分析、会议摘要、图像编辑。
  • 长任务:视频总结、批量素材处理、课程视频索引。

长任务不要假装能立刻完成。给用户进度、预计时间和完成提醒,比让界面转圈更诚实。

权限与隐私

多模态文件常包含敏感信息。

图片可能有:

  • 身份证件。
  • 地址。
  • 人脸。
  • 聊天记录。
  • 后台系统截图。

音视频可能有:

  • 声纹。
  • 会议内容。
  • 未公开课程。
  • 学生信息。
  • 客户信息。

产品需要:

  • 告诉用户文件如何处理。
  • 限制可上传文件类型和大小。
  • 对敏感文件做提示。
  • 控制存储时间。
  • 提供删除机制。
  • 避免把隐私文件用于不必要的训练或分析。

隐私不是法务文件里的一段话,而是用户流程里的真实保护。

评估多模态功能

多模态评估更难,因为输出类型更多。

图片理解

检查:

  • 是否看到了关键区域。
  • 是否正确识别文字。
  • 是否误读图表。
  • 是否把不确定内容说成确定结论。

图片生成

检查:

  • 是否符合主题。
  • 是否符合画幅和风格。
  • 是否出现奇怪文字。
  • 是否有版权或品牌风险。
  • 是否能用于真实场景。

音频

检查:

  • 转写准确率。
  • 说话人区分。
  • 行动项提取。
  • 关键内容是否遗漏。

视频

检查:

  • 章节是否合理。
  • 时间戳是否准确。
  • 摘要是否覆盖关键画面。
  • 是否把字幕外的信息纳入判断。

多模态评估最好用真实样本,而不是只看模型演示。

课程产品场景

多模态很适合课程产品。

可设计场景:

1. 截图答疑

学习者上传报错截图或工具界面截图,AI 帮助解释问题。

注意:

  • 要提醒用户遮挡敏感信息。
  • 输出应包含原因、下一步、风险。

2. 视频课自动笔记

AI 根据课程视频生成章节、知识点和复习题。

注意:

  • 必须保留时间戳。
  • 需要人工抽查关键概念。

3. 作业图片点评

学习者上传草图、流程图、截图或表格,AI 给反馈。

注意:

  • 反馈要基于评分 Rubric。
  • 不要只给泛泛鼓励。

4. 文章配图生成

把课程概念转成插图、封面或图文卡片。

注意:

  • 视觉要服务理解,不只是好看。
  • 含文字的图片要检查可读性。

5. 语音复习

把课程笔记生成音频,或让用户用语音回答检查题。

注意:

  • 语音回答要允许重录。
  • 评估要区分表达问题和理解问题。

常见误区

误区 1:上传按钮就是多模态产品

上传只是入口,任务、权限、预处理、输出和评估才决定产品质量。

误区 2:多模态一定比文本更好

如果文本已经能准确表达任务,多模态可能只是增加成本和复杂度。

误区 3:模型看图就一定看对了

模型可能漏看细节、误读图表、看错文字或忽略上下文。

误区 4:生成图片只要好看就行

课程图片要服务理解,还要考虑版权、文字可读性和事实准确性。

误区 5:音视频摘要可以完全自动发布

课程、会议和访谈摘要需要抽查,尤其是结论、时间戳和责任归属。

动手练习

为一个课程产品设计多模态功能。

填写:

项目 内容
功能名称
目标用户
使用场景
输入类型 图片 / 音频 / 视频 / 文档
用户任务
输出形式
预处理步骤
隐私风险
成本和延迟
评估方法
失败提示
检查题(自测)
  1. 为什么多模态产品不能只靠“上传文件”完成设计?
  2. 多模态功能有哪些成本和延迟来源?
  3. 为课程视频摘要设计评估时,为什么时间戳很重要?
参考答案
  1. 因为产品体验还包括输入边界、上传与预处理、失败兜底、隐私提示、结果展示与评估方式,文件上传只是入口之一。
  2. 成本:多模态 API 调用费、预处理、存储、传输;延迟:上传耗时、预处理耗时、模型推理耗时,都明显高于纯文本。
  3. 时间戳能定位"哪一秒说了什么",是视频摘要可追溯、可跳转、可评估的关键;没有时间戳的摘要无法验证。

Takeaway

多模态产品设计的核心,是让模型处理真实世界里的图片、声音和视频,同时让用户知道系统能做什么、不能做什么、需要等多久、如何保护隐私、如何验证结果。能力越强,产品边界越要清楚。