6.2图像理解与生成
本课只解决一个主问题:本单元只解决一个主问题:AI “看图”和 AI “画图”到底是两类什么能力,应该如何使用和评估?
学习目标
学完本单元后,学习者应该能够:
- 区分图像理解、图像生成和图像编辑。
- 解释视觉问答、OCR、图表理解、截图分析的典型用途。
- 理解图像生成中的提示、参考图、风格和版权风险。
- 判断图像任务的可靠性和评估难点。
- 为课程产品设计合适的图像类 AI 功能。
先给直觉
图像相关 AI 能力可以先分成三类:
看图:理解已有图片
画图:生成新图片
改图:基于已有图片修改
这三类能力很容易被混在一起,但产品设计和风险完全不同。
让 AI 看一张报错截图,目标是理解信息。
让 AI 生成一张课程封面,目标是创作素材。
让 AI 修改一张产品图,目标是编辑已有视觉对象。
同样叫“图像 AI”,其实任务差很多。
图像理解
图像理解是让模型从图片中提取信息、解释内容或回答问题。
常见任务:
- 图片描述。
- OCR。
- 视觉问答。
- 截图分析。
- 图表解读。
- 场景识别。
- 文档理解。
例子:
请看这张课程页面截图,指出用户可能不知道下一步点哪里。
这里模型需要理解页面布局、按钮、文字和用户任务。
OCR
OCR 是识别图片中的文字。
适合:
- 截图文字提取。
- 票据识别。
- 扫描件处理。
- 白板文字整理。
但 OCR 不等于图像理解。
识别出文字只是第一步,理解这些文字在页面、表格或图表中的含义是另一件事。
视觉问答
视觉问答是围绕图片提问。
例子:
这张图表里哪个指标下降最明显?
模型需要:
- 识别图表元素。
- 理解坐标轴。
- 比较数值。
- 形成结论。
图表类任务要特别小心。模型可能看错数值、误解坐标轴,或者把趋势说反。
截图分析
截图分析是多模态模型非常实用的场景。
适合:
- 软件报错。
- 网页体验分析。
- 产品界面评审。
- 操作步骤指导。
- 表单问题排查。
例子:
这是用户在课程网站里的截图。请判断用户下一步可能卡在哪里,并给出改进建议。
截图比文字描述更接近真实场景。
图像生成
图像生成是根据文本、参考图或条件生成新图片。
常见用途:
- 课程封面。
- 概念插图。
- 文章配图。
- 分镜草图。
- 图文卡片。
- 视觉风格探索。
图像生成的输入通常包括:
- 主题。
- 场景。
- 风格。
- 构图。
- 颜色。
- 画幅。
- 是否包含文字。
- 参考图。
图像生成 Prompt
好的图像 Prompt 通常包含:
- 主体:画什么。
- 场景:在哪里。
- 用途:用于课程封面、文章插图还是图表。
- 风格:写实、插画、信息图等。
- 构图:近景、俯视、中心构图等。
- 色彩:明亮、克制、高对比等。
- 画幅:16:9、1:1、竖图等。
- 禁止项:不要出现文字、不要出现品牌标识等。
例子:
为一节解释 RAG 的 AI 课程生成一张教学插图。
画面表现:用户问题进入检索系统,找到资料片段,再交给模型生成回答。
风格:清晰的信息图插画,适合课程页面。
要求:不要出现真实品牌标识,不要使用小字说明。
画幅:16:9。
图像编辑
图像编辑是基于已有图片进行修改。
常见任务:
- 去除背景。
- 替换物体。
- 改变颜色。
- 扩展画布。
- 修复瑕疵。
- 调整风格。
图像编辑比纯生成更依赖参考图。
产品上要注意:
- 用户是否有权修改这张图。
- 是否会改变关键事实。
- 是否需要保留原图。
- 是否需要标注 AI 编辑。
图像理解的评估难点
图像理解评估难在:
- 答案可能有多个合理表达。
- 模型可能漏掉小细节。
- 图表数值需要精确。
- 截图中的文字可能很小。
- 视觉关系可能复杂。
- 专业图像需要领域知识。
评估时要区分:
- 是否看到了关键元素。
- 是否正确解释关系。
- 是否读准文字和数值。
- 是否承认不确定。
- 是否避免过度推断。
图像生成的评估难点
图像生成评估关注:
- 是否符合用途。
- 主题是否准确。
- 构图是否清楚。
- 风格是否一致。
- 是否有版权或相似性风险。
- 是否出现错误文字。
- 是否适合目标平台。
课程图像尤其要看:它是否帮助理解,而不是只好看。
版权与相似性风险
图像生成要注意:
- 不要要求模仿在世艺术家的风格。
- 不要生成高度相似的品牌图、角色或商标。
- 不要把无授权参考图用于商业用途。
- 不要伪造真实人物或真实事件。
- 不要把 AI 图当真实照片误导用户。
课程产品里,图像应服务教学,不应靠擦边相似性吸引注意。
课程产品中的图像 AI
适合的功能:
概念图生成
为 RAG、Agent、Attention 等概念生成教学图。
截图答疑
学员上传界面或报错截图,AI 解释问题。
白板整理
把手写学习笔记整理成结构化大纲。
图表解释
解释模型评估结果或成本对比图。
文章配图规划
为公众号文章生成配图需求,而不是直接生成不受控图片。
常见误区
误区 1:图像理解就是 OCR
OCR 只是识别文字,图像理解还包括布局、对象、关系和视觉推理。
误区 2:图像生成适合所有课程图示
不一定。流程图、架构图、严肃数据图表更适合人工设计或代码绘制。
误区 3:生成图好看就够了
课程图像要帮助理解,不能只当装饰。
误区 4:AI 看图不会编
会。模型可能看漏、误读或过度推断。
误区 5:参考图随便用
参考图涉及版权、隐私和授权,不是随便喂给模型就没事。
动手练习
选择一个课程概念,设计一张图像需求。
填写:
| 项目 | 内容 |
|---|---|
| 概念 | |
| 图像用途 | |
| 目标读者 | |
| 需要表达的核心关系 | |
| 适合生成图还是流程图 | |
| 是否需要文字 | |
| 风格要求 | |
| 版权风险 | |
| 如何判断图是否成功 |
检查题(自测)
- 图像理解、图像生成、图像编辑有什么区别?
- 为什么 OCR 不等于完整图像理解?
- 课程图像生成为什么不能只看好不好看?
参考答案
- 图像理解是"看图片并回答关于它的问题";图像生成是"根据描述从头画一张图";图像编辑是"在已有图片上修改"。
- OCR 只提取文字,不理解图像整体内容、语义与关系,是图像理解的一小部分。
- 课程配图不能只看美观:要评估它是否准确表达概念、有没有错误信息、是否涉及版权或肖像风险、是否适合目标学习者。
Takeaway
图像 AI 分为看图、画图和改图。课程产品里,图像能力最重要的价值是降低理解成本和表达成本,但必须同时关注准确性、版权、隐私和教学目标。