LLMStart|持续课程 · 不追玄学
模块 6 · 6.2
进阶级65 分钟

6.2图像理解与生成

本课只解决一个主问题:本单元只解决一个主问题:

AI “看图”和 AI “画图”到底是两类什么能力,应该如何使用和评估?

学习目标

学完本单元后,学习者应该能够:

  • 区分图像理解、图像生成和图像编辑。
  • 解释视觉问答、OCR、图表理解、截图分析的典型用途。
  • 理解图像生成中的提示、参考图、风格和版权风险。
  • 判断图像任务的可靠性和评估难点。
  • 为课程产品设计合适的图像类 AI 功能。

先给直觉

图像相关 AI 能力可以先分成三类:

看图:理解已有图片
画图:生成新图片
改图:基于已有图片修改

这三类能力很容易被混在一起,但产品设计和风险完全不同。

让 AI 看一张报错截图,目标是理解信息。

让 AI 生成一张课程封面,目标是创作素材。

让 AI 修改一张产品图,目标是编辑已有视觉对象。

同样叫“图像 AI”,其实任务差很多。

图像理解

图像理解是让模型从图片中提取信息、解释内容或回答问题。

常见任务:

  • 图片描述。
  • OCR。
  • 视觉问答。
  • 截图分析。
  • 图表解读。
  • 场景识别。
  • 文档理解。

例子:

请看这张课程页面截图,指出用户可能不知道下一步点哪里。

这里模型需要理解页面布局、按钮、文字和用户任务。

OCR

OCR 是识别图片中的文字。

适合:

  • 截图文字提取。
  • 票据识别。
  • 扫描件处理。
  • 白板文字整理。

但 OCR 不等于图像理解。

识别出文字只是第一步,理解这些文字在页面、表格或图表中的含义是另一件事。

视觉问答

视觉问答是围绕图片提问。

例子:

这张图表里哪个指标下降最明显?

模型需要:

  • 识别图表元素。
  • 理解坐标轴。
  • 比较数值。
  • 形成结论。

图表类任务要特别小心。模型可能看错数值、误解坐标轴,或者把趋势说反。

截图分析

截图分析是多模态模型非常实用的场景。

适合:

  • 软件报错。
  • 网页体验分析。
  • 产品界面评审。
  • 操作步骤指导。
  • 表单问题排查。

例子:

这是用户在课程网站里的截图。请判断用户下一步可能卡在哪里,并给出改进建议。

截图比文字描述更接近真实场景。

图像生成

图像生成是根据文本、参考图或条件生成新图片。

常见用途:

  • 课程封面。
  • 概念插图。
  • 文章配图。
  • 分镜草图。
  • 图文卡片。
  • 视觉风格探索。

图像生成的输入通常包括:

  • 主题。
  • 场景。
  • 风格。
  • 构图。
  • 颜色。
  • 画幅。
  • 是否包含文字。
  • 参考图。

图像生成 Prompt

好的图像 Prompt 通常包含:

  • 主体:画什么。
  • 场景:在哪里。
  • 用途:用于课程封面、文章插图还是图表。
  • 风格:写实、插画、信息图等。
  • 构图:近景、俯视、中心构图等。
  • 色彩:明亮、克制、高对比等。
  • 画幅:16:9、1:1、竖图等。
  • 禁止项:不要出现文字、不要出现品牌标识等。

例子:

为一节解释 RAG 的 AI 课程生成一张教学插图。
画面表现:用户问题进入检索系统,找到资料片段,再交给模型生成回答。
风格:清晰的信息图插画,适合课程页面。
要求:不要出现真实品牌标识,不要使用小字说明。
画幅:16:9。

图像编辑

图像编辑是基于已有图片进行修改。

常见任务:

  • 去除背景。
  • 替换物体。
  • 改变颜色。
  • 扩展画布。
  • 修复瑕疵。
  • 调整风格。

图像编辑比纯生成更依赖参考图。

产品上要注意:

  • 用户是否有权修改这张图。
  • 是否会改变关键事实。
  • 是否需要保留原图。
  • 是否需要标注 AI 编辑。

图像理解的评估难点

图像理解评估难在:

  • 答案可能有多个合理表达。
  • 模型可能漏掉小细节。
  • 图表数值需要精确。
  • 截图中的文字可能很小。
  • 视觉关系可能复杂。
  • 专业图像需要领域知识。

评估时要区分:

  • 是否看到了关键元素。
  • 是否正确解释关系。
  • 是否读准文字和数值。
  • 是否承认不确定。
  • 是否避免过度推断。

图像生成的评估难点

图像生成评估关注:

  • 是否符合用途。
  • 主题是否准确。
  • 构图是否清楚。
  • 风格是否一致。
  • 是否有版权或相似性风险。
  • 是否出现错误文字。
  • 是否适合目标平台。

课程图像尤其要看:它是否帮助理解,而不是只好看。

版权与相似性风险

图像生成要注意:

  • 不要要求模仿在世艺术家的风格。
  • 不要生成高度相似的品牌图、角色或商标。
  • 不要把无授权参考图用于商业用途。
  • 不要伪造真实人物或真实事件。
  • 不要把 AI 图当真实照片误导用户。

课程产品里,图像应服务教学,不应靠擦边相似性吸引注意。

课程产品中的图像 AI

适合的功能:

概念图生成

为 RAG、Agent、Attention 等概念生成教学图。

截图答疑

学员上传界面或报错截图,AI 解释问题。

白板整理

把手写学习笔记整理成结构化大纲。

图表解释

解释模型评估结果或成本对比图。

文章配图规划

为公众号文章生成配图需求,而不是直接生成不受控图片。

常见误区

误区 1:图像理解就是 OCR

OCR 只是识别文字,图像理解还包括布局、对象、关系和视觉推理。

误区 2:图像生成适合所有课程图示

不一定。流程图、架构图、严肃数据图表更适合人工设计或代码绘制。

误区 3:生成图好看就够了

课程图像要帮助理解,不能只当装饰。

误区 4:AI 看图不会编

会。模型可能看漏、误读或过度推断。

误区 5:参考图随便用

参考图涉及版权、隐私和授权,不是随便喂给模型就没事。

动手练习

选择一个课程概念,设计一张图像需求。

填写:

项目 内容
概念
图像用途
目标读者
需要表达的核心关系
适合生成图还是流程图
是否需要文字
风格要求
版权风险
如何判断图是否成功
检查题(自测)
  1. 图像理解、图像生成、图像编辑有什么区别?
  2. 为什么 OCR 不等于完整图像理解?
  3. 课程图像生成为什么不能只看好不好看?
参考答案
  1. 图像理解是"看图片并回答关于它的问题";图像生成是"根据描述从头画一张图";图像编辑是"在已有图片上修改"。
  2. OCR 只提取文字,不理解图像整体内容、语义与关系,是图像理解的一小部分。
  3. 课程配图不能只看美观:要评估它是否准确表达概念、有没有错误信息、是否涉及版权或肖像风险、是否适合目标学习者。

Takeaway

图像 AI 分为看图、画图和改图。课程产品里,图像能力最重要的价值是降低理解成本和表达成本,但必须同时关注准确性、版权、隐私和教学目标。