本阶段课程 · 多模态与联网搜索
图像理解、生成与编辑语音与视频:转写、理解和生成联网搜索与资料研究按任务选择 AI 能力与输入
LESSON 13 / 36阅读约 7 分钟

图像理解、生成与编辑

区分识别内容、计算结果和图片外的事实,认识图像任务的边界。

图像理解与图像生成是两类任务

当你上传一张小票,请AI读出商品和金额,这是图像理解:系统从输入图像中提取或解释信息。当你输入“画一张森林里的小屋”,得到一张新图,这是图像生成。编辑已有图像,则同时涉及给定图像与修改指令。

这些能力可能出现在同一个应用里,也可能由不同模型提供。一个能理解图片的模型不一定能直接生成图片;一个能生成图片的工具,也不一定擅长准确读取密集表格。选择工具时,应先看实际输入输出能力。

模型怎样利用图片

图像会被转换成模型能计算的表示。模型学习把画面模式与语言或其他输出联系起来,因此可以描述场景、回答图片相关问题或提取部分文字。具体编码方式随模型而异,不需要把“看图”想成电脑里藏着一双人眼。

图片分辨率、裁剪、方向和清晰度会影响信息是否可读。人物遮住的文字、模糊的数字、很小的表格单元格,都可能成为误差来源。模型生成一段完整描述,并不意味着每个细节都已经可靠识别。

用小票区分三个不同步骤

本课的小票包含笔记本2本,每本12元,小计24元;签字笔3支,每支5元,小计15元;合计39元。识别任务首先是把这些字段读出来。

第二步才是计算:2×12=24,3×5=15,24+15=39。第三步是比较计算结果与票据标注。这样分开之后,如果出现错误,就能判断是读错了数量,还是用了错误算式。

结果属于什么
图片写着笔记本数量为2识别出的内容,需要对照图片
2乘12等于24计算,需要正确的输入与运算
这家店营业到晚上10点图片外的事实,需要其他来源

让AI看小票,不会自动让它知道商店地址、营业时间或付款是否成功。对模糊内容,允许它标为看不清,比要求每个字段都必须填满更合理。

怎样提出图像生成或编辑要求

生成图片时,说明主体、画面内容、用途、比例和风格,通常比堆叠“高清、极致、震撼”等词更具体。做活动海报,还需要区分背景画面与必须准确的文字:日期、价格、联系方式应单独核对,必要时在排版工具中添加。

编辑已有图像时,明确哪些区域或元素要改变,哪些要保留。例如“把背景换成纯灰,保留商品外观与标签内容”。修改后要检查原本要求保留的细节,因为局部编辑也可能影响其他区域。

多模态扩展了模型能处理的材料,但并没有改变基本方法:先明确任务,再提供可读输入,最后按照任务所需精度核对结果。

检查一下理解

AI 从小票正确读出39元,是否说明它知道商店营业时间?

本节参考与继续阅读

下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。

可选练习把图片中的商品整理成表格,并发现“识别文字”和“核对金额”是两件事。
练习目标

把图片中的商品整理成表格,并发现“识别文字”和“核对金额”是两件事。

下载下方小票图片。打开支持图片输入的 AI 对话工具,点击输入框旁的“+”、附件或图片按钮,上传图片,再发送要求。若工具不支持图片,可以先使用图片下的文字版,练习核对步骤。

学习用小票:笔记本2本,每本12元;签字笔3支,每支5元;合计39元。
学习用小票:笔记本2本,每本12元;签字笔3支,每支5元;合计39元。下载练习图片
小票文字版(图片不可上传时使用)
学习用示例,非真实票据
笔记本  数量2  单价12元  小计24元
签字笔  数量3  单价5元  小计15元
合计39元

跟着做一遍

下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。

01

上传图片,只让它抄下来

确认缩略图已经出现在输入框中;仅发文件名,它看不到你电脑里的图片。

发给 AI 的内容
请读取这张学习用小票,按“商品、数量、单价、小计”列成表格。看不清的地方写“看不清”,不要猜。暂时不要解释。
做完后,展开结果对照
对照示例 · 不要求逐字相同

笔记本|2|12元|24元 签字笔|3|5元|15元

为什么这样做先提取,再计算,出了错时才能分清是读错了数字,还是计算出了问题。

02

检查三个等式

拿图片逐项对照表格,然后发送计算要求。

发给 AI 的内容
根据刚才表格,列出每项“数量×单价”的结果,再把小计相加。最后比较图片上的合计。
做完后,展开结果对照
对照示例 · 不要求逐字相同

2×12=24;3×5=15;24+15=39。与小票上的39元一致。

为什么这样做本例很小,你能心算。真实报销表应使用计算器或表格公式核对,不能把模型口头说的“已核对”当作证明。

03

问一个图片没有的信息

继续提问,检查它能不能保留未知。

发给 AI 的内容
这家店的营业时间是什么?只根据图片回答。
做完后,展开结果对照
对照示例 · 不要求逐字相同

图片没有提供店名或营业时间,无法确认。

为什么这样做图中出现的东西才是证据;能看图不意味着知道图片外的事实。

刚才用到的一个新词

多模态

同一个任务中使用文字、图片、声音等不同形式的信息。

没做出来?从这里排查

工具说看不到图片

确认真的附上了文件;没有图片功能时使用文字版练后两步。

识别成2本笔、3本本子

放大原图,指出错行,要求重新读取那一行,不必重做整张表。

换一个例子验证

找一张不含个人信息的菜单或物品标签。

  1. 遮去电话号码、付款码和姓名。
  2. 提取3个字段,给不清楚的内容保留空缺。
  3. 至少核对一个数字和一个“图片没有提供”的事实。
检查标准你能区分图上看见的内容、计算结果和额外猜测。

完成状态仅保存在当前浏览器,可再次点击取消。