本阶段课程 · 多模态与联网搜索
图像理解、生成与编辑
区分识别内容、计算结果和图片外的事实,认识图像任务的边界。
图像理解与图像生成是两类任务
当你上传一张小票,请AI读出商品和金额,这是图像理解:系统从输入图像中提取或解释信息。当你输入“画一张森林里的小屋”,得到一张新图,这是图像生成。编辑已有图像,则同时涉及给定图像与修改指令。
这些能力可能出现在同一个应用里,也可能由不同模型提供。一个能理解图片的模型不一定能直接生成图片;一个能生成图片的工具,也不一定擅长准确读取密集表格。选择工具时,应先看实际输入输出能力。
模型怎样利用图片
图像会被转换成模型能计算的表示。模型学习把画面模式与语言或其他输出联系起来,因此可以描述场景、回答图片相关问题或提取部分文字。具体编码方式随模型而异,不需要把“看图”想成电脑里藏着一双人眼。
图片分辨率、裁剪、方向和清晰度会影响信息是否可读。人物遮住的文字、模糊的数字、很小的表格单元格,都可能成为误差来源。模型生成一段完整描述,并不意味着每个细节都已经可靠识别。
用小票区分三个不同步骤
本课的小票包含笔记本2本,每本12元,小计24元;签字笔3支,每支5元,小计15元;合计39元。识别任务首先是把这些字段读出来。
第二步才是计算:2×12=24,3×5=15,24+15=39。第三步是比较计算结果与票据标注。这样分开之后,如果出现错误,就能判断是读错了数量,还是用了错误算式。
| 结果 | 属于什么 |
|---|---|
| 图片写着笔记本数量为2 | 识别出的内容,需要对照图片 |
| 2乘12等于24 | 计算,需要正确的输入与运算 |
| 这家店营业到晚上10点 | 图片外的事实,需要其他来源 |
让AI看小票,不会自动让它知道商店地址、营业时间或付款是否成功。对模糊内容,允许它标为看不清,比要求每个字段都必须填满更合理。
怎样提出图像生成或编辑要求
生成图片时,说明主体、画面内容、用途、比例和风格,通常比堆叠“高清、极致、震撼”等词更具体。做活动海报,还需要区分背景画面与必须准确的文字:日期、价格、联系方式应单独核对,必要时在排版工具中添加。
编辑已有图像时,明确哪些区域或元素要改变,哪些要保留。例如“把背景换成纯灰,保留商品外观与标签内容”。修改后要检查原本要求保留的细节,因为局部编辑也可能影响其他区域。
多模态扩展了模型能处理的材料,但并没有改变基本方法:先明确任务,再提供可读输入,最后按照任务所需精度核对结果。
检查一下理解
本节参考与继续阅读
下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。
- Google · 图像理解
- Microsoft · 生成式AI与大语言模型导论
对应基础术语、模型工作方式与应用范围;不以其中历史产品示例作为当前能力或报价。
可选练习把图片中的商品整理成表格,并发现“识别文字”和“核对金额”是两件事。
把图片中的商品整理成表格,并发现“识别文字”和“核对金额”是两件事。
下载下方小票图片。打开支持图片输入的 AI 对话工具,点击输入框旁的“+”、附件或图片按钮,上传图片,再发送要求。若工具不支持图片,可以先使用图片下的文字版,练习核对步骤。

学习用示例,非真实票据 笔记本 数量2 单价12元 小计24元 签字笔 数量3 单价5元 小计15元 合计39元
跟着做一遍
下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。
上传图片,只让它抄下来
确认缩略图已经出现在输入框中;仅发文件名,它看不到你电脑里的图片。
请读取这张学习用小票,按“商品、数量、单价、小计”列成表格。看不清的地方写“看不清”,不要猜。暂时不要解释。
做完后,展开结果对照
笔记本|2|12元|24元 签字笔|3|5元|15元
为什么这样做先提取,再计算,出了错时才能分清是读错了数字,还是计算出了问题。
检查三个等式
拿图片逐项对照表格,然后发送计算要求。
根据刚才表格,列出每项“数量×单价”的结果,再把小计相加。最后比较图片上的合计。
做完后,展开结果对照
2×12=24;3×5=15;24+15=39。与小票上的39元一致。
为什么这样做本例很小,你能心算。真实报销表应使用计算器或表格公式核对,不能把模型口头说的“已核对”当作证明。
问一个图片没有的信息
继续提问,检查它能不能保留未知。
这家店的营业时间是什么?只根据图片回答。
做完后,展开结果对照
图片没有提供店名或营业时间,无法确认。
为什么这样做图中出现的东西才是证据;能看图不意味着知道图片外的事实。
多模态
同一个任务中使用文字、图片、声音等不同形式的信息。
没做出来?从这里排查
工具说看不到图片
确认真的附上了文件;没有图片功能时使用文字版练后两步。
识别成2本笔、3本本子
放大原图,指出错行,要求重新读取那一行,不必重做整张表。
换一个例子验证
找一张不含个人信息的菜单或物品标签。
- 遮去电话号码、付款码和姓名。
- 提取3个字段,给不清楚的内容保留空缺。
- 至少核对一个数字和一个“图片没有提供”的事实。
完成状态仅保存在当前浏览器,可再次点击取消。