本阶段课程 · 多模态与联网搜索
图像理解、生成与编辑语音与视频:转写、理解和生成联网搜索与资料研究按任务选择 AI 能力与输入
LESSON 16 / 36阅读约 7 分钟

按任务选择 AI 能力与输入

从最终产物反推需要的模型、材料和工具,为应用开发建立整体认识。

先确定产物,再决定需要哪种能力

面对一项任务,可以先问:最后需要一段文字、一张表、一张图片,还是一个实际完成的操作?再看输入是什么形式,以及结果需要多高精度。这样的判断,比先选一个热门工具再把任务塞进去更直接。

例如“把活动公告整理成通知”主要是文字处理;“从小票提取金额”需要图像或文字识别;“把金额精确汇总”需要计算;“把结果保存进系统”需要写入工具。一个任务可能跨越多种能力,并不是选择了大模型就自动拥有全部能力。

常见任务与输入输出怎样对应

任务主要输入所需能力最后交付
改写通知原文和要求文本生成待核对文字
读懂小票清晰图片图像理解、必要时计算字段与金额
整理录音音频或校对后的转写转写、总结纪要与待办
查询最新规则问题与可访问来源搜索、阅读带依据的答案
登记报名表单与名单状态规则判断、写入工具实际登记回执

这一张表也解释了“聊天模型”和“AI应用”的区别。应用可以把模型、解析器、搜索和业务工具组合起来。评估一个产品时,要看它如何完成整项任务,不能只看模型名字。

为什么不建议一开始上传所有材料

无关文件会增加阅读与筛选负担,过期资料可能与新资料冲突,图片里的可复制文字又可能在识别过程中引入错误。材料越多,并不自动意味着答案依据越充分。

假设要写活动通知,时间地点在文字公告里,路线在平面图里,主持人开场白在音频里。先写通知正文时,相关公告通常已经足够;要补路线再提供平面图,要写主持稿再处理音频。每次增加材料,都应有明确用途。

技术术语也可以转成选择问题

多模态意味着能处理哪些信息形式;上下文容量意味着一次可以容纳多少输入;工具调用意味着能否请求外部操作;结构化输出意味着结果能否按约定字段交给软件。把功能名称翻译成任务条件,就容易判断自己是否需要它。

不要把“能上传”“能联网”“能调用工具”理解成质量保证。还要测试输入是否读对、来源是否合适、工具是否真的执行成功。功能存在与功能在当前任务中可用,是两次不同的判断。

什么时候需要学习下一阶段的API

如果只是偶尔在聊天里处理个人任务,直接使用应用可能已经足够。希望把模型嵌入自己的表单、批量处理重复输入、连接业务数据,或控制多步执行时,就会遇到API。

下一阶段会从一次请求与响应讲起。你不需要先学会编程,就能看懂应用怎样把问题交给模型,以及怎样在此基础上增加资料、工具和Agent。

检查一下理解

公告已有可复制文字,只要提取时间地点,通常先怎么做?

本节参考与继续阅读

下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。

可选练习为一个真实需求选择足够且合适的材料,避免把无关文件全扔进去。
练习目标

为一个真实需求选择足够且合适的材料,避免把无关文件全扔进去。

打开你常用的 AI 对话工具,选择“新建对话”或“新建聊天”。在输入框粘贴下面的内容,点击发送。后续步骤留在同一段对话里;只有明确要求时才新开对话。

活动任务卡
你要发布一则活动通知。时间和地点在文字公告里;签到路线在一张平面图里;主持人开场白在语音备忘录里。现在只需先写通知正文,不需要路线图和开场白。

跟着做一遍

下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。

01

先问自己到底要交付什么

读任务卡,暂时不要上传文件。把材料清单交给 AI,请它说明最少需要哪些信息。

发给 AI 的内容
我要写活动通知正文。材料有:文字公告(时间地点报名方式)、平面图(签到路线)、语音备忘录(主持人开场白)。请选出本次必要材料,并说明其余两项什么时候才需要。
做完后,展开结果对照
对照示例 · 不要求逐字相同

写通知先用文字公告;补签到路线时再看平面图;准备主持稿时再处理语音。

为什么这样做输入越多,不一定越有用。选择材料是你与 AI 协作的一部分。

02

给它一份可以直接使用的文字

现在只提供与正文相关的事实。

发给 AI 的内容
请用这些信息写通知:周六10:00,社区二楼活动室,旧物交换活动,群里回复“报名”,最多20人。不增加路线、收费或其他规则。
做完后,展开结果对照
对照示例 · 不要求逐字相同

应得到包含时间、地点、主题、报名方式和人数限制的通知,不出现未知停车信息。

为什么这样做能够复制的文字通常不必先截图再识别。保持原材料清楚,能减少中间步骤的错误。

03

材料不足时只请求必要补充

假设又要在通知后面加路线,但你还没提供平面图。

发给 AI 的内容
请补上一句从大门到活动室的路线。当前没有平面图,也没有路线文字。你应该先问我要什么?
做完后,展开结果对照
对照示例 · 不要求逐字相同

请提供平面图或用文字描述从大门到活动室的实际路线;在拿到材料前不编造左转右转。

为什么这样做如果工具不能看图,你可以自己描述路线;选择工具要跟着任务走。

刚才用到的一个新词

输入材料

为当前任务提供的文字、图片、文件或音频;只有相关且可读的内容才能真正帮忙。

没做出来?从这里排查

文件很多,不知道从哪里开始

列出最终结果需要的字段,再逐个寻找能提供这些字段的最小材料。

想让 AI 理解视频,只有一段字幕

说明只有字幕,先处理讲话内容;需要画面时再补截图或视频片段。

换一个例子验证

为自己的一个任务制作材料清单。

  1. 写下最终产物,例如一封邮件或一张费用表。
  2. 给每份材料标注“必要”“稍后再用”“无关”。
  3. 先只用必要材料完成最小版本,再补一项真正有用的信息。
检查标准每次上传或粘贴都能说清楚它解决了哪个问题。

完成状态仅保存在当前浏览器,可再次点击取消。