本阶段课程 · 多模态与联网搜索
按任务选择 AI 能力与输入
从最终产物反推需要的模型、材料和工具,为应用开发建立整体认识。
先确定产物,再决定需要哪种能力
面对一项任务,可以先问:最后需要一段文字、一张表、一张图片,还是一个实际完成的操作?再看输入是什么形式,以及结果需要多高精度。这样的判断,比先选一个热门工具再把任务塞进去更直接。
例如“把活动公告整理成通知”主要是文字处理;“从小票提取金额”需要图像或文字识别;“把金额精确汇总”需要计算;“把结果保存进系统”需要写入工具。一个任务可能跨越多种能力,并不是选择了大模型就自动拥有全部能力。
常见任务与输入输出怎样对应
| 任务 | 主要输入 | 所需能力 | 最后交付 |
|---|---|---|---|
| 改写通知 | 原文和要求 | 文本生成 | 待核对文字 |
| 读懂小票 | 清晰图片 | 图像理解、必要时计算 | 字段与金额 |
| 整理录音 | 音频或校对后的转写 | 转写、总结 | 纪要与待办 |
| 查询最新规则 | 问题与可访问来源 | 搜索、阅读 | 带依据的答案 |
| 登记报名 | 表单与名单状态 | 规则判断、写入工具 | 实际登记回执 |
这一张表也解释了“聊天模型”和“AI应用”的区别。应用可以把模型、解析器、搜索和业务工具组合起来。评估一个产品时,要看它如何完成整项任务,不能只看模型名字。
为什么不建议一开始上传所有材料
无关文件会增加阅读与筛选负担,过期资料可能与新资料冲突,图片里的可复制文字又可能在识别过程中引入错误。材料越多,并不自动意味着答案依据越充分。
假设要写活动通知,时间地点在文字公告里,路线在平面图里,主持人开场白在音频里。先写通知正文时,相关公告通常已经足够;要补路线再提供平面图,要写主持稿再处理音频。每次增加材料,都应有明确用途。
技术术语也可以转成选择问题
多模态意味着能处理哪些信息形式;上下文容量意味着一次可以容纳多少输入;工具调用意味着能否请求外部操作;结构化输出意味着结果能否按约定字段交给软件。把功能名称翻译成任务条件,就容易判断自己是否需要它。
不要把“能上传”“能联网”“能调用工具”理解成质量保证。还要测试输入是否读对、来源是否合适、工具是否真的执行成功。功能存在与功能在当前任务中可用,是两次不同的判断。
什么时候需要学习下一阶段的API
如果只是偶尔在聊天里处理个人任务,直接使用应用可能已经足够。希望把模型嵌入自己的表单、批量处理重复输入、连接业务数据,或控制多步执行时,就会遇到API。
下一阶段会从一次请求与响应讲起。你不需要先学会编程,就能看懂应用怎样把问题交给模型,以及怎样在此基础上增加资料、工具和Agent。
检查一下理解
本节参考与继续阅读
下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。
- Microsoft · 生成式AI与大语言模型导论
对应基础术语、模型工作方式与应用范围;不以其中历史产品示例作为当前能力或报价。
- Hugging Face · What are LLMs?
对应逐Token生成、注意力、训练与模型调用。本站不要求掌握模型架构代码。
可选练习为一个真实需求选择足够且合适的材料,避免把无关文件全扔进去。
为一个真实需求选择足够且合适的材料,避免把无关文件全扔进去。
打开你常用的 AI 对话工具,选择“新建对话”或“新建聊天”。在输入框粘贴下面的内容,点击发送。后续步骤留在同一段对话里;只有明确要求时才新开对话。
你要发布一则活动通知。时间和地点在文字公告里;签到路线在一张平面图里;主持人开场白在语音备忘录里。现在只需先写通知正文,不需要路线图和开场白。
跟着做一遍
下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。
先问自己到底要交付什么
读任务卡,暂时不要上传文件。把材料清单交给 AI,请它说明最少需要哪些信息。
我要写活动通知正文。材料有:文字公告(时间地点报名方式)、平面图(签到路线)、语音备忘录(主持人开场白)。请选出本次必要材料,并说明其余两项什么时候才需要。
做完后,展开结果对照
写通知先用文字公告;补签到路线时再看平面图;准备主持稿时再处理语音。
为什么这样做输入越多,不一定越有用。选择材料是你与 AI 协作的一部分。
给它一份可以直接使用的文字
现在只提供与正文相关的事实。
请用这些信息写通知:周六10:00,社区二楼活动室,旧物交换活动,群里回复“报名”,最多20人。不增加路线、收费或其他规则。
做完后,展开结果对照
应得到包含时间、地点、主题、报名方式和人数限制的通知,不出现未知停车信息。
为什么这样做能够复制的文字通常不必先截图再识别。保持原材料清楚,能减少中间步骤的错误。
材料不足时只请求必要补充
假设又要在通知后面加路线,但你还没提供平面图。
请补上一句从大门到活动室的路线。当前没有平面图,也没有路线文字。你应该先问我要什么?
做完后,展开结果对照
请提供平面图或用文字描述从大门到活动室的实际路线;在拿到材料前不编造左转右转。
为什么这样做如果工具不能看图,你可以自己描述路线;选择工具要跟着任务走。
输入材料
为当前任务提供的文字、图片、文件或音频;只有相关且可读的内容才能真正帮忙。
没做出来?从这里排查
文件很多,不知道从哪里开始
列出最终结果需要的字段,再逐个寻找能提供这些字段的最小材料。
想让 AI 理解视频,只有一段字幕
说明只有字幕,先处理讲话内容;需要画面时再补截图或视频片段。
换一个例子验证
为自己的一个任务制作材料清单。
- 写下最终产物,例如一封邮件或一张费用表。
- 给每份材料标注“必要”“稍后再用”“无关”。
- 先只用必要材料完成最小版本,再补一项真正有用的信息。
完成状态仅保存在当前浏览器,可再次点击取消。