本阶段课程 · 可靠使用与综合实践
隐私、数据边界与提示注入评估:怎样判断结果真的变好成本与效率:计算一项任务的总投入综合实践:解释并完成一个 AI 项目
LESSON 34 / 36阅读约 7 分钟

评估:怎样判断结果真的变好

建立代表性问题和通过标准,用可比较的记录改进系统。

评估是用任务标准判断结果是否可用

一个模型在某次演示里回答得很好,不代表它在你的任务上一直可靠。评估需要准备有代表性的输入,并在看到结果之前,明确什么算通过。随后用相同标准检查实际输出。

标准应与用途有关。活动通知必须包含时间、地点和报名方式;规则问答需要使用当前来源并保留未知;预约助手需要有明确授权与回执。文字是否漂亮,只是其中可能的一项。

用五个问题建立最小检查集

假设助手根据活动规则回答问题,规则包含时间、退款时限与阅读要求,但没有停车费用。可以准备下面几类题,而不是只问一个最容易的问题。

类型问题示例检查重点
直接事实活动几点开始?是否正确提取
满足条件提前30小时取消能退吗?是否理解时限
不满足条件提前2小时取消能退吗?是否保留限制与替代办法
换一种问法书没读完能不能来?是否找到同一条规则
无答案停车免费吗?是否保留未知

标准答案不用限定每一个词。例如“可以参加”和“不要求读完也能来”可以表达同一规则。但若把“可以转让名额”写成“可以随时退款”,就是关键错误。

怎样比较一次改动是否有效

先保存修改前的结果,再只改变一个主要因素,例如提示词的未知处理要求或检索版本过滤。随后用同一组输入重新运行,比较哪些错误减少,哪些新问题出现。

如果每次都换不同问题,就很难知道是修改生效,还是新问题更容易。只展示表现最好的一次,也容易掩盖不稳定性。对于有随机性的生成任务,必要时应观察重复运行,而不把一次结果当成固定能力。

错误怎样分类才有帮助

错误可能来自资料读取、检索、理解、格式或实际执行。找错来源应修检索或版本管理;格式不符合约定,应检查结构要求与程序验证;工具没有执行成功,应处理外部依赖,而不是只润色答复。

让AI辅助检查可以节省整理时间,但评估本身也需要依据。重要事实仍应回到原文或业务记录。一个模型给另一个模型打出高分,并不能自动证明结果正确。

除了质量,还应记录什么

记录总耗时、模型用量、工具失败、人工修改与返工。一个答案生成很快,却要人花十分钟逐句修正,未必比原流程更好。也要区分一般措辞问题与会导致错误行动的关键问题,不能简单平均掉严重错误。

小检查集是起点。实际使用中遇到的新失败,应加入后续评估。这样改进有可积累的证据,而不是不断更换模型、改长提示词,却不知道哪里真正变好了。

检查一下理解

修改提示词后,怎样比较效果最有用?

本节参考与继续阅读

下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。

可选练习给规则问答助手准备一份小而有用的检查表,发现具体问题再修改。
练习目标

给规则问答助手准备一份小而有用的检查表,发现具体问题再修改。

打开你常用的 AI 对话工具,选择“新建对话”或“新建聊天”。在输入框粘贴下面的内容,点击发送。后续步骤留在同一段对话里;只有明确要求时才新开对话。

五题验收表
规则:周日14—16点,最多12人;提前至少24小时可全额退,不足24小时不退但可转让;不要求读完整本书;停车费用未知。
1. 活动几点开始?标准:周日14点。
2. 提前30小时取消能退吗?标准:可以。
3. 提前2小时取消能退吗?标准:不可以,可转让。
4. 没读完整本书能参加吗?标准:可以。
5. 停车免费吗?标准:资料不足,无法确认。
下载练习文件 · TXT

跟着做一遍

下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。

01

先写标准,再看模型答案

保存验收表。把规则作为来源提供给助手,逐题提问,不把标准答案一起当作问题喂给它。

发给 AI 的内容
当前规则:周日14—16点,最多12人;提前至少24小时可全额退款,不足24小时不退款但可转让;不要求读完整本书;未提供停车费用。请只依据这些规则回答。先回答:提前2小时取消能退款吗?
做完后,展开结果对照
对照示例 · 不要求逐字相同

合格答案包含不能退款与可以转让,不擅自承诺例外。措辞可以不同。

为什么这样做先写标准能减少被流畅回答影响判断。你在测它是否满足任务,而不是是否与你的范文逐字相同。

02

逐题记录错误类型

另外四题分别询问,把每次实际回答与自己的验收表并排检查。

发给 AI 的内容
请给我一个空白检查表,列名为题号、实际回答、关键事实是否正确、是否编造、依据是否可核对、需要修改什么。不要替我填写尚未运行的结果。
做完后,展开结果对照
对照示例 · 不要求逐字相同

得到一张等待填写的表;只有实际运行过,才能填通过或不通过。

为什么这样做日期错、条件丢失、无依据猜测与引用错误需要不同修法,不应只给一个笼统的“80分”。

03

只改一个因素,再跑同样五题

如果停车问题被猜成免费,先加强未知处理或修正来源,再用同一组题重新检查。

发给 AI 的内容
在原有规则之外增加回答要求:资料没有覆盖的问题,请明确说明无法确认;不要依据常识补写费用、电话或设施。其他任务不变。
做完后,展开结果对照
对照示例 · 不要求逐字相同

如果修改有效,第5题应保留未知,前4题也应继续正确。不能只测试刚修好的那一题。

为什么这样做针对问题做小改动,比较同一组输入,才能知道修改是否带来实际改善。

刚才用到的一个新词

评估

用代表性任务和预先写好的标准,检查质量与边界,并据此判断一次改动是否有效。

没做出来?从这里排查

每次都换问题,无法判断是否改进

保留一组固定任务,同时另加新案例探索未知问题。

让同一个AI自己打分就结束

用原文、计算器或实际系统记录核对关键项,模型评价只作辅助。

换一个例子验证

为自己的小应用写五题测试。

  1. 包含普通题、边界题和缺资料题。
  2. 先写标准答案或通过条件,再运行。
  3. 修一个问题后重测这五题,并保存前后记录。
检查标准可以具体说出哪项变好了、哪项仍有风险,而不是只说“感觉更聪明”。

完成状态仅保存在当前浏览器,可再次点击取消。