本阶段课程 · 可靠使用与综合实践
评估:怎样判断结果真的变好
建立代表性问题和通过标准,用可比较的记录改进系统。
评估是用任务标准判断结果是否可用
一个模型在某次演示里回答得很好,不代表它在你的任务上一直可靠。评估需要准备有代表性的输入,并在看到结果之前,明确什么算通过。随后用相同标准检查实际输出。
标准应与用途有关。活动通知必须包含时间、地点和报名方式;规则问答需要使用当前来源并保留未知;预约助手需要有明确授权与回执。文字是否漂亮,只是其中可能的一项。
用五个问题建立最小检查集
假设助手根据活动规则回答问题,规则包含时间、退款时限与阅读要求,但没有停车费用。可以准备下面几类题,而不是只问一个最容易的问题。
| 类型 | 问题示例 | 检查重点 |
|---|---|---|
| 直接事实 | 活动几点开始? | 是否正确提取 |
| 满足条件 | 提前30小时取消能退吗? | 是否理解时限 |
| 不满足条件 | 提前2小时取消能退吗? | 是否保留限制与替代办法 |
| 换一种问法 | 书没读完能不能来? | 是否找到同一条规则 |
| 无答案 | 停车免费吗? | 是否保留未知 |
标准答案不用限定每一个词。例如“可以参加”和“不要求读完也能来”可以表达同一规则。但若把“可以转让名额”写成“可以随时退款”,就是关键错误。
怎样比较一次改动是否有效
先保存修改前的结果,再只改变一个主要因素,例如提示词的未知处理要求或检索版本过滤。随后用同一组输入重新运行,比较哪些错误减少,哪些新问题出现。
如果每次都换不同问题,就很难知道是修改生效,还是新问题更容易。只展示表现最好的一次,也容易掩盖不稳定性。对于有随机性的生成任务,必要时应观察重复运行,而不把一次结果当成固定能力。
错误怎样分类才有帮助
错误可能来自资料读取、检索、理解、格式或实际执行。找错来源应修检索或版本管理;格式不符合约定,应检查结构要求与程序验证;工具没有执行成功,应处理外部依赖,而不是只润色答复。
让AI辅助检查可以节省整理时间,但评估本身也需要依据。重要事实仍应回到原文或业务记录。一个模型给另一个模型打出高分,并不能自动证明结果正确。
除了质量,还应记录什么
记录总耗时、模型用量、工具失败、人工修改与返工。一个答案生成很快,却要人花十分钟逐句修正,未必比原流程更好。也要区分一般措辞问题与会导致错误行动的关键问题,不能简单平均掉严重错误。
小检查集是起点。实际使用中遇到的新失败,应加入后续评估。这样改进有可积累的证据,而不是不断更换模型、改长提示词,却不知道哪里真正变好了。
检查一下理解
本节参考与继续阅读
下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。
- OpenAI · 评估实践
- Anthropic · AI Fluency 课程大纲
参考描述任务、检查结果、再次反馈的协作过程;没有照搬其整套课程。
可选练习给规则问答助手准备一份小而有用的检查表,发现具体问题再修改。
给规则问答助手准备一份小而有用的检查表,发现具体问题再修改。
打开你常用的 AI 对话工具,选择“新建对话”或“新建聊天”。在输入框粘贴下面的内容,点击发送。后续步骤留在同一段对话里;只有明确要求时才新开对话。
规则:周日14—16点,最多12人;提前至少24小时可全额退,不足24小时不退但可转让;不要求读完整本书;停车费用未知。 1. 活动几点开始?标准:周日14点。 2. 提前30小时取消能退吗?标准:可以。 3. 提前2小时取消能退吗?标准:不可以,可转让。 4. 没读完整本书能参加吗?标准:可以。 5. 停车免费吗?标准:资料不足,无法确认。
跟着做一遍
下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。
先写标准,再看模型答案
保存验收表。把规则作为来源提供给助手,逐题提问,不把标准答案一起当作问题喂给它。
当前规则:周日14—16点,最多12人;提前至少24小时可全额退款,不足24小时不退款但可转让;不要求读完整本书;未提供停车费用。请只依据这些规则回答。先回答:提前2小时取消能退款吗?
做完后,展开结果对照
合格答案包含不能退款与可以转让,不擅自承诺例外。措辞可以不同。
为什么这样做先写标准能减少被流畅回答影响判断。你在测它是否满足任务,而不是是否与你的范文逐字相同。
逐题记录错误类型
另外四题分别询问,把每次实际回答与自己的验收表并排检查。
请给我一个空白检查表,列名为题号、实际回答、关键事实是否正确、是否编造、依据是否可核对、需要修改什么。不要替我填写尚未运行的结果。
做完后,展开结果对照
得到一张等待填写的表;只有实际运行过,才能填通过或不通过。
为什么这样做日期错、条件丢失、无依据猜测与引用错误需要不同修法,不应只给一个笼统的“80分”。
只改一个因素,再跑同样五题
如果停车问题被猜成免费,先加强未知处理或修正来源,再用同一组题重新检查。
在原有规则之外增加回答要求:资料没有覆盖的问题,请明确说明无法确认;不要依据常识补写费用、电话或设施。其他任务不变。
做完后,展开结果对照
如果修改有效,第5题应保留未知,前4题也应继续正确。不能只测试刚修好的那一题。
为什么这样做针对问题做小改动,比较同一组输入,才能知道修改是否带来实际改善。
评估
用代表性任务和预先写好的标准,检查质量与边界,并据此判断一次改动是否有效。
没做出来?从这里排查
每次都换问题,无法判断是否改进
保留一组固定任务,同时另加新案例探索未知问题。
让同一个AI自己打分就结束
用原文、计算器或实际系统记录核对关键项,模型评价只作辅助。
换一个例子验证
为自己的小应用写五题测试。
- 包含普通题、边界题和缺资料题。
- 先写标准答案或通过条件,再运行。
- 修一个问题后重测这五题,并保存前后记录。
完成状态仅保存在当前浏览器,可再次点击取消。