本阶段课程 · AI 与大模型基础
AI、大模型与聊天应用的关系训练与推理:模型怎样学会和生成Token、上下文与多轮对话模型的能力、局限与幻觉
LESSON 02 / 36阅读约 7 分钟

训练与推理:模型怎样学会和生成

从训练目标、参数变化到逐段生成,理解一次回答是怎样产生的。

模型怎样从数据中学到东西

上一课说,模型里有许多可以调整的数值,叫作参数。训练就是利用数据和计算,不断调整这些参数,使模型更接近训练目标。它不是由人把每个问题的答案逐条写进一张问答表。

以常见的生成式语言模型为例,一种重要的训练任务是:给定前面的文本,预测接下来出现的文本片段。训练材料中已经有后续内容,因此系统可以比较预测与实际内容的差异,再调整参数。重复这个过程后,模型逐渐学到用词、句法、文体,以及语言中表达的各种关系。

为了便于说明,先把下面的中文短语当作“片段”;真实模型使用的 Token 划分可能与这里不同。

已有文本:这杯咖啡太烫了,我想等它……

合理续写之一:凉一点再喝。

模型需要利用“咖啡”“烫”“等”等上下文,才能生成合适的后续。大规模训练会覆盖比这个例子复杂得多的材料,但基础关系相似:根据当前内容预测后续内容,并从预测误差中学习。

回答是怎样一段段生成出来的

使用训练好的模型来处理新输入,叫作推理(inference)。这个术语在这里表示运行模型,不保证每次输出都具有严密的逻辑证明。

常见的生成式语言模型会根据输入,计算下一个 Token 的候选分数,再按生成策略选择一个,把它接到已有文本后面,继续生成后续 Token。这个过程持续到模型生成结束标记,或触及输出长度等限制。

例如“凉一点”生成之后,已有上下文就变成了“这杯咖啡太烫了,我想等它凉一点”。接下来再生成“再喝”便有了新的依据。你在屏幕上看到字逐渐出现,常常与这种逐步生成和应用的流式展示有关;界面的显示批次不一定等于一个 Token。

为什么预测后续文本还能翻译、总结和回答问题

训练材料包含很多表达方式、任务形式与概念关系。要在不同上下文里预测后续内容,模型需要学习这些模式。再经过面向指令、对话等用途的训练,模型可以更适合按照“翻译下面的句子”“总结这段文字”等要求产生结果。

这解释了为什么提示词会影响回答:它成为本次生成的输入条件。也解释了一个限制:生成过程偏向产生符合上下文的内容,本身并不等于完成了数据库查询、数学证明或事实审查。写得合理与查证属实,需要分开判断。

现代模型使用复杂的网络结构。你可能听到 Transformer 和注意力机制:可以先理解为一种组织计算的方法,让模型在处理当前位置时利用上下文中相关的信息。这里不要求掌握网络层数或公式;需要记住的是,相关信息必须进入它能使用的输入范围。

训练、聊天和记忆分别改变了什么

过程主要变化示例
训练调整模型参数用数据改善语言生成或某类任务行为
当前对话改变这次提供的上下文告诉它“本文写给第一次接触 AI 的人”
应用保存记忆在模型外保存信息,之后再取回应用保存你偏好简短回答的设置

你在聊天里纠正一个日期,模型下一轮使用正确日期,通常可以由“新日期进入当前上下文”解释,不必假定模型刚刚完成了永久训练。应用是否保留这些内容、是否在后续用于改进模型,则由产品的数据设置与条款决定。

下一课会具体解释 Token 与上下文。它们决定本次请求有哪些信息可用,也是理解长聊天、费用和模型接口的基础。

检查一下理解

当前聊天里补充一条规则后答对了,最直接能说明什么?

本节参考与继续阅读

下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。

可选练习不再把“这次告诉它”误认为“所有对话都永久学会”。
练习目标

不再把“这次告诉它”误认为“所有对话都永久学会”。

打开你常用的 AI 对话工具,选择“新建对话”或“新建聊天”。在输入框粘贴下面的内容,点击发送。后续步骤留在同一段对话里;只有明确要求时才新开对话。

虚构店铺规则
本练习中的青禾文具店:周一休息,其他日子10:00—18:00营业。这是教学虚构规则,不是现实店铺信息。

跟着做一遍

下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。

01

在当前对话告诉它一个规则

新建对话,发送虚构规则与问题。

发给 AI 的内容
以下是练习中的虚构规则:青禾文具店周一休息,其他日子10:00—18:00营业。只按本规则回答:周一能去吗?
做完后,展开结果对照
对照示例 · 不要求逐字相同

按所给规则,周一休息,不能去。

为什么这样做当前能回答,是因为规则就在这次对话材料里,不能据此判断模型参数被改变。

02

新开对话再问一次

新开聊天,不带上材料,发送下面的问题。结果因产品是否检索、是否有跨对话记忆而异。

发给 AI 的内容
本练习中的青禾文具店周一营业吗?如果缺少练习规则,请先问我要规则。
做完后,展开结果对照
对照示例 · 不要求逐字相同

可能要求补充规则;若应用带入了记忆或其他背景,也可能回答。无论答对或答错,单次表现都不能证明发生了训练。

为什么这样做这是观察产品行为的实验,不是用一次回答测量模型内部参数。

03

把可靠做法固定下来

以后让它处理这家虚构店铺的任务时,把规则明确附上,不依赖它“应该记得”。

发给 AI 的内容
当前有效规则:本练习中的青禾文具店周一休息,其他日子10:00—18:00营业。请写一条周一不接待的提醒,只用这些信息。
做完后,展开结果对照
对照示例 · 不要求逐字相同

今天是周一,青禾文具店休息。其他日子营业时间为10:00—18:00。

为什么这样做你保证材料到位,才方便检查输出是否遵守规则。以后有大量规则时,可以用知识库按需取回。

刚才用到的一个新词

训练与生成

训练通常用数据调整模型参数;聊天时运行模型、根据当前输入产生回答,属于推理或生成过程。

没做出来?从这里排查

它说“我会永远记住”

把这句话当普通回复,查看产品实际记忆功能;重要规则仍保存到你控制的资料中。

新对话答错,觉得工具没法用

补充必要规则或接入正确来源,别把遗漏背景与能力不足混为一谈。

换一个例子验证

为一个常用规则决定保存方式。

  1. 区分一次性的任务材料和长期会用的规则。
  2. 把规则保存成你能更新的文档。
  3. 在新任务中明确提供规则,或检查应用实际取回的版本。
检查标准能解释“本次回答为什么知道这条信息”,而不是笼统说它已经学会了。

完成状态仅保存在当前浏览器,可再次点击取消。