本阶段课程 · AI 与大模型基础
训练与推理:模型怎样学会和生成
从训练目标、参数变化到逐段生成,理解一次回答是怎样产生的。
模型怎样从数据中学到东西
上一课说,模型里有许多可以调整的数值,叫作参数。训练就是利用数据和计算,不断调整这些参数,使模型更接近训练目标。它不是由人把每个问题的答案逐条写进一张问答表。
以常见的生成式语言模型为例,一种重要的训练任务是:给定前面的文本,预测接下来出现的文本片段。训练材料中已经有后续内容,因此系统可以比较预测与实际内容的差异,再调整参数。重复这个过程后,模型逐渐学到用词、句法、文体,以及语言中表达的各种关系。
为了便于说明,先把下面的中文短语当作“片段”;真实模型使用的 Token 划分可能与这里不同。
已有文本:这杯咖啡太烫了,我想等它……
合理续写之一:凉一点再喝。
模型需要利用“咖啡”“烫”“等”等上下文,才能生成合适的后续。大规模训练会覆盖比这个例子复杂得多的材料,但基础关系相似:根据当前内容预测后续内容,并从预测误差中学习。
回答是怎样一段段生成出来的
使用训练好的模型来处理新输入,叫作推理(inference)。这个术语在这里表示运行模型,不保证每次输出都具有严密的逻辑证明。
常见的生成式语言模型会根据输入,计算下一个 Token 的候选分数,再按生成策略选择一个,把它接到已有文本后面,继续生成后续 Token。这个过程持续到模型生成结束标记,或触及输出长度等限制。
例如“凉一点”生成之后,已有上下文就变成了“这杯咖啡太烫了,我想等它凉一点”。接下来再生成“再喝”便有了新的依据。你在屏幕上看到字逐渐出现,常常与这种逐步生成和应用的流式展示有关;界面的显示批次不一定等于一个 Token。
为什么预测后续文本还能翻译、总结和回答问题
训练材料包含很多表达方式、任务形式与概念关系。要在不同上下文里预测后续内容,模型需要学习这些模式。再经过面向指令、对话等用途的训练,模型可以更适合按照“翻译下面的句子”“总结这段文字”等要求产生结果。
这解释了为什么提示词会影响回答:它成为本次生成的输入条件。也解释了一个限制:生成过程偏向产生符合上下文的内容,本身并不等于完成了数据库查询、数学证明或事实审查。写得合理与查证属实,需要分开判断。
现代模型使用复杂的网络结构。你可能听到 Transformer 和注意力机制:可以先理解为一种组织计算的方法,让模型在处理当前位置时利用上下文中相关的信息。这里不要求掌握网络层数或公式;需要记住的是,相关信息必须进入它能使用的输入范围。
训练、聊天和记忆分别改变了什么
| 过程 | 主要变化 | 示例 |
|---|---|---|
| 训练 | 调整模型参数 | 用数据改善语言生成或某类任务行为 |
| 当前对话 | 改变这次提供的上下文 | 告诉它“本文写给第一次接触 AI 的人” |
| 应用保存记忆 | 在模型外保存信息,之后再取回 | 应用保存你偏好简短回答的设置 |
你在聊天里纠正一个日期,模型下一轮使用正确日期,通常可以由“新日期进入当前上下文”解释,不必假定模型刚刚完成了永久训练。应用是否保留这些内容、是否在后续用于改进模型,则由产品的数据设置与条款决定。
下一课会具体解释 Token 与上下文。它们决定本次请求有哪些信息可用,也是理解长聊天、费用和模型接口的基础。
检查一下理解
本节参考与继续阅读
下列章节用于核对概念与机制。本站以中文重新组织讲解,例子和练习为独立编写。
- Google · Introduction to Large Language Models
对应语言模型、Token与上下文。原课包含技术前置知识,本站以不需要公式的解释展开。
- Hugging Face · What are LLMs?
对应逐Token生成、注意力、训练与模型调用。本站不要求掌握模型架构代码。
可选练习不再把“这次告诉它”误认为“所有对话都永久学会”。
不再把“这次告诉它”误认为“所有对话都永久学会”。
打开你常用的 AI 对话工具,选择“新建对话”或“新建聊天”。在输入框粘贴下面的内容,点击发送。后续步骤留在同一段对话里;只有明确要求时才新开对话。
本练习中的青禾文具店:周一休息,其他日子10:00—18:00营业。这是教学虚构规则,不是现实店铺信息。
跟着做一遍
下面的结果是本站编写的对照示例。实际工具的措辞可能不同,按每步的关键条件检查即可。
在当前对话告诉它一个规则
新建对话,发送虚构规则与问题。
以下是练习中的虚构规则:青禾文具店周一休息,其他日子10:00—18:00营业。只按本规则回答:周一能去吗?
做完后,展开结果对照
按所给规则,周一休息,不能去。
为什么这样做当前能回答,是因为规则就在这次对话材料里,不能据此判断模型参数被改变。
新开对话再问一次
新开聊天,不带上材料,发送下面的问题。结果因产品是否检索、是否有跨对话记忆而异。
本练习中的青禾文具店周一营业吗?如果缺少练习规则,请先问我要规则。
做完后,展开结果对照
可能要求补充规则;若应用带入了记忆或其他背景,也可能回答。无论答对或答错,单次表现都不能证明发生了训练。
为什么这样做这是观察产品行为的实验,不是用一次回答测量模型内部参数。
把可靠做法固定下来
以后让它处理这家虚构店铺的任务时,把规则明确附上,不依赖它“应该记得”。
当前有效规则:本练习中的青禾文具店周一休息,其他日子10:00—18:00营业。请写一条周一不接待的提醒,只用这些信息。
做完后,展开结果对照
今天是周一,青禾文具店休息。其他日子营业时间为10:00—18:00。
为什么这样做你保证材料到位,才方便检查输出是否遵守规则。以后有大量规则时,可以用知识库按需取回。
训练与生成
训练通常用数据调整模型参数;聊天时运行模型、根据当前输入产生回答,属于推理或生成过程。
没做出来?从这里排查
它说“我会永远记住”
把这句话当普通回复,查看产品实际记忆功能;重要规则仍保存到你控制的资料中。
新对话答错,觉得工具没法用
补充必要规则或接入正确来源,别把遗漏背景与能力不足混为一谈。
换一个例子验证
为一个常用规则决定保存方式。
- 区分一次性的任务材料和长期会用的规则。
- 把规则保存成你能更新的文档。
- 在新任务中明确提供规则,或检查应用实际取回的版本。
完成状态仅保存在当前浏览器,可再次点击取消。