生成不是整段查抄,也不只是随机接龙,而是反复预测并选择下一个Token。
你看到AI几秒钟写出一段话,容易以为它先在脑中想好全文,再逐字显示。更接近实际的解释是:语言模型会一步步生成较小的文字单元。
生活类比
像有很多备选路线的文字接龙:每走一步,都根据已经走过的路重新判断下一步
对应:接龙开头=输入与上下文;候选路线=Token概率;选择一步=生成策略;整条路线=最终回答
这个比方在哪会塌:模型处理的是Token而非固定一个汉字;它可能调用搜索、数据库或工具获取资料,也可能在生成前进行内部计算
它防止的误解:防止把生成理解成从答案库整段复制,也防止以为屏幕逐字出现就是模型内部的完整思考过程
生成的四个动作
- 1把输入转换成Token,并结合系统要求、对话历史和其他上下文。
- 2计算下一个Token的概率分布。
- 3按照确定性或带随机性的策略选择一个Token。
- 4把新Token放回上下文,重复过程,直到结束或达到限制。
为什么同一问题可能有不同答案
生成策略可能允许在多个合理候选中选择,温度等参数会影响候选分布;此外,模型版本、系统提示、对话历史、联网结果和服务端设置也可能变化。因此答案不同不能只归因于温度,温度较低也不保证所有系统绝对重复。
生成和查资料可以同时发生
基础语言模型主要依据训练参数和当前上下文生成。现代AI产品还可能先搜索网页、查询知识库、读取文件或调用程序,再由模型组织答案。判断结果是否可靠时,要分清“它有没有拿到资料”和“它有没有正确使用资料”。
- “它从数据库找到整段标准答案”——语言模型通常逐步生成,但产品也可能接入外部检索。
- “每一步都选概率最高的Token”——具体取决于生成策略,不同产品设置不同。
- “屏幕一个字一个字出现就是模型一个字一个字思考”——显示还受到Token切分、网络传输和前端渲染影响。
延伸阅读
- 3Blue1Brown 神经网络与大模型原理动画系列(3Blue1Brown (Grant Sanderson)) |主要讲:大模型原理的动画讲解
最后复核:2026-07-26
AI 领域更新很快,相关工具/价格/规则可能已变化,重要事实请以官方来源为准。