下一个Token,为什么能练出大模型?
大模型最核心的预训练任务,听起来简单得有点过分:给定前文,预测下一个 Token。Token 可以是一个字、词的一部分或标点。把一段文本右移一位,输入和答案就同时有了,而且序列中的每个位置都能产生监督信号。
🧠 关键不在某一道题多难,而在这种题能从海量文本中自动生成。模型为了持续降低交叉熵,必须利用语法、语义、事实关联、代码结构和篇章模式。它不需要先知道“翻译”“摘要”这些任务名,也会在数据中反复遇见这些模式。
⚙️ Transformer 的因果掩码保证位置 t 只能看自己和左侧内容,不能偷看未来答案。训练时,Token ID 经过 Embedding 和多层注意力变成每个位置上的词表概率,再把正确 Token 的概率转成损失,反向更新参数。一段序列会同时形成一排共享计算的问题。
🔍 这也解释了 GPT、BERT、T5 为什么会分流:GPT 做从左到右的因果生成,BERT 恢复被遮盖内容,T5 把缺失片段改写成生成任务。它们都利用无标注文本,却要求模型学习不同的信息边界。
⚠️ 下一 Token 预测得到的是 Base Model:它擅长延续文本分布,不会自动变成稳定执行指令的助手。指令遵循、偏好和安全边界还要靠 SFT、偏好优化等后训练塑造。预训练建立能力底座,后训练决定这些能力怎样被调用。
大模型 预训练 Transformer 生成式AI AI学习 LLM AI新手村 人工智能






