attention 分不清猫追狗和狗追猫
你有没有想过:大模型到底怎么知道词的先后顺序?
其实它的核心零件 self-attention 天生就看不见顺序——把句子里的词两两算个关联,却不记得谁排第几个。所以在它眼里,「猫追狗」和「狗追猫」就是同一袋词。把词序补回去的那束信号,就是位置编码。
这篇把位置编码的进化史一次讲透:
▸ 绝对位置(正弦波):用不同频率的 sin/cos 给每个位置一张唯一指纹,但可学习版「训练多长只能用多长」
▸ 思路转向:语言里真正重要的不是「第几个」,而是两个词「隔多远」
▸ RoPE(旋转位置编码):不把位置「加」进向量,而是按位置把 query/key「转」一个角度——两个词打分时,内积只看它俩的夹角差,也就是相对距离
▸ 一句话记住 RoPE:绝对地转,相对地算
🔹 Llama、Qwen、Mistral 这些主流开源大模型,几乎清一色用 RoPE
🔹 它还留了个尾巴:序列一旦超长就会「转晕」,这就是长上下文里的长度外推问题
AI 大模型 LLM 机器学习 深度学习 AI入门 技术分享 AI干货 Transformer



















