从注意力到 Transformer
理解 token、位置、注意力和前馈网络怎样组成现代语言模型的基本积木。
读完这一章,你会理解
- 理解自注意力解决的问题
- 知道位置信息为什么必要
- 看懂 Transformer 块的主要数据流
模型看到的是 token,不是句子
文本首先被切分为 token,再映射成向量。向量让离散符号进入可以计算的空间,但仅有 token 向量还不知道它们在句子中的先后顺序。
位置编码把顺序信息加入表示。不同实现可以使用固定编码、可学习位置向量或 RoPE,但目标都是让模型区分“谁在前、谁在后”。
注意力是在当前上下文中寻找关联
每个位置都会产生 Query、Key 和 Value。Query 与其他位置的 Key 比较,得到权重,再用这些权重汇总 Value。
多头注意力让模型可以在不同子空间中同时关注不同关系,例如局部搭配、长距离指代或句法结构。
Attention(Q, K, V) = softmax(QKᵀ / √d) V一个 Transformer 块做了什么
注意力负责不同 token 之间的信息交换,前馈网络负责对每个位置的表示做非线性变换。残差连接帮助信息和梯度稳定流动,归一化让训练更容易控制。
- 归一化并计算自注意力
- 通过残差连接保留原始信息
- 进入前馈网络进行逐位置变换
- 再次残差相加,送入下一层