知行LEARNING HANDBOOK
目录 · 02 从注意力到 Transformer
学习手册/人工智能基础
CHAPTER 0210 分钟

从注意力到 Transformer

理解 token、位置、注意力和前馈网络怎样组成现代语言模型的基本积木。

读完这一章,你会理解

  1. 理解自注意力解决的问题
  2. 知道位置信息为什么必要
  3. 看懂 Transformer 块的主要数据流

模型看到的是 token,不是句子

文本首先被切分为 token,再映射成向量。向量让离散符号进入可以计算的空间,但仅有 token 向量还不知道它们在句子中的先后顺序。

位置编码把顺序信息加入表示。不同实现可以使用固定编码、可学习位置向量或 RoPE,但目标都是让模型区分“谁在前、谁在后”。

注意力是在当前上下文中寻找关联

每个位置都会产生 Query、Key 和 Value。Query 与其他位置的 Key 比较,得到权重,再用这些权重汇总 Value。

多头注意力让模型可以在不同子空间中同时关注不同关系,例如局部搭配、长距离指代或句法结构。

Attention(Q, K, V) = softmax(QKᵀ / √d) V

一个 Transformer 块做了什么

注意力负责不同 token 之间的信息交换,前馈网络负责对每个位置的表示做非线性变换。残差连接帮助信息和梯度稳定流动,归一化让训练更容易控制。

  • 归一化并计算自注意力
  • 通过残差连接保留原始信息
  • 进入前馈网络进行逐位置变换
  • 再次残差相加,送入下一层