Transformer,从直觉到注意力网络
把 Token、QKV 和注意力拆成可观察的信号流,理解模型如何选择信息。
ARTICLE / 03 SECTIONS
START READING03 SECTIONS
先建立一个直觉
语言中的一个词,往往要回头看其它词才知道自己的意思。Transformer 的关键不是按顺序机械处理文本,而是让每个 Token 根据当前任务,动态决定应该关注哪些信息。
注意力在做什么
每个 Token 会形成三种表示:Query 用来提问,Key 用来描述自己,Value 携带可被汇总的信息。Query 和所有 Key 计算相关性,再把结果作为权重,汇总对应的 Value。
这让模型可以直接连接相距很远的信息,也让同一个词在不同上下文中得到不同的表示。
为什么它会成为大模型的核心
注意力机制可以并行处理一个序列,并随着层数增加逐步形成更抽象的表示。位置编码提供顺序感,多头注意力让模型同时观察不同关系,残差连接和归一化则让深层训练稳定下来。
理解这些部件之后,再去看预训练、推理和上下文窗口,模型的能力就不再只是一个黑箱结论。
LEARNING PATH
沿着这条路径继续
每一篇文章都是下一次理解的起点。
从这里开始建立这一条路径的基础认知
当前阅读Transformer,从直觉到注意力网络Transformer 原理
继续探索大语言模型