《Attention Is All You Need》笔记

yin_bo_ Lv3
  • Transfomer架构图:
    ![alt Transfomer架构图](/images/《Attention Is All You Need》笔记/Transfomer架构图.jpg)
  1. QKV

    • Attention中的三个向量:query key value
    • 例子:
      我 喜欢 吃 苹果
      每个单词都有自己的QKV
      对于”吃”:
      Q就是查询该句子哪些词与吃相关
      每个单词都有K,也就是该词的特征
      吃的Q会和所有词的K做匹配 看谁的匹配分数最高 则最应该关注该词
      V:算出来匹配之后,将Q里融入匹配到的K的信息,也就是V
      Attenion 就是通过QKV计算每个词,判断句子里哪些词更重要,然后重点关注这些词
  2. 多头注意力机制(Mult-head Attention)
    每次使用QKV计算句子中词是否重要重要 的过程称为一次
    因此多头注意力机制就是利用多套QKV,从不同角度去理解句子

  • 因此 多头注意力机制 = 多组Attention并行工作
  1. 前馈网络(Feed Forward)
    Attention 负责让词和词之间交流,前馈网络负责对每个词自己做进一步加工
    具体流程就是对于512维的单个词,将其升维到2048维,让模型更好的去处理,再降维到512维,使尺寸和流程保证一致,再通过Add & Norm进行精炼
    简单地说就是将每个词再做一次深度的加工

  2. 残差链接 + 层归一化(Add & Norm)

    • 残差链接:
      通俗来讲就是将attention处理后的向量和原始向量相加,产生一个保底通道
      假如x为原始信息向量,则残差链接会将向量转变为x + Attention(x)
    • 层归一化:
      • 经过多次attention或者feed forward之后,某些数可能特别大,有些可能特别想
      • 层归一化就是将每一层数据调整稳定,让输出更稳定
    • 的概念:
      Attention -> Add & Norm -> Feed Forward -> Add & Norm这一个流程往往要重复多次,对信息进行提炼,每一次流程被成为一层。
  • 标题: 《Attention Is All You Need》笔记
  • 作者: yin_bo_
  • 创建于 : 2026-06-14 23:03:47
  • 更新于 : 2026-06-14 23:53:21
  • 链接: https://www.blog.yinbo.xyz/2026/06/14/面试/《Attention Is All You Need》笔记/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
目录
《Attention Is All You Need》笔记