Skip to content

Transformer 与注意力机制

Transformer 是现代大语言模型的基石。本系列教程深入讲解 Transformer 的每一个组件。

  • 注意力机制的直观理解
  • Self-Attention 的数学原理
  • Multi-Head Attention 的设计动机
  • 位置编码的多种实现
  • Encoder-Decoder 架构
  • 从零实现一个 Mini Transformer
  • 深度学习基础
  • 矩阵运算

自注意力机制的核心计算:

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V
  1. Transformer 架构总览
  2. Self-Attention 详解
  3. Multi-Head Attention
  4. 位置编码
  5. 从零实现 Mini Transformer