Transformer 与注意力机制
Transformer 与注意力机制
Section titled “Transformer 与注意力机制”Transformer 是现代大语言模型的基石。本系列教程深入讲解 Transformer 的每一个组件。
- 注意力机制的直观理解
- Self-Attention 的数学原理
- Multi-Head Attention 的设计动机
- 位置编码的多种实现
- Encoder-Decoder 架构
- 从零实现一个 Mini Transformer
- 深度学习基础
- 矩阵运算
自注意力机制的核心计算: