核心概念
每个概念聚焦一个知识点,配有数学公式和代码实现。
- 注意力机制 — Scaled Dot-Product Attention 数学原理与 PyTorch 实现
- Multi-Head Attention — 多头注意力 + MQA/GQA 对比
- Embedding — 词嵌入的原理、实现与语义空间
- Tokenization — BPE 分词算法、主流 tokenizer 对比
- 位置编码 — 正弦编码、RoPE、可学习编码对比
- 激活函数 — ReLU、GELU、SwiGLU 的选择与对比
- 反向传播 — 链式法则、梯度消失与梯度爆炸
- Layer Normalization — Transformer 稳定训练的关键
- 损失函数 — MSE、Cross-Entropy、KL 散度
- 优化器 — SGD、Adam、AdamW 对比与学习率调度
- 正则化 — Dropout、Weight Decay、数据增强
- KV Cache — 推理加速核心技术
- 模型量化 — INT4/INT8、GPTQ、AWQ 对比
- 位置编码(Sinusoidal、RoPE、ALiBi)
- Multi-Head Attention
- 激活函数(ReLU、GELU、SwiGLU)
- 反向传播
- 梯度消失与梯度爆炸
- 优化器(SGD、Adam、AdamW)
- 量化(INT8、INT4、GPTQ、AWQ)
- Layer Normalization vs Batch Normalization
- 损失函数(Cross-Entropy、KL 散度)