模型族谱
大语言模型发展脉络
Section titled “大语言模型发展脉络”从 2017 年 Transformer 提出到 GPT-4,大模型经历了爆炸式发展。
timeline title LLM 发展历程 2017 : Transformer 架构 2018 : GPT-1 : BERT 2020 : GPT-3 (175B) 2022 : ChatGPT : InstructGPT 2023 : GPT-4 : LLaMA 2024 : Claude 3 : Llama 3.1 2025 : DeepSeek-R1| 时间 | 模型 | 核心贡献 |
|---|---|---|
| 2017.06 | Transformer | 提出 Self-Attention 架构,取代 RNN |
| 2018.06 | GPT-1 | 生成式预训练 + 微调范式 |
| 2018.10 | BERT | 双向编码器,MLM 预训练 |
| 2019.02 | GPT-2 | 1.5B 参数,zero-shot 能力初现 |
| 2020.05 | GPT-3 | 175B 参数,few-shot 学习 |
| 2022.03 | InstructGPT | RLHF 对齐人类偏好 |
| 2022.11 | ChatGPT | 对话式 AI 普及 |
| 2023.02 | LLaMA | 开源高效大模型 |
| 2023.03 | GPT-4 | 多模态、推理能力跃升 |
| 2024.03 | Claude 3 | 长上下文、安全对齐 |
| 2024.07 | Llama 3.1 | 405B 开源模型 |
| 2025.01 | DeepSeek-R1 | 推理模型,开源 |
两条技术路线
Section titled “两条技术路线”编码器路线(BERT 系)
Section titled “编码器路线(BERT 系)”以 BERT 为代表,专注于理解任务:
- 双向 Attention(能看到前后文)
- 预训练:Masked Language Model(挖空填词)
- 适合:分类、命名实体识别、问答
解码器路线(GPT 系)
Section titled “解码器路线(GPT 系)”以 GPT 为代表,专注于生成任务:
- 单向 Attention(只能看到前文)
- 预训练:Next Token Prediction(预测下一个词)
- 适合:对话、写作、代码生成
开源模型对比
Section titled “开源模型对比”| 模型 | 参数规模 | 上下文长度 | 特点 |
|---|---|---|---|
| Llama 3.1 | 8B / 70B / 405B | 128K | Meta 出品,生态最成熟 |
| Llama 4 | 多种规格 | 128K+ | 最新一代 |
| DeepSeek-V3 | 671B (MoE) | 128K | 高性价比,中文优秀 |
| Qwen 2.5 | 0.5B~72B | 128K | 阿里出品,多语言 |
| Mistral | 7B / 12B | 32K | 欧洲团队,小而精 |
| Gemma 3 | 1B~27B | 128K | Google 出品 |
关键概念速查
Section titled “关键概念速查”- MoE(混合专家):每次推理只激活部分参数,DeepSeek-V3 的 671B 中只激活 37B
- RLHF:用人类偏好数据训练奖励模型,再通过强化学习对齐模型
- 上下文长度:模型一次能处理的最大 token 数,通过 RoPE 等位置编码扩展