Skip to content

模型族谱

从 2017 年 Transformer 提出到 GPT-4,大模型经历了爆炸式发展。

timeline
title LLM 发展历程
2017 : Transformer 架构
2018 : GPT-1 : BERT
2020 : GPT-3 (175B)
2022 : ChatGPT : InstructGPT
2023 : GPT-4 : LLaMA
2024 : Claude 3 : Llama 3.1
2025 : DeepSeek-R1
时间模型核心贡献
2017.06Transformer提出 Self-Attention 架构,取代 RNN
2018.06GPT-1生成式预训练 + 微调范式
2018.10BERT双向编码器,MLM 预训练
2019.02GPT-21.5B 参数,zero-shot 能力初现
2020.05GPT-3175B 参数,few-shot 学习
2022.03InstructGPTRLHF 对齐人类偏好
2022.11ChatGPT对话式 AI 普及
2023.02LLaMA开源高效大模型
2023.03GPT-4多模态、推理能力跃升
2024.03Claude 3长上下文、安全对齐
2024.07Llama 3.1405B 开源模型
2025.01DeepSeek-R1推理模型,开源

以 BERT 为代表,专注于理解任务:

  • 双向 Attention(能看到前后文)
  • 预训练:Masked Language Model(挖空填词)
  • 适合:分类、命名实体识别、问答

以 GPT 为代表,专注于生成任务:

  • 单向 Attention(只能看到前文)
  • 预训练:Next Token Prediction(预测下一个词)
  • 适合:对话、写作、代码生成
模型参数规模上下文长度特点
Llama 3.18B / 70B / 405B128KMeta 出品,生态最成熟
Llama 4多种规格128K+最新一代
DeepSeek-V3671B (MoE)128K高性价比,中文优秀
Qwen 2.50.5B~72B128K阿里出品,多语言
Mistral7B / 12B32K欧洲团队,小而精
Gemma 31B~27B128KGoogle 出品
  • MoE(混合专家):每次推理只激活部分参数,DeepSeek-V3 的 671B 中只激活 37B
  • RLHF:用人类偏好数据训练奖励模型,再通过强化学习对齐模型
  • 上下文长度:模型一次能处理的最大 token 数,通过 RoPE 等位置编码扩展