InstructGPT
InstructGPT
Section titled “InstructGPT”作者:Ouyang et al. (OpenAI, 2022)
全称:Training language models to follow instructions with human feedback
GPT-3 很强大,但经常不遵循用户意图——编造事实、输出有害内容、不理解指令。InstructGPT 用 RLHF 解决了这个问题。
flowchart TD A[Step 1: SFT] --> B[Step 2: 训练 RM] B --> C[Step 3: PPO 优化] A -->|收集人类演示数据<br/>微调 GPT-3| A1[监督微调模型] B -->|标注员对回答排序<br/>训练奖励模型| B1[奖励模型 RM] C -->|用 RM 打分<br/>PPO 优化策略| C1[InstructGPT]Step 1:监督微调 (SFT)
Section titled “Step 1:监督微调 (SFT)”收集 13K 人类写的 prompt-answer 对,微调 GPT-3:
标注员写回答:Prompt: "解释什么是机器学习"Answer: "机器学习是让计算机从数据中学习规律..."Step 2:训练奖励模型 (RM)
Section titled “Step 2:训练奖励模型 (RM)”让标注员对多个回答排序,训练奖励模型预测人类偏好:
Prompt: "写一首关于 AI 的诗"
回答 A: "芯片闪烁着智慧的光芒..." ← 标注员排第 1回答 B: "AI is a technology..." ← 标注员排第 2回答 C: "什么是AI?AI就是..." ← 标注员排第 3Step 3:PPO 优化
Section titled “Step 3:PPO 优化”用奖励模型通过 PPO 算法优化策略,同时加入 KL 惩罚防止模型偏离太远:
| 发现 | 数据 |
|---|---|
| 1.3B InstructGPT 胜过 175B GPT-3 | 标注员偏好率 85% vs 15% |
| 幻觉显著减少 | TruthfulQA 准确率提升 2 倍 |
| 有害输出大幅下降 | RealToxicityPrompts 毒性降低 25% |
- 直接催生了 ChatGPT
- RLHF 成为 Claude、Gemini 等产品的标准对齐方法
- DPO (2023) 提出了更简单的替代方案