Skip to content

InstructGPT

作者:Ouyang et al. (OpenAI, 2022)
全称:Training language models to follow instructions with human feedback

GPT-3 很强大,但经常不遵循用户意图——编造事实、输出有害内容、不理解指令。InstructGPT 用 RLHF 解决了这个问题。

flowchart TD
A[Step 1: SFT] --> B[Step 2: 训练 RM]
B --> C[Step 3: PPO 优化]
A -->|收集人类演示数据<br/>微调 GPT-3| A1[监督微调模型]
B -->|标注员对回答排序<br/>训练奖励模型| B1[奖励模型 RM]
C -->|用 RM 打分<br/>PPO 优化策略| C1[InstructGPT]

收集 13K 人类写的 prompt-answer 对,微调 GPT-3:

标注员写回答:
Prompt: "解释什么是机器学习"
Answer: "机器学习是让计算机从数据中学习规律..."

让标注员对多个回答排序,训练奖励模型预测人类偏好:

Prompt: "写一首关于 AI 的诗"
回答 A: "芯片闪烁着智慧的光芒..." ← 标注员排第 1
回答 B: "AI is a technology..." ← 标注员排第 2
回答 C: "什么是AI?AI就是..." ← 标注员排第 3

用奖励模型通过 PPO 算法优化策略,同时加入 KL 惩罚防止模型偏离太远:

目标=E[R(x,y)]βKL(πθπSFT)\text{目标} = \mathbb{E}[R(x, y)] - \beta \cdot \text{KL}(\pi_{\theta} \| \pi_{\text{SFT}})
发现数据
1.3B InstructGPT 胜过 175B GPT-3标注员偏好率 85% vs 15%
幻觉显著减少TruthfulQA 准确率提升 2 倍
有害输出大幅下降RealToxicityPrompts 毒性降低 25%
  • 直接催生了 ChatGPT
  • RLHF 成为 Claude、Gemini 等产品的标准对齐方法
  • DPO (2023) 提出了更简单的替代方案