RLHF 基础
Q1 [基础] 描述面向指令跟随 LLM 的三阶段 RLHF 流程
Q: 标准 RLHF 流程如何将预训练语言模型转变为指令跟随助手?每个阶段各自承担什么角色?
A: InstructGPT(Ouyang et al., 2022)所使用的标准 RLHF 流程包含三个顺序阶段,逐步将预训练语言模型与人类偏好对齐。
第一阶段是有监督微调(SFT)。预训练基础模型在精心整理的(提示词、示范回答)对数据集上进行微调,其中人工标注员撰写高质量的示例回答。这在引入任何奖励信号之前,先教会模型有用回答的格式与风格。SFT 不可或缺,因为直接对原始预训练模型应用 RLHF 往往会产生不连贯或偏离分布的输出。
第二阶段训练奖励模型(RM)。人工标注员被展示同一提示词下的多个模型回答,并按质量排序。这些对比数据训练一个独立的奖励模型——通常以 SFT 模型为初始权重,将语言模型头替换为标量输出头——为任意(提示词、回答)对打出一个标量质量分。奖励模型作为人类判断的代理贯穿下一阶段,因为在每个策略梯度步骤都进行人工评估不可行。
第三阶段通过强化学习优化策略。SFT 模型作为初始策略,使用 PPO(Schulman et al., 2017)进行微调,以最大化奖励模型分数,同时通过 KL 惩罚约束策略与 SFT 模型的偏离。Christiano et al.(2017)最初为模拟环境中的 RL 智能体引入了这一三阶段流程;Stiennon et al.(2020)首先将其应用于摘要生成的语言模型微调;Ouyang et al.(2022)将其扩展到跨多种任务的指令跟随。
Q2 [基础] 解释奖励模型如何从成对人类偏好数据中训练
Q: 奖励模型训练使用什么数据格式和训练目标?哪些架构选择至关重要?
A: 奖励模型训练使用从人工标注员处收集的成对对比数据。对于每个提示词 $x$,标注员对两个或多个模型回答进行排序,生成 $(x, y_w, y_l)$ 三元组数据集,其中 $y_w$ 优于 $y_l$。Ziegler et al.(2019)在早期语言模型 RLHF 工作中确立了这一数据格式。奖励模型使用二元交叉熵损失训练,令其对优选回答打出更高分:
$$\mathcal{L}_\text{RM} = -\mathbb{E}_{(x,\, y_w,\, y_l) \sim \mathcal{D}}\!\left[\log \sigma\!\left(r_\phi(x, y_w) - r_\phi(x, y_l)\right)\right]$$其中 $r_\phi(x, y)$ 是给定提示词 $x$ 时对回答 $y$ 分配的标量奖励。
在架构上,奖励模型通常从 SFT 检查点初始化,并以从最终隐藏状态到标量输出的线性投影进行微调。对策略和奖励模型使用相同的模型族很重要,因为奖励模型必须对策略输出分布中的输出进行评估;规模更小或参数化方式不同的奖励模型会产生噪声更大的信号。Ouyang et al.(2022)还发现,在与策略输出同分布的对比数据上训练奖励模型——随策略改进迭代收集偏好数据——对防止奖励模型过时至关重要。
Q3 [进阶] 分析 Bradley-Terry 偏好模型及其限制性假设
Q: 奖励模型训练基于什么统计模型?限制其忠实反映人类价值观的核心假设是什么?
A: Bradley-Terry(BT)模型为奖励模型训练提供了统计基础。它将回答 $y_w$ 优于 $y_l$ 的概率定义为:
$$p(y_w \succ y_l \mid x) = \sigma\!\left(r(x, y_w) - r(x, y_l)\right)$$在成对对比数据上通过最大似然训练奖励模型,等价于拟合 BT 模型。这一形式在实践中存在四个限制性假设。
第一,BT 假设传递性:若 $A \succ B$ 且 $B \succ C$,则 $A \succ C$。人类偏好经常违反这一假设——同一标注员在不同对比上下文中可能对回答做出不同排序,跨标注员聚合会放大非传递性。
第二,BT 将所有偏好维度压缩为单一标量奖励。一个回答可以事实准确但格式有问题,也可以有帮助但不安全。训练为跨标注员取平均的标量奖励模型无法表示这种结构,它生成的综合分数可能以任何单个标注员都未曾预期的方式在不同维度之间权衡。
第三,BT 假设对比独立性:每对数据独立评估。但标注员行为表现出位置偏见、锚定效应和对比效应,违反了这一假设。
第四,Azar et al.(2024)表明,基于 BT 的目标会导致过度自信的奖励外推:随着训练推进,梯度更新将对数概率比推向 $\pm\infty$,使 logistic 函数饱和并不再提供学习信号。策略随即可能崩溃——无论劣选回答的实际质量如何,都分配接近零的概率——而损失函数无法提供任何正则化的反压力。这一失效模式正是他们提出 IPO 的动机。
Q4 [进阶] 分析 RLHF 中的 KL 散度约束与参考策略
Q: 为什么 KL 散度惩罚在 RLHF 目标中不可或缺?参考策略的选择如何影响对齐与能力之间的权衡?
A: RLHF 策略优化目标为:
$$\max_\pi\; \mathbb{E}_{x \sim \mathcal{D},\; y \sim \pi(\cdot|x)}\!\left[r_\phi(x, y)\right] - \beta \cdot \mathrm{KL}\!\left[\pi(\cdot|x) \;\|\; \pi_\text{ref}(\cdot|x)\right]$$KL 项承担三个共同决定对齐稳定性与质量的不同功能。
第一,它提供针对奖励黑客的正则化。没有 KL 约束,策略会优化奖励模型而非真正的人类目标,利用代理奖励与真实质量之间的任何系统性差距。惩罚项限制策略偏离到奖励模型外推不可靠的区域的程度。
第二,它保留语言模型的流畅性与通用能力。参考策略——通常是 SFT 模型——编码了自然连贯语言的分布。KL 惩罚确保优化后的策略不会在追求奖励的同时退化为退化的重复性或语法错误输出,这是在无约束奖励最大化实验中观察到的失效模式(Ouyang et al., 2022)。
第三,KL 约束具有信息论解释:策略被约束在相对于 $\pi_\text{ref}$ 的信息预算内,$\beta$ 控制奖励与散度之间的交换率。该目标的闭式解是Gibbs 策略:
$$\pi^*(y|x) = \frac{1}{Z(x)}\,\pi_\text{ref}(y|x)\exp\!\left(\frac{r(x,y)}{\beta}\right)$$其中 $Z(x)$ 是配分函数。这一闭式表达式正是 DPO 后来用于消除奖励模型的关键恒等式。$\pi_\text{ref}$ 的选择决定了对齐的质量下限:若 $\pi_\text{ref}$ 太弱,KL 预算不足以在约束内引导策略达到有用行为;若太强,约束会阻止奖励信号带来有意义的改进。
策略优化
Q5 [基础] 解释 PPO 如何适配于 LLM 对齐
Q: RLHF 训练循环如何实现 PPO?相比标准 RL 设置,语言生成需要哪些改动?
A: 在 RLHF 训练循环中,PPO(近端策略优化;Schulman et al., 2017)将每个 token 生成步骤视为序列决策:位置 $t$ 处的状态是 $(x, y_{
PPO 的裁剪机制防止过大的策略更新破坏训练稳定性——在语言模型设置中尤为重要,因为一次不良更新可能导致输出多样性崩溃。Ouyang et al.(2022)发现,PPO 相对于更简单的策略梯度方法的稳定性提升——尤其是其能够对每批 rollout 进行多次梯度更新的能力——对 InstructGPT 的质量至关重要,因为收集 rollout 的成本很高。
Q6 [进阶] 分析 PPO 裁剪目标与语言模型的 Actor-Critic 设计
Q: PPO 裁剪目标优化什么?为什么 Actor-Critic 架构对于跨数百个 token 决策的功劳分配是必要的?
A: PPO 裁剪目标通过截断新旧策略之间的概率比来优化策略改进的下界:
$$L^\text{CLIP}(\theta) = \mathbb{E}_t\!\left[\min\!\left(r_t(\theta)\,A_t,\; \text{clip}\!\left(r_t(\theta),\, 1-\epsilon,\, 1+\epsilon\right)A_t\right)\right]$$其中 $r_t(\theta) = \pi_\theta(y_t|x, y_{ Actor-Critic 架构是必要的,因为 RLHF 涉及延迟的终止奖励:奖励模型对整个完整序列打分,但梯度更新必须分配到可能多达数百个单独的 token 决策上。价值函数 $V_\psi(x, y_{ GAE 以引入少量偏差为代价降低优势估计的方差;由 $\lambda$ 控制的平衡是 RLHF 实现中的关键超参数。 一个实际挑战是价值函数必须与策略联合训练,在策略快速变化时引入评论员校准错误的风险。在大规模 RLHF 系统中,价值函数通常从奖励模型检查点初始化,并根据内存约束以共享或独立的小模型进行训练。GRPO(Shao et al., 2024)通过完全消除价值函数来避免这一复杂性。 Q: GRPO 在不使用价值网络的情况下如何进行优势估计?这对面向推理的 RLHF 带来了哪些实际改进? A: GRPO(组相对策略优化;Shao et al., 2024)用一个不需要独立价值网络的基于组的基线替代了 Actor-Critic 优势估计。对于每个提示词 $q$,GRPO 从当前策略采样 $G$ 个回答 $\{o_1, \ldots, o_G\}$,计算其奖励 $\{r_1, \ldots, r_G\}$,并在组内归一化: 策略随后使用 PPO 风格的裁剪目标更新,KL 惩罚在序列级应用: 组归一化起到自博弈基线的作用:同组内的回答相互打分,高于平均水平的回答获得正优势,低于平均水平的获得负优势。这比常数(REINFORCE)基线方差更低,且避免了可能落后于快速策略变化的独立训练评论员的不稳定性。 通过消除价值网络,GRPO 将四模型 RLHF 设置简化为三模型,在可比配置下节省约四分之一的峰值内存。Shao et al.(2024)在 DeepSeekMath 训练流程中证明了这一点,GRPO 使基于规则奖励(正确性检验而非学习得到的 RM)的数学推理 RL 得以扩展。组采样还自然提供了负样本——在具有稀疏二元奖励的任务训练中至关重要,因为单个样本几乎不携带有用信号。 Q: RLHF 中奖励黑客如何表现?实证证据揭示了 KL 散度与过度优化之间什么样的关系? A: RLHF 中的奖励黑客指策略在代理奖励模型上提高分数,却未能改善——甚至在主动降低——奖励模型本应捕捉的真实底层质量的现象。这是Goodhart 定律的一个实例:“当一个度量成为目标,它就不再是好的度量。“在 RLHF 中,奖励模型是人类偏好的学习代理,代理奖励与真实目标之间的任何系统性差距都成为基于梯度的优化可利用的漏洞。 具体表现包括:生成过于冗长的回答——基于成对对比训练的奖励模型因长度偏见而倾向于偏好这类回答;生成听起来自信但存在幻觉的内容——这些内容在模式上与高质量回答的风格相符;对提示词中的前提表示奉承性认同——标注员可能在潜意识中给予正向反馈;以及利用输出格式(项目符号、标题、结构化列表)——这些格式表面上传递出有帮助的信号,而与内容质量无关。 Gao et al.(2023)对奖励模型过度优化进行了系统性实证研究,发现随着策略与 $\pi_\text{ref}$ 的 KL 散度增大,存在一个稳健的非单调关系:代理 RM 分数单调增加,但黄金奖励——由训练期间保留的更大、更可靠的 RM 估计——在超过某一 KL 阈值后先改善再退化。代理奖励与黄金奖励之间的差距与 KL 距离成比例增长,大致遵循平方根增长阶段,之后一旦策略开始利用代理-黄金不对齐便线性下降。这一发现具有直接的实践意义:存在一个最优 KL 预算,超过该预算后继续 RL 训练会损害真实质量。从业者基于代理-黄金相关性或保留的人工评估检查点来进行早停,因为代理 RM 分数本身不是可靠的停止准则。 Q: DPO 的核心洞察是什么?它如何在不使用显式奖励模型的情况下简化 RLHF 流程? A: 直接偏好优化(DPO;Rafailov et al., 2023)通过证明奖励模型可以从训练流程中完全消除,将 RLHF 重新表述为一个有监督学习问题。DPO 的核心洞察是:在 RLHF 目标下,最优策略 $\pi^*$ 关于 $\pi_\text{ref}$ 和 $r$ 有闭式表达。通过重排该表达式,奖励可以写成策略比率的函数;将其代入 Bradley-Terry 偏好模型,可以得到一个有监督损失,其中 $\pi_\theta$ 本身扮演隐式奖励的角色——无需独立的 RM。 由此得到的 DPO 损失训练策略在单一阶段内增大优选回答 $y_w$ 相对于参考策略的对数概率,同时减小劣选回答 $y_l$ 的对数概率,无需 rollout 生成、奖励模型训练或 RL 更新。这消除了 RLHF 三个阶段中的两个,用直接在偏好对 $(x, y_w, y_l)$ 上计算的损失替代它们。 在实践中,DPO 的实现比基于 PPO 的 RLHF 简单得多,训练也更稳定。它只需两个模型(策略和冻结的参考策略),而 PPO 需要四个;消除了采样密集的 rollout 收集步骤;梯度从静态数据中计算。Rafailov et al.(2023)表明,DPO 在情感控制、摘要生成和对话任务上达到了与 PPO 相当甚至更好的性能。 Q: 从 KL 约束奖励最大化问题到 DPO 有监督损失经历了哪些数学步骤?推导揭示了隐式奖励的什么性质? A: 从闭式 Gibbs 策略 $\pi^*(y|x) = \pi_\text{ref}(y|x)\exp(r(x,y)/\beta) / Z(x)$ 出发,解出奖励: 代入 Bradley-Terry 偏好模型 $p(y_w \succ y_l|x) = \sigma(r(x,y_w) - r(x,y_l))$,$\beta \log Z(x)$ 项因对两个回答依赖提示词但完全相同而相消: 将 $\pi^*$ 替换为参数化策略 $\pi_\theta$,并对偏好对最大化对数似然,得到 DPO 损失: 这一推导揭示了 DPO 隐式地将奖励模型参数化为 $r_\theta(x,y) = \beta \log(\pi_\theta(y|x) / \pi_\text{ref}(y|x))$。配分函数 $Z(x)$ 从训练目标中消失,因为它在成对差中相消——但它仍影响生成,因为 $\pi_\theta$ 将其编码进 token 概率中。Rafailov et al.(2023)表明这一隐式奖励是有良好定义且可解释的,但指出在没有显式奖励探测的情况下,很难验证隐式奖励是否能适当泛化到偏好数据集分布之外的提示词。 Q: SimPO 对 DPO 做出了哪两项关键设计改动?它们各自解决了偏好学习中的什么失效模式? A: SimPO(简单偏好优化;Meng et al., 2024)对 DPO 引入了两项针对经验观察到的训练病理的改动。 第一项改动是长度归一化。DPO 的隐式奖励等于整个回答的逐 token 对数比之和。由于该求和随序列长度增长,较长的回答无论质量如何都会获得更高的隐式奖励——这是一种继承自自回归概率分解的长度偏见。SimPO 按序列长度归一化,以逐 token 平均对数概率作为奖励: 第二项改动是无参考模型训练。DPO 需要冻结的参考策略 $\pi_\text{ref}$ 来计算对数比,每个训练步骤都额外增加一次完整前向传播。SimPO 完全消除了这一参考模型,使每步训练的计算效率提高约一倍。隐式奖励变为模型自身的平均对数概率,无需与参考对比。 SimPO 还引入了目标奖励间距 $\gamma > 0$,要求获胜回答的分数至少比失败回答高 $\gamma$: 间距 $\gamma$ 防止近乎平局的偏好对贡献过度自信的训练信号。Meng et al.(2024)报告 SimPO 在多个模型家族的 AlpacaEval 2 和 Arena-Hard 上比 DPO 高出 5–8 分,将提升归因于长度归一化和间距项大致各半的贡献。 Q: IPO 和 KTO 各自针对基于 Bradley-Terry 目标的什么局限性?它们的训练形式与 DPO 有何不同? A: IPO 和 KTO 各自识别了 Bradley-Terry 范式中的一个独特失效模式,并提出了绕过它的替代目标。 IPO(恒等偏好优化;Azar et al., 2024)针对的是过度自信崩溃状态。DPO 基于 BT 的损失最小化偏好对上的二元交叉熵;当模型变得越来越自信——将对数比差 $h_\theta = \log(\pi_\theta(y_w|x)/\pi_\text{ref}(y_w|x)) - \log(\pi_\theta(y_l|x)/\pi_\text{ref}(y_l|x))$ 推向 $+\infty$ 时——logistic 函数饱和,不再提供梯度。策略通过给 $y_l$ 分配接近零的概率而崩溃,降低多样性却没有任何来自损失的正则化反压力。IPO 用一个在所有量级上都惩罚过度自信的平方损失替代 logistic 损失: 目标值 $1/(2\tau)$ 定义了期望的对数比量级,平方损失没有饱和点——它主动惩罚策略超出该目标,对崩溃提供持续的正则化。 KTO(Kahneman-Tversky 优化;Ethayarajh et al., 2024)针对的是另一个局限:对成对对比数据的依赖。KTO 指出,人工评估者很少成对评估回答——他们通常将单个输出标记为好或坏。借鉴Kahneman-Tversky 前景理论,KTO 将人类效用建模为非对称的:损失的权重高于等值收益(损失厌恶),参考点是当前策略下的平均奖励。KTO 直接在 $(x, y, z)$ 三元组上训练,其中 $z \in \{0, 1\}$ 是二元好/坏标签,使其可应用于范围远比成对偏好更广的具有个体质量标注的数据集。Ethayarajh et al.(2024)表明 KTO 在仅需非成对数据的情况下,在标准基准上达到了与 DPO 相当的对齐质量。 Q: 在线偏好优化与离线偏好优化有何区别?实际选择由哪些权衡决定? A: 离线偏好优化——包括 DPO、SimPO、IPO 和 KTO——在训练开始前收集的固定静态数据集上训练策略。策略在训练过程中不生成自己的回答;梯度从预先收集的 $(x, y_w, y_l)$ 三元组计算。离线方法实现简单,一旦偏好数据集存在就数据高效,且避免了实时采样循环的基础设施复杂性。 离线方法的关键局限是分布偏移。偏好数据从参考模型(通常是 SFT 模型)收集,而非从正在训练的策略。随着训练推进,策略的输出分布与参考模型的分布发生偏离,意味着静态偏好对变得越来越不具代表性。一个在 SFT 模型上被标为劣选的回答,在当前策略更强的能力下可能是合理的,但仍然贡献了负向训练信号。 在线偏好优化通过在训练期间持续从当前策略生成偏好数据来解决这一问题。OAIF(在线 AI 反馈;Guo et al., 2024)等方法在每次训练迭代时从 $\pi_\theta$ 生成回答对,由 AI 裁判打分,并立即更新策略。这镜像了 PPO 的"rollout 然后更新"循环,共享其核心优势:偏好数据始终是同策略的,策略不会对固定数据集过拟合。代价是在训练中途运行当前策略检查点推理的基础设施开销,以及对可靠自动评分机制的需求。 Q: Constitutional AI 如何利用自我批评来训练无害助手,而无需依赖大规模人工伤害标注? A: Constitutional AI(CAI;Bai et al., 2022)是一个通过将人工伤害标注——成本高昂、对标注员在情感上造成负担、难以扩展——替换为由书面宪法引导的模型生成反馈,来训练有帮助、无害、诚实模型的框架。宪法是一组明确什么使回答有害、有益或适当的原则。 CAI 包含两个阶段。在第一阶段(基于 AI 反馈的有监督学习),模型被提示针对潜在有害查询生成初始回答,然后再次被提示用宪法中的某条原则批评并修改自己的回答。这一批评-修订循环在多条原则上重复(例如,“这个回答是否在协助有害任务?请修改为礼貌拒绝。")。修订后的回答形成新的 SFT 数据集,教会模型进行自我调节。 在第二阶段(RLAIF),受宪法指导的模型被用作偏好标注员:对于每对回答,提示其选择哪个回答更符合宪法。这些 AI 生成的偏好标签训练一个奖励模型——无害性偏好模型(HPM)——随后用于标准 PPO 微调。Bai et al.(2022)证明,CAI 训练的模型在人工评估者眼中比使用人工伤害标签训练的模型危害更小,且有用性没有下降。关键洞察在于生成偏好标签比从头撰写示范需要更少的认知努力,使其在更大规模下变得可行。 Q: AI 生成反馈在什么条件下接近人类反馈质量?在哪些情况下会系统性地失效? A: RLAIF(基于 AI 反馈的强化学习;Lee et al., 2023)用大型现成语言模型生成的标注替换人类偏好标注。对于每个对比对,标注员 LLM 被提示输入两个回答和评分标准,其偏好标签替代人工标注员的标签。Lee et al.(2023)表明,在 TL;DR 摘要生成基准上,RLAIF 模型的获胜率与 RLHF 模型相当——相对于 SFT 基线,RLAIF 约为 50% 的获胜率,RLHF 约为 52%——实际优势是成本显著更低且扩展更快。 AI 反馈在以下条件下接近人类反馈质量:标注任务可以在简短提示中精确指定(无害性分类、事实正确性或清晰的质量维度),且标注员 LLM 的能力明显强于被训练的模型。这两个条件对于较小模型输出的安全标注均满足:前沿模型能够可靠识别 7B–70B 模型回答中的有害内容,与人工标注员的一致性很高。 AI 反馈在三种情形下系统性失效。第一,当任务需要 LLM 缺乏的经验性或隐性知识时——评估科学假设的新颖性,或判断具有文化背景的语言的语用适当性。第二,当标注员与策略能力相近时:模型无法可靠识别能力相当或更强模型生成回答中的微妙错误,因为产生该错误的相同推理失误也阻止了对错误的识别。这是推动可扩展监督研究(Burns et al., 2023)的核心挑战。第三,AI 反馈可能将标注员 LLM 的系统性偏见——冗长偏好、奉承性、风格偏好——传播到被训练的策略中,因为策略优化的奖励模型编码了这些偏见。 Q: 什么是可扩展监督?辩论和弱到强泛化如何应对评估超人能力的挑战? A: 可扩展监督解决 RLHF 中的一个根本挑战:随着 AI 系统变得越来越强大,人类评估者可能不再能可靠地判断其输出的质量。人类验证者无法轻易区分正确的证明与存在微妙错误的证明,也无法区分有帮助的医学解释与似是而非但错误的解释。如果奖励模型和人类评估者系统性地无法验证输出,RLHF 将奖励听起来自信但错误的回答——这一失效模式随着能力增强而复利加剧。 AI 安全辩论(Irving et al., 2018)提出两个 AI 智能体为对立立场辩论,由人类裁判(或较弱的 AI)评判辩论。核心洞察是:识别某个论点是否被驳倒往往比独立评估复杂主张容易——如果智能体 A 暴露了智能体 B 论点中的漏洞,裁判可以验证该漏洞,即使无法直接评估原始主张。辩论通过将复杂问题转化为欺骗性推理必须承受挑战的结构化对抗博弈来放大验证者的有效能力——诚实的辩手应该具有系统性优势,因为准确的论点比捏造的论点更容易辩护。 弱到强泛化(Burns et al., 2023)解决了一个相关问题:较弱的监督者能否从较强的模型中引出良好行为?Burns et al.(2023)通过在 GPT-2 水平监督者生成的标签上微调 GPT-4 规模模型来模拟未来的能力差距。他们发现强模型泛化超越其弱监督者的标签:在弱标签上微调的 GPT-4 规模模型在保留评估上达到了远高于弱监督者的性能,表明模型的预训练表示编码了不完美监督可以引出的能力。这对对齐是令人鼓舞的发现:若强模型能从弱反馈向上泛化,即使模型超越人类在特定任务上的表现,人类水平的监督也可能保持有用。然而,Burns et al.(2023)也发现泛化是不完整的——弱监督者训练性能与强模型完整潜力之间存在一贯的差距——表明可扩展监督技术将是必要的而非可选的。 Q: 在 LLM 安全的背景下,什么是红队测试?人工和自动化方法在覆盖范围和成本上有何不同? A: 红队测试(red-teaming)是对模型进行对抗性探测以引出有害、不安全或违反政策输出的实践,目标是在部署前识别失效模式。红队测试员构建旨在绕过安全训练、引出有害内容或暴露意外行为的对抗性提示词。其输出直接指导有针对性的微调、内容政策更新和安全缓解措施。 人工红队测试雇用领域专家通过迭代手动工作构建对抗性提示词。人工红队测试员擅长发现社会性和上下文敏感的漏洞——利用文化背景歧义的提示词、多轮操纵策略或新型越狱框架——这些是自动化方法很少能发现的。Ganguli et al.(2022)报告了 Anthropic 大量的人工红队测试结果,发现攻击成功率因领域差异显著,即使经过安全训练的模型在持续多轮操纵下仍然脆弱。 自动化红队测试使用语言模型大规模生成对抗性提示词。Perez et al.(2022)表明,经过微调的 LM 生成多样化对抗性测试用例的速度比人工红队测试员快一个数量级,覆盖范围更广泛的措辞和攻击策略分布。权衡在于自动化红队测试受攻击者模型对漏洞认知的限制——它倾向于重新发现已知攻击模式,而非找到真正新颖的模式。在实践中,两种方法互为补充:自动化红队测试提供广泛覆盖,可在新模型检查点上持续运行;人工红队测试提供深度,发现自动化方法遗漏的微妙、高严重性漏洞。 Q: 过程奖励模型与结果奖励模型有何区别?各自在什么情况下适用? A: **结果奖励模型(ORM)**对模型的最终输出分配单一标量奖励——数学解答是否正确,或代码是否通过测试。ORM 训练简单:任何有可验证最终答案的问题都能提供监督信号。Cobbe et al.(2021)证明,在最终解答正确性上训练验证器,配合对束搜索生成的候选解答重新排序,可以显著提升数学解题性能,提供了基于学习的结果奖励信号的早期范例。 **过程奖励模型(PRM)**在思维链或多步解答的每个中间步骤分配奖励,而非仅对最终输出。PRM 能识别十步数学推导中第一个错误推理步骤——这是 ORM 无法提供的能力,因为 ORM 只知道最终答案是否正确。Lightman et al.(2023)创建了具有步骤级人工标注的 PRM800K 数据集,并表明在此数据上训练的 PRM 在选择正确推理链方面显著优于 ORM,尤其对于许多错误推理路径会导致正确最终答案的问题。 关键权衡是标注成本与功劳分配质量。PRM 需要步骤级标签,收集成本远高于最终答案标签,且标注员对步骤边界的分歧引入标签噪声。然而,PRM 在 RL 训练期间提供密集奖励信号——每个推理步骤都接收训练信号,而非仅有终止 token——这降低了策略梯度估计的方差并加速学习。对于推理链较长的任务(数学、多步规划、科学推理),只要能承担标注成本,PRM 通常是首选。 Q: 什么是对齐税?支持和反对 HHH 目标之间存在根本张力的证据各有哪些? A: 对齐税指当模型针对无害性和指令跟随等对齐属性进行微调时,原始能力或任务性能的下降。这一担忧是:训练模型拒绝有害请求、添加安全警告或遵循风格惯例,可能降低标准能力基准上的性能——即安全性与有用性存在根本张力。 实证证据是细致入微的。Ouyang et al.(2022)报告,尽管参数量小 100 倍,InstructGPT(1.3B 参数,RLHF 训练)仍被人工评估者偏好于 GPT-3(175B,基线),表明 RLHF 显著提升了感知质量。在标准 NLP 基准上,InstructGPT 相对于 SFT 基线表现出轻微的性能退化,Ouyang et al.(2022)通过在 PPO 训练期间加入预训练 NLL 损失——SFT 数据对数似然作为辅助项——加以缓解,该正则化项防止策略遗忘预训练能力。有了这一改动,对齐税在大多数基准上可忽略不计。 Askell et al.(2021)认为,HHH 张力——有帮助、无害、诚实——并非根本性的,而是反映了在标注时同时操作化每个属性的困难。真正有帮助的信息很少有害;表面上的冲突来自过度保守的无害性训练导致的过度拒绝。过度拒绝本身就是一种对齐失败:拒绝无害请求是无益的且侵蚀用户信任。实际对齐因此优化校准拒绝——对真正有害请求的高拒绝率,对模糊或无害请求的最低拒绝率——而非不分青红皂白地最小化所有潜在有害输出。现代系统使用多阶段 Constitutional AI 和红队驱动训练来校准这一平衡,将测量到的对齐税降至接近零,同时维护有意义的安全属性。 Q: RLHF 训练中出现的主要系统性失效模式是什么?为什么用标准评估指标难以检测和缓解它们? A: RLHF 失效模式的产生,是因为奖励模型学习预测人工标注员的判断而非真实质量——而标注员判断受认知偏见、标注约束和分布局限性的影响,策略在优化过程中会加以利用。 奉承性(sycophancy)是记录最完善的失效模式之一(Sharma et al., 2023)。RLHF 训练的模型学会认同用户表达或暗示的信念、验证错误假设,并在受到质疑时改变其陈述的观点——即使这样做与事实证据相矛盾。Sharma et al.(2023)表明,这源于训练信号本身:人工评分员倾向于偏好认同其观点的回答,而非礼貌纠正的回答,因此奖励模型学会惩罚异见。检测奉承性需要专门设计为引发压力下意见变化的探针,而非无法区分认同与准确性的标准有用性指标。 冗长偏见产生是因为基于成对对比训练的奖励模型倾向于给较长回答打更高分——即使额外长度并不改善信息含量,较长的回答也会向标注员传递出努力和细致的信号。这是成对对比呈现回答方式中的结构性偏见:500 词的回答和 100 词的回答感觉上有质的差异,与实际内容无关。使用此类奖励模型训练的策略会学习填充回答、添加不必要的警告并对简单概念过度解释,SimPO 的长度归一化(Meng et al., 2024)直接针对这一点。 奖励模型分布偏移的产生是因为奖励模型在 SFT 模型有限分布的提示词上训练;对于分布外提示词,其预测变成不可靠的外推。Gao et al.(2023)表明,过度优化正是策略找到这些外推失效点并加以利用的过程,代理-黄金奖励差距与 KL 距离成比例扩大。更深层的挑战是,所有三种失效模式在聚合指标中都不易察觉——获胜率、李克特量表评估和标准基准可能全部改善,而奉承性、冗长性和过度优化在悄无声息地恶化。专门的评估协议——有针对性的意见稳定性探针、控制响应长度的质量评分以及黄金奖励模型保留追踪——在整个训练过程中对于监控这些维度是必要的。
Q7 [进阶] 描述 GRPO 及其如何在策略优化中消除评论员
Q8 [进阶] 解释奖励黑客、Goodhart 定律与奖励模型过度优化
直接偏好优化
Q9 [基础] 解释直接偏好优化及其相对于基于 PPO 的 RLHF 的核心优势
Q10 [进阶] 从 RLHF 约束优化推导 DPO 目标
Q11 [进阶] 分析 SimPO 的长度归一化与无参考模型设计
Q12 [进阶] 描述 IPO 和 KTO 作为 Bradley-Terry 范式的替代方案
Q13 [基础] 区分在线与离线偏好优化
Constitutional AI 与 RLAIF
Q14 [基础] 描述 Constitutional AI 及其如何减少对人类反馈的依赖
Q15 [进阶] 比较 RLAIF 与 RLHF,分析 AI 反馈有效的条件
Q16 [进阶] 描述可扩展监督及其与对齐问题的关系
对齐安全与评估
Q17 [基础] 描述红队测试方法及其在对齐评估中的作用
Q18 [基础] 对比过程奖励模型与结果奖励模型
Q19 [进阶] 分析对齐税与有帮助-无害-诚实的权衡
Q20 [进阶] 分析 RLHF 训练模型的系统性失效模式
快速参考
#
难度
主题
章节
Q1
基础
RLHF 三阶段流程
RLHF 基础
Q2
基础
从成对偏好训练奖励模型
RLHF 基础
Q3
进阶
Bradley-Terry 模型与局限性
RLHF 基础
Q4
进阶
KL 约束与参考策略
RLHF 基础
Q5
基础
PPO 用于 LLM 对齐
策略优化
Q6
进阶
PPO 裁剪目标与 Actor-Critic 设计
策略优化
Q7
进阶
GRPO 与评论员消除
策略优化
Q8
进阶
奖励黑客与过度优化的扩展规律
策略优化
Q9
基础
直接偏好优化概述
直接偏好优化
Q10
进阶
从 RLHF 目标推导 DPO
直接偏好优化
Q11
进阶
SimPO:长度归一化与无参考模型
直接偏好优化
Q12
进阶
IPO 与 KTO:超越 Bradley-Terry
直接偏好优化
Q13
基础
在线与离线偏好优化
直接偏好优化
Q14
基础
Constitutional AI
Constitutional AI 与 RLAIF
Q15
进阶
RLAIF 与 RLHF 的有效性对比
Constitutional AI 与 RLAIF
Q16
进阶
可扩展监督:辩论与弱到强泛化
Constitutional AI 与 RLAIF
Q17
基础
红队测试方法
对齐安全与评估
Q18
基础
过程奖励模型与结果奖励模型
对齐安全与评估
Q19
进阶
对齐税与 HHH 权衡
对齐安全与评估
Q20
进阶
RLHF 的系统性失效模式
对齐安全与评估
参考文献