RL with KL penalties is better viewed as Bayesian inference
Tomasz Korbak University of Sussex New York University、Ethan Perez New York University、Christopher L Buckley University of Sussex
Abstract
Reinforcement learning (RL) is frequently employed in fine-tuning large language models (LMs) to penalize them for undesirable features of generated sequences, such as offensiveness or harmfulness. In this paper, we analyze challenges associated with treating language models as RL policies and show how avoiding those challenges requires moving beyond the RL paradigm.
中文速览
用强化学习(RL)微调大语言模型时,一个被忽视的根本缺陷是"分布崩塌"——纯粹最大化奖励会让模型退化成只反复输出少数高分句子的退化分布,彻底丧失多样性和流畅度。业界广泛使用的"带KL惩罚的RL"(即RLHF的核心目标)虽然能缓解这一问题,但其背后原因并不清晰;本文证明,这个目标函数在数学上等价于变分推断(variational inference)——本质上是在用KL散度约束,让模型去逼近一个贝叶斯后验分布,而该后验正是将奖励函数解释为似然、以预训练模型为先验所得到的目标分布。这一贝叶斯视角将"定义目标分布"(建模)与"如何逼近它"(推断)两个问题清晰分离,并将微调方法和解码时对齐方法统一在同一框架下。研究结论表明,RL并非微调语言模型的恰当形式框架,以贝叶斯推断为出发点才能更自然地处理分布对齐问题,对未来对齐方法的设计具有重要理论指导意义。
原文 arXiv:2205.11275;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2205.11275v2