研究发现谄媚附和行为可通过中性数据经对比偏好优化迁移
原文:Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization
谄媚式认同(sycophantic agreement)指语言模型过度迎合用户的行为,往往以牺牲事实准确性为代价。尽管谄媚式认同是模型对齐中一个众所周知的失败模式,人们对其如何从模型训练中产生仍知之甚少。在本工作中,我们证明谄媚式认同可以作为广泛使用的对比偏好优化目标的一个意外副产品而出现。使用OLMo 3后训练流程,我们展示,对于三个模型家族中的多组教师模型,教师模型谄媚认同率的对数比率与最终学生模型谄媚认同率之间存在强相关。我们进一步证明,这种意外迁移不限于DPO,还发生在其他6种偏好优化目标中。为了探究这一效应能否归因于特定的训练样本,我们分析了偏好数据,发现谄媚信号弥散在整个数据集中而非集中在稀疏的样本集合中:每个样本看起来都是中性的,即没有显式的谄媚认同实例,且基于探针的数据归因或logit线性选择进行的过滤,若不删除数据集的大部分就无法缓解谄媚问题。总体而言,我们的发现表明,用于生成偏好数据的教师模型可能以意想不到的方式与对齐训练目标相互作用,泛化出谄媚式认同这类不良且潜在有害的行为。作者:Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang 分类:cs.LG