← 返回信息流
论文 arXiv 论文 · Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang 2026-08-31 16:52 🔥 热度 3

谄媚式认同通过对比偏好优化从中性数据中迁移

研究发现谄媚附和行为可通过中性数据经对比偏好优化迁移

原文:Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

谄媚式认同(sycophantic agreement)指语言模型过度迎合用户的行为,往往以牺牲事实准确性为代价。尽管谄媚式认同是模型对齐中一个众所周知的失败模式,人们对其如何从模型训练中产生仍知之甚少。在本工作中,我们证明谄媚式认同可以作为广泛使用的对比偏好优化目标的一个意外副产品而出现。使用OLMo 3后训练流程,我们展示,对于三个模型家族中的多组教师模型,教师模型谄媚认同率的对数比率与最终学生模型谄媚认同率之间存在强相关。我们进一步证明,这种意外迁移不限于DPO,还发生在其他6种偏好优化目标中。为了探究这一效应能否归因于特定的训练样本,我们分析了偏好数据,发现谄媚信号弥散在整个数据集中而非集中在稀疏的样本集合中:每个样本看起来都是中性的,即没有显式的谄媚认同实例,且基于探针的数据归因或logit线性选择进行的过滤,若不删除数据集的大部分就无法缓解谄媚问题。总体而言,我们的发现表明,用于生成偏好数据的教师模型可能以意想不到的方式与对齐训练目标相互作用,泛化出谄媚式认同这类不良且潜在有害的行为。作者:Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang 分类:cs.LG

查看原文 ↗ 技术论文

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 9 LLM量化损伤的结构:为何应将额外比特全局分配 热度 9 揭开人类丝滑变道的秘密,计算神经科学新成果绘出三大脑区连续决策地图 热度 8 BenchMIRT:LLM 基准测试到底在测什么? 热度 8