噪声偏好数据下的DPO后验标签修正
原文:PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization
直接偏好优化(DPO)通过成对比较简化了对齐过程,但其假设所有观测到的偏好都是可靠的。真实数据往往违反这一假设,产生反转、微弱或模糊的标签,导致有害的策略更新。为此,我们提出后验标签纠错DPO(PLC-DPO),通过将每一对的训练信号判定为干净、反转或平局三种情况,实现对偏好的稳健优化。其核心思想是将校准后的策略-参考模型间隔作为在线证据,以采取适当的纠正措施。这将噪声偏好学习重新定义为主动纠正监督的方向和强度,而非仅仅过滤可疑样本。在57个数据集-模型-基准组合上,PLC-DPO取得了最佳平均胜率(60.5,次优方法为55.5)。注入噪声与平局压力测试、人类分歧分析以及自我确认诊断进一步表明,该路由机制保持稳定,并能区分反转样本与方向微弱样本。作者:Boryeong Cho, Sumyeong Ahn, Se-Young Yun 分类:cs.LG,cs.CL