← 返回信息流
模型 arXiv 论文 · Boryeong Cho, Sumyeong Ahn, Se-Young Yun 2026-08-31 11:11 🔥 热度 5

PLC-DPO:噪声与歧义偏好优化中的后验标签纠错

噪声偏好数据下的DPO后验标签修正

原文:PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization

直接偏好优化(DPO)通过成对比较简化了对齐过程,但其假设所有观测到的偏好都是可靠的。真实数据往往违反这一假设,产生反转、微弱或模糊的标签,导致有害的策略更新。为此,我们提出后验标签纠错DPO(PLC-DPO),通过将每一对的训练信号判定为干净、反转或平局三种情况,实现对偏好的稳健优化。其核心思想是将校准后的策略-参考模型间隔作为在线证据,以采取适当的纠正措施。这将噪声偏好学习重新定义为主动纠正监督的方向和强度,而非仅仅过滤可疑样本。在57个数据集-模型-基准组合上,PLC-DPO取得了最佳平均胜率(60.5,次优方法为55.5)。注入噪声与平局压力测试、人类分歧分析以及自我确认诊断进一步表明,该路由机制保持稳定,并能区分反转样本与方向微弱样本。作者:Boryeong Cho, Sumyeong Ahn, Se-Young Yun 分类:cs.LG,cs.CL

查看原文 ↗ 技术论文大模型发布

📌 相关阅读

GPT-6 热度 25 「GPT-6」灰测demo刷屏!周四发布在即 热度 16 DeepSeek V4 Flash Vision 发布了…… 热度 10 自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 10 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9