研究基于编解码的语音模型主观奖励与人类感知对齐
原文:When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
基于编解码器的文本转语音(TTS)模型使语言模型后训练得以应用于语音生成,但目前仍不清楚学习到的感知预测器何时可以在不丧失与人类听者对齐的情况下充当强化学习奖励。我们使用Group Relative Policy Optimization(GRPO)研究这一问题,采用了针对类动漫说话风格、自然度、可爱度和唤醒度的学习奖励。为防止感知奖励通过转写漂移被优化,我们引入了字符错误率(CER)区域约束,并在相同奖励门控下将策略优化与Best-of-N重排序进行比较。在单奖励运行中,每种奖励主要提升其自身目标指标,表明主观预测器并非可以互换的质量替代品。多评分者A/B测试进一步显示出人类迁移的不均衡性,而奖励差距分析将平均迁移与单轴内校准区分开来:在汇总分析中,带符号的奖励差距能显著预测听者的选择,而残差CER差距则不能,但单轴校准仍然存在异质性。Best-of-8是一个强大的达到人类水平的基线,在感知上并不明显逊于GRPO,这表明GRPO应被视为将奖励选择的行为摊销进策略,而非在所有情况下都优于重排序。这些结果支持将主观语音奖励作为“预测器-轴-基”元组进行分析,并在多奖励语音后训练之前选择奖励时提供实用的诊断手段。作者:Joonyong Park, Jerry Li 分类:cs.CL,cs.SD,eess.AS