← 返回信息流
模型 arXiv 论文 · Joonyong Park, Jerry Li 2026-08-31 16:14 🔥 热度 5

基于预测器的强化学习何时与人类感知对齐?基于编解码器的语音语言模型中主观奖励的研究

研究基于编解码的语音模型主观奖励与人类感知对齐

原文:When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

基于编解码器的文本转语音(TTS)模型使语言模型后训练得以应用于语音生成,但目前仍不清楚学习到的感知预测器何时可以在不丧失与人类听者对齐的情况下充当强化学习奖励。我们使用Group Relative Policy Optimization(GRPO)研究这一问题,采用了针对类动漫说话风格、自然度、可爱度和唤醒度的学习奖励。为防止感知奖励通过转写漂移被优化,我们引入了字符错误率(CER)区域约束,并在相同奖励门控下将策略优化与Best-of-N重排序进行比较。在单奖励运行中,每种奖励主要提升其自身目标指标,表明主观预测器并非可以互换的质量替代品。多评分者A/B测试进一步显示出人类迁移的不均衡性,而奖励差距分析将平均迁移与单轴内校准区分开来:在汇总分析中,带符号的奖励差距能显著预测听者的选择,而残差CER差距则不能,但单轴校准仍然存在异质性。Best-of-8是一个强大的达到人类水平的基线,在感知上并不明显逊于GRPO,这表明GRPO应被视为将奖励选择的行为摊销进策略,而非在所有情况下都优于重排序。这些结果支持将主观语音奖励作为“预测器-轴-基”元组进行分析,并在多奖励语音后训练之前选择奖励时提供实用的诊断手段。作者:Joonyong Park, Jerry Li 分类:cs.CL,cs.SD,eess.AS

查看原文 ↗ 技术论文多模态

📌 相关阅读

3秒出片比播放还快,MiniMax打开了AI视频的实时商业化路径 热度 9 FastVideo-MiniMax-H3,融合模型,数字人,全能参考,文图生视频,8G显存可用,自动补帧,超分放大,首尾帧,自动提示词,多任务队列 热度 9 视频 模型 大PK!谁能兼顾价格、速度、效果? 热度 9 218. 大模型 的训练、推理、SFT、强化学习究竟有什么区别?【每天一个宝藏问题】 热度 9 基于多模态 Qwen3‑VL 大模型 微调实战|环境搭建、数据集处理、 模型 训练、部署推理【码士集团】 热度 9