Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning
📄 Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning #语音交互 #多模态模型 #自监督学习 #低资源 8.2/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | #语音交互 | #强化学习 | #多模态模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Yuxin Li(Nanyang Technological University) 通讯作者:未说明 作者列表:Yuxin Li(Nanyang Technological University)、Donghang Wu(Nanyang Technological University)、Guan-Ting Lin(National Taiwan University)、Hung-yi Lee(National Taiwan University)、Chengwei Qin(The Hong Kong University of Science and Technology)、Zhehuai Chen(NVIDIA)、Chen Chen(NVIDIA) 💡 毒舌点评 该工作聪明地将全双工对话中“何时说话”与“说什么”解耦,用精心设计的局部窗口采样和因子化奖励把发声时机变成一个独立的 RL 优化目标,既保住了指令跟随能力又把交互指标拉满。但奖励函数的八个超参数和繁杂的惩罚项像是精心调制的独门秘方,其跨语言、跨风格的泛化性未经验证,且代码与模型均未开源,让社区难以深入复现和改进。 ...