时长定多久才好听:DMOSpeech 2 把时长预测也纳入指标优化
针对扩散零样本语音合成中时长预测长期游离于感知指标优化之外的问题,DMOSpeech 2 用分组相对策略优化对时长预测器做强化学习并引入教师引导采样,在 Seed-TTS 上把英文 WER 降到 1.752、相似度提到 0.698,代价是教师引导模式需同时保存师生参数并增加采样步数。
针对扩散零样本语音合成中时长预测长期游离于感知指标优化之外的问题,DMOSpeech 2 用分组相对策略优化对时长预测器做强化学习并引入教师引导采样,在 Seed-TTS 上把英文 WER 降到 1.752、相似度提到 0.698,代价是教师引导模式需同时保存师生参数并增加采样步数。
针对听诊数据稀缺且正常与异常声音频谱特性不同,PASA 把增强选择建模为马尔可夫决策过程并用混合批量-样本策略执行,在三个基准上提升诊断分数,但个性化依赖验证集奖励与样本统计积累,计算代价高于固定增强。
针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。
MultiMood 针对纯文本情感支持丢失非语言线索且回复不可靠的问题,用视频音频文本三路编码加对话压缩与 PPO 加 GRPO 可信对齐,在 MESC 四任务与 DFEW 表情识别上取得最优平均表现,代价是策略预测仍弱于专用基线且压缩会损失信息。
针对自回归 TTS 整句打分太粗、难以定位个别错词的问题,论文用冻结 Whisper 交叉注意力算出注意力纯度与对齐单调性两个词级奖励,再做组内相对策略优化,在 CoSyVoice 上把域内 WER 从 5.25 降到 3.21、域外从 8.92 降到 4.54,代价是需要额外采样与 ASR 打分开销且未报告延迟。
论文针对大音频语言模型的黑盒音频越狱问题,用两阶段语言与声学风格变换加查询自适应策略搜索 70 种风格组合,在 4 个开源模型和 2 个商用模型上验证了情感、年龄、性别扰动能提升越狱成功率,代价是需要可控 TTS 与多次查询评估。
针对视觉存在但音频缺失的不对称输入,论文用 AV-ConfuseBench 暴露视觉主导误判,并用 RL-CoMM 的两阶段强化协作把 Qwen2.5-Omni-3B 的问答与幻觉指标提升 10 到 30 个百分点,代价是只在有限样本上做在线策略优化并依赖外部音频推理与嵌入裁判。
针对单遍硬提交流式中文识别,X2Streaming-ASR 用监听与解码交替的等待或提交决策加三阶段训练,在五个测试集上报告平均字符提交延迟为 27 毫秒到 84 毫秒,并在 AISHELL-1 和 AISHELL-3 上取得参评流式系统中最优字符错误率,代价是部分测试集离线能力上限弱于基线。
LETHE 把 3×3 反馈延迟网络当作可被改写的房间,用五特征线性判别器对照初始声音 DNA、以单样本扰动更新十一个参数,45 组 180 秒对照显示只有生成器开启时 c22 才会演化,但稳定工作点偏离经典纳什均衡且扰动先验仍待剥离。
针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。
音视频理解 | 6.3/10
语音合成 | 7.4/10
扩散模型 | 5.9/10
说话人日志 | 7.0/10
语音合成 | 7.5/10
音乐生成 | 6.9/10
音频事件检测 | 7.1/10
音乐生成 | 7.1/10
语音合成 | 7.6/10
语音交互 | 7.6/10