论文解读

时长定多久才好听:DMOSpeech 2 把时长预测也纳入指标优化

针对扩散零样本语音合成中时长预测长期游离于感知指标优化之外的问题,DMOSpeech 2 用分组相对策略优化对时长预测器做强化学习并引入教师引导采样,在 Seed-TTS 上把英文 WER 降到 1.752、相似度提到 0.698,代价是教师引导模式需同时保存师生参数并增加采样步数。

 · 更新于 2026-09-24 · 约 17 分钟 · 8292 字 阅读 →
论文解读

为每段呼吸声选增强:PASA 用两阶段混合策略平衡效率与个性化

针对听诊数据稀缺且正常与异常声音频谱特性不同,PASA 把增强选择建模为马尔可夫决策过程并用混合批量-样本策略执行,在三个基准上提升诊断分数,但个性化依赖验证集奖励与样本统计积累,计算代价高于固定增强。

 · 更新于 2026-09-24 · 约 25 分钟 · 12377 字 阅读 →
论文解读

在又听又看的长视频里找准谁在响、何时响、在哪里:R-AVST 与 AVST-Zero

针对未剪辑复杂视听场景中发声可见物体的时空定位问题,论文构建带细粒度时空标注的 R-AVST 并用多维奖励的 GRPO 训练 AVST-Zero,最强证据是在时序推理上达到 47.96% m tIoU 并在时空联合任务上同时提升时间与空间指标,代价是空间绝对精度仍很低且依赖自动标注加人工清洗的流水线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8572 字 阅读 →
论文解读

看得见情绪还不够,可信才能用:MultiMood 的多模态分工与对齐代价

MultiMood 针对纯文本情感支持丢失非语言线索且回复不可靠的问题,用视频音频文本三路编码加对话压缩与 PPO 加 GRPO 可信对齐,在 MESC 四任务与 DFEW 表情识别上取得最优平均表现,代价是策略预测仍弱于专用基线且压缩会损失信息。

 · 更新于 2026-09-24 · 约 18 分钟 · 8664 字 阅读 →
论文解读

合成错一个词就够了:用 ASR 交叉注意力的清晰度与单调性做词级奖励

针对自回归 TTS 整句打分太粗、难以定位个别错词的问题,论文用冻结 Whisper 交叉注意力算出注意力纯度与对齐单调性两个词级奖励,再做组内相对策略优化,在 CoSyVoice 上把域内 WER 从 5.25 降到 3.21、域外从 8.92 降到 4.54,代价是需要额外采样与 ASR 打分开销且未报告延迟。

 · 更新于 2026-09-24 · 约 18 分钟 · 8632 字 阅读 →
论文解读

换一种说法、换一种声音,对齐就松动:StyleBreak 的风格化音频越狱

论文针对大音频语言模型的黑盒音频越狱问题,用两阶段语言与声学风格变换加查询自适应策略搜索 70 种风格组合,在 4 个开源模型和 2 个商用模型上验证了情感、年龄、性别扰动能提升越狱成功率,代价是需要可控 TTS 与多次查询评估。

 · 更新于 2026-09-24 · 约 20 分钟 · 9712 字 阅读 →
论文解读

眼睛看到不等于耳朵听到:用音频专属参考把多模态推理拉回声音证据

针对视觉存在但音频缺失的不对称输入,论文用 AV-ConfuseBench 暴露视觉主导误判,并用 RL-CoMM 的两阶段强化协作把 Qwen2.5-Omni-3B 的问答与幻觉指标提升 10 到 30 个百分点,代价是只在有限样本上做在线策略优化并依赖外部音频推理与嵌入裁判。

 · 更新于 2026-09-24 · 约 19 分钟 · 9458 字 阅读 →
论文解读

流式识别不是等多久,而是每个字该等多久:X2Streaming-ASR 的位置相关提交

针对单遍硬提交流式中文识别,X2Streaming-ASR 用监听与解码交替的等待或提交决策加三阶段训练,在五个测试集上报告平均字符提交延迟为 27 毫秒到 84 毫秒,并在 AISHELL-1 和 AISHELL-3 上取得参评流式系统中最优字符错误率,代价是部分测试集离线能力上限弱于基线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8680 字 阅读 →
论文解读

记忆即变换:LETHE 用能量判别与随机扰动让混响参数自己走

LETHE 把 3×3 反馈延迟网络当作可被改写的房间,用五特征线性判别器对照初始声音 DNA、以单样本扰动更新十一个参数,45 组 180 秒对照显示只有生成器开启时 c22 才会演化,但稳定工作点偏离经典纳什均衡且扰动先验仍待剥离。

 · 更新于 2026-09-24 · 约 16 分钟 · 7985 字 阅读 →
论文解读

耦合失真下不换模型而换管线:StrixAE 用智能体调度专家模型

针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。

 · 更新于 2026-09-24 · 约 22 分钟 · 10852 字 阅读 →
论文解读

先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11200 字 阅读 →
论文解读

别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读

语音合成 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11235 字 阅读 →
论文解读

7B 做原生音画同步:用门控与路由把对齐做轻,而不是把参数做大

扩散模型 | 5.9/10

 · 更新于 2026-09-24 · 约 30 分钟 · 14580 字 阅读 →
论文解读

听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音

说话人日志 | 7.0/10

 · 更新于 2026-09-24 · 约 29 分钟 · 14406 字 阅读 →
论文解读

一句里装不下两种心情:HybridEmo 如何让 TTS 先走完轨迹再调好混合

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12777 字 阅读 →
论文解读

把混音师的耳朵写成奖励:SPHERE 如何让 3B 音频语言模型学会摆位

音乐生成 | 6.9/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12674 字 阅读 →
论文解读

给声音装上刻度:TEMPO 如何让大音频语言模型学会报时

音频事件检测 | 7.1/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12370 字 阅读 →
论文解读

当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令

音乐生成 | 7.1/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13132 字 阅读 →
论文解读

主观分数能当奖励吗?当感知预测器遇上可懂度硬约束

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11677 字 阅读 →
论文解读

听错一个字就全盘皆输:SpeechGym 把语音智能体的失败变成可训练的梯度

语音交互 | 7.6/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8505 字 阅读 →