论文解读
合成错一个词就够了:用 ASR 交叉注意力的清晰度与单调性做词级奖励
针对自回归 TTS 整句打分太粗、难以定位个别错词的问题,论文用冻结 Whisper 交叉注意力算出注意力纯度与对齐单调性两个词级奖励,再做组内相对策略优化,在 CoSyVoice 上把域内 WER 从 5.25 降到 3.21、域外从 8.92 降到 4.54,代价是需要额外采样与 ASR 打分开销且未报告延迟。
针对自回归 TTS 整句打分太粗、难以定位个别错词的问题,论文用冻结 Whisper 交叉注意力算出注意力纯度与对齐单调性两个词级奖励,再做组内相对策略优化,在 CoSyVoice 上把域内 WER 从 5.25 降到 3.21、域外从 8.92 降到 4.54,代价是需要额外采样与 ASR 打分开销且未报告延迟。
论文把多说话人对话中的手术式伪造注入形式化为时序定位问题,用冻结二分类器加滑窗与迟滞解码器实现零样本定位,在 180 段构造对话上以强骨干达到时序交并比 0.90 左右,但边界位移约 3.5 秒且短时域外生成器注入仍接近全漏检。
在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。
语音合成 | 8.2/10
语音合成 | 7.6/10
语音转换 | 8.0/10
空间音频 | 7.5/10
音视频语音合成 | 6.7/10
音频分类 | 7.2/10
音视频生成 | 6.8/10
语音识别 | 5.6/10
音频生成 | 6.3/10
语音合成 | 7.7/10
语音识别 | 6.6/10
语音合成 | 6.5/10
语音合成 | 6.4/10
语音合成 | 7.0/10
音频生成 | 7.0/10
音视频理解 | 7.1/10
音乐检索 | 7.7/10