论文解读
加了编解码器训练就掉音质:CRAW 用注意力、掩蔽与纠错把两者拉回平衡
CRAW 针对神经编解码器与去噪重合成导致后处理水印失效的问题,用加宽失真训练加注意力池化加推理时感知掩蔽加重复纠错码,在保持 PESQ 约 4.0 的同时把编解码器与去噪下的检测 F1 拉回 0.8 以上,代价是掩蔽带来约 150 ms 的额外推理延迟。
CRAW 针对神经编解码器与去噪重合成导致后处理水印失效的问题,用加宽失真训练加注意力池化加推理时感知掩蔽加重复纠错码,在保持 PESQ 约 4.0 的同时把编解码器与去噪下的检测 F1 拉回 0.8 以上,代价是掩蔽带来约 150 ms 的额外推理延迟。
针对一段音频里同时含真实与伪造、跨时间与跨声源的混合真实性检测,ToolDF 用音频大模型做编排器按结构调用分离与四个领域专家并执行早失败汇总,在复合类型上取得最高的 C-Avg. 81.89,代价是依赖外部工具的可靠性。
语音伪造检测 | 7.4/10
语音伪造检测 | 6.4/10
语音伪造检测 | 6.5/10
音频水印 | 6.4/10
语音伪造检测 | 6.4/10
语音伪造检测 | 7.5/10
语音伪造检测 | 6.0/10
语音伪造检测 | 6.6/10
语音伪造检测 | 6.1/10
音频伪造检测 | 6.3/10
语音伪造检测 | 7.6/10
语音伪造检测 | 6.0/10
说话人验证 | 6.0/10
语音伪造检测 | 8.4/10
语音伪造检测 | 6.4/10
语音伪造检测 | 7.7/10
语音伪造检测 | 6.8/10
语音伪造检测 | 6.6/10