论文解读
为说话人日志做自监督:目标、数据与容量的分工与代价
该文以 WavLM 为骨干研究说话人日志,报告加权多层目标、10k 小时数据规模、Large 容量与 Conformer 切块调优带来可复现的 DER 下降,但 100k 小时与剪枝收益趋平且标注噪声限制可测改进。
该文以 WavLM 为骨干研究说话人日志,报告加权多层目标、10k 小时数据规模、Large 容量与 Conformer 切块调优带来可复现的 DER 下降,但 100k 小时与剪枝收益趋平且标注噪声限制可测改进。
针对同一说话人说多种语言时模型易依赖说话人特征走捷径的问题,该文采用在 VoxLingua107 上预训练的 ECAPA-TDNN 做编码器并比较 AAM-Softmax 与 RAM-Softmax,在 Tidy-X 上报告识别任务 85.95% 宏准确率与验证任务 16.39% 等错误率,最强证据来自与官方基线的同协议对照,代价是未充分优化未见语种验证与未 …
音乐转录 | 7.4/10
语音识别 | 4.7/10
音视频理解 | 9.4/10
音频事件检测 | 8.8/10
音频理解 | 8.8/10
音频理解 | 8.0/10
说话人验证 | 5.6/10
预训练 | 5.8/10
语音增强 | 5.7/10
语音伪造检测 | 6.0/10
语音合成 | 6.9/10
音频分类 | 6.2/10
音乐转录 | 7.7/10
语音质量评估 | 6.0/10
语音属性识别 | 7.5/10
语音增强 | 8.1/10
音频分类 | 6.3/10
音频分类 | 5.0/10