DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation
📄 DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation 标签:#音视频语音分离 #多任务学习 #语音增强 #鲁棒性 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频语音分离 | #多任务学习 | #语音增强 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Wei Zhou(Yijiahe AI) 通讯作者:Wanyi Ning(Yijiahe AI / 天津大学) 作者列表:Wei Zhou(Yijiahe AI)、Wanyi Ning(Yijiahe AI / 天津大学)、Yinshang Guo(南京大学)、Qianxiao Fang(Yijiahe AI)、Haitao Qian(Yijiahe AI)、Yingpeng Li(Yijiahe AI) 💡 毒舌点评 DAVE 的设计直觉很清醒:视觉不是用来重建波形的,而是用来做身份归属的低带宽决策,这比把不可靠视觉特征硬塞进分离网络更符合真实场景。可惜“certified”这个说法撑不住:场景分类器只有 98.13% 准确率,误路由会让“结构性不降级”不成立;官方排行榜上 DAVE 主要靠 UTMOS 和 DNSMOS-OVRL 两项无参考感知指标领先,SI-SDR、CER、说话人相似度都不是最优,平均排名只在 4.00/4.14,明显落后于 AITD 和 audioman。再加上没有开源代码、权重或 DAVE-Corpus 下载入口,这套系统更像一个工程报告而不能称为可复现的方法贡献。 ...