Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE
📄 Identity-Faithful Audio-Visual Target Speaker Extraction with QIANGDA and VOXBLINK2-AVSE 标签:#音视频语音分离 #多模态模型 #基准测试 #数据集 #数据清洗 6.8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.2/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频语音分离 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 Peijun Yang(武汉大学网络空间安全学院 / 武汉大学人工智能学院),Zhan Jin(武汉大学计算机学院),Juan Liu(武汉大学计算机学院 / 武汉大学人工智能学院,共同通讯作者),Ming Li(武汉大学人工智能学院 / 香港中文大学(深圳)人工智能学院,共同通讯作者)。通讯邮箱:liujuan@whu.edu.cn, ming.li.cuhksz@gmail.com。 💡 毒舌点评 “QiangDa 把 AV-TSE 评测从’独立录音合成的干净混合’拉回到’同一物理场景共同录制的双人重叠’,并要求同一段混合分别在 A/B 视觉提示下输出两个不同身份,OSD-first 严格判定也确实堵住了 visual bypass——这个评测思路比只报 SI-SNR 聪明得多,发布 VoxBlink2-AVSE 也有实际价值。但作为 benchmark 论文,实验通篇只有自家 8 个检查点的内部互比,VisualVoice、USEV、AV-GridNet 这些已有 AV-TSE 方法一个直接对比都没有,读者无法判断 QiangDa 到底比旧基准难在哪、新方法比旧方法强在哪;最强的无 speaker-loss 检查点启动 CLI 未完整保存,等于资源论文里最亮的数字作者自己都复现不出来。基准的’锚’没打好,严谨性和可用性都要打折扣。” ...