Ontology-based Target Sound Extraction
📄 从“只会抽叶子”到“整棵树都能点名”:用本体距离重塑目标声音提取的条件空间 英文题目:Ontology-based Target Sound Extraction 一句话:为解决固定叶粒度提取无法响应粗粒度查询的问题,论文在 AudioSet 三层本体上对比多热与全本体独热两种条件化并用 CPCC 损失对齐嵌入欧氏距离与树最短路径,使单次前向在根、中间、叶三级分别达到 6.43/6.66/7.10 dB SI-SNRi,但代价是完全合成数据与单一本体限制了真实泛化验证。 标签:#音频分离 | #对比学习 | #模型评估 评分:5.7/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Carlos Hernandez-Olivan:机构信息未在 arXiv HTML 中可靠披露 Marc Delcroix:机构信息未在 arXiv HTML 中可靠披露 Tsubasa Ochiai:机构信息未在 arXiv HTML 中可靠披露 Naohiro Tawara:机构信息未在 arXiv HTML 中可靠披露 Shoko Araki:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把目标声音提取(Target Sound Extraction, TSE)从固定叶节点提升到本体(Ontology)任意层级单次前向提取,并用共表型相关系数(Cophenetic Correlation Coefficient, CPCC)把树最短路径距离显式压进嵌入(Embedding)欧氏几何,思路干净且对叶级也有增益。短板是评估完全依赖自合成的 5 秒混合与单一 AudioSet 衍生三层树,未做真实录音、跨本体泛化或主观听感,且未开源、未报告方差与显著性检验,让 0.7-1.0 dB 级提升的可信度打折扣。 ...