Explainable-by-Design Audio Deepfake Detection via Wiener-Hopf Linear Prediction
📄 Explainable-by-Design Audio Deepfake Detection via Wiener-Hopf Linear Prediction 标签:#语音伪造检测 #CNN #可解释性 #鲁棒性 #音频理解 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音伪造检测 | #CNN | #可解释性 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Mattia Tamiazzo(意大利帕多瓦大学信息工程系) 通讯作者:未说明(论文未明确标注) 作者列表:Mattia Tamiazzo(意大利帕多瓦大学信息工程系)、Simone Milani(意大利帕多瓦大学信息工程系)、Massimo Iuliani(Amped Software)、Marco Fontani(Amped Software) 💡 毒舌点评 本文试图用“可解释设计”的旗号为基于经典信号处理的检测器赋予新意,核心是将Wiener-Hopf线性预测系数堆叠成图后喂给一个极简CNN。这个思路有一定价值,至少比盲目堆参数要诚实,但其创新本质上是组合式的,将两个已知技术(线性预测、CNN)拼接起来,并冠以“可解释设计”的名号。最大的硬伤在于实验对比严重不足:作者声称性能“有竞争力”,却刻意回避与当前真正的SOTA模型(如高性能的SSL模型或集成方法)进行公平对决;在ASVspoof 2019 LA上明显弱于其自身列出的Wav2Vec2基线,在DiffSSD上微弱的优势也缺乏统计显著性检验。此外,论文完全不开源,声称的低复杂度和高性能均无法验证,这在顶会评审中是致命伤。对可解释性发现(关注静音段)的物理假设(混响)也仅仅是臆测,缺乏扎实的信号分析支撑。 ...