An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures

📄 An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures #语音伪造检测 #可解释性 #鲁棒性 6.1/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.1/10 | 前50% | #语音伪造检测 | #自监督学习 | #可解释性 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Santiago Rubio(University of Zaragoza, ViVoLab, Aragón Institute for Engineering Research (I3A), Spain) 通讯作者:未明确标注,但根据邮件地址推断为 Santiago Rubio (s.rubio@unizar.es) 作者列表: Santiago Rubio(University of Zaragoza, ViVoLab, I3A) Pilar Bello(University of Zaragoza, ViVoLab, I3A) Dayana Ribas(Business Telecommunications Services (BTS), Spain) Antonio Miguel(University of Zaragoza, ViVoLab, I3A) Eduardo Lleida(University of Zaragoza, ViVoLab, I3A) Alfonso Ortega(University of Zaragoza, ViVoLab, I3A) 💡 毒舌点评 本文用因果图把"捷径学习"包装得漂亮,干预设计也有巧思——只扰动非语音区就能把模型性能打掉60多个百分点,堪称一记响亮的耳光。但可惜整个诊断只在一套SSL前端上唱独角戏,且代码、置信区间、显著性检验全都欠奉,让这个框架目前更像是精致的学术花瓶,距离落地还有很大距离。更关键的是,自定义DA中针对非语音的修剪本质上形成了循环论证——用已知捷径的解药来证明捷径的危害,发现的惊奇度大打折扣。 ...

2026-07-07 · 更新于 2026-07-24 · 4 min · 655 words

Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

📄 Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese) #语音伪造检测 #语音合成 #可解释性 1.9/10 | 创新 0.8/2 | 严谨 0.3/1.5 | 实验 0.1/1.5 | 清晰 0.3/1 | 影响 0.1/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0.3/1.5 📝 1.9/10 | 后50% | #语音伪造检测 | #图神经网络 | #语音合成 #可解释性 | arxiv 👥 作者与机构 第一作者:Yusei Tamura(东京大学 大学院 学际信息学府) 第二作者:Shigekazu Ishihara(广岛国际大学 心理学部 健康福祉学部) 第三作者:Ken Ito(东京大学 信息学环/学际信息学府) 通讯作者:未明确说明(按惯例疑为第三作者 Ken Ito) 💡 毒舌点评 本文将上世纪最优输运(Wasserstein距离)和拓扑数据分析(持久同调)的概念堆砌起来,试图为AI合成语音检测提供新思路。想法是"用频谱分布的贫瘠性来暴露生成模型的马脚",这一点尚可。但论文水平停留在非常初步的探索性原型阶段:实验仅含单个说话人、单个未公开合成模型的几张热力图和散点图,所有可引用的量化数字全部以"“遮挡。全文没有准确率、等错误率、AUC,没有与任何基线对比,没有跨说话人、跨合成器的泛化性测试。声称使用了"持久同调"进行拓扑映射,但方法部分对其构造(如Vietoris-Rips复形、持久图计算)只字未提,实际呈现的仅为特征分解降维。标题与内容严重脱节,这不是在测试方法,而是在展示一张充满占位符的海报。 📌 核心摘要 本文旨在解决生成式AI合成的日语语音(deepfake)难以被人类听觉和常规方法可靠检测的问题。 核心思想是将语音的傅里叶幅度谱归一化,视为一种概率密度函数(作者称为"随机光谱学”),用一维Wasserstein距离度量不同元音频谱间的差异性。作者认为该距离对基频平移(如说话人音高变化)鲁棒,更能反映音色内在差异。 在此基础上,构建元音或整句音频之间的成对Wasserstein距离矩阵,并声称通过"持久同调"方法在保持距离结构的情况下将频谱映射到低维拓扑空间中,观察自然语音与合成语音是否呈分离的簇。 实验仅基于一位日本知名律师的语音样本,对比其自然语音与一个在该样本上训练的语音合成系统所生成的语音。展示结果包括元音摩拉的距离矩阵热力图、二维散点图,以及五句受控元音频率人造句子的距离矩阵与散点图。 所有实验仅以示例图形呈现,无任何数字量化指标。距离矩阵均值文本中以"“占位,合成与自然语音"可清晰区分"的论断完全依赖肉眼观察,既无分类阈值,也无统计检验,更无基线对比。 论文承认其方法目前专用于日语(摩拉音节、元音-假名一一对应的语言),并提出了向英语等语言扩展的设想(利用ARPAbet进行音素标注、控制元音频率造句),但未做任何实验验证。 主要局限性包括:完全缺失的量化实验评估、持久同调方法有名无实、单一数据源导致结论普适性高度存疑、对噪声/码率/说话人变化等实际因素零评估、方法不可复现且无任何开源材料。 🔗 开源详情 代码:未提供链接 模型权重:未提供 数据集:未提供 Demo:未提供 复现材料:未提供 引用的开源项目:参考文献[10] (Bonafos et al., 2023) 和 [11] (Liu et al., 2017) 均为arXiv版本,但论文本身未交付任何代码或数据。 🏗️ 方法概述和架构 论文提出了一种用于区分日语自然语音与合成语音的分析流程,总体分为以下几个步骤: ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 256 words

MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing

📄 MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing #语音伪造检测 #可解释性 #自监督学习 #领域适应 6.3/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 6.3/10 | 前50% | #语音伪造检测 | #Transformer | #可解释性 #自监督学习 | arxiv 👥 作者与机构 第一作者:Yugwon Won(RaonSecure Co., Ltd., AI Security R&D Team, Seoul, Republic of Korea) 通讯作者:Yugwon Won(同第一作者) 作者列表:Yugwon Won(AI Security R&D Team, RaonSecure Co., Ltd.) 💡 毒舌点评 论文将手工特征拆分为多语义查询令牌进行交叉注意力融合,并利用注意力矩阵和令牌激活进行可解释性分析,思路是有趣的。但这项工作的核心贡献更多体现在特征工程与可视化技巧上,而非提出基础性的新架构或理论。方法在2019年数据集上接近单任务SOTA,但在真正考验泛化能力的2021年跨域评测上表现惨淡,尤其是PA场景(EER 40.09%),使得“统一”模型的卖点大打折扣。对最核心的“6-token”与“单token”之间的性能差异,论文避而不谈,可解释性分析也仅限于定性观察,缺乏严格的因果或消融验证,这使得整体贡献的坚实程度存疑。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 415 words

Open-Set Source Tracing as Compositional Factors via Structured Prototypes

📄 Open-Set Source Tracing as Compositional Factors via Structured Prototypes #语音伪造检测 #可解释性 6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5 ✅ 6/10 | 前50% | #语音伪造检测 | #对比学习 | #可解释性 | arxiv 👥 作者与机构 第一作者:Santiago Rubio(University of Zaragoza, ViVoLab, Aragón Institute for Engineering Research (I3A), Spain) 通讯作者:未明确指定,推断为 Santiago Rubio 作者列表:Santiago Rubio, Antonio Almudévar, Antonio Miguel, Eduardo Lleida, Alfonso Ortega(均隶属于 University of Zaragoza, ViVoLab, I3A) 💡 毒舌点评 这篇文章用 “Nature vs. Nurture” 的比喻把合成语音来源拆成架构、数据和残余因子,思路漂亮且很有解释力;结构化正交原型与子空间划分也确实在少样本开集归因上稳住了泛化差距。但实验仅围绕 MLAAD 一个数据集自娱自乐,缺少与更丰富的开集溯源方法(如基于 OOD 分数的方案)的正面交锋,也没有任何代码或权重放出,让人对方法的真实鲁棒性心里没底。44 个未见源的评估听起来唬人,但未见架构和未见数据集的严重不对称性让“泛化”的成色打了折扣。 ...

2026-07-07 · 更新于 2026-07-24 · 5 min · 933 words

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

📄 Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings #音频理解 #可解释性 6.2/10 | 创新 1/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.3/1.5 ✅ 6.2/10 | 前50% | #音频理解 | #对比学习 | #可解释性 | arxiv 👥 作者与机构 第一作者:Héctor Martel(未说明) 通讯作者:未说明 作者列表:Héctor Martel(未说明)、Joe Hennessy-Priest(未说明)、Taemin Cho(未说明) 💡 毒舌点评 这篇论文用扎实且系统的方法给CLAP音频嵌入做了一次深度"体检",干净利落地揭示了RT60/LUFS/SC/RP等低级声学属性的编码规律,特别是"近似线性编码"和"强迫非线性编码"两种模式的划分,以及跨模型泛化验证,确实有料。但说到底,这是用标准探测工具对一个已知模型做属性摸底,方法论上没有新东西;对比的8个额外模型全用别人现成的;而且论文对于代码、模型权重和数据集的可复现性要求闭口不谈——这在强调开源的顶会里,基本等同于在审稿人面前主动亮出软肋。 📌 核心摘要 本文旨在系统性研究音频-语言基础模型CLAP的嵌入空间中,如何编码混响时间(RT60)、响度(LUFS)、频谱质心(SC)和相对音高(RP)这四种低级声学属性。 方法核心是使用线性、MLP和基于RBF核的岭回归(Kernel Ridge Regression)三种复杂度递增的探测模型,在完全冻结的LAION-CLAP音频编码器嵌入上训练回归任务,以判断每个属性的编码是线性还是非线性,并通过分析独立训练得到的线性探头权重向量的余弦相似度,考察学习到的特征方向在不同数据集下的一致性。 与以往工作相比,本文是首次对CLAP进行如此系统和全面的低级声学属性探测研究,覆盖多个数据域(噪声、语音、单声道音符、音乐混音),并首次揭示了频谱质心的强非线性编码(线性探头在5个数据集中的4个上完全失败)与其他属性(RT60、LUFS、RP)的近似线性编码这两种不同的编码机制。 主要实验结果如原文表1所示,所有属性均可被非线性探头可靠恢复。RT60、LUFS和RP近乎线性编码,而SC需要非线性探头。线性探头对RT60和LUFS表现出跨数据集一致性,而RP则高度依赖数据集。这些发现能推广到另外8个音频基础模型(如MS-CLAP、MERT、Wav2Vec2、Whisper、WavLM、VGGish),但振幅不变架构(如Wav2Vec2、WavLM-Large、MERT)会完全丢失响度信息。 特征 数据集 线性探头 R² (范围) 非线性探头 R² (范围) 关键发现 RT60 全部5个 0.67 (NSynth) - 0.95 (White Noise) 0.75 (MusDB18HQ) - 0.99 (White Noise) 近乎线性编码;跨域特征轴一致 LUFS 全部5个 0.76 (MusDB18HQ) - 0.99 (White Noise) 0.88 (NSynth) - 1.00 (White Noise) 近乎线性编码;跨域特征轴高度一致 SC 全部5个 R² < -1 (失败) 至 0.43 (NSynth) 0.40 (MusDB18HQ) - 1.00 (White Noise) 强非线性编码;线性恢复仅在NSynth上部分成功 RP 全部5个 0.36 (MusDB18HQ) - 0.97 (White Noise) 0.64 (MusDB18HQ) - 1.00 (White Noise) 介于线性和非线性之间;特征轴高度领域相关 实际意义在于,证明了一个冻结的CLAP模型可同时用于估计混响、响度和频谱内容,为自动混音分析、效果链估计和文本驱动效果控制等应用奠定了理论基础。 主要局限性(论文明确承认)包括:仅分析最终层嵌入而忽略中间层、RT60增强使用简化的鞋盒房间几何模型、MusDB18HQ等音乐混音中可能存在残余混响、未能建立响度和音高的跨模态一致文本预测、文本描述实验仅为定性演示。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及(论文使用并评估了多个开源预训练模型,如 LAION-CLAP、MS-CLAP、MERT、Whisper 等,但未提供任何自训权重或权重下载的整合链接) 数据集:论文中未提及数据集的统一获取链接(使用了 White Noise 合成数据、NSynth、VCTK-Corpus、MusDB18HQ、SonicMaster,均为公开或可申请获取的第三方数据集,但未提供一站式下载地址) Demo:论文中未提及 复现材料:论文中未提供独立的复现包或配置文件,但在第 3.3 节给出了全部训练超参数(如学习率 $ 1 \times 10^{-3} $ , batch size 256 等)和探针结构细节 论文中引用的开源项目: LAION-CLAP: https://github.com/LAION-AI/CLAP pyloudnorm: https://github.com/csteinmetz1/pyloudnorm gpuRIR: https://github.com/DavidDiazGuerra/gpuRIR torch_audiomentations: https://github.com/iver56/torch-audiomentations torchaudio: https://github.com/pytorch/audio fadtk: https://github.com/microsoft/fadtk 🏗️ 方法概述和架构 本论文的核心方法是一个参数化探测框架,旨在通过训练浅层模型预测冻结嵌入中的特定声学属性,从而解析该属性的编码几何特性(线性或非线性)。该框架设计严谨,通过为每个属性独立生成增强数据来消除属性间的伪相关,确保探测到的编码结构完全来自嵌入空间本身。 ...

2026-07-07 · 更新于 2026-07-24 · 3 min · 515 words

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

📄 RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain #零样本 #少样本 #可解释性 #自监督学习 8.1/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.1/10 | 前25% | #音频理解 | #参数高效微调 | #零样本 #少样本 | arxiv 👥 作者与机构 第一作者:Omer Moussa(Max Planck Institute for Software Systems, Saarbrücken, Germany) 通讯作者:Mariya Toneva(Max Planck Institute for Software Systems, Saarbrücken, Germany) 作者列表:Omer Moussa(Max Planck Institute for Software Systems)、Mariya Toneva(Max Planck Institute for Software Systems) 💡 毒舌点评 本文巧妙地将群体共享响应的零样本预测与高效的个体少样本适配统一在一个紧凑的模型中,其学到的ROI查询嵌入能无监督地恢复出听觉到语言的皮层层级,设计精妙。然而,亮点背后是隐忧:训练仅依赖6名受试者的单一视听数据集,混合数据集训练未带来增益反而有所下降,这对其作为“基础模型”的泛化能力投下阴影。实验局限于英语自然聆听场景,其对多语言、对话等复杂真实场景的适用性仍然存疑,距离真正的通用模型尚有距离。 ...

2026-07-07 · 更新于 2026-07-24 · 2 min · 345 words

Taste-aware music retrieval from audio embeddings

📄 Taste-aware music retrieval from audio embeddings #音乐检索 #预训练 #多任务学习 #可解释性 6.9/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 1.3/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | #音乐检索 | #预训练 | #多任务学习 #可解释性 | arxiv 👥 作者与机构 第一作者:Matteo Spanio(帕多瓦大学,CSC实验室) 通讯作者:未说明 作者列表:Matteo Spanio(帕多瓦大学,CSC实验室)、Antonio Rodà(帕多瓦大学,CSC实验室) 💡 毒舌点评 本文把一个已有心理学根基的“声‑味对应”任务做实成了可复现、可检索的MIR基准,单编码器就能把误差压到单人评估者的一半,这个结论很漂亮。但40项的测试集让几乎所有的融合收益都落在统计噪声里,检索实验的CLAP-text完全失效更像是prompt问题而非方法本质优势,对“辣味”这一缺乏心理学支撑的轴也没有充分辩护。 📌 核心摘要 论文将“从音频预测味觉”形式化为一个内容化音乐信息检索(MIR)基准,使用经过感知验证的多源语料库,预测甜、苦、咸、酸、辣五种味觉强度。 方法核心是冻结预训练音频编码器提取嵌入,经时间池化后送入一个共享的、带sigmoid输出的多层感知机进行多任务回归,损失为掩码MSE,并引入门控晚期融合来组合多编码器。 相比先前需微调五个独立AST回归器的工作,本文用一个多任务头取代五个独立头,并配合掩码损失和sigmoid输出,在极简的冻结编码器设置下大幅降低绝对误差,并额外增加了检索评估和心理学驱动的可解释性分析。 最佳系统(单VGGish或融合组合)在测试集上达到宏观RMSE 0.134,在真实音乐子集上误差(RMSE 0.13)不到单个人类评估者与共识偏差(RMSE 0.28)的一半;门控晚期融合将宏观Pearson \(r\) 从0.666提升到0.724;在309项检索池中,基于味觉向量检索的精度完全饱和,而CLAP-text基线几乎随机。 方法 宏观RMSE↓ 宏观MAE↓ 宏观Pearson \(r\) ↑ VGGish (单编码器) 0.134 0.109 0.666 VGGish+MULE (融合) 0.134 0.111 0.724 SOTA (AST 5头) 0.219 0.175 0.556 配置 RMSE↓ MAE↓ 宏观\(r\) ↑ SOTA (微调AST, 无界MSE) 0.219 0.175 0.556 +冻结AST, 每味MLP, 掩码MSE, sigmoid 0.143 0.115 0.663 +共享多任务头 0.143 0.116 0.658 +门控晚期融合 (VGGish+MULE) 0.134 0.111 0.724 实际意义在于为音乐推荐系统提供了一个可解释的“味觉”语义轴,可支持“相似但更甜”这类检索,且模型误差已低于普通标注者,有替代或辅助人工评分的潜力。 主要局限是样本量极小(训练269项,测试40项),导致统计效力不足,尤其是融合效果的显著性难以保证;辣味轴缺乏类似甜/苦那样的跨模态对应实证;跨文化泛化未验证。 🔗 开源详情 代码:https://github.com/CSCPadova/wav2taste 模型权重:训练好的 taste 预测头(task-specific heads)随代码仓库提供(位于 https://github.com/CSCPadova/wav2taste);使用的预训练音频编码器权重来自各开源项目(见下文“论文中引用的开源项目”)。 数据集:https://huggingface.co/datasets/csc-unipd/sonic-seasoning (sonic-seasoning 统一音乐‑味觉语料库) Demo:论文中未提及 复现材料:代码仓库提供训练与评估脚本;论文中给出训练超参数(AdamW,lr \(=10^{-3}\),weight decay \(=10^{-4}\),batch size \(=32\),max \(50\) epochs,patience \(10\) on validation macro \(r\),multi-task MLP head hidden \(256\),dropout \(0.2\),sigmoid output,\(5\) seeds \(\{11,22,33,44,55\}\)),冻结编码器缓存策略,分析探针配置(ridge \(\alpha=1.0\),\(5\)-fold CV)等。 论文中引用的开源项目: HEAR benchmark:https://hearbenchmark.com VGGish:https://github.com/tensorflow/models/tree/master/research/audioset/vggish PANNs:https://github.com/qiuqiangkong/audioset_tagging_cnn AST (Audio Spectrogram Transformer):https://github.com/YuanGongND/ast HuBERT:https://github.com/pytorch/fairseq MERT:https://huggingface.co/m-a-p/MERT-v1-330M CLAP:https://github.com/LAION-AI/CLAP EnCodec:https://github.com/facebookresearch/encodec MULE:https://github.com/mule-project/mule (推测地址,论文引用[22]) librosa:https://github.com/librosa/librosa MusicGen (Audiocraft):https://github.com/facebookresearch/audiocraft FMA (Free Music Archive):https://github.com/mdeff/fma Omar-RQ:结合论文上下文应为基于 EnCodec 的离散自监督模型,常与 EnCodec 关联,未找到独立官方仓库(可能指 Omar 等人提出的残差量化变体,与 EnCodec 同源) 🏗️ 方法概述和架构 本文构建了一个“从音频嵌入预测味觉”的冻结编码器‑多任务回归框架,并在此基础上附加门控晚期融合、可解释性探测和检索评估。 ...

2026-07-07 · 更新于 2026-07-24 · 4 min · 770 words

语音/音乐/音频论文速递 2026-07-07

语音/音乐/音频论文速递 2026-07-07 共分析 58 篇论文 ⚡ 今日概览 📥 抓取 58 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 11篇 ███████████ #语音伪造检测 5篇 █████ #音频理解 4篇 ████ #语音交互 3篇 ███ #音频事件检测 3篇 ███ #语音转换 3篇 ███ #音视频理解 3篇 ███ #语音合成 3篇 ███ 📊 论文评分排行榜(58 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1分 前10% #音频检索 🥈 SPEARBench: A Benchmark for Naturalness Evaluation in S 8.9分 前25% #语音交互 🥉 Metronome: Bound the Cache, Keep the Beat for Real-Time 8.7分 前25% #语音交互 4. Auto-AEG: Scalable Data Construction for Open-Vocabular 8.3分 前25% #音频事件检测 5. RABBiT: Rapidly adaptive BOLD foundation model via brai 8.1分 前25% #音频理解 6. TRACE-EVC: Text-Guided Relative Affective Control for Z 8.0分 前25% #语音转换 7. Parallelized Autoregressive Decoding for Omni-Modal Den 8.0分 前25% #音视频理解 8. Speaker-Disentangled Chunk-Wise Regression for Syllabic 7.9分 前25% #语音编码 9. Speaker-Aware Temporal Aggregation Strategies on Segmen 7.9分 前25% #语音属性识别 10. REDDIT: Correcting Model-Generated Timestamp Drift in A 7.8分 前25% #语音识别 11. Deriving Benchmarking Datasets from Long-Form Recording 7.7分 前25% #基准测试 12. ProPS: Prompted Profile Synthesis for Natural Language- 7.6分 前25% #语音合成 13. DELTA-TTS: Adapting Autoregressive Model into Diffusion 7.5分 前25% #语音合成 14. TokAN: Accent Normalization Using Self-Supervised Speec 7.5分 前25% #语音转换 15. Listen, Think, Transcribe: Continuous Latent Test-Time 7.5分 前25% #语音识别 16. \(C^3\)ASD: Multi-Level Consistency-Driven Representation 7.5分 前25% #音视频理解 17. Training-Free Model Selection and Domain-Aware Score Ca 7.3分 前50% #音频事件检测 18. CHILDES-Aligned: A Curated Children's Speech Datase 7.2分 前50% #语音识别 19. Taste-aware music retrieval from audio embeddings 6.9分 前50% #音乐检索 20. Lights, Camera, Carbon: Architectural Scaling Laws for 6.9分 前50% #音视频生成 21. Unified Audio Intelligence Without Regressing on Text I 6.8分 前50% #音频交互 22. Ranking the Impact of Contextual Specialization in Neur 6.7分 前50% #语音增强 23. SynSFX: Multi-Model Sound Effects Synthesis Dataset for 6.5分 前50% #音频伪造检测 24. Evaluating the Effect of Linguistic Relatedness on Cros 6.5分 前50% #语音识别 25. MOSAIC: Interpretable Multi-Token Cross-Attention of Bi 6.3分 前50% #语音伪造检测 26. CARD: Cross-component Audio Representation Distillation 6.3分 前50% #音频字幕生成 27. Probing Low-Level Acoustic Attribute Encoding in CLAP A 6.2分 前50% #音频理解 28. Trajectory Variance: AnUnsupervised Measure of Developm 6.2分 前50% #音频理解 29. Adaptive Diversity-Uncertainty Active Learning with Red 6.2分 前50% #音频事件检测 30. Adaptive Loss Balancing for Multi-Task Bioacoustic Clas 6.1分 前50% #音频分类 31. An Intervention-Based Framework for Shortcut Diagnosis 6.1分 前50% #语音伪造检测 32. QuaSR: Quality-Aware Sample Reweighting for Pacific Ind 6.0分 前50% #语音识别 33. CaReCoS: A Spectrogram based Visual Benchmark for Cardi 6.0分 前50% #音频理解 34. Open-Set Source Tracing as Compositional Factors via St 6.0分 前50% #语音伪造检测 35. Context-Aware ASR for Mandarin Technical Lectures 6.0分 前50% #语音识别 36. Streaming Neural Speech Codecs through Time-Invariant R 6.0分 前50% #语音编码 37. Physiological Noise Augmentation Improves Non-Invasive 6.0分 前50% #语音识别 38. DuplexChat: Constructing Speaker-Separated Full-Duplex 5.9分 前50% #语音交互 39. Noisy Environment Adaptation of Neural Speech Codec via 5.9分 前50% #语音增强 40. NouveauVoice: Generating Novel Pseudo Speakers for Voic 5.9分 前50% #语音转换 41. OmniFocus: Query-Guided Modality-Balanced Token Compres 5.9分 前50% #音视频问答 42. Jointly Improving Dialect Identification and ASR in Ind 5.8分 前50% #语音识别 43. S-DiverSe: Spanish Diverse Speech 5.8分 前50% #语音识别 44. Towards Robust Uncertainty-Aware Speaker Modeling 5.7分 前50% #说话人验证 45. Towards Language-Agnostic Speech Inversion 5.6分 前50% #语音属性识别 46. Layer-wise Cross-Lingual Depression Detection from Spee 5.5分 前50% #语音情感识别 47. Wan-Streamer v0.2: Higher Resolution, Same Latency 5.4分 后50% #音视频交互 48. Mixture-Constrained Max Pooling Improves Separation-Bas 5.3分 后50% #音频分类 49. Reinforcement Learning for Data-Efficient Code-Switched 5.3分 后50% #语音识别 50. Physics-Informed Direction-of-Arrival Estimation Over D 5.3分 后50% #声源定位 51. Sampling Bias Compensation for Robust Evaluation of Aud 4.9分 后50% #音频分类 52. UniSkip-Mamba: A Frequency-Aware State Space Model for 4.8分 后50% #音视频理解 53. Progressive Refinement: An Iterative Pseudo-Labeling Ap 4.6分 后50% #语音识别 54. Weakly Guided and Autoregressive Beamformer Parameteriz 4.3分 后50% #语音分离 55. DETECT-3B-Omni is Agnostic of Content and Demographics 4.2分 后50% #语音伪造检测 56. Towards Digital Preservation of Efik: TTS for a Low-Res 4.0分 后50% #语音合成 57. Quantum-Inspired Harmonic Decision Models: A Computatio 2.3分 后50% #音乐生成 58. Information-Geometric Superposed Vowel Evaluation: Part 1.9分 后50% #语音伪造检测 📋 论文列表 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ...

2026-07-07 · 更新于 2026-07-24 · 47 min · 9986 words

ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools — From Consensus Learning to Ambiguity-Driven Emotion Reasoning

📄 ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools — From Consensus Learning to Ambiguity-Driven Emotion Reasoning #语音情感识别 #强化学习 #多模态模型 #可解释性 6.5/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 ✅ 6.5/10 | 前50% | #语音情感识别 | #强化学习 | #多模态模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Esther Sun(Language Technologies Institute, Carnegie Mellon University) 通讯作者:Esther Sun(Language Technologies Institute, Carnegie Mellon University) 作者列表:Esther Sun, Bo-Hao Su, Abinay Reddy Naini, Shinji Watanabe(均来自Language Technologies Institute, Carnegie Mellon University), Carlos Busso(Multimodal Signal Processing Laboratory, University of Texas at Dallas) 💡 毒舌点评 这项工作将“打标签”式的经典SER重构为智能体探案式的证据收集与裁决过程,框架设计颇具巧思,尤其在利用GRPO与证据信任门对齐推理质量与工具使用上展现了良好的技术深度。然而,文章在惊艳的框架叙事背后,对核心工具的底层实现算法、GRPO训练的稳定性与超参数敏感度、以及推理延迟与计算开销等现实落地问题几乎只字不提,这让整个系统更接近一个精巧的概念验证(Proof-of-Concept),距离一个可被严格复现和实际部署的机器学习系统还有相当的距离。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 602 words

AG-REPA: Causal Layer Selection for Representation Alignment in Audio Flow Matching

📄 AG-REPA: Causal Layer Selection for Representation Alignment in Audio Flow Matching #语音合成 #音频生成 #可解释性 7.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | #语音合成 | #知识蒸馏 | #音频生成 #可解释性 | arxiv 👥 作者与机构 第一作者:Pengfei Zhang(香港科技大学(广州)信息枢纽人工智能学域) 通讯作者:Li Liu(香港科技大学(广州)信息枢纽人工智能学域) 作者列表:Pengfei Zhang、Tianxin Xie、Minghao Yang、Li Liu(均来自香港科技大学(广州)信息枢纽人工智能学域) 💡 毒舌点评 这篇论文最大的亮点是发现并实证了“存储-贡献分离”(SCD)现象,然后巧妙地用一个因果归因工具(FoG-A)来指导层选择,把REPA从“凭经验瞎猜”升级成了“看谁真干活”。动机清晰,intuition很有说服力。但话说回来,实验规模偏小(总步数仅500k,两个数据集),跨架构验证虽然做了但深度不够——只给了几个FAD/WER/MOS数字,缺少更系统的分析(如动态、消融等),无法确定增益是否只是某种隐式正则化的结果。虽然FoG-A排名看起来稳定,但在更长/更大规模训练下的行为完全是未知数。此外,从Jacobian链式传播直接跳到一个强烈的“蝴蝶效应”论断有些牵强,没有严谨讨论梯度衰减或中间层Jacobian性质对结论的影响。方法整体仍停留在原型验证阶段。 📌 核心摘要 问题定义:在token-conditioned音频流匹配(Flow Matching)模型中,现有的表示对齐(REPA)策略通常凭经验固定中间层(如第8层)进行监督,忽略了“存储语义最丰富的层”与“对生成速度场v_θ贡献最大的层”可能不一致,导致训练效率低下。 方法核心:提出归因引导的REPA(AG-REPA)。首先,利用前向门控消融(FoG-A)作为因果探针,量化DiT每一层对最终预测速度场的因果贡献;然后,自动选出贡献最大的Top-K层,并按贡献大小进行加权对齐,从而将对齐目标从“语义储层”转向“因果驱动层”。 与已有工作的不同:不同于固定层REPA或基于梯度范数的选择,AG-REPA首次将因果干预度量引入音频流匹配的表示对齐,明确区分“表示存储”与“函数贡献”,并据此设计了一种全新的层选择与损失加权策略。 主要实验结果(Config B, 500k步):在LibriSpeech和AudioSet的统一音频生成任务上,AG-REPA相比于固定中层REPA(Layer 4, 8, 12),语音FAD从1.45降至1.29,音效FAD从2.88降至2.56,语音MOS从3.92升至4.12。跨架构(Voicebox, CosyVoice, F5-TTS)实验也取得一致改进,例如在F5-TTS上FAD从1.45降至1.15。关键消融显示,对齐FoG-A选出的“因果驱动层”相比对齐LASP选出的“表示丰富层”,FAD改善幅度提升约3.4倍,且收敛加速约3.3倍。 实际意义与普适性:为扩散/流匹配模型的训练加速提供了一种轻量、可移植的归因引导范式。其诊断工具集(BiT-C, LASP, FoG-A)不仅服务于AG-REPA,也为理解其他生成架构的内部行为提供了可操作的工具。 主要局限性:实验在有限训练规模(500k步)下进行;FoG-A排名虽短程稳定,但在更长训练或模型显著漂移后是否依然有效未知;方法依赖双教师蒸馏,增加了部署依赖;未在更泛化的音频/视觉任务上进行验证。 🔗 开源详情 代码:https://github.com/zpforlove/AG-REPA 模型权重:未提供。 数据集:LibriSpeech 与 AudioSet,论文未直接提供下载链接,但LibriSpeech可通过https://www.openslr.org/12 获取,AudioSet通过https://research.google.com/audioset/ 获取。 Demo:未提供。 复现材料:论文附录提供了部分架构和诊断协议细节,但未提供完整的训练配置文件、预训练检查点或独立复现脚本。 论文中引用的相关开源项目: Whisper (large‑v3): https://github.com/openai/whisper BEATs: https://github.com/microsoft/unilm/tree/master/beats RepCodec: 引用自 Huang et al. (2024) Vocos: https://github.com/gemelo‑ai/vocos Qwen3‑0.6B‑Base: https://huggingface.co/Qwen/Qwen3‑0.6B CosyVoice: https://github.com/FunAudioLLM/CosyVoice F5‑TTS: https://github.com/swivid/F5‑TTS Matcha‑TTS: https://github.com/shivammehta25/Matcha‑TTS DINOv2: https://github.com/facebookresearch/dinov2 🏗️ 方法概述和架构 整个工作围绕一个两阶段的统一音频生成流水线展开:第一阶段是自回归大语言模型(LLM)预测离散声学token;第二阶段是基于DiT的流匹配模型将这些token生成为连续mel谱,再经由神经声码器合成波形。本文的核心贡献并不在该流水线设计,而在于第二阶段DiT训练过程中的表示对齐策略。作者引入了一套“先诊断、后干预”的机制,包含三个互补的探测工具和一个归因引导的训练算法。 ...

2026-07-04 · 更新于 2026-07-24 · 3 min · 447 words