Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models

📄 Escaping the Procrustean Bed: Groupwise Orthogonal Connectors for Audio-Language Models #语音属性识别 #多模态模型 #鲁棒性 #可解释性 7.8/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.8/10 | 前25% | #语音属性识别 | #多模态模型 | #鲁棒性 #可解释性 | arxiv 👥 作者与机构 第一作者:Ho-Lam Chung (National Taiwan University, 未明确标注) 通讯作者:未说明 作者列表:Ho-Lam Chung (National Taiwan University), Ke-Han Lu (National Taiwan University), Yi-Cheng Lin (National Taiwan University), Guan-Ting Lin (National Taiwan University), Yiming Chen (未说明), Hung-yi Lee (National Taiwan University) 💡 毒舌点评 这篇论文用一个漂亮的“Procrustean Bed”比喻,精准诊断了Q-Former连接器的输出坍缩问题——这大概是近年来音频-语言模型领域最形象、最一针见血的问题命名。分组正交约束的设计简洁到几乎“零成本”,却在4B模型上把多跳副语言推理拉到75.2%,反超了一众8B模型,这种“以小博大”的结果确实令人印象深刻。然而,全文完全缺失对G=8这一关键参数、正交权重λ、以及组内正则必要性的消融实验,使得“到底是哪部分设计真正起作用”这一问题悬而未决。代码和模型均未开源,在当前顶会投稿标准下,这几乎是在挑战审稿人的耐心底线——一个声称“零成本”修复的方法,却让社区为零验证它付出巨大成本。 ...

2026-07-08 · 更新于 2026-08-14 · 2 min · 255 words

语音/音乐/音频论文速递 2026-07-08

语音/音乐/音频论文速递 2026-07-08 共分析 26 篇论文 ⚡ 今日概览 📥 抓取 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音属性识别 3篇 ███ #音频分类 3篇 ███ #语音合成 3篇 ███ #语音识别 3篇 ███ #声源定位 2篇 ██ #音乐生成 2篇 ██ #语音交互 1篇 █ #音频事件检测 1篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 Hierarchical Acoustic-Semantic Modeling: Modality Separ 9.2分 前10% #语音交互 🥈 Propose and Attend: Training-free MLLM Grounding Confid 8.2分 前25% #音频事件检测 🥉 Music I Care About: Automated Multimodal Benchmarking o 7.8分 前25% #音乐理解 4. Escaping the Procrustean Bed: Groupwise Orthogonal Conn 7.8分 前25% #语音属性识别 5. TriA Pipeline: A Large-Scale Automatic Audio Annotation 7.4分 前50% #音频分类 6. InsideSSL: Understanding Self-Supervised Speech Represe 7.4分 前50% #语音属性识别 7. Precise Video-to-Audio Generation with Cross-Modal Alig 7.4分 前50% #音视频生成 8. WordVoice: Explicit and Decoupled Multi-Dimensional Wor 7.2分 前50% #语音合成 9. ForestIR: Physics-Informed Forest Sound Simulation for 7.2分 前50% #声源定位 10. Uncovering Latent Depression Severity for Binary Depres 7.0分 前50% #音视频理解 11. Determinantal point process sampling for bioacoustic ac 6.9分 前50% #音频分类 12. From Sinhala to Dhivehi: Cross-Lingual Transfer Learnin 6.6分 前50% #语音识别 13. Goodbye Equal Error Rate, Hello Local Information Discl 6.5分 前50% #语音转换 14. BlueMagpie-TTS: A Token-Efficient Tokenizer, Language M 6.5分 前50% #语音合成 15. Fréchet Distance Loss on Speech Representations for Tex 6.5分 前50% #语音合成 16. NAVER LABS System Re-implementation for the IWSLT 2026 6.4分 前50% #语音翻译 17. Few-Shot Class-Incremental Audio Classification Using P 6.3分 前50% #音频分类 18. Gemma 4 Technical Report 6.2分 前50% #语音识别 19. Revisiting the Relation Between Language Model Perplexi 6.0分 前50% #语音识别 20. Multimodal Video-to-Music Recommendation via Semantic R 5.4分 后50% #音乐检索 21. Designing Maintainable Hybrid Generative Systems: A Qua 5.3分 后50% #音乐生成 22. Learning-based Physics-Constrained Neural Kernel for So 5.2分 后50% #声源定位 23. Distributed Multichannel Wiener Filtering for Topology- 5.1分 后50% #语音增强 24. Flow Matching-Based Speech Source Separation with Best- 4.9分 后50% #语音分离 25. Umm… With Transformers? Insights from Filled Pause Us 4.8分 后50% #语音属性识别 26. From Textural Counterpoint to Feature Encoding: A Multi 2.1分 后50% #音乐生成 📋 论文列表 🥇 Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs 9.2/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-08 · 更新于 2026-08-14 · 20 min · 4152 words

An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures

📄 An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures #语音伪造检测 #可解释性 #鲁棒性 6.1/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.1/10 | 前50% | #语音伪造检测 | #自监督学习 | #可解释性 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Santiago Rubio(University of Zaragoza, ViVoLab, Aragón Institute for Engineering Research (I3A), Spain) 通讯作者:未明确标注,但根据邮件地址推断为 Santiago Rubio (s.rubio@unizar.es) 作者列表: Santiago Rubio(University of Zaragoza, ViVoLab, I3A) Pilar Bello(University of Zaragoza, ViVoLab, I3A) Dayana Ribas(Business Telecommunications Services (BTS), Spain) Antonio Miguel(University of Zaragoza, ViVoLab, I3A) Eduardo Lleida(University of Zaragoza, ViVoLab, I3A) Alfonso Ortega(University of Zaragoza, ViVoLab, I3A) 💡 毒舌点评 本文用因果图把"捷径学习"包装得漂亮,干预设计也有巧思——只扰动非语音区就能把模型性能打掉60多个百分点,堪称一记响亮的耳光。但可惜整个诊断只在一套SSL前端上唱独角戏,且代码、置信区间、显著性检验全都欠奉,让这个框架目前更像是精致的学术花瓶,距离落地还有很大距离。更关键的是,自定义DA中针对非语音的修剪本质上形成了循环论证——用已知捷径的解药来证明捷径的危害,发现的惊奇度大打折扣。 ...

2026-07-07 · 更新于 2026-08-14 · 4 min · 655 words

Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

📄 Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese) #语音伪造检测 #语音合成 #可解释性 1.9/10 | 创新 0.8/2 | 严谨 0.3/1.5 | 实验 0.1/1.5 | 清晰 0.3/1 | 影响 0.1/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0.3/1.5 📝 1.9/10 | 后50% | #语音伪造检测 | #图神经网络 | #语音合成 #可解释性 | arxiv 👥 作者与机构 第一作者:Yusei Tamura(东京大学 大学院 学际信息学府) 第二作者:Shigekazu Ishihara(广岛国际大学 心理学部 健康福祉学部) 第三作者:Ken Ito(东京大学 信息学环/学际信息学府) 通讯作者:未明确说明(按惯例疑为第三作者 Ken Ito) 💡 毒舌点评 本文将上世纪最优输运(Wasserstein距离)和拓扑数据分析(持久同调)的概念堆砌起来,试图为AI合成语音检测提供新思路。想法是"用频谱分布的贫瘠性来暴露生成模型的马脚",这一点尚可。但论文水平停留在非常初步的探索性原型阶段:实验仅含单个说话人、单个未公开合成模型的几张热力图和散点图,所有可引用的量化数字全部以"“遮挡。全文没有准确率、等错误率、AUC,没有与任何基线对比,没有跨说话人、跨合成器的泛化性测试。声称使用了"持久同调"进行拓扑映射,但方法部分对其构造(如Vietoris-Rips复形、持久图计算)只字未提,实际呈现的仅为特征分解降维。标题与内容严重脱节,这不是在测试方法,而是在展示一张充满占位符的海报。 📌 核心摘要 本文旨在解决生成式AI合成的日语语音(deepfake)难以被人类听觉和常规方法可靠检测的问题。 核心思想是将语音的傅里叶幅度谱归一化,视为一种概率密度函数(作者称为"随机光谱学”),用一维Wasserstein距离度量不同元音频谱间的差异性。作者认为该距离对基频平移(如说话人音高变化)鲁棒,更能反映音色内在差异。 在此基础上,构建元音或整句音频之间的成对Wasserstein距离矩阵,并声称通过"持久同调"方法在保持距离结构的情况下将频谱映射到低维拓扑空间中,观察自然语音与合成语音是否呈分离的簇。 实验仅基于一位日本知名律师的语音样本,对比其自然语音与一个在该样本上训练的语音合成系统所生成的语音。展示结果包括元音摩拉的距离矩阵热力图、二维散点图,以及五句受控元音频率人造句子的距离矩阵与散点图。 所有实验仅以示例图形呈现,无任何数字量化指标。距离矩阵均值文本中以"“占位,合成与自然语音"可清晰区分"的论断完全依赖肉眼观察,既无分类阈值,也无统计检验,更无基线对比。 论文承认其方法目前专用于日语(摩拉音节、元音-假名一一对应的语言),并提出了向英语等语言扩展的设想(利用ARPAbet进行音素标注、控制元音频率造句),但未做任何实验验证。 主要局限性包括:完全缺失的量化实验评估、持久同调方法有名无实、单一数据源导致结论普适性高度存疑、对噪声/码率/说话人变化等实际因素零评估、方法不可复现且无任何开源材料。 🔗 开源详情 代码:未提供链接 模型权重:未提供 数据集:未提供 Demo:未提供 复现材料:未提供 引用的开源项目:参考文献[10] (Bonafos et al., 2023) 和 [11] (Liu et al., 2017) 均为arXiv版本,但论文本身未交付任何代码或数据。 🏗️ 方法概述和架构 论文提出了一种用于区分日语自然语音与合成语音的分析流程,总体分为以下几个步骤: ...

2026-07-07 · 更新于 2026-08-14 · 2 min · 256 words

MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing

📄 MOSAIC: Interpretable Multi-Token Cross-Attention of Biophonetic and Self-Supervised Representations for Unified Voice Anti-Spoofing #语音伪造检测 #可解释性 #自监督学习 #领域适应 6.3/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 6.3/10 | 前50% | #语音伪造检测 | #Transformer | #可解释性 #自监督学习 | arxiv 👥 作者与机构 第一作者:Yugwon Won(RaonSecure Co., Ltd., AI Security R&D Team, Seoul, Republic of Korea) 通讯作者:Yugwon Won(同第一作者) 作者列表:Yugwon Won(AI Security R&D Team, RaonSecure Co., Ltd.) 💡 毒舌点评 论文将手工特征拆分为多语义查询令牌进行交叉注意力融合,并利用注意力矩阵和令牌激活进行可解释性分析,思路是有趣的。但这项工作的核心贡献更多体现在特征工程与可视化技巧上,而非提出基础性的新架构或理论。方法在2019年数据集上接近单任务SOTA,但在真正考验泛化能力的2021年跨域评测上表现惨淡,尤其是PA场景(EER 40.09%),使得“统一”模型的卖点大打折扣。对最核心的“6-token”与“单token”之间的性能差异,论文避而不谈,可解释性分析也仅限于定性观察,缺乏严格的因果或消融验证,这使得整体贡献的坚实程度存疑。 ...

2026-07-07 · 更新于 2026-08-14 · 2 min · 415 words

Open-Set Source Tracing as Compositional Factors via Structured Prototypes

📄 Open-Set Source Tracing as Compositional Factors via Structured Prototypes #语音伪造检测 #可解释性 6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5 ✅ 6/10 | 前50% | #语音伪造检测 | #对比学习 | #可解释性 | arxiv 👥 作者与机构 第一作者:Santiago Rubio(University of Zaragoza, ViVoLab, Aragón Institute for Engineering Research (I3A), Spain) 通讯作者:未明确指定,推断为 Santiago Rubio 作者列表:Santiago Rubio, Antonio Almudévar, Antonio Miguel, Eduardo Lleida, Alfonso Ortega(均隶属于 University of Zaragoza, ViVoLab, I3A) 💡 毒舌点评 这篇文章用 “Nature vs. Nurture” 的比喻把合成语音来源拆成架构、数据和残余因子,思路漂亮且很有解释力;结构化正交原型与子空间划分也确实在少样本开集归因上稳住了泛化差距。但实验仅围绕 MLAAD 一个数据集自娱自乐,缺少与更丰富的开集溯源方法(如基于 OOD 分数的方案)的正面交锋,也没有任何代码或权重放出,让人对方法的真实鲁棒性心里没底。44 个未见源的评估听起来唬人,但未见架构和未见数据集的严重不对称性让“泛化”的成色打了折扣。 ...

2026-07-07 · 更新于 2026-08-14 · 5 min · 933 words

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

📄 Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings #音频理解 #可解释性 6.2/10 | 创新 1/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.3/1.5 ✅ 6.2/10 | 前50% | #音频理解 | #对比学习 | #可解释性 | arxiv 👥 作者与机构 第一作者:Héctor Martel(未说明) 通讯作者:未说明 作者列表:Héctor Martel(未说明)、Joe Hennessy-Priest(未说明)、Taemin Cho(未说明) 💡 毒舌点评 这篇论文用扎实且系统的方法给CLAP音频嵌入做了一次深度"体检",干净利落地揭示了RT60/LUFS/SC/RP等低级声学属性的编码规律,特别是"近似线性编码"和"强迫非线性编码"两种模式的划分,以及跨模型泛化验证,确实有料。但说到底,这是用标准探测工具对一个已知模型做属性摸底,方法论上没有新东西;对比的8个额外模型全用别人现成的;而且论文对于代码、模型权重和数据集的可复现性要求闭口不谈——这在强调开源的顶会里,基本等同于在审稿人面前主动亮出软肋。 📌 核心摘要 本文旨在系统性研究音频-语言基础模型CLAP的嵌入空间中,如何编码混响时间(RT60)、响度(LUFS)、频谱质心(SC)和相对音高(RP)这四种低级声学属性。 方法核心是使用线性、MLP和基于RBF核的岭回归(Kernel Ridge Regression)三种复杂度递增的探测模型,在完全冻结的LAION-CLAP音频编码器嵌入上训练回归任务,以判断每个属性的编码是线性还是非线性,并通过分析独立训练得到的线性探头权重向量的余弦相似度,考察学习到的特征方向在不同数据集下的一致性。 与以往工作相比,本文是首次对CLAP进行如此系统和全面的低级声学属性探测研究,覆盖多个数据域(噪声、语音、单声道音符、音乐混音),并首次揭示了频谱质心的强非线性编码(线性探头在5个数据集中的4个上完全失败)与其他属性(RT60、LUFS、RP)的近似线性编码这两种不同的编码机制。 主要实验结果如原文表1所示,所有属性均可被非线性探头可靠恢复。RT60、LUFS和RP近乎线性编码,而SC需要非线性探头。线性探头对RT60和LUFS表现出跨数据集一致性,而RP则高度依赖数据集。这些发现能推广到另外8个音频基础模型(如MS-CLAP、MERT、Wav2Vec2、Whisper、WavLM、VGGish),但振幅不变架构(如Wav2Vec2、WavLM-Large、MERT)会完全丢失响度信息。 特征 数据集 线性探头 R² (范围) 非线性探头 R² (范围) 关键发现 RT60 全部5个 0.67 (NSynth) - 0.95 (White Noise) 0.75 (MusDB18HQ) - 0.99 (White Noise) 近乎线性编码;跨域特征轴一致 LUFS 全部5个 0.76 (MusDB18HQ) - 0.99 (White Noise) 0.88 (NSynth) - 1.00 (White Noise) 近乎线性编码;跨域特征轴高度一致 SC 全部5个 R² < -1 (失败) 至 0.43 (NSynth) 0.40 (MusDB18HQ) - 1.00 (White Noise) 强非线性编码;线性恢复仅在NSynth上部分成功 RP 全部5个 0.36 (MusDB18HQ) - 0.97 (White Noise) 0.64 (MusDB18HQ) - 1.00 (White Noise) 介于线性和非线性之间;特征轴高度领域相关 实际意义在于,证明了一个冻结的CLAP模型可同时用于估计混响、响度和频谱内容,为自动混音分析、效果链估计和文本驱动效果控制等应用奠定了理论基础。 主要局限性(论文明确承认)包括:仅分析最终层嵌入而忽略中间层、RT60增强使用简化的鞋盒房间几何模型、MusDB18HQ等音乐混音中可能存在残余混响、未能建立响度和音高的跨模态一致文本预测、文本描述实验仅为定性演示。 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及(论文使用并评估了多个开源预训练模型,如 LAION-CLAP、MS-CLAP、MERT、Whisper 等,但未提供任何自训权重或权重下载的整合链接) 数据集:论文中未提及数据集的统一获取链接(使用了 White Noise 合成数据、NSynth、VCTK-Corpus、MusDB18HQ、SonicMaster,均为公开或可申请获取的第三方数据集,但未提供一站式下载地址) Demo:论文中未提及 复现材料:论文中未提供独立的复现包或配置文件,但在第 3.3 节给出了全部训练超参数(如学习率 $ 1 \times 10^{-3} $ , batch size 256 等)和探针结构细节 论文中引用的开源项目: LAION-CLAP: https://github.com/LAION-AI/CLAP pyloudnorm: https://github.com/csteinmetz1/pyloudnorm gpuRIR: https://github.com/DavidDiazGuerra/gpuRIR torch_audiomentations: https://github.com/iver56/torch-audiomentations torchaudio: https://github.com/pytorch/audio fadtk: https://github.com/microsoft/fadtk 🏗️ 方法概述和架构 本论文的核心方法是一个参数化探测框架,旨在通过训练浅层模型预测冻结嵌入中的特定声学属性,从而解析该属性的编码几何特性(线性或非线性)。该框架设计严谨,通过为每个属性独立生成增强数据来消除属性间的伪相关,确保探测到的编码结构完全来自嵌入空间本身。 ...

2026-07-07 · 更新于 2026-08-14 · 3 min · 515 words

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

📄 RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain #零样本 #少样本 #可解释性 #自监督学习 8.1/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.1/10 | 前25% | #音频理解 | #参数高效微调 | #零样本 #少样本 | arxiv 👥 作者与机构 第一作者:Omer Moussa(Max Planck Institute for Software Systems, Saarbrücken, Germany) 通讯作者:Mariya Toneva(Max Planck Institute for Software Systems, Saarbrücken, Germany) 作者列表:Omer Moussa(Max Planck Institute for Software Systems)、Mariya Toneva(Max Planck Institute for Software Systems) 💡 毒舌点评 本文巧妙地将群体共享响应的零样本预测与高效的个体少样本适配统一在一个紧凑的模型中,其学到的ROI查询嵌入能无监督地恢复出听觉到语言的皮层层级,设计精妙。然而,亮点背后是隐忧:训练仅依赖6名受试者的单一视听数据集,混合数据集训练未带来增益反而有所下降,这对其作为“基础模型”的泛化能力投下阴影。实验局限于英语自然聆听场景,其对多语言、对话等复杂真实场景的适用性仍然存疑,距离真正的通用模型尚有距离。 ...

2026-07-07 · 更新于 2026-08-14 · 2 min · 345 words

Taste-aware music retrieval from audio embeddings

📄 Taste-aware music retrieval from audio embeddings #音乐检索 #预训练 #多任务学习 #可解释性 6.9/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 1.3/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | #音乐检索 | #预训练 | #多任务学习 #可解释性 | arxiv 👥 作者与机构 第一作者:Matteo Spanio(帕多瓦大学,CSC实验室) 通讯作者:未说明 作者列表:Matteo Spanio(帕多瓦大学,CSC实验室)、Antonio Rodà(帕多瓦大学,CSC实验室) 💡 毒舌点评 本文把一个已有心理学根基的“声‑味对应”任务做实成了可复现、可检索的MIR基准,单编码器就能把误差压到单人评估者的一半,这个结论很漂亮。但40项的测试集让几乎所有的融合收益都落在统计噪声里,检索实验的CLAP-text完全失效更像是prompt问题而非方法本质优势,对“辣味”这一缺乏心理学支撑的轴也没有充分辩护。 📌 核心摘要 论文将“从音频预测味觉”形式化为一个内容化音乐信息检索(MIR)基准,使用经过感知验证的多源语料库,预测甜、苦、咸、酸、辣五种味觉强度。 方法核心是冻结预训练音频编码器提取嵌入,经时间池化后送入一个共享的、带sigmoid输出的多层感知机进行多任务回归,损失为掩码MSE,并引入门控晚期融合来组合多编码器。 相比先前需微调五个独立AST回归器的工作,本文用一个多任务头取代五个独立头,并配合掩码损失和sigmoid输出,在极简的冻结编码器设置下大幅降低绝对误差,并额外增加了检索评估和心理学驱动的可解释性分析。 最佳系统(单VGGish或融合组合)在测试集上达到宏观RMSE 0.134,在真实音乐子集上误差(RMSE 0.13)不到单个人类评估者与共识偏差(RMSE 0.28)的一半;门控晚期融合将宏观Pearson \(r\) 从0.666提升到0.724;在309项检索池中,基于味觉向量检索的精度完全饱和,而CLAP-text基线几乎随机。 方法 宏观RMSE↓ 宏观MAE↓ 宏观Pearson \(r\) ↑ VGGish (单编码器) 0.134 0.109 0.666 VGGish+MULE (融合) 0.134 0.111 0.724 SOTA (AST 5头) 0.219 0.175 0.556 配置 RMSE↓ MAE↓ 宏观\(r\) ↑ SOTA (微调AST, 无界MSE) 0.219 0.175 0.556 +冻结AST, 每味MLP, 掩码MSE, sigmoid 0.143 0.115 0.663 +共享多任务头 0.143 0.116 0.658 +门控晚期融合 (VGGish+MULE) 0.134 0.111 0.724 实际意义在于为音乐推荐系统提供了一个可解释的“味觉”语义轴,可支持“相似但更甜”这类检索,且模型误差已低于普通标注者,有替代或辅助人工评分的潜力。 主要局限是样本量极小(训练269项,测试40项),导致统计效力不足,尤其是融合效果的显著性难以保证;辣味轴缺乏类似甜/苦那样的跨模态对应实证;跨文化泛化未验证。 🔗 开源详情 代码:https://github.com/CSCPadova/wav2taste 模型权重:训练好的 taste 预测头(task-specific heads)随代码仓库提供(位于 https://github.com/CSCPadova/wav2taste);使用的预训练音频编码器权重来自各开源项目(见下文“论文中引用的开源项目”)。 数据集:https://huggingface.co/datasets/csc-unipd/sonic-seasoning (sonic-seasoning 统一音乐‑味觉语料库) Demo:论文中未提及 复现材料:代码仓库提供训练与评估脚本;论文中给出训练超参数(AdamW,lr \(=10^{-3}\),weight decay \(=10^{-4}\),batch size \(=32\),max \(50\) epochs,patience \(10\) on validation macro \(r\),multi-task MLP head hidden \(256\),dropout \(0.2\),sigmoid output,\(5\) seeds \(\{11,22,33,44,55\}\)),冻结编码器缓存策略,分析探针配置(ridge \(\alpha=1.0\),\(5\)-fold CV)等。 论文中引用的开源项目: HEAR benchmark:https://hearbenchmark.com VGGish:https://github.com/tensorflow/models/tree/master/research/audioset/vggish PANNs:https://github.com/qiuqiangkong/audioset_tagging_cnn AST (Audio Spectrogram Transformer):https://github.com/YuanGongND/ast HuBERT:https://github.com/pytorch/fairseq MERT:https://huggingface.co/m-a-p/MERT-v1-330M CLAP:https://github.com/LAION-AI/CLAP EnCodec:https://github.com/facebookresearch/encodec MULE:https://github.com/mule-project/mule (推测地址,论文引用[22]) librosa:https://github.com/librosa/librosa MusicGen (Audiocraft):https://github.com/facebookresearch/audiocraft FMA (Free Music Archive):https://github.com/mdeff/fma Omar-RQ:结合论文上下文应为基于 EnCodec 的离散自监督模型,常与 EnCodec 关联,未找到独立官方仓库(可能指 Omar 等人提出的残差量化变体,与 EnCodec 同源) 🏗️ 方法概述和架构 本文构建了一个“从音频嵌入预测味觉”的冻结编码器‑多任务回归框架,并在此基础上附加门控晚期融合、可解释性探测和检索评估。 ...

2026-07-07 · 更新于 2026-08-14 · 4 min · 770 words

语音/音乐/音频论文速递 2026-07-07

语音/音乐/音频论文速递 2026-07-07 共分析 58 篇论文 ⚡ 今日概览 📥 抓取 58 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 11篇 ███████████ #语音伪造检测 5篇 █████ #音频理解 4篇 ████ #语音交互 3篇 ███ #音频事件检测 3篇 ███ #语音转换 3篇 ███ #音视频理解 3篇 ███ #语音合成 3篇 ███ 📊 论文评分排行榜(58 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1分 前10% #音频检索 🥈 SPEARBench: A Benchmark for Naturalness Evaluation in S 8.9分 前25% #语音交互 🥉 Metronome: Bound the Cache, Keep the Beat for Real-Time 8.7分 前25% #语音交互 4. Auto-AEG: Scalable Data Construction for Open-Vocabular 8.3分 前25% #音频事件检测 5. RABBiT: Rapidly adaptive BOLD foundation model via brai 8.1分 前25% #音频理解 6. TRACE-EVC: Text-Guided Relative Affective Control for Z 8.0分 前25% #语音转换 7. Parallelized Autoregressive Decoding for Omni-Modal Den 8.0分 前25% #音视频理解 8. Speaker-Disentangled Chunk-Wise Regression for Syllabic 7.9分 前25% #语音编码 9. Speaker-Aware Temporal Aggregation Strategies on Segmen 7.9分 前25% #语音属性识别 10. REDDIT: Correcting Model-Generated Timestamp Drift in A 7.8分 前25% #语音识别 11. Deriving Benchmarking Datasets from Long-Form Recording 7.7分 前25% #基准测试 12. ProPS: Prompted Profile Synthesis for Natural Language- 7.6分 前25% #语音合成 13. DELTA-TTS: Adapting Autoregressive Model into Diffusion 7.5分 前25% #语音合成 14. TokAN: Accent Normalization Using Self-Supervised Speec 7.5分 前25% #语音转换 15. Listen, Think, Transcribe: Continuous Latent Test-Time 7.5分 前25% #语音识别 16. \(C^3\)ASD: Multi-Level Consistency-Driven Representation 7.5分 前25% #音视频理解 17. Training-Free Model Selection and Domain-Aware Score Ca 7.3分 前50% #音频事件检测 18. CHILDES-Aligned: A Curated Children's Speech Datase 7.2分 前50% #语音识别 19. Taste-aware music retrieval from audio embeddings 6.9分 前50% #音乐检索 20. Lights, Camera, Carbon: Architectural Scaling Laws for 6.9分 前50% #音视频生成 21. Unified Audio Intelligence Without Regressing on Text I 6.8分 前50% #音频交互 22. Ranking the Impact of Contextual Specialization in Neur 6.7分 前50% #语音增强 23. SynSFX: Multi-Model Sound Effects Synthesis Dataset for 6.5分 前50% #音频伪造检测 24. Evaluating the Effect of Linguistic Relatedness on Cros 6.5分 前50% #语音识别 25. MOSAIC: Interpretable Multi-Token Cross-Attention of Bi 6.3分 前50% #语音伪造检测 26. CARD: Cross-component Audio Representation Distillation 6.3分 前50% #音频字幕生成 27. Probing Low-Level Acoustic Attribute Encoding in CLAP A 6.2分 前50% #音频理解 28. Trajectory Variance: AnUnsupervised Measure of Developm 6.2分 前50% #音频理解 29. Adaptive Diversity-Uncertainty Active Learning with Red 6.2分 前50% #音频事件检测 30. Adaptive Loss Balancing for Multi-Task Bioacoustic Clas 6.1分 前50% #音频分类 31. An Intervention-Based Framework for Shortcut Diagnosis 6.1分 前50% #语音伪造检测 32. QuaSR: Quality-Aware Sample Reweighting for Pacific Ind 6.0分 前50% #语音识别 33. CaReCoS: A Spectrogram based Visual Benchmark for Cardi 6.0分 前50% #音频理解 34. Open-Set Source Tracing as Compositional Factors via St 6.0分 前50% #语音伪造检测 35. Context-Aware ASR for Mandarin Technical Lectures 6.0分 前50% #语音识别 36. Streaming Neural Speech Codecs through Time-Invariant R 6.0分 前50% #语音编码 37. Physiological Noise Augmentation Improves Non-Invasive 6.0分 前50% #语音识别 38. DuplexChat: Constructing Speaker-Separated Full-Duplex 5.9分 前50% #语音交互 39. Noisy Environment Adaptation of Neural Speech Codec via 5.9分 前50% #语音增强 40. NouveauVoice: Generating Novel Pseudo Speakers for Voic 5.9分 前50% #语音转换 41. OmniFocus: Query-Guided Modality-Balanced Token Compres 5.9分 前50% #音视频问答 42. Jointly Improving Dialect Identification and ASR in Ind 5.8分 前50% #语音识别 43. S-DiverSe: Spanish Diverse Speech 5.8分 前50% #语音识别 44. Towards Robust Uncertainty-Aware Speaker Modeling 5.7分 前50% #说话人验证 45. Towards Language-Agnostic Speech Inversion 5.6分 前50% #语音属性识别 46. Layer-wise Cross-Lingual Depression Detection from Spee 5.5分 前50% #语音情感识别 47. Wan-Streamer v0.2: Higher Resolution, Same Latency 5.4分 后50% #音视频交互 48. Mixture-Constrained Max Pooling Improves Separation-Bas 5.3分 后50% #音频分类 49. Reinforcement Learning for Data-Efficient Code-Switched 5.3分 后50% #语音识别 50. Physics-Informed Direction-of-Arrival Estimation Over D 5.3分 后50% #声源定位 51. Sampling Bias Compensation for Robust Evaluation of Aud 4.9分 后50% #音频分类 52. UniSkip-Mamba: A Frequency-Aware State Space Model for 4.8分 后50% #音视频理解 53. Progressive Refinement: An Iterative Pseudo-Labeling Ap 4.6分 后50% #语音识别 54. Weakly Guided and Autoregressive Beamformer Parameteriz 4.3分 后50% #语音分离 55. DETECT-3B-Omni is Agnostic of Content and Demographics 4.2分 后50% #语音伪造检测 56. Towards Digital Preservation of Efik: TTS for a Low-Res 4.0分 后50% #语音合成 57. Quantum-Inspired Harmonic Decision Models: A Computatio 2.3分 后50% #音乐生成 58. Information-Geometric Superposed Vowel Evaluation: Part 1.9分 后50% #语音伪造检测 📋 论文列表 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ...

2026-07-07 · 更新于 2026-08-14 · 47 min · 9986 words