语音/音乐/音频论文速递 2026-08-10

语音/音乐/音频论文速递 2026-08-10 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 2篇 ██ #音乐理解 2篇 ██ #音频伪造检测 2篇 ██ #音频生成 2篇 ██ #多模态模型 1篇 █ #歌唱生成 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 How Much AI Is in This Track? Quantifying the Proportio 8.3分 前25% 方法研究 #音频伪造检测 🥈 Objects as Audio-Visual Modal Sound Fields 7.6分 前25% 方法研究 #音频生成 🥉 StreamArena: Toward Continuous, Interactive, and Long-H 7.6分 前25% 数据集与基准 #多模态模型 4. Frame-Level Pansori Mode Classification with Complement 7.6分 前25% 数据集与基准 #音乐理解 5. Multi Codec Discrete Diffusion Model for Text Guided Sp 7.3分 前50% 方法研究 #语音编辑 6. MI-MIDI: Mechanistic Interpretability of Text-to-MIDI G 7.1分 前50% 方法研究 #音乐生成 7. SemBridge: Semantic Token Anchoring for Continuous-Late 7.0分 前50% 方法研究 #语音合成 8. Do Audio Language Models Use Paralinguistic Evidence? C 6.9分 前50% 数据集与基准 #语音情感识别 9. Separating Decision-Rule Misalignment from Readout-Cove 6.8分 前50% 方法研究 #语音情感识别 10. MMAG: A Multi-Control Mixed Audio Generation Benchmark 6.8分 前50% 数据集与基准 #音频生成 11. Assessing AI-generated music detection in real-world br 6.8分 前50% 数据集与基准 #音频伪造检测 12. LSEAD: A Privacy-Preserving LLM-Based Speech Analysis F 6.6分 前50% 系统技术报告 #语音识别 13. Cloud-Boosted Low-Compute Multi-Channel Speech Enhancem 6.0分 前50% 方法研究 #语音增强 14. Shape Your Feed: An LLM-based Agentic System for Conver 5.7分 前50% 系统技术报告 #音视频交互 15. From Prompting to Describing: A Cross-Cultural Study of 5.5分 前50% 应用研究 #音乐理解 16. Beyond Call and Response: Modelling Reciprocal Coordina 5.5分 前50% 方法研究 #歌唱生成 📋 论文列表 🥇 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-10 · 更新于 2026-08-14 · 14 min · 2864 words

A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper

📄 A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper 标签:#语音情感识别 #语音大模型 #低资源 #领域适应 #音频理解 5.7/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #语音大模型 | #低资源 #领域适应 | arxiv 👥 作者与机构 第一作者:Ali Shendabadi(未提供机构) 通讯作者:未说明 作者列表:Ali Shendabadi(未提供机构)、Parnia Izadirad(未提供机构)、Mostafa Salehi(未提供机构) 💡 毒舌点评 用 PCA 替代可学习投影层是一个务实且低成本的做法,确实省掉约 19.66 万额外参数,并报告了约 30% 的每轮训练加速。但实验设计并不干净:PCA 降到 512 维,而 FC 投影层降到 256 维,维度与方法两个变量同时改变,导致“PCA 更优”这一结论无法严格归因于降维方法本身。再加上没有跨数据集验证、没有显著性检验、没有代码或权重,“一致性提升”和 SOTA 结论都明显偏强。 ...

2026-08-07 · 更新于 2026-08-14 · 3 min · 639 words

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

📄 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 标签:#语音伪造检测 #基准测试 #语音合成 #语音转换 #音频理解 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.4/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音伪造检测 | #基准测试 | #语音合成 #语音转换 | arxiv 👥 作者与机构 第一作者:Aurosweta Mahapatra(Johns Hopkins University) 通讯作者:Berrak Sisman(Johns Hopkins University) 作者列表:Aurosweta Mahapatra(Johns Hopkins University)、Xiutian Zhao(Johns Hopkins University)、Shreeram Suresh Chandra(Johns Hopkins University)、Zihan Zhang(Johns Hopkins University)、Zongyang Du(Johns Hopkins University)、Ismail Rasim Ulgen(Johns Hopkins University)、Kong Aik Lee(Hong Kong Polytechnic University)、Nicholas Andrews(Johns Hopkins University)、Carlos Busso(Carnegie Mellon University)、Berrak Sisman(Johns Hopkins University) 💡 毒舌点评 AffectDF 在情感伪造攻击的覆盖广度上确实做出了有分量的贡献:21种攻击、约260小时、五种情绪、同时含表演性与自发性语音,直接填补了现有情感伪造基准规模小、攻击范式单一的空白。但训练集仅有4个说话人、LALM微调只验证了Voxtral一个模型、所有EER均为点估计且无置信区间,基准的"全面性"尚未完全转化为结论的"稳健性"。更关键的是,“情感训练无法一致提升跨域鲁棒性"这一核心反直觉发现主要建立在少数模型的行为分歧之上,论文未能说明训练数据变化为何会反转表演/自发风格的难度方向。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 805 words

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

📄 Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset 标签:#音乐转录 #Transformer #预训练 #数据集 #基准测试 7.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐转录 | #Transformer | #预训练 #数据集 | arxiv 👥 作者与机构 第一作者:Eoin Cummins(University College Dublin) 通讯作者:Yaolong Ju(Great Bay University),电子邮箱:juyaolong@gbu.edu.cn 作者列表:Eoin Cummins(University College Dublin)、Zhongyi Huang(Guangxi Normal University)、Alexandre D’Hooge(Great Bay University)、Zhuoro Mo(Shenzhen University)、Yaolong Ju(Great Bay University) 💡 毒舌点评 SheetSage-A2S 数据集本身是 A2S 走向流行音乐真实录音的重要资产,61 小时、9,468 个片段的规模填补了该方向的数据空白;但模型侧本质是“换预训练编码器 + 扩大 FFN + 数据增强”的组合,实验虽然完整,却既未量化 MuQ 预训练数据与评估集的潜在重叠,也未与 MERT/MusicFM 等其他音乐基础模型做公平对比,因此“MuQ 是合适选择”的结论仍缺乏足够说服力。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 717 words

Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning

📄 Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning 标签:#说话人验证 #CNN #音频理解 #Transformer #模型评估 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #说话人验证 | #CNN | #音频理解 #Transformer | arxiv 👥 作者与机构 作者列表为 Zezhong Jin、Xiaoyu Wang、Zhe Li、Chong-Xin Gan、Zilong Huang、Man-Wai Mak、Kong Aik Lee。论文脚注列出的单位有三个:1. 香港理工大学电子及资讯工程学系(Dept. of EEE, The Hong Kong Polytechnic University);2. 百度(Baidu Inc.);3. 香港大学言语、语言与认知实验室(Speech, Language, and Cognition Laboratory, The University of Hong Kong, Hong Kong SAR)。论文正文未逐位标注作者与单位的对应关系;第一作者 Zezhong Jin 的邮箱 zezhong.jin@connect.polyu.hk 可确认其属于香港理工大学。通讯作者信息未披露。 ...

2026-08-07 · 更新于 2026-08-14 · 3 min · 559 words

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

📄 Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors 标签:#语音质量评估 #Transformer #可解释性 #模型评估 #多语言 6.7/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音质量评估 | #Transformer | #可解释性 #模型评估 | arxiv 👥 作者与机构 第一作者:Arya Labroo(未说明) 通讯作者:未说明 作者列表:Arya Labroo(未说明)、Mengjie Qian(未说明)、Kate Knill(未说明) 💡 毒舌点评 把CAV/SAE这套可解释性工具搬到L2口语自动评分偏置审计上,“概念可恢复不等于概念影响分数”与“SAE的重建目标会稀释梯度敏感性”都是很有信息量的负结果。但四个探针点全部位于两个评分器的回归头内部,并未触达BERT/Whisper主干Transformer层;核心代码、模型权重与训练超参一律未开放,SAE也只给出m/k/稀疏度这类结构配置,读者很难判断“SAE导致Bgr衰减”究竟是方法固有缺陷还是实现局限性。 ...

2026-08-07 · 更新于 2026-08-14 · 2 min · 274 words

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

📄 C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models 标签:#音视频问答 #多模态模型 #基准测试 #数据集 #可解释性 5.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.5/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Swapnanil Mukherjee(Microsoft Research India) 通讯作者:Swapnanil Mukherjee(Microsoft Research India,论文提供联系邮箱为 swapnanil.mukherjee12@gmail.com) 作者列表:Swapnanil Mukherjee(Microsoft Research India)、Agyeya Negi(IIIT Hyderabad)、Tanuja Ganu(Microsoft Research India)、Ponnurangam Kumaraguru(IIIT Hyderabad) 💡 毒舌点评 用自动管道造了一个看似覆盖全模态、实际由 Gemini 单方生成并单方审计的 C3PO 基准,再用这个基准宣称“Gemini-3.1-Pro 最强”,存在明显的循环评价风险。不过其 IC/CC 双轴设计与注意力熵分析确实触碰到了多模态模型“过早承诺单模态”这一真问题,且模板粒度很细,值得后续工作修正生成偏差后复用。如果作者不公开生成产物和完整模板逻辑,这个基准的实际影响力会大打折扣。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 690 words

Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI

📄 Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI 标签:#语音识别 #Transformer #低资源 #多语言 #音频理解 7.8/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.8/10 | 前25% | 文档类型:理论研究 | 评分置信度:中 | #语音识别 | #Transformer | #低资源 #多语言 | arxiv 👥 作者与机构 第一作者:Jay L. Cunningham(DePaul University, School of Computing, RAISE Lab, USA;jcunni37@depaul.edu) 通讯作者:未标注 作者列表: Jay L. Cunningham(DePaul University, School of Computing, RAISE Lab, USA;jcunni37@depaul.edu) Mark Atta Mensah(York University, Electrical Engineering and Computer Science, Canada;mamensah@yorku.ca) Richard Martinez(Independent Researcher, USA;martinezrichardme@gmail.com) João Vieira da Silva Neto(DePaul University, School of Computing, RAISE Lab, USA;jvieirad@depaul.edu) Efi Dawodu(DePaul University, School of Computing, RAISE Lab, USA;edawodu@depaul.edu) 💡 毒舌点评 一篇题为“去殖民化”的论文,落地时却几乎全靠概念装置:七层模型、3M伤害分类、四支柱框架,术语琳琅满目,唯独缺少作者自己承认的那个东西——实验。通篇以“殖民语言等级”“结构暴力”为批判矛头,但给出的药方是一个“最低审计协议”式的未来待办清单;没有新架构、没有基准、没有代码,甚至连一个示范性审计都没有。用它自己的话说,这是“诊断地图”,可地图画得再细,不迈出一步也到不了任何地方。更讽刺的是,论文批评WER意识形态,却拿不出任何替代性的量化验证;批评北美机构特权,却由北美大学机构和独立研究员用英语发表。5.1分不算冤枉:批判性有余,而工程与验证几乎缺席。 ...

2026-08-07 · 更新于 2026-08-14 · 1 min · 183 words

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

📄 Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model 标签:#音乐生成 #扩散模型 #自回归模型 #数据集 #音频理解 6.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #扩散模型 | #自回归模型 #数据集 | arxiv 👥 作者与机构 第一作者:Zhiwei Lin(未说明) 通讯作者:未说明 作者列表:Zhiwei Lin(未说明)、Jun Chen(未说明)、Boshi Tang(未说明)、Weihao Wu(未说明)、Jing Yang(未说明)、Yaolong Ju(未说明)、Fan Fan(未说明)、Zhiyong Wu(未说明) 备注:论文正文仅标出作者上标编号 1、2、3,未给出机构名称。 💡 毒舌点评 把 LDM 与自回归潜在上下文拼接结合来解决长程符号音乐生成,思路自然,且客观指标确实优于已有基线;但代码和模型权重均未公开,上下文模块没有做有/无的独立消融,长时长实验只验证到 32 小节,论文却宣称能生成“数分钟”一致音乐。这些 claim 目前主要靠 demo 和少量表格背书,审稿人无法直接复现验证。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 667 words

Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects

📄 Diff2Mix: Controllable Music Mixing via Diffusion Models and Differentiable Audio Effects 标签:#音频生成 #扩散模型 #可解释性 #模型评估 #工业应用 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #扩散模型 | #可解释性 #模型评估 | arxiv 👥 作者与机构 第一作者:Yisu Zong(机构未说明) 通讯作者:未说明 作者列表:Yisu Zong(机构未说明)、Jinjie Shi(机构未说明)、Joshua Reiss(机构未说明) 💡 毒舌点评 将参考条件扩散模型与可微调音台结合,在保持可解释性的同时实现参考风格控制,且主观听感上 Diff2Mix-P 能达到人类混音水平,这是最清晰的亮点。但客观 KAD 在多数嵌入上仍落后于 MEGAMI,论文既没有给出 CFG 权重、掩码比例和效果链顺序的消融,也未深入解释主观与客观结果倒挂的原因;摇滚参考的全体失败进一步说明单一全局风格嵌入对轨道间交互建模不足。 ...

2026-08-07 · 更新于 2026-08-14 · 3 min · 590 words