语音/音乐/音频论文速递 2026-07-21

语音/音乐/音频论文速递 2026-07-21 共分析 34 篇论文 ⚡ 今日概览 📥 抓取 34 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 3篇 ███ #音频理解 3篇 ███ #语音伪造检测 2篇 ██ #语音翻译 2篇 ██ #说话人验证 2篇 ██ #音频事件检测 2篇 ██ #基准测试 1篇 █ #多模态模型 1篇 █ 📊 论文评分排行榜(34 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 HARP: Harmonic-Aware Residual Partitioning for Neural A 9.6分 前10% 方法研究 #音频编码 🥈 SALMONN-2: Advancing General-Purpose Hearing Abilities 9.4分 前10% 模型报告 #音频理解 🥉 Pseudo-label distillation for discriminative anomalous 9.0分 前10% 方法研究 #音频事件检测 4. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous A 8.8分 前25% 数据集与基准 #基准测试 5. RealDESED: A Real-World Domestic Sound Event Detection 7.9分 前25% 数据集与基准 #音频事件检测 6. FlowSonic: Stable Zero-Shot Music Editing via High-Orde 7.9分 前25% 方法研究 #音乐生成 7. Time-Frequency Consistency Learning for Robust Speech D 7.9分 前25% 方法研究 #语音伪造检测 8. AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Cali 7.8分 前25% 方法研究 #说话人验证 9. X-Translator: A Real-Time Multilingual Speaker-Aware Sp 7.8分 前25% 系统技术报告 #语音翻译 10. Dense-Sparse Dynamic Time Warping for Customizing Piano 7.8分 前25% 系统技术报告 #音乐源分离 11. Do Speech Tokens Leak Voiceprints? Speaker Inversion At 7.7分 前25% 方法研究 #说话人验证 12. Is One Score Enough? Assessing Singing Quality of Songs 7.6分 前25% 方法研究 #音乐理解 13. FlashRT: Agent Harness for Guiding Agents to Deploy Rea 7.5分 前25% 系统技术报告 #音视频生成 14. AI_LectureNote: A Retrospective Pilot Study of a Post-A 7.2分 前50% 系统技术报告 #语音识别 15. Should Missing Modalities Always Be Necessary to Repair 7.0分 前50% 方法研究 #多模态模型 16. Re-Sonance: A Dysarthric Asynchronous Real-Time Speech 6.9分 前50% 系统技术报告 #语音转换 17. NABEATs: Noise-Aware Audio Representation Learning 6.7分 前50% 方法研究 #音频理解 18. When to Use Extra Context: Evidence-Grounded Terminolog 6.7分 前50% 系统技术报告 #语音翻译 19. How Reliable Are Multimodal Signals of Conversational S 6.6分 前50% 方法研究 #鲁棒性 20. SSTMark: Robust Training-Free Semantic-Level Speech Wat 6.5分 前50% 系统技术报告 #音频水印 21. The tttAI System for the TSA-ASR Task of the SmartGlass 6.5分 前50% 系统技术报告 #说话人日志 22. Audio Cross Verification Using Dual Alignment Likelihoo 6.5分 前50% 方法研究 #音频伪造检测 23. Component-Level Ensemble Fusion for Speech and Environm 6.4分 前50% 系统技术报告 #语音伪造检测 24. Adaptive Momentum Enhanced Distributed Multichannel Act 6.3分 前50% 应用研究 #音频理解 25. Robust Summarization of Doctor-Patient Conversations: T 6.3分 前50% 系统技术报告 #语音交互 26. An Audio Language Model-Based Voice Concept Bottleneck 6.2分 前50% 应用研究 #语音质量评估 27. FillGauss: Fine-Grained Filling-Aware Impact Sound Gene 6.2分 前50% 方法研究 #音频生成 28. Harness TTS: Towards Context-Aware Expressive Speech Sy 6.2分 前50% 方法研究 #语音合成 29. Modeling turn-taking with distant viewing: investigatin 6.2分 前50% 系统技术报告 #音视频 30. Efficient Audio-Visual Event Recognition via Knowledge 5.8分 前50% 方法研究 #音视频理解 31. Multi-Level Privacy-Preserving Dementia Detection from 5.5分 前50% 方法研究 #语音属性识别 32. Explainable Lightweight Compact Deep Models for Speech 5.4分 后50% 方法研究 #语音情感识别 33. Team RAS in 11th ABAW Competition: Multimodal Ambivalen 5.3分 后50% 系统技术报告 #语音情感识别 34. EII-SCL: Harnessing Emotional Inertia for Multimodal Em 5.2分 后50% 方法研究 #语音情感识别 📋 论文列表 🥇 HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs 9.6/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ...

2026-07-21 · 更新于 2026-07-24 · 29 min · 6176 words

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

📄 Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos 标签:#音视频理解 #多模态模型 #音视频问答 #数据集 #课程学习 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频理解 | #多模态模型 | #音视频问答 #数据集 | arxiv 👥 作者与机构 第一作者:Sreyan Ghosh(NVIDIA, USA;University of Maryland, USA) 通讯作者:未说明 作者列表:Sreyan Ghosh(NVIDIA, USA;University of Maryland, USA)、Arushi Goel(NVIDIA, USA;University of Maryland, USA)、Kaousheik Jayakumar(University of Maryland, USA)、Lasha Koroshinadze(University of Maryland, USA)、Nishit Anand(University of Maryland, USA)、Siddharth Gururani(NVIDIA, USA)、Hanrong Ye(NVIDIA, USA)、Pritam Biswas(NVIDIA, USA)、Yuanhang Su(NVIDIA, USA)、Ehsan Hosseini-Asl(NVIDIA, USA)、Sang-gil Lee(NVIDIA, USA)、Zhifeng Kong(NVIDIA, USA)、Jaehyeon Kim(NVIDIA, USA)、Sungwon Kim(NVIDIA, USA)、Karan Sapra(NVIDIA, USA)、S Sakshi(University of Maryland, USA)、Ramani Duraiswami(University of Maryland, USA)、Dinesh Manocha(University of Maryland, USA)、Andrew Tao(NVIDIA, USA)、Mohammad Shoeybi(NVIDIA, USA)、Bryan Catanzaro(NVIDIA, USA)、Ming-Yu Liu(NVIDIA, USA)、Wei Ping(NVIDIA, USA) 💡 毒舌点评 论文在工程和开源上堪称模范生,提供了从数据集、训练代码到模型权重的完整“全家桶”,对音视频理解领域的研究者极具实用价值。然而,其核心创新更接近于一个精心设计的系统集成和工程优化,而非原理性突破,方法的新颖性相对有限。 ...

2026-07-20 · 更新于 2026-07-24 · 4 min · 700 words

AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis

📄 AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis 标签:#语音合成 #流匹配 #语音情感识别 #多模态模型 #音频理解 6.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #流匹配 | #语音情感识别 #多模态模型 | arxiv 👥 作者与机构 第一作者:Zhenqi Jia(College of Computer Science, Inner Mongolia University) 通讯作者:Rui Liu(College of Computer Science, Inner Mongolia University)、Haizhou Li(SRIBD, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen) 作者列表:Zhenqi Jia(College of Computer Science, Inner Mongolia University)、Yuan Zhao(College of Computer Science, Inner Mongolia University)、Aruukhan(College of Computer Science, Inner Mongolia University)、Rui Liu(College of Computer Science, Inner Mongolia University)、Haizhou Li(SRIBD, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen) 💡 毒舌点评 本文提出AuEmoChat框架,试图通过学习离散的“真实情感”token空间来突破对话语音合成(CSS)中有限情感标签的瓶颈,并利用token合并压缩冗余上下文。思路有新意,实验设计也较为完整,主观和客观指标均展示了对SOTA基线的超越。然而,论文的核心创新(AuEmoCodec)建立在使用一个外部闭源大模型(Gemini-2.5-Flash)进行情感标注的“魔法”之上,形成了一个用AI标注AI的脆弱闭环,其泛化性、可控性和可解释性均存疑。更关键的是,作者在摘要中信誓旦旦承诺的代码和演示开源,至今仅是一个匿名占位符GitHub链接,实为空头支票,严重损害了论文的可信度和实际影响力。 ...

2026-07-20 · 更新于 2026-07-24 · 4 min · 668 words

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

📄 AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning 标签:#多模态模型 #自监督学习 #音视频理解 #音频理解 #Transformer 5.7/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.3/1.5 📝 5.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #自监督学习 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Benjamin Robson(未说明) 通讯作者:未说明 作者列表:Benjamin Robson(未说明)、Santeri Mentu(未说明)、Wenshuai Zhao(未说明)、Arno Solin(未说明) 💡 毒舌点评 本文将JEPA理论优雅地扩展到音视频领域,设计极度简洁(无解码器、无EMA教师、无对比损失),并通过详尽的消融实验清晰地验证了模态dropout作为核心机制的有效性,展现了理论指导实践的良好范例。然而,其性能与当前SOTA的MAE基线存在显著差距(VGGSound 57.1% vs. 67.1%,AudioSet 32.7 vs. 53.3 mAP),且完全没有开源,使得其实际贡献和影响力大打折扣。论文更像一个精心设计的“概念验证”,而非能立即推动领域性能前进的竞争性工作。 ...

2026-07-20 · 更新于 2026-07-24 · 3 min · 576 words

Constrained Hebbian Learning Supports Efficient Representational Allocation under Structural Constraints

📄 Constrained Hebbian Learning Supports Efficient Representational Allocation under Structural Constraints 标签:#音视频理解 #多模态模型 #自监督学习 #理论分析 #音频理解 6.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #自监督学习 #理论分析 | arxiv 👥 作者与机构 第一作者:Patrick Inoue(KEIM Institute, Albstadt-Sigmaringen University, Germany; Department of Computer Science, Chemnitz University of Technology, Germany) 通讯作者:Patrick Inoue(标注 ∗) 作者列表:Patrick Inoue(KEIM Institute, Albstadt-Sigmaringen University, Germany; Department of Computer Science, Chemnitz University of Technology, Germany)、Florian Röhrbein(Department of Computer Science, Chemnitz University of Technology, Germany)、Andreas Knoblauch(KEIM Institute, Albstadt-Sigmaringen University, Germany) 💡 毒舌点评 本文引入了一个受约束的赫布学习框架来探讨神经表征的成本-性能权衡,这在概念上是值得肯定的。然而,其核心实验设置存在一个根本性问题:将预训练的大规模深度学习模型(MAE)提取的固定高维嵌入作为“高阶感官输入”来模拟生物神经系统的早期处理,这种模拟与真实生物系统“边学习边表征”的动态过程存在本质差异。论文将这种设置解释为“剥离低层特征提取的复杂性”,但在批评者看来,这更像是在一个已经被深度学习模型“咀嚼”和“结构化”过的、高度抽象的空间里进行局部学习的演练。其论证的核心——Hebbian规则在固定嵌入上能产生更高效的表征——能否推广到从原始感官流中学习,仍然是一个巨大的问号。此外,评估指标(VIB)本身的假设和局限(如高斯近似)也可能影响结论的普适性。总体而言,文章提供了一个精心设计的对比实验,但其生物合理性和现实意义有待商榷。 ...

2026-07-20 · 更新于 2026-07-24 · 4 min · 732 words

语音/音乐/音频论文速递 2026-07-20

语音/音乐/音频论文速递 2026-07-20 共分析 15 篇论文 ⚡ 今日概览 📥 抓取 15 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 3篇 ███ #基准测试 2篇 ██ #语音识别 2篇 ██ #自回归模型 1篇 █ #语音交互 1篇 █ #语音合成 1篇 █ #语音质量评估 1篇 █ #说话人验证 1篇 █ 📊 论文评分排行榜(15 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 StemFX: Learning Mixing Style Representations via Autor 9.6分 前10% 方法研究 #自回归模型 🥈 A Geometry-Limited Identification Floor and Its Consequ 8.8分 前25% 方法研究 #说话人验证 🥉 Proof-Carrying Multimodal Timelines: Finite-Trace Modal 8.6分 前25% 系统技术报告 #基准测试 4. A Study of Parallelizable Alternatives to Dynamic Time 8.1分 前25% 系统技术报告 #基准测试 5. Estimating the Reliability of Dynamic Time Warping Alig 7.6分 前25% 方法研究 #音乐理解 6. Controlling Implicit Shortcut Reliance in L2 Spoken Eng 7.5分 前25% 方法研究 #语音质量评估 7. Segmental DTW: A Parallelizable Alternative to Dynamic 7.0分 前50% 方法研究 #音频检索 8. AuEmoChat: Authentic Emotion Understanding and Renderin 6.9分 前50% 方法研究 #语音合成 9. Constrained Hebbian Learning Supports Efficient Represe 6.7分 前50% 方法研究 #音视频理解 10. SpeechGuard: Online Defense against Backdoor Attacks on 6.0分 前50% 方法研究 #语音识别 11. Audio-Visual Flamingo: Open Audio-Visual Intelligence f 6.0分 前50% 系统技术报告 #音视频理解 12. AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervis 5.7分 前50% 方法研究 #音视频理解 13. Data-driven Video Codec with Implicit Neural Representa 5.3分 后50% 系统技术报告 #音频编码 14. AnovaX: A Local, Multi-Agent Voice Assistant with LLM P 4.8分 后50% 系统技术报告 #语音交互 15. Natural Backdoor Attacks on Speech Recognition Models 3.5分 后50% 方法研究 #语音识别 📋 论文列表 🥇 StemFX: Learning Mixing Style Representations via Autoregressive FX Chain Prediction on Source-Separated Stems 9.6/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-20 · 更新于 2026-07-24 · 13 min · 2761 words

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

📄 AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning 标签:#音频检索 #模型融合 #多模态模型 #持续学习 #音频理解 6.4/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频检索 | #模型融合 | #多模态模型 #持续学习 | arxiv 👥 作者与机构 第一作者:Sarthak Jain(University of Illinois Urbana-Champaign) 通讯作者:未说明(论文中未明确标注通讯作者) 作者列表:Sarthak Jain(University of Illinois Urbana-Champaign)、Qiran Hu(University of Illinois Urbana-Champaign)、Zhen Zhu(University of Illinois Urbana-Champaign; Google DeepMind)†、Yaoyao Liu(University of Illinois Urbana-Champaign) †注:根据论文脚注,Zhen Zhu的此项工作是在其作为伊利诺伊大学厄巴纳-香槟分校博士生期间完成的,之后加入了Google DeepMind。 💡 毒舌点评 论文提出了一个将不同持续学习检查点视为“乐高积木”进行后处理组合的简洁视角,方法本身简单且有启发性。然而,其实验验证严重受限于单一的小规模数据集(AudioSet的79类子集)和单一的骨干网络(AudioCLIP ViT-B/32),这极大地削弱了其结论的普适性和实际影响力。对于一篇声称改进“持续多模态表示学习”的方法论文,缺乏在更主流、更大规模的视觉-语言(而非音频-图像-文本)持续学习场景下的验证,是一个显著的硬伤。 ...

2026-07-17 · 更新于 2026-07-24 · 4 min · 682 words

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

📄 InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring 标签:#多模态模型 #对比学习 #数据集 #基准测试 #智能座舱 7.3/10 | 创新 1.1/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #多模态模型 | #对比学习 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Hao Yang(哈尔滨工业大学) 通讯作者:Bing Qin(哈尔滨工业大学)(论文未明确标注通讯作者,但根据作者列表最后一位及邮箱格式推断) 作者列表:Hao Yang(哈尔滨工业大学)、Yanyan Zhao(哈尔滨工业大学)、Kewei Zhao(哈尔滨工业大学)、Hongbo Zhang(哈尔滨工业大学)、Tian Zheng(哈尔滨工业大学)、Yusheng Liu(哈尔滨工业大学)、Xing Fu(哈尔滨工业大学)、Bichen Wang(哈尔滨工业大学)、Yu Zhang(哈尔滨工业大学)、Hao He(SERES)、Zhen Wu(SERES)、Xuda Zhi(SERES)、Yongbo Huang(SERES)、Bing Qin(哈尔滨工业大学) 💡 毒舌点评 论文在座舱场景中创新性地融合了对话文本和红外模态,数据构建流程规范且具有工程价值。然而,其核心卖点之一——用于“跨语言评估”的英文基准——完全依赖质量不可控的机器合成语音,这不仅引入了严重的偏差,更使其关于跨语言性能的结论沦为一项对语音合成技术的间接评估,极大地削弱了研究的科学严谨性。模型比较的公平性也存在疑问。 ...

2026-07-17 · 更新于 2026-07-24 · 3 min · 553 words

SceneBind: Binding What and Where Across Vision, Audio and Language

📄 SceneBind: Binding What and Where Across Vision, Audio and Language 标签:#多模态模型 #音视频理解 #对比学习 #空间音频 #音频理解 6.6/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #对比学习 #空间音频 | arxiv 👥 作者与机构 第一作者:Mingfei Chen (University of Washington) 通讯作者:Eli Shlizerman (University of Washington) 作者列表:Mingfei Chen (University of Washington), Zijun Cui (University of Washington, University of Texas at Dallas), Ruoke Zhang (University of Washington), Hyeonggon Ryu (Hankuk University of Foreign Studies), Eli Shlizerman (University of Washington) 💡 毒舌点评 论文将场景理解从“是什么”推进到“在哪里”,提出了一个完整的语义-空间绑定框架和配套数据集,实验设计扎实,在空间检索任务上优势明显。然而,它本质上是将视觉领域的“对象槽”思想嫁接到音视频场景理解中,创新更多在于问题定义和工程组合;更关键的是,论文对空间音频信号的利用较为浅层(仅简单拼接特征),且核心贡献与音频领域的直接关联性有限,影响力主要惠及多模态和具身智能社区。 ...

2026-07-17 · 更新于 2026-07-24 · 2 min · 421 words

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

📄 Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment 标签:#多模态模型 #强化学习 #音频理解 #Transformer #模型评估 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #多模态模型 | #Transformer | #强化学习 #音频理解 | arxiv 👥 作者与机构 第一作者:Harikrishnan P M 通讯作者:未说明 作者列表:Harikrishnan P M, Goutham Vignesh, Ganesh Parab, Saisubramaniam Gopalakrishnan, Vishal Vaddina, Varun V, Rohit Agrawal 机构信息:论文中未提及任何作者所属机构。 💡 毒舌点评 论文的出发点(质疑推理在感知任务中的必要性)有洞察力,但实验设计存在明显的“选择性对比”,未能全面验证其核心论点。将结论从一个特定的冷启动、小规模(4B)模型推广到“推理无用”的通用结论,过于冒进,忽略了推理在更复杂场景或更大模型中可能存在的价值。 ...

2026-07-17 · 更新于 2026-07-24 · 3 min · 442 words