语音/音乐/音频论文速递 2026-07-29

语音/音乐/音频论文速递 2026-07-29 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 2篇 ██ #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #音频理解 2篇 ██ #Transformer 1篇 █ #声源定位 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 faster-enhancer.c: A Dependency-Free int8 Runtime for S 8.7分 前25% 系统技术报告 #语音增强 🥈 OmniScope: Modality-Decoupled Token Compression for Omn 8.3分 前25% 方法研究 #音视频问答 🥉 AVE-Compass: Towards Holistic Evaluation for Audio-Vide 8.3分 前25% 数据集与基准 #多模态模型 4. Extracting Voice Styles from Frozen TTS Models via Grad 7.9分 前25% 方法研究 #语音克隆 5. CARE: A Multimodal Corpus for Studying Speech and Non-V 7.9分 前25% 数据集与基准 #音视频理解 6. GraphIDyOM: A graph-native Python reimplementation of I 7.8分 前25% 系统技术报告 #音乐理解 7. VAD to the Bone: Ultra-Tiny Speech Activity Detection f 7.4分 前50% 系统技术报告 #语音活动检测 8. Unlocking Spatial Grounding in Large Audio-Visual Retri 7.2分 前50% 方法研究 #声源定位 9. SpeechLLM Meets Federated Learning for End-to-End ASR: 7.1分 前50% 方法研究 #语音识别 10. Joint Text-Audio Alignment for EEG-to-Text Decoding in 7.0分 前50% 方法研究 #语音交互 11. OmniDelta: Skill-Driven Budget Allocation for Token Com 7.0分 前50% 方法研究 #音视频问答 12. Text-Prompted CLAP: Learning Query-Conditioned Audio Re 6.6分 前50% 方法研究 #音频理解 13. Towards Operational Conversational Intelligence: A Spee 6.4分 前50% 系统技术报告 #说话人日志 14. Parallel Decoding Distillation for Fast Image and Video 6.2分 前50% 方法研究 #音视频生成 15. Spacing Out: On the Reliability of Binaural Music Sourc 6.1分 前50% 方法研究 #音乐源分离 16. MyMentorLLM: A psychotherapy GenAI environment with mul 5.9分 前50% 系统技术报告 #语音交互 17. MusiChat: Vibe Composing for Music Creation 5.8分 前50% 系统技术报告 #音乐生成 18. AMRD: Adaptive Multi-Teacher Relational Distillation fo 5.6分 前50% 方法研究 #语音情感识别 19. Multi-Phonation Graph Learning with Self-Supervised Spe 5.5分 前50% 方法研究 #语音属性识别 20. Evaluation of forced alignment of code-mixed speech: th 5.4分 后50% 方法研究 #语音识别 21. A Cross-lingual Comparison of Human and Classification 5.1分 后50% 方法研究 #Transformer 22. From Semantics to Readout: Mechanistic Understanding of 5.1分 后50% 方法研究 #音频理解 23. Finding the noise: Zero-shot AI Music Detection 5.1分 后50% 方法研究 #无监督学习 24. Depression Markers in Speech: An Approach based on Trac 5.1分 后50% 应用研究 #语音属性识别 25. Self-Supervised Audio Representation Learning for Pedia 5.0分 后50% 应用研究 #音频分类 26. DynaBridge: Dynamic Summary-Guided Cross-Task Multimoda 4.9分 后50% 方法研究 #音视频理解 27. Device Invariance using Domain Adaptation on Acoustic S 4.2分 后50% 方法研究 #领域适应 📋 论文列表 🥇 faster-enhancer.c: A Dependency-Free int8 Runtime for Streaming Speech Enhancement on Commodity CPUs 8.7/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 ...

2026-07-29 · 更新于 2026-08-14 · 20 min · 4243 words

Disentangling Acoustic Cues in Alzheimer's Pathology and Perception: The Roles of Language and Gender

📄 Disentangling Acoustic Cues in Alzheimer’s Pathology and Perception: The Roles of Language and Gender 标签:#语音属性识别 #可解释性 #医疗音频 #多语言 #模型评估 5.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.3/1.5 📝 5.4/10 | 后50% | 文档类型:应用研究 | 评分置信度:高 | #语音属性识别 | #可解释性 | #医疗音频 #多语言 | arxiv 👥 作者与机构 第一作者:Liu He(University of Science and Technology of China) 通讯作者:Jiahong Yuan(University of Science and Technology of China) 作者列表:Liu He(University of Science and Technology of China)、Yuanchao Li(University of Edinburgh)、Yin-Long Liu(University of Science and Technology of China)、Rui Feng(University of Science and Technology of China)、Yiming Wang(University of Science and Technology of China)、Jiaxin Chen(University of Science and Technology of China)、Yizhe Wang(University of Science and Technology of China)、Jiahong Yuan(University of Science and Technology of China) 💡 毒舌点评 论文首次将XAI审计用于对比AD病理模型与人类感知在不同语言和性别中的对齐,揭示了全局SHAP解释隐藏的严重人口统计学分歧,这一点具有洞察力。但样本量极小,男性与希腊语病理模型未超越随机水平,导致该子集的发现几乎无法可靠解释;此外,无任何代码或模型公开,使框架的推广和验证成为纸上谈兵。 ...

2026-07-28 · 更新于 2026-08-14 · 4 min · 640 words

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

📄 Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages 标签:#说话人日志 #模型评估 #语音识别 #基准测试 #多语言 7.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.1/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #说话人日志 | #模型评估 | #语音识别 #基准测试 | arxiv 👥 作者与机构 第一作者:Deovrat Mehendale(Sarvam AI, AI4Bharat, IIT Madras) 通讯作者:未明确标注(论文使用公共邮箱 deovrat.mehendale@gmail.com, adityam0309@gmail.com, dhruvsubhashrathi@gmail.com) 作者列表:Deovrat Mehendale(Sarvam AI, AI4Bharat, IIT Madras)、Aditya Mehndiratta(Sarvam AI, AI4Bharat, IIT Madras,以公共邮箱标注)、Dhruv Rathi(Sarvam AI, AI4Bharat, IIT Madras,以公共邮箱标注)、Kaushal Bhogale(Sarvam AI)、Mitesh M. Khapra(Sarvam AI, AI4Bharat, IIT Madras) 💡 毒舌点评 亮点:首次全面覆盖印度宪法承认的全部 22 种语言的多说话人 ASR+diarization 联合基准,108 小时的三场景(近场/远场/野外)数据填补了一个明确的生态空白;联合评估 cpWER/WDER 的实验设计比传统 decoupled 评估更贴近生产实际;code-mixing 感知的双重转写协议是印度语言 ASR 评估中实际而长期被忽略的痛点。 ...

2026-07-28 · 更新于 2026-08-14 · 5 min · 1037 words

MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition

📄 MoLGE: Mixture of Language Group Experts for Efficient Scaling of Massively Multilingual Speech Recognition 标签:#语音识别 #LoRA #多语言 #参数高效微调 #音频理解 6.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #LoRA | #多语言 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Sangmin Lee(延世大学 电子电气工程系) 通讯作者:Hong-Goo Kang(延世大学 电子电气工程系) 作者列表:Sangmin Lee(延世大学 电子电气工程系)、Woojin Chung(延世大学 电子电气工程系)、Woongjib Choi(延世大学 电子电气工程系)、Hong-Goo Kang(延世大学 电子电气工程系) 💡 毒舌点评 论文将语言分组与 Mixture of LoRA Experts 结合,对 495 种语言做了相当系统的分组策略研究,实验设计扎实,洞察到语言先验在复杂正字法空间中的收益大于简化音素空间。但整体架构仍是对已有 PEFT 与 MoE 技术的组合,缺乏真正颠覆性的新组件;且仅基于 300M 量级的 wav2vec2 类骨干,未与当前主流的数十亿参数大模型直接对标,限制了其在产业界的说服力。 ...

2026-07-28 · 更新于 2026-08-14 · 3 min · 574 words

Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm

📄 Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm 标签:#语音合成 #语音大模型 #流匹配 #强化学习 #多语言 7.0/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.4/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #语音合成 | #语音大模型 | #流匹配 #强化学习 | arxiv 👥 作者与机构 作者列表:Bajian Xiang、Cheng Wen、Han Zhao、Hao Wang、Haoxu Wang、Jiawei Jin、Jiayan Cui、Jie Chen、Mengxi Nie、Tianyu Zhao、Weiqin Li、Xiang Lv、Xiangang Li、Yang Xiang、Yang Zhou(论文注明按名字字母顺序同等贡献) 通讯作者:未说明 机构:未说明 💡 毒舌点评 这篇工作把语音合成的控制性、鲁棒性、多语言覆盖和工程效率卷到了一起,12.5 Hz tokenizer搭配五阶段渐进式训练的思路确实有点意思,在多个榜单上刷出很强数据,工业落地能力肉眼可见。但作为一篇系统技术报告,论文只展示了最终甜点模型的结果,对每个训练阶段、每项设计决策的增益几乎零消融,让人很难判断究竟是哪个trick真正扛了大旗;再加上完全没有提供代码、模型或权重,连训练数据规模和具体超参数都藏着掖着,复现和公平对比基本无从谈起,学术透明度大打折扣。 ...

2026-07-28 · 更新于 2026-08-14 · 2 min · 330 words

Simple Language Normalization Wins: Cross-Lingual Speaker Verification for the TidyVoice 2026 Challenge

📄 Simple Language Normalization Wins: Cross-Lingual Speaker Verification for the TidyVoice 2026 Challenge 标签:#说话人验证 #领域适应 #多语言 #基准测试 #音频理解 6.8/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #说话人验证 | #领域适应 | #多语言 #基准测试 | arxiv 👥 作者与机构 第一作者:Nina Hosseini-Kivanani(University of Luxembourg & Radio Télévisioun Lëtzebuerg (RTL), Luxembourg) 通讯作者:未说明 作者列表:Nina Hosseini-Kivanani(University of Luxembourg & Radio Télévisioun Lëtzebuerg (RTL), Luxembourg) 💡 毒舌点评 本文用一记经典的 NAP 组合拳在 TidyVoice 2026 竞赛中登顶,展示出"后处理降维"比复杂对抗训练更稳健、更省力,工程实用性突出。然而,方法本质是对 2007 年 nuisance 子空间技术的直接复用,创新深度有限,且对 WavLM 等自监督前端的调优十分浅尝辄止,未能给出真正公平的比较。 ...

2026-07-28 · 更新于 2026-08-14 · 4 min · 777 words

Kutti AI: A Voice-First, Offline-Capable Learning Companion with Real-Time Struggle Detection for Visually-Impaired Children

📄 Kutti AI: A Voice-First, Offline-Capable Learning Companion with Real-Time Struggle Detection for Visually-Impaired Children 标签:#语音交互 #语音大模型 #离线 #教育 #多语言 5.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.2/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 📝 5.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #语音交互 | #语音大模型 | #离线 #教育 | arxiv 👥 作者与机构 第一作者:Kadharmoideen Fadurudeen(独立研究者) 其他作者:无 通讯作者:未明确指定(仅一位作者) 💡 毒舌点评 这份工作有一个善良且有现实需求的出发点——为视障儿童打造一个离线可用的纯语音学习伴侣。设计思路清晰,将本地ASR、多信号困难检测和跨语言容忍评估整合成一个完整闭环,工程架构上算是一个不错的集成。但论文完全是一个“可行性原型”的报告,没有任何定量实验或真实用户数据来支撑任何一个功能的有效性,严格来说不能算作已验证的研究成果。要冲击顶会,至少得拿出真刀真枪的用户实验和基线对比。 ...

2026-07-27 · 更新于 2026-08-14 · 1 min · 178 words

语音/音乐/音频论文速递 2026-07-27

语音/音乐/音频论文速递 2026-07-27 共分析 13 篇论文 ⚡ 今日概览 📥 抓取 13 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音伪造检测 2篇 ██ #语音识别 2篇 ██ #音频理解 2篇 ██ #大语言模型 1篇 █ #语音交互 1篇 █ #语音情感识别 1篇 █ #语音活动检测 1篇 █ #音乐检索 1篇 █ 📊 论文评分排行榜(13 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MEUSLI: a Multilingual Projector for LLM-based ASR and 8.2分 前25% 方法研究 #语音识别 🥈 CODA: Cascaded Online Discontinuity-Aware Alignment for 8.1分 前25% 方法研究 #音频理解 🥉 SoundscapeAgent: Agentic Soundscape Construction for Co 8.0分 前25% 系统技术报告 #大语言模型 4. Reflector: Arrangement-Aware Harmonic Retrieval for Sam 7.7分 前25% 系统技术报告 #音乐检索 5. Phylogenetic signal in marine mammal and bird vocalizat 7.7分 前25% 应用研究 #音频理解 6. Listen, Do Not Copy: Internalizing Audio-Grounded Scaff 6.6分 前50% 方法研究 #语音识别 7. Probing Speaker Identity Sensitivity in Audio Deepfake 6.5分 前50% 方法研究 #语音伪造检测 8. Transforming Keystroke Noise to Text: Self-Supervised A 6.5分 前50% 方法研究 #语音活动检测 9. Music-JEPA: Learning a World Model of Sound from Action 6.2分 前50% 方法研究 #音乐转录 10. Synthetic Speech, Real Signal: Paralinguistic Preservat 6.2分 前50% 应用研究 #语音情感识别 11. Kutti AI: A Voice-First, Offline-Capable Learning Compa 5.5分 前50% 系统技术报告 #语音交互 12. MemNMF: Memory-Augmented NMF on LPC Spectra for Anomalo 5.3分 后50% 方法研究 #音频事件检测 13. How Meta-Learning Shapes LoRA Adapter Geometry in Speec 5.2分 后50% 方法研究 #语音伪造检测 📋 论文列表 🥇 MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond 8.2/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ...

2026-07-27 · 更新于 2026-08-14 · 10 min · 2119 words

VibeVoice-ASR-BitNet Technical Report

📄 VibeVoice-ASR-BitNet Technical Report 标签:#语音识别 #模型压缩 #高效推理 #多语言 #音频理解 7.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.8/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #模型压缩 | #高效推理 #多语言 | arxiv 👥 作者与机构 第一作者:Songchen Xu(上海交通大学) 通讯作者:Furu Wei(Microsoft Research) 作者列表:Songchen Xu(上海交通大学)、Ting Song(Microsoft Research)、Shaohan Huang(Microsoft Research)、Zhiliang Peng(Microsoft Research)、Yan Xia(Microsoft Research)、Yujie Tu(中国科学院大学)、Xin Huang(复旦大学)、Jianwei Yu(Microsoft Research)、Li Dong(Microsoft Research)、Furu Wei(Microsoft Research) 💡 毒舌点评 论文的亮点在于其系统级的工程洞察:针对VAE(IO密集型)和LM(权重密集型)的不同计算瓶颈,实施“异构量化”策略(I8_S与I2_S),并辅以深度工程优化(定制SIMD内核、算子融合),形成一个完整的、可在消费级CPU上实时运行的端到端系统,切实解决了LLM-based ASR在边缘部署的痛点。短板在于,作为一份强调“方法”的技术报告,其核心贡献“异构量化”的优越性缺乏严格的组件级消融实验支撑;训练过程的关键细节(数据、超参数、渐进调度)近乎黑箱,严重影响了可复现性;与FP16基线的精度对比也不够直观全面。 ...

2026-07-24 · 更新于 2026-08-14 · 3 min · 464 words

语音/音乐/音频论文速递 2026-07-24

语音/音乐/音频论文速递 2026-07-24 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 4篇 ████ #语音交互 2篇 ██ #语音情感识别 2篇 ██ #多模态模型 1篇 █ #数据集 1篇 █ #语音伪造检测 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DONDO: Open w2v-BERT Speech-Recognition Base Models for 8.1分 前25% 系统技术报告 #语音识别 🥈 Designed Vocalizations Dataset: Sound-Designed Human an 7.9分 前25% 数据集与基准 #语音转换 🥉 VibeVoice-ASR-BitNet Technical Report 7.8分 前25% 系统技术报告 #语音识别 4. Faster IndexTTS-2: Accelerating and Streaming Autoregre 7.6分 前25% 系统技术报告 #语音合成 5. From Read Speech to Spoken Digits: A Task-Specific Eval 7.5分 前25% 应用研究 #语音识别 6. Instruct-FD: Can Your Full-Duplex Speech System Follow 7.2分 前50% 数据集与基准 #语音交互 7. OPOD: On-Policy Omni Distillation 7.1分 前50% 方法研究 #多模态模型 8. X\(^3\)-OPD: Distilling Reasoning into Large Audio-Langua 7.1分 前50% 方法研究 #音频理解 9. Toward Interpretable Speech Deepfake Detection using Ar 7.0分 前50% 方法研究 #语音伪造检测 10. Toward Generalizable Cognitive Impairment Detection wit 7.0分 前50% 方法研究 #语音情感识别 11. Safeguards for Speech2Speech LLM-Assistants: A Case Stu 6.5分 前50% 系统技术报告 #语音交互 12. Investigating Codec-Internal Latent Audio Watermarking 6.4分 前50% 系统技术报告 #音频水印 13. TF-MossFormer: Integrating Convolution Gated Local-Glob 6.3分 前50% 模型报告 #语音分离 14. Phonetic forced alignment for low-resource language var 6.2分 前50% 方法研究 #语音识别 15. SCoPE: Shift-Aware Speaker-Conditioned Priors for Emoti 6.0分 前50% 方法研究 #语音情感识别 16. Word meaning co-determines vowel-inherent spectral chan 5.9分 前50% 方法研究 #语音属性识别 17. An Evaluation Framework for Structured Audio Captions V 5.3分 后50% 数据集与基准 #数据集 18. Improving the performance of an ASV system using hybrid 5.0分 后50% 方法研究 #说话人验证 📋 论文列表 🥇 DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages 8.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-07-24 · 更新于 2026-08-14 · 14 min · 2973 words