语音/音乐/音频论文速递 2026-07-07

语音/音乐/音频论文速递 2026-07-07 共分析 58 篇论文 ⚡ 今日概览 📥 抓取 58 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 11篇 ███████████ #语音伪造检测 5篇 █████ #音频理解 4篇 ████ #语音交互 3篇 ███ #音频事件检测 3篇 ███ #语音转换 3篇 ███ #音视频理解 3篇 ███ #语音合成 3篇 ███ 📊 论文评分排行榜(58 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1分 前10% #音频检索 🥈 SPEARBench: A Benchmark for Naturalness Evaluation in S 8.9分 前25% #语音交互 🥉 Metronome: Bound the Cache, Keep the Beat for Real-Time 8.7分 前25% #语音交互 4. Auto-AEG: Scalable Data Construction for Open-Vocabular 8.3分 前25% #音频事件检测 5. RABBiT: Rapidly adaptive BOLD foundation model via brai 8.1分 前25% #音频理解 6. TRACE-EVC: Text-Guided Relative Affective Control for Z 8.0分 前25% #语音转换 7. Parallelized Autoregressive Decoding for Omni-Modal Den 8.0分 前25% #音视频理解 8. Speaker-Disentangled Chunk-Wise Regression for Syllabic 7.9分 前25% #语音编码 9. Speaker-Aware Temporal Aggregation Strategies on Segmen 7.9分 前25% #语音属性识别 10. REDDIT: Correcting Model-Generated Timestamp Drift in A 7.8分 前25% #语音识别 11. Deriving Benchmarking Datasets from Long-Form Recording 7.7分 前25% #基准测试 12. ProPS: Prompted Profile Synthesis for Natural Language- 7.6分 前25% #语音合成 13. DELTA-TTS: Adapting Autoregressive Model into Diffusion 7.5分 前25% #语音合成 14. TokAN: Accent Normalization Using Self-Supervised Speec 7.5分 前25% #语音转换 15. Listen, Think, Transcribe: Continuous Latent Test-Time 7.5分 前25% #语音识别 16. \(C^3\)ASD: Multi-Level Consistency-Driven Representation 7.5分 前25% #音视频理解 17. Training-Free Model Selection and Domain-Aware Score Ca 7.3分 前50% #音频事件检测 18. CHILDES-Aligned: A Curated Children's Speech Datase 7.2分 前50% #语音识别 19. Taste-aware music retrieval from audio embeddings 6.9分 前50% #音乐检索 20. Lights, Camera, Carbon: Architectural Scaling Laws for 6.9分 前50% #音视频生成 21. Unified Audio Intelligence Without Regressing on Text I 6.8分 前50% #音频交互 22. Ranking the Impact of Contextual Specialization in Neur 6.7分 前50% #语音增强 23. SynSFX: Multi-Model Sound Effects Synthesis Dataset for 6.5分 前50% #音频伪造检测 24. Evaluating the Effect of Linguistic Relatedness on Cros 6.5分 前50% #语音识别 25. MOSAIC: Interpretable Multi-Token Cross-Attention of Bi 6.3分 前50% #语音伪造检测 26. CARD: Cross-component Audio Representation Distillation 6.3分 前50% #音频字幕生成 27. Probing Low-Level Acoustic Attribute Encoding in CLAP A 6.2分 前50% #音频理解 28. Trajectory Variance: AnUnsupervised Measure of Developm 6.2分 前50% #音频理解 29. Adaptive Diversity-Uncertainty Active Learning with Red 6.2分 前50% #音频事件检测 30. Adaptive Loss Balancing for Multi-Task Bioacoustic Clas 6.1分 前50% #音频分类 31. An Intervention-Based Framework for Shortcut Diagnosis 6.1分 前50% #语音伪造检测 32. QuaSR: Quality-Aware Sample Reweighting for Pacific Ind 6.0分 前50% #语音识别 33. CaReCoS: A Spectrogram based Visual Benchmark for Cardi 6.0分 前50% #音频理解 34. Open-Set Source Tracing as Compositional Factors via St 6.0分 前50% #语音伪造检测 35. Context-Aware ASR for Mandarin Technical Lectures 6.0分 前50% #语音识别 36. Streaming Neural Speech Codecs through Time-Invariant R 6.0分 前50% #语音编码 37. Physiological Noise Augmentation Improves Non-Invasive 6.0分 前50% #语音识别 38. DuplexChat: Constructing Speaker-Separated Full-Duplex 5.9分 前50% #语音交互 39. Noisy Environment Adaptation of Neural Speech Codec via 5.9分 前50% #语音增强 40. NouveauVoice: Generating Novel Pseudo Speakers for Voic 5.9分 前50% #语音转换 41. OmniFocus: Query-Guided Modality-Balanced Token Compres 5.9分 前50% #音视频问答 42. Jointly Improving Dialect Identification and ASR in Ind 5.8分 前50% #语音识别 43. S-DiverSe: Spanish Diverse Speech 5.8分 前50% #语音识别 44. Towards Robust Uncertainty-Aware Speaker Modeling 5.7分 前50% #说话人验证 45. Towards Language-Agnostic Speech Inversion 5.6分 前50% #语音属性识别 46. Layer-wise Cross-Lingual Depression Detection from Spee 5.5分 前50% #语音情感识别 47. Wan-Streamer v0.2: Higher Resolution, Same Latency 5.4分 后50% #音视频交互 48. Mixture-Constrained Max Pooling Improves Separation-Bas 5.3分 后50% #音频分类 49. Reinforcement Learning for Data-Efficient Code-Switched 5.3分 后50% #语音识别 50. Physics-Informed Direction-of-Arrival Estimation Over D 5.3分 后50% #声源定位 51. Sampling Bias Compensation for Robust Evaluation of Aud 4.9分 后50% #音频分类 52. UniSkip-Mamba: A Frequency-Aware State Space Model for 4.8分 后50% #音视频理解 53. Progressive Refinement: An Iterative Pseudo-Labeling Ap 4.6分 后50% #语音识别 54. Weakly Guided and Autoregressive Beamformer Parameteriz 4.3分 后50% #语音分离 55. DETECT-3B-Omni is Agnostic of Content and Demographics 4.2分 后50% #语音伪造检测 56. Towards Digital Preservation of Efik: TTS for a Low-Res 4.0分 后50% #语音合成 57. Quantum-Inspired Harmonic Decision Models: A Computatio 2.3分 后50% #音乐生成 58. Information-Geometric Superposed Vowel Evaluation: Part 1.9分 后50% #语音伪造检测 📋 论文列表 🥇 Doppelganger: Sound Effects and Their Synthetic Twins 9.1/10 | 创新 1.5/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ...

2026-07-07 · 更新于 2026-07-27 · 47 min · 9986 words

A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation

📄 A Semantically Consistent Dataset for Data-Efficient Query-Based Universal Sound Separation #音频分离 #数据集 #低资源 #数据清洗 9.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 9.2/10 | 前10% | #音频分离 | #数据集 | #低资源 #数据清洗 | arxiv 👥 作者与机构 第一作者:Kai Li(清华大学计算机系 / IDG/McGovern Institute for Brain Research, 清华大学)、Jintao Cheng(清华大学计算机系)(*共同第一) 通讯作者:Xiaolin Hu(清华大学计算机系 / IDG/McGovern Institute for Brain Research / 中国脑与认知科学研究所 (CIBR)) 作者列表:Kai Li, Jintao Cheng, Chang Zeng (Shanda AI Research Tokyo), Zijun Yan (清华大学), Helin Wang (Johns Hopkins University), Zixiong Su (Shanda AI Research Tokyo), Bo Zheng (Shanda AI Research Tokyo), Xiaolin Hu (清华大学) 💡 毒舌点评 这篇论文用一个精心设计的数据清洗管道,优雅地证明了“数据纯度远比数据规模重要”这一反直觉结论——Hive 仅凭 0.2% 的训练数据量,就让模型在多项指标上媲美甚至超越百万小时级的 SAM-Audio,说服力极强。但管道核心的语义对齐和兼容性判断完全依赖 Qwen3-Omni 零样本能力,这种对单一黑盒模型的深度绑定,可能让数据集系统性地继承了该模型的偏见,而作者对这种“近亲繁殖”风险的审计仍显不足。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 735 words

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

📄 AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning #音频理解 #音频大模型 #强化学习 #低资源 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.2/10 | 前50% | #音频理解 | #强化学习 | #音频大模型 #低资源 | arxiv 👥 作者与机构 第一作者:Siqian Tong(中国科学院声学研究所,中国科学院大学) 通讯作者:Siqian Tong(中国科学院声学研究所,中国科学院大学)、Xuan Li(中国科学院声学研究所,中国科学院大学) 作者列表:Siqian Tong(中国科学院声学研究所)、Xuan Li(中国科学院声学研究所)、Yiwei Wang(加州大学默塞德分校)、Baolong Bi(中国科学院计算技术研究所)、Yujun Cai(昆士兰大学)、Shenghua Liu(中国科学院计算技术研究所)、Yuchen He(中国科学院计算技术研究所)、Chengpeng Hao(中国科学院声学研究所) 💡 毒舌点评 这篇论文在音频工具增强推理上的探索方向值得肯定,差分奖励机制的设计也算巧妙。但话说回来,仅在2000样本上训练的RL策略、6个固定工具的微缩库,再加上对ReAct等成熟工具调度框架的刻意回避,让“范式转移”的宣称显得过于膨胀。整体工作更像是在已知的RL+Tool框架上,于音频领域完成了一次精巧但有限的适配验证,深度和广度都还欠火候。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 342 words

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

📄 Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models #语音合成 #后训练 #自监督学习 #低资源 #多语言 8/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 🔥 8/10 | 前25% | #语音合成 | #后训练 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Yizhong Geng(北京邮电大学) 通讯作者:Xiaoyu Shen(Eastern Institute of Technology, Ningbo) 作者列表:Yizhong Geng(北京邮电大学)、Yanliang Li(Beijing Logic Intelligence Technology)、Jinghan Yang(北京邮电大学)、Tianhan Jiang(University of California, USA)、Boxun An(Northwestern University, USA)、Ya Li(北京邮电大学)、Xiaoyu Shen(Eastern Institute of Technology, Ningbo) 💡 毒舌点评 本文敏锐地抓住低资源SLM中合成数据泛滥引发的“越稳定越单调”的分布塌缩现象,并将Flow-Matching架构的内在解耦设计巧妙地转化为无需人工标注的自对齐信号,思路相当漂亮。然而,TDSC对目标语言ASR模块的硬依赖限制了其在最极端的语言上的用武之地,且整个pipeline的计算开销在资源受限场景下的性价比分析仍然缺席。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 641 words

Convex Low-resource Accent-Robust Language Detection in Speech Recognition

📄 Convex Low-resource Accent-Robust Language Detection in Speech Recognition #语音识别 #迁移学习 #低资源 #理论分析 6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 6/10 | 前50% | #语音识别 | #迁移学习 | #低资源 #理论分析 | arxiv 👥 作者与机构 第一作者:Miria Feng(斯坦福大学电气工程系) 通讯作者:Miria Feng(miria00@stanford.edu) 作者列表:Miria Feng(斯坦福大学电气工程系)、William Tan(斯坦福大学计算机科学系)、Mert Pilanci(斯坦福大学电气工程系) 💡 毒舌点评 本文将凸神经网络的理论工具精准地“搬”进了语音识别语言检测任务,在极低资源下拿到了漂亮的一致性好成绩,理论与系统落地的结合点找得准,凸优化免调参的特性是实证亮点。但检测头只做语言分类,并未触碰 ASR 转录瓶颈本身;对比基线缺乏与主流 LID 专用模型的正面较量;且特征空间证书因缺乏编码器 Lipschitz 的精确估计而难以兑现为实用的音频空间鲁棒性保证,理论保证与工程实际之间存在明显落差。 📌 核心摘要 本文针对多方言口音环境下自动语音识别(ASR)语言检测错误频发、尤其低资源方言样本稀缺导致传统微调过拟合的问题,提出 Convex Language Detection (CLD) 框架。方法核心是利用两层 ReLU 网络的凸重构形式,将 ASR 编码器冻结,仅通过凸规划训练一个检测头;该凸程序用 ADMM 在 JAX 上多 GPU 求解,得到全局最优解,并基于 variation norm 推导出 Lipschitz 证明和可计算的 margin 稳定性证书。相比传统神经网络需要大量数据和超参调优,CLD 在低资源(100-10000 样本)场景下保持高语言检测准确率并显著降低 WER。主要实验分别在二分类(英语 vs 中文,各含5种口音)和多分类(5种语言,24种口音)上进行,使用 Whisper-Small、Whisper-Large-V3 和 MMS-1B 作为骨干编码器;CLD 在500样本二分类上达到96.95%准确率,远超微调Whisper的72.07%和普通NN的55.80%;多分类中 Whisper-Large-V3 配合 CLD 达到98.06%准确率,WER降至28.60;训练时间仅为普通NN的7.7%。该方法为低资源多方言场景提供了一种可即插即用的稳健语言检测模块,但仅改善语言识别错误,对同一语言内方言转录错误仍受限于原始解码器。 ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 820 words

Simultaneous Speech-to-Speech Translation Without Aligned Data

📄 Simultaneous Speech-to-Speech Translation Without Aligned Data #语音翻译 #强化学习 #多语言 #低资源 #流式处理 8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8/10 | 前25% | #语音翻译 | #强化学习 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Tom Labiausse(Kyutai, Paris, France) 通讯作者:未指定个人通讯作者,提供团队邮箱 hibiki@kyutai.org 作者列表:Tom Labiausse(Kyutai)、Romain Fabre(Kyutai)、Yannick Estève(LIA, University of Avignon)、Alexandre Défossez(Kyutai / Gradium)、Neil Zeghidour(Gradium) 💡 毒舌点评 通过消除词级对齐数据并用单BLEU奖励驱动RL,Hibiki-Zero简化了同时语音翻译的训练范式,并在多语言环境下取得了有竞争力的质量-延迟折衷,尤其在新语言适应方面展现出潜力。但过程奖励完全依赖BLEU,回避了对翻译自然度、韵律和语义保真度的直接建模;且评测数据及训练目标语音均为合成数据,存在生成-评估偏差风险,在实际场景下的泛化能力仍存疑。 ...

2026-07-04 · 更新于 2026-07-27 · 2 min · 326 words

Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis

📄 Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis #音频分类 #音频事件检测 #低资源 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | #音频分类 | #知识蒸馏 | #音频事件检测 #低资源 | arxiv 👥 作者与机构 第一作者:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 通讯作者:Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 作者列表:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University)、Guoheng Huang(School of Computer Science and Technology, Guangdong University of Technology)、Chan-Tong Lam(Faculty of Applied Sciences, Macao Polytechnic University)、Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University) 💡 毒舌点评 这篇论文精准地抓住了医疗音频模型过度自信的几何病根——范数偏差,用球形约束和动态Procrustes对齐的组合拳切断了特征幅度与置信度的虚假耦合,理念清晰且动机扎实。实验校准效果惊人,将BEATs的ECE从28.51%拉低到4.44%,且做到了零额外推理成本,这一点很漂亮。然而,方法论层面更多是已知几何工具(L2归一化、ETF、SVD)在特定问题上的精巧组装,而非基础性突破。此外,验证局限于两个公开的呼吸音/心音数据集,在标签噪声、跨中心/跨设备泛化上的鲁棒性论证几乎为零,结论的临床闭环说服力仍需大量补充。 ...

2026-07-04 · 更新于 2026-07-27 · 5 min · 901 words

VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio

📄 VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio #音频检索 #基准测试 #零样本 #多语言 #低资源 #自监督学习 8.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | #音频检索 | #自监督学习 | #基准测试 #零样本 | arxiv 👥 作者与机构 第一作者:Maris Basha(苏黎世大学神经信息学研究所与 ETH Zurich) 通讯作者:Richard Hahnloser(苏黎世大学神经信息学研究所与 ETH Zurich) 作者列表:Maris Basha(苏黎世大学神经信息学研究所与 ETH Zurich)、Anja Zai(苏黎世大学神经信息学研究所与 ETH Zurich)、Sabine Stoll(苏黎世大学语言进化跨学科研究所)、Richard Hahnloser(苏黎世大学神经信息学研究所与 ETH Zurich) 💡 毒舌点评 这篇工作用一套训练无关的几何视角给冻结音频嵌入做了一次透彻的“体检”,GSR 的边界惩罚设计和跨语料聚合的工程勇气值得肯定,暴露出的低资源语言局部检索崩塌为社区敲响了警钟。但盲测仅限于语音域,让“OOD 泛化”的标题显得过于宏大;公共子集普遍存在的预训练重叠也使得零样本的纯净度打了折扣,而 GSR 与 Silhouette 高达 0.82 的相关性让人不禁要问:新指标的边际贡献究竟在哪里? ...

2026-07-04 · 更新于 2026-07-27 · 4 min · 657 words

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

📄 Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings #语音交互 #预训练 #多任务学习 #低资源 #迁移学习 #Transformer 7/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7/10 | 前50% | #语音交互 | #预训练 | #多任务学习 #低资源 | arxiv 👥 作者与机构 第一作者:Jesuraj Bandekar(印度科学学院电气工程系) 通讯作者:Prasanta Kumar Ghosh(印度科学学院电气工程系) 作者列表:Jesuraj Bandekar、Prasanta Kumar Ghosh(均来自印度科学学院电气工程系) 资助信息:本研究由印度科技部(Department of Science and Technology, DST)资助。 💡 毒舌点评 本文用一套组合式多任务预训练给低资源 AAI 打了针强心剂,用廉价的 MFCC 就敢叫板重量级 SSL 特征,工程实用性看似不错。但方法只是将已知预训练目标拼盘,却未深究多目标间的互补与冗余;消融止于最终性能的罗列,没有一丝表征层面的分析。仅抱紧 TERA 和单一数据集,就敢声称“高效替代”,说服力在审稿人看来仍需更多证据。 ...

2026-07-03 · 更新于 2026-07-27 · 6 min · 1175 words

From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages

📄 From Monolingual to Multilingual: Evaluating Mamba for ASR in South African Languages #语音识别 #低资源 4.8/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 📝 4.8/10 | 后50% | #语音识别 | #端到端 | #低资源 | arxiv 👥 作者与机构 第一作者:Jesujoba O. Alabi(萨尔大学/DFG SFB 1102) 通讯作者:未说明 作者列表:Jesujoba O. Alabi(萨尔大学,DFG SFB 1102)、Julian Herreilers(未说明)、Badr M. Abdullah(萨尔大学,DFG SFB 1102)、Dietrich Klakow(萨尔大学) 💡 毒舌点评 在南非语言ASR的蛮荒之地上,这篇工作用Mamba立了一块"省时省显存"的路标,证明了SSM在此地跑得通。但整个研究本质上是一次对ConMamba的"加盟商复制"——把公开的Mamba-ASR配方(SpeechBrain模板)原样搬到七个南非语种上,加上几个教科书式的多语条件化trick,没有触及非洲语言形态复杂、语码混杂等本质痛点。更糟糕的是,全篇零代码、零模型、零数据承诺,连个README都没有,让后续研究者想复现都无从下手。 ...

2026-07-03 · 更新于 2026-07-27 · 3 min · 599 words