Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

📄 Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes 标签:#空间音频 #音视频生成 #声源定位 #多通道 #CNN 6.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #CNN | #音视频生成 #声源定位 | arxiv 👥 作者与机构 第一作者:Qingyu Luo(Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) 通讯作者:论文未单独标注通讯作者;作者邮箱均为 University of Surrey 域名 作者列表:Qingyu Luo、Peng Zhang、Wenwu Wang、Philip J. B. Jackson(机构:Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 850 words

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

📄 AudioWorldSim: Realistic Binaural Audio Datasets For World Models 标签:#空间音频 #生成模型 #数据集 #多通道 9.7/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.7/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #空间音频 | #生成模型 | #数据集 #多通道 | arxiv 👥 作者与机构 第一作者:Luis Vitor Zerkowski(VISGRAF;IMPA) 通讯作者:正文未明确标注 作者列表:Luis Vitor Zerkowski、Luiz Velho(机构:VISGRAF;IMPA) 💡 毒舌点评 这是少见的把声学 bug 根因、特征尺寸、吞吐和失败率都写清楚的工具论文。同源卷积与 IR 补零修复的不是美化指标,而是会污染世界模型训练的真实不连续。最需要克制的是把开放生成器说成开放数据集或已验证的世界模型方案:5% 后端失败、材质禁用、场景许可和缺少下游实验仍是硬边界。 ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 435 words

A Novel Binaural Cue Preservation Loss for DNN-Based Binaural Speech Enhancement

📄 A Novel Binaural Cue Preservation Loss for DNN-Based Binaural Speech Enhancement 标签:#语音增强 #多任务学习 #助听器 #多通道 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #多任务学习 | #助听器 #多通道 | arxiv 👥 作者与机构 第一作者:Jayteerth Amble(未说明) 通讯作者:未说明 作者列表:Jayteerth Amble(未说明)、Thomas Haubner(未说明)、Hendrik Schröter(未说明)、Christoph Hoog Antink(未说明)、Henning Puder(未说明) 机构信息:论文中未提供作者所属机构、实验室或部门信息。 💡 毒舌点评 这篇论文的两个损失函数动机清晰,尤其是 BRE 直接把掩膜对干净频谱的破坏从增强输出中拆出来,比继续堆 ILD/IPD 误差更有意思。短板也很明显:全文只有合成消声环境,Figure 2 全是曲线而正文没有关键数值表;BRE 既当训练目标又当评估指标,循环验证风险不小;BC 声称联合 ILD/IPD,却连 IPD 误差都没有单列。整体是小而精的损失设计,但距离真实助听器场景还有不少距离。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 751 words

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

📄 Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion 标签:#空间音频 #扩散模型 #多通道 #鲁棒性 6.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #空间音频 | #扩散模型 | #多通道 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Xiang Zhou(西北工业大学 智能声学与沉浸式通信中心;南洋理工大学 数字信号处理实验室) 通讯作者:Wen Zhang(西北工业大学 智能声学与沉浸式通信中心,wen.zhang@nwpu.edu.cn) 作者列表:Xiang Zhou(西北工业大学 智能声学与沉浸式通信中心;南洋理工大学 数字信号处理实验室)、Zhengqiao Zhao(西北工业大学 智能声学与沉浸式通信中心)、Zhengding Luo(西北工业大学 智能声学与沉浸式通信中心)、Wen Zhang(西北工业大学 智能声学与沉浸式通信中心) 💡 毒舌点评 这篇论文用 GASHP 前端、双分支条件扩散和低阶/高阶空间正则的组合,试图解决稀疏五麦克风阵列下 FOA/SOA 编码的欠定与病态问题。整体思路清楚,物理投影至少避免了直接伪逆放大噪声,消融也基本支持各模块贡献。但硬伤同样直接:没有代码、没有模型权重、数据仅有“on request”的空泛承诺;2.66 秒/4 秒音频的推理速度与实时部署背道而驰;Table 3 中估计 SOA 反投影超过 Ground Truth 的结果,作者解释为二阶截断误差,却没有提供任何控制实验排除模型过拟合到特定阵列响应或参考信号失真。更刺眼的是,相关工作里明确讨论了同为生成式稀疏麦克风 Ambisonic 编码的 Flow-HOA,实验却完全不做对比,这削弱了“相对于最新生成式基线”的说服力。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 928 words

Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode

📄 Ambisonics Encoding of Room Impulse Responses using a Device-Agnostic Diffusion Mode 标签:#音频生成 #扩散模型 #空间音频 #多通道 #零样本 6.3/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #扩散模型 | #空间音频 #多通道 | arxiv 👥 作者与机构 第一作者:Eloi Moliner(Meta Reality Labs Research;Aalto University, Acoustics Lab, DICE, Espoo, Finland) 通讯作者:未说明 作者列表:Eloi Moliner(Meta Reality Labs Research;Aalto University, Acoustics Lab, DICE)、Christoph Hold(Meta Reality Labs Research)、Juan Azcarreta Ortiz(Meta Reality Labs Research)、Sebastian Prepeliţă(Meta Reality Labs Research)、Ishwarya Ananthabhotla(Meta Reality Labs Research)、Daniel Wong(Meta Reality Labs Research)、Sanjeel Parekh(Meta Reality Labs Research)、Sanha Lee(Meta Reality Labs Research) 💡 毒舌点评 本文首次将无条件扩散先验与 diffusion posterior sampling 结合用于高阶 Ambisonics RIR 编码,并通过 range-projected 压缩频谱距离显著压制弱高阶分量误差,这是一个有价值的组合洞察。但“设备无关”的核心卖点只在一个 7 麦克风阵列上实证,训练数据、ATF 与权重全部闭源,听音测试仅 13 人且无统计检验,让人很难判断这到底是通用方法还是内部数据工程能力。 ...

2026-08-17 · 更新于 2026-09-04 · 5 min · 878 words

Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones

📄 Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones 标签:#语音增强 #CNN #RNN #多通道 #模型评估 5.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 📝 5.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #CNN | #RNN #多通道 | arxiv 👥 作者与机构 第一作者:Oshan A. B. Yalegama(Department of Electronic and Telecommunication Engineering, University of Moratuwa, Sri Lanka) 第二作者:Wageesha N. Manamperi(School of Engineering, The Australian National University, Australia;其邮箱为 University of Moratuwa 邮箱,机构标注与邮箱存在不一致) 通讯作者:论文未明确标注通讯作者,仅通过脚注列出两位作者的邮箱 yalegamammoab.20@uom.lk 和 wageesham@uom.lk 💡 毒舌点评 本文首次把 ReTM 估计从协方差基线推进到监督深度学习,三种架构分别覆盖 STFT 深度卷积、时域滤波器组和 BiLSTM 时序建模,FuSNet 在仿真指标上确实有明显提升,LAeNet 的下游降噪效果也值得关注。但实验规模极小、完全依赖仿真,测试集在多数场景中只有 10 秒;正文与表格之间存在“场景 B 中 SCoNet MSE 优于 FuSNet”这类直接与数据相悖的表述;FuSNet 在下游语音增强中反而从 Baseline 的 4.07 dB 跌到 −1.19 dB,说明 ReTM 精度高不等于降噪有用;LAeNet 训练时拼接了目标信号却未说明推断输入,存在训练/推断不一致的严重疑点。再加上只给了音频样本、没有代码和权重,论文可靠性被明显拖累。 ...

2026-08-13 · 更新于 2026-09-04 · 5 min · 973 words

BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays

📄 BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays 标签:#语音分离 #Transformer #语音增强 #多通道 5.0/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 📝 5.0/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音分离 | #Transformer | #语音增强 #多通道 | arxiv 👥 作者与机构 第一作者:Selani A. Indrapala(斯里兰卡莫拉图瓦大学,电子与电信工程系) 通讯作者:未说明 作者列表:Selani A. Indrapala(斯里兰卡莫拉图瓦大学电子与电信工程系)、Wageesha N. Manamperi(斯里兰卡莫拉图瓦大学电子与电信工程系) 资助来源:“Accelerating Higher Education Expansion and Development (AHEAD)” 项目(编号 6026-LK/8743-LK)及斯里兰卡电信监管委员会(TRCSL)2024 研发基金 💡 毒舌点评 用 oracle DoA/VAD 把 SegSNR 从 -8.69 拉到 -2.57,说明空间与活动性信息确实能带来可观增益;但所谓“目标说话人提取”既依赖真值标签,又未与任何已有 TSE 方法对比,更像“带 oracle 指导的 BCCTN 增强”。更扎眼的是引言末尾宣称 “consistently surpasses state-of-the-art methods”,而全文的对比基线只有 MVDR 和自己使用的 BCCTN 系列,SOTA 声称没有实质证据支撑,离 AR 眼镜实际部署还有很大距离。 ...

2026-08-12 · 更新于 2026-09-04 · 6 min · 1193 words

语音/音乐/音频论文速递 2026-08-12

语音/音乐/音频论文速递 2026-08-12 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 4篇 ████ #语音识别 4篇 ████ #音乐理解 4篇 ████ #扩散模型 1篇 █ #端到端 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DuplexWorld: Can voice agents help you get through the 8.5分 前25% 数据集与基准 #语音交互 🥈 A Dataset and Benchmark for Optical Music Recognition o 8.5分 前25% 数据集与基准 #端到端 🥉 Measuring Cross-Cultural Style Diffusion Through Era Cl 8.3分 前25% 方法研究 #音乐理解 4. Training Set Synthesis for Bioacoustic Denoising: A Cas 8.0分 前25% 应用研究 #语音增强 5. Modeling and Interpreting Correlations, Null Distributi 8.0分 前25% 方法研究 #音频理解 6. Seeds Before Objectives: Rethinking Evaluation for Low- 7.9分 前25% 数据集与基准 #语音识别 7. Beyond Dry References: Learning Relative Audio Effects 7.7分 前25% 方法研究 #音乐理解 8. MAJEPPA: Morphing and Assessing in a Unified Piano Perf 7.5分 前25% 方法研究 #音乐理解 9. DIY e-HandPan: A new DIY Low-Cost Handpan Interface bas 7.2分 前50% 系统技术报告 #音频交互 10. Rationale-Guided Learning for Multimodal Emotion Recogn 7.2分 前50% 方法研究 #语音情感识别 11. The GENEA Challenge 2026: A Large-Scale Disentangled Ev 7.2分 前50% 数据集与基准 #语音交互 12. Beyond Naturalness: Probing Automated Text-To-Speech Ev 7.1分 前50% 数据集与基准 #语音质量评估 13. In Defense of Using Worst-case Privacy Disclosure as Pr 7.1分 前50% 理论研究 #说话人验证 14. Pitch Contour Tokenization using VQ-VAE and Its Applica 7.1分 前50% 方法研究 #音乐理解 15. VoxSumm: A Multilingual Corpus of Long-Form Spoken News 6.9分 前50% 数据集与基准 #语音翻译 16. myMediWhisper: Construction of Burmese Medical Speech C 6.7分 前50% 数据集与基准 #语音识别 17. MazzikaAI: A knowledge-based performance-to-prompt comp 6.6分 前50% 系统技术报告 #音乐生成 18. ASR-Roundtrip Evaluation Can Mask Context- and Conventi 6.5分 前50% 方法研究 #语音合成 19. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with 6.5分 前50% 系统技术报告 #音视频生成 20. TimeRoute: Time-Aware Modality Routing and Diffusion fo 6.5分 前50% 方法研究 #扩散模型 21. X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint 6.4分 前50% 方法研究 #语音交互 22. Edge Phoneme Recognition for Children’s Speech through 6.3分 前50% 模型报告 #语音识别 23. DINO-A: Adapting Self-Distillation Vision Transformers 6.2分 前50% 方法研究 #音频分类 24. Whisper-Aware LLM: Self-Supervised Uncertainty Learning 6.1分 前50% 方法研究 #语音识别 25. Never Stop Speaking: a Denial-of-Service Attack on End- 5.4分 后50% 方法研究 #语音交互 26. BiTSE: Binaural Target Speaker Extraction in Noisy Mult 5.0分 后50% 方法研究 #语音分离 27. Monophonic Audio Synthesizer Using FPGAs 4.2分 后50% 系统技术报告 #音频生成 📋 论文列表 🥇 DuplexWorld: Can voice agents help you get through the day? 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-12 · 更新于 2026-09-04 · 24 min · 4909 words

Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty

📄 Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty 标签:#声源定位 #Transformer #鲁棒性 #多通道 6.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #Transformer | #鲁棒性 #多通道 | arxiv 👥 作者与机构 第一作者:Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) 通讯作者:未说明 作者列表: Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) Changwoo J. Lee(Duke University, Department of Statistical Science) Xin Shen(Duke University, Department of Statistical Science) Ari Lehtiö(University of Jyväskylä, Digital Services) Sandro von Brandenburg(University of Jyväskylä, Digital Services) Ossi Nokelainen(University of Jyväskylä, Department of Biological and Environmental Science;University of Jyväskylä, Open Science Centre) David B. Dunson(Duke University, Department of Statistical Science) Otso Ovaskainen(University of Jyväskylä, Department of Biological and Environmental Science) 💡 毒舌点评 用“保留物理求解器 + 学习校正 + 两层物理门控 + GDOP 缩放不确定性”的思路来抑制双曲定位的灾难性长尾,诊断清楚、设计务实,这是论文最大的亮点。但真实实验只有一个冰冻湖站点、六个已知扬声器位置,森林场景全部是仿真,且没有给出完整混合门控在森林仿真中的直接结果;基线只有经典双曲求解器,未与任何现代深度学习、score-based 或 conformal 声源定位方法对比。整体说服力仍未达到顶会主接收准。 ...

2026-08-11 · 更新于 2026-09-04 · 3 min · 619 words

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

📄 Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement 标签:#语音增强 #知识蒸馏 #多通道 #实时处理 #高效推理 6.0/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #知识蒸馏 | #多通道 #实时处理 | arxiv 👥 作者与机构 第一作者:Xulin Fan(University of Illinois Urbana-Champaign, USA) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Xulin Fan(University of Illinois Urbana-Champaign)、Juan Azcarreta(Meta Reality Labs Research)、Ashutosh Pandey(Meta Reality Labs Research)、Jesus Alvarez(Meta Reality Labs Research)、Ke Tan(Meta Reality Labs Research)、Jacob Donley(Meta Reality Labs Research)、Ritwik Giri(Meta Reality Labs Research)、Buye Xu(Meta Reality Labs Research) 💡 毒舌点评 把服务器端 SpatialNet 的延迟增强谱、中间层特征和空间统计量一起“搬”到边缘端,确实让 TinyGRU+MCWF 在合成低 SNR 测试集上获得 3.77 dB 和 3.49 dB 的 SI-SDR 提升,而边缘端参数只增加约 1.5%、计算量只增加约 2.4%,这个端云协作 pipeline 有工程启发。但实验基本局限于同一套 Pyroomacoustics 合成 RIR 与固定延迟仿真:没有与原始 Knowledge Boosting 直接对比,没有真实设备、动态网络延迟、丢包或带宽测试,也没有统计显著性检验。更刺眼的是 PESQ 没有随 SI-SDR 同步上升,完整模型的 PESQ 甚至低于中间消融配置。目前的结论更适合表述为“仿真环境下端云协作增强的可行性验证”,而非成熟的部署级方案。 ...

2026-08-10 · 更新于 2026-09-04 · 4 min · 712 words