PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

📄 PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs #空间音频 #Transformer #大语言模型 #参数高效微调 #多通道 8.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.7/10 | 前25% | #空间音频 | #Transformer | #大语言模型 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Artem Dementyev (Google DeepMind, Cambridge, USA) 通讯作者:Artem Dementyev (Google DeepMind, Cambridge, USA) 作者列表:Artem Dementyev (Google DeepMind, Cambridge, USA)、Wazeer Zulfikar (Media Lab, MIT, Cambridge, USA)、Sinan Hersek (Google AR, Seattle, WA)、Pascal Getreuer (Google DeepMind, Cambridge, USA)、Anurag Kumar (Google DeepMind, Cambridge, USA)、Vivek Kumar (Google DeepMind, Cambridge, USA) 💡 毒舌点评 在LLM普遍缺乏空间听觉的当下,提出几何无关的空间音频编码器并与Gemma集成,切入点精准,但实验验证过分依赖合成数据,如同在声学真空里练出绝世武功,一到真实环境的混响、遮挡和噪声面前就难免露怯。定向转录准确率仅44%-52%,离实用还很遥远,更像是给LLM装上了一副度数不太准的眼镜。 ...

2026-07-04 · 更新于 2026-08-14 · 3 min · 512 words

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

📄 Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer #空间音频 #音视频生成 #扩散模型 #流式处理 #自回归模型 #对比学习 6.6/10 | 创新 1.3/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.8/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 ✅ 6.6/10 | 前50% | #音视频生成 | #扩散模型 | #空间音频 #流式处理 | arxiv 👥 作者与机构 第一作者(共同一作):Ke Lei(浙江大学) 共同一作:Yu Zhang(字节跳动) 共同一作:Changhao Pan(浙江大学) 作者列表:Xueyi Pu(浙江大学)、Wenxiang Guo(浙江大学)、Ruiqi Li(字节跳动)、Zhou Zhao(浙江大学,通讯作者) 💡 毒舌点评 这篇文章在流式空间音频生成上做出了明确的架构贡献——自回归做全局规划、扩散做局部渲染的思路干净利落,SVAC的空间负样本设计也很有物理感知能力。但整体evaluation偏弱,尤其是缺少与最近强基线(如MovieGen-Audio、Frieren)的直接对比,且ablation中只展示了去掉某组件的退化程度,缺少为什么这套组合设计优于其他可能组合(如AR-only或Diffusion-only变体)的深度分析。另外,伪FOA预训练策略的随意性以及对总生成时长的回避讨论,让人觉得像一份扎实的工程系统报告而非有深刻洞察的顶会文章。 ...

2026-07-04 · 更新于 2026-08-14 · 2 min · 399 words

Spatial Speech Perception Systems: A Survey of Sound Source Localization, Directional Enhancement, and Speech Recognition

📄 Spatial Speech Perception Systems: A Survey of Sound Source Localization, Directional Enhancement, and Speech Recognition #空间音频 #声源定位 #语音增强 #语音识别 4.1/10 | 创新 0.8/2 | 严谨 0.6/1.5 | 实验 0.4/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0.8/1.5 📝 4.1/10 | 后50% | #声源定位 | #空间音频 | #语音增强 #语音识别 | arxiv 👥 作者与机构 第一作者:Pengyuan Shao(University College London, Department of Computer Science) 通讯作者:未明确说明,根据作者顺序推断为 Dimitrios Kanoulas(University College London, Department of Computer Science) 作者列表:Pengyuan Shao(University College London, Department of Computer Science)、Dimitrios Kanoulas(University College London, Department of Computer Science) 💡 毒舌点评 这篇综述选题有现实意义,试图将空间语音感知系统的三大组件进行统一综述,但在顶会级别看来,其贡献仅停留在文献整理和概念归纳层面。全文没有任何定量元分析、方法对比实验或新基准/工具,不发布数据集也不开源代码。所谓的"系统级评价"、“语义可靠性"等概念始终停留在愿景,缺乏可操作的量化定义或评测方案。对于希望直接拿来评估或改进自己系统的研究者而言,这篇综述提供不了太多硬核见解。 ...

2026-07-03 · 更新于 2026-08-14 · 4 min · 737 words

Evaluation of Head-Related Transfer Functions Across Five Levels of Individualisation in Virtual Reality

📄 Evaluation of Head-Related Transfer Functions Across Five Levels of Individualisation in Virtual Reality #空间音频 7.6/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.5/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ✅ 7.6/10 | 前25% | #空间音频 | #空间音频 | arxiv 👥 作者与机构 作者:Ludovic Pirard, Katarina C. Poole 机构:Imperial College London 📌 核心摘要 本研究旨在系统评估五种不同个性化程度的头相关传递函数在虚拟现实(VR)声音定位任务中的行为表现。研究合并了两个使用相同声学测量HRTF基线和短时VR定位协议的实验数据,对19名参与者进行了五种条件的测试内比较:个体测量、KEMAR、随机非个体测量、高分辨率扫描合成和光度测量重建合成HRTF。结果表明,横向定位指标对HRTF类型不敏感,而极坐标(仰角)相关指标和混淆率则强烈依赖于HRTF条件。关键发现包括:随机非个体HRTF在多个极坐标指标上显著优于固定的KEMAR基线;高分辨率合成HRTF的性能与个体测量HRTF无显著差异;而光度测量合成HRTF与KEMAR一样,表现出最显著的性能下降。研究验证了VR定位协议的测试-重测信度,并强调了在使用数值合成进行仰角相关任务时网格分辨率的重要性。 🔗 开源详情 代码:论文中提及了用于数值计算HRTF的开源工具Mesh2HRTF [11],以及用于实时双耳空间化的开源库3D Tune-In (3DTI) Toolkit [28]。但论文未提供这些工具的具体代码仓库(如GitHub)链接,也未提供本研究特定的分析代码(如数据处理、统计分析脚本)。 模型权重:论文中未提及。 数据集:论文中提及了两个公开数据集:1. SONICOM数据集 [7];2. Extended SONICOM数据集 [12]。论文未提供这些数据集的直接下载链接,但明确指出它们是公开可用的学术数据集。实验生成的原始行为数据本身未说明是否公开。 Demo:论文中未提及。 复现材料:论文详细描述了实验方法、设备设置(如Meta Quest 2/3 VR耳机、Sennheiser HD 599SE耳机、Unity应用)和协议。但未提供可直接下载的训练配置、检查点、实验代码或行为数据等复现材料链接。 论文中引用的开源项目: Mesh2HRTF [11]:用于从3D网格数值计算HRTF的开源软件包。 3D Tune-In (3DTI) Toolkit [28]:用于实时双耳空间化的开源库。 (注:论文引用了这些项目,但未在论文中提供其具体的项目主页或代码仓库URL。) 🏗️ 方法概述和架构 本研究方法是一个行为实验评估框架,而非计算模型。其核心是通过一个统一的VR定位实验,对五种HRTF条件进行直接的被试内比较。整体架构可分为三个主要部分:HRTF条件准备、VR定位实验流程、行为数据分析。 ...

2026-06-30 · 更新于 2026-08-14 · 2 min · 298 words

Perceptual Evaluation of Higher-Order Ambisonic Codecs on Both Synthetic Mixing and Native Recordings

📄 Perceptual Evaluation of Higher-Order Ambisonic Codecs on Both Synthetic Mixing and Native Recordings #音频编码 #空间音频 #信号处理基础 8/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.1/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 8/10 | 前50% | #音频编码 | #空间音频 | #信号处理基础 | arxiv 👥 作者与机构 作者:Adrien Llave, Grégory Pallone, Jérôme Daniel 单位:Orange Research, 法国 💡 毒舌点评 这篇论文的“顶会”野心有点撑不住其“工作汇报”的内核。它本质上是对一个已标准化的工业编解码器(IVAS)在特定场景(HOA)下的性能评测报告,而非提出一种新方法或揭示全新原理。其核心价值在于“系统性测试”和“工程观察”,对于推动HOA编解码器实际应用有参考价值,但在理论或方法论创新上乏善可陈。作者试图通过四个假设的验证来构建故事线,但这更像是对已知现象的确认性实验,而非探索性研究。最大的遗憾是,方法部分(Section V)对SPAR和DirAC如何协同工作、特别是“去相关滤波器”的具体实现和局限性缺乏技术细节,使得后续的性能分析和归因显得根基不稳。 📌 核心摘要 本文系统评估了3GPP新近标准化的IVAS编解码器在场景音频(SBA)模式下,对采用不同空间化方法生成的三阶Ambisonics(HOA)内容的感知编码性能。研究通过两个主观MUSHRA实验,将IVAS与一种简单但常用的多单声道基线方法(EVSx16)进行比较。实验覆盖了13种多样化的音频内容,包括由理想平面波编码、空间房间脉冲响应卷积及球形麦克风阵列原生录制三种方式生成。主要发现是:在相似比特率(~256 kbps)下,IVAS整体性能优于EVSx16。IVAS的性能高度依赖于内容的空间特性,尤其擅长处理通道间相关性强的信号(如平面波合成内容),在低比特率下表现依然稳健;但其性能在包含空间扩散混响的自然录音上显著下降。相反,EVSx16在混响内容上的表现相对更好。研究证实了IVAS偏好无扩散混响的内容,且该偏好随比特率降低而增强;而EVSx16偏好扩散内容,且该偏好与比特率无关。 ...

2026-06-24 · 更新于 2026-08-14 · 2 min · 281 words

Generalised Transcoding Framework for Arbitrary Spatial Audio Capture and Playback Formats

📄 Generalised Transcoding Framework for Arbitrary Spatial Audio Capture and Playback Formats #空间音频 8.7/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.4/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.7/10 | 前50% | #空间音频 | #空间音频 | arxiv 👥 作者与机构 作者:Archontis Politis, Janani Fernandez, Leo McCormack 单位:坦佩雷大学(Faculty of Information Technology and Communication Sciences),阿尔托大学(Department of Information and Communications Engineering) 💡 毒舌点评 一篇扎实的“螺丝钉”式推进论文。其核心价值在于将空间音频处理中长期割裂的Ambisonics处理流和原始麦克风阵列处理流统一到一个框架下,并在参数估计上引入了更灵活的环境声场模型。然而,其创新更多是工程上的集大成与优化,而非颠覆性的新思路。实验设计虽全面,但全部基于模拟场景,缺乏真实世界复杂动态录音的验证,这使得结论的普适性打了折扣。论文最大的短板在于对计算复杂度和实时实现的代价语焉不详,仅提了句“有实时插件”,这对于一个标榜“通用框架”的工作是不够的。作者声称“鲁棒”,但鲁棒性的分析主要停留在模型参数正确或过估计的模拟测试,对于欠估计和参数估计错误连锁反应的讨论不足。总的来说,这是一篇优秀的领域内改进工作,但距离成为里程碑式的基础框架还差一口气。 ...

2026-06-18 · 更新于 2026-08-14 · 2 min · 240 words

Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

📄 Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources #空间音频 #音频问答 #数据集 6.9/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 0.6/1.5 | 清晰 1/1 | 影响 1.4/1.5 | 开源 0.1/1.5 | 复现 0.4/0.5 | 工程 0.5/1.5 ✅ 6.9/10 | 前25% | #音频问答 | #空间音频 | #数据集 | arxiv 👥 作者与机构 作者:Oh Hyun-Bin (POSTECH), Kazuki Shimada (Sony AI), Yuhta Takida (Sony AI), Kim Sung-Bin (POSTECH), Toshimitsu Uesaka (Sony AI), Takashi Shibuya (Sony AI), Kyeongyoon Lee (Sungkyunkwan University), Tae-Hyun Oh (KAIST), Yuki Mitsufuji (Sony AI, Sony Group Corporation) 机构:POSTECH, Sony AI, Sony Group Corporation, Sungkyunkwan University, KAIST ...

2026-06-15 · 更新于 2026-08-14 · 3 min · 514 words

Sensitivity Analysis of Generative Spatial Audio Metrics: A Study on Responsiveness, Smoothness, and Symmetry

📄 Sensitivity Analysis of Generative Spatial Audio Metrics: A Study on Responsiveness, Smoothness, and Symmetry #空间音频 #音频生成 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 7.2/10 | 前50% | #音频生成 | #空间音频 | arxiv 👥 作者与机构 Purnima Kamath (New York University, New York, USA) Adrian S Roman (New York University, New York, USA) Koichi Saito (Sony AI, New York, USA; Sony Group Corporation, Tokyo, Japan) Yuki Mitsufuji (Sony AI, New York, USA; Sony Group Corporation, Tokyo, Japan) Juan P Bello (New York University, New York, USA) ...

2026-06-11 · 更新于 2026-08-14 · 2 min · 335 words

Flow-HOA: Generative Joint Optimization for Ambisonics Encoding via Flow Matching

📄 Flow-HOA: Generative Joint Optimization for Ambisonics Encoding via Flow Matching #空间音频 #生成模型 7.9/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.3/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.9/10 | 前25% | #空间音频 | #生成模型 | arxiv 👥 作者与机构 未在提供的原文片段中明确列出作者和机构信息。 💡 毒舌点评 本文试图用时髦的生成模型(Flow Matching)来解决一个经典的信号处理问题——从稀疏阵列编码HOA。想法是好的,但需要更清醒地认识到问题的本质。将HOA滤波器设计重新表述为生成任务确实提供了新的视角,尤其是在处理非凸、多目标优化时。然而,论文在声称“超越传统方法”时,实验对比的基线(仅ASM)显得过于单薄和陈旧,缺乏与当前最新的数据驱动或混合方法的公平较量,这大大削弱了其结论的普遍说服力。此外,论文花了不少篇幅讨论主观测试中“空间定位”得分无显著差异的IHL现象,并将其归因于非个性化HRTF的渲染链限制。这种解释虽然合理,但更像是在为自家方法在核心空间任务上的“未显著超越”寻找借口,而非坦诚面对可能的方法局限(例如,模型是否真正学习到了更精确的空间特征,还是仅仅优化了信号保真度?)。总体而言,这是一篇扎实的应用型工作,展示了生成模型在信号处理领域的潜力,但在验证其普适性和优越性方面仍需更严厉的自我审视。 📌 核心摘要 本文提出了Flow-HOA,一个用于从稀疏、不规则麦克风阵列生成高阶Ambisonics编码滤波器的生成式联合优化框架。该方法的核心是利用条件流匹配(Conditional Flow Matching)技术,将一个基于物理的初始滤波器(通过约束最小二乘获得)作为先验,通过学习一个向量场将其迭代优化为满足多域保真度目标的最终FIR滤波器。联合优化目标由时域波形误差、多分辨率频谱一致性、子带能量保持和空间指向性四个损失函数加权构成。在合成数据上的客观评估表明,Flow-HOA在信号保真度和空间精度指标上优于基于模型的基线(ASM)。在真实麦克风阵列录音上进行的主观试听测试进一步证实,Flow-HOA能提供更高的整体音质且伪影更少,并展示了从合成训练数据到真实世界采集条件的泛化能力。 🔗 开源详情 代码:论文中在“Conclusion”部分提及代码将开源(“Code will be made publicly available upon publication.”),但未提供具体的仓库链接(如GitHub、GitLab等)。在分析时点视为承诺开源但未发布。 模型权重:论文中未提及提供预训练模型权重的链接。 数据集:论文中明确使用FSD50K作为训练数据源,网址:https://zenodo.org/record/4060432。此外,用于主观测试的Neumann KU 100 HRTF数据集在文献[24]中引用,但未提供直接链接。 Demo:论文中未提及在线演示链接。 复现材料:论文详细描述了模型架构(1D U-Net)、训练配置(优化器AdamW,学习率1e-5,批量大小256)和损失函数权重(Table 1)。然而,未提供具体的复现脚本、测量好的阵列脉冲响应数据或预训练模型。复现的硬件(特定的SPMA原型)和物理测量环境(消声室)是重要的非公开材料。 论文中引用的开源项目: PyTorch:用于模型实现。 webMUSHRA:用于主观听力测试,网址:https://github.com/Spension/webMUSHRA。 🏗️ 方法概述和架构 Flow-HOA框架将高阶Ambisonics编码滤波器的设计重新定义为一个生成式联合优化问题,其目标是从一个基于物理的先验分布中学习,生成满足多维度保真度约束的最优有限脉冲响应(FIR)滤波器。整个框架分为三个核心阶段,具体架构与数据流如下: ...

2026-06-04 · 更新于 2026-08-14 · 2 min · 255 words

SHB-AE: Spherical harmonic beamforming based Ambisonics encoding and upscaling method for smartphone microphone array

📄 SHB-AE: Spherical harmonic beamforming based Ambisonics encoding and upscaling method for smartphone microphone array #鲁棒性 #空间音频 6.7/10 | 创新 1.4/2 | 严谨 0.9/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 6.7/10 | 前50% | #音频编码 | #鲁棒性 | #空间音频 | arxiv 👥 作者与机构 论文标题:SHB-AE: Spherical harmonic beamforming based Ambisonics encoding and upscaling method for smartphone microphone array 会议:Accepted for presentation at AES Europe 2025 Convention (AES 158th Convention), Warsaw, Poland, May 22-24, 2025. 机构/支持:本工作得到国家重点研发计划(No.2024YFB2808902)和北京大学高性能计算平台的支持。(注:论文未明确列出作者个人所属机构,仅列出致谢信息)。 ...

2026-06-04 · 更新于 2026-08-14 · 2 min · 305 words