Broadband Acoustic Intensity Direction Estimation with Tight-Frame Cardioid Arrays

📄 把方向藏进声强里:二十四个心形话筒如何撑住低频到高频 英文题目:Broadband Acoustic Intensity Direction Estimation with Tight-Frame Cardioid Arrays 一句话:论文用消声室实测脉冲响应验证对置心形对做和差声强加紧框架平均的宽带测向链路,最强证据是多方向短间距组合在中弱干扰下全频段保持小角度跟踪误差,代价是单话筒顺序合成与相干叠加基准尚未检验真实多通道失配与混响。 标签:#声源定位 | #端到端 | #空间音频 | #多通道 | #鲁棒性 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Akira Omoto:Faculty of Design, Kyushu University, Fukuoka 815-8540, Japan 💬 毒舌点评 用对置心形话筒和差测声强、再靠紧框架平均扛到 20 kHz 的思路扎实,对做声强探头的人有直接参考价值。但全篇是单话筒转 26 个位置拼出来的阵列,多通道幅相失配与同步这个真痛点完全没碰,所谓多干扰也只是把实测脉冲响应转角度再相干叠加,并不是真实反射声场,2.5 度这种数字的外推力要打折扣。 📌 核心摘要 宽带声强测向长期受限于压差式探头有限差分近似的高频上限,本文用实测脉冲响应验证基于心形指向性的心形-心形配对(cardioid-cardioid,C-C)方法能否实现 50 Hz 到 20 kHz 的稳定指向。核心机制是对每个对置心形对做和差以估计声压与质点振速分量,再经希尔伯特变换构造解析信号并时域积分求径向有功声强,最后按紧框架(tight frame)方向向量加权求和重构三维正交强度并估计方位与俯仰。实验在消声室用单只 DPA 2012 心形话筒配合全景云台顺序测量 26 通道脉冲响应,声源为 2.5 m 前方 Genelec 8331,48 kHz 采样、5.5 s 扫频激励,由同一批数据合成 6 话筒正交阵 TF6 与 24 话筒多方位阵 TF24,对比对置间距 \(d=20\) mm 与 \(100\) mm。主结果是 TF24 加 \(d=20\) mm 在总干扰信号能量比 \(L_{J/S}=-20\) dB 与 \(-30\) dB 时全频段中值跟踪误差保持在 2.5 度以内,在 \(L_{J/S}=-10\) dB 时 5 kHz 以下在 5 度以内、高频约 7.5 度。该工作给出了可直接参考的阵形与处理链条,主要局限是顺序单话筒合成未评估多话筒个体差异与同步误差,且多波到达为旋转重标定加相干叠加的标准化基准而非真实反射复现。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 821 words

The Attention Triangle in Audio-Video Models

📄 谁在替鹦鹉说话:当音频偷偷改写了画面 英文题目:The Attention Triangle in Audio-Video Models 一句话:针对文本到音视频联合生成中声音被绑到错误实体的问题,该工作把文本、音频、视频的三边交叉注意力看作可干预的路由三角,用无训练的两遍偏置转向同时约束直接绑定与经音频中转的间接耦合,在 100 个挑战提示上把声源归属从 0.1216 提升到 0.1349,代价是约数倍推理开销与对外部份割的依赖。 标签:#音视频生成 | #扩散模型 | #声源定位 | #可解释性 评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Sagi Polaczek:Tel Aviv University, Tel Aviv, Israel Noa Kraicer:Tel Aviv University, Tel Aviv, Israel Gal Metzer:Tel Aviv University, Tel Aviv, Israel Zhuo Ning:Simon Fraser University, Burnaby, Canada Ali Mahdavi-Amiri:Simon Fraser University, Burnaby, Canada Daniel Cohen-Or:Tel Aviv University, Tel Aviv, Israel Raja Giryes:Tel Aviv University, Tel Aviv, Israel 💬 毒舌点评 把文本音频视频三边泄漏统一为注意力三角并用双向路由可视化把玄学先验变成可干预通路,视角干净且干预无需训练。短板是全套转向依赖基线解码加 SAM3 外部分割与人工标注短语,成本约 2.5 倍且分割或音频显著性失效便无从纠偏,评估又建在人工筛选变异的失败富集提示集上,外推性存疑。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 809 words

语音/音乐/音频论文速递 2026-09-04

语音/音乐/音频论文速递 2026-09-04 共分析 30 篇论文 ⚡ 今日概览 ✅ 筛选入选 30 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音增强 5 篇 █████ #语音合成 3 篇 ███ #语音交互 2 篇 ██ #语音质量评估 2 篇 ██ #声源定位 1 篇 █ #语音情感识别 1 篇 █ #语音编码 1 篇 █ 📊 论文评分排行榜(30 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ToolDF: Tool-Integrated Reasoning for Mixed… 8.4 前25% 方法研究 #音频伪造检测 🥈 Geometric Ceilings on Time-Frequency Masking for… 7.9 前25% 理论研究 #音乐源分离 🥉 CRAW: Codec Robust Audio Watermarking 7.7 前25% 方法研究 #音频水印 4. The 2026 PNPL Competition: Word Classification and… 7.5 前25% 数据集与基准 #语音识别 5. Test-time adaptation for speech enhancement with an… 7.5 前25% 方法研究 #语音增强 6. Alignment-Free Text-Audiobox for Voice Dubbing and… 7.5 前25% 系统技术报告 #语音合成 7. Listen to the Latents: Self-Correcting Speech… 7.2 前50% 方法研究 #语音识别 8. StreamWSR: Streamable and Lightweight Waveform-Domain… 7.2 前50% 方法研究 #语音增强 9. DuplexSpeechBench-IFEval: Evaluating Implicit… 7.2 前50% 数据集与基准 #语音交互 10. Building and Evaluating Fixed-Voice Thai TTS from… 7.2 前50% 系统技术报告 #语音合成 11. PACodec: A Low-bitrate Neural Speech Codec with… 7.1 前50% 方法研究 #语音编码 12. Decoupling Turn-Taking from Semantics: A Decoupled… 7.0 前50% 方法研究 #语音交互 13. Summary of the ChinaVoices Challenge 2026: Data, Tasks… 6.9 前50% 数据集与基准 #语音识别 14. The Attention Triangle in Audio-Video Models 6.9 前50% 方法研究 #音视频生成 15. Compressing Streaming Neural Audio Encoders via Latent… 6.9 前50% 方法研究 #语音识别 16. Dual-Form ASR: Semantics-Aware Inverse Text… 6.8 前50% 方法研究 #语音识别 17. Deep Neural Compression for RIR-Characterized Acoustic… 6.6 前50% 方法研究 #音频编码 18. SISER: Speaker-Invariant Speech Emotion Recognition… 6.5 前50% 方法研究 #语音情感识别 19. Masked Autoregressive Speech Enhancement with… 6.4 前50% 方法研究 #语音增强 20. Last Translation Benchmark 6.4 前50% 数据集与基准 #语音翻译 21. Neural Music Enhancement with Dual Time-Frequency… 6.2 前50% 方法研究 #语音增强 22. CAPQ-FAST: Content-Adaptive Perceived Quality… 6.2 前50% 应用研究 #音频质量评估 23. Beyond .WAV: Design and Software Verification of… 6.1 前50% 系统技术报告 #语音质量评估 24. Broadband Acoustic Intensity Direction Estimation with… 6.1 前50% 方法研究 #声源定位 25. Local Chord Corruption Is Not Recognizer Replay: Chord… 6.1 前50% 方法研究 #音乐生成 26. VoxReason: Listener-Free Evaluation of Source-Grounded… 5.9 前50% 数据集与基准 #语音合成 27. Is Semantics Enough for Speech Mean Opinion Score… 5.9 前50% 方法研究 #语音质量评估 28. Fairness Evaluation of Edge-AI Implementation for… 5.6 前50% 应用研究 #语音识别 29. StrixAE: An Intelligent Agent for Audio Enhancement… 5.5 前50% 系统技术报告 #语音增强 30. Opening mind by opening architecture: analysis… 4.5 后 50% 系统技术报告 #音频生成 📋 论文列表 🥇 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection ...

2026-09-04 · 更新于 2026-09-04 · 26 min · 5367 words

ARFT: A Synchronized Multimodal RF-Acoustic Dataset for Positioning in Distributed Environments

📄 同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上 英文题目:ARFT: A Synchronized Multimodal RF-Acoustic Dataset for Positioning in Distributed Environments 一句话:ARFT 针对室内分布式定位缺乏同步多模态真值数据的难题,用共架漫游车与逐周期编排把 91 路超声波形和 42 阵元射频快照绑定到同一位姿,并以 0.110 m 二维声学基线证明数据可用,代价是单房间静态采集且射频定位仍缺定量验证。 标签:#声源定位 | #端到端 | #数据集 | #基准测试 评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Daan Delabie:机构信息未在 arXiv HTML 中可靠披露 Jarne Van Mulders:机构信息未在 arXiv HTML 中可靠披露 Bert Pyck:机构信息未在 arXiv HTML 中可靠披露 Gustav Nilsson Gisleskog:机构信息未在 arXiv HTML 中可靠披露 Gilles Callebaut:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 三模态逐周期绑定加42阵元近满快照确实补上了室内分布式定位缺失的同步融合底座,声学最小二乘基线也让数据开箱可验。遗憾是射频端仍停留在指纹可视化而无定位精度,动态跟踪与跨房间泛化缺席让联合定位愿景只兑现了一半。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 908 words

语音/音乐/音频论文速递 2026-09-03

语音/音乐/音频论文速递 2026-09-03 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音合成 2 篇 ██ #音频分类 2 篇 ██ #声源定位 1 篇 █ #语音增强 1 篇 █ #语音情感识别 1 篇 █ #音乐生成 1 篇 █ #音视频理解 1 篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVERT: Audio-Verified Adjudication for Spoken Dialogue… 7.6 前25% 方法研究 #语音识别 🥈 Hearing the Whispers: Black-Box Membership Inference… 7.5 前25% 方法研究 #语音合成 🥉 The Missing Temporal Link: Temporal Context Routing… 7.5 前25% 方法研究 #音视频生成 4. VibeVoice-ASR-Streaming Technical Report 7.5 前25% 系统技术报告 #语音识别 5. A Common Measure of Communication for Speech Brain… 7.4 前50% 方法研究 #语音识别 6. SonicCaps: Large-Scale Diverse and Fine-Grained… 7.2 前50% 数据集与基准 #音频检索 7. Understanding Automatic Mixing: A Subtask-Oriented… 7.0 前50% 应用研究 #音乐生成 8. Scalable Direction-Following TTS via Voice Impression… 6.8 前50% 方法研究 #语音合成 9. Efficient Passive Acoustic Monitoring of Killer Whales… 6.7 前50% 应用研究 #音频分类 10. Auditory Illusion Benchmark for Large Audio Language… 6.4 前50% 数据集与基准 #音频理解 11. ARFT: A Synchronized Multimodal RF-Acoustic Dataset… 6.4 前50% 数据集与基准 #声源定位 12. Sensing Bone-Conducted Speech with Earbuds 6.3 前50% 应用研究 #语音增强 13. PhoenixNest-Video: Evidence-Grounded Multimodal Agent… 6.3 前50% 方法研究 #音视频理解 14. SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper… 6.1 前50% 应用研究 #语音识别 15. Removing Speech, Keeping Activities: A Privacy… 5.9 前50% 应用研究 #音频分类 16. Choosing a PEFT Variant for Per-Patient Dysarthric ASR… 5.9 前50% 应用研究 #语音识别 17. VAANI Noise Event Dataset: A curated spontaneous… 5.8 前50% 数据集与基准 #语音识别 18. Predictors of Loneliness in Older Adults Using… 4.9 后 50% 应用研究 #语音情感识别 📋 论文列表 🥇 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking ...

2026-09-03 · 更新于 2026-09-04 · 15 min · 3026 words

Leveraging Bayesian Optimization for Array Shape Self-Calibration in Underwater DoA Estimation

📄 把 2M 维坐标压到一条曲线上:BOGE 如何用物理先验与贝叶斯优化校准水下柔性阵 英文题目:Leveraging Bayesian Optimization for Array Shape Self-Calibration in Underwater DoA Estimation 一句话:针对水下柔性阵未知形变导致波达方向失配的问题,BOGE 用正弦加弧的物理参数化将逐元优化压缩为可行流形上的一维贝叶斯优化与 B 样条残差精修,并以重叠子阵拼接支撑长阵,在仿真与 SWellEx-96 上取得更低几何误差,代价是依赖三个已知参考元与单源窄带假设。 标签:#声源定位 #空间音频 #鲁棒性 #多通道 评分:5.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Xin Gui:Hubei Longzhong Laboratory, Wuhan University of Technology Xiangyang Demonstration Zone, Xiangyang 441000, China, National Engineering Research Center of Fiber Optic Sensing Technology and Networks, Wuhan University of Technology, Wuhan 430070, China Tianang Li:the School of Information Engineering, Wuhan University of Technology, Wuhan 430070, China Changjia Wang:the School of Information Engineering, Wuhan University of Technology, Wuhan 430070, China Bowen Han:the School of Information Engineering, Wuhan University of Technology, Wuhan 430070, China Yunchuan Zhang:the School of Information Engineering, Wuhan University of Technology, Wuhan 430070, China Zhengying Li:the School of Information Engineering, Wuhan University of Technology, Wuhan 430070, China;National Engineering Research Center of Fiber Optic Sensing Technology and Networks, and State Key Laboratory of Advanced Technology for Materials Synthesis and Processing, Wuhan University of Technology, Wuhan, 430070, China 💬 毒舌点评 亮点在于把 \(2M\) 维逐元坐标优化压缩为 4 参数物理曲线上的 1 维可行流形贝叶斯优化加 B 样条残差约束精修,并用 30% 重叠子阵 Kabsch 拼接支撑 238 元长阵,在 SWellEx-96 上做到 0.659 m 几何误差;短板是全程依赖首、中、尾 3 个已知非共线参考元和单源远场窄带假设,且 4 个基线均为作者复现、实测阶段直接剔除 ASMLM 与 WORKS,湖试又无真值几何,所谓稳定跟踪只能靠谱峰宽度间接佐证。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1800 words

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

📄 EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models 标签:#声源定位 #RNN #测试时自适应 #高效推理 #鲁棒性 8.8/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #声源定位 | #RNN | #测试时自适应 #高效推理 | arxiv 👥 作者与机构 第一作者:Ori Cohen(School of ECE, Ben-Gurion University of the Negev, Israel) 通讯作者:正文未明确标注通讯作者 作者列表:Ori Cohen、Nir Shlezinger、Tirza Routtenberg(机构:School of ECE, Ben-Gurion University of the Negev, Israel) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 790 words

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

📄 Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes 标签:#空间音频 #音视频生成 #声源定位 #多通道 #CNN 6.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.7/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #CNN | #音视频生成 #声源定位 | arxiv 👥 作者与机构 第一作者:Qingyu Luo(Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) 通讯作者:论文未单独标注通讯作者;作者邮箱均为 University of Surrey 域名 作者列表:Qingyu Luo、Peng Zhang、Wenwu Wang、Philip J. B. Jackson(机构:Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, U.K.) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 850 words

A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels

📄 A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels 标签:#声源定位 #生成模型 #理论分析 #高效推理 9.8/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.8/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #生成模型 | #理论分析 #高效推理 | arxiv 👥 作者与机构 第一作者:Ashwani Koul(Linköping University, Linköping, Sweden) 通讯作者:正文未明确标注 作者列表:Ashwani Koul、Gustaf Hendeby、Isaac Skog(机构:Linköping University;KTH;FOI-Swedish Defence Research Agency, Sweden) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 400 words

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

📄 Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails 标签:#音频事件检测 #多模态模型 #声源定位 #理论分析 #实时处理 6.6/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #多模态模型 | #声源定位 #理论分析 | arxiv 👥 作者与机构 第一作者:Cong Xu(University of South Florida, Department of Electrical Engineering, iCONS Laboratory) 通讯作者:未说明 作者列表:Cong Xu(University of South Florida, Department of Electrical Engineering, iCONS Laboratory)、Ravi Sankar(University of South Florida, Department of Electrical Engineering, iCONS Laboratory) 💡 毒舌点评 亮点是真正把“缺少预期视觉共证据”当成一种可标定的证据来推理隐蔽交通参与者,并把输出限定为校准化的风险参考变量,这在盲区碰撞预警里比只做声学检测更接近可用系统。短板也很直观:核心贡献无法复现,没有代码或模型;此外,签名分类器跨路口泛化明显不足,移动 ego 场景基本失效,说明离实际部署仍有一段距离。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 673 words