语音/音乐/音频论文速递 2026-08-18

语音/音乐/音频论文速递 2026-08-18 共分析 39 篇论文 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 3篇 ███ #语音增强 3篇 ███ #语音识别 3篇 ███ #音频分类 3篇 ███ #音频理解 3篇 ███ #声源定位 2篇 ██ #语音编码 2篇 ██ #音视频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retri 7.9分 前25% 数据集与基准 #音频检索 🥈 What Makes a Good Layer? Assessing the Layer-Wise Intri 7.7分 前25% 方法研究 #音乐理解 🥉 How Fragile Is Your Watermark? Training-Free Structural 7.6分 前25% 方法研究 #音频水印 4. Numerical and perceptual validity of synthetic Head-Rel 7.6分 前25% 应用研究 #声源定位 5. ACE-Cap: Active Evidence Acquisition via Agentic Co-Evo 7.5分 前25% 方法研究 #音频字幕生成 6. CineDub: Scaling End-to-End Video Dubbing to Multi-Spea 7.3分 前50% 方法研究 #音视频语音合成 7. Prototype-Rectified Iterative Self-supervised Manifold 7.2分 前50% 方法研究 #音频分类 8. CLARA: Clip-Level Multimodal Alignment with VLM-Derived 7.2分 前50% 方法研究 #音视频理解 9. Impulse Response Estimation via Laguerre-Fourier Expans 6.8分 前50% 方法研究 #音频理解 10. SingDance: Compositional Zero-Shot Singing-and-Dancing 6.8分 前50% 方法研究 #音视频生成 11. Listen, Reason, and Segment: Aligning LALMs with Editor 6.8分 前50% 方法研究 #音频理解 12. AnyTalk: Speech Animation for Arbitrary Characters Leve 6.7分 前50% 方法研究 #音视频语音合成 13. Evidence of Absence: Cross-Modal Abductive Risk Percept 6.6分 前50% 方法研究 #音频事件检测 14. ParaJSCC: A Parameterized Framework for Reusable Multim 6.6分 前50% 方法研究 #音频编码 15. ARENA: Automated Red-Teaming for Large Audio Language M 6.5分 前50% 方法研究 #音频理解 16. The Null Token Knows: Reducing Message-Free Hallucinati 6.5分 前50% 方法研究 #语音识别 17. Moving Horizon Estimation for Underwater Target Trackin 6.5分 前50% 方法研究 #声源定位 18. Multi-Granularity Sentiment Integration for LLM-Based M 6.5分 前50% 方法研究 #音视频理解 19. Adding Voice Cloning to Text-to-Audio-Video Models with 6.4分 前50% 方法研究 #语音克隆 20. Xemo-Talker: Unlock Emotions Explicitly for Audio-Drive 6.2分 前50% 方法研究 #音视频生成 21. Separate First, Then Associate: A Two-Stage Approach fo 6.2分 前50% 系统技术报告 #音视频语音分离 22. Geometry-adaptive Ambisonic encoding for sparse microph 6.2分 前50% 方法研究 #空间音频 23. A survey of AI-generated voices and their detection 6.1分 前50% 综述 #语音伪造检测 24. Iterative Self-Learning for Expressive Text-to-Speech S 6.1分 前50% 方法研究 #语音合成 25. Cached LLM Probability Retrieval for Speech Recognition 6.1分 前50% 方法研究 #语音识别 26. DuplexGen: Decoupling Content, Timing, and Acoustics fo 6.1分 前50% 方法研究 #语音合成 27. Speaker-Normalized Semantic Speech Tokens via Iterative 6.0分 前50% 方法研究 #语音编码 28. Multi-Modal Generative Fuzzy System: Fuzzy Inference Gu 5.9分 前50% 方法研究 #音视频问答 29. A Parameter-Free Few-Shot Evaluation for Elephant Vocal 5.9分 前50% 应用研究 #音频分类 30. Contrastive Learning with Variational Regularization fo 5.9分 前50% 方法研究 #语音合成 31. Sonifying I2S Transport Signals to Detect Transmission 5.9分 前50% 系统技术报告 #音频分类 32. An Analytical-Prior Framework for Data-Efficient Predic 5.8分 前50% 方法研究 #预训练 33. Navigating Speech Enhancement for Real-Time MRI: A Syst 5.7分 前50% 应用研究 #语音增强 34. Distinguishing AI-Generated Music from Edited Audio as 5.6分 前50% 方法研究 #音频伪造检测 35. A Novel Binaural Cue Preservation Loss for DNN-Based Bi 5.6分 前50% 方法研究 #语音增强 36. Unadapted Multilingual ASR on a Garrusi Kurdish Evaluat 5.6分 前50% 方法研究 #语音识别 37. Feedforward Active Speech Suppression Based on Time Ser 5.5分 前50% 方法研究 #语音增强 38. Using the Mimi codec for metalinguistic representations 4.7分 后50% 方法研究 #语音编码 39. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Ran 3.5分 后50% 系统技术报告 #音频编码 📋 论文列表 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-18 · 更新于 2026-09-04 · 40 min · 8515 words

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

📄 CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation 标签:#音频分类 #自监督学习 #多模态模型 #Transformer #医疗音频 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频分类 | #自监督学习 | #多模态模型 #Transformer | arxiv 👥 作者与机构 第一作者:Hamza Shafiq(机构未明确;文中“Affiliation: Jun Hu”标注异常) 通讯作者:Aaqib Saeed(Eindhoven University of Technology, Netherlands;a.saeed@tue.nl) 作者列表:Hamza Shafiq(机构未明确)、Hung Manh Pham(Singapore Management University, Singapore)、Bin Zhu(Singapore Management University, Singapore)、Pan Zhou(Singapore Management University, Singapore)、Aaqib Saeed(Eindhoven University of Technology, Netherlands) 💡 毒舌点评 本文把 ECG、PPG、PCG 之间的生理学延迟建模为可学习的一等公民部件,延迟感知 latent prediction 加上两阶段课程在多个下游任务中确实带来显著提升,尤其对过去较弱的心音 PCG 任务贡献清楚。跨模态对齐不是简单拼接,而是通过可微高斯核和生理 anchor 监督把延迟估计嵌入训练目标,这比 naive timestamp alignment 有实质进步。但论文在无代码、无权重、部分关键训练细节未交代的前提下,仍把“统一心脏基础模型”的叙述推得较满,复现性和工业可信度明显打折;PCG 基线选择和统计显著性也仍有可诟病之处。 ...

2026-08-14 · 更新于 2026-09-04 · 6 min · 1241 words

语音/音乐/音频论文速递 2026-08-14

语音/音乐/音频论文速递 2026-08-14 共分析 12 篇论文 ⚡ 今日概览 ✅ 筛选入选 12 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #多模态模型 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ #语音属性识别 1篇 █ #语音质量评估 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(12 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward… 8.2分 前25% 方法研究 #音频生成 🥈 CASA: Content-Acoustic Speaking Assessment with Speech… 7.9分 前25% 方法研究 #语音质量评估 🥉 Comparative Analysis of Multilingual Pre-trained… 7.6分 前25% 数据集与基准 #语音识别 4. OmniScientist: An Omni-Modal Omni-Discipline AI… 7.6分 前25% 系统技术报告 #多模态模型 5. Alignment Drift in Single-Model Speculative Decoding… 7.3分 前50% 方法研究 #语音识别 6. EgoCITE: Context-Augmented Indexing and Time-Aware… 7.2分 前50% 系统技术报告 #音视频问答 7. CardioState-JEPA: Delay-Aware Cross-Modal Learning of… 7.2分 前50% 方法研究 #音频分类 8. FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme… 7.0分 前50% 系统技术报告 #语音合成 9. Motor, Cognitive, or Corpus? What Survives Cross… 6.1分 前50% 应用研究 #语音属性识别 10. Evaluating Pre-trained Speech Encoders for Spontaneous… 6.0分 前50% 方法研究 #语音伪造检测 11. HybridSB-MoE: Dual-Domain Schrödinger Bridges with… 5.9分 前50% 方法研究 #语音增强 12. Drive-to-Music: Context-Aware Generative Audio for In… 5.2分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ...

2026-08-14 · 更新于 2026-09-04 · 12 min · 2527 words

Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning

📄 Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning 标签:#音频事件检测 #参数高效微调 #说话人日志 #自监督学习 #Transformer 6.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #LoRA | #参数高效微调 #说话人日志 | arxiv 👥 作者与机构 Xulin Fan:University of Illinois Urbana-Champaign, USA Jialu Li:University of Arizona, USA Mohammad Nur Hossain Khan:Worcester Polytechnic Institute, USA Kexin Hu:University of Illinois Urbana-Champaign, USA Bashima Islam:Worcester Polytechnic Institute, USA Mark Hasegawa-Johnson:University of Illinois Urbana-Champaign, USA Nancy L. McElwain:University of Illinois Urbana-Champaign, USA 通讯作者:论文未明确标注通讯作者;作者邮箱在论文中列出,但未说明通讯作者身份。 ...

2026-08-13 · 更新于 2026-09-04 · 4 min · 766 words

语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-13 · 更新于 2026-09-04 · 20 min · 4212 words

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

📄 A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores 标签:#端到端 #Transformer #基准测试 8.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #端到端 | #Transformer | #基准测试 | arxiv 👥 作者与机构 Dongmin Kim(韩国西江大学 Music & Arts Learning (MALer) Lab) Brian Liu(独立研究者) Jose J. Valero-Mas(西班牙阿利坎特大学模式识别与人工智能小组) Dasaem Jeong(韩国西江大学 MALer Lab;联系邮箱 dasaemj@sogang.ac.kr;论文未明确标注“通讯作者”,按署名与联系邮箱推断) 💡 毒舌点评 首个多声部 OMR 基准的开创性毋庸置疑,视觉对齐 + 三编码转换 + 测试集互斥四折协议的工程链条相当完整,3.6%/5.9% 的基线让这个任务从“不可能”变成了“可挑战”。但人工校对没有第二人校验、四折标准差偏大、LMXE 由作者自己的转换管线生成并取得全面优势,使得“编码选择 > 架构选择”这个 headline 结论的公信力打了折扣。 ...

2026-08-12 · 更新于 2026-09-04 · 4 min · 770 words

BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays

📄 BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays 标签:#语音分离 #Transformer #语音增强 #多通道 5.0/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 📝 5.0/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音分离 | #Transformer | #语音增强 #多通道 | arxiv 👥 作者与机构 第一作者:Selani A. Indrapala(斯里兰卡莫拉图瓦大学,电子与电信工程系) 通讯作者:未说明 作者列表:Selani A. Indrapala(斯里兰卡莫拉图瓦大学电子与电信工程系)、Wageesha N. Manamperi(斯里兰卡莫拉图瓦大学电子与电信工程系) 资助来源:“Accelerating Higher Education Expansion and Development (AHEAD)” 项目(编号 6026-LK/8743-LK)及斯里兰卡电信监管委员会(TRCSL)2024 研发基金 💡 毒舌点评 用 oracle DoA/VAD 把 SegSNR 从 -8.69 拉到 -2.57,说明空间与活动性信息确实能带来可观增益;但所谓“目标说话人提取”既依赖真值标签,又未与任何已有 TSE 方法对比,更像“带 oracle 指导的 BCCTN 增强”。更扎眼的是引言末尾宣称 “consistently surpasses state-of-the-art methods”,而全文的对比基线只有 MVDR 和自己使用的 BCCTN 系列,SOTA 声称没有实质证据支撑,离 AR 眼镜实际部署还有很大距离。 ...

2026-08-12 · 更新于 2026-09-04 · 6 min · 1193 words

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

📄 DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning 标签:#音频分类 #自监督学习 #Transformer #知识蒸馏 #预训练 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频分类 | #自监督学习 | #Transformer #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Tomasz Radzikowski(Warsaw University of Technology) 通讯作者:未披露 作者列表:Tomasz Radzikowski、Mateusz Modrzejewski、Przemysław Rokita(均为 Warsaw University of Technology) 论文状态:Preprint,已接收于 ICAISC 2026,最终版将发表于 Springer LNAI。 💡 毒舌点评 把 DINO 以最小改动搬到通用音频,并用与 BYOL-A v2 完全对齐的 FSD50K 预训练和 EVAR 线性探针评测做了一次干净的算法级对照,这是论文最有价值的贡献。但整套方法没有任何针对音频的新机制,最佳变体平均落后 BYOL-A v2 达 11.96 个百分点;作者把差距归因于 65,536 维投影在 FSD50K 尺度下数据效率不足和多裁剪的局部-全局语义不匹配,却既没有对投影维度、多裁剪开关做消融,也没有在 AudioSet 上验证尺度假设,因此“机制解释”更像事后假设而非实证结论。 ...

2026-08-12 · 更新于 2026-09-04 · 4 min · 787 words

语音/音乐/音频论文速递 2026-08-12

语音/音乐/音频论文速递 2026-08-12 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 4篇 ████ #语音识别 4篇 ████ #音乐理解 4篇 ████ #扩散模型 1篇 █ #端到端 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DuplexWorld: Can voice agents help you get through the 8.5分 前25% 数据集与基准 #语音交互 🥈 A Dataset and Benchmark for Optical Music Recognition o 8.5分 前25% 数据集与基准 #端到端 🥉 Measuring Cross-Cultural Style Diffusion Through Era Cl 8.3分 前25% 方法研究 #音乐理解 4. Training Set Synthesis for Bioacoustic Denoising: A Cas 8.0分 前25% 应用研究 #语音增强 5. Modeling and Interpreting Correlations, Null Distributi 8.0分 前25% 方法研究 #音频理解 6. Seeds Before Objectives: Rethinking Evaluation for Low- 7.9分 前25% 数据集与基准 #语音识别 7. Beyond Dry References: Learning Relative Audio Effects 7.7分 前25% 方法研究 #音乐理解 8. MAJEPPA: Morphing and Assessing in a Unified Piano Perf 7.5分 前25% 方法研究 #音乐理解 9. DIY e-HandPan: A new DIY Low-Cost Handpan Interface bas 7.2分 前50% 系统技术报告 #音频交互 10. Rationale-Guided Learning for Multimodal Emotion Recogn 7.2分 前50% 方法研究 #语音情感识别 11. The GENEA Challenge 2026: A Large-Scale Disentangled Ev 7.2分 前50% 数据集与基准 #语音交互 12. Beyond Naturalness: Probing Automated Text-To-Speech Ev 7.1分 前50% 数据集与基准 #语音质量评估 13. In Defense of Using Worst-case Privacy Disclosure as Pr 7.1分 前50% 理论研究 #说话人验证 14. Pitch Contour Tokenization using VQ-VAE and Its Applica 7.1分 前50% 方法研究 #音乐理解 15. VoxSumm: A Multilingual Corpus of Long-Form Spoken News 6.9分 前50% 数据集与基准 #语音翻译 16. myMediWhisper: Construction of Burmese Medical Speech C 6.7分 前50% 数据集与基准 #语音识别 17. MazzikaAI: A knowledge-based performance-to-prompt comp 6.6分 前50% 系统技术报告 #音乐生成 18. ASR-Roundtrip Evaluation Can Mask Context- and Conventi 6.5分 前50% 方法研究 #语音合成 19. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with 6.5分 前50% 系统技术报告 #音视频生成 20. TimeRoute: Time-Aware Modality Routing and Diffusion fo 6.5分 前50% 方法研究 #扩散模型 21. X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint 6.4分 前50% 方法研究 #语音交互 22. Edge Phoneme Recognition for Children’s Speech through 6.3分 前50% 模型报告 #语音识别 23. DINO-A: Adapting Self-Distillation Vision Transformers 6.2分 前50% 方法研究 #音频分类 24. Whisper-Aware LLM: Self-Supervised Uncertainty Learning 6.1分 前50% 方法研究 #语音识别 25. Never Stop Speaking: a Denial-of-Service Attack on End- 5.4分 后50% 方法研究 #语音交互 26. BiTSE: Binaural Target Speaker Extraction in Noisy Mult 5.0分 后50% 方法研究 #语音分离 27. Monophonic Audio Synthesizer Using FPGAs 4.2分 后50% 系统技术报告 #音频生成 📋 论文列表 🥇 DuplexWorld: Can voice agents help you get through the day? 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-12 · 更新于 2026-09-04 · 24 min · 4909 words

Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty

📄 Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty 标签:#声源定位 #Transformer #鲁棒性 #多通道 6.2/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #Transformer | #鲁棒性 #多通道 | arxiv 👥 作者与机构 第一作者:Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) 通讯作者:未说明 作者列表: Jennifer N. Kampe(University of Jyväskylä, Department of Biological and Environmental Science;Duke University, Department of Statistical Science) Changwoo J. Lee(Duke University, Department of Statistical Science) Xin Shen(Duke University, Department of Statistical Science) Ari Lehtiö(University of Jyväskylä, Digital Services) Sandro von Brandenburg(University of Jyväskylä, Digital Services) Ossi Nokelainen(University of Jyväskylä, Department of Biological and Environmental Science;University of Jyväskylä, Open Science Centre) David B. Dunson(Duke University, Department of Statistical Science) Otso Ovaskainen(University of Jyväskylä, Department of Biological and Environmental Science) 💡 毒舌点评 用“保留物理求解器 + 学习校正 + 两层物理门控 + GDOP 缩放不确定性”的思路来抑制双曲定位的灾难性长尾,诊断清楚、设计务实,这是论文最大的亮点。但真实实验只有一个冰冻湖站点、六个已知扬声器位置,森林场景全部是仿真,且没有给出完整混合门控在森林仿真中的直接结果;基线只有经典双曲求解器,未与任何现代深度学习、score-based 或 conformal 声源定位方法对比。整体说服力仍未达到顶会主接收准。 ...

2026-08-11 · 更新于 2026-09-04 · 3 min · 619 words