ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids

📄 开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消? 英文题目:ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids 一句话:为解决开耳式助听器通气孔泄漏污染增强语音的问题,ABSE-NET 用 BMVDR 做保留空间线索的粗增强,再用仅 0.112M 参数的轻量网络联合完成泄漏对消与失真补偿,在合成双耳数据上以 0.184G FLOPs 取得 PESQ 3.626 与 STOI 0.955,但验证仍局限于仿真声学环境。 标签:#语音增强 | #CNN | #主动降噪 | #助听器 | #模型压缩 评分:7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 De Hu:机构信息未在 arXiv HTML 中可靠披露 Xue Du:机构信息未在 arXiv HTML 中可靠披露 Qingying Zhao:机构信息未在 arXiv HTML 中可靠披露 Qintuya Si:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把双耳最小方差无失真响应波束形成器(binaural minimum variance distortionless response beamformer,BMVDR)与轻量后滤波级联,用 0.112M 参数实现开耳式场景下的泄漏对消且摆脱耳内误差麦克风,工程指向清晰。短板是评估完全依赖 Hearpiece 实测头相关脉冲响应(head-related impulse response,HRIR)合成的 24 小时仿真数据,未见真实开耳助听器佩戴、非线性次级路径或主观听感验证,且核心公式中空间线索误差定义存在明显笔误,削弱严谨性观感。 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1735 words

语音/音乐/音频论文速递 2026-09-02

语音/音乐/音频论文速递 2026-09-02 共分析 23 篇论文 ⚡ 今日概览 ✅ 筛选入选 23 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频分类 3 篇 ███ #多模态模型 2 篇 ██ #语音合成 2 篇 ██ #语音增强 2 篇 ██ #语音情感识别 2 篇 ██ #音频分离 2 篇 ██ #语音交互 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(23 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 BiMTokenizer: Preserving Semantic-Acoustic Balance in… 8.3 前25% 方法研究 #语音编码 🥈 A Composable Evaluation System for Reproducible Omni… 8.3 前25% 系统技术报告 #多模态模型 🥉 Phrase-Localized Language-Contrastive Guidance… 8.2 前25% 方法研究 #语音合成 4. Zero-Shot Respiratory Sound Classification through LLM… 7.8 前25% 方法研究 #音频分类 5. A Unified Uncertainty-Aware Back-End for Speaker… 7.8 前25% 方法研究 #说话人验证 6. ABSE-NET: A Lightweight Neural Model for Active… 7.5 前25% 方法研究 #语音增强 7. TUTTI: Toward generalizable audio-to-score… 7.4 前50% 方法研究 #音乐转录 8. Perceptible or Not? Diagnosing Passive Fingerprints… 7.4 前50% 方法研究 #语音伪造检测 9. Ready to Speak: Aligning LLMs for TTS-Friendly Text… 7.4 前50% 方法研究 #语音合成 10. On the Human and Computer Alignment of Attribute-Based… 7.3 前50% 数据集与基准 #音乐检索 11. TimeSteer: Inference-Time Speech Scheduling in Joint… 7.2 前50% 方法研究 #音视频生成 12. VoiceLongMemEval: Do Assistants Remember How You… 7.1 前50% 数据集与基准 #语音情感识别 13. Cleaner Speech, Weaker Generalization: Revisiting Pitt… 7.0 前50% 数据集与基准 #音频分类 14. TAG-Bench: Benchmarking Temporal Audio Grounding in… 6.9 前50% 数据集与基准 #音频理解 15. Artificial Rosetta Stone: Constrained Maximum A… 6.8 前50% 方法研究 #音乐理解 16. XVAE-WMT: Explainable Wavelet-Temporal Variational… 6.6 前50% 方法研究 #音频分离 17. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U… 6.4 前50% 方法研究 #语音增强 18. Conversation Coach: A Voice-enabled AI System that… 6.3 前50% 系统技术报告 #语音交互 19. Soft Posterior Speaker Injection for Multi-Talker… 6.2 前50% 方法研究 #语音识别 20. Heard but Not Heeded: Paralinguistic Information… 6.0 前50% 方法研究 #语音情感识别 21. Ontology-based Target Sound Extraction 5.7 前50% 方法研究 #音频分离 22. MADS: A Multiview Acoustic Descriptor Set Beyond… 5.7 前50% 方法研究 #音频分类 23. TEIDAN: A Multilingual Multiparty Dialogue Corpus 5.1 后 50% 数据集与基准 #多模态模型 📋 论文列表 🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling ...

2026-09-02 · 更新于 2026-09-04 · 24 min · 4954 words

Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks

📄 Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks 标签:#语音增强 #主动降噪 #实时处理 5.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #主动降噪 | #实时处理 | arxiv 👥 作者与机构 第一作者:Manami Nishikata(Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan) 通讯作者:未说明 作者列表:Manami Nishikata(Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan)、Shoichi Koyama(National Institute of Informatics, Tokyo, Japan;Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan) 💡 毒舌点评 本文的想法朴素但有一定吸引力:把语音时间序列预测注入 FxLMS 的梯度更新,试图缓解非平稳语音下自适应滤波跟踪滞后。然而,最刺眼的结果是 MLP 预测质量相当差(Pearson 相关系数仅 0.287),却与 oracle 预测的降噪效果几乎相同。这说明当前 NPR 指标或评估设计可能根本测不出预测精度带来的真实增益。更值得注意的是,论文在方法部分构建了参考与期望两个预测器,但实验只训练和使用了参考信号预测器,期望信号由已知主路径直接生成,期望信号预测器这一更大难点被完全回避。整体上,方法有参考价值,但距离主动语音抑制的实际部署仍非常遥远。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 660 words

语音/音乐/音频论文速递 2026-08-18

语音/音乐/音频论文速递 2026-08-18 共分析 39 篇论文 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 3篇 ███ #语音增强 3篇 ███ #语音识别 3篇 ███ #音频分类 3篇 ███ #音频理解 3篇 ███ #声源定位 2篇 ██ #语音编码 2篇 ██ #音视频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retri 7.9分 前25% 数据集与基准 #音频检索 🥈 What Makes a Good Layer? Assessing the Layer-Wise Intri 7.7分 前25% 方法研究 #音乐理解 🥉 How Fragile Is Your Watermark? Training-Free Structural 7.6分 前25% 方法研究 #音频水印 4. Numerical and perceptual validity of synthetic Head-Rel 7.6分 前25% 应用研究 #声源定位 5. ACE-Cap: Active Evidence Acquisition via Agentic Co-Evo 7.5分 前25% 方法研究 #音频字幕生成 6. CineDub: Scaling End-to-End Video Dubbing to Multi-Spea 7.3分 前50% 方法研究 #音视频语音合成 7. Prototype-Rectified Iterative Self-supervised Manifold 7.2分 前50% 方法研究 #音频分类 8. CLARA: Clip-Level Multimodal Alignment with VLM-Derived 7.2分 前50% 方法研究 #音视频理解 9. Impulse Response Estimation via Laguerre-Fourier Expans 6.8分 前50% 方法研究 #音频理解 10. SingDance: Compositional Zero-Shot Singing-and-Dancing 6.8分 前50% 方法研究 #音视频生成 11. Listen, Reason, and Segment: Aligning LALMs with Editor 6.8分 前50% 方法研究 #音频理解 12. AnyTalk: Speech Animation for Arbitrary Characters Leve 6.7分 前50% 方法研究 #音视频语音合成 13. Evidence of Absence: Cross-Modal Abductive Risk Percept 6.6分 前50% 方法研究 #音频事件检测 14. ParaJSCC: A Parameterized Framework for Reusable Multim 6.6分 前50% 方法研究 #音频编码 15. ARENA: Automated Red-Teaming for Large Audio Language M 6.5分 前50% 方法研究 #音频理解 16. The Null Token Knows: Reducing Message-Free Hallucinati 6.5分 前50% 方法研究 #语音识别 17. Moving Horizon Estimation for Underwater Target Trackin 6.5分 前50% 方法研究 #声源定位 18. Multi-Granularity Sentiment Integration for LLM-Based M 6.5分 前50% 方法研究 #音视频理解 19. Adding Voice Cloning to Text-to-Audio-Video Models with 6.4分 前50% 方法研究 #语音克隆 20. Xemo-Talker: Unlock Emotions Explicitly for Audio-Drive 6.2分 前50% 方法研究 #音视频生成 21. Separate First, Then Associate: A Two-Stage Approach fo 6.2分 前50% 系统技术报告 #音视频语音分离 22. Geometry-adaptive Ambisonic encoding for sparse microph 6.2分 前50% 方法研究 #空间音频 23. A survey of AI-generated voices and their detection 6.1分 前50% 综述 #语音伪造检测 24. Iterative Self-Learning for Expressive Text-to-Speech S 6.1分 前50% 方法研究 #语音合成 25. Cached LLM Probability Retrieval for Speech Recognition 6.1分 前50% 方法研究 #语音识别 26. DuplexGen: Decoupling Content, Timing, and Acoustics fo 6.1分 前50% 方法研究 #语音合成 27. Speaker-Normalized Semantic Speech Tokens via Iterative 6.0分 前50% 方法研究 #语音编码 28. Multi-Modal Generative Fuzzy System: Fuzzy Inference Gu 5.9分 前50% 方法研究 #音视频问答 29. A Parameter-Free Few-Shot Evaluation for Elephant Vocal 5.9分 前50% 应用研究 #音频分类 30. Contrastive Learning with Variational Regularization fo 5.9分 前50% 方法研究 #语音合成 31. Sonifying I2S Transport Signals to Detect Transmission 5.9分 前50% 系统技术报告 #音频分类 32. An Analytical-Prior Framework for Data-Efficient Predic 5.8分 前50% 方法研究 #预训练 33. Navigating Speech Enhancement for Real-Time MRI: A Syst 5.7分 前50% 应用研究 #语音增强 34. Distinguishing AI-Generated Music from Edited Audio as 5.6分 前50% 方法研究 #音频伪造检测 35. A Novel Binaural Cue Preservation Loss for DNN-Based Bi 5.6分 前50% 方法研究 #语音增强 36. Unadapted Multilingual ASR on a Garrusi Kurdish Evaluat 5.6分 前50% 方法研究 #语音识别 37. Feedforward Active Speech Suppression Based on Time Ser 5.5分 前50% 方法研究 #语音增强 38. Using the Mimi codec for metalinguistic representations 4.7分 后50% 方法研究 #语音编码 39. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Ran 3.5分 后50% 系统技术报告 #音频编码 📋 论文列表 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-18 · 更新于 2026-09-04 · 40 min · 8515 words

Model-Agnostic Meta-Learning Initialization for Distributed Multichannel Active Noise Control

📄 Model-Agnostic Meta-Learning Initialization for Distributed Multichannel Active Noise Control 标签:#主动降噪 #元学习 #音频理解 #Transformer #模型评估 5.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.5/1.5 📝 5.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #主动降噪 | #元学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Xiaoyi Shen(State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences) 通讯作者:未明确说明,但从致谢基金(中国科学院青年人才引进项目)推断可能为 Jun Yang 作者列表:Xiaoyi Shen(State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences)、Junwei Ji(School of Electrical and Electronic Engineering, Nanyang Technological University)、Woon-Seng Gan(School of Electrical and Electronic Engineering, Nanyang Technological University)、Dongyuan Shi(Center of Intelligent Acoustics and Immersive Communications, Northwestern Polytechnical University)、Jun Yang(State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences) 💡 毒舌点评 本文将MAML引入分布式多通道ANC滤波器初始化,动机合理,仿真显示收敛速度确有提升。但硬伤是MAML训练的超参数(内外步长、遗忘因子、任务数等)一律缺失,所谓的“核心贡献”几乎无法复现;且通篇未与任何非零初始化基线(如系统辨识均值、随机初值的多次平均)对比,无法支撑其“元学习初始化最优”的主张。纯仿真、无实测、无计算开销分析,工程实用价值存疑。 ...

2026-08-03 · 更新于 2026-09-04 · 2 min · 357 words

语音/音乐/音频论文速递 2026-08-03

语音/音乐/音频论文速递 2026-08-03 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #音频理解 2篇 ██ #主动降噪 1篇 █ #元学习 1篇 █ #医疗音频 1篇 █ #声源定位 1篇 █ #数据集 1篇 █ #语音交互 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Do Music Foundation Models Embed Pitch in Helical Struc 8.1分 前25% 方法研究 #音乐理解 🥈 Versatile On-device Adaptation at the Edge by Unifying 8.1分 前25% 系统技术报告 #元学习 🥉 FriendBench: Benchmarking Dyadic Familiarity Inference 7.9分 前25% 数据集与基准 #音视频理解 4. Cloned Voices, Real Consequences: Evaluating Bias in Po 7.7分 前25% 数据集与基准 #语音伪造检测 5. A Neurosymbolic Approach for Explainable Early Diagnosi 7.7分 前25% 系统技术报告 #音频理解 6. DoubleHelix: Structured Cross-Modal Fusion for Audio-Vi 7.4分 前50% 方法研究 #音视频语音识别 7. Tensor-Based Joint Pitch and DOA Estimation 6.9分 前50% 方法研究 #声源定位 8. ParaASR: Multi-Token Prediction for Fast and Long-Conte 6.7分 前50% 系统技术报告 #语音识别 9. Exploring Efficient Waveform Diffusion Models for Foley 6.5分 前50% 方法研究 #音频生成 10. Leveraging Beam Search Information for Confidence Estim 6.3分 前50% 方法研究 #语音识别 11. TORUS: A Test of Rendering-Understanding Self-Coherence 6.1分 前50% 数据集与基准 #音频理解 12. M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain 6.1分 前50% 数据集与基准 #语音交互 13. Stable Autoregressive Speech Generation with Low-Frame- 5.8分 前50% 方法研究 #语音合成 14. Learning to Predict Performance-induced Emotion Differe 5.6分 前50% 方法研究 #数据集 15. Model-Agnostic Meta-Learning Initialization for Distrib 5.1分 后50% 方法研究 #主动降噪 16. Technological Advances in Detecting and Managing Cognit 4.0分 后50% 综述 #医疗音频 📋 论文列表 🥇 Do Music Foundation Models Embed Pitch in Helical Structure? 8.1/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ...

2026-08-03 · 更新于 2026-09-04 · 14 min · 2783 words

Adaptive Momentum Enhanced Distributed Multichannel Active Noise Control for Faster Convergence under Communication Delays

📄 Adaptive Momentum Enhanced Distributed Multichannel Active Noise Control for Faster Convergence under Communication Delays 标签:#主动降噪 #音频理解 #Transformer #模型评估 6.3/10 | 创新 1.3/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.3/10 | 前50% | 文档类型:应用研究 | 评分置信度:高 | #音频理解 | #主动降噪 | #Transformer #模型评估 | arxiv 👥 作者与机构 作者列表:Junwei Ji, Woon-Seng Gan, Boxiang Wang, Ziyi Yang, Haowen Li 第一作者:Junwei Ji 通讯作者:未说明 机构:未明确列出所有作者机构。基于通讯作者Woon-Seng Gan的已知背景,推断至少部分作者隶属于新加坡南洋理工大学电气与电子工程学院。 💡 毒舌点评 工作选题精准,瞄准了分布式ANC工程化中一个实际且棘手的痛点——通信延迟导致收敛慢。核心想法也合理,将ML中常见的动量思想进行改造并引入特定自适应滤波框架。然而,这本质上是对一个已有、高度特化的算法(ASSS-MGDFxLMS)的“补丁式”增强,属于典型的增量式改进。最大的硬伤在于完全缺乏理论分析,既未证明新算法在什么条件下能收敛,也未给出收敛速率的分析,使得其有效性完全系于有限仿真。实验设计虽有针对性,但场景单一(6节点、固定声学路径),与工程实际中复杂多变的声场、拓扑和网络异常(丢包、异步)相去甚远。贡献更偏工程技巧而非科学洞察,因此适合但难以获得顶级会议的高度认可。 ...

2026-07-21 · 更新于 2026-09-04 · 2 min · 327 words

语音/音乐/音频论文速递 2026-07-21

语音/音乐/音频论文速递 2026-07-21 共分析 34 篇论文 ⚡ 今日概览 📥 抓取 34 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 3篇 ███ #音频理解 3篇 ███ #语音伪造检测 2篇 ██ #语音翻译 2篇 ██ #说话人验证 2篇 ██ #音频事件检测 2篇 ██ #基准测试 1篇 █ #多模态模型 1篇 █ 📊 论文评分排行榜(34 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 HARP: Harmonic-Aware Residual Partitioning for Neural A 9.6分 前10% 方法研究 #音频编码 🥈 SALMONN-2: Advancing General-Purpose Hearing Abilities 9.4分 前10% 模型报告 #音频理解 🥉 Pseudo-label distillation for discriminative anomalous 9.0分 前10% 方法研究 #音频事件检测 4. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous A 8.8分 前25% 数据集与基准 #基准测试 5. RealDESED: A Real-World Domestic Sound Event Detection 7.9分 前25% 数据集与基准 #音频事件检测 6. FlowSonic: Stable Zero-Shot Music Editing via High-Orde 7.9分 前25% 方法研究 #音乐生成 7. Time-Frequency Consistency Learning for Robust Speech D 7.9分 前25% 方法研究 #语音伪造检测 8. AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Cali 7.8分 前25% 方法研究 #说话人验证 9. X-Translator: A Real-Time Multilingual Speaker-Aware Sp 7.8分 前25% 系统技术报告 #语音翻译 10. Dense-Sparse Dynamic Time Warping for Customizing Piano 7.8分 前25% 系统技术报告 #音乐源分离 11. Do Speech Tokens Leak Voiceprints? Speaker Inversion At 7.7分 前25% 方法研究 #说话人验证 12. Is One Score Enough? Assessing Singing Quality of Songs 7.6分 前25% 方法研究 #音乐理解 13. FlashRT: Agent Harness for Guiding Agents to Deploy Rea 7.5分 前25% 系统技术报告 #音视频生成 14. AI_LectureNote: A Retrospective Pilot Study of a Post-A 7.2分 前50% 系统技术报告 #语音识别 15. Should Missing Modalities Always Be Necessary to Repair 7.0分 前50% 方法研究 #多模态模型 16. Re-Sonance: A Dysarthric Asynchronous Real-Time Speech 6.9分 前50% 系统技术报告 #语音转换 17. NABEATs: Noise-Aware Audio Representation Learning 6.7分 前50% 方法研究 #音频理解 18. When to Use Extra Context: Evidence-Grounded Terminolog 6.7分 前50% 系统技术报告 #语音翻译 19. How Reliable Are Multimodal Signals of Conversational S 6.6分 前50% 方法研究 #鲁棒性 20. SSTMark: Robust Training-Free Semantic-Level Speech Wat 6.5分 前50% 系统技术报告 #音频水印 21. The tttAI System for the TSA-ASR Task of the SmartGlass 6.5分 前50% 系统技术报告 #说话人日志 22. Audio Cross Verification Using Dual Alignment Likelihoo 6.5分 前50% 方法研究 #音频伪造检测 23. Component-Level Ensemble Fusion for Speech and Environm 6.4分 前50% 系统技术报告 #语音伪造检测 24. Adaptive Momentum Enhanced Distributed Multichannel Act 6.3分 前50% 应用研究 #音频理解 25. Robust Summarization of Doctor-Patient Conversations: T 6.3分 前50% 系统技术报告 #语音交互 26. An Audio Language Model-Based Voice Concept Bottleneck 6.2分 前50% 应用研究 #语音质量评估 27. FillGauss: Fine-Grained Filling-Aware Impact Sound Gene 6.2分 前50% 方法研究 #音频生成 28. Harness TTS: Towards Context-Aware Expressive Speech Sy 6.2分 前50% 方法研究 #语音合成 29. Modeling turn-taking with distant viewing: investigatin 6.2分 前50% 系统技术报告 #音视频 30. Efficient Audio-Visual Event Recognition via Knowledge 5.8分 前50% 方法研究 #音视频理解 31. Multi-Level Privacy-Preserving Dementia Detection from 5.5分 前50% 方法研究 #语音属性识别 32. Explainable Lightweight Compact Deep Models for Speech 5.4分 后50% 方法研究 #语音情感识别 33. Team RAS in 11th ABAW Competition: Multimodal Ambivalen 5.3分 后50% 系统技术报告 #语音情感识别 34. EII-SCL: Harnessing Emotional Inertia for Multimodal Em 5.2分 后50% 方法研究 #语音情感识别 📋 论文列表 🥇 HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs 9.6/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ...

2026-07-21 · 更新于 2026-09-04 · 29 min · 6176 words

Spatial-Frequency Cued Generative Fixed-Filter Active Noise Control Based on Deep Learning in Reverberant Environments

📄 Spatial-Frequency Cued Generative Fixed-Filter Active Noise Control Based on Deep Learning in Reverberant Environments 标签:#主动降噪 #声源定位 #多任务学习 #音频理解 #Transformer 6.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #声源定位 | #多任务学习 | #主动降噪 #音频理解 | arxiv 👥 作者与机构 第一作者:Boxiang Wang(南洋理工大学电气与电子工程学院 Smart Nation TRANS Lab) 通讯作者:未说明 作者列表:Boxiang Wang(南洋理工大学电气与电子工程学院 Smart Nation TRANS Lab)、Haowen Li(西北工业大学智能声学与沉浸式通信中心)、Dongyuan Shi(西北工业大学智能声学与沉浸式通信中心)、Junwei Ji(西北工业大学智能声学与沉浸式通信中心)、Ziyi Yang(西北工业大学智能声学与沉浸式通信中心)、Zhengding Luo(西北工业大学智能声学与沉浸式通信中心)、Woon-Seng Gan(南洋理工大学电气与电子工程学院 Smart Nation TRANS Lab) 💡 毒舌点评 论文抓住了传统GFANC忽略声源空间信息这一明确痛点,通过引入3D空间条件化和设计多任务CRNN,在模拟和实测中确实实现了更快的响应和更高的降噪量,其系统框架(离线库+在线双路)的工程思路清晰。然而,其核心价值高度依赖于“预定义网格点+离散分类”这一前提,当声源位置介于网格之间时,系统只能进行最近邻硬选择,空间维度上的连续适应性缺失。实验场景局限于单一、静止噪声源,对声源运动、多声源、设备布局变化等现实复杂性完全回避。0.5秒的帧处理延迟在ANC中已是显著的算法延迟,论文却以“delayless”为卖点,存在概念混淆。总体来看,这是一篇在受限场景下工程表现不错的方案,但离鲁棒、灵活的现实部署还有相当距离。 ...

2026-07-15 · 更新于 2026-09-04 · 3 min · 462 words

语音/音乐/音频论文速递 2026-07-15

语音/音乐/音频论文速递 2026-07-15 共分析 25 篇论文 ⚡ 今日概览 📥 抓取 25 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音乐理解 3篇 ███ #声源定位 2篇 ██ #语音伪造检测 2篇 ██ #语音合成 2篇 ██ #语音增强 2篇 ██ #语音识别 2篇 ██ #说话人日志 2篇 ██ #音频事件检测 2篇 ██ 📊 论文评分排行榜(25 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ChartGenEval: Corruption-Tested Multi-Dimensional Feedb 8.8分 前25% 方法研究 #音乐生成 🥈 Contrasting statistical patterns in melodic and molecul 8.7分 前25% 方法研究 #音乐理解 🥉 Open-Source Intelligence and Music Information Retrieva 7.9分 前25% 应用研究 #音乐理解 4. HSEmotion Team at the 11th ABAW Challenge: Multi-Task L 7.9分 前25% 系统技术报告 #音视频 5. Low-Latency Neural Models for Real-Time Music Enhanceme 7.7分 前25% 系统技术报告 #音乐源分离 6. Do We Really Need Multimodal Emotion Language Models La 7.4分 前50% 方法研究 #语音情感识别 7. ZipL-Dialog: Memory-Efficient Long-Form Spoken Dialog S 7.3分 前50% 系统技术报告 #语音合成 8. The Sound of Absence: Audio-Language Embedding Models S 7.1分 前50% 系统技术报告 #音频检索 9. Real-time Generation of Listener Nodding via Prediction 6.9分 前50% 方法研究 #语音交互 10. Spatial-Frequency Cued Generative Fixed-Filter Active N 6.9分 前50% 方法研究 #声源定位 11. UD-ASD: A Unified Diffusion Model for Anomalous Sound D 6.6分 前50% 方法研究 #音频事件检测 12. Investigating the Integration of Spatial Information in 6.6分 前50% 方法研究 #说话人日志 13. Segregate, Refine, Integrate: Decomposing Multimodal Fu 6.5分 前50% 方法研究 #音频事件检测 14. AutoSIFT: Automatic Style Sifting for Controllable Spee 6.5分 前50% 方法研究 #语音合成 15. Listen first: Output-based multi-microphone speech enha 6.4分 前50% 方法研究 #语音增强 16. Neural Morphing: Sequence-Optimized Token-Level Morphin 6.4分 前50% 系统技术报告 #音频编码 17. Hybrid Continual Learning for Low-Resource Australian A 6.3分 前50% 方法研究 #语音识别 18. Explainable-by-Design Audio Deepfake Detection via Wien 6.1分 前50% 方法研究 #语音伪造检测 19. Traceback Translators Against Forgetting in Continual F 6.0分 前50% 方法研究 #语音伪造检测 20. Automated Synthesis of Facial Mechanisms for Conversati 5.9分 前50% 系统技术报告 #音频理解 21. PolarBM: Complex-valued Boltzmann Machine for Modeling 5.8分 前50% 方法研究 #语音增强 22. Audio-Native Speech Recognition with a Frozen Discrete- 5.7分 前50% 方法研究 #语音识别 23. What is a Musical Scale? Regularity and Convention in t 5.6分 前50% 理论研究 #音乐理解 24. DOA Estimation from One-Bit Magnitude-Only Measurements 5.1分 后50% 方法研究 #声源定位 25. Audio Diarization: A New Paradigm for Exploring Audio R 4.5分 后50% 方法研究 #说话人日志 📋 论文列表 🥇 ChartGenEval: Corruption-Tested Multi-Dimensional Feedback for Rhythm-Game Chart Generation 8.8/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ...

2026-07-15 · 更新于 2026-09-04 · 23 min · 4806 words