语音/音乐/音频论文速递 2026-08-19

语音/音乐/音频论文速递 2026-08-19 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 3篇 ███ #音乐理解 2篇 ██ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音唤醒 1篇 █ #语音情感识别 1篇 █ #说话人验证 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 FireRedTTS3: Unified Speech Generation and Editing with 9.0分 前10% 方法研究 #语音合成 🥈 SpeechSense: A Paralinguistic-Focused Dataset for Fine- 8.5分 前25% 数据集与基准 #语音情感识别 🥉 DynaForcing: Overcoming Dynamic Collapse in Self-Forcin 8.0分 前25% 方法研究 #音视频生成 4. Automatic Transcription of Microtonal Free-Rhythm Vocal 7.5分 前25% 应用研究 #音乐转录 5. Emotion Across Speech and Faces: Shared Affective Mecha 7.4分 前50% 方法研究 #音视频理解 6. UniVerse: Benchmarking and Enhancing LALMs on Culturall 7.1分 前50% 数据集与基准 #音乐理解 7. A Multiplication-Free Feature Extractor for Signal Clas 6.9分 前50% 方法研究 #语音唤醒 8. PolyDebate: A Game-Orchestrated Multimodal System for D 6.8分 前50% 应用研究 #语音交互 9. Uncertainty-Aware Decision Making in Multimodal Large L 6.8分 前50% 综述 #音频理解 10. Why GPT-Style Models Do Not Directly Transfer to Symbol 6.7分 前50% 理论研究 #音乐生成 11. The Last Mile of Deepfake Speech Detection: An Industry 6.6分 前50% 系统技术报告 #语音伪造检测 12. Closing the Affective Loop: Multimodal Speaker-Listener 6.5分 前50% 应用研究 #语音交互 13. DNN-Based Frequency-Dependent Estimation of Speech, Mus 6.5分 前50% 方法研究 #音频分离 14. Multi-turn Conversational AI from Text to Multimodal In 6.5分 前50% 综述 #语音交互 15. On computational approaches to Pop music culture 6.1分 前50% 综述 #音乐理解 16. Target Speaker Identification: A Low-Latency Streaming 5.6分 前50% 系统技术报告 #说话人验证 📋 论文列表 🥇 FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations 9.0/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ...

2026-08-19 · 更新于 2026-09-04 · 18 min · 3634 words

Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures

📄 Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures 标签:#音乐源分离 #RNN #对比学习 #数据集 #多任务学习 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐源分离 | #RNN | #对比学习 #数据集 | arxiv 👥 作者与机构 第一作者:Jocelyn Xu(根据代码仓库用户名 jocelynxu01 推断,论文文本未明确显示作者列表) 通讯作者:未说明 作者列表:未说明(提供文本中未包含作者与机构信息) 💡 毒舌点评 把 SpeakerBeam/VoiceFilter 的 enrollment 范式搬进歌唱分离,并用 FiLM 与拼接做条件化,在 duet 目标歌手 SI-SDR 上从 0.33 dB 拉到 5.58 dB,方向有价值且确实有效;但整套方法基本是 Open-Unmix + 现成 speaker embedding 思路的双拼,未见架构或表示层面的本质突破。DAMP-VSEP 每首歌都被当作独立歌手,所谓 singer embedding 更像“同一首歌内 segment matching”,与真正跨歌曲歌手身份泛化不是一回事,这一点比作者承认的更致命。 ...

2026-08-17 · 更新于 2026-09-04 · 3 min · 579 words

语音/音乐/音频论文速递 2026-08-17

语音/音乐/音频论文速递 2026-08-17 共分析 20 篇论文 ⚡ 今日概览 📥 抓取 20 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音乐理解 3篇 ███ #语音合成 2篇 ██ #语音识别 2篇 ██ #音视频生成 2篇 ██ #语音交互 1篇 █ #语音伪造检测 1篇 █ #说话人日志 1篇 █ #音乐源分离 1篇 █ 📊 论文评分排行榜(20 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoiceChat-TTS: A Low-Latency Continuous Speech Synthesi 8.2分 前25% 模型报告 #语音合成 🥈 Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint 7.7分 前25% 方法研究 #音视频生成 🥉 Trajectory Dynamics in Self-Supervised Learning Latent 7.6分 前25% 方法研究 #语音伪造检测 4. H2H Music Improv: A Communication Model and Audio-Visua 7.6分 前25% 数据集与基准 #音乐理解 5. Singer-Informed Vocal Source Separation for Multi-Singe 7.5分 前25% 方法研究 #音乐源分离 6. Why Performance Metrics Overpromise in Auditory Attenti 6.9分 前50% 方法研究 #语音交互 7. VoiceDesigner: Text-to-Voice Generation and Editing via 6.8分 前50% 系统技术报告 #语音合成 8. The MPB Corpus: A Dataset of Melody, Rhythm, Harmony, a 6.8分 前50% 数据集与基准 #音乐理解 9. Acoustic UAV Detection in Battlefield Scenarios: Handli 6.7分 前50% 方法研究 #音频事件检测 10. Avatar-Forever: Decoupled Parallel Training for High-Qu 6.6分 前50% 方法研究 #音视频生成 11. LoopVSR: A Loop Engineering Framework for Automated Rep 6.6分 前50% 方法研究 #音视频语音识别 12. Leading-Silence Augmentation and Multi-Stage Synthetic 6.5分 前50% 系统技术报告 #说话人日志 13. StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Sup 6.4分 前50% 方法研究 #语音识别 14. Ambisonics Encoding of Room Impulse Responses using a D 6.3分 前50% 方法研究 #音频生成 15. AT-ADD: All-Type Audio Deepfake Detection Challenge Sum 6.3分 前50% 数据集与基准 #音频伪造检测 16. S2Dialog: Multimodal Dialogue Retrieval with Semantic a 6.0分 前50% 方法研究 #音频检索 17. Measuring Fairness in Large Audio Language Models via S 5.6分 前50% 方法研究 #语音识别 18. Exploring ESC Winners with Nested Diagrams 5.4分 后50% 系统技术报告 #音乐理解 19. Architecture and Affordances of PLAUD: Performative Lat 5.0分 后50% 系统技术报告 #音乐生成 20. Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A T 4.4分 后50% 系统技术报告 #音视频理解 📋 论文列表 🥇 VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents 8.2/10 | 创新 1.1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-17 · 更新于 2026-09-04 · 20 min · 4165 words

Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones

📄 Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones 标签:#语音增强 #CNN #RNN #多通道 #模型评估 5.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 📝 5.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #CNN | #RNN #多通道 | arxiv 👥 作者与机构 第一作者:Oshan A. B. Yalegama(Department of Electronic and Telecommunication Engineering, University of Moratuwa, Sri Lanka) 第二作者:Wageesha N. Manamperi(School of Engineering, The Australian National University, Australia;其邮箱为 University of Moratuwa 邮箱,机构标注与邮箱存在不一致) 通讯作者:论文未明确标注通讯作者,仅通过脚注列出两位作者的邮箱 yalegamammoab.20@uom.lk 和 wageesham@uom.lk 💡 毒舌点评 本文首次把 ReTM 估计从协方差基线推进到监督深度学习,三种架构分别覆盖 STFT 深度卷积、时域滤波器组和 BiLSTM 时序建模,FuSNet 在仿真指标上确实有明显提升,LAeNet 的下游降噪效果也值得关注。但实验规模极小、完全依赖仿真,测试集在多数场景中只有 10 秒;正文与表格之间存在“场景 B 中 SCoNet MSE 优于 FuSNet”这类直接与数据相悖的表述;FuSNet 在下游语音增强中反而从 Baseline 的 4.07 dB 跌到 −1.19 dB,说明 ReTM 精度高不等于降噪有用;LAeNet 训练时拼接了目标信号却未说明推断输入,存在训练/推断不一致的严重疑点。再加上只给了音频样本、没有代码和权重,论文可靠性被明显拖累。 ...

2026-08-13 · 更新于 2026-09-04 · 5 min · 973 words

语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-13 · 更新于 2026-09-04 · 20 min · 4212 words

Echo-Aware Modulation for Compact-Latent Frequency-Time Modeling in Lightweight Acoustic Echo Cancellation

📄 Echo-Aware Modulation for Compact-Latent Frequency-Time Modeling in Lightweight Acoustic Echo Cancellation 标签:#回声消除 #RNN #实时处理 #语音增强 #音频理解 6.3/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #RNN | #回声消除 #实时处理 | arxiv 👥 作者与机构 第一作者:Ye Ni(东南大学信息科学与工程学院) 通讯作者:Ruiyu Liang(东南大学信息科学与工程学院 / 南京工程学院通信工程学院) 作者列表:Ye Ni(东南大学信息科学与工程学院)、Ruiyu Liang(东南大学信息科学与工程学院 / 南京工程学院通信工程学院)、Qingyun Wang(南京工程学院通信工程学院)、Kai Xie(西北工业大学智能声学与沉浸式通信中心)、Cairong Zou(东南大学信息科学与工程学院)、Björn W. Schuller(慕尼黑工业大学健康信息学主席 / 帝国理工学院语言、音频与音乐组) 💡 毒舌点评 这项工作精准定位了轻量级AEC在紧凑潜在空间中的性能退化问题,提出的Echo-Aware Modulation (EAM) 模块原理清晰,对Bark域压缩敏感性的剖析也颇有见地。然而,整体框架与作者前作MSA-DPCRN的继承关系过于直白,所谓“新框架”贡献有限。EAM模块本质上是一个精巧的多支路门控特征融合方案,其“回声感知”交互建模虽有效,但技术新颖性不足,更像一次工程上的“打补丁”而非方法论上的实质性创新。此外,不开源的情况严重削弱了这项工作的社区价值与影响力。 ...

2026-08-05 · 更新于 2026-09-04 · 3 min · 625 words

语音/音乐/音频论文速递 2026-08-05

语音/音乐/音频论文速递 2026-08-05 共分析 32 篇论文 ⚡ 今日概览 📥 抓取 32 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 6篇 ██████ #语音合成 3篇 ███ #音频生成 3篇 ███ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #多任务学习 1篇 █ 📊 论文评分排行榜(32 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8分 前25% 系统技术报告 #音乐转录 🥈 Efficient Audio Enhancement with a Differentiable Psych 8.2分 前25% 系统技术报告 #音频超分辨 🥉 GROW: Group-Relative Advantage-Weighted On-Policy Reinf 8.0分 前25% 方法研究 #语音合成 4. Reinforcement Learning with Evolving Rubrics as Rewards 7.6分 前25% 方法研究 #音频理解 5. Cross-cultural evaluation of taste-sound correspondence 7.5分 前25% 应用研究 #音乐理解 6. dots.tts.edit: Precisely Controlled Speech Editing with 7.4分 前50% 模型报告 #语音编辑 7. Anomalous Sound Detection Meets Noise-Aware Self-Superv 7.2分 前50% 方法研究 #音频事件检测 8. Towards More Expressive Spoken LLMs: Fine-Grained Inten 7.2分 前50% 方法研究 #语音交互 9. CLASVS: Continuous-Latent Autoregression for Melody-Pre 7.1分 前50% 方法研究 #自回归模型 10. Music Restoration via Latent Operator Optimization and 7.0分 前50% 方法研究 #音频修复 11. DDSynth-RL: Audio Synthesizer Inversion via Discrete Di 7.0分 前50% 方法研究 #音频生成 12. Language-Specialized Multi-Teacher On-Policy Distillati 6.9分 前50% 方法研究 #语音识别 13. AI-Based Sound Effect Generation: A Narrative Review of 6.9分 前50% 综述 #音频生成 14. Hear to See: Discerning Stateful Listening for Audio-Vi 6.8分 前50% 方法研究 #音频理解 15. On the Geometry of Music Bandwidth Extension in Latent 6.7分 前50% 方法研究 #音频理解 16. Learning Music Style for Piano Arrangement Through Cros 6.6分 前50% 方法研究 #音乐生成 17. Adaptive Modality Reliability Diagnosis and Restoration 6.4分 前50% 方法研究 #音视频理解 18. Latent Softmax for Data-Efficient Phoneme-Based Multili 6.3分 前50% 方法研究 #语音识别 19. Echo-Aware Modulation for Compact-Latent Frequency-Time 6.3分 前50% 方法研究 #语音增强 20. Geometric Cross-Modal Token Selection for Latency-Const 6.2分 前50% 方法研究 #音视频问答 21. Rethinking Modality Reliability in Multimodal Sentiment 6.2分 前50% 方法研究 #音视频理解 22. Towards Real-world Environment-aware Zero-shot Text-to- 6.1分 前50% 方法研究 #语音合成 23. MeloCodec: Harnessing Melodic Priors for High-Fidelity 6.1分 前50% 方法研究 #歌唱生成 24. Speaker Verification Under Real Classroom Conditions fo 5.7分 前50% 应用研究 #说话人验证 25. Band-Count Dense Modal Estimation with Fixed-Frequency 5.6分 前50% 方法研究 #音频理解 26. Simulation-Based Plate-Reverb Parameter Estimation from 5.5分 前50% 方法研究 #音频理解 27. MEMS Microphones as Ultrasonic Transducers: Nonlinear E 5.5分 前50% 系统技术报告 #音频生成 28. Beyond One-Size-Fits-All: Personalized and Culturally A 5.2分 后50% 方法研究 #语音合成 29. Deep Learning-Based Active Trim Panels for Enhanced Air 5.0分 后50% 方法研究 #多任务学习 30. Calliphony: A Calligraphy-Driven Interface for Real-Tim 5.0分 后50% 系统技术报告 #音乐生成 31. Evidence-Grounded Multimodal Knowledge Graph Constructi 4.7分 后50% 系统技术报告 #音视频问答 32. What Is Sonification? Toward a Philosophy of Sonificati 3.8分 后50% 理论研究 #音频理解 📋 论文列表 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-05 · 更新于 2026-09-04 · 24 min · 4991 words

Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art

📄 Sounding Canvas: Embedding Algorithms in Networked, Sensorial Sound Art 标签:#RNN #多模态模型 #实时处理 #音频理解 #Transformer 5.7/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 📝 5.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #RNN | #Transformer | #多模态模型 #实时处理 | arxiv 👥 作者与机构 第一作者:Luciano Ciamarone(independent researcher) 第二作者:Dora Motèque(independent researcher) 第三作者/通讯作者:Marco Giordano(Department of Information Engineering, Computer Science and Mathematics (DISIM), University of L’Aquila) 💡 毒舌点评 论文将触觉绘画、电容传感、CNN-LSTM技术与网络艺术进行了整合,工程管线完整,代码开源。但作为一篇投递至Organised Sound(论文明确目标为该期刊"Embedding Algorithms"特辑)的艺术工程论文,全篇缺乏任何定量评估、用户研究或与同类系统的公平对比,声称的“引导”“幽灵协作者”等现象仅依赖于展览中的非正式观察与日志初步描述,论文自身也明确承认“未进行正式分析”且“不作出明确声明”。这种声明与证据的巨大落差,使得其核心贡献仍停留在设计理念与工程蓝图层面。 ...

2026-08-04 · 更新于 2026-09-04 · 2 min · 234 words

语音/音乐/音频论文速递 2026-08-04

语音/音乐/音频论文速递 2026-08-04 共分析 39 篇论文。 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 3篇 ███ #音视频生成 3篇 ███ #语音属性识别 2篇 ██ #说话人验证 2篇 ██ #音视频理解 2篇 ██ #音频分类 2篇 ██ #音频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dat 8.3分 前25% 数据集与基准 #语音识别 🥈 FATE: Frame-Level Audio-Visual Temporal Embedding 8.3分 前25% 方法研究 #音视频理解 🥉 Allocation Before Ranking: Decoupled Token Compression 8.1分 前25% 方法研究 #音视频理解 4. Embodied Passive Aeroacoustic Perception Enables Relati 7.9分 前25% 系统技术报告 #声源定位 5. Interpretable MEG Decoding of Perceived Speech: Cortica 7.9分 前25% 方法研究 #音频检索 6. Beyond Prompt Adherence: Auditing Attribute-Level Voice 7.8分 前25% 方法研究 #语音合成 7. Hidden-Domain Routing for All-Type Audio Deepfake Detec 7.6分 前25% 系统技术报告 #领域适应 8. An End-to-End Workflow for Fin Whale Song Detection, No 7.5分 前25% 系统技术报告 #音频事件检测 9. SAGE: Switch-Aware EEG-Guided Soft Gating for Target Sp 7.3分 前50% 方法研究 #语音分离 10. Experience-Calibrated Contrastive Decoding for Mitigati 7.2分 前50% 方法研究 #语音合成 11. DRONEAUDIONET: Noise Suppression for Drone Audition-bas 7.2分 前50% 方法研究 #音频分离 12. Multi-Backbone Self-Supervised Ensembles for Audio Deep 7.2分 前50% 系统技术报告 #音频伪造检测 13. Hear, Invoke, and Understand: A Skill-Calling Multimoda 7.2分 前50% 方法研究 #音频理解 14. CultureVidBench: Benchmarking Cultural Understanding in 7.2分 前50% 数据集与基准 #音视频生成 15. SwanTale: Unified Multi-Speaker Speech and Audio Genera 7.1分 前50% 系统技术报告 #音频生成 16. Scene2Sound: Auditory-Grounded Soundscape Generation fo 7.0分 前50% 方法研究 #音频生成 17. The Learning Objective Governs Perceptual Narrowing: A 7.0分 前50% 方法研究 #语音属性识别 18. Discriminative Axis, Not Data Volume: What a Contrastiv 6.9分 前50% 方法研究 #语音属性识别 19. P-MUSE: Prompt-MIDI-Optional Model for Unified Instrume 6.9分 前50% 系统技术报告 #音频理解 20. AcoustiTrace: When Plausible Sound Violates Physics 6.9分 前50% 数据集与基准 #音视频生成 21. Gecko: Fast Private Inference via Secure Public Encoder 6.9分 前50% 系统技术报告 #迁移学习 22. LeapTalk: Breaking the Latency-Quality Trade-off in Tal 6.8分 前50% 方法研究 #音视频生成 23. Separate-and-Detect: Unified Drum Transcription and Ste 6.8分 前50% 方法研究 #音乐转录 24. Domain-Specific Evaluation of Text-to-Speech Systems: A 6.8分 前50% 数据集与基准 #语音合成 25. JoyAI-Talker: Full-Duplex Speech Interactive Large Mode 6.5分 前50% 系统技术报告 #语音合成 26. REIMU: Efficient Heterogeneous Hierarchical Reasoning f 6.4分 前50% 方法研究 #语音伪造检测 27. The Role of Disfluencies in Speech Translation 6.4分 前50% 数据集与基准 #语音翻译 28. SCOPE: Entanglement Frontier Escape for Source-Free Cla 6.3分 前50% 方法研究 #说话人验证 29. Uncertainty-Aware Crossmodal Fusion for Classification 6.3分 前50% 方法研究 #音频分类 30. Can Foundation Models Hear What Made That Sound? A Tier 6.3分 前50% 数据集与基准 #音频分类 31. QR-Erase: Efficient Subspace-Based Machine Unlearning w 6.0分 前50% 方法研究 #说话人验证 32. SGAD: A State-Guided Adaptive Decision Framework for Ro 6.0分 前50% 方法研究 #Transformer 33. Normal-Anchored First-Order Model-Agnostic Meta-Learnin 5.9分 前50% 方法研究 #语音识别 34. AnyBand: Unified Multi-Bandwidth Speech Extension via F 5.9分 前50% 方法研究 #语音超分 35. Sounding Canvas: Embedding Algorithms in Networked, Sen 5.7分 前50% 系统技术报告 #RNN 36. UOT-IR: Structured Routing of High-Polyphony Symbolic M 5.5分 前50% 方法研究 #音乐理解 37. Embodied Empathy: A Multimodal AR and LLM-Powered Syste 5.4分 后50% 应用研究 #音频交互 38. Analyzing Speech Condition Effects in Dysarthric ASR: A 5.0分 后50% 方法研究 #语音识别 39. Homebot: A Personal AI Agent for Conversational Home As 3.8分 后50% 系统技术报告 #语音交互 📋 论文列表 🥇 SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

2026-08-04 · 更新于 2026-09-04 · 28 min · 5820 words

A Study on Online Mask-based Beamforming Using Per-channel Masking for Spatially Distributed Microphones

📄 A Study on Online Mask-based Beamforming Using Per-channel Masking for Spatially Distributed Microphones 标签:#语音增强 #RNN #音频理解 #Transformer #模型评估 5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #RNN | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Wiebke Middelberg(未说明) 通讯作者:未说明 作者列表:Wiebke Middelberg(未说明)、Svantje Void(未说明)、Simon Doclo(未说明)、Ryan Corey(未说明) 💡 毒舌点评 本文敏锐地捕捉到分布式麦克风场景下单掩码的不足,通过每通道掩码将空间多样性纳入波束形成,在线实现进一步贴近实际应用,在近场噪声源场景下取得明确收益。然而,实验全部依赖模拟数据且未与同样面向分布式阵列的无监督或几何无关基线(如CGMM-MVDR、基于相对传递函数的波束形成)进行系统对比,仅靠IRM和单通道DNN掩码的结论支撑力有限,对多通道掩码估计本身的复杂性讨论几乎为零,使得方法的现实可部署性存疑。 ...

2026-07-30 · 更新于 2026-09-04 · 2 min · 226 words