语音/音乐/音频论文速递 2026-08-18
语音/音乐/音频论文速递 2026-08-18 共分析 39 篇论文 ⚡ 今日概览 📥 抓取 39 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 3篇 ███ #语音增强 3篇 ███ #语音识别 3篇 ███ #音频分类 3篇 ███ #音频理解 3篇 ███ #声源定位 2篇 ██ #语音编码 2篇 ██ #音视频理解 2篇 ██ 📊 论文评分排行榜(39 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retri 7.9分 前25% 数据集与基准 #音频检索 🥈 What Makes a Good Layer? Assessing the Layer-Wise Intri 7.7分 前25% 方法研究 #音乐理解 🥉 How Fragile Is Your Watermark? Training-Free Structural 7.6分 前25% 方法研究 #音频水印 4. Numerical and perceptual validity of synthetic Head-Rel 7.6分 前25% 应用研究 #声源定位 5. ACE-Cap: Active Evidence Acquisition via Agentic Co-Evo 7.5分 前25% 方法研究 #音频字幕生成 6. CineDub: Scaling End-to-End Video Dubbing to Multi-Spea 7.3分 前50% 方法研究 #音视频语音合成 7. Prototype-Rectified Iterative Self-supervised Manifold 7.2分 前50% 方法研究 #音频分类 8. CLARA: Clip-Level Multimodal Alignment with VLM-Derived 7.2分 前50% 方法研究 #音视频理解 9. Impulse Response Estimation via Laguerre-Fourier Expans 6.8分 前50% 方法研究 #音频理解 10. SingDance: Compositional Zero-Shot Singing-and-Dancing 6.8分 前50% 方法研究 #音视频生成 11. Listen, Reason, and Segment: Aligning LALMs with Editor 6.8分 前50% 方法研究 #音频理解 12. AnyTalk: Speech Animation for Arbitrary Characters Leve 6.7分 前50% 方法研究 #音视频语音合成 13. Evidence of Absence: Cross-Modal Abductive Risk Percept 6.6分 前50% 方法研究 #音频事件检测 14. ParaJSCC: A Parameterized Framework for Reusable Multim 6.6分 前50% 方法研究 #音频编码 15. ARENA: Automated Red-Teaming for Large Audio Language M 6.5分 前50% 方法研究 #音频理解 16. The Null Token Knows: Reducing Message-Free Hallucinati 6.5分 前50% 方法研究 #语音识别 17. Moving Horizon Estimation for Underwater Target Trackin 6.5分 前50% 方法研究 #声源定位 18. Multi-Granularity Sentiment Integration for LLM-Based M 6.5分 前50% 方法研究 #音视频理解 19. Adding Voice Cloning to Text-to-Audio-Video Models with 6.4分 前50% 方法研究 #语音克隆 20. Xemo-Talker: Unlock Emotions Explicitly for Audio-Drive 6.2分 前50% 方法研究 #音视频生成 21. Separate First, Then Associate: A Two-Stage Approach fo 6.2分 前50% 系统技术报告 #音视频语音分离 22. Geometry-adaptive Ambisonic encoding for sparse microph 6.2分 前50% 方法研究 #空间音频 23. A survey of AI-generated voices and their detection 6.1分 前50% 综述 #语音伪造检测 24. Iterative Self-Learning for Expressive Text-to-Speech S 6.1分 前50% 方法研究 #语音合成 25. Cached LLM Probability Retrieval for Speech Recognition 6.1分 前50% 方法研究 #语音识别 26. DuplexGen: Decoupling Content, Timing, and Acoustics fo 6.1分 前50% 方法研究 #语音合成 27. Speaker-Normalized Semantic Speech Tokens via Iterative 6.0分 前50% 方法研究 #语音编码 28. Multi-Modal Generative Fuzzy System: Fuzzy Inference Gu 5.9分 前50% 方法研究 #音视频问答 29. A Parameter-Free Few-Shot Evaluation for Elephant Vocal 5.9分 前50% 应用研究 #音频分类 30. Contrastive Learning with Variational Regularization fo 5.9分 前50% 方法研究 #语音合成 31. Sonifying I2S Transport Signals to Detect Transmission 5.9分 前50% 系统技术报告 #音频分类 32. An Analytical-Prior Framework for Data-Efficient Predic 5.8分 前50% 方法研究 #预训练 33. Navigating Speech Enhancement for Real-Time MRI: A Syst 5.7分 前50% 应用研究 #语音增强 34. Distinguishing AI-Generated Music from Edited Audio as 5.6分 前50% 方法研究 #音频伪造检测 35. A Novel Binaural Cue Preservation Loss for DNN-Based Bi 5.6分 前50% 方法研究 #语音增强 36. Unadapted Multilingual ASR on a Garrusi Kurdish Evaluat 5.6分 前50% 方法研究 #语音识别 37. Feedforward Active Speech Suppression Based on Time Ser 5.5分 前50% 方法研究 #语音增强 38. Using the Mimi codec for metalinguistic representations 4.7分 后50% 方法研究 #语音编码 39. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Ran 3.5分 后50% 系统技术报告 #音频编码 📋 论文列表 🥇 INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...