论文解读

Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors

音频理解 | 9.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5382 字 阅读 →
论文解读

Do SpeechLMs Hear Their Own Opinions? Diagnosing and Mitigating Previous-Belief Contamination in Streaming Emotion Understanding

语音情感识别 | 8.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4535 字 阅读 →
论文解读

Spiking Neural Networks for Energy-Efficient Object Detection in Forward-Looking Sonar Imagery

音频事件检测 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4625 字 阅读 →
论文解读

Training DeepFilterNet with Accurate Room Acoustic Simulations Improves Single-Channel Speech Enhancement

语音增强 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4932 字 阅读 →
论文解读

Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction

语音情感识别 | 5.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6000 字 阅读 →
论文解读

Uncertainty-Aware Decision Making in Multimodal Large Language Models

音频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3533 字 阅读 →
论文解读

Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task

音频伪造检测 | 5.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7071 字 阅读 →
论文解读

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

空间音频 | 6.2/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8580 字 阅读 →
论文解读

How Fragile Is Your Watermark? Training-Free Structural Removal of Neural Audio Watermarks

音频水印 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7533 字 阅读 →
论文解读

Impulse Response Estimation via Laguerre-Fourier Expansion

音频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9364 字 阅读 →
论文解读

Moving Horizon Estimation for Underwater Target Tracking Based on Time-Difference-of-Arrival Measurements

声源定位 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5318 字 阅读 →
论文解读

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

音频编码 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6157 字 阅读 →
论文解读

The Null Token Knows: Reducing Message-Free Hallucination in ASR and NMT

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7035 字 阅读 →
论文解读

Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels

音频事件检测 | 6.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5205 字 阅读 →
论文解读

Trajectory Dynamics in Self-Supervised Learning Latent Space for Audio Deepfake Detection

语音伪造检测 | 7.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5887 字 阅读 →
论文解读

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

音视频问答 | 6.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6671 字 阅读 →
论文解读

myMediWhisper: Construction of Burmese Medical Speech Corpus and Whisper Fine-Tuning for Clinical Dialogue ASR

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8115 字 阅读 →
论文解读

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

语音交互 | 5.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7305 字 阅读 →
论文解读

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

音视频语音分离 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6225 字 阅读 →
论文解读

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

音频理解 | 7.4/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2056 字 阅读 →