论文解读

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

音视频语音分离 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6225 字 阅读 →
论文解读

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

模型剪枝 | 8.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7856 字 阅读 →
论文解读

Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6691 字 阅读 →
论文解读

Dynamic Clustering for Cross-Segment Permutation Alignment in Long Speech Separation

语音分离 | 6.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6452 字 阅读 →
论文解读

EmoS: A Theory-Grounded Framework for Evaluating and Aligning Emotional Intelligence in Spoken Language Models

语音情感识别 | 6.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5637 字 阅读 →
论文解读

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

音频理解 | 7.4/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2056 字 阅读 →
论文解读

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

音视频语音识别 | 6.6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7993 字 阅读 →
论文解读

Investigating Multimodal Informativity under Different Partner Visibility Conditions in Video-Mediated Dialogue

多模态模型 | 5.9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7905 字 阅读 →
论文解读

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

音视频问答 | 6.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5213 字 阅读 →
论文解读

Machine-Learning-Based Diagnostic Framework for Passive Ultrasonic Detection of Railway Wheel Defects

音频分类 | 5.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5133 字 阅读 →
论文解读

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

音视频理解 | 6.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6883 字 阅读 →
论文解读

Mitigating Over-Suppression in Speech Enhancement via Inference-Time Rethink-and-Refine Correction Module

语音增强 | 6.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5718 字 阅读 →
论文解读

Multilingual Emotion Neurons in Large Audio-Language Models

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7199 字 阅读 →
论文解读

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

音乐生成 | 6.3/10

 · 更新于 2026-09-06 · 约 24 分钟 · 11885 字 阅读 →
论文解读

Neural Array-Generic Direction-of-Arrival Estimation Exploiting Array Transfer Functions

声源定位 | 6.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6231 字 阅读 →
论文解读

omni-macos: On-Device Omni-Modal Search on Apple Silicon

音频检索 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6772 字 阅读 →
论文解读

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

语音交互 | 8.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6734 字 阅读 →
论文解读

Physics-Informed Learning for Robust Acoustic Localization with Calibrated Uncertainty

声源定位 | 6.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6273 字 阅读 →
论文解读

RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction

音频生成 | 6.9/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9065 字 阅读 →
论文解读

REFRAMED: Towards Realistic Audio Description Generation for Movies

音频字幕生成 | 8.0/10

 · 更新于 2026-09-06 · 约 18 分钟 · 9013 字 阅读 →