论文解读

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

声源定位 | 8.1/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8152 字 阅读 →
论文解读

Joint Enhancement and Classification using Coupled Diffusion Models of Signals and Logits

语音识别 | 9.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6415 字 阅读 →
论文解读

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

语音交互 | 8.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7266 字 阅读 →
论文解读

Language Model Augmented Semi-Supervised Statistical Inference

语音属性识别 | 5.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6984 字 阅读 →
论文解读

Learning Tight Rejection Boundaries without Negatives for Strict One-Class Audio Deepfake Detection

语音伪造检测 | 9.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7104 字 阅读 →
论文解读

LightAVSeg: Lightweight Audio-Visual Segmentation

模型压缩 | 6.3/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8803 字 阅读 →
论文解读

Listening Through the Noise: Cauchy-Driven Diffusion Bridges for Robust Gastrointestinal Auscultation and Clinical Benchmarking

音频修复 | 7.4/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8704 字 阅读 →
论文解读

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

音频理解 | 9.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6965 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频理解 | 6.4/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8593 字 阅读 →
论文解读

MER-DG: Modality-Entropy Regularization for Multimodal Domain Generalization

音视频理解 | 5.4/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4947 字 阅读 →
论文解读

MetaPerch: Learning from metadata for bioacoustics foundation models

音频分类 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6330 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

 · 更新于 2026-09-06 · 约 16 分钟 · 7591 字 阅读 →
论文解读

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

 · 更新于 2026-09-06 · 约 16 分钟 · 7525 字 阅读 →
论文解读

Multimodal Fact-Level Attribution for Verifiable Reasoning

音频理解 | 6.4/10

 · 更新于 2026-09-06 · 约 23 分钟 · 11220 字 阅读 →
论文解读

Multimodal Fusion via Self-Consistent Task-Gradient Fields

鲁棒性 | 5.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7110 字 阅读 →
论文解读

Multimodal Latent Language Modeling with Next-Token Diffusion

语音合成 | 6.1/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2865 字 阅读 →
论文解读

Multimodal Meta-Verifier with Explicit Structured Recalibration

多模态模型 | 5.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6947 字 阅读 →
论文解读

Multiple Choice Learning of Low-Rank Adapters for Language Modeling

多模态模型 | 8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6764 字 阅读 →
论文解读

MusicDET: Zero-Shot AI-Generated Music Detection

音频伪造检测 | 6.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7804 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 5.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6370 字 阅读 →