论文解读

MER-DG: Modality-Entropy Regularization for Multimodal Domain Generalization

音视频理解 | 5.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4947 字 阅读 →
论文解读

MetaPerch: Learning from metadata for bioacoustics foundation models

音频分类 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6330 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

 · 更新于 2026-09-24 · 约 16 分钟 · 7591 字 阅读 →
论文解读

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

 · 更新于 2026-09-24 · 约 16 分钟 · 7525 字 阅读 →
论文解读

Multimodal Fact-Level Attribution for Verifiable Reasoning

音频理解 | 6.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11220 字 阅读 →
论文解读

Multimodal Fusion via Self-Consistent Task-Gradient Fields

鲁棒性 | 5.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7110 字 阅读 →
论文解读

Multimodal Latent Language Modeling with Next-Token Diffusion

语音合成 | 6.1/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2865 字 阅读 →
论文解读

Multimodal Meta-Verifier with Explicit Structured Recalibration

多模态模型 | 5.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6947 字 阅读 →
论文解读

Multiple Choice Learning of Low-Rank Adapters for Language Modeling

多模态模型 | 8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6764 字 阅读 →
论文解读

MusicDET: Zero-Shot AI-Generated Music Detection

音频伪造检测 | 6.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7804 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

音频事件检测 | 5.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6370 字 阅读 →
论文解读

Native Active Perception as Reasoning for Omni-Modal Understanding

音视频理解 | 6.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6431 字 阅读 →
论文解读

Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation

音视频语音分离 | 6.2/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9223 字 阅读 →
论文解读

NeuroCLUS: A Foundation Model with Functional Clustering for Intracranial Neural Decoding

语音识别 | 6/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12965 字 阅读 →
论文解读

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

 · 更新于 2026-09-24 · 约 20 分钟 · 9686 字 阅读 →
论文解读

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6079 字 阅读 →
论文解读

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8099 字 阅读 →
论文解读

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9284 字 阅读 →
论文解读

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

音视频问答 | 7.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7537 字 阅读 →
论文解读

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

音视频问答 | 7.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7777 字 阅读 →