论文解读

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

语音分离 | 7.5/10

 · 更新于 2026-09-06 · 约 25 分钟 · 12209 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4323 字 阅读 →
论文解读

MIAM: Modality Imbalance-Aware Masking for Multimodal Ecological Applications

生态计算 | 8.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5623 字 阅读 →
论文解读

MindMix: A Multimodal Foundation Model for Auditory Perception Decoding via Deep Neural-Acoustic Alignment

音频分类 | 9.0/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9208 字 阅读 →
论文解读

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5854 字 阅读 →
论文解读

NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching

多模态模型 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5387 字 阅读 →
论文解读

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

音频场景理解 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4373 字 阅读 →
论文解读

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

基准测试 数据集 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4749 字 阅读 →
论文解读

OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text

音频检索 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5371 字 阅读 →
论文解读

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

基准测试 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4370 字 阅读 →
论文解读

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

多模态模型 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5484 字 阅读 →
论文解读

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

模型比较 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4240 字 阅读 →
论文解读

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

音频问答 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4257 字 阅读 →
论文解读

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

音频分类 | 9.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6625 字 阅读 →
论文解读

RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System

语音伪造检测 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4899 字 阅读 →
论文解读

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

机器人操作 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5562 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4966 字 阅读 →
论文解读

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

多模态模型 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4951 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4222 字 阅读 →
论文解读

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

视频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4282 字 阅读 →