论文解读

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

音频场景理解 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4566 字 阅读 →
论文解读

Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences

多模态模型 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4700 字 阅读 →
论文解读

OmniCVR: A Benchmark for Omni-Composed Video Retrieval with Vision, Audio, and Text

音频检索 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5159 字 阅读 →
论文解读

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

基准测试 | 7.8/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3836 字 阅读 →
论文解读

OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM

音频问答 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6263 字 阅读 →
论文解读

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

多模态模型 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6080 字 阅读 →
论文解读

PrismAudio: Decomposed Chain-of-Thought and Multi-dimensional Rewards for Video-to-Audio Generation

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5436 字 阅读 →
论文解读

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

音频问答 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4714 字 阅读 →
论文解读

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

音频分类 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 5010 字 阅读 →
论文解读

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

语音对话系统 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4469 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6243 字 阅读 →
论文解读

Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

音频问答 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4393 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4797 字 阅读 →
论文解读

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

视频生成 | 8.8/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4252 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

音频问答 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4348 字 阅读 →
论文解读

The Deleuzian Representation Hypothesis

模型评估 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4035 字 阅读 →
论文解读

TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO- DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN- FERENCE ON BATTERY-POWERED SMALL DEVICES

多模态模型 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5357 字 阅读 →
论文解读

TRIBE: TRImodal Brain Encoder for whole-brain fMRI response prediction

脑编码 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5372 字 阅读 →
论文解读

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

视频摘要 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 4001 字 阅读 →