论文解读

Native Active Perception as Reasoning for Omni-Modal Understanding

音视频理解 | 6.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6431 字 阅读 →
论文解读

Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation

音视频语音分离 | 6.2/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9223 字 阅读 →
论文解读

NeuroCLUS: A Foundation Model with Functional Clustering for Intracranial Neural Decoding

语音识别 | 6/10

 · 更新于 2026-09-06 · 约 26 分钟 · 12965 字 阅读 →
论文解读

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

 · 更新于 2026-09-06 · 约 20 分钟 · 9686 字 阅读 →
论文解读

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

音视频理解 | 7.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6079 字 阅读 →
论文解读

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

音视频理解 | 6.3/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8099 字 阅读 →
论文解读

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

音视频生成 | 6.9/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9284 字 阅读 →
论文解读

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

音视频问答 | 7.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7537 字 阅读 →
论文解读

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

音视频问答 | 7.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7777 字 阅读 →
论文解读

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

语音合成 | 8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5305 字 阅读 →
论文解读

PADS-TAL: Padding-Annealed Diffusion Sampling in Text-Aware Latent Space for Robust and Diverse Text-to-Music Generation

音乐生成 | 6.6/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10222 字 阅读 →
论文解读

PCRNet: Phase-aware Complex Refinement Network for EEG-based Auditory Attention Decoding

实时处理 | 6.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6788 字 阅读 →
论文解读

PHALAR: Phasors for Learned Musical Audio Representations

音乐生成 | 8/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7969 字 阅读 →
论文解读

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

空间音频 | 8.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8299 字 阅读 →
论文解读

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

音视频问答 | 7.3/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7522 字 阅读 →
论文解读

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

音乐生成 | 8.1/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2789 字 阅读 →
论文解读

Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration

音乐生成 | 6.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8684 字 阅读 →
论文解读

PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models

音视频理解 | 3.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5669 字 阅读 →
论文解读

ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3736 字 阅读 →
论文解读

Probing Cross-modal Information Hubs in Audio-Visual LLMs

音视频理解 | 7.2/10

 · 更新于 2026-09-06 · 约 6 分钟 · 2684 字 阅读 →