论文解读

Multimodal Fusion via Self-Consistent Task-Gradient Fields

Multimodal Fusion via Self-Consistent Task-Gradient Fields

 · 更新于 2026-10-01 · 约 1 分钟 · 32 字 阅读 →
论文解读

Multimodal Latent Language Modeling with Next-Token Diffusion

Multimodal Latent Language Modeling with Next-Token Diffusion

 · 更新于 2026-10-01 · 约 1 分钟 · 33 字 阅读 →
论文解读

Multiple Choice Learning of Low-Rank Adapters for Language Modeling

Multiple Choice Learning of Low-Rank Adapters for Language Modeling

 · 更新于 2026-10-01 · 约 1 分钟 · 35 字 阅读 →
论文解读

MusicDET: Zero-Shot AI-Generated Music Detection

MusicDET: Zero-Shot AI-Generated Music Detection

 · 更新于 2026-10-01 · 约 1 分钟 · 31 字 阅读 →
论文解读

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

 · 更新于 2026-10-01 · 约 1 分钟 · 40 字 阅读 →
论文解读

Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation

Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation

 · 更新于 2026-10-01 · 约 1 分钟 · 37 字 阅读 →
论文解读

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

 · 更新于 2026-10-01 · 约 1 分钟 · 33 字 阅读 →
论文解读

OmniDenseCap: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

OmniDenseCap: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

 · 更新于 2026-10-01 · 约 1 分钟 · 36 字 阅读 →
论文解读

OmniShow: Orchestrating Multimodal Conditions for Human-Object Interaction Video Generation

OmniShow: Orchestrating Multimodal Conditions for Human-Object Interaction Video Generation

 · 更新于 2026-10-01 · 约 1 分钟 · 35 字 阅读 →
论文解读

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

 · 更新于 2026-10-01 · 约 1 分钟 · 36 字 阅读 →
论文解读

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

 · 更新于 2026-10-01 · 约 1 分钟 · 36 字 阅读 →
论文解读

Optimality of FSQ tokens for continuous diffusion for categorical data with application to text-to-speech

Optimality of FSQ tokens for continuous diffusion for categorical data with application to text-to-speech

 · 更新于 2026-10-01 · 约 1 分钟 · 40 字 阅读 →
论文解读

PADS-TAL: Padding-Annealed Diffusion Sampling in Text-Aware Latent Space for Robust and Diverse Text-to-Music Generation

PADS-TAL: Padding-Annealed Diffusion Sampling in Text-Aware Latent Space for Robust and Diverse Text-to-Music Generation

 · 更新于 2026-10-01 · 约 1 分钟 · 40 字 阅读 →
论文解读

PCRNet: Phase-aware Complex Refinement Network for EEG-based Auditory Attention Decoding

PCRNet: Phase-aware Complex Refinement Network for EEG-based Auditory Attention Decoding

 · 更新于 2026-10-01 · 约 1 分钟 · 36 字 阅读 →
论文解读

PHALAR: Phasors for Learned Musical Audio Representations

PHALAR: Phasors for Learned Musical Audio Representations

 · 更新于 2026-10-01 · 约 1 分钟 · 33 字 阅读 →
论文解读

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

 · 更新于 2026-10-01 · 约 1 分钟 · 35 字 阅读 →
论文解读

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

 · 更新于 2026-10-01 · 约 1 分钟 · 36 字 阅读 →
论文解读

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

 · 更新于 2026-10-01 · 约 1 分钟 · 37 字 阅读 →
论文解读

Polyphonia: Training-Free Context-Aware Music Editing with Acoustic-Informed Attention Calibration

Polyphonia: Training-Free Context-Aware Music Editing with Acoustic-Informed Attention Calibration

 · 更新于 2026-10-01 · 约 1 分钟 · 35 字 阅读 →
论文解读

Position: *Beyond Text* The Text-Centric Bias in Foundation Models Must Be Revisited for a Speech-First Future

Position: *Beyond Text* The Text-Centric Bias in Foundation Models Must Be Revisited for a Speech-First Future

 · 更新于 2026-10-01 · 约 1 分钟 · 42 字 阅读 →