Multimodal Fusion via Self-Consistent Task-Gradient Fields
Multimodal Fusion via Self-Consistent Task-Gradient Fields
Multimodal Fusion via Self-Consistent Task-Gradient Fields
Multimodal Latent Language Modeling with Next-Token Diffusion
Multiple Choice Learning of Low-Rank Adapters for Language Modeling
MusicDET: Zero-Shot AI-Generated Music Detection
NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating
Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation
Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
OmniDenseCap: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
OmniShow: Orchestrating Multimodal Conditions for Human-Object Interaction Video Generation
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
Optimality of FSQ tokens for continuous diffusion for categorical data with application to text-to-speech
PADS-TAL: Padding-Annealed Diffusion Sampling in Text-Aware Latent Space for Robust and Diverse Text-to-Music Generation
PCRNet: Phase-aware Complex Refinement Network for EEG-based Auditory Attention Decoding
PHALAR: Phasors for Learned Musical Audio Representations
PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training
Polyphonia: Training-Free Context-Aware Music Editing with Acoustic-Informed Attention Calibration
Position: *Beyond Text* The Text-Centric Bias in Foundation Models Must Be Revisited for a Speech-First Future