MFCL Audio: An Audio Function Calling Evaluation for Large Language Models
MFCL Audio: An Audio Function Calling Evaluation for Large Language Models
MFCL Audio: An Audio Function Calling Evaluation for Large Language Models
MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models
MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts
视频行为识别 | 5.9/10
Multimodal Fusion via Self-Consistent Task-Gradient Fields
Multimodal Latent Language Modeling with Next-Token Diffusion
Multiple Choice Learning of Low-Rank Adapters for Language Modeling
MusicDET: Zero-Shot AI-Generated Music Detection
NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating
Neural-Inspired Modeling of Auditory Selection and Compensation for Audio-Visual Speech Separation
Omni-Perception Policy Optimization for Multimodal Emotion Reasoning
OmniDenseCap: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
OmniShow: Orchestrating Multimodal Conditions for Human-Object Interaction Video Generation
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
Optimality of FSQ tokens for continuous diffusion for categorical data with application to text-to-speech
PADS-TAL: Padding-Annealed Diffusion Sampling in Text-Aware Latent Space for Robust and Diverse Text-to-Music Generation
PCRNet: Phase-aware Complex Refinement Network for EEG-based Auditory Attention Decoding
PHALAR: Phasors for Learned Musical Audio Representations
PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs