Bridging Your Imagination with Audio-Video Generation via a Unified Director
Bridging Your Imagination with Audio-Video Generation via a Unified Director
Bridging Your Imagination with Audio-Video Generation via a Unified Director
Characterizing the Predictive Impact of Modalities with Supervised Latent-Variable Modeling
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
CoCoEmo: Composable and Controllable Human-Like Emotional TTS via Activation Steering
CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks
** | 7.5/10
DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing
Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox
DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs
EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs
Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability
FakeWorld 1.0: An Omni modal Benchmark for Fake Media and Content
FoeGlass: When Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors
From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
Group Cognition Learning: Making Everything Better Through Controlled Two-Stage Agents Collaboration
Hearing Without Noticing? Attention-Aware Stealthy Black-box Adversarial Audio Attacks