PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training
Polyphonia: Training-Free Context-Aware Music Editing with Acoustic-Informed Attention Calibration
Position: *Beyond Text* The Text-Centric Bias in Foundation Models Must Be Revisited for a Speech-First Future
Position: Towards Responsible Evaluation for Text-to-Speech
PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models
ProactiveLLM: Learning Active Interaction for Streaming Large Language Models
Probing Cross-modal Information Hubs in Audio-Visual LLMs
Quaternion Self-Attention with Shared Scores
Query-Based Asymmetric Modeling with Decoupled Input–Output Rates for Speech Restoration
Real-World Unsupervised Models Generalize to Predict Brain Responses to Out-of-Distribution Stimuli
Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas
ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models
REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
Rethinking Attention in Spiking Transformers: Overcoming Density Bias with Set Similarity
Robust Signal Enhancement via Fractional Detail Views and Knowledge Guided Multi-view Fusion
S3Audio: Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos
** | 6.5/10
SARSteer: Safeguarding Large Audio Language Models via Safe-Ablated Refusal Steering