论文解读

Quaternion Self-Attention with Shared Scores

语音增强 | 6.3/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10452 字 阅读 →
论文解读

Query-Based Asymmetric Modeling with Decoupled Input–Output Rates for Speech Restoration

语音增强 | 7.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6737 字 阅读 →
论文解读

Real-World Unsupervised Models Generalize to Predict Brain Responses to Out-of-Distribution Stimuli

模型评估 | 6.9/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9530 字 阅读 →
论文解读

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

 · 更新于 2026-09-06 · 约 15 分钟 · 7136 字 阅读 →
论文解读

ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models

语音编码 | 8/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6645 字 阅读 →
论文解读

REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation

音视频生成 | 7.3/10

 · 更新于 2026-09-06 · 约 26 分钟 · 12601 字 阅读 →
论文解读

Rethinking Attention in Spiking Transformers: Overcoming Density Bias with Set Similarity

音频分类 | 3.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7033 字 阅读 →
论文解读

Robust Signal Enhancement via Fractional Detail Views and Knowledge Guided Multi-view Fusion

语音增强 | 5.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8257 字 阅读 →
论文解读

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

音视频生成 | 7.6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7734 字 阅读 →
论文解读

SAM Audio: Segment Anything in Audio

音频分离 | 9.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6829 字 阅读 →
论文解读

SARSteer: Safeguarding Large Audio Language Models via Safe-Ablated Refusal Steering

SARSteer: Safeguarding Large Audio Language Models via Safe-Ablated Refusal Steering

 · 更新于 2026-09-06 · 约 19 分钟 · 9250 字 阅读 →
论文解读

Scaling Behavior in Model Fine-tuning for Audio DeepFake Detection

音频伪造检测 | 5.9/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7857 字 阅读 →
论文解读

Scaling Transformers for End-to-End Discrete Audio Tokenization

音频编码 | 7.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

语音编码 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5991 字 阅读 →
论文解读

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

音视频生成 | 7.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6404 字 阅读 →
论文解读

Simultaneous Speech-to-Speech Translation Without Aligned Data

语音翻译 | 8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5628 字 阅读 →
论文解读

SONAR: Spectral‑Contrastive Audio Residuals for Generalizable Deepfake Detection

语音伪造检测 | 7.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7289 字 阅读 →
论文解读

SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering

音频修复 | 8/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8353 字 阅读 →
论文解读

Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech

语音合成 | 7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6988 字 阅读 →
论文解读

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

模型剪枝 | 5.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5098 字 阅读 →