论文解读

Robust Online Overdetermined Independent Vector Analysis Based on Bilinear Decomposition

语音分离 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4197 字 阅读 →
论文解读

RoCo: Robust Code for Fast and Effective Proactive Defense against Voice Cloning Attack

音频安全 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5166 字 阅读 →
论文解读

RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4067 字 阅读 →
论文解读

S-PRESSO: Ultra Low Bitrate Sound Effect Compression with Diffusion Autoencoders and Offline Quantization

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5113 字 阅读 →
论文解读

S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4416 字 阅读 →
论文解读

S2Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

歌唱语音转换 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5290 字 阅读 →
论文解读

SA-SSL-MOS: Self-Supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment

语音质量评估 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5780 字 阅读 →
论文解读

SAASDNet: An EEG-Based Streaming Auditory Attention Switch Decoding Network for Self-Initiated Attention Switching in Mixed Speech

脑机接口 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4824 字 阅读 →
论文解读

SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution

音频增强 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4383 字 阅读 →
论文解读

Salad-VAE: Semantic Audio Compression with Language-Audio Distillation

音频压缩 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4645 字 阅读 →
论文解读

Sampling-Rate-Agnostic Speech Super-Resolution Based on Gaussian Process Dynamical Systems with Deep Kernel Learning

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4782 字 阅读 →
论文解读

SAUNA: Song-Level Audio & User-Listening Data Neural Alignment

音乐信息检索 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3885 字 阅读 →
论文解读

Savgbench: Benchmarking Spatially Aligned Audio-Video Generation

基准测试 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4030 字 阅读 →
论文解读

Scalable Evaluation for Audio Identification Via Synthetic Latent Fingerprint Generation

音频检索 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3896 字 阅读 →
论文解读

Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4289 字 阅读 →
论文解读

Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4626 字 阅读 →
论文解读

Scaling Spoken Language Models with Syllabic Speech Tokenization

语音理解 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4144 字 阅读 →
论文解读

SceneRAG: Scene-Level Retrieval-Augmented Generation for Video Understanding

视频理解 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4080 字 阅读 →
论文解读

SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5790 字 阅读 →
论文解读

Secondary Source Placement for Sound Field Control Based on Ising Model

空间音频 | 6.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4089 字 阅读 →