论文解读

Retrieval-Based Speculative Decoding For Autoregressive Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3544 字 阅读 →
论文解读

Revisiting Direct Speech-to-Text Translation with Speech LLMS: Better Scaling than Cot Prompting?

语音翻译 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4766 字 阅读 →
论文解读

RFM-Editing: Rectified Flow Matching for Text-Guided Audio Editing

音频编辑 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4151 字 阅读 →
论文解读

RHO-PERFECT: Correlation Ceiling for Subjective Evaluation Datasets

模型评估 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4357 字 阅读 →
论文解读

RIR-Former: Coordinate-Guided Transformer for Continuous Reconstruction of Room Impulse Responses

房间脉冲响应 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4278 字 阅读 →
论文解读

RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models

语音识别 | 8.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3657 字 阅读 →
论文解读

RMODGDF: A Robust STFT-Derived Feature for Musical Instrument Recognition

音乐信息检索 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4290 字 阅读 →
论文解读

Robust Accent Identification via Voice Conversion and Non-Timbral Embeddings

语音识别 | 7.5/10

 · 更新于 2026-09-16 · 约 7 分钟 · 3282 字 阅读 →
论文解读

Robust and Lightweight F0 Estimation Through Mid-Level Fusion of DSP-Informed Features

基频估计 | 8.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5195 字 阅读 →
论文解读

Robust Deepfake Audio Detection via Multi-Level Intermediate Feature Fusion

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3781 字 阅读 →
论文解读

Robust Online Overdetermined Independent Vector Analysis Based on Bilinear Decomposition

语音分离 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4197 字 阅读 →
论文解读

RoCo: Robust Code for Fast and Effective Proactive Defense against Voice Cloning Attack

音频安全 | 7.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5166 字 阅读 →
论文解读

RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS

语音合成 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4067 字 阅读 →
论文解读

S-PRESSO: Ultra Low Bitrate Sound Effect Compression with Diffusion Autoencoders and Offline Quantization

音频生成 | 7.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5113 字 阅读 →
论文解读

S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models

音频分类 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4416 字 阅读 →
论文解读

S2Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

歌唱语音转换 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5290 字 阅读 →
论文解读

SA-SSL-MOS: Self-Supervised Learning MOS Prediction with Spectral Augmentation for Generalized Multi-Rate Speech Assessment

语音质量评估 | 7.0/10

 · 更新于 2026-09-16 · 约 12 分钟 · 5780 字 阅读 →
论文解读

SAASDNet: An EEG-Based Streaming Auditory Attention Switch Decoding Network for Self-Initiated Attention Switching in Mixed Speech

脑机接口 | 8.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4824 字 阅读 →
论文解读

SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution

音频增强 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4383 字 阅读 →
论文解读

Salad-VAE: Semantic Audio Compression with Language-Audio Distillation

音频压缩 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4645 字 阅读 →