论文解读

Retrieval-Based Speculative Decoding For Autoregressive Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3544 字 阅读 →
论文解读

RoCo: Robust Code for Fast and Effective Proactive Defense against Voice Cloning Attack

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5166 字 阅读 →
论文解读

RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4067 字 阅读 →
论文解读

SFM-TTS: Lightweight and Rapid Speech Synthesis with Flexible Shortcut Flow Matching

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5280 字 阅读 →
论文解读

Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-Scale Dataset Cleansing

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4546 字 阅读 →
论文解读

SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4202 字 阅读 →
论文解读

SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4626 字 阅读 →
论文解读

SPAM: Style Prompt Adherence Metric for Prompt-Based TTS

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4628 字 阅读 →
论文解读

Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts

语音质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4591 字 阅读 →
论文解读

STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5581 字 阅读 →
论文解读

Syncspeech: Efficient and Low-Latency Text-to-Speech Based on Temporal Masked Transformer

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4853 字 阅读 →
论文解读

SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4862 字 阅读 →
论文解读

Synthetic yet Striking? Assessing Vocal Charisma in TTS via Perceptual and Algorithmic Measures

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4258 字 阅读 →
论文解读

T-Cache: Fast Inference For Masked Generative Transformer-Based TTS Via Prompt-Aware Feature Caching

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4509 字 阅读 →
论文解读

T-Mimi: A Transformer-Based Mimi Decoder for Real-Time On-Phone TTS

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3841 字 阅读 →
论文解读

TAGARELA - A Portuguese Speech Dataset from Podcasts

语音识别 语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3967 字 阅读 →
论文解读

Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4678 字 阅读 →
论文解读

TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4601 字 阅读 →
论文解读

Training Flow Matching Models with Reliable Labels via Self-Purification

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4189 字 阅读 →
论文解读

Understanding the Strengths and Weaknesses of SSL Models for Audio Deepfake Model Attribution

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4679 字 阅读 →