论文解读

Combining Multi-Order Attention and Multi-Resolution Discriminator for High-Fidelity Neural Vocoder

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6236 字 阅读 →
论文解读

Confidence-Based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4790 字 阅读 →
论文解读

Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5822 字 阅读 →
论文解读

CosyAccent: Duration-Controllable Accent Normalization using Source-Synthesis Training Data

语音转换 | 7.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5037 字 阅读 →
论文解读

Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis

语音克隆 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4837 字 阅读 →
论文解读

DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5316 字 阅读 →
论文解读

Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4986 字 阅读 →
论文解读

Direct Preference Optimization For Speech Autoregressive Diffusion Models

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4779 字 阅读 →
论文解读

Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4612 字 阅读 →
论文解读

DMP-TTS: Disentangled Multi-Modal Prompting for Controllable Text-to-Speech with Chained Guidance

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6161 字 阅读 →
论文解读

Do You Hear What I Mean? Quantifying the Instruction-Perception GAP in Instruction-Guided Expressive Text-to-Speech Systems

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4453 字 阅读 →
论文解读

ECSA: Dual-Branch Emotion Compensation for Emotion-Consistent Speaker Anonymization

语音匿名化 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4486 字 阅读 →
论文解读

EMG-to-Speech with Fewer Channels

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4171 字 阅读 →
论文解读

Emilia-NV: A Non-Verbal Speech Dataset with Word-Level Annotation for Human-Like Speech Modeling

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4512 字 阅读 →
论文解读

EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5127 字 阅读 →
论文解读

EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4419 字 阅读 →
论文解读

Emotion-Aligned Generation in Diffusion Text to Speech Models Via Preference-Guided Optimization

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4704 字 阅读 →
论文解读

Emotional Damage: Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3817 字 阅读 →
论文解读

Emotional Dimension Control in Language Model-Based Text-To-Speech: Spanning a Broad Spectrum of Human Emotions

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4379 字 阅读 →
论文解读

Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech Codec

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4068 字 阅读 →