论文解读

NüshuVoice: Reviving the Voice of Endangered Nüshu with Pitch-Aware Text-to-Speech

语音合成 | 7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5298 字 阅读 →
论文解读

A Comparison of Generative and Discriminative Methods for Speech Enhancement: Robustness, Complexity, and Hallucination

语音增强 | 8.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 7008 字 阅读 →
论文解读

LiveBand: Live Accompaniment Generation in the Audio Domain

音乐生成 | 8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6832 字 阅读 →
论文解读

FiPA-SR -- FiLM-Conditioned Perceptually Informed Audio Super-Resolution

生成对抗网络 | 8.1/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4919 字 阅读 →
论文解读

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5475 字 阅读 →
论文解读

Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio

语音合成 | 10/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6556 字 阅读 →
论文解读

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

语音合成 | 9.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7303 字 阅读 →
论文解读

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

语音合成 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6239 字 阅读 →
论文解读

WaveNeXt 2: ConvNeXt-Based Fast Neural Vocoders With Residual Denoising and Sub-Modeling for GAN and Diffusion Models

语音合成 | 8.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5927 字 阅读 →
论文解读

WaveNeXt 2: ConvNeXt-Based Fast Neural Vocoders With Residual Denoising and Sub-Modeling for GAN and Diffusion Models

语音合成 | 9.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Toward Complex-Valued Neural Networks for Waveform Generation

语音合成 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5338 字 阅读 →
论文解读

Low-Bandwidth High-Fidelity Speech Transmission with Generative Latent Joint Source-Channel Coding

语音增强 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4889 字 阅读 →
论文解读

MixGAN-based Non-blind Bandwidth Extension for Audio Codec

音频增强 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4791 字 阅读 →