论文解读

Robust Accent Identification via Voice Conversion and Non-Timbral Embeddings

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3282 字 阅读 →
论文解读

S2Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

歌唱语音转换 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5290 字 阅读 →
论文解读

Speaker Anonymisation for Speech-Based Suicide Risk Detection

语音匿名化 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3992 字 阅读 →
论文解读

StylePitcher: Generating Style-Following and Expressive Pitch Curves for Versatile Singing Tasks

歌唱语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5251 字 阅读 →
论文解读

Target Speaker Anonymization in Multi-Speaker Recordings

语音匿名化 | 7.6/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3887 字 阅读 →
论文解读

VChangeCodec: An Ultra Low-Complexity Neural Speech Codec with Built-In Voice Changer for Customized Real-Time Communication

语音转换 语音增强 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5237 字 阅读 →
论文解读

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

1. **问题**:零样本语音转换需要同时实现高质量的说话人特征迁移和低延迟的流式推理,这是一个尚未很好解决的挑战。 2. **方法核心**:提出X-VC系统,在预训练的SAC语音编解码器的潜在空间中进行一步转换。核心是一个双条件声学转换器,它联合处理源语音的编解码器潜在表示和目标参考语音的帧级梅尔

 · 更新于 2026-09-24 · 约 9 分钟 · 4441 字 阅读 →
论文解读

MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora

这篇论文旨在解决零样本语音模仿任务中高质量平行训练数据稀缺的核心瓶颈。传统方法要么依赖复杂的解耦架构,要么使用合成语音作为训练目标,导致输出质量受限于合成系统的能力。作者提出了一种名为 **MimicLM** 的新框架,其核心创新在于**“角色交换”的数据构建策略**:使用TTS生成的语音作为**训

 · 更新于 2026-09-24 · 约 10 分钟 · 4878 字 阅读 →
论文解读

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

这篇论文旨在解决零样本语音转换中**高保真说话人迁移**与**低延迟流式推理**难以兼得的核心挑战。作者提出了**X-VC**系统,其核心创新在于**在预训练神经编解码器(SAC)的潜在空间中进行一步

 · 更新于 2026-09-24 · 约 10 分钟 · 4920 字 阅读 →