SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings
📄 SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings #语音合成 #对比学习 #自监督学习 #低资源 #参数高效微调 5.8/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 📝 5.8/10 | 前50% | #语音合成 | #对比学习 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Priyam Mazumdar(University of Illinois Urbana-Champaign) 通讯作者:未说明 作者列表:Priyam Mazumdar(University of Illinois Urbana-Champaign)、Yurii Halychanskyi(University of Illinois Urbana-Champaign)、Steven Guo(University of Illinois Urbana-Champaign)、Mark Hasegawa-Johnson(University of Illinois Urbana-Champaign)、Volodymyr Kindratenko(University of Illinois Urbana-Champaign, National Center for Supercomputing Applications) 💡 毒舌点评 本文利用对比学习将Wav2Vec2声学信息注入字符嵌入以替换G2P模块,在极低资源英语TTS上取得了显著的WER下降(如1小时数据从24.7%降至7.5%)。思路直接,工程落地价值清晰。但是,实验对比严重不足,未能与任何基于SSL离散单元或其连续表征直接建模的TTS强基线进行对比,导致无法判断“声学注入”方案相较于完全端到端声学模型的独特价值。音素基线仅使用与下游语音域不匹配的g2pE,这一对比漏洞使得SPARCLE的巨大优势说服力存疑。此外,模型和代码的零开源承诺让社区无法验证其有效性,削弱了研究贡献。 ...