Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech
📄 Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech #语音合成 7.9/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | #语音合成 | #参数高效微调 | arxiv 👥 作者与机构 Daniel O. Brito 和 Arnaldo Candido Junior 机构:圣保罗州立大学“儒利奥·德梅斯基塔·菲尔霍”(UNESP)生物科学、文学与精确科学研究所,巴西圣若泽-杜里奥普雷图。 💡 毒舌点评 这篇论文做了一件有趣的事:在语音合成领域,它没有卷参数量,而是去卷一个“情感向量”应该加在哪儿。作者很诚实,先试了改模型权重、改编解码器嵌入、改离散Token,结果都不行,最后发现最有效的居然是直接在说话人嵌入(x-vector)上做算术。这就像发现想让一个演员表现出愤怒,与其重写他的大脑(权重),不如调整他的“气质签名”(x-vector)来得直接。方法上,这是一个清晰的、基于排除法的实证研究,并且提出了一个训练免费的跨说话人情感迁移方案。主要短板在于实验范围较窄(只在一个模型上验证),且部分评估指标(如emotion2vec)在跨语言场景下可能饱和,使得结论的普适性和绝对性能评估打了折扣。总的来说,它提供了一个巧妙的、低成本的实用思路,但离定义一个新范式还有距离。 📌 核心摘要 本文研究了在基于语言模型的大规模文本到语音(LM-TTS)系统中,任务向量算术(Task-Vector Arithmetic)是否能实现跨说话人的情感控制。通过一个系统性消除研究,作者在Qwen3-TTS-12Hz-1.7B模型上测试了四种候选操作对象:模型权重(通过LoRA微调)、连续编解码器嵌入、离散编解码器Token以及由ECAPA-TDNN编码器产生的说话人嵌入(x-vector)。研究发现,情感韵律的主要载体是x-vector,而非模型权重或Token。基于此,作者提出了一种无需训练的方法:在x-vector空间进行多说话人均值质心算术。具体地,情感向量 \(\tau_{\text{emo}}\) 定义为情感与中性x-vector的质心差,并应用于目标说话人的中性x-vector:\(\mathbf{x}_{\text{new}} = \mathbf{x}(\text{target}, \text{neutral}) + \alpha \cdot \tau_{\text{emo}}\)。使用ESD(英语)提取 \(\tau\),在emoUERJ(巴西葡萄牙语)上进行跨语言验证,结果显示,在英语未见说话人上,情感相似度(EECS)平均提升+0.29;在巴西葡萄牙语未见说话人上,提升+0.09。该方法在保持身份(WavLM SECS ≳0.88)和可懂度(WER ≈0)方面表现良好。这些结果为解决基于Token的TTS架构与质心算术的不兼容性提供了初步证据,表明当算术操作迁移至说话人嵌入时,该方法是可行的。 ...