Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech
📄 一句里换一种口音:用帧级掩码把全局引导切开 英文题目:Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech 一句话:针对句内码本切换中嵌入短语被载体口音同化的泄露问题,论文在离散扩散 TTS 的推理时用自注意力探测得到短语掩码并以独立尺度 λ 做语言对比引导,在 1200 条 12 方向合成语料上将嵌入短语语言准确率从 0.233 提至 0.518,代价是 UTMOS 轻度下降与需回退到 eager 注意力的 2.26 倍推理开销。 标签:#语音合成 | #扩散模型 | #语音克隆 | #多语言 | #零样本 评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Che Hyun Lee:Department of Electrical and Computer Engineering, Seoul National University Sangkwon Park:Department of Electrical and Computer Engineering, Seoul National University Donghun Kang:Department of Electrical and Computer Engineering, Seoul National University Dongwook Lee:Interdisciplinary Program in Artificial Intelligence, Seoul National University Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把全局分类器无关引导 Classifier-Free Guidance (CFG) 拆成帧级可控的语言对比引导,并用模型自注意力自举定位短语边界,实现了无训练的句内口音解耦,思路干净且与离散扩散的迭代去噪天然互补。短板是核心证据完全绑定在 OmniVoice 单一骨干和合成文本上,对自回归架构、真实自发码本切换及长时韵律连贯性的外推缺乏严格验证,推理侧需退回 eager 注意力导致的 2.26 倍开销也削弱了即插即用的说服力。 ...