英文题目:CraftTTS: Fine-Grained Prosody Control for Text-to-Speech

会议身份:conference:interspeech:2026:conference-paper-id:yang26l_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#强化学习 #韵律 #零样本 #文本到语音

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Wenbing Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Qihang Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Bingsong Bai:机构信息未能从会议 PDF 纯文本可靠映射
  • Zihan Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Yueran Hou:机构信息未能从会议 PDF 纯文本可靠映射
  • Peilei Jia:机构信息未能从会议 PDF 纯文本可靠映射
  • Yingming Gao:机构信息未能从会议 PDF 纯文本可靠映射
  • Ya Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Jun Gao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该工作处理零样本文本到语音,输入为文本与说话人提示,输出为带词级强度与语速标记的语音,难点在于严格局部声学约束易破坏自回归先验并引发伪影、异常停顿与情感泄漏。方法分三阶段:先以DeepSeek-V3标注重读、弱读、快、慢四类标签,经教师Indextts2多轮续写与优选构造偏好对,提供无人工标注的监督信号;再以联合监督微调与直接偏好优化在目标骨干CosyVoice 2上建立标签到声学实现的敏感性;最后以组相对策略优化与多维韵律奖励在采样组内平衡可懂度、强度对比与节奏。与直接声学规划或全局风格迁移不同,其取舍是不硬约束时长参数,而以可懂度锚定、情感解耦与节奏正则间接塑形。在中文InstructTTSEval子集评测下,CraftTTS完整模型的NMOS得分为3.87±0.13,高于基线CosyVoice 2的NMOS得分3.67±0.14。结论适用边界受限于中文短句与四类离散标签,尚未验证跨语言长篇章与连续韵律外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么研究生要先看清任务?

本文的输入是带词级韵律标签的中文文本加一段用于克隆音色的参考语音,输出是保留参考人音色但在指定词上实现重读、轻读、加快或放慢的连续语音。目标读者是刚进入语音合成的研究生,需要先建立的动作是把任务拆成三句话复述:谁说,由参考语音决定;说什么,由文本决定;哪几个词要怎么说,由 strong、weak、fast、slow 4 种标签决定。

论文反复强调的矛盾是零样本大模型全局克隆已经很好,但一旦在词级别严格加力,模型容易出现声学伪影、不自然停顿或全局情绪泄漏,也就是局部听话了但整句不自然了。学习时不要把韵律控制理解成简单调音量或调时长,原文把人类通过强度与语速变化形成局部语言结构的现象称为 speech cadence,建模对象是这种随语义变化的起伏,而不是全局混响或全局情绪。论文脚注给出了示例页链接,本次解读不对其可达性做断言,复述方法时只依据正文与图。

后续所有方法都可以回到这个输入输出检查:标签是否落在正确的词边界上,整句是否仍然流畅可懂,音色是否还是参考人的音色。

已有路线各管哪一段,为什么还缺稳定词级控制?

按同输入、同目标、同运行阶段对照,现有路线可分为 4 类。第一类是基于参考的风格迁移,它用一段参考语音整体搬运风格,优点是全局自然,缺点是无法指定某一个词加重。第二类是结构化韵律标签,CosyVoice 2 等工作已支持标签,但原文指出严格词级执行仍不稳定。第三类是自然语言指令,用一句话描述想要的风格,适合粗粒度意图,不适合词边界精确对齐。第 4 类是显式词级声学规划,直接预测每个词的时长或基频,控制精确但容易与自回归先验冲突。

论文把失败归因到两点,一是缺少精确对齐的富有表现力数据且不希望依赖人工标注,二是自回归大模型中激进的局部声学条件会扰动全局声学先验。理解这点才能明白 CraftTTS 为什么不走单一端到端大模型一步到位,而是用数据构造加偏好对齐加强化约束的 3 段式:先解决无标注数据稀缺,再解决标签敏感度,最后解决局部与全局的权衡。

教学例子是把全局迁移想象成给整锅汤调味,把词级控制想象成只给其中一块肉加盐,前者搅拌即可,后者需要定位而不搅浑整锅。

要解决的冲突如何度量,什么算成功什么算失败?

论文提出的核心问题是能否系统地对齐基于大模型的语音合成系统,使其服从细粒度韵律指令而不牺牲全局泛化与合成稳定性。成功需要同时满足三件事:标签因果性,即加标签与不加标签的同一文本在声学上出现方向一致的变化;全局自然度,即整句韵律自然评分不下降;可懂度与音色保持,即字错率与说话人相似度不出现大幅退化。失败模式在原文有明确列举:声学伪影、不自然停顿、全局情绪泄漏、韵律夸张和长句时间不稳定。

评价时要分开看客观声学统计与主观听感,客观侧用音高标准差、音高范围、平均强度、强度范围和每秒字数反映变化方向,主观侧用说话人相似度、韵律自然度、重音匹配度和语速匹配度 4 种平均意见分。初学者常犯的错误是只看重音是否明显就判成功,正确动作是同时检查字错率是否上升、自然度是否下降、音色是否漂移,因为论文的全部设计就是为了平衡这组 trade-off,而不是把某一个对比度推到最大。

三阶段总览:数据、敏感度、稳定性各解决什么?

CraftTTS 的全景可以沿一个样本走完。假设输入中文文本阿尔瓦雷斯依言行事,目标是让阿尔瓦雷斯重读。第一阶段不训练目标模型,而是用大语言模型做标注加外部教师做合成,产出高质量的偏好对;第二阶段用这些偏好对把目标骨干 CosyVoice 2 微调到对标签敏感;第 3 阶段用强化学习把敏感但可能夸张的模型拉回到稳定自然。

3 个阶段的分工是计算换标注、对比换敏感、奖励换稳定。第一阶段是计算驱动的零样本合成策略,避免人工标注也避免用自身采样带来的退化;第二阶段是联合监督微调加直接偏好优化,锚定局部强度与语速标签;第 3 阶段是组相对策略优化加多维韵律奖励,在可懂度、强度对比和节奏之间做调节。

下图是论文给出的 3 阶段框架总览,阅读时先看主路径再看分支汇合,建议按焦点动作逐步核对从文本到韵律语音的完整链路。

看图路径: 1. 先从左下中文原句经 DeepSeek-V3 加标签再到切分进入 Stage 1 的路径走一遍;2. 观察 Stage 1 中风格提示与说话人提示如何共同进入 Text-to-Semantic 再经 Best-of-N 筛选;3. 对比深绿色的上一轮语义尾部如何作为前缀桥接下一段以保持音高能量连续;4. 再看下方 Training 黄色箭头如何把 Stage 2 的正负样本对接到 Stage 3 的三路奖励评分

原论文 Figure 1:Overview of the proposed three-stage framework for achieving fine-grained word-level prosodic…

论文图 1。原论文 Figure 1:“Overview of the proposed three-stage framework for achieving fine-grained word-level prosodic controllability.”。

图中可见上方 Stage 1 完成切分、多采样与最佳选择并输出正样本,下方中间蓝色长条是待训练的语音大模型主干,左下标注与切分向上 feeding Stage 1,下方 Stage 2 用正负样本形成两种损失,Stage 3 对同一输入的多个候选做 3 路奖励打分。关键细节是图中雪花符号表示冻结的语义到梅尔与声码器部分,火焰符号表示可训练的语音大模型,黄色 Training 大箭头表示从阶段二向阶段三的渐进优化方向。理解这张图后,后续组件都可以挂到对应方框上,不会把数据构造的教师与最终被优化的策略搞混。

阶段一如何不用人工就造出词级偏好数据?

阶段一的起点是大规模无标注中文文本,来源是 AISHELL-3 与 THCHS-30 的子集文本。第一步由 DeepSeek-V3 扮演语言专家做韵律分析,在词或短语级别插入 4 种标签,示例形态是<strong> 词语</strong>,分别对应局部强弱与快慢。白话解释是让大语言模型先读懂哪几个词在语义上应强调、哪里应放慢,再把判断写成机器可读的标签。

第二步是多轮自回归推理,利用教师模型 Indextts2 对参考敏感的特性,对带标签段随机采样目标风格提示,但不是把独立风格块直接拼接,而是在每一段生成时把上一段尾部的声学 token 作为自回归前缀拼在前面,形成声学桥,使音高能量跨过控制边界连续传播。这一步的动作本质是分段可控、上下文连续。

第三步是标签条件多采样选择,同时做两件事:为保音色生成多个候选并选与参考说话人嵌入余弦相似度最高者,为控语速利用自回归解码随机性以声学 token 长度代理语速,对 fast 选最短、对 slow 选最长,从而无需外部时长模型实现词级语速控制。第四步构造对比对,把多轮韵律控制音频作为偏好胜者,把无韵律标签的对应基线合成作为偏好败者,组成后续偏好学习的数据。

结构化韵律标签 × 自回归声学先验: 结构化韵律标签负责在词或短语跨度上显式声明要做什么,如 strong、weak、fast、slow,它是离散的、可读的控制接口;自回归声学先验负责维持前后音节在音高、能量和停顿上的连续分布,它是 CosyVoice 2 这类大模型预训练学到的生成习惯。二者搭配的原因是直接把强局部指令压进自回归链会打断连续性,CraftTTS 因此让标签只作为条件输入,再用多轮声学前缀和后续奖励约束把标签意图翻译成不撕裂先验的渐变实现,组合意义是局部可控而全局不断裂。

最佳候选选择 × 说话人保持: 最佳候选选择负责在教师模型 Indextts2 多采样输出中挑出既符合标签又质量更高的样本,它是数据阶段的质量过滤器;说话人保持负责防止强弱风格提示交替引入音色漂移,具体做法是计算候选与参考说话人嵌入的余弦相似度并选最高者。二者搭配的原因是风格提示能带来重音变化但也会带偏音色,若不筛选就会把音色漂移当作偏好数据喂给下游,组合意义是用同一多采样机制同时实现音色锚定和语速代理控制,即最短候选对应 fast、最长候选对应 slow。

复述时要记住阶段一的教师与目标是分离的,教师是 Indextts2,目标是 CosyVoice 2,这种分离是原文明确用来避免自采样偏差的设计,不是实现细节的随意选择。

风格提示池与说话人提示如何分工避免串味?

阶段一还有一个容易被忽略的组件是提示来源的解耦。风格提示池来自 StoryTTS,挑选具有强调与弱化韵律的句子,专门提供 strong 与 weak 如何实现的声音范例;说话人身份提示来自内部语音数据集,专门提供是谁在说的音色锚点。在合成时文本到语义模块同时接收风格提示与说话人提示,但二者功能不同:风格提示决定局部起伏的形状,说话人提示决定全局音色的位置。多采样选择进一步把二者解开,用相似度守住音色,用长度代理守住语速。

初学者可以这样操作化记忆:换风格提示应只改变重音形态,若音色也变了说明选择环节没做好;换说话人提示应只改变音色,若重音形态系统性消失说明标签与风格提示的绑定太弱。原文正是用这种分离加筛选保证偏好正样本既有标签一致性又有声学质量,否则下游偏好学习会把音色漂移误学成重音的必要条件。

阶段二如何训练:监督与偏好损失各自更新什么?

阶段二把阶段一产出的 9330 条语句用于训练目标骨干,优化器是 Adam,学习率是 1 乘 10 的负 5 次方,共训练 13 轮,直接偏好优化缩放因子取 0.1 并做梯度裁剪最大范数为 5.0,硬件是单节点 8 张 A100。训练目标是联合损失,监督部分对带标签胜者样本做负对数似然,目标是建立标签到局部声学实现的稳定映射与一致的说话人实现。

偏好部分最大化带标签样本与基线样本之间的偏好间隔,其隐式奖励定义为当前策略与冻结参考策略对数似然比的缩放,目标是在不引入显式奖励模型的情况下让模型更严格服从韵律。权重 lambda 平衡生成稳定性与偏好可控性。需要指出的缺项是原文未报告 lambda 的具体数值与冻结参考策略的重置时机,也未给出监督与偏好梯度是否交替或同 batch 混合的实现顺序,复现时应先按联合加权同时优化实现并记录该缺项,不从模型名推定细节。

监督微调 × 直接偏好优化: 监督微调负责让模型学会带标签正样本的基本映射,即看到<strong> 词语</strong>这类标注就生成对应重读形态,它只最大化正样本似然而不惩罚忽略标签的行为;直接偏好优化负责放大带标签样本与无标签基线样本之间的偏好间隔,用隐式奖励差惩罚韵律纠缠和边界错位。二者搭配的原因是只做监督微调会得到僵硬模仿,对控制失败没有罚则,联合训练以 Ltotal equals LSFT 加 lambda LDPO 形式同时保留稳定生成与偏好驱动的可控性,组合意义是先立住映射再 sharpen 对标签的敏感度。

组相对策略优化 × 多维韵律奖励: 组相对策略优化负责在不依赖价值网络的情况下做强化探索,它对同一输入采样一组候选并在组内做标准化优势比较,再用裁剪目标加 token 级 KL 惩罚约束偏离;多维韵律奖励负责告诉策略什么叫好,由可懂度、强度对比和语速 3 路解耦信号组成。二者搭配的原因是词级控制需要的不是硬性时长或响度模板,而是可权衡的方向性目标,GRPO 提供稳定的组内比较机制,奖励提供不极端化的优化方向,组合意义是在保持可懂与自然的前提下把强度对比和语速拉到标签要求的一侧。

暂停感知的识别奖励 × 语速正则: 暂停感知的识别奖励负责同时守住文字正确性和韵律短语边界,它把真值与 Whisper 输出中的标点统一映射为边界符再算字符错误率并做指数缩放;语速正则负责只给方向不给硬时长,它用生成时长与文本导出基准时长的比值配合 fast 为正向、slow 为负向、无标签为零的方向因子。二者搭配的原因是强化探索容易为换取重音对比而牺牲可懂度或把语速推向极端,前者防止语言退化,后者防止时长过优化,组合意义是让强度和语速的提升都发生在可懂且不断裂的范围内。

按证据表述,阶段二后模型已具备基本标签声学对齐与更强的韵律区分度,但长句稳定性仍然有限,这正是阶段三要解决的遗留问题。

阶段三如何用奖励把夸张拉回稳定?

阶段三把阶段二得到的模型作为活跃策略,每次对同一输入采样 8 个候选,采样温度为 1.0,用 Adam 以 1 乘 10 的负 6 次方学习率在裁剪目标下优化,裁剪系数为 0.2,token 级 KL 惩罚系数为 0.01,另采样 3224 条文本提示专门用于本阶段。状态是输入文本加已生成声学 token,动作是下一个 token 的分布。奖励由 3 路加权组成,权重分别是识别奖励 0.6、情绪奖励 0.15、长度奖励 0.25。

第一路是暂停感知的识别奖励,把真值与 Whisper 输出的标点统一映射为边界符后算字符错误率再做指数缩放,缩放因子取 3.0,目标是同时守住文字对齐与韵律短语。第二路是解耦情绪奖励,把生成语音锚向中性情绪基线同时部分保留参考主导情绪,公式中情绪后验与指示函数配合,系数取 0.6,目标是压住过强全局情绪对局部强弱对比的淹没。

第 3 路是语速正则,用生成时长与文本导出基准时长之比配合方向因子,方向因子仅在快慢标签激活,否则为零,再经平滑缩放避免过优化,目标是只给方向不给硬时长。优势在组内做标准化,无需价值网络。原文明确说该设计不是刚性强制声学参数,而是基于可懂、强度、节奏 3 个人类韵律通用维度的解耦优化,防止极端声学畸变。

实验条件:数据、基线、指标方向如何保证可比?

所有数据集均为中文,这是复现时必须守住的前提。数据构造文本取自 AISHELL-3 与 THCHS-30 子集,风格提示来自 StoryTTS,说话人提示来自内部语音数据,评估文本用 InstructTTSEval 中文子集并用同样的大模型标注流水线打标签,说话人参考来自 seed-tts-eval。比较的公平条件是同一多说话人测试集上渐进评估原始 CosyVoice 2、加监督微调、加阶段二联合训练与完整 CraftTTS,客观指标在全部 200 条上计算,主观由 14 位听众打分。客观侧字符错误率用 whisper-large-v3 衡量语言保真度,方向越低越好;说话人相似度用预训练说话人验证模型,方向越高越好。

韵律可控性用音高标准差、音高范围、平均强度、强度范围与每秒字数,其中每秒字数定义为字符数除以能量语音活动检测去长静音后的非静音时长。主观侧 4 种 5 分制平均意见分分别是说话人相似度、韵律自然度、重音匹配度针对强弱、语速匹配度针对快慢,方向都是越高越好并报告 95% 置信区间。

控制灵敏度分析另构造 120 条语义标注短句,每种控制标签 30 条共 3 个说话人,短文本用于减少累积推理变异,每文本合成带标签与不带标签两个版本再算声学偏差,从而把标签因果效应与音素差异或全局漂移分开。

主结果:自然度与语速匹配的提升以什么为代价?

比较问题是渐进加入各阶段后,细粒度控制的听感收益是否以可懂度与音色为代价,公平条件是同一测试集与同一组客观主观指标,指标方向是自然度与匹配度越高越好、字错率越低越好、相似度越高越好。下表整理了原文报告的阶段性数字,表头单位按原文保留,裸值不擅自追加百分号之外的单位。

条件字错率 CER说话人相似度 Sim韵律自然度 NMOS重音匹配度 STMOS语速匹配度 SPMOS
Baseline 骨干6.36%0.69993.67 ± 0.143.18 ± 0.193.09 ± 0.16
加 SFT7.34%0.68413.57 ± 0.143.43 ± 0.223.15 ± 0.17
加阶段二 SFT 加 DPO7.38%0.68733.57 ± 0.153.30 ± 0.193.22 ± 0.18
完整 CraftTTS7.01%0.68203.87 ± 0.133.41 ± 0.213.35 ± 0.21

表后解释需要同时讲收益与代价。完整 CraftTTS 在表中取得最高的韵律自然度与语速匹配度,论文报告其说话人相似主观分也达到 3.73,支持其在细粒度控制下改善韵律连贯性的判断。具体代价是字错率从基线 6.36% 升到 7.01%,说话人相似度从 0.6999 降到 0.6820,论文明确解释这是暂停感知识别奖励有意惩罚不自然停顿而非只优化字面正确率的结果,不是测量误差。

阶段性看,监督微调带来最强的重音匹配但自然度下降,阶段二通过偏好学习提升韵律区分度但稳定性仍有限,阶段三引入多维奖励后字错率回落且多项主观分达到峰值,支持渐进优化平衡了可控与质量。未胜出项必须点名:字错率与客观说话人相似度始终未超过原始骨干,若只看这两列会误判完整模型最差,因此不能把自动指标直接当成人评,也不能用单列胜负代替整体判断。

标签灵敏度:四个标签各自改变了什么声学量?

比较问题是每个标签是否引起方向正确的声学变化,公平条件是同一文本带标签与不带标签配对合成并算相对中性基线的偏差,指标是音高标准差变化、音高范围变化、平均强度变化、强度范围变化与每秒字数变化。下表按原文整理方向性偏差,正值为增加、负值为减少,语速列可直接读出快慢是否生效。

标签音高标准差变化音高范围变化平均强度变化强度范围变化每秒字数 CPS 变化
strong+6.48+13.37-4.78+11.67-0.26
weak-5.85-2.98-0.51+5.24+0.29
fast+3.73+12.61-3.94+15.12+0.54
slow+1.68+18.67-3.86+12.42-0.39

表后解释要把数字翻译成可复述的机制。strong 提高音高变化性与范围并降低每秒字数,符合重读拉长效应;weak 压缩音高动态并轻微提高每秒字数,反映去强调;fast 带来最大的每秒字数增加,slow 带来最大的每秒字数减少,验证了方向性时长目标的有效性。重要限制是语速调整伴随音高与强度的协同变化而非单纯时长缩放,论文将其报告为连贯韵律调制而非简单变速。

负结果也要说明:平均强度列在 4 个标签下均为负值,若把响度绝对值当作强弱的唯一证据会与表冲突,正确做法是结合音高范围与强度范围一起判断对比度,原文的解耦情绪奖励正是为保留这种对比空间而压住全局情绪偏置。

分阶段看:哪一步立功,哪一步若缺会留下什么?

把四行结果纵向读就是一组阶段消融。只加监督微调时重音匹配从 3.18 升到 3.43,说明基本标签声学映射已建立,但自然度从 3.67 降到 3.57,说明僵硬模仿损害自然 ness。加入直接偏好优化后语速匹配从 3.15 升到 3.22,说明偏好间隔有助于区分度,但字错率仍在 7.38% 高位且稳定性有限,说明对比学习本身不解决长句声学先验扰动。完整模型加入组相对策略优化与 3 路奖励后自然度跃升到 3.87、语速匹配到 3.35、字错率回落到 7.01%,支持阶段三是决定性转折点的判断。

论文未提供拿掉某一奖励分量的单独消融,也未报告仅做强化而不做阶段二的对照,因此不能断言某一奖励单独的贡献,只能说 3 路加权整体支持了从夸张到稳定的恢复。教学动作是复现时按阶段保存检查点并在同一 200 条客观集与抽样主观集上复测,若跳过阶段二直接做强化,很可能因缺少标签敏感起点而使奖励探索效率下降,但这属于待验证推测,不应写成必然结论。

边界与未验证点:哪些结论不能推广?

首先是语言与数据边界,所有结论限于中文,文本、风格提示与评估集均为中文语料,跨语言韵律标签是否同样有效未验证。其次是标签覆盖边界,仅验证强弱快慢 4 种词级标签,更丰富的韵律属性如情感细粒度、停顿层级或语调曲线未纳入,论文将其列为未来工作。再次是资源与成本边界,训练用单节点 8 卡 A100,阶段二 13 轮、阶段三每输入 8 候选,推理开销、输出帧率与实际延迟未报告,不能承诺该方法改善延迟或降低成本,训练资源与推理延迟应分开讨论。

还有统计边界,主观由 14 位听众评分并给出置信区间,但未报告显著性检验与误判率,总体趋势不等于每组每步都成立。最后是证据冲突处理,原文表头与正文在指标口径上基本一致,未发现需要标注的算术冲突,但阶段二权重 lambda 与参考策略冻结细节缺失,复现时应明确记录为缺项而不自行编造划分或聚合口径。相关性不等于因果的提醒同样适用:声学偏差与标签共现支持因果解释的力度来自配对合成设计,若改用非配对语料比较则不能做同样推断。

复现先做什么:按什么顺序搭流水线?

第一步复现标注流水线,用中文文本调用大语言模型做词级标注并检查标签是否落在语义重音词上,先人工抽查边界正确性再进入合成,因为边界错会污染后续全部偏好对。第二步搭建教师合成链,用 Indextts2 加 StoryTTS 风格提示与内部或自备说话人提示实现多轮带前缀推理,再实现最佳候选选择中的相似度筛选与长度代理筛选,目标是先产出少量可听的正样本并与无标签基线做配对试听。

第三步准备目标骨干 CosyVoice 2 的联合微调环境,按学习率 1 乘 10 的负 5 次方、偏好缩放 0.1、梯度裁剪 5.0 起步,先在小子集上验证损失下降与标签敏感出现,再扩展到 9330 条。第四步实现 3 路奖励与组相对策略优化,按权重 0.6、0.15、0.25 与识别缩放 3.0、情绪系数 0.6、采样 8、温度 1.0、学习率 1 乘 10 的负 6 次方、裁剪 0.2、KL 系数 0.01 起步,用 3224 条提示做强化并监控字错率与自然度的同步变化。关于开源状态,本次可核对的资源清单未提供完成 HTTPS 验证的可用资源,因此不声称代码、模型或数据已公开,复现应按论文文字与超参数自行实现。

常见误解是把无人工标注当成无数据成本,实际成本转移到了大模型推理与多采样计算,预算时要留足教师合成与强化采样的算力。

何时值得尝试 CraftTTS 路线,何时不必?

当任务需要指定某几个词加重、减弱、加快或放慢,且整句仍要保持自然流畅与原说话人音色时,这条路线值得尝试,因为它用计算换标注解决了数据稀缺,用偏好间隔解决了标签忽略,用解耦奖励解决了局部夸张。当任务只需要全局风格搬运或整句语速统一调整时,不必启动 3 阶段重型对齐,参考迁移或单一时长控制已足够。当数据是英文或其他语言、或需要更细的情感与语调控制时,应先补小规模配对验证再决定,因为原文证据限于中文四标签。

复述方法的最小闭环是:大模型打标签、教师分段桥接合成并筛选正样本、联合监督与偏好训练立敏感、多维奖励强化保稳定;检验闭环的最小证据是配对声学偏差方向正确加自然度与语速匹配提升加字错率未大幅恶化。记住论文的中心判断不是对比度越大越好,而是在可懂、音色与自然的约束下实现可感知的词级对比,这正是阶段三权重把识别奖励放在 0.6 最高位的原因。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总