英文题目:CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis

会议身份:conference:interspeech:2026:conference-paper-id:zheng26c_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自回归模型 #扩散模型 #韵律 #零样本 #文本到语音

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhisheng Zheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaohang Sun:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhu Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Caren Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Rohith Kumar:机构信息未能从会议 PDF 纯文本可靠映射
  • Manoj Aggarwal:机构信息未能从会议 PDF 纯文本可靠映射
  • Gerard Medioni:机构信息未能从会议 PDF 纯文本可靠映射
  • David Harwath:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

可控表达性语音合成需以音素序列文本生成波形语音,并在保持目标音色下对特定音素或词的音高响度节奏做帧级局部控制,难点在于身份与韵律高度纠缠且缺乏时间对齐的控制接口。CtrlSpeech先将音素嵌入与离散化音高响度时长信号按音素对齐叠加构成细粒度条件,同时从提示语音提取全局说话人嵌入作为音色条件。两类条件与连续声学隐变量补丁一同送入因果自回归Transformer生成总结历史上下文的隐表示,该表示作为下一步生成的条件输入。局部扩散解码器以该隐表示为条件逐补丁重建VAE连续隐变量,再经BigVGAN声码器合成波形,支持先粗生成再细调的迭代流程。与仅提供句子级全局风格提示的方法不同,该设计将粗粒度身份与细粒度韵律显式分离并保持帧级对齐,因而可直接操控局部韵律事件而不破坏音色。在LibriSpeech-PC test-clean零样本合成设置下,CtrlSpeech(0.6B)的WER为2.46%,低于复现DiTAR基线的WER 2.55%。该结论适用边界受限于英语朗读语料的零样本合成任务,尚未验证情感跨语种自发语音与非言语声的外推,且失败条件包括基频提取与强制对齐误差较大的情形。训练成本为在8张NVIDIA A100 80GB硬件上训练5个epoch,推理开销为采用32步采样与1.5引导尺度的分类器自由引导解码。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,哪些信息必须保留?

这篇解读的输入是会议论文的正文证据与两张官方原图像素,目标是让刚进入语音合成的研究生能复述 CtrlSpeech 的做法并知道实验条件。输出必须保留论文实际报告的任务、表示、组件、训练量、评测集和关键数字,不补无来源的效果承诺。

语音合成的输入在这里是两类。第一类是语言内容,即要读的文本,论文内部转成音素序列。第二类是控制条件,粗的一端是说话人身份,要求合成语音听起来是同一个人;细的一端是韵律,要求某个音素或词的音高、响度和时长可以被指定和修改。输出是 16 千赫采样波形重建出的连续语音。必须保留的信息是音色不能因改韵律而漂移,语言内容不能因加控制而读错。

初学者常把自然度好等同于可控。论文的起点正好相反:近年系统在自然度和零-shot 克隆上已经很强,但控制多停在整句层面,例如给一句风格描述或全局指令。用户想改的是局部事件,例如把 quick 这个词抬高一点、把某个元音拖长一点,同时保持目标音色。这就需要时间对齐的信号,而不是一句话的整体向量。

因此学习顺序是先分清两条路线。参考条件合成路线用短提示语音提供音色、韵律和情感线索,优点是像谁很像;文本提示合成路线用自然语言描述风格,优点是交互直观。CtrlSpeech 的选择是两者不互斥:用全局说话人条件守住像谁,用音素对齐的显式信号管住怎么说,并允许用户听完一版再迭代修正。

已有路线在同输入同目标下各解决了什么?

如果按同输入、同目标来对照,参考条件合成的输入是文本加短参考语音,目标是未见说话人的可懂且像该说话人的语音。从早期的风格迁移到 VALL-E 这类自回归编解码语言模型,再到 NaturalSpeech、MaskGCT 和 F5-TTS 这类非自回归、扩散或流模型,趋势是质量和效率同时提升,且不需要为新说话人微调。论文把 DiTAR 也放在这一脉络里,作为连续表示加自回归与扩散结合的骨干。

文本提示合成的输入是文本加风格描述或指令,目标是更直观地控制多种属性。PromptTTS、PromptTTS 2 和 InstructTTS 说明语言提示可以给出细粒度描述,最近的大模型指令语音合成进一步把多属性统一到指令跟随里。但论文指出一个边界:即使暴露多个属性,控制仍多在句子或话语级,而不是与具体音素或词绑定的时间对齐信号。

DrawSpeech 是与 CtrlSpeech 最接近的对照,因为它用韵律草图做显式条件。论文在 LJSpeech 上比较了有草图和无草图两种情形下的音高与响度均方根误差。需要强调的是类别差异不能当同条件胜负:文本单输入时恢复局部韵律本来就难,有显式信号时才进入可比的控制任务。CtrlSpeech 的差异化在于把音高、响度和时长三者都做到音素对齐,并与全局说话人条件解耦,同时支持多轮细化。

要解决的局部控制问题如何定义?

问题可以写成给定文本、说话人提示和一组时间对齐控制,生成既像该说话人又服从局部韵律的语音。举例只是教学例子:假设要合成 The quick brown fox jumps,粗控制先定说话人,细控制再指定 quick 的音高曲线抬高、brown 的响度加大、jumps 中某个元音延长。模型必须做到改的是这几个局部量,不改整句音色,不读错词。

难点在于三者容易纠缠。说话人身份、韵律和风格如果混在一个隐向量里,调韵律就会带偏音色。论文的解法是表示上分开:身份用全局向量,韵律用按音素展开的离散符号序列。另一个难点是评价要分开:像谁用说话人相似度,读得对不对用词错误率,韵律跟没跟上用帧级或音素级偏差。混用指标会误判,例如把相似度高当成韵律准。

论文还明确了一个现实约束:细粒度信号的质量依赖前端。音高来自 WORLD 声码器的 DIO 估计加 StoneMask 精修,时长来自强制对齐把音素与波形对上。如果这两步错了,控制量本身就错了。这意味着可控性实验测的是在给定前端条件下的跟随能力,不是无条件预测韵律的能力。

从文本到可迭代修正语音的主路径是什么?

主路径可以沿一个样本走完。输入文本先转成音素序列,每个音素拿到自己的嵌入。同一时刻,系统从提示语音提取全局说话人嵌入,作为整句的音色锚点。音素嵌入再与该音素对应的音高档、响度档和时长值相加,形成带控制的语言表示。声学侧把目标波形经变分自编码器压成连续隐序列,切成每 4 个连续隐词元一块,送入自回归主干加局部扩散解码器逐块生成,最后由 BigVGAN 结构的解码器重建波形。

用户可见的工作流是两轮。第一轮是粗粒度:给文本和说话人设置,得到第一版可试听语音。第二轮到第 N 轮是细粒度:听完后直接调音高曲线、响度柱和词时长条,再送入细粒度控制重新合成。试听框回到细粒度框的回路就是迭代修正的含义,不是自动优化,而是人听人改。

下面这张图是理解该流程的唯一像素依据,请按导读顺序看清两轮与两类箭头的分工。

看图路径: 1. 先从左侧 Round 1 粗粒度框看输入文本与说话人设置如何汇入粗粒度控制再产生首次试听;2. 再看中间首次试听箭头如何进入右侧 Round 2-N 细粒度框的音高、响度和词时长三个面板;3. 对照底部图例区分蓝色用户输入控制箭头与绿色模型处理输出箭头的走向;4. 观察右侧试听框返回细粒度框的绿色回路,确认迭代修正的闭环位置

原论文 Figure 1:Coarse-to-fine speech control pipeline.

论文图 1。原论文 Figure 1:“Coarse-to-fine speech control pipeline.”。

这张图显示左侧 Round 1 框内有输入文本与说话人嵌入和提示音频两个子框,它们经粗粒度控制产生中间试听;中间试听向右进入 Round 2-N 框,框内自上而下是音高调整曲线、响度控制柱状和词时长条 3 个可调面板,再经细粒度控制产生右侧试听;右侧试听有一条绿色回边指向细粒度框,表示可反复听改。底部图例说明蓝色箭头是用户输入与控制,绿色箭头是模型处理与输出,因此从左到右既是控制由粗到细,也是用户参与由少到多的过程。

全局说话人条件 × 音素对齐韵律信号: 全局说话人条件负责整句的音色保持,用说话人嵌入向量或提示语音给出身份锚点;音素对齐韵律信号负责局部的音高、响度和时长变化,按音素逐个给出可调量;二者搭配的原因是把身份与表现分开表示,组合意义是改某个词的重音或拖长时不把声音换成别人。

这种分工的训练含义是全局条件与局部条件同时作为输入,但监督来源不同:全局向量来自预训练声纹模型,局部符号来自基频、能量与对齐前端,声学目标来自真实波形的连续隐序列。推理时若不给细信号,模型退化为普通零-shot 合成;若给了细信号,模型被要求跟随它们,这正是后文对照实验的设计逻辑。

音素、音高、响度、时长如何变成模型看得懂的符号?

先讲 4 个控制量的具体动作。音高指基频,反映声带振动快慢。论文用 WORLD 提取原始轮廓并精修,再把赫兹值按公式转到梅尔刻度以贴近听感,然后在 65.0 到 650.0 赫兹范围内量化为 128 档:清音帧归 0 档,浊音线性映射到 1 到 126 档并四舍五入取整,超 650.0 赫兹截断到 127 档。响度指感知强度,先做 A 计权滤波近似人耳对中频更敏感的特性,再算帧级均方根能量并转分贝,公式中有极小量防止静音段数值问题,最后把负 60.0 到 0.0 分贝裁剪并最小最大归一化后量化为 64 档,约 1 分贝一档。时长指每个音素占多少声学帧,由强制对齐把音素转录与配对波形在时间上对准后计数得到。

这些符号不是直接拼在波形上,而是与音素嵌入相加。也就是说每个音素位置的向量都携带了该说什么以及用多高、多响、多长来说。说话人嵌入则作为全局条件,不随时间变化,作用是整句保持音色。论文的消融显示只用嵌入、只用提示语音和两者都用效果不同,说明两者提供互补的说话人信息。

声学侧的建模动作需要看清架构图,它展示了语言流与声学流在哪里汇合、条件在哪里注入。

看图路径: 1. 先沿底部音素词元与连续语音词元向上看因果自回归变换器的主干汇聚位置;2. 再看左上角音素、音高、响度和时长四行色块如何相加后注入主干左侧;3. 观察中间 LocDiT 按 h_i-2、h_i-1、h_i 逐块生成并向上合成语音波形的分块过程;4. 检查右侧放大的 DiT 块中时间、音色条件经 MLP 后以缩放和平移方式注入层归一化的位置

原论文 Figure 2:The architecture of CTRLSPEECH.

论文图 2。原论文 Figure 2:“The architecture of CTRLSPEECH.”。

这张图底部左侧是音素词元,底部右侧是连续语音词元经聚合编码器压缩后的块序列,二者共同向上进入因果自回归变换器;左上角小框显示音素、音高、响度和时长四行色块相加后注入主干,说明语言侧已是控制增强的表示;中间 3 个 LocDiT 块分别以历史状态为条件逐块生成并向上合成语音波形;右侧放大块显示时间与音色经多层感知机后以缩放和平移作用于层归一化,证实全局条件以调制方式注入扩散解码器。按此顺序可复述 1 次前向:文本与控制先融合为条件,自回归主干再给出块级上下文,扩散头最后补全块内波形细节。

自回归分块建模 × 局部扩散解码: 自回归分块建模负责长程依赖,按声学小块顺序记住上文说了什么、节奏走到哪里;局部扩散解码负责块内细节,在当前块内做双向去噪补全波形纹理;二者搭配是因为连续声学特征短程相关强、长程结构又需要记忆,组合后形成先看历史再精修当前块的生成方式。

连续隐变量语音表示 × 离散编解码词元: 连续隐变量语音表示用变分自编码器把波形压成 40 Hz、64 维的连续序列,保留细微的韵律和音色渐变;离散编解码词元则先量化再分阶段生成,容易丢信息并累积误差;搭配理由是表现力合成更需要平滑可微的声学空间,组合意义是让后续的音高响度时长微调直接落在连续空间里生效。

基频 × 梅尔刻度量化: 基频负责声带振动快慢的物理量,是音高高低的来源;梅尔刻度量化负责按人耳听感把赫兹值压缩映射并分箱,论文把 65.0-650.0 赫兹映射为 1-126 箱、清音归 0、超限截断到 127;二者搭配是让控制量更贴近感知,组合后模型收到的是 128 档的粗音高符号而非原始赫兹浮点。

补充一个实现细节:文本与声学流使用各自独立重置的位置索引,声学隐序列按非重叠小块切分,每块含 4 个连续隐词元。自回归主干为每块输出一个上下文表示,局部扩散变换器以它为条件并行重建下一块,还可把历史块作前缀上下文以改善跨块连续性,原文称之为类似外推的上下文感知生成。

训练目标、优化设置与推理采样如何操作?

训练目标由两项相加。一项是流匹配损失,负责让扩散解码器预测的速度场接近前向过程诱导的目标速度场;另一项是停止预测损失,把每个声学块分类为首、中、尾 3 类,权重系数平衡两者。论文给出的是整体目标形式,变分自编码器部分直接使用 Semantic-VAE 的已有检查点,不在本研究中重新训练该编解码器。

优化器用 AdamW,学习率为 2 乘 10 的负 4 次方,权重衰减为 0.01,学习率先在前 5% 步数线性热身再线性衰减。2 个模型变体用同一套设置,在 8 块 80 吉字节 A100 上训练 5 轮。需要指出的缺项是论文未报告梯度是否截断到某些条件分支、说话人嵌入是否冻结更新、批量大小与总步数,因此复现时只能先按显式超参数对齐,再把缺失项记为待验证。

推理时采用无分类器引导,采样步数为 32,引导尺度为 1.5,并把时间嵌入与说话人嵌入视为统一条件信号。这意味着改引导尺度或步数会同时影响质量与控制跟随,不宜把论文数字直接外推到其他采样配置。训练语料是 Emilia 英文子集的一部分加 GigaSpeech 子集的一部分,共约 20000 小时英文语音,提供宽声学与语言覆盖;评测另用 LibriSpeech-PC、Seed-TTS 英文集和 LJSpeech,训练与评测的划分按原文交代,不自行拼凑。

数据、模型、指标与基线如何保证可比?

数据侧要分清 3 段用途。预训练用约 20000 小时英文语音学通用生成能力;零-shot 合成在 LibriSpeech-PC 测试干净集和 Seed-TTS 英文测试集上测,检验未见说话人的可懂度和相似度;细粒度可控性在 LJSpeech 测试集上测音高响度,在 LibriSpeech-PC 干净集上测时长。不同指标的聚合对象不同:音高响度是帧级偏差,时长是音素级平均绝对误差,不能跨表直接比大小。

模型侧有两个变体。0.1B 用 512 维隐藏、4 层 8 头聚合编码器和 4 层 8 头 DiT 解码器;0.6B 扩到 1024 维隐藏、6 层 16 头聚合编码器和 6 层 16 头 DiT 解码器。基线 DiTAR 因未开源,论文用同样训练数据自行复现 0.6B 版本,因此比较的是同数据复现基线,不是原作者官方权重。声码器重建也被列出,用于说明编解码本身的上限。

指标方向必须先记住。词错误率用 Whisper-large-v3 计算,越低表示可懂度越好;说话人相似度用 WavLM 说话人验证模型提 embedding 后算余弦,越高越像;比较平均意见分是听合成与真值后判断哪边更自然,相似度平均意见分是听合成与提示后打像不像;音高响度均方根误差和时长平均绝对误差越低表示跟随控制越好。自动指标不能当成人评,主观分也不能替代跟随误差。

下表把训练与推理的运行条件整理成五列,便于复现时逐项对齐,数字与单位均来自原文连续句的逐字证据。

配置项训练轮数硬件推理步数引导设置
原文条件5 epochs8 NVIDIA A100 80 GB GPUs32 sampling stepsguidance scale of 1.5
优化器AdamW optimizerlearning rate of 2 × 10−4weight decay of 0.01linearly warmed up over the first 5%
模型变体0.1B model0.6B modelhidden size of 512hidden size to 1024
声学表示frame rate of 40 Hzdimensionality of 64patch contains 4 consecutive latent tokens16 kHz input waveform
数据规模approximately 20,000 hours of English speechEmilia subsetGigaSpeech subsetLibriSpeech-PC test-clean

表后需要说明该表的用途与边界。该表只解决运行条件对齐,不证明质量高低。它的价值是复现时先把轮数、硬件、步数、引导尺度、隐帧率与块大小固定,再谈结果差异。它的代价是未覆盖批量、随机种子与前端版本,若这两处不同,音高响度时长数字会有系统偏移。未评测的边界包括多语与码切换、情感与非言语发声,原文在局限中已声明未建模。

零-shot 质量守住了吗,显式控制带来了多少跟随收益?

先看零-shot 合成要测什么。与谁比:在两个测试集上与真值、声码器重建和同数据复现的 DiTAR 比,另有两个尺寸的 CtrlSpeech。条件是否一致:论文强调 DiTAR 是同训练数据的自复现,尺寸为 0.6B,因此 0.6B 对 0.6B 是相对公平的对照。指标方向:词错误率越低越好,相似度越高越好,主观分越高越好。

下表把核心可运行策略的数字整理成五列,同一单元格内保留原文的数值写法,比较对象限定为论文实际运行的系统,不用搜索最优或事后最优代替。

评测集指标真值参考CtrlSpeech 0.6B复现 DiTAR 0.6B
LibriSpeech-PC test-cleanWER(%)↓2.402.46% WERDiTAR reproduced baseline
LibriSpeech-PC test-cleanSIM-o↑0.690.65 SIM-o0.61 baseline
Seed-TTS test-enWER(%)↓1.902.58% WER2.89 baseline
Seed-TTS test-enSIM-o↑0.730.63 SIM-o0.59 baseline
控制跟随Pitch RMSE67.86 Hz text-only38.39 Hz with controlDrawSpeech 43.59 text-only

表后解释主要收益与具体代价。报告显示 CtrlSpeech 0.6B 在 LibriSpeech-PC 上取得 2.46% 词错误率与 0.65 相似度,在 Seed-TTS 上为 2.58% 与 0.63,客观两项均优于复现 DiTAR,主观相似度也有增益,支持零-shot 质量未被控制分支拖累的判断。但反例必须同时讲:0.1B 在 Seed-TTS 上词错误率为 6.50%,明显弱于 0.6B,说明小尺寸在该集上可懂度代价大;纯文本无控制时 0.6B 音高误差为 67.86 赫兹,差于 DrawSpeech 的 43.59 赫兹,说明无信号时局部韵律难以从文本恢复。一旦给显式信号,0.6B 音高从 67.86 赫兹降到 38.39 赫兹,响度从 6.35 分贝降到 4.56 分贝,时长平均绝对误差从 28.08 降到 11.86,支持对齐控制直接改善声学实现的判断。

零-shot 语音合成 × 细粒度可控性: 零-shot 语音合成负责只给短提示语音就模仿未见说话人,要求可懂度和相似度;细粒度可控性负责按词或音素改音高、响度和时长,要求输出跟随给定控制量;二者搭配的难点是改表现时不能丢身份,组合意义是论文同时用词错误率和说话人相似度守住前者,再用均方根误差和平均绝对误差检验后者。

还需补两类论文特有细节。第一是响度文本单输入时已较好,0.1B 为 7.12 分贝、0.6B 为 6.35 分贝,均低于 DrawSpeech 的 14.03 分贝,但这不等于音高也好,同一表内音高恰是 CtrlSpeech 更差,因此不能把总体趋势推广到每个属性。第二是时长无控制时与复现 DiTAR 相近,有控制时两尺寸分别从 31.58 降到 14.00 和从 28.08 降到 11.86,大幅优于复现基线的 28.00,证实音素级时长条件对节奏的直接作用。

拿掉说话人条件或控制信号会发生什么?

消融要回答两个问题。第一是粗粒度说话人条件是否必要。在 Seed-TTS 英文集上,0.6B 无说话人条件时相似度掉到 0.07,词错误率为 3.12%;只用说话人嵌入时相似度回到 0.48,只用提示语音时为 0.53 且词错误率 2.69%;两者都用时最好,为 2.58% 与 0.63。方向很清楚:相似度对说话人条件极敏感,嵌入与提示语音互补,缺一都会损失。

第二是细粒度信号是否必要。音高响度在 LJSpeech 上分文本单输入、有草图或有控制信号两档比较;时长在 LibriSpeech-PC 上分无控制与有控制两档比较。共同结论是有信号大幅降误差,无信号则与基线相近或更差。这支持控制是跟随而非凭空预测:给了才准,不给不准。

下表把消融的关键数字整理成五列,便于看到未胜出项与失败条件,数值仍以原文连续句为准。

消融条件指标无条件结果单条件结果双条件结果
说话人控制SIM-o↑0.07 w/o speaker0.48 embedding only0.63 embedding plus prompt
时长控制MAE↓31.58 w/o control 0.1B14.00 w/ control 0.1B28.00 DiTAR baseline
时长控制MAE↓28.08 w/o control 0.6B11.86 w/ control 0.6Bsubstantially outperforming replicated
推理配置采样32 sampling stepsguidance scale of 1.5unified conditioning signal

表后必须讲代价与反例。收益是双条件最好、单条件次之、无条件最差,时长有控制直接把误差砍半以上。但反例是只用嵌入时词错误率 3.27% 反而略高于无条件的 3.12%,说明相似度回升不必然带来可懂度提升;小模型无控制时长 31.58 甚至高于大模型无控制的 28.08,说明容量本身也影响节奏稳定性。未评测边界是若前端对齐错了,时长条件会把错误节奏强加给合成,这在论文局限中归为依赖对齐质量的问题。

哪些结论不能下,哪些误差来源必须承认?

论文用专门一节承认四点局限。第一是实验主要在英文语音上,多语或码切换是否有效尚未探索,因此不能把结论推广到中文或混读场景。第二是细粒度控制依赖音素对齐的音高、响度和时长,其质量受基频提取与强制对齐误差影响,前端错则控制错。第三是显式控制虽提升跟随,但纯文本生成仍难预测精确局部韵律,尤其是音高,这与文本单输入时音高误差大的结果一致。第四是当前只管说话人、音高、响度和时长,情感、音质和非言语发声未显式建模。

从证据等级看,零-shot 与可控性的数字属于直接报告,有表可查;双条件互补与对齐控制有效的解释属于有限解释,有消融支持但只在英文与给定前端下成立;若推测换前端或换语言仍同样提升,则属于待验证,不宜承诺。缺失证据不是技术错误,例如未测量延迟与成本,就不能说推理更快更省。

初学者易犯的误解是把响度好当成全部韵律好,或把某一步最好当成全程最好。原文数据显示响度文本单输入已优于对照,但音高文本单输入劣于对照;总体趋势不等于每组每步都成立。另一个误解是把训练资源当成延迟,8 卡训练 5 轮说的是预算,32 步采样加引导说的是推理开销,40 赫兹隐帧率说的是表示密度,三者要分开讨论。

要复现应先固定什么,再补哪项验证?

复现先做三件事。第一是按原文固定可运行条件:两尺寸的结构配置、AdamW 学习率与衰减、5% 热身后线性衰减、5 轮、32 步采样与 1.5 引导尺度、每块 4 隐词元、40 赫兹 64 维隐表示、16 千赫输入。第二是固定前端:WORLD 加 DIO 加 StoneMask 的音高流程、A 计权加均方根转分贝的响度流程、强制对齐的时长计数,以及 128 档音高与 64 档响度的量化边界。第三是固定评测链:Whisper-large-v3 算词错误率、WavLM 说话人验证模型算相似度、帧级均方根误差与音素级平均绝对误差分开算。

资源状态是正文开源声明的唯一依据。本次收到的证据中未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。论文正文虽写演示、代码与权重可在 CtrlSpeech 处获取,但本次未能确认可达,复现应先按论文文字自建流程,不依赖外部链接。

还需补的验证包括换前端版本后的跟随稳定性、不同引导尺度与步数下的质量与控制权衡、以及在噪声提示或短提示下的相似度变化。若要宣称实用,还应补测实际延迟、实时率与人工听感的误判率,这些在原文中未测量,不能默认改善。

何时值得尝试这种粗到细的显式控制?

当任务同时要求像谁和逐词可改时值得尝试,例如有声书里某个人物的某句需要抬高、加重或拖长,又不希望换音色。这时先用粗条件定身份与初版,再用细信号逐词修正,比整句重抽或换提示更直接。当只需要整体风格且不关心落在哪个词上时,文本提示或全局风格向量可能更省事,不必上音素对齐。

可核对的要点是表示分开、条件对齐、评价分开。表示分开指身份走全局向量,表现走音素符号;条件对齐指每个符号都能回指到具体音素;评价分开指可懂度、相似度和跟随误差各归其位。复述方法时沿样本走一遍输入到表示到组件到目标到输出,再展开量化与分块细节,就不容易把比喻当证明。

收束时回到最强证据与主要代价。最强证据是有控制时音高、响度和时长误差同步大幅下降且零-shot 客观指标不降;主要代价是无控制时音高预测仍弱且全流程受前端质量与英文数据范围限制。理解这一点,就能在后续工作中补对验证,而不是只调大模型。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总