英文题目:Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering

会议身份:conference:interspeech:2026:conference-paper-id:geng26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据增强 #数据清洗 #指令微调 #语音 #文本到语音

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yizhong Geng:机构信息未能从会议 PDF 纯文本可靠映射
  • Kecan Mao:机构信息未能从会议 PDF 纯文本可靠映射
  • Qifei Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Cong Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yingming Gao:机构信息未能从会议 PDF 纯文本可靠映射
  • Ruimin Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Chunfeng Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Hao Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Ya Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

指令式语音合成任务输入为用户自由文本指令,输出为口音、情感、语速、音量等多维风格可控语音,实际难点是大规模指令语音监督难采集,而大语言模型(Large Language Model,LLM)改写结构化标签所得指令存在同质化与语义漂移腐蚀监督。流程第一步做属性对齐的数据准备,对每段语音做变调变速变音量参数化扰动并配模板提示,形成可信低层韵律锚点。第二步以上一步的扰动后语音与结构化标签为种子,用人物视角(Persona)、句法模式(Syntactic Pattern)与属性槽位(Attribute Slots)硬约束有界枚举生成多样化指令候选,系统扩展覆盖。第三步用异源验证器对候选评分并对边界样本投票,仅保留高保真指令语音对进入第四步监督微调(Supervised Fine-Tuning,SFT),以先扩覆盖后滤漂移区别于无约束改写。在中文InstructTTSEval上完整方案平均指令遵循准确率56.4%,超过同骨干无微调34.5%与朴素微调51.0%,外部基线VoxInstruct为47.5%;无约束改写漂移率40.4%降至约束改写15.4%,过滤后审计约5%。结论目前仅在中文单语料与CosyVoice 2.0-0.5B单基座验证,未检验跨语言与真实用户分布外推。原文未披露训练硬件、推理与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么要读这篇?

这篇解读的输入是会议论文正文与两张官方原图,目标是让刚进入语音合成领域的学生能复述方法与实验条件。必须保留的信息包括任务定义、3 类漂移、3 个稳定机制、训练与评估配置、主要数字及其适用条件。输出是 1 篇按学习依赖展开的中文讲解,不做超出证据的推广。

指令式语音合成要解决的问题是用户用自由文字描述想要的声音,例如带北京口音的叙述、悲伤但语速稍快。模型要根据这段控制指令去朗读另一段文本内容。白话说,控制指令是关于如何说的要求,朗读文本是要说的内容,二者不能混淆。英文名是指令式文本转语音,缩写是 Instruct-TTS。

传统做法用固定标签控制,例如情感等于开心、口音等于四川。为了扩大到真实用户的多样说法,常见做法是把结构化标签经大模型改写成自然语言指令,论文称之为标签到指令流水线,英文是 label-to-instruction pipeline。这条路看似省力,但论文发现无约束改写中有超过 40% 的样本改变了原意,相当于给模型喂了错的监督信号。

本研究的目标不是换更大的合成模型,而是把这批指令数据变干净、变全面。具体动作是先约束生成以扩大覆盖,再用校验器过滤漂移,再用声学扰动补齐低层韵律监督,最后在同一合成底座上做稳定微调并在中文评测集上验证。理解这条数据为主线的因果链,是后续所有细节的基础。

同输入同目标的已有路线差在哪里?

在指令式语音合成一侧,提示式合成系列从说话风格扩展到情感、口音和韵律等多维指令,大规模标注语料也在推进。这些工作多把上游指令数据当作给定,重点改进模型结构与训练目标。本文的对照点是同输入、同目标、同运行阶段,但监督来源不同:它专门研究上游指令数据的覆盖与忠实,不改合成模型主体。

在可控语音合成一侧,传统方法用参考音频嵌入或离散风格标签控制整体风格,音高、语速、音量等低层属性多经信号处理或模型内部控制调节。本文的属性对齐监督沿用了参数化扰动的思想,但新增作用是把扰动参数与自然语言属性提示配对,形成高保真接地信号,而不是只做数据增强。

在自然语言处理一侧,自主指令生成与演化指令证明了大模型生成指令可以训练遵循能力,大模型作评委也被广泛用于数据过滤。本文指出这些通用流水线假设提示质量可控,但在语音场景中控制与表演的边界更微妙,通用提示与过滤不能直接搬运。因此本文的漂移分类与双家族模型校验是针对语音指令的特化设计,不能把类别差异直接当成同条件胜负来比较。

什么叫指令监督不稳定,三类漂移如何污染训练?

论文把两个耦合弱点统一为指令监督不稳定性,英文是 instruction supervision instability。白话说,就是训练用的指令与语音配对又窄又脏:窄指说法同质,覆盖不了真实用户的多种表达;脏指改写悄悄改变控制含义。模型本身能跟随指令,但学到的监督信号不可靠。

指令监督不稳定性 × 标签到指令流水线: 标签到指令流水线指把口音、情感、风格等结构化标签经模板或大模型改写成自然语言控制指令的过程;指令监督不稳定性指该流水线同时存在表达同质化和语义漂移两种缺陷,导致训练信号又窄又脏。论文把问题定位为数据质量问题而非模型结构问题,因此 remedy 必须同时在覆盖维度和忠实维度改进数据,而不是只调模型。

为让忠实可操作,论文定义 3 类漂移。第一类是指令到执行漂移,英文是 instruction-to-execution drift,改写从要求如何说变成直接用目标风格说话。第二类是角色代入漂移,英文是 role-assumption drift,改写以剧中人口吻回应,而不是下达控制指令。第 3 类是实体与标签漂移,英文是 entity/label drift,改写悄悄改动情感、口音或风格等种子属性。

下面这张图用同一个北京口音叙述种子,直观展示 3 类错误与忠实指令的差别,读图时先确认顶部要求,再看每张卡片错在哪里。

看图路径: 1. 先看顶部白色框中的忠实指令,确认种子要求是北京口音叙述;2. 再逐一对比三个灰色卡片中红色漂移示例与顶部要求的区别;3. 注意每张卡片的英文小字解释,区分表演、代入角色与篡改标签三种错误;4. 把三类错误与后文过滤器的三个类别对应起来

原论文 Figure 1:Three drift types in LLM-rewritten instructions: a drifted output versus the expected faithful…

论文图 1。原论文 Figure 1:“Three drift types in LLM-rewritten instructions: a drifted output versus the expected faithful instruction from the same seed attributes.”。

从像素可见,顶部白框是忠实指令,要求用北京口音叙述。下方 3 张灰卡分别给出红色漂移示例:第一张输出目标风格的表演式话语,第二张以北京主持人自居开始叙述,第 3 张直接写成四川口音会话。左侧图标也不同,分别对应书写、人物讲解与结构分支。每张卡片的灰色小字说明了错误性质,红色字标出漂移部分。这种并排呈现说明 3 类错误都偏离同一份种子要求,但偏离方式不同,后文过滤器正是按这 3 类打分。

指令到执行漂移 × 角色代入漂移: 指令到执行漂移指改写从说明如何说滑向直接表演该风格的话语,混淆了控制与执行边界;角色代入漂移指改写采用剧中人第一人称口吻回应,而不是下达控制指令,教会模型模仿人设而非可控性。二者都是监督污染,但前者破坏指令与执行的功能区分,后者引入多余的人设模仿目标,分类后校验器才能按不同模式打分剔除。

污染机制可以沿一个样本走完:种子要求北京口音,若改写变成四川口音,语音仍是北京口音,模型就会学到错误的口音映射;若改写变成表演式话语,模型会把朗读内容当成风格控制,混淆两种功能。这解释了为何在有噪声指令上直接微调可能不如不微调,证据在后文主结果中给出。

稳定配方全景:数据如何从毛坯变成高保真监督?

配方分为 4 段。第一段是数据准备,从预切分短语音片段出发,标注口音、情感、性别、说话风格等结构化种子属性,再对每段语音做音高、语速、音量的参数化扰动,经模板生成属性提示。第二段是可控多样化,在人设、句式、属性槽约束下改写种子属性,系统枚举组合生成候选。第三段是漂移过滤,用另一模型家族的校验器按漂移分类打分与投票,只保留高保真指令。第 4 段是稳定微调与评估,把高保真指令与语音配对微调同一底座,并在未见过的新指令上测试泛化。

下图是 4 段的流水线总览,建议沿箭头看主路径,再看语义分支与声学分支在哪里汇合。

看图路径: 1. 沿 1 到 4 四个虚线框看主路径,从原始语音到结构化标注再到高保真指令;2. 看第 2 框中句法、人设、属性槽三个约束如何同时指向生成指令;3. 看第 3 框漏斗两侧的输入指令、漂移分类与下方高保真输出的关系;4. 看第 4 框中语音片段与指令如何汇入模型,再分出人工与自动两路评估

原论文 Figure 2:Overview of our data-centric stabilization recipe: (1) data preparation with structured labeling…

论文图 2。原论文 Figure 2:“Overview of our data-centric stabilization recipe: (1) data preparation with structured labeling and pitch/speed/volume perturbation; (2) controllable instruction diversification…”。

从像素可见,全图是 4 个虚线纵框。第一框顶部是原始语音库,经标注变为结构化标签数据,再经扰动变为属性扰动数据,箭头向下表示加工顺序。第二框顶部是改写提示,中部是句法、人设、属性槽 3 个约束图标,箭头向下生成指令示例。第三框顶部是待筛指令,中间是打分与投票的漏斗,左侧引出 3 类漂移示例,向下输出高保真指令。第四框顶部是指令与语音片段汇入指令式语音合成模型,中部经中文评测集生成合成语音,底部同时走向人工判断与自动判断。这种布局说明语义扩写与声学扰动是两条并行供给线,最终都汇入微调与评估。

关键设计是模型家族隔离:生成、校验、评判分别使用不同系列的大模型,以减轻自评偏差与系统性偏好。覆盖与保真的权衡也被显式暴露:约束扩写降低漂移但仍有残留,过滤进一步提纯但会减少保留量,后文用保留率数字量化这一代价。

三个组件各自算什么,如何配合?

先讲属性对齐监督,英文是 attribute-aligned supervision。输入是预切分短片段与结构化标注,操作是对每段语音做音高正负半音、语速倍率、音量分贝的多档扰动,再把扰动设置映射为简洁属性提示。输出是扰动后语音与属性提示的配对。它的作用是为音高、语速、音量等定义明确的声学维度提供接地真值,弥补自由改写覆盖不可靠的问题。

再讲可控指令多样化,英文是 controllable instruction diversification。输入是种子属性,约束有三项:人设指定说话人视角以分散语用意图,句法模式约束表层形式以减轻模板依赖,属性槽要求所有目标属性不可丢弃以防遗漏导致标签漂移。这些约束作为硬要求写入改写提示,对每颗种子枚举人设与句式组合,最多每种子生成二十余候选。它的作用是让覆盖增长系统有界,而不是自由发挥。

然后讲漂移过滤,英文是 drift filtering。输入是种子要求加候选指令,校验器输出漂移与否、漂移类别与置信分。低于阈值的丢弃,边界样本多次独立采样,只有多数票为无漂移才保留。它的作用是去除残留的监督污染,并暴露覆盖与保真的可调权衡。

可控指令多样化 × 漂移过滤: 可控指令多样化负责扩大覆盖,它用人设视角、句式模式和属性槽 3 个硬约束从同一组种子属性枚举出多种等义说法;漂移过滤负责保证忠实,它用另一模型家族的校验器按漂移分类打分并投票剔除已偏离的候选。二者必须搭配的原因是只扩写不解决残留约 15.4% 的漂移,只过滤不扩大对真实用户说法的覆盖,组合后才形成先系统生成再严格筛选的高保真指令集。

属性对齐监督 × 参数化扰动: 参数化扰动指对每段语音沿音高、语速、音量做定量信号处理变换;属性对齐监督指把这些变换设置经轻量模板映射成简洁属性提示,形成扰动后语音与属性提示的配对。分工是前者提供可精确控制的声学真值,后者提供与之对齐的语言监督,搭配理由是自由改写难以可靠表达低层韵律量级,组合后补齐了标签到指令难以覆盖的精细可控性。

打分阈值 × 自一致投票: 打分阈值指校验器对每条候选给出漂移与否、类别和置信分,低于阈值的直接丢弃;自一致投票指对边界样本多次独立采样,只有多数票为无漂移才保留。分工是前者快速去除低置信样本,后者降低单次判断噪声,搭配形成覆盖与保真的可调权衡,组合使用时精度最高但保留率最低。

沿一个样本走完全程有助于记忆:一段带北京口音标注的短语音先被扰动出不同语速版本并配上语速提示;同一组种子属性经不同人设与句式改写出多条指令;校验器剔除其中表演式、代入式与篡改标签的条目;剩余高保真指令与对应语音组成微调对,教模型把多样说法映射到同一控制含义。

微调与数据构造的真实计算过程是什么?

训练底座是中文语音集合上微调的 CosyVoice 2.0 的小参数版本。数据规模约为 90 小时、约一万二千片段,每段短于 30 秒,覆盖 8 类口音与 10 类说话人风格并带结构化标注。属性对齐部分对每片段做音高、语速、音量的多档扰动,原文报告每片段产生 17 个变体。指令生成比较了多个大模型,最终选择多样性与属性忠实最好的模型生成候选,校验使用另一家族模型,阈值与投票细节与完整提示模板放在补充材料中。

监督来源有两类:一类是高保真自然语言指令与原始语音的配对,另一类是属性提示与扰动后语音的配对。前者教多样的说法到同一控制含义,后者教低层韵律的可控映射。优化器使用 AdamW,学习率、批量、轮数、余弦 schedule 与预热步数在原文实验配置中给出。论文未报告逐层冻结与否、梯度是否截断到某模块、以及是否重置优化器状态等实现细节,这些缺项在复现时需要按补充材料或默认配置补齐,不从模型名称推定。

需要区分的是,校验器与评判器只参与数据筛选与评估打分,不参与合成模型的梯度更新。生成、过滤、评测使用不同模型家族,是为了减轻单一模型的系统偏差。训练资源如显卡型号与耗时在正文证据中未给出,不能承诺训练成本得到改善。

在什么数据与协议上测,指标方向如何?

评估使用中文评测集的中文划分,包含 3 类任务:属性控制发音与风格、对话场景描述、角色扮演,缩写分别是 APS、DSD、RP。该评测使用与训练提示不同的未见指令,直接测试对多样真实说法的泛化。指标包括大模型听音频并结合指令文本判定的遵循准确率,方向是越高越好;合成语音的字错率,方向是越低越好;20 名母语听众对每种设置各 20 条样本评出自然度与可控性,量表为一到五分并带置信区间,方向是越高越好。

比较条件保持同一合成底座:无微调基线、朴素微调与完整配方对比,另有一个外部基线使用官方检查点并喂相同指令。指令生成、漂移校验、最终评判分属不同模型家族,以减少偏差。人工标注 800 条扩写样本,一半来自无约束改写,一半来自受控改写,用于估计漂移率;过滤后还经人工抽查验证残留漂移。判断稳定性分析放在补充材料中。

复现时要注意聚合口径:平均准确率是三任务的算术平均,百分点差与相对百分比不同。字错率与主观分属于不同维度,不能把自动指标当成人评,也不能把某任务的提升推广为全程成立。

主结果:完整配方比两类基线好多少,代价是什么?

要回答的核心比较问题是,在同一底座与同一中文评测上,完整配方是否同时优于不微调与在未过滤改写上直接微调。公平条件是三者共享底座与评测指令,指标方向是准确率与主观分越高越好,字错率越低越好。下表整理平均准确率、字错率与主观分,外部基线另行列出以避免混放不同底座。

条件平均准确率字错率自然度可控性
无微调基线34.5%35.0%3.303.17
朴素微调51.0%19.2%3.463.22
完整配方56.4%17.74.164.16
外部基线47.5%22.53.183.12

上表显示完整配方平均准确率达到 56.4%,高于无微调的 34.5% 与朴素微调的 51%。字错率从 35% 降到 19.2% 再降到 17.7,人工自然度与可控性均达到 4.16,高出其他系统 0.7 以上。外部基线平均准确率为 40% 7.5,但主观分最低,说明自动准确率与人工感受并不完全一致。

未胜出项也应说明:在细分的情感维度上,朴素微调反而高于完整配方,论文解释为未过滤改写可能过度堆积情感描述,平衡配方纠正了这种偏向。这提示总体平均的提升不等于每个属性都提升,复现时应分属性检查,而不是只看平均值。

漂移有多普遍,去掉每个组件会发生什么?

第一个要验证的问题是漂移是否普遍且可被约束改写降低。比较条件是同为 800 条人工标注,分为无约束与受控两组,指标是 3 类漂移率与总量,方向越低越好。下表同时给出定义以便对照,数值保留原文写法。

漂移类型含义无约束漂移率受控漂移率变化
总量3 类合计40.4%15.4%下降

上表报告无约束改写总漂移为 40% 点四,其中指令到执行占 18.3%,角色代入占 12.7%,实体标签占 9.4%。受控改写把总量降到 15.4%,每类约减半,但残留仍不可忽略,这正是需要过滤的理由。

第二个要验证的问题是 3 个机制是否互补。比较条件是从完整配方每次移除一个组件,指标仍是平均准确率与字错率。下表整理移除后的平均值与关键任务变化,数据保留原文报告。

条件平均准确率字错率关键任务变化证据指向
完整配方56.4%17.7基准全量
去可控多样化51.8%18.4全面回落覆盖贡献
去漂移过滤48.9%19.8降幅最大保真最关键
去属性监督53.1%18.1APS 从 49.5% 到 42.7%韵律接地
过滤策略组合最优65.4%保留 61.5%DSD 最高但保留最低权衡

上表显示去掉漂移过滤平均值从 56.4% 降到 40% 8.9,尽管训练集更大,支持增益来自去脏而非数据量。去掉可控多样化降到 51%,说明覆盖扩展超出单独过滤的贡献。去掉属性监督平均为 53.1%,但属性控制任务从 40% 9.5 降到 40% 2.7,符合其针对低层属性的定位。过滤策略对比中阈值与投票单用各有保留率代价,组合精度最高但仅保留 61.5%,体现保真与覆盖的固有权衡。

哪些结论有边界,什么还没有被验证?

论文直接报告的是中文划分上的提升,跨语言泛化未在正文证据中验证,不能把中文结论推广到其他语言。漂移分类可能推广到其他指令生成任务,但原文用可能一词表述,属于待验证推测,不是已证结论。

证据支持过滤是最大贡献者,也支持漂移率下降与下游提升呈单调关系,但相关性不等于严格因果,因为 3 组对比的操作点同时改变了数据量与筛选严格度。论文提到尺寸匹配对照在补充材料中,正文未给出细节,复现时应补做等量对比。

未测量的量包括误判率、延迟、推理开销与训练成本,原文未报告硬件预算,不能承诺这些量得到改善。评判依赖大模型听音频,主观分样本量为每设置 20 条,判断稳定性分析在补充材料中,正文证据有限,引用时应说明该边界。

复现先做什么,需要哪些信息条件?

先复现数据管线:准备预切分短语音并标注口音、情感、风格等种子属性,再按音高半音、语速倍率、音量分贝多档扰动并经模板生成属性提示。原文给出扰动档位与每片段十七变体,完整提示模板与人设句式规格在补充材料中,复现必须先拿到这部分,否则约束扩写无法对齐。

再复现生成与过滤:用与校验不同家族的模型生成候选,用另一家族模型按 3 类漂移打分,阈值与多次投票保留多数无漂移样本,记录保留率以复现覆盖与保真的权衡。训练沿用同一合成底座与优化配置,评估用未见指令的中文三任务,分别记录分任务准确率、平均值、字错率与人工双分。

资源状态是正文开源声明的唯一依据。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。论文脚注给出音频示例页面,但本次未能确认可达,复现前应先确认链接当前是否可用,并区分代码开源、权重下载与系统可运行 3 种不同状态。

何时值得尝试这套配方?

当你的指令数据来自标签改写,且发现说法单一或模型把控制当表演时,这套配方值得尝试。它的适用条件是已有结构化种子属性,能做参数化声学扰动,且能承担另一模型家族做校验与多次投票的成本。如果只能做其中一步,证据支持优先做漂移过滤,因为它是单项影响最大的组件。

常见误解是多样性本身等于质量。本文的反例是无约束扩写越多,漂移污染也越多;受控扩写降低漂移但仍残留约 15%,必须再过滤。另一个误解是数据量越大越好,去过滤后数据量更大但平均值反而下降,说明保真优先于数量。

收束一句话:用硬约束把说法变多,用分类校验把错的去掉,用扰动配对把轻重快慢讲准,三者缺一不可,代价是保留率下降与额外的模型调用开销,还需补跨语言与成本验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总