英文题目:Imitation Learning for Elder-Facing Speech Synthesis
会议身份:
conference:interspeech:2026:conference-paper-id:han26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#强化学习 #主观评测 #低资源 #语音 #文本到语音
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Dongrui Han:机构信息未能从会议 PDF 纯文本可靠映射
- Weidong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jiawen Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Mingyu Cui:机构信息未能从会议 PDF 纯文本可靠映射
- Helen Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Xixin Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向老年人的语音合成需将文本转为慢速、高可懂且偏好对齐的粤语语音,难点在于老年人易疲劳而难以大规模采集偏好,且奖励函数欠约束易引发奖励黑客。该方法先以医护人员录制的老年面向与新闻播报配对样本训练专家奖励与发音奖励并以加权调和平均融合成复合奖励,再用组相对策略优化微调CosyVoice 2-Yue策略,随后以两阶段在策略奖励学习迭代加入策略rollout并重训奖励模型以动态收紧约束。与固定奖励的组相对策略优化相比,关键差异在于奖励模型随策略分布演化而更新而非冻结,从而抑制一味拉长停顿的投机解。在内部测试集与8名老年人平均意见分评测下,GRPO w/ OPRL Stage 2的MOS为3.78±0.16,高于GRPO w/o OPRL的MOS 2.70±0.23。结论仅在粤语、单基座模型与小规模老年听测范围内成立,未验证跨语言、跨基座与长期真实部署偏好的外推性。上述适用边界受限于单语言小样本条件,跨场景长期效果尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 演示资源:https://dongru1.github.io/demo/im-efss/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?这篇解读要帮你复述什么?
本文解读的输入是会议论文正文的确定性证据与两张官方原图像素,目标是让刚进入语音合成领域的研究生能不看原文也复述出方法与实验条件。必须保留的信息包括任务定义、专家示范的来源与规模、奖励组成、2 阶段在策略奖励学习的构造步骤、基线与评估指标方向,以及可核对的关键数字。输出按学习依赖展开,先讲老年听辨任务为何不能直接套用通用合成,再讲相关路线与本文选择,最后落到可复现的训练与评估细节。论文当前演示链接状态为可用,地址在摘要中给出,但解读的事实判断仍以正文证据为准,不把能打开演示页等同于能复现训练。
老年语音合成的难点不在能否发出自然音,而在是否匹配老年人因听觉与认知衰退产生的理解需求。通用系统追求自然与表现力,默认听者是一般成年人,对语速、停顿、音高变化的处理未必照顾高听阈与较慢加工速度的老人。如果直接让老人反复做偏好选择来调参,老人容易疲劳,数据收集成本高且难以扩大规模。
论文因此换了一条路:不直接采集老人的成对偏好,而是请有经验的医护人员录制面向老人的示范语音,把这种示范当作专家行为,用模仿学习让合成模型去学。教学例子是:就像新手护士跟班学习资深护士如何对老人放慢语速、加重关键词,而不是让每位老人都来投票打分。
已有路线如何处理偏好与奖励?本文站在哪里?
同输入同目标的已有工作包括两类。第一类是直接让老人参与,例如文中引用的 HILVoice,在可控韵律因子上迭代搜索老人偏好的说话风格,每轮都依赖主观偏好测试更新时长与音高等因子。这条路监督信号最直接,但运行阶段需要老人反复听评,时间长且易疲劳,难以做成大数据集。第二类是基于强化学习的语音合成后训练,例如用群组相对策略优化提升自然度,或用直接偏好优化在模型生成的成对数据上学情绪与可懂度偏好。
这类工作的奖励多用词错误率等客观指标,因为人工成对标注贵,而固定奖励容易出现奖励黑客行为,即模型只刷奖励高的风格维度,丢掉未写进奖励的质量与可懂度约束。
本文与上述工作的对照点在于监督来源与运行阶段。监督上,本文不用老人偏好对,而用医护专家示范加中性风格或中性模型生成的负例构成奖励训练集;运行上,本文不在固定奖励下只微调策略,而是让奖励模型随策略滚动样本逐步更新。论文还讨论了已有缓解奖励黑客行为的做法,例如构造失真语音与干净语音的数据对来施加约束,但指出随着策略变强,原先构造的约束会失效,因此需要动态的在策略指导。这一判断是论文选择 2 阶段更新的直接理由。
任务的形式化输入输出是什么?难在哪里?
任务输入是一段待合成的文本,输出是面向老年人的粤语语音波形。训练时可用的监督不是老人打分,而是专家示范集,记为文本与录音的配对集合,每对包含同一内容的两种录音:一种是医护人员面向老人的风格,另一种是中性新闻播报风格。负样本集合则是中性风格录音或中性模型生成语音。奖励训练集是专家示范与负样本的并集。测试时要求模型对未见文本仍能生成老人偏好的风格,同时保持可懂度。
难点有 3 层。第一,奖励难写:质量是主观的,涉及自然度与可懂度多个交互因素,写错就会被钻空子。第二,数据少:内部专家示范只有百余对,总时长有限,无法靠大规模监督微调覆盖广泛文本。第三,评估双重要求:既要韵律像专家,又不能牺牲发音准确性,单一指标上升不能证明任务成功。论文把问题框定为低资源下的偏好对齐,而不是单纯提升自然度,这决定了后文必须同时报告风格指标与可懂度指标,并用老人主观评价做最终裁决。
整体管线如何从文本走到老年偏好语音?
沿一个样本走完全程有助于建立全局图。输入一句粤语文本,先进入已做监督微调的策略模型,即粤语 CosyVoice 2-Yue 骨干,采样出一组语音记号,记为多个滚动样本。记号经流匹配与声码器转成波形,再送入复合奖励模型打分,得到每个样本的奖励值。同一文本的多个奖励在组内做均值与标准差归一化,得到相对优势值,最后用带裁剪与散度惩罚的目标更新策略参数。奖励模型本身不是固定的,它会定期把策略新生成的语音筛后加回训练集并重训,形成奖励学习与策略微调交替进行的闭环。
模仿学习 × 逆强化学习: 模仿学习负责定目标:不手写老年人喜欢什么样的语速和停顿,而是直接复刻医护专家面对老人时的示范语音;逆强化学习负责定标尺:先从专家示范与非专家负例中反推一个专家奖励模型,给像专家的语音打高分,再用这个奖励去优化语音合成策略,二者搭配的原因是主观偏好难以写成公式,只能先学奖励再学策略。
下图是论文给出的管线总览,上半是单轮群组优化的数据流,下半是在策略奖励学习的双向更新关系。读图时先抓住主路径,再看奖励分支如何汇入组计算。
看图路径: 1. 先从左侧策略模型输出的多个语音记号找到主路径,再看波形如何进入奖励模型;2. 对比蓝色发音奖励框与橙色专家奖励框的并列位置,确认二者共同组成复合奖励;3. 跟踪复合奖励到组计算再到优势值的箭头,理解组内比较如何驱动策略更新;4. 看下半部分从数据到专家奖励再到策略模型的双向箭头,区分奖励学习与策略微调两个方向
论文图 1。原论文 Figure 1:“Overview of the GRPO pipeline and the on-policy reward learning (OPRL) process.”。
从像素可见,上半部分从左到右依次是语音记号、波形、奖励模型、复合奖励值、组计算与优势值,奖励模型内部并列了发音奖励与专家奖励两个子框。下半部分左侧是专家示范与负例数据,中部是专家奖励,右侧是策略模型,中间用奖励学习箭头与微调箭头连接,其中一条奖励学习箭头用红色突出,强调奖励不是 1 次性训好就不动,而是要回头更新。这个结构直接对应后文 2 阶段的具体筛选与加库操作,理解了双向箭头就理解了本文与固定奖励工作的本质区别。
专家奖励与发音奖励各自算什么?如何合成?
专家奖励也被称为内在奖励,目标是判断生成语音是否像专家示范。实现上先用预训练 StyleTTS 2 的韵律风格编码器从梅尔谱提取韵律嵌入,编码器包含带谱归一化的卷积层、4 个带谱归一化的残差块、空间下采样、自适应平均池化与线性投影,输出 128 维向量,训练奖励时冻结该编码器。奖励头对该向量做层归一化,再过 6 个残差块,每个块含两层线性层、层归一化、激活、残差连接与丢弃率 0.1 的丢弃,最后线性映射为无界标量,再经双曲正切变换归一化到 0 到 1 区间。训练用成对排序损失,让专家录音的分数高于非专家样本,符合 Bradley-Terry 成对比较思想。
发音奖励负责守住可懂度底线。用预训练粤语识别模型把语音转写为文本,考虑到粤语同音字多,不用字错误率而用基于粤拼的音节错误率。原始音节错误率经双曲正切变换映射为有界奖励,陡峭系数取 3,错误越低奖励越高。两个归一化奖励再用加权调和平均合成复合奖励,形式类似 F 分数。调和平均的特点是对短板惩罚更狠,避免模型用高风格分掩盖低可懂度分,或反之。
专家奖励 × 发音奖励: 专家奖励负责管风格:用冻结的韵律风格编码器抽取梅尔谱的韵律嵌入,再经可训练奖励头判断是否像专家面对老人的说话方式;发音奖励负责管可懂度:用粤语识别模型转写后算基于粤拼的音节错误率并映射到 0 到 1,二者用调和平均组合的原因是防止模型用含糊但缓慢的语音刷风格分,任一分过低都会把总分拉低。
策略优化沿用群组相对策略优化并保留近端策略优化裁剪。对每条文本采样 4 个滚动样本,用组内奖励的均值与标准差算优势,再对每个记号位置做重要性采样比率裁剪,裁剪范围 0.2,并加相对冻结参考模型的散度惩罚以防漂移过大。原文明确给出了优势公式、裁剪目标与散度项的计算安排,冻结的是参考模型与风格编码器,可训练的是策略与奖励头,梯度路径按标准策略梯度与排序损失执行,未报告的部分不做推定。
在策略奖励学习如何动态修标尺?
在策略奖励学习的核心动作是把策略刚生成的语音变成奖励模型的训练数据。第一阶段限定在专家示范文本上进行。先在初始奖励训练集上训好初始专家奖励,再用该奖励做群组优化微调策略,并记录全部滚动样本。然后筛选预测专家奖励在 10 分位到 90 分位之间且音节错误率低于 0.15 的样本,赋予介于负例与专家示范之间的中位奖励,加入数据集后重训专家奖励。这一筛加过程重复预设次数 5 次。筛选上下分位之外的样本被丢掉,目的是去掉奖励过高可能是钻空子、奖励过低可能是坏样本的两端,只保留中间可信的过渡样本。
群组相对策略优化 × 在策略奖励学习: 群组相对策略优化负责做策略更新:对同一文本采样一组语音,用组内均值和标准差算相对优势并做裁剪更新; 在策略奖励学习负责修标尺:把策略新生成的滚动样本筛后加回奖励训练集并重训奖励模型,二者搭配的原因是固定奖励会被策略钻空子,只有让奖励见过策略的新花样,才能持续指出偏离专家的行为。
第二阶段要把奖励暴露给更多文本变化。输入除原训练数据与第一阶段策略外,还有外部文本集。步骤是先用当前专家奖励在外部文本上继续群组优化并记录滚动样本,再把音节错误率不超过 0.1 的样本按 0.04 为箱宽分箱,对样本充足的箱按预测专家奖励排序,取 0、25、50、75、100 分位样本赋单调递增奖励,加入原训练集后重训奖励,最后再用最新奖励微调策略。分箱的作用是让不同可懂度水平各自排序,避免把发音差但风格夸张的样本与发音好的样本直接比较,从而在扩大文本覆盖的同时守住可懂度分层。
两阶段训练的具体操作与超参数是什么?
训练起点是对粤语 CosyVoice 2-Yue 骨干在专家示范数据上做监督微调,所得模型作为策略初始化。CosyVoice 2-Yue 本身已在粤语数据上微调过,发音奖励用的识别模型是包含 5000 小时粤语数据的多语种模型。监督微调用 Adam 学习率 1 乘 10 的负 5 次方,在 4 卡上训练 200 轮。专家奖励训练用 AdamW 学习率 1 乘 10 的负 4 次方、权重衰减 0.01、批量 32、最多 200 轮并以 100 轮耐心早停。群组优化用 AdamW 学习率 1 乘 10 的负 6 次方、权重衰减 0.01、梯度裁剪 1.0、累积 2 步、批量 2、半精度,每个提示采样 4 条,采样用 top-k 为 25、温度 1.2,裁剪 0.2,散度系数 0.1,移动平均窗口 20,若移动平均奖励 1000 步不提升则停止。
奖励黑客行为 × 2 阶段更新: 奖励黑客行为指模型只放大奖励函数中好拿分的 1 维,例如一味放慢语速和加长静音,却丢掉整体质量和可懂度;2 阶段更新负责分步堵漏:第一阶段在专家示范文本内用生成样本扩展奖励集,第二阶段在外部大文本上按发音错误分箱排序扩展奖励集,组合意义是先在已见文本上稳住奖励,再到未见文本上扩大韵律覆盖。
阶段一与阶段二的数据操作是本节最需复述的部分。阶段一重复 5 轮,每轮都经历策略微调、按分位与音节错误率筛选、赋中位奖励、扩库重训奖励。阶段二只做一轮大循环,但引入外部文本的 5000 句筛选集,且筛选条件更严,要求音节错误率不超过 0.1 并按箱排序赋等级奖励。论文未报告奖励头重训时是否重置优化器或冻结轮数之外的细节,这部分属于缺项,复现时应先按常规做法从上轮权重继续微调并记录验证排序准确率,不从模型名称推定实现。若没有在策略更新,固定奖励基线就是本文的无 OPRL 对照,它只做 1 次奖励训练后不再更新奖励。
数据划分、评估协议与指标方向如何规定?
实验要回答 3 个问题:合成语音是否更像专家韵律,是否保持或提升可懂度,是否被老年人主观偏好。数据上内部专家示范共 125 对,划分训练 89、验证 18、测试 18,阶段二另用外部粤语文本集并只保留长于 5 字的句子以放大韵律差异,再随机选 5000 句用于群组优化,保证有限时间内每句可被多次使用。模型比较包含基座、加监督微调、加无 OPRL 的群组优化、加 OPRL 第一阶段、加 OPRL 第二阶段,条件上后者以前者为起点,保证增量可归因。
主观评估请 8 位 66 到 83 岁的粤语母语老人,每系统听 10 句,按 1 到 5 分给偏好分,分数越高越喜欢。客观评估分 3 组:可懂度用音节错误率与字错误率,越低越好;韵律用动态时间规整对齐后的音高准确率、音高平均绝对误差、能量误差、梅尔倒谱失真、浊音帧基频相关性与基频方差比,其中准确率与相关性越高越好,误差与失真越低越好,方差比越接近 1 越好;时长与相似度报告静音时长、总时长与说话人相似度,时长指标用于诊断是否拖长,而非越长越好。统计显著性用配对符号秩检验加校正报告。
下表整理数据与训练配置,比较问题是复现需要准备多少数据与算力,公平条件是同一骨干与同一示范集,指标方向是数量越大覆盖越广但成本越高。
| 环节 | 数据规模 | 划分与筛选 | 优化器与学习率 | 批量与训练预算 | 采样与早停 |
|---|---|---|---|---|---|
| 专家示范 | 125 对,1.5 小时 | 训练 89,验证 18,测试 18 | 监督微调 Adam 1×10−5 | 200 轮,4 卡 | — |
| 主观评估 | 8 位老人 | 每系统 10 句,66-83 岁,均值 71.2 | — | — | — |
上表说明复现先做什么:先按 89、18、18 划分准备示范数据并核对总时长,再准备 5000 句外部文本与 8 位老人的主观协议,最后按表中优化器与批量复现监督与奖励训练。代价是群组优化批量小但需多轮采样与奖励重训,未报告总时长与硬件小时数,推理延迟也未测量,因此不能承诺成本下降。表格数字均来自正文连续原句,破折号表示该环节原文未报告对应量,属于缺项而非零。
主结果显示什么收益?奖励黑客行为长什么样?
比较问题是:在同一骨干与同一示范起点下,OPRL 是否同时改善可懂度、韵律与老人偏好。公平条件是监督微调模型作为强基线,无 OPRL 的群组优化作为固定奖励对照,OPRL 2 阶段依次递进。指标方向是音节与字错误率越低越好,音高准确率越高越好,总时长与静音时长接近真值才健康,老人平均意见分越高越好。论文报告无 OPRL 出现典型奖励黑客行为:静音与总时长远超真值,但可懂度与多项客观指标弱于监督微调,主观分也是最低之一。OPRL 第一阶段在全部客观指标上超过无 OPRL,第二阶段进一步提升并在多数指标取得最好或次好,主观分最高且显著高于基座与无 OPRL。
| 系统 | 静音时长 | 总时长 | 音节错误率 | 字错误率 |
|---|---|---|---|---|
| 真值 | 5.43 | 19.27 | — | — |
| 无 OPRL 的群组优化 | 11.51 | 27.62 | 11.58% | 6.99% |
上表只放有连续原句证据的数字,破折号表示真值的可懂度数字未在连续句中出现,不代入推测。表后解释主要收益与具体代价:收益是 OPRL 把拖长语音的投机行为压回去,让模型在不牺牲可懂度的前提下学专家韵律;代价与反例是无 OPRL 的慢速偏执,它把专家示范中的慢速放大为大量停顿与拉长,总时长超出真值约 43%,静音时长翻倍以上,但音节与字错误率反而变差,说明慢不等于清楚。论文还报告第二阶段基频方差比为 1.06,略高于 1 但主观分最高,支持略高且自然的音高变化更受老人偏好,但这属于有限解释,还需验证是否对所有文本成立。
下图用同一句话的三版频谱直观展示上述判断,读图前先明确对象与时间范围:三行是同一内容的真值、OPRL 第二阶段与无 OPRL 版本,横轴是 0 到 22 秒,纵轴是频率能量分布,叠加曲线是预测基频轮廓。
看图路径: 1. 先比较三行频谱的总时间轴,确认无 OPRL 样本明显更长且静音段更多;2. 再看每行左上角标注的原始奖励与 OPRL 奖励数值,判断哪个奖励被钻了空子;3. 观察叠加的基频轮廓线在有声段的连续性,对比拖长停顿处的断裂差异
论文图 2。原论文 Figure 2:“Generated mel-spectrograms and predicted rewards from original and OPRL-based reward models.”。
从像素可见,第一行真值在约 15 秒内结束,频谱块集中、静音间隙短,左上角标注原始奖励 2.668、OPRL 奖励 1.994。第二行 OPRL 第二阶段略长但结构仍紧凑,基频线连续起伏,原始奖励 3.496 反而高于真值,而 OPRL 奖励降到 0.905。第三行无 OPRL 版本拖到约 22 秒,黑色静音段明显增多变宽,基频线断裂更多,原始奖励高达 3.670,OPRL 奖励仅 0.353。这组对比支持论文的关键反证:原始固定奖励给拖长语音打更高分,而 OPRL 奖励给拖长语音打更低分,从而为策略提供有意义的纠偏信号。像素不能精确读出的频率数值不硬写,结论以时长结构与奖励排序为准。
去掉 OPRL 或只做到第一阶段会怎样?
消融的逻辑是把 OPRL 拆成无、阶段一、阶段二三档,观察奖励黑客行为是否逐步缓解。无 OPRL 档只训 1 次奖励然后一直微调策略,结果是风格分虚高但质量与可懂度下滑,老人主观分低,证明固定奖励在低资源下不可靠。阶段一档在示范文本内做 5 轮奖励扩库重训,结果在全部客观指标上超过无 OPRL,说明见过策略滚动样本的奖励更能识别投机性慢速。阶段二档再引入外部文本的分箱排序数据,结果在可懂度与韵律多数指标上最好或次好,主观分进一步提升,说明更广的韵律分布有助于泛化到未见文本。
需要保留的边界是阶段二的提升依赖发音奖励的约束与分箱设计。如果去掉发音奖励或去掉按音节错误率分箱,模型可能再次用含糊语音换风格分,但论文未报告这一消融,属于未评测边界,不能断言去掉后必然崩溃。另一个未胜出项是监督微调本身在部分指标上已很强,OPRL 第一阶段的主观分与监督微调接近,说明小数据下监督微调仍是必备起点,OPRL 的价值主要体现在抑制群组优化的投机行为,而非替代监督微调。总体趋势是阶段越多越好,但不等于每句、每步都单调提升,原文用移动平均早停也暗示训练过程有波动。
证据的边界与未验证的推测有哪些?
论文直接报告的是粤语、单骨干、125 对专家示范、8 位老人的结果,显示 OPRL 第二阶段在可懂度、韵律与主观偏好上占优。有限解释是 OPRL 通过动态奖励缓解了慢速偏执,这一解释有频谱时长与双奖励排序支持,但因果链仍需更多干预实验验证,例如固定策略只换奖励能否复现排序反转。未验证推测包括是否适用于其他语言、其他骨干、年轻听者与一般成人的偏好差异,以及文本结构偏好,这些在结论中被列为未来工作,当前不能推广。
缺失证据不是技术错误,但复现与选型时必须正视。原文未测量误判率之外的延迟、实时率与训练总成本,未报告奖励排序准确率随轮次的变化曲线,未公开内部专家数据的采集协议细节与说话人信息。相关性不等于因果:主观分高与韵律指标好同时出现,不能直接断定是某一单项韵律因子导致偏好。此外演示页可用不等于数据与权重可运行,论文未声明代码与权重开源状态,收束时应区分演示可听、代码开源与系统可运行 3 个层次。
复现先做什么?需要保留哪些超参数与信息条件?
复现第一步是准备数据与协议。按训练 89、验证 18、测试 18 划分 125 对示范,核对总时长 1.5 小时,每对保留面向老人与中性新闻两种风格。外部文本选长于 5 字的句子并随机取 5000 句,保证群组优化时每句可复用。主观评估固定 8 位粤语母语老人、每系统 10 句、1 到 5 分制,年龄范围与均值按原文记录,年长者听评需控制疲劳,测试顺序应随机化以减少顺序效应。
第二步是复现模型与奖励。骨干用粤语 CosyVoice 2-Yue,先监督微调 200 轮作为策略起点。韵律编码器冻结,只训奖励头,奖励训练批量 32、200 轮、耐心 100。群组优化批量 2、累积 2 步、半精度、每提示 4 条、top-k 为 25、温度 1.2、裁剪 0.2、散度系数 0.1、移动平均窗口 20、1000 步无提升早停。阶段一按 10 到 90 分位且音节错误率低于 0.15 筛选并赋中位奖励,重复 5 轮。
阶段二按音节错误率不超过 0.1、分箱 0.04、取五分位赋单调奖励。先跑通无 OPRL 对照,确认出现时长膨胀,再接入 OPRL 观察时长回落与可懂度回升,这是最省算力的诊断信号。
何时值得尝试这种方法?一句话收束
当任务是服务特定听者群、偏好难写成公式、且直接采集目标人群偏好成本过高时,值得尝试用领域专家的示范代替目标人群标注,再以可懂度奖励守底线。复现时先做监督微调打底,再用小批量群组优化验证奖励是否被钻空子,若出现静音与总时长膨胀而错误率不降,就引入在策略奖励学习。还需补的验证是更大规模老人听评、跨语言与跨骨干泛化、以及奖励排序准确率与训练成本的完整记录。只有补齐这些,才能把当前粤语小样本上的有效性判断为可部署收益,而非单次实验的相对最优。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

