英文题目:Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models

会议身份:conference:interspeech:2026:conference-paper-id:peng26g_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #偏好优化 #语音 #文本到语音

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
  • Yukun Ma:机构信息未能从会议 PDF 纯文本可靠映射
  • Chong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yi-Wen Chao:机构信息未能从会议 PDF 纯文本可靠映射
  • Chongjia Ni:机构信息未能从会议 PDF 纯文本可靠映射
  • Bin Ma:机构信息未能从会议 PDF 纯文本可靠映射
  • Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

情感文本到语音合成需要在目标文本语义与用户指定的渲染情感冲突时仍保持可懂、自然且情感准确,现有自回归模型易被文本语义牵引而丢失目标情感。作者先用外部大语言模型抽取文本情感并判定不一致等级,再运行渲染情感与文本情感双分支解码并按等级动态融合对数几率,最后将该引导信号经难样本构造的偏好优化蒸馏回模型以实现单遍推理。与传统丢弃条件的无分类器引导相比,该方法以显式情感对比替代空白基线,提供了更具方向性的跨模态修正信号。在包含7类情感的组合语料测试上,难样本增强的蒸馏模型相对中性参考的CosyVoice2基线将情感准确率从50.63%提升至59.55%,同时词错误率从4.61%降至3.76%,动态引导版本情感准确率达64.83%但词错误率为7.86%。结论主要适用于英文7类离散情感与中性参考零样本设定,对开放式细粒度描述、跨语言及强冲突长文本的外推尚未验证。原文未披露训练时长与推理延迟成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么:为什么冲突样本最考验情感语音合成?

这篇解读的对象是自回归语音合成模型中的情感控制问题。输入包括两部分:一是待合成的目标文本,例如论文示例中的英文句子,其字面语义本身带有悲伤色彩;二是用户用自然语言给出的渲染情感指令,例如要求用高度惊讶的语气说出这句话。目标是让合成语音在声学上准确传达用户指定的渲染情感,同时保持内容可懂、听感自然和音质稳定。

对于刚进入语音领域的读者,需要先建立一个基本判断:文本语义本身会对合成模型产生牵引。模型在训练中见过大量文本情感与语音情感一致的样本,因此当两者一致时,模型顺着文本走也能得到不错的情感表达。当两者冲突时,模型要在 2 个方向之间调和,一边是文本隐含的情感,另一边是指令要求的情感。如果没有专门机制,模型往往偏向文本一侧,导致目标情感被削弱。

本文的输出是一套完整的方法与验证:先在推理期用两路预测的差值做引导,再按冲突程度调整引导强度,最后把引导效果蒸馏回模型,使推理期不再依赖外部判断和双路计算。必须保留的关键信息是:所有实验都以中性参考语音为现实基线,情感判断用独立的语音情感识别模型完成,引导尺度的选择来自开发集网格搜索,蒸馏数据的偏好排序同时考虑可懂度和情感置信度。资源状态方面,本次收到的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能按论文文字讨论方法与结果。

已有路线如何做情感控制,各自在冲突面前缺了什么?

在进入本文方法前,需要把相关路线按相同输入、相同目标和相同运行阶段做对照。第一类是基于参考音频的情感迁移,例如层次化变分推理的零样本合成框架,需要一段带有目标情感的参考语音来提供风格。这种做法的输入是文本加参考音频,目标是克隆参考中的情感。它的优点是风格信号直接来自真实语音,但在现实零样本场景下用户往往没有合适的参考音频,只能用中性参考代替,此时风格信息缺失,论文报告显示情感表达会明显下降。

第二类是大规模语言模型式语音合成,支持情感标签或自然语言指令控制。论文对比的系统包括支持情感标签的内置优化音色,以及原生支持自然语言情感控制的自回归系统。这类方法的输入是文本加一段描述语气的提示,目标是零样本生成对应情感。它的优点是不需要参考音频,但在冲突样本上同样会退化,因为文本语义的牵引没有被显式建模。

第三类是推理期引导方法,例如无分类器引导。它的运行阶段在解码时,通过条件预测与无条件预测的差值来放大条件效果。已有工作把它用于风格对齐,但论文指出这种做法只是丢弃条件做基线,没有针对文本与渲染情感的冲突方向构造基线,因此在冲突严重时要么力度不够,要么加大尺度后引入伪影并损伤可懂度。本文的定位就是补上这一块:把基线换成文本情感,并按冲突程度动态选强度,再用偏好优化把引导内化。

冲突是如何被定义和分级的?

论文把问题形式化为跨模态不一致。一种模态是文本情感,即从目标文本字面语义中可以推断出的情感;另一种模态是渲染情感,即用户明确要求在语音中表现出的情感。当两者相同、不同或强烈相反时,样本被分为相同、不一致和高度不一致三档。举例来说,文本本身是悲伤回忆,却要求用惊讶语气说出,就属于高度不一致的教学例子,例子不代表论文报告了该单句的数值效果。

这种分级不是评价指标,而是控制信号。外部大模型在推理期同时完成两件事:抽取文本情感,以及评估文本情感与渲染情感之间的不一致程度。需要强调的是,论文明确说明该大模型只提供引导尺度的控制信号,不用于评价,也不作为科学证据,报告的增益完全建立在独立的客观与主观指标上。

自然语言情感控制 × 跨模态不一致: 自然语言情感控制负责把用户用一句话描述的目标情感转成合成条件,跨模态不一致负责描述目标文本自身携带的情感与该目标情感之间的冲突程度,二者搭配的原因是前者只管要渲染什么,后者要判断文本语义会把生成往回拉多远,组合意义是把冲突显式分级,后续才能决定引导要用多大力度。

从学习依赖看,理解这个分级是理解后续所有设计的前提。固定引导强度之所以次优,正是因为它对三档样本一视同仁:对相同样本做引导可能反而破坏原有表达,对冲突样本则需要足够大的外推才能盖过文本牵引。

方法全景:一个样本如何走完输入到波形?

沿着一个样本走完全流程,有助于把各组件的位置固定下来。输入是目标文本和渲染情感提示。外部大模型先读这两部分,输出文本情感和不一致档位,并映射到一个引导尺度。与此同时,文本嵌入模块把情感提示和目标文本转成离散符号,送入自回归语音大模型。

自回归语音大模型运行两个并行分支:一个以渲染情感为条件,另一个以文本情感为条件,而不是传统做法中的空条件。两路输出的对数几率按动态尺度融合,得到引导后的输出,再经声码器转成波形。直观理解是,模型先分别算出如果顺着文本情感会怎么发音,以及如果按目标情感会怎么发音,然后把两者的差异放大,加回到文本情感基线上,从而把生成推向目标情感。

下面这张总体结构图展示了上述主路径、右侧评估分支和中间融合模块的位置关系,值得对照文字通读一遍。

看图路径: 1. 先从底部目标文本与情感提示出发,沿文本嵌入向上追踪到自回归语音大模型的输入;2. 再看右侧大模型分支如何输出文本情感与不一致评估,并把引导尺度送回中间融合模块;3. 对比中间两路输出逻辑:一路以渲染情感为条件,一路以文本情感为条件,最后汇入声码器;4. 结合底部示例句,确认文本情感与渲染情感提示是如何分别构造的

原论文 Figure 1:Overall architecture of the proposed Dynamic Scale Cross-Modal Consistency Guided CFG…

论文图 1。原论文 Figure 1:“Overall architecture of the proposed Dynamic Scale Cross-Modal Consistency Guided CFG (DS-CCG-CFG) frame- work.”。

从像素可见,底部是情感提示与目标文本的输入区,示例中目标文本带有悲伤含义,渲染情感提示要求高度惊讶,文本情感提示则对应高度悲伤。中部粉色长条是自回归语音大模型,上方黄色长条是应用引导的融合模块,再向上是绿色输出符号与蓝色声码器,最顶部是频谱形式的波形示意。右侧绿色模块标注了文本情感检测与不一致评估,虚线箭头表示它把引导尺度送回融合模块。读图时不要把虚线当成音频信号通路,它只是控制信号。论文同时说明,情感相同的样本仍沿用传统空条件分支,只有检测到不一致时才切换到文本情感基线。

基线为什么从空条件换成文本情感?

传统无分类器引导的做法是把条件预测减去无条件预测。无条件预测通过丢弃条件得到,它代表模型在没有任何风格要求时的平均行为。外推的含义是沿着从平均行为指向条件行为的方向再走远一点,从而放大条件效果。论文指出,在冲突样本上这种平均基线不够用,因为文本语义的牵引很强,平均行为本身已经被文本拉偏,差值方向不够精准。

跨模态一致性引导的做法是把基线换成文本情感条件下的预测。此时差值直接对应从文本情感走向渲染情感的方向,引导信号明确指向需要克服的冲突。原文用两个并列的计算式表达这一替换:传统形式是空条件加尺度乘以条件与空条件的差,改进形式是文本情感条件加尺度乘以渲染情感与文本情感的差。由于本次证据没有提供可绑定的原始公式字符,解读中不单独展示公式符号,只讲计算目标与实现:符号输入是两路对数几率,计算目标是融合后的输出对数几率,实现是在解码的每个自回归步骤执行该融合。

无分类器引导 × 跨模态一致性引导的: 无分类器引导的分工是用条件预测减去一个基线预测再外推放大条件效果,跨模态一致性引导的的分工是把基线从空条件换成文本情感条件,搭配原因是空条件无法对抗文本语义的牵引,而文本情感基线能直接拉开两种情感的距离,组合意义是得到一个对准冲突方向的引导信号。

需要保留的实现细节是,这种替换只在检测到不一致时启用,相同样本仍使用传统空条件形式。这样做的原因是相同样本本来不需要对抗文本牵引,强行对比两种相同情感只会引入不必要的扰动。

动态尺度如何按冲突档位取值?

固定尺度的问题在论文的分组实验中表现得很直观。对相同样本做引导会降低情感准确率,对不一致样本适度引导能提升表达,但过大尺度会让词错误率急剧上升。这说明引导强度与可懂度之间存在折中,且折中点随冲突程度变化。

动态尺度的设计就是把三档不一致映射到 3 个具体数值。论文报告的选择是通过开发集网格搜索,在情感准确率与词错误率之间权衡得到的,分别对应相同、不一致和高度不一致。推理时外部大模型先给出档位,再查表得到尺度,解码时用该尺度融合两路预测。

动态引导尺度 × 不一致程度: 不一致程度的分工是由外部大模型判断文本情感与渲染情感属于相同、不一致还是高度不一致,动态引导尺度的分工是把这三档映射到不同的引导强度,搭配原因是相同样本不需要强推而冲突样本需要更强外推,组合意义是在情感强度与可懂度之间按样本做折中。

为核对档位与尺度的对应关系,先提出比较问题:在相同实验条件下,不同档位是否确实需要不同强度,指标方向是情感准确率越高越好、词错误率越低越好。下表整理了论文文字中明确给出的尺度映射与高低档配置,公平条件是同一自回归基座与同一解码流程,只改变基线类型与尺度取值。

条件指标基线取值本方法取值比较对象
相同、不一致、高度不一致三档引导尺度传统低引导 1.5,高引导 3.0动态映射 1.0、2.5、3.0传统固定尺度与动态尺度
相同样本引导策略空条件基线空条件基线冲突样本用文本情感基线
不一致与高度不一致样本引导策略空条件基线文本情感基线相同样本仍用空条件

上表的主要收益是把强度选择从人工试探变成按档查表,代价是推理期必须先调用外部大模型做判断,增加了系统依赖与延迟。未胜出的情况也要记住:固定高尺度虽然在部分冲突样本上情感分数更高,但词错误率代价大,因此不能只看情感一项就认为越大越好。

蒸馏如何构造偏好对并更新模型?

双路解码与外部判断带来了推理开销和引导伪影,论文用直接偏好优化把引导信号蒸馏回模型。训练对象是自回归语音大模型的有监督微调版本与偏好优化版本。论文说明在训练子集上做有监督微调,在训练集加外部难样本上做偏好优化训练,每次训练在一张显存较大的图形处理器上进行,有效批量按秒计量,学习率固定,优化器为自适应矩估计,训练若干轮且不做模型平均。原文未报告梯度是否截断到声码器、嵌入是否冻结等更细的实现,解读中不从模型名称推定这些细节,只记录已报告的批量、学习率、轮数与硬件。

难样本挖掘的具体动作是:取外部语料的纯文本,抽取其文本情感,再配一个与之相反的目标情感,人为制造冲突语料。这样做的目的是让训练集中包含足够多的冲突样本,否则模型很少见到需要对抗文本牵引的情况。

偏好对的构造方法是:对每条目标文本,用 5 个随机种子乘以 5 个引导尺度生成 25 条候选语音,再用一个兼顾可懂度与表达的目标分数排序,取最高分与最低分作为正负对。目标分数由词错误率与情感置信度平均得到,情感置信度在预测情感与目标不一致时施加惩罚。由于目标分数中包含可懂度约束,引导引入的伪影更可能排在低分一侧,从而在偏好优化中被推开,而不是被蒸馏进模型。

直接偏好优化 × 难样本挖掘: 难样本挖掘的分工是为每条文本配一个与文本情感相反的目标情感,人为构造冲突语料,直接偏好优化的分工是用高低分的合成样本对来更新模型偏好,搭配原因是只有先造出足够难的冲突样本,偏好学习才能学到冲突下的稳定控制,组合意义是把推理期双路引导内化为模型自身能力。

需要区分的是,蒸馏阶段确实发生了参数更新,而推理期的动态引导与蒸馏后的独立模型是两条可运行策略:前者需要外部判断与双路解码,后者是单路独立模型,不再需要外部大模型。

数据、模型与指标是如何组织的?

实验数据来自 7 个已有的语音数据集的组合,覆盖愤怒、厌恶、恐惧、高兴、中性、悲伤和惊讶 7 类情感。论文同时使用了一个外部语料的纯文本部分,只用其文本做合成与偏好训练,不报告其音频时长。划分上训练、验证与测试的规模在文字中有明确说明,训练与验证测试的量级差异较大,复现时应严格按原文划分核对说话人数量与情感分布,而不是只看总时长。

基线包括需要渲染情感参考音频的零样本框架、支持情感标签的内置优化音色系统,以及原生支持自然语言情感控制的自回归系统。论文特别做了参考条件对照:用渲染情感参考 versus 用中性参考。中性参考更接近现实,因为用户通常拿不出目标情感的参考音频。后续所有改进都以中性参考的自回归系统为主要基线,这个选择决定了数字的可比性。

评价指标分 3 组。情感表达用预训练语音情感识别模型计算平均情感识别准确率,数值越高越好。语音质量与自然度用 3 个客观模型分别预测平均意见分、音频清晰度和合成自然度,数值越高越好。可懂度用大词汇量语音识别模型转写后计算词错误率,数值越低越好。主观评价包括人类听评的情感相似度、自然度和总体质量,以及多模态大模型作为裁判的表达、自然度与可懂度平均分。论文强调外部大模型只做控制信号,不做评价证据。

下表把论文连续原句中实际出现的训练与数据配置整理成可核对的形式,比较问题是复现需要哪些数据规模与优化设置,公平条件是同一基座与同一文本输入。

条件指标训练集取值验证测试取值比较对象
组合语料划分话语数量与时长37,883 条,40.01 小时2,445 条,2.83 小时 / 2.85 小时外部 20,000 纯文本
优化设置批量与学习率有效批量 640s,学习率 10−5单卡训练,多轮无平均自适应矩估计优化器
偏好候选生成候选数量与尺度每文本 25 条候选5 种子乘以五尺度尺度集合 1.0 至 3.0

表后需要说明代价与边界:外部 20,000 条纯文本只贡献文本多样性,不贡献真实音频监督,其效果依赖合成候选的质量与排序分数的可靠性。未评测的边界包括训练资源的 wall-clock 时间、推理延迟与输出帧率,原文未报告这些量,因此不能声称蒸馏改善了延迟,只能说它去掉了双路解码的结构性开销。

主结果:在可比条件下谁提升了情感表达,代价是什么?

主结果的组织必须先固定可比条件。所有后续数字都以中性参考的自回归系统为基线,而不是以带有渲染情感参考的数字为基线,因为后者通过参考音频泄露了目标风格,绕过了零样本自然语言控制的难度。论文报告,从渲染参考换成中性参考时,情感识别准确率明显下降,这正是冲突与信息缺失共同作用的证据。

在该基线上,有监督微调小幅恢复表达,但可懂度略有损失。传统固定引导能提升情感,但高尺度严重损伤质量与可懂度。改进的跨模态引导在低尺度和高尺度下都优于同尺度的传统引导,动态尺度版本在免训练配置中取得最好的综合结果,情感识别准确率与模型裁判分数最高。蒸馏后的独立模型不再需要外部判断与双路解码,可懂度反而改善,词错误率降到较低水平,再加入外部难样本后情感准确率进一步提升,同时保持自然度与可懂度。

情感识别准确率 × 词错误率: 情感识别准确率的分工是衡量合成语音在声学上是否传达目标情感,词错误率的分工是衡量合成内容是否仍然可懂,搭配原因是增强情感的引导很容易损伤发音和自然度,组合意义是必须同时看两项才能判断引导是有效增强还是以牺牲可懂度换来的。

下表用论文连续原句中出现的关键数字组织比较,指标方向是情感识别准确率越高越好、词错误率越低越好,公平条件是同一测试集与同一中性参考设置。

条件指标基线本方法比较对象
渲染参考换中性参考情感识别准确率65.11%50.63%同一自回归基座
有监督微调相对基线情感与可懂度变化基线水平情感 +2.91%,词错误率 +0.92%零样本基线
偏好候选构造每文本候选数单次生成25 条候选五尺度乘以 5 种子

表后解释主要收益与具体代价:中性参考下的下降幅度说明参考条件不可混比,引用数字时必须注明参考类型。有监督微调的收益是部分恢复表达,代价是可懂度小幅变差。候选构造的代价是训练期需要大量合成与打分,但换来的是偏好对覆盖不同引导强度,使蒸馏能选出兼顾表达与可懂度的样本。未胜出的项是传统高尺度引导,它在情感上可能不低,但质量与可懂度代价大,因此综合裁判分数不高。

引导尺度与冲突程度的折中:多大算过大?

这一节回答消融问题:引导尺度是否应该随冲突程度变化。实验按相同、不一致与高度不一致分组,分别扫描多个引导尺度,观察情感识别准确率与词错误率的变化。论文文字总结的规律是:对相同样本做引导会损伤情感准确率,对不一致样本适度引导有帮助,但过大尺度会让所有组的可懂度明显变差。

下图把这种分组扫描可视化,左图是情感准确率随尺度的变化,右图是词错误率随尺度的变化,阅读时必须先确认纵轴含义再判断好坏。

看图路径: 1. 先确认左右两图横轴都是引导尺度,左图纵轴是情感识别准确率,右图纵轴是词错误率;2. 再按图例区分相同、不一致与高度不一致三组柱子在同一尺度下的高低关系;3. 观察引导尺度增大时左图不一致组先升后稳,右图三组词错误率同步抬升的趋势

原论文 Figure 2:2

论文图 2。原论文 Figure 2:“2”。

从像素可见,左图纵轴为情感识别准确率百分比,右图纵轴为词错误率百分比,横轴都是引导尺度从小到大。图例区分相同、不一致与高度不一致 3 组样本量。可见的趋势是左图中不一致组随尺度增大而抬升,相同组在小尺度后趋平甚至回落;右图中 3 组词错误率都随尺度增大而抬升,大尺度处高度不一致组的柱子最高。像素不能精确读出的具体数值不硬写,结论以论文文字为准:动态映射选择兼顾了两项指标,而不是取单项最优。反证意义在于,如果只看情感一项,很容易选过大的尺度,但结合词错误率就会发现代价不可接受,这正是动态尺度的必要性。

哪些结论有边界,哪些量没有被测量?

首先是适用边界。动态引导依赖外部大模型对文本情感与不一致档位的判断,如果判断错误,尺度就会错配。论文未报告误判率与错配后的回退行为,因此在文本情感模糊或混合情感的长文本上,效果待验证。其次是评价边界。客观情感指标来自特定语音情感识别模型,主观听评只用了少量样本的子集,模型裁判的分数在自然度与质量上接近满分,可能压缩了区分度,因此不能把自动指标直接当成人评,也不能把小样本听评推广到全部情感。

其次是成本边界。论文报告了训练硬件、批量、学习率与轮数,但未报告训练时长、推理延迟、输出帧率与显存峰值。蒸馏确实去掉了双路解码的结构,但没有测量就不承诺实际延迟下降多少。总体趋势不等于每组都成立:动态引导在冲突样本上增益最大,在相同样本上增益有限甚至为负,使用时应按档位预期效果。

最后是数据边界。组合语料覆盖 7 类基本情感,没有覆盖强度连续变化、混合情感或对话上下文中的情感保持。外部难样本只用了纯文本,其多样性受限于文本来源与合成质量。缺失证据不是技术错误,但复现与引用时要明确标注这些未验证部分,不把相关性当成因果,也不把未测量的成本改善当成已证结论。

复现先做什么,需要保留哪些超参数与信息条件?

复现的第一步是固定基线条件。使用支持自然语言情感控制的自回归系统,以中性参考语音为默认参考,而不是用渲染情感参考去对比。只有在中性参考下,才能复现论文所说的大幅下降与后续恢复。如果误用渲染参考,会得到虚高的基线,掩盖冲突问题的难度。

第二步是复现判断与映射。调用外部大模型抽取文本情感并给出三档不一致评估,再映射到论文通过开发集网格搜索得到的 3 个尺度。需要保留的超参数包括传统低高引导的两个尺度、动态映射的 3 个尺度,以及偏好候选生成时的 5 个尺度集合与 5 个随机种子。解码时只在不一致样本上把基线切换为文本情感,相同样本保持空条件基线,这个切换条件必须原样保留。

第三步是复现蒸馏。先做有监督微调,再按难样本挖掘构造冲突语料,对每条文本生成 25 条候选并用兼顾词错误率与情感置信度的分数排序,取最高与最低组成偏好对做直接偏好优化。排序分数中情感不一致时的惩罚项要保留,否则低质量高自信样本可能被选为正例。评价时用独立的语音情感识别模型算情感准确率,用独立语音识别模型算词错误率,用客观质量模型看自然度与清晰度,再补小规模人类听评。关于可运行性,本次证据未提供可用链接,因此应按无公开代码处理:只能按文字重写流程,不声称权重可下载或系统可直接运行。

何时值得尝试这种引导,记住哪条主线?

当任务同时满足 3 个条件时,这种方法值得尝试:输入是自由文本加自然语言情感指令,测试中会出现文本情感与目标情感冲突,以及推理期可以接受外部判断或愿意做 1 次蒸馏来去掉它。如果所有样本都是情感一致的朗读,动态引导的收益有限,不必引入额外复杂度。如果已有目标情感的参考音频且允许使用参考,那么参考本身已经提供强风格信号,冲突问题的形态也会变化,不应直接套用本文在中性参考下的数字。

记住的主线是一个样本的完整链路:文本情感与渲染情感先被显式区分,不一致程度决定引导强度,文本情感基线决定引导方向,偏好优化把这种方向与强度内化为模型偏好。重提结果时要增加适用条件:最大增益出现在不一致与高度不一致样本上,相同样本的增益很小;蒸馏加外部难样本在保持可懂度的同时提升情感,但其前提是候选生成与排序分数可靠。

对初学者的实践建议是,先复现分组评估,把相同、不一致与高度不一致 3 组的情感准确率与词错误率分开看,再决定是否需要动态尺度。只看总体平均会掩盖折中,只有分组才能看到过大尺度的代价。还需补的验证包括判断模块的误判分析、更大规模的人类听评,以及延迟与成本的实测,这些补齐后才能把方法从论文条件推向真实部署。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总