英文题目:How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech

会议身份:conference:interspeech:2026:conference-paper-id:mathur26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#注意力机制 #统计分析 #可解释性 #语音 #文本到语音

评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Nityanand Mathur:机构信息未能从会议 PDF 纯文本可靠映射
  • Hamees Sayed:机构信息未能从会议 PDF 纯文本可靠映射
  • Wasim Madha:机构信息未能从会议 PDF 纯文本可靠映射
  • Apoorv Singh:机构信息未能从会议 PDF 纯文本可靠映射
  • Sameer Khurana:机构信息未能从会议 PDF 纯文本可靠映射
  • Akshat Mandloi:机构信息未能从会议 PDF 纯文本可靠映射
  • Sudarshan Kamath:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

风格描述语音合成以自由文本刻画音色与韵律为输入、以波形为输出,难点在于难以判断风格词是全局调制整句还是局部对齐到某些音段。本文先用前向钩子截获流匹配扩散变换器每一层每一步的跨注意力,再按注意力头平均并跨层跨步聚合为每个描述词的时间热图,最后将热图与基频和能量轮廓关联并按层步分解重要性。与图像归因直接复用空间图不同,该链条把二维空间归因改造为一维时间归因,并区分风格词与内容词和功能词的分工。在3520个生成样本的评测设置下,风格词的时间方差指标为2.1×10−5,低于功能词的时间方差指标19.2×10−5。代表词响亮loud的注意力与能量呈正向高相关,支持全局调制兼具语义接地。结论仅适用于所测模型与模板化英文风格提示,向自然提示与其他架构的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,先保留哪些关键信息?

这篇解读的输入是会议论文正文提供的文字证据和 4 张官方原图像素,目标是让刚进入语音合成的研究生能复述方法并核对实验条件。必须保留的信息包括模型名称与结构规模、归因截获的位置与聚合方式、词分类定义、样本组合数量与成功生成数、5 个分析指标的定义与方向、以及每组关键数字的类别归属和统计口径。输出是 1 篇按学习依赖展开的中文技术解读,不做超出证据的效果承诺。

任务本身是风格题注语音合成,也就是用白话解释,先给英文名或缩写:输入是两段文字,一段是风格题注,例如平静深沉说得慢,另一段是要读出的文本内容,输出是带有指定风格的波形。难点在于题注中的每个词到底在时间的哪个位置起了多大作用。传统做法只看整体风格是否像,无法定位是哪个形容词失效。论文要回答的是指令词到声学时间的映射关系,这直接决定后续能否诊断控制失败和改进可控性。

初学者容易误以为注意力高就等于声音一定变化,本文后续会用与基频和能量的相关来约束这种直觉,相关只是伴随出现,不是因果证明。

已有路线解决了什么,还有什么没解决?

同输入同目标的路线是风格条件语音合成。白话解释是让模型听懂描述声音的句子,代表系统包括采用流匹配变换器并以编码后题注为条件的 CapSpeech,以及探索类似范式的 VoiceBox 和 NaturalSpeech 3。更早的自回归路线如 Tacotron 系列建立了注意力合成,但依赖固定说话人向量,而不是灵活文本条件。零样本多说话人系统进一步展示了隐扩散控制声音的潜力。这些工作报告了生成质量,但论文指出它们没有打开黑箱说明风格指令词的内部处理。

同运行阶段的可解释性路线来自图像生成。用白话解释,扩散注意力归因图就是把每词注意力变成图像区域归因,代表方法是 DAAM,它从稳定扩散中抽取交叉注意力并归因到单个提示词,提示词到提示词编辑和通用注意力 rollout 进一步把交叉注意力当作条件影响的可信代理。在语音中,注意力分析长期停留在自回归模型的对齐可视化。缺口在于语音是时间信号,注意力要映射到频谱时间帧而非空间像素,且全局属性与局部属性混在一起,图像方法不能直接套用。

同监督的生成建模路线是流匹配。用白话解释,流匹配就是直接学习从噪声到数据的速度场,代表依据是连续归一化流的常微分方程形式,它与需要学习分数函数并迭代去噪的扩散模型不同。语音合成中已有基于扩散的梅尔频谱生成和基于流的对齐搜索,以及展示流匹配高质量合成的 F5-TTS。CapSpeech 采用流匹配加扩散变换器主干,每层每步都有显式交叉注意力,这正是论文选择它的理由:条件路径清晰,适合做词级归因。

论文把问题切成哪三个可测量的问题?

论文把如何影响拆成 3 个可测量问题。第一是全局还是局部条件,也就是风格形容词的注意力是否铺满全句,而内容名词和功能词是否更集中。操作是计算每词聚合热力图的时间方差、峰均比和时间熵并按词类分组比较。第二是声学 grounding,也就是注意力峰是否落在基频或能量高的时间区,且语义是否自洽,例如响亮是否对应能量。操作是用音频分析库抽取帧级基频和均方根能量,插值到注意力时间轴后算皮尔逊相关。

第三是层与步动态,也就是在变换器深度和常微分方程步骤两个维度上哪类词在何时更重要,以及注意力熵何时最小。操作是按层和按步平均注意力权重得到重要性曲线,并计算晚早比和首末步衰减比。举例来说,题注是一段风格描述,文本是三十句待合成内容之一,模型生成 1 次波形就产生 600 个注意力矩阵,研究者把同一题注配不同文本重复生成,最终在三千多次生成上统计规律。教学例子仅用于理解流程,不附加无源数值。

论文的 4 个贡献点分别对应首次跨注意力归因、全局局部分析、声学关联分析和层步动态研究,摘要同时强调层 17 附近熵最小与风格重要性峰值共现,提示网络在最关键阶段最具选择性。

沿一个样本走完输入到输出需要经过什么?

先沿一个样本走完全程。输入是风格题注词序列和待读文本,题注先经过 T5 题注编码器变成上下文嵌入,同时短风格标签经过对比语言音频预训练编码器变成全局风格向量。核心生成器是具有 25 层的流匹配扩散变换器,它从高斯噪声出发,经过 24 步常微分方程求解逐步精修梅尔频谱隐变量,每层包含自注意力、交叉注意力和前馈子层,其中交叉注意力以音频隐变量为查询,以题注嵌入为键和值。最后由 HiFi-GAN 声码器把精修后的梅尔频谱转成输出波形。

研究动作是在每个交叉注意力模块注册前向钩子,截获每层每步的注意力张量,先对注意力头取平均,再在所有层和步上求和平均得到每词的 1 维时间热力图,总量是每次生成 600 个矩阵。下面的示意图展示了这条主路径与归因分支的汇合方式,阅读时先看主路径再看钩子分支,有助于理解后续公式中符号的来源。

看图路径: 1. 先从左到右跟随噪声经自注意力到交叉注意力再到前馈和声码器的主路径;2. 再看上方风格题注经编码器向下注入交叉注意力的位置;3. 最后看下方红色虚线钩子如何从交叉注意力引出每词热力图

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

上图是 CapSpeech 管线与 DAAM 钩子的位置图。左侧高斯符号表示噪声起点,中间蓝色大框是变换器层内的自注意力到交叉注意力再到前馈的顺序,上方橙色分支是题注编码注入交叉注意力的箭头,右侧粉色框是声码器到波形的输出,下方红色虚线是从交叉注意力引出到每词热力图的旁路。可见内容是钩子不改变生成,只做观测,这解释了为什么该方法无需重新训练即可分析已有关注权重。需要提醒的是编码器与声码器的参数状态在本文中未被作为实验变量报告,复现时应保持原模型权重不变,只增加观测代码。

编码器和生成器各自负责什么,如何配合?

编码侧的分工是提供语义与声学两路条件。T5 编码器利用预训练得到的丰富语义表示捕捉风格描述中的细微差别,输出维度为题注长度乘隐维度的嵌入矩阵。对比语言音频预训练编码器从短风格标签产生全局向量,提供声学侧的接地。生成侧的分工是执行流匹配。模型学习速度场,满足从噪声到数据分布的常微分方程传输,每步每层的交叉注意力让题注直接影响当前速度场。

与自回归模型主要用注意力做对齐不同,这里的交叉注意力直接调制生成过程的每一步,因此可解释路径更清晰。配合理由是语义分支解决说什么风格,声学分支解决整体音色锚点,变换器负责在时间轴上落实。新增作用是条件不再是 1 次性向量,而是在深度和时间上重复施加的调制信号。初学者应先记住符号含义:音频帧数决定热力图长度,题注词数决定热力图个数,头平均后的矩阵行是时间,列是词。

风格题注 × 跨注意力: 风格题注负责用自然语言说清想要什么声音,流匹配 DiT 负责把高斯噪声一步步变成梅尔频谱,跨注意力是两者搭配的接口:题注经 T5 编码成键和值,音频隐变量做查询,每层每步都查询 1 次,新增作用是让全局风格约束能持续调制速度场,而不是只在开头给 1 次条件。

该组合的复现要点是冻结原有权重,只在交叉注意力处加钩子。若改动编码器或声码器,归因结果的可比性将丢失,论文未报告此类消融,因此解读不推测拿掉某一路会怎样。

注意力截获后如何算出每词的时间热力图?

计算分 3 步。第一步是在每层和每步截获多头交叉注意力张量,形状是头数乘音频帧数乘题注词数,查询来自当前隐变量,键来自题注嵌入,缩放点积后做归一化。第二步是对头维度取平均,得到该层该步的平均注意力矩阵。第 3 步是在 25 层和 24 步上全部累加平均,得到每个题注词的长度为音频帧数的 1 维向量,这就是该词的时间归因图。它类比图像 DAAM 的 2 维空间图,只是把空间轴换成音频时间轴。

实现细节是句子分词器会把单词切成子词,论文在分类前通过词边界前缀合并连续子词,再把每个词实例归入风格、内容或功能 3 类。风格类是 30 个描述音质情绪或语速的形容词,内容类是 20 个描述说话人或声音的名词,功能类是冠词介词和标点。实例总数在成功生成上统计,风格约数千例,内容约数千例,功能约数万例,具体数字见后文实验条件表。指标定义紧随其后:时间方差衡量在时间上是否集中,低方差表示铺展的全局影响;峰均比衡量峰相对背景有多尖。

时间熵衡量分布均匀的信息论不确定性,最大熵对应完全均匀;声学相关是热力图与基频或能量轮廓的皮尔逊相关;层步重要性是按类别在帧和步或层上平均权重,晚早比和首末衰减比总结趋势。

交叉注意力 × DAAM 归因: 交叉注意力分工是计算音频帧对题注词的权重,DAAM 归因分工是把这些权重截获、平均多头并在层和步上聚合为每词时间热力图,二者搭配的理由是权重本身分散在 25 层乘 24 步中无法直接读,聚合后才得到可与基频和能量对照的 1 维曲线,组合意义是把不可见的条件强度变成可核对的时间信号。

时间方差 × 峰均比: 时间方差分工是衡量注意力在时间上铺得多开,低方差表示全局铺展,峰均比分工是衡量最高点相对平均有多突出,二者搭配才能区分均匀无特征和有稳定形状的全局影响,组合后论文发现风格词是低方差加高峰均比,即有固定形状但铺满全句的签名。

层重要性 × 步重要性: 层重要性分工是看在变换器深度上哪一层更依赖某类词,步重要性分工是看在常微分方程去噪时间上早期还是晚期更依赖某类词,二者搭配才能还原由粗到细的调度,组合意义是揭示风格在早期步骤和深层建立全局骨架,功能词在晚期步骤补齐时序细节。

上述 3 组桥接说明归因不是简单可视化,而是把分散权重变成可统计、可对照声学的量。原文未给出梯度路径的额外说明,归因只用前向权重,不涉及反向传播或停止梯度。

本研究训练了什么,没有训练什么?

本研究没有训练新的语音合成模型,也没有微调 CapSpeech、T5 编码器或声码器。训练节在此的等价职责是讲清构造与推理的真实计算过程。构造过程是用 30 个风格形容词与 20 个内容名词套入 6 种题注模板,组合出 120 条风格题注,再配 30 条在长度、音素复杂度和内容上多样的文本,得到 3600 组题注加文本组合。推理过程是把每组组合送入 CapSpeech 做 1 次生成,记录每次的波形、基频与能量,以及全部交叉注意力矩阵。

由于时长估计失败排除了 80 次,最终得到 3520 次成功生成,分析 54880 个词实例,捕获约 2,110,000 个注意力矩阵。声学特征用概率阈值分布的基频估计算法在 50 到 600 赫兹范围内提取以覆盖常见男女声,用音频分析库提取均方根能量,两者线性插值到注意力时间轴后参与相关计算。统计方法用曼惠特尼 U 检验避免参数假设,用科恩 d 报告标准化均值差异。

缺项是论文未报告硬件预算、推理耗时、随机种子和重复次数,也未说明失败的 80 次在题注类型上是否有偏,因此不能把成功率外推为稳定性结论,也不能从冻结参数推定输出确定。

数据组合、词表划分和指标方向如何核对?

核对实验条件要同时锁定数据集、模型、阶段、指标、单位和聚合对象。数据侧是合成构造而非自然采集:120 条题注乘 30 条文本等于 3600 组合,成功 3520 次,词实例按合并子词后的 3 类统计。模型侧是单一 CapSpeech 系统,不含基线模型对比,所有比较都是词类之间或词与词之间的比较,不是模型胜负。指标方向是方差越低越全局,峰均比越高峰越突出,熵越低越集中,相关系数正值表示注意力高的时间区声学特征也高,重要性数值越大表示该层或该步更依赖该类词。

聚合对象是先对头平均,再对层步平均得到每词热力图,然后按类别平均或分组检验。资源状态是本次未发现来源绑定且完成安全验证的资源,不得声称代码模型或数据已公开。复现时应保留相同的模板结构、词表规模和层步规模,否则晚早比和衰减比的数值不可直接比较。

常见误解是把内容词的高相关当成风格控制更好的证据,实际上内容词多为说话人身份词,对音高能量包络施加整句类别约束,数值高不代表风格语义更准,需要结合下文按词的语义一致性一起看。

风格词是否更全局,数字支持什么判断?

要回答的比较问题是在公平的同一批生成与同一聚合流程下,风格、内容、功能 3 类词的时间铺展是否有差异,公平条件是同一 3520 次生成、同一头平均加层步平均流程,指标方向是方差越低越全局,峰均比越高形状越有特征,熵衡量均匀性。下表整理了 3 类词的样本量与三项形态指标,阅读时先看方差列的量级差异,再看峰均比列的反向排序,最后看熵列是否拉开差距。

类别样本数时间方差峰均比时间熵
风格词79682.1 × 10−51.748.72 bits
内容词84807.0 × 10−51.488.74 bits
功能词3843219.2 × 10−51.368.76 bits

看图路径: 1. 先对比左图三类词箱体的中位高度,确认风格词方差最低;2. 再看中图风格词箱体中位和上沿是否高于内容词和功能词;3. 最后看右图三类词熵箱体是否高度重叠以确认无显著差异

原论文 Figure 2:Global vs. local conditioning.

论文图 2。原论文 Figure 2:“Global vs. local conditioning. Boxplots of (A) tem- poral variance, (B) PMR, and (C) temporal entropy by cate- gory: Style, Content, Function.”。

上图是 3 类词在方差、峰均比和熵上的箱线对比。左图纵轴是时间方差,风格词箱体贴近零线且高度最矮,内容词和功能词依次更高,括号标注显示组间差异达到极显著水平。中图纵轴是峰均比,风格词中位最高且上沿最长,呈现低方差但高峰均比的组合。右图纵轴是时间熵,3 组箱体重叠且标注为不显著。表后解释是主要收益为 9.2 倍的功能与风格方差比确认了风格形容词作为全局调制器的判断,效应量为负 1.16 和负 0.72,显著性达到 10 的负 43 次方量级。

代价或反例是熵没有区分度,说明熵对这类形状差异不敏感,不能单独用熵判断全局性。按词细分时,开朗、深沉、刺耳最铺展,而鼻音和响亮方差相对更高,提示有明确声学落点的词会部分定位到效应最强的时间区,但即使最不全局的响亮仍比功能词平均低约 3.1 倍。未胜出项是功能词,它方差最高而峰均比最低,表现为分散但无特征的语法脚手架。

注意力峰是否落在声音特征高的地方?

要回答的比较问题是注意力的时间形状是否与可测声学特征同向变化,公平条件是同一波形抽取的基频能量并插值到同一注意力时间轴,指标方向是皮尔逊相关为正表示注意力高的地方特征也高。下表按类别和代表词给出与基频和能量的平均相关,阅读时先看类别行确认风格是否强于功能,再看内容行为何最高,最后看代表词是否语义自洽。

条件指标风格词内容词功能词
注意力与基频相关平均 r+0.21+0.50+0.11
注意力与能量相关平均 r+0.28+0.54+0.09
loud 与能量单词 r+0.64+0.49 基频256 样本
nasal 与能量单词 r+0.67+0.41 基频288 样本
nervous 与能量单词 r+0.47+0.37 基频352 样本

看图路径: 1. 先在左和中条形图中从上到下找 loud 和 nasal 的排序位置;2. 再对比同一词在基频图和能量图中的相对长短;3. 最后在右图案例曲线中看蓝色注意力峰与绿色能量峰是否同向起伏

原论文 Figure 3:Acoustic grounding. (A) Mean r(attention, F0) per style word.

论文图 3。原论文 Figure 3:“Acoustic grounding. (A) Mean r(attention, F0) per style word. (B) Same for energy. (C) Case study: normalised attention, F0, and energy overlaid.”。

上图左为每风格词与基频的平均相关条形,中为与能量的平均相关条形,右为归一化注意力、基频和能量随时间的叠加案例。可见内容是能量图中响亮和鼻音排在最上,基频图中响亮、自信、紧张等靠前,右图 3 条曲线在浊音段同向起伏而在静音段分离。表后解释是风格词与能量和基频呈中等正相关,且能量差异高度显著,基频差异也显著,支持注意力在功能上接地到声学现实。

语义一致性体现在响亮对应能量正 0.64,鼻音对应能量正 0.67,紧张和戏剧性更偏能量而非基频,自信则基频更高,符合响度与能量、紧张与能量、 уверенность 与音高提升的直觉。代价是内容词相关最高,因为男女等身份词施加整句类别约束,主导了音高能量包络,不能据此说内容词风格控制更细。限制是相关不是因果,未做注意力编辑干预,因此不能承诺改注意力就一定改声音。

重要性在层和步上如何移动,熵何时最小?

要回答的比较问题是风格依赖在深度和去噪时间上何时最强,公平条件是同一类别定义和同一平均口径,指标方向是重要性数值越大越依赖,晚早比大于 1 表示偏深层,首末衰减大于 1 表示偏早期。下表总结 3 类词的峰值层、峰值步与比率,阅读时先看风格行的深层偏好与早期衰减,再看功能行的反向趋势,最后看熵曲线的谷底位置。

类别峰值层层峰值重要性晚早比首末步衰减
风格词170.0341.285.2×
内容词220.0611.071.7×
功能词180.1080.980.84×上升
层熵最小18 层 8.54 bits步熵变化 0.03 bits范围 8.54 至 8.76 bits风格峰在 17 层
步重要性风格 0.053 到 0.010内容 0.048 到 0.029功能 0.086 到 0.103交叉发生在中后期

看图路径: 1. 先看左热力图中风格行随层索引向右的颜色变化趋势;2. 再看中热力图中风格行随步索引向右是否快速变浅而功能行保持深色;3. 最后看右折线图中蓝色层熵谷底与红色步熵平线的对比

原论文 Figure 4:Layer and step dynamics. (A) I(l)

论文图 4。原论文 Figure 4:“Layer and step dynamics. (A) I(l)”。

上图左为按层的重要性热力,中为按常微分方程步骤的重要性热力,右为层熵与步熵曲线。可见内容是左图中风格行向右渐亮并在 17 层附近最亮,内容行在 22 层最亮,功能行整体最亮但随深度无明显增强。中图中风格行从左到右快速变浅,功能行从左到右保持深色甚至加深。右图中蓝色层熵在 17 到 18 层附近跌入谷底,红色步熵几乎水平。

表后解释是层动态显示风格重要性从浅到深单调增强,深层平均比浅层高约 28%,内容峰更晚,功能在深层被抑制,说明深层放大语义词而压制语法脚手架。步动态显示风格在第 0 步最高并衰减 5.2 倍,内容缓慢衰减 1.7 倍,功能反而上升,揭示早期建全局声学骨架、晚期补措辞时序的由粗到细调度。熵动态显示层熵最小值紧邻风格峰,表明网络在最关键层最具选择性,而步熵全程稳定,说明注意力分布的广度不变但类别重心剧烈转移。

未评测边界是未做按头分析,无法指出哪个头专门编码风格。

哪些结论有边界,不能外推到哪里?

论文直接报告的是单模型单构造下的统计规律,有限解释是对机制的归纳,未验证推测需要措辞区分。已显示的是风格词更全局、与声学语义一致、早期步骤与深层更重要、熵谷与风格峰共现,这些都带有显著性或效应量支持。支持但非证明的是全局调制通道的统一图景,即早期定骨架、深层精修、关键层聚焦,这与视觉变换器和图像扩散的由粗到细现象一致,但跨模态类比不能当作性质证明。

可能或待验证的是能否通过改注意力实现可控编辑,论文在局限中明确列为未来工作,包括扩展到其他流匹配与扩散语音架构、采用自然用户提示、做注意力编辑的因果干预、做按头分析、以及与基线注意力模式比较以量化学习到的结构。缺失证据不是技术错误,但复现与引用时必须说明边界:仅 30 个风格词、合成模板题注、30 句文本、单模型权重,未测量误判率、延迟、成本和主观听感,因此不承诺控制精度、推理开销或输出帧率得到改善。

总体趋势不等于每组每步都成立,例如个别有明确声学落点的词会部分定位,不能把全局性推广到每个词。

要复现这套归因,先做什么,需要保留什么?

复现先做三件事。第一是还原可运行系统:获取 CapSpeech 权重与推理代码,保持 T5 编码器、变换器与声码器不变,确认 25 层与 24 步的默认调度与论文一致,记录时长估计失败的排除规则以便对齐 3520 次成功生成的口径。第二是加观测而不改生成:在每个交叉注意力模块注册前向钩子,保存头平均前的原始张量以便核对形状为头数乘音频帧数乘题注词数,再实现头平均与层步聚合得到每词热力图,并实现子词合并与 3 类词划分。

第三是还原测量管线:用相同基频范围与能量提取流程并插值到注意力帧数,计算时间方差、峰均比、熵、皮尔逊相关、层步重要性、晚早比与首末衰减,统计用曼惠特尼 U 与科恩 d。需要保留的关键超参数和信息条件包括 6 种题注模板、30 形容词与 20 名词的词表、30 条文本的构成、50 到 600 赫兹的基频范围、最大熵等于音频帧数的对数。还需补的验证是自然提示复测、跨模型复测、注意力编辑干预和按头分解。

资源状态按本次核对写为未发现可用绑定,不写当前可用或已公开,引用时只说方法可按描述实现,不做可下载承诺。

何时值得尝试这套方法,如何一句话记住它?

当你的任务也是用自然语言控制语音风格,且需要定位是哪个词没起作用时,值得尝试这套跨注意力归因。它用白话解释就是给每个指令词画一条随时间变化的关注曲线,再拿声音的音高能量曲线去对照。记住它的顺序是先看方差判断是否全局,再看相关判断是否接地,最后看层步曲线判断何时何地最关键。若风格词方差不低,说明条件没有铺开,应检查题注编码或条件注入位置。

若相关语义错乱,例如响亮不对应能量,应怀疑声学 grounding 不足而非单纯调大引导强度。若风格峰不在深层或早期,说明调度与本文单模型结论不一致,需要重新测量而非直接套用 17 层或 5.2 倍的数字。最终判断是论文提供了首个语音扩散模型的词级时间归因证据链,但证据限于特定模型与合成提示,适合作为诊断起点,不适合直接当作通用控制律。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总