英文题目:DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.1157

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #模型剪枝 #高效推理 #语音 #文本到语音

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yanru Huo:机构信息未能从会议 PDF 纯文本可靠映射
  • Ziyue Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zuoli Tang:机构信息未能从会议 PDF 纯文本可靠映射
  • Qingyang Hong:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhou Zhao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

扩散变换器语音合成以文本与参考音频为输入生成目标波形,难点在于多步去噪的二次注意力开销与无分类器引导双分支重复计算叠加导致推理缓慢。DiTReducio先经检查阶段识别呈对角线状注意模式的高时间冗余层步对,输出候选子集进入预校准。预校准仅对该子集逐对试探时间跳过并以均值绝对误差筛选低误差项,将已压缩策略固定后进入校准。校准基于已压缩模型对全层步按深度相关动态阈值逐层试探时间跳过与分支跳过,优先时间跳过并记录每对最优策略供推理复用。与直接替换分支的DiTFastAttn及引入强化学习网络的BlockDance不同,该方法以模式先验缩小搜索空间并以分支残差重构非条件分支,保留文本与音色条件细节以抑制过饱和削波。在LibriSpeech-PC-test-clean跨句复刻评测设置下,F5-TTS经DiTReducio在T4阈值下的RTF为0.129,低于未压缩基线T0的0.178。其适用边界受限于F5-TTS与MegaTTS 3两类扩散语音模型及英文朗读语料,高阈值下说话人相似度明显下滑且依赖高质量校准音频,尚未验证其他架构与语种的外推。推理开销在单卡Nvidia 3090硬件上测量且压缩后计算量降至基线的45.58%,训练成本为零因全程免训练仅需三次推理校准。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

要解决的语音合成任务是什么?

这篇论文研究的是非自回归语音合成中的推理加速问题。输入是参考文本、发音人提示音频及其转写,目标是在跨句任务中生成与目标发音人音色一致、内容与给定文本一致的语音。初学者可以这样理解:模型先听一段参考声音记住音色,再读一段新文本,用记住的音色把新文本念出来。

论文聚焦的两类模型是 F5-TTS 和 MegaTTS 3,它们都用扩散变换器作为声学建模主体。扩散模型的特点是需要多步去噪,每一步都要把整个变换器跑一遍,再加上无分类器引导需要同时算条件分支和无条件分支,计算量会被放大。自注意力本身随序列长度呈平方复杂度,长语音序列更吃力。

原文报告的动机是已有轻量系统仍难以满足端侧部署和实时交互,因此需要一种不重新训练、能控制质量与速度权衡的即插即用加速方法。需要保留的关键信息是:任务是零样本跨句合成,加速对象是推理阶段的扩散变换器层,而不是声码器或其他前后处理。本文输出 1 篇可复述方法的解读,不评价商业价值,只讲原文做了什么、在什么条件下测出什么。

已有加速路线为何不够用?

论文把已有加速分为 3 类。第一类是优化采样,例如改进求解器或用蒸馏把多步教师模型压缩成少步学生模型,这也是语音合成中最常用的加速策略,但蒸馏需要额外训练开销并依赖教师性能。第二类是模型压缩,例如量化与剪枝,可以提高推理效率,但原文指出它们会带来不可预测的生成质量下降。

第 3 类是注意力机制优化,例如稀疏注意力与词元合并类方法,但这类方法往往要在每步计算注意力热图或训练词元选择器,与快速注意力实现存在兼容问题,实现复杂度也限制了落地。视觉领域的免训练即插即用加速较多,但语音领域同类工作有限。

论文点名了最接近的两项工作:DiTFastAttn 采用贪心搜索且主要关注注意力模块,容易得到次优压缩策略;BlockDance 以层为粗粒度跳过,还引入一个辅助强化学习网络,甚至比一些轻量语音模型还大,因此不是严格免训练。DiTReducio 的区别是同时针对注意力模块和前馈模块,以层与步骤交叉的细粒度进行剪裁,并用模式引导的预校准避免贪心局部最优,同时保持免训练。这 1 对照说明本文不是提出新的声学模型,而是提出一种校准出复用策略的框架。

冗余出现在什么位置?

论文把冗余定义在层步对上。层步对就是某一层在某一个去噪时间步的 1 次计算。时间冗余指同一模块在相邻时间步的输出高度相似。原文用余弦相似度热图验证,在 F5-TTS 的第 10 层和第 20 层、MegaTTS 3 的第 10 层和第 22 层,无论注意力还是前馈模块,相邻步输出都保持高度一致。

分支冗余指在同一时间步,条件分支输出与无条件分支输出高度相似。F5-TTS 测量了条件分支与无条件分支在不同步骤的相似度,MegaTTS 3 因为有多条件引导,比较了说话人条件分支、文本条件分支与无条件分支三者之间的相似度,发现特定层步对存在高分支相似。

进一步,论文观察注意力热图有两种模式。对角线状模式是词元主要注意邻近词元,论文将其对应为局部声学精修,例如韵律与频谱细节。条纹状模式是跨全序列建立依赖,论文假设其作为注意力锚点广播信息、建立长程依赖,对保持结构连贯关键,冗余较低。F5-TTS 中第 5 层在时间步 0 呈现对角线状,第 2 层在时间步 26 呈现条纹状。这一区分是后续先压缩哪一批层步对的依据。

三阶段校准如何得到加速策略?

DiTReducio 的总体流程是先标记、再小范围试压缩、最后全面试压缩,共经过 3 次推理过程,最终输出一张策略表,记录每个层步对用哪种压缩方法或不用压缩。检查阶段通过检测对角线状注意力模式,找出时间冗余高的层步对子集。原文在实验中取前 10% 的层步对作为高时间冗余对。

预校准阶段只对这些被标记的对试用时间跳过,计算压缩前后模型输出的平均绝对误差,若低于动态阈值则保留,否则记为不压缩。校准阶段在预校准后的模型基础上,对全部层步对依次试用时间跳过与分支跳过,优先试用时间跳过,因为它节省更多计算;同样用误差与阈值比较决定保留哪种方法;若某对已在预校准中确定使用时间跳过,则跳过对其的再次校准。

下图展示了 3 个阶段的数据流与判断逻辑,3 个面板从左到右分别对应检查、预校准与校准,箭头表示从步骤 t 到步骤 t 加 1 的缓存复用方向。

看图路径: 1. 先从左到右看检查阶段、预校准阶段、校准阶段三块面板的输入输出箭头;2. 再看中间与右侧面板中原始输出与压缩输出如何汇入计算损失的判断框;3. 比较左侧已标记与未标记层步对的图例,确认只有对角线状模式被标记;4. 注意右侧面板标注已在上一阶段用过时间跳过的对会被跳过校准

原论文 Figure 1:Overview of DiTReducio. In the Check Phase, we identify a subset of highly temporally redundant…

论文图 1。原论文 Figure 1:“Overview of DiTReducio. In the Check Phase, we identify a subset of highly temporally redundant layer-step pairs by detecting diagonal-like attention patterns.”。

上图左侧是检查阶段,只看注意力模式并打标记,不做压缩决策;中间是预校准阶段,对标记对做原始输出与压缩输出的成对比较,用损失是否小于按层缩放的阈值决定接受或拒绝时间跳过;右侧是校准阶段,对全部层步对按同样损失约束依次尝试时间跳过与分支跳过。3 个阶段共用同一个思想:压缩带来的整模型输出偏差必须小于与层深相关的容忍值,深层压缩影响更大,因此阈值随层号增大而放宽。

两种跳过各自复用了什么计算?

时间跳过处理的是跨步重复。白话说就是上一步刚算过的结果,这一步几乎不变,直接拿来用。英文名是 Temporal Skipping,缩写为 TS。实现上为每个模块维护缓存,上一步计算后写入缓存,下一步若启用时间跳过则跳过模块前向,直接输出缓存值;若未启用则正常计算并更新缓存。

下式给出其形式化定义,符号 Ot 表示某模块在时间步 t 的输出,Ot 减 1 表示同一模块在前一步的输出,计算目标是让当前输出等于缓存的前步输出。

\[Ot = Ot−1.\]

分支跳过处理的是同一步内双分支重复。白话说就是条件分支和无条件分支算出来很像,只算一个,另一个用残差拼出来。英文名是 Branch Skipping,缩写为 BS。论文强调不能直接用条件分支替换无条件分支,否则会加重无分类器引导带来的过饱和与伪影,在语音中表现为可闻削波,而语音的条件信号多样,包括文本与音色,因此需要分支残差机制。

具体做法是只执行条件分支,用缓存的上一步无条件输出减上一步条件输出得到分支残差,再加到当前条件输出上,重建当前无条件输出。下式中 Concat 表示把条件输出与无条件输出拼接成模块总输出,Oc 表示条件分支,Ou 表示无条件分支,t 与 t 减 1 表示当前步与前一步,计算目标是跳过冗余分支的同时让重建输出接近原始输出。

\[Ot = Concat\]

两种机制的缓存更新规则不同,时间跳过跨步复用,分支跳过跨分支复用。下图对比了两者的工作流,上方面板为时间跳过,下方面板为分支跳过,图中区分了深色正常计算模块与灰色跳过计算模块。

看图路径: 1. 先看上半部分时间跳过在步骤 t 计算并写缓存、在步骤 t 加 1 直接读缓存的箭头;2. 再看下半部分分支跳过只计算条件分支,另一分支经残差相减再相加得到;3. 对照图右侧减号与加号图例,确认残差路径的运算顺序

原论文 Figure 2:Comparison of the workflows of TS, BS.

论文图 2。原论文 Figure 2:“Comparison of the workflows of TS, BS. The cache is updated only when TS is not applied by the corresponding module.”。

上半部分显示时间跳过在步骤 t 时模块正常计算并把输出写入缓存,在步骤 t 加 1 时模块变灰表示跳过计算,直接由缓存提供输出。下半部分显示分支跳过只让条件分支经过深色模块,缓存的上一时刻双分支差值形成分支残差,再与当前条件输出相加得到无条件分支输出,减号与加号分别对应残差的构造与重建。该图还表明分支跳过需要同时维护条件与无条件侧的缓存,而时间跳过只需维护跨步缓存。

时间冗余 × 时间跳过: 时间冗余指同一模块在相邻去噪步输出高度相似,分工是描述可以省掉的重复计算;时间跳过分工是执行省计算的动作,直接复用上一步缓存的输出;二者搭配的理由是相似度高则复用误差小,组合意义是把跨步重复的前向计算换成查缓存。

分支冗余 × 分支跳过: 分支冗余指无分类器引导下条件分支与无条件分支在某些层步输出高度相似,分工是指出双分支重复算了接近的结果;分支跳过分工是只算条件分支,再用缓存的分支残差重建无条件分支;搭配理由是直接替换会加重过饱和和削波,组合意义是省掉一个分支的同时保留条件细节。

对角线状注意力 × 条纹状注意力: 对角线状注意力指词元主要关注邻近词元,分工是对应局部声学精修;条纹状注意力指跨全序列建立依赖,分工是对应全局信息聚合;搭配理由是前者时间冗余高可先压缩,后者对结构连贯关键应保留,组合意义是为校准提供先验顺序,避免贪心搜索把高冗余对推入次优策略。

对 MegaTTS 3 的适配是论文特有的实现细节。该模型有多条件引导,有 2 个条件分支,论文计算两个残差:文本条件分支与说话人条件分支之间的残差,以及无条件分支与说话人条件分支之间的残差。推理时只显式计算说话人条件分支,另两个分支分别加上各自残差重建。F5-TTS 的适配是把条件与无条件输入拼成一个批次做单次前向,与原始双次前向功能等价,从而让分支跳过可以实施。2 模型都兼容快速注意力实现。

没有训练时校准阶段实际算了什么?

本研究没有神经网络训练阶段,没有更新任何模型参数,没有梯度路径,也没有监督损失用于调参。实际计算过程是搜索与记录压缩策略。输入是一段用于校准的高质量音频与对应文本,模型权重全程冻结。校准阶段的算法是对每个时间步 t、每一层 l 依次尝试压缩方法。

先不压缩算一遍整模型输出 O,再对该层的注意力与前馈模块应用某种方法算出压缩输出 O 撇,计算两者平均绝对误差,即所有张量元素差的绝对值取均值。若误差小于 l 除以 L 再乘全局阈值的动态阈值,其中 L 是总层数,l 是当前层号,则把策略表的 t 行 l 列记为该方法,否则记为不压缩。时间跳过优先于分支跳过被尝试。预校准与校准共用同一损失约束,但预校准只处理被标记的层步对。

最终部署时不再搜索,直接查表执行复用。论文未报告校准音频的具体数量与选择标准,这是复现时需要补齐的缺项,不能从模型名称推定实现。

预校准 × 校准: 预校准分工是只对检查阶段标记的高时间冗余层步对试用时间跳过并保留低损失者;校准分工是在此基础上对全部层步对依次试用时间跳过与分支跳过;搭配理由是先锁定容易压缩的部分,再全局搜索剩余机会,组合意义是得到与模型相关的推理加速策略表。

需要明确的是,冻结参数不等于输出确定。扩散采样仍有随机性,论文用 5 个随机种子取平均来平滑这种波动。校准阈值是控制加速与质量的核心旋钮,F5-TTS 最大值取 0.3,MegaTTS 3 最大值取 1.2,最大阈值对应相似度下降约 10%。阈值从 T1 到 T6 均匀分布,T0 表示未压缩基线。

在什么数据与指标下比较?

数据集是 LibriSpeech-PC-test-clean 子集,共 1127 个样本,遵循 F5-TTS 的跨句评测范式。补充实验还用了 LibriSpeech-PC-test-other 子集,过滤出时长 3 到 10 秒的 1832 个样本,用于验证更嘈杂困难场景。主实验在单张英伟达 3090 上测实时率与浮点运算量,补充实验在 8 张英伟达 H200 上用批量 128 推理以降低缓存输入输出开销对实时率的影响。

指标方向需要记清:说话人相似度用基于 WavLM-large 提取特征的余弦相似度,越高越好,记为 SIM-o;词错误率用 Whisper-large-v3 转写后与参考文本比较,越低越好,记为 WER;平均意见分是人工听感质量,越高越好;实时率是推理时间与音频时长之比,越低越快;计算量占比是压缩后浮点运算量相对基线的比例,越低表示省得越多。

对于 F5-TTS,实时率按模型总推理时间计算;对于 MegaTTS 3,只计扩散变换器推理时间,因为扩散变换器不是全流程唯一瓶颈。主观评测聚焦 T0 与 T4 两档,对 F5-TTS 与 MegaTTS 3 各生成 10 条不同长度英文语句,招募 20 人分成 4 组做组间设计,每组评一组模型阈值组合,每人评 10 条,每种组合得 50 个打分,用 5 点量表评价音频质量并报告均值与标准差。

主结果在相同条件下省了多少?

要回答的核心比较问题是:在同一模型、同一数据集与同一解码条件下,查表复用策略相对未压缩基线与视觉域免训练基线能否更快且不明显损失可懂度与相似度。公平条件是补充实验中两者共用 F5-TTS 跨句协议与批量推理设置,指标方向是实时率与词错误率越低越好,相似度越高越好。下表是在干净与困难子集上与 DiTFastAttn 的对比,包含未压缩基线与 T1 到 T6 六档可运行策略。

DatasetMethod Level RTFWER (%)SIM-o
(↓)(↓)(↑)
Vanilla -0.04742.0540.670
(DiTFastAttn) T40.04032.2130.652
Ours T30.04082.0760.662
Vanilla -0.05764.3730.653
T50.04665.3490.602
(DiTReducio) T40.04734.2740.629

从表中可见,在干净子集上,本方法的词错误率保持在 2.052% 到 2.086% 的词错误率区间内小幅波动,而基线方法的词错误率从 2.066% 的词错误率升至 3.481% 的词错误率。在困难子集上,基线方法在 T6 档的词错误率达到 7.014% 的词错误率,本方法在 T6 档的词错误率为 4.654% 的词错误率,语言准确性保持更稳。两方法在高压缩段加速比趋同,但本方法保留了更多可懂度。

需要指出一个未胜出项:在 T1 附近本方法实时率优势不大,且在困难子集 T1 档本方法的词错误率为 4.543% 的词错误率,基线方法的词错误率为 4.463% 的词错误率,前者比后者高出 0.08 个百分点的词错误率,说明轻压缩段收益有限。

总体加速的定量陈述需要与主实验条件绑定。下表整理原文直接报告的加速幅度,条件、指标、基线与本方法分列,单位保留原文写法。

条件指标基线本方法比较对象
F5-TTS 与 MegaTTS 3 主实验实时率改进1.00×37.1% 改进未压缩基线
跨句主观听感 T4 档加速比1.00×1.37×F5-TTS 基线
跨句主观听感 T4 档加速比1.00×1.76×MegaTTS 3 个基线

上表的主要收益是计算量与实时率双降,且在 T4 档听感没有显著下降,F5-TTS 的平均意见分从 3.93 分降到 3.90 分,MegaTTS 3 的平均意见分从 3.98 分降到 3.94 分。代价是阈值选择敏感:F5-TTS 在 0.3 的全局阈值附近出现质量退化,MegaTTS 3 到 0.4 的全局阈值仍可保持,超过 T4 后边际加速减小而退化更明显,说明压缩接近理论极限。另一个细节是 F5-TTS 在 T2 档已有 16.5% 的实时率降低,而最大压缩达 37.0% 的实时率降低时退化仍属中等,这支持从低到中等阈值逐步加压的使用方式。

阈值行为的原文数字进一步说明适用条件。下表把原文提到的阈值与退化边界放在同一宽表中,便于复现时先定阈值范围。

条件指标基线本方法比较对象
F5-TTS 阈值上限全局阈值00.3均匀分布 T1 到 T6 档
MegaTTS 3 阈值上限全局阈值01.2均匀分布 T1 到 T6 档

上表说明不同模型对阈值敏感度不同,不能把 F5-TTS 的 0.3 的全局阈值直接搬到 MegaTTS 3 的 1.2 的全局阈值上。复现时应先在小阈值验证实时率收益,再向 T4 推进,并在 T5 到 T6 段重点监听削波与可懂度,而非只看平均分。

拿掉哪部分会破坏质量或速度?

消融要回答的是检查与预校准是否有必要,以及时间跳过、分支跳过与分支残差各自承担什么。论文在 F5-TTS 上做了 3 组对照:去掉时间跳过、去掉分支跳过、去掉前 2 个阶段。去掉时间跳过后计算量占比下降最少,说明时间跳过是省计算的主力;去掉分支跳过后词错误率在高阈值段急剧上升,说明分支跳过对保持可懂度与进一步提速重要;去掉前 2 阶段即直接贪心校准,在同等压缩下生成质量与推理速度都变差,支持模式引导的预校准避免了局部最优。

下图展示四指标随阈值从 T0 到 T6 的变化,左上为相似度,右上为词错误率,左下为实时率,右下为计算量占比,3 条曲线分别对应上述 3 种去掉操作。

看图路径: 1. 先看左上相似度与右上词错误率随压缩阈值从 T0 到 T6 的变化趋势;2. 再看左下实时率与右下计算量占比是否随阈值单调下降;3. 比较去掉时间跳过、去掉分支跳过、去掉前两阶段三条曲线的分叉位置

原论文 Figure 5:Ablation study on F5-TTS. PRE represents the Check Phase and the Pre-Calibration Phase.

论文图 5。原论文 Figure 5:“Ablation study on F5-TTS. PRE represents the Check Phase and the Pre-Calibration Phase.”。

左上相似度面板中去掉前 2 阶段的曲线从 T3 起明显走低,右上词错误率面板中去掉分支跳过的曲线在 T4 后快速上扬,左下实时率与右下计算量面板中去掉时间跳过的曲线下降最慢。四者结合说明时间跳过管省多少,分支跳过管高压缩下是否还能听懂,前 2 阶段管搜索起点是否可靠。

论文还对比了分支替换策略:直接用条件替换无条件或反向替换,在相似度与词错误率上都不如分支残差,尤其反向替换在 T6 词错误率超过 10%,而分支残差保持在 2.6% 左右,实时率三者接近,因此残差的代价主要是实现稍复杂,而非速度损失。方法分布热图显示随阈值升高,采用压缩的层步对逐渐增多,后期时间步更倾向时间跳过,早期时间步倾向不压缩或分支跳过,这与扩散过程内部冗余随步骤演变的假设一致,但原文未给出因果证明,应视为有限解释。

哪些边界尚未验证?

论文明确的局限有两点。第一,适用范围主要限于基于扩散变换器的语音合成模型,对其他架构的泛化有限。第二,框架需要高质量校准音频才能达到最优性能,但具体数量、时长与音色覆盖未在正文交代。

未评测的边界包括:主观评测只覆盖 T0 与 T4,未覆盖 T5 到 T6 高压缩段的听感;MegaTTS 3 的实时率只计扩散变换器部分,不能直接换算端到端延迟;补充实验用批量 128 测实时率,与单条流式交互的延迟表现不同,总体趋势不等于每步都成立。风险方面,论文在附录指出在医疗、法律转录或应急响应等高风险场景中,即使微小失真也可能导致误解或信任下降;效率提升也可能降低伪造音频的门槛,需要配套 safeguards。

相关性不等于因果,例如条纹状模式与低冗余的关联是经验观察加假设,尚未验证去掉这类层一定导致结构崩坏。未测量误判率、每步延迟与部署成本时,不应承诺这些量必然改善。

复现先做什么才能跑通?

复现的第一步是准备模型与数据。模型用 F5-TTS 与 MegaTTS 3 的公开权重,数据用 LibriSpeech-PC-test-clean 的 1127 样本做跨句合成,困难场景再加 test-other 过滤后 1832 样本。实现上先改 F5-TTS 把条件与无条件输入拼批次做单次前向,保持与双次前向功能等价;MegaTTS 3 按说话人条件分支为基准实现双残差重建;两处都接入快速注意力并确认兼容。

第二步是实现缓存与查表逻辑。每个注意力与前馈模块加缓存,时间跳过启用时跳过计算读缓存,否则计算并更新;分支跳过只算条件分支,用缓存残差重建另一个分支。第三步是跑 3 阶段校准。先检测注意力模式标记前 10% 高时间冗余对,再对标记对试时间跳过并按动态阈值保留,最后全局依次试时间跳过与分支跳过并记录策略表,全程冻结权重,用 5 个随机种子取平均。

关键超参数是全局阈值,F5-TTS 从 0 到 0.3 均匀取 6 档,MegaTTS 3 从 0 到 1.2 均匀取 6 档,T4 作为起点验证。资源状态是正文开源声明的唯一依据:本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开,复现前需自行确认链接可达。训练资源、推理开销与输出帧率应分别记录,批量测速结果不要直接当作单流延迟。

何时值得尝试这种加速?

当部署的是基于扩散变换器的语音合成,且不能承担蒸馏再训练成本,又希望在质量与速度之间用一个阈值连续调节时,这种先标记高冗余对再校准的方法值得尝试。它的直接报告是大幅降低计算量与实时率,同时在 T4 附近保持相似度、词错误率与听感稳定;有限解释是局部精修层更适合跨步复用,全局聚合层应保留;待验证的是该模式划分是否适用于其他语言、长文本与流式分块。

重提结果时应增加适用条件:在干净集上本方法的词错误率稳定在 2.052% 的词错误率到 2.086% 的词错误率之间,在困难集上优势更明显,但轻压缩段优势小,高压缩段需警惕相似度下降约 10% 的相似度下降边界。常见误解是把免训练等同于确定性求解,实际上采样随机性仍在,需多种子平均;另一个误解是把计算量占比下降直接当作端到端延迟同比下降,对 MegaTTS 3 这类多模块系统只能按扩散变换器部分解读。

还需补的验证是校准集规模与音色多样性对策略表迁移性的影响,以及 T5 到 T6 段的人工听感与削波率。只有补齐这些,才能把论文的加速数字安全地搬到自己的部署链路中。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总