英文题目:Spiking Vocos: An Energy-Efficient Neural Vocoder

会议身份:conference:interspeech:2026:conference-paper-id:chen26j_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #高效推理 #语音 #语音合成

评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yukun Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhaoxi Mu:机构信息未能从会议 PDF 纯文本可靠映射
  • Andong Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Peilin Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Xingyu Yang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理从梅尔频谱图到波形的频域声码任务,输入为 100 维梅尔频谱图,输出为经逆短时傅里叶变换重建的 24 kHz 波形,难点在于二值脉冲的信息瓶颈与脉冲动力学因果性导致的未来上下文缺失。方法链分为三步:首先以堆叠脉冲 ConvNeXt 块将密集逐点卷积转为稀疏累加操作并用幅度捷径回灌信号动态,其次以同构人工网络教师对学生做层间特征与终层幅度相位蒸馏以继承频谱预测能力,最后在每块内嵌入时间移位模块融合相邻帧信息以补偿时序建模短板。与直接脉冲化相比,该设计保留了 Vocos 的无上采样频域架构,同时用事件驱动稀疏性替代主要乘加开销。在 LibriTTS 的 test-clean 划分上,4 步联合模型取得 UTMOS 3.74,对照人工网络基线 3.82 仅下降 0.08,且理论能耗仅为基线的 14.7%。结论限于单语料朗读语音的高保真重建,尚未验证噪声、跨语言、长时与流式条件下的外推能力。能耗为基于 45nm 工艺的理论估算,未给出真实神经形态芯片实测延迟与功耗。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,什么信息不能丢?

这篇论文研究的任务是声码,即从声学特征恢复波形。它是语音合成、增强和转换链条的最后一步,前端给出压缩过的频谱表示,后端必须输出可听的高质量语音。原文的输入是 100 维的梅尔频谱,由 24 kHz 音频经 1024 点傅里叶变换、256 点跳长压缩得到;目标是从这种低速率、高压缩的表示恢复出 24 kHz 波形的幅度和相位细节。必须保留的信息包括谐波结构、清浊音交替、基频周期性以及相位在时间和频率方向的连续性,丢掉任何一部分都会出现金属声、抖动或含糊。

初学者可以这样走一遍样本:一段朗读先被切帧并压缩成每 256 个采样点对应 1 帧梅尔向量,序列长度远短于波形;声码器要把这个短序列映射为傅里叶谱系数,再经逆短时傅里叶变换无损重建波形。传统自回归声码器逐采样点生成,质量高但速度慢;并行对抗网络声码器直接输出波形,需要多层上采样,计算量大。频域路线不直接生成长波形,而是预测可经逆变换恢复的谱系数,结构更轻。

脉冲神经网络被引入的原因是事件驱动,只有发放脉冲的位置才触发累加,有望大幅降低功耗。但二值脉冲会抹平幅度,时间建模也偏因果,这是全文要解决的矛盾。

脉冲神经网络 × 声码器: 脉冲神经网络的分工是用 0 或 1 的稀疏放电做计算,把乘累加变成条件累加来省电;声码器的分工是把梅尔频谱还原成可听波形。两者搭配的原因是声码器推理量大、适合放在端侧,组合意义是让生成器主干跑在稀疏脉冲上,再经逆短时傅里叶变换恢复波形。

资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,原文中给出的仓库链接本次未能确认可达,复现时只能以论文文字描述为准。

时域与频域声码器走了哪些不同路线?

时域声码器直接在波形采样点层面建模。WaveNet、WaveRNN 和 LPCNet 属于自回归路线,依赖历史采样点逐点预测,音质好但推理串行、实时性差。为此出现了 MelGAN、HiFi-GAN 和 BigVGAN 等并行对抗路线,1 次输出一段波形,用判别器约束真实感,速度明显提升。扩散和流匹配路线如 FreGrad 和 WaveFM 则用迭代去噪或流变换提高保真度,并压缩推理步数。这些方法的共同负担是需要多层上采样把帧级特征拉长到采样点级。

频域声码器换了思路。iSTFTNet 在 HiFi-GAN 基础上把最后几层上采样换成逆短时傅里叶变换,利用变换本身完成上采样;Vocos 更进一步,采用全卷积一致结构而不含任何上采样层,所有层保持相同时间分辨率,直接预测幅度谱和相位谱,再经逆变换恢复波形,因此实时因子比 iSTFTNet 高数倍,结构轻量。APNet2 针对相位包裹问题提出反包裹函数,显式约束瞬时相位、群延迟和相位时间差;RFWave 对子带复谱分别用整流流建模,并用重叠损失减少子带不一致。

相关工作的对照条件是同输入、同目标、同运行阶段:输入都是梅尔频谱,目标都是可听波形,运行阶段都是推理。类别差异不能当成同条件胜负,例如不能用自回归模型的质量直接否定并行模型的效率价值。脉冲网络此前多用于分类和语音合成前端,直接替换人工网络通常掉点,原因就是二值瓶颈和时间建模不足,知识蒸馏和时间移位是两类已验证的缓解手段,本文把它们组合到频域声码器中。

脉冲化 Vocos 难在哪里?

论文要回答的问题是:能否把高效的频域 Vocos 搬进脉冲域,同时保持高保真并实现超低功耗。难点有 3 个。第一,信息瓶颈。脉冲神经元的发放是阶跃函数,超过阈值就输出 1,所有超阈值输入的幅度差异被抹掉,原文称之为饱和现象。对于声码这种需要精细幅度和相位重建的任务,这种量化误差会直接反映为频谱失真。

第二,训练不稳定与性能差距。脉冲发放不可微,只能用替代梯度直接训练,存在不稳定,且与人工网络对应体之间仍有差距。第三,时间建模受限。脉冲网络靠膜电位在时间步之间传递状态,具有类似循环网络的动态,但因果性导致看不到未来,原文引用部分时间依赖来描述这种对未来盲视的问题。

教学例子:假设某 1 帧元音的谐波幅度是连续渐变的,人工网络可以用浮点数保留 0.2、0.5、0.9 的差别,脉冲网络若阈值是 0.4,则 0.5 和 0.9 都变成 1,差别丢失,后续逐点卷积就只能在丢失细节的基础上计算。解决思路必须同时满足稀疏省电和细节保留,这就是幅度捷径、蒸馏和时间移位的分工来源。

Spiking Vocos 全景:一个样本走完全程

从一个样本看,输入梅尔频谱先进入一叠脉冲 ConvNeXt 块,每个块内都应用时间移位模块,最后输出幅度谱和相位谱,经逆短时傅里叶变换得到波形。下方的脉冲支路是实际部署的模型,上方的人工 Vocos 支路只在训练时作为教师提供监督。中间通过适配器做逐层特征对齐,末端分别做幅度和相位蒸馏。推理时只跑下方脉冲支路加逆变换,不需要教师。沿输入到输出的箭头看,主路径保持时间分辨率不变,没有上采样层,这是继承 Vocos 轻量设计的关键。

块数、通道数与教师保持宏观一致,目的是让自结构蒸馏可以逐块对齐。时间步是脉冲网络特有的维度,论文重点评估 4 步和 8 步两种设置,4 步更省时省电但建模容量更小。下面的图把这种双支路训练与单支路推理的关系画了出来,右侧还对比了标准块与脉冲块的内部差异。 下面这段先说明全景图的主路径与监督位置,再引出图片,图片之后解释每个视觉元素对应的真实组件。

看图路径: 1. 沿下方的黄色脉冲支路从输入特征经多个脉冲 ConvNeXt 块看到逆短时傅里叶变换的输出箭头;2. 对比右侧蓝色标准块与黄色脉冲块,确认两个 PLIF 位置和新增的幅度捷径回路;3. 观察中间灰色时间移位示意与上下两路之间的特征损失、幅度损失和相位损失箭头;4. 核对上方蓝色人工网络支路与下方脉冲支路在适配器处如何逐块对齐

原论文 Figure 1:(a) The overall architecture of the Spiking Vocos generator.

论文图 1。原论文 Figure 1:“(a) The overall architecture of the Spiking Vocos generator.”。

该图左侧上下两条横向链条分别是人工教师与脉冲学生的主干,输入特征在最左端进入,逆变换在最右端输出。中间灰色块是时间移位示意,箭头标出过去一拍与未来一拍的信息交换。上下链条之间的双向箭头标出特征损失,右侧四块频谱示意之间的箭头标出幅度损失与相位损失。右侧放大部分显示标准块只有深度卷积加两层逐点卷积加残差,而脉冲块在两层逐点卷积前各插入一个 PLIF 神经元,并在深度卷积输入到逐点输出之间增加了幅度捷径的乘法与加法回路。这正是用稀疏计算替换密集计算,同时补回幅度信息的结构落点。

脉冲 ConvNeXt 块把计算搬到哪里省电?

标准 ConvNeXt 块由 7 乘 1 深度卷积、一层 1 乘 1 逐点卷积、第二层 1 乘 1 逐点卷积和残差连接组成,其中两层逐点卷积占主要计算量。脉冲版本的设计动作很具体:在两个计算密集的逐点卷积之前各插入一个 PLIF 神经元,让这两个大矩阵乘法只处理稀疏二值输入,把大量乘累加转为累加。深度卷积仍用连续值乘累加,因为它参数少、不是瓶颈。PLIF 神经元每个时间步执行充电、发放和重置 3 步。

充电是用输入电流更新上一时刻的膜电位,时间常数可学习,使模型能自适应平衡当前输入与历史记忆;发放是用阶跃函数判断膜电位是否超过阈值,超过则输出 1,否则输出 0;重置是发放后把膜电位拉回重置值,未发放则保持。替代梯度用于解决阶跃不可微问题,使反向传播可行。幅度捷径的动作是把块输入的绝对值与块输出逐元素相乘,再与残差相加。

用绝对值的原因是幅度非负,乘法把原始信号动态重新注入,而主干仍保持稀疏。这种设计的代价是引入了少量逐元素乘法,但相比把逐点卷积搬回稠密计算,代价小得多。

ConvNeXt 块 × PLIF 神经元: ConvNeXt 块的分工是提供深度可分离卷积加两层逐点卷积的频域建模骨架;PLIF 神经元的分工是在每个时间步做充电、放电和重置,并用可学习时间常数平衡当前输入与历史膜电位。搭配理由是把 PLIF 放在计算量最大的逐点卷积之前,让大矩阵乘法只处理稀疏二值,组合后形成脉冲 ConvNeXt 块。

幅度捷径与时间移位各自补什么短板?

幅度捷径补的是二值瓶颈。没有它时,超阈值信息全部坍缩为 1,谐波峰谷对比会被压平,主观上可能出现发闷或粗糙。有了它,连续幅度以乘性门控形式参与输出,脉冲支路负责提供稀疏的结构选择,幅度支路负责恢复动态范围。实现上它是一条跨过 PLIF 和逐点卷积的旁路,直接引用块输入,因此不破坏稀疏性。时间移位补的是因果盲视。

具体做法是把中间特征按通道分成 3 段,分别向前移 1 位、保持不动、向后移 1 位,并做填充与截断以保持形状,再用权重系数与原始特征残差融合。原文报告的切分与权重是固定值,切分比例与残差权重均给定,用于保证训练稳定。向前移带来过去信息,向后移带来未来信息,使每块能同时看到三拍。风险是移位会稀释当前时刻的信息,因此保留原始特征的残差连接是必要的。

关键实现细节是当时间移位与蒸馏同时使用时,中间蒸馏点要移到下一个 ConvNeXt 块之后取,避免移位操作扰动对齐目标。这个顺序安排是原文明确给出的,不是推测。

幅度捷径 × 信息瓶颈: 信息瓶颈指所有超阈值输入都被映射为 1,幅度细节被抹平;幅度捷径的分工是用输入幅度的绝对值与块输出逐元素相乘,把连续幅度重新注入数据流。搭配原因是既保留脉冲计算的稀疏性,又不丢失信号动态,组合意义是缓解饱和现象带来的频谱重建误差。

时间移位模块 × 部分时间依赖: 部分时间依赖指脉冲网络因果传递膜电位,看不到未来时刻;时间移位模块的分工是把通道分成 3 组,分别前移 1 位、保持不动、后移 1 位,再用残差权重融合。搭配原因是无需参数即可让每块同时看到过去、现在和未来,组合意义是增强脉冲声码器的时间维信息融合能力。

教师如何监督学生:特征、幅度、相位三路损失

训练采用自结构知识蒸馏,教师是与学生宏观结构相同的人工 Vocos,已经预训练好。监督分两层。中间层用轻量适配器把学生的中间特征投影到教师特征空间,适配器由线性层加激活函数组成,对所有蒸馏块求均方误差。这鼓励学生模仿教师的逐层行为。最终层对幅度和相位用不同目标。

幅度损失是学生与教师对数幅度之间的 L1 距离,取对数是为了压缩动态范围,使弱谐波也能得到梯度。相位损失更复杂,因为相位在正负派处回绕,直接相减会产生虚假大误差。原文引入反包裹函数,把误差映射到主值区间,再分别约束瞬时相位、沿频率的群延迟和沿时间的相位差,三项取均值后相加。这种三项配合既约束点级精度,又约束时间与频率方向的一致性。总蒸馏损失是特征损失、相位损失和幅度损失的加权和,权重系数按原文设置。

生成器与判别器各训练 1,000,000 步,优化器用 AdamW,参数按原文给出。需要指出的缺项是原文未完整报告判别器结构细节、蒸馏权重具体数值和替代梯度函数的形状,复现时只能保持生成器侧与已报告部分一致,缺失部分需明确标记为待确认,不从模型名称推定实现。

自结构蒸馏 × Vocos 教师模型: Vocos 教师模型的分工是提供与学生相同宏观结构下的人工神经网络高质量特征与频谱;自结构蒸馏的分工是通过适配器对齐逐层特征,并对幅度和相位分别施加监督。搭配原因是结构相同使层间对齐可行,组合意义是让脉冲学生模仿教师的内部计算步骤与最终输出。

数据、基线、指标与听感测试如何组织?

实验要回答 3 个问题:音质是否接近人工基线,脉冲化省了多少电,时间移位与蒸馏各自贡献多少。数据用 LibriTTS 完整训练集训练,在 test-clean 子集评估。音频处理条件全模型一致,保证公平。基线包括人工 Vocos 和预训练 HiFi-GAN,前者是同结构教师与直接对照,后者是时域声码器代表。客观指标包括 UTMOS、PESQ、ViSQOL、清浊音分类 F1 和周期性误差。

UTMOS 是与人工平均意见分相关的伪主观分,越高越好;PESQ 和 ViSQOL 评估信号质量,越高越好;清浊音 F1 越高越好,周期性误差越低越好。主观测试用 5 分制平均意见分和相似度平均意见分并给出 95% 置信区间,作为金标准。能量分析用 32 位浮点在 45 纳米工艺下的单位代价估算,累加与乘累加分别计价,结合发放率计算理论能耗。

下表整理原文报告的训练与评估配置,阅读时注意它只说明条件,不能代替结果表。

条件指标或配置基线或来源本方法设置比较对象
训练数据完整训练集LibriTTS脉冲模型全量训练人工 Vocos 同样训练
音频参数24 kHz,100 维梅尔谱1024 点窗长,256 点跳长与基线一致保证公平
评估数据test-clean 子集客观加主观指标同条件解码HiFi-GAN 作时域参照
能耗模型45 纳米单位代价乘累加与累加分别计价结合发放率估算理论值非实测功耗

该配置表的意义是核对数据集、模型与实验阶段是否一致,后续结果表的数字必须在相同条件下比较。

时间移位与蒸馏同时使用时蒸馏点后移的细节属于配置的一部分,复现时必须照做,否则对齐目标会被移位破坏。

4 步与 8 步能否接近人工 Vocos?主观与客观是否一致?

比较的问题是:在相同数据与评估协议下,脉冲版本与人工 Vocos 的差距多大,时间移位与蒸馏各自带来什么。公平条件是同训练集、同测试子集、同梅尔参数。指标方向是 UTMOS、PESQ、ViSQOL 和清浊音 F1 越高越好,周期性误差越低越好。下表是主结果,数值保留原文精度。

模型UTMOS 越高越好PESQ 越高越好ViSQOL 越高越好清浊音 F1 越高越好周期性误差越低越好
人工 Vocos 基线3.823.654.670.96000.108
脉冲 8 步3.803.494.660.95660.114
脉冲 4 步3.463.314.630.95220.127
4 步加时间移位3.713.364.650.95390.116
4 步加蒸馏3.703.434.650.95590.118
4 步加两者3.743.454.650.95580.116

表后解释需要同时讲收益与代价。

8 步脉冲的 UTMOS 达到 3.80,与基线 3.82 几乎持平,ViSQOL 也只差 0.01,说明增加时间步能有效缩小差距,代价是计算延迟翻倍。聚焦更高效的 4 步设置,原始 4 步的 UTMOS 只有 3.46,明显落后;单独加时间移位提升到 3.71,单独加蒸馏提升到 3.70 且 PESQ 提升最大,说明前者改善了时间融合,后者迁移了细粒度频谱知识;两者结合达到 3.74 和 3.45,为 4 步中最好。但 PESQ 与基线 3.65 仍有 0.20 差距,原文假设这是二值量化的精度损失,主观测试却显示人耳对此类误差更鲁棒。

主观上脉冲 4 步两者结合的平均意见分与相似度分接近人工 Vocos,原文报告其感知质量可比,这支持感知指标与信号级指标不一致的判断。未胜出项也要点明:周期性误差在所有脉冲版本都高于基线,4 步原始版本最差,说明周期性重建仍是短板。 下面这段先交代稀疏放电图的观察任务,再引出图片,图片之后解释稀疏性与能耗的联系。

看图路径: 1. 先确认三个坐标轴分别为序列长度、通道数和网络深度;2. 逐层比较浅层与深层平面上圆点的疏密变化;3. 观察放电在序列和通道方向是否均匀铺开而非集中成束

原论文 Figure 2:Visualization of spike activity at different depths.

论文图 2。原论文 Figure 2:“Visualization of spike activity at different depths.”。

该图用 3 维散点显示不同深度层的放电,每个点代表 1 次发放,横轴是序列位置,纵轴是通道,竖轴是深度。从像素可见浅层平面点最稀疏,深层平面点逐渐变密,但整体仍是稀疏铺开而非稠密块状。这与原文描述的发放率随深度增加的模式一致,也与另一脉冲语音模型的观察相似。稀疏性是省电的前提,因为逐点卷积只在有点的通道位置触发累加;深层变密解释了为什么加时间移位与蒸馏会适度提高发放率,那是用少量额外放电换取频谱精度。

拿掉时间移位或蒸馏会发生什么?能量代价是多少?

消融要验证两个模块是否协同。比较的问题是:在 4 步预算下,单独使用与联合使用的收益与能耗代价。公平条件是同为 4 步、同数据、同评估。指标方向同主结果,能耗越低越好,发放率越低通常越省电。下表把音质与能耗放在同一条件下对照,数字保留原文写法。

模型发放率理论能耗UTMOS 越高越好PESQ 越高越好能效对比
人工 Vocos不适用58.0 mJ3.823.65基准
脉冲 8 步14.7%14.4 mJ3.803.49约 4 倍省电但延迟翻倍
4 步加两者17.6%8.5 mJ3.743.45仅为基线 14.7% 能耗

表后解释要讲清协同与权衡。时间移位以发放率从 12.9% 升到 14.1%、能耗从 6.4 mJ 升到 6.9 mJ 的代价,把 UTMOS 从 3.46 拉到 3.71,是性价比最高的单项改进。蒸馏把发放率推到 18.0%、能耗 8.7 mJ,PESQ 达到单项中最高的 3.43,说明它更擅长恢复信号级细节,但放电更积极。

两者结合发放率 17.6%、能耗 8.5 mJ,反而略低于单独蒸馏,同时 UTMOS 和综合表现最好,显示时间移位提供了更好的时间上下文,使蒸馏知识更容易落地。最终 4 步结合版本仅为人工基线 14.7% 能量,原文换算为超过 6.8 倍能效提升。反例是 8 步虽然 UTMOS 最高,但能耗 14.4 mJ 接近 4 步结合的 2 倍,且延迟翻倍,不适合低资源场景。能量公式方面,深度卷积仍按乘累加计价,逐点卷积按发放率加权的累加计价,序列长度与时间步是乘性因子,这解释了为什么步数减半能大幅省电。

哪些差距与边界还没有被验证?

论文直接报告的限制是 PESQ 差距。4 步最佳版本的 PESQ 为 3.45,与基线 3.65 仍差 0.20,周期性误差也更高。原文用二值量化的有限解释来说明,表达为假设而非定论,应理解为支持而非证明。未评测的边界包括噪声、混响、跨说话人与跨语言泛化,以及长时稳定性,原文只在干净朗读集上评估,不能推广到复杂声学环境。能量数字是基于单位代价与发放率的理论估算,不是芯片实测功耗,未测量实际延迟、内存占用和误判率,不能承诺这些量同步改善。

训练资源方面只报告了步数与优化器,未报告硬件型号、 batch 大小、学习率 schedule 和蒸馏权重,复现时这些是缺项。主观测试样本量与听音人筛选标准也未在给定证据中详述,只能引用平均意见分趋势,不能当成统计显著性证明。总体趋势不等于每组每步都成立,例如深层发放率更高意味着某些层的省电比低于平均值。相关性不等于因果,UTMOS 提升与时间移位的关联有消融支持,但不能排除与其他超参数的交互,待验证部分应保留。

要复现先做什么,需要哪些超参数与信息条件?

复现的第一步是准备数据与基线。用 LibriTTS 完整训练集,按 24 kHz、1024 点窗长、256 点跳长提取 100 维梅尔谱,test-clean 作评估。先训练人工 Vocos 作为教师与基线,再训练脉冲学生。脉冲块实现要严格做到在两层逐点卷积前各放一个 PLIF 神经元,深度卷积保持连续计算,幅度捷径用输入绝对值与块输出相乘后残差相加。时间移位按原文固定切分与 0.5 残差权重实现,注意同时用蒸馏时把中间对齐点移到下一块之后。

蒸馏需实现适配器投影加均方误差、幅度对数 L1 损失和带反包裹的三项相位损失,总损失加权求和。训练生成器与判别器各 1,000,000 步,用 AdamW。评估同时跑 UTMOS、PESQ、ViSQOL、清浊音 F1 和周期性误差,再做小规模主观听感对比。何时值得尝试:如果目标是端侧低功耗语音回放且能接受轻微信号级误差,4 步结合版本值得尝试;如果追求最高信号保真或低延迟流式,还需补验证。

代码与权重方面,本次未获得可验证的公开资源,不得声称已公开,复现只能依据论文文字,缺失的判别器细节与损失权重需在报告中明确标注为自行补齐。

一句话收束:省电从哪里来,质量靠什么保住?

省电来自把大矩阵乘法搬到稀疏脉冲上并减少时间步,质量靠幅度捷径补回动态、蒸馏搬运教师知识、时间移位补回未来上下文。证据显示 4 步结合版本在感知上接近人工 Vocos,能耗仅为约 14.7%,但 PESQ 与周期性指标仍落后,说明感知鲁棒不等于信号级无损。对于刚入门的研究生,可复述的方法链条是:梅尔谱进入脉冲 ConvNeXt 栈,经移位融合时间信息,经稀疏逐点卷积建模频谱,经幅度捷径恢复动态,输出幅度与相位谱后逆变换成波形,训练时用同结构教师逐层与末端联合监督。

记住 3 个对照:8 步对 4 步是质量换延迟,时间移位对蒸馏是上下文换细节,理论能耗对实测功耗是估算换验证。下一步最值得补的验证是在噪声与跨说话人条件下的稳定性,以及在真实脉冲芯片上的延迟与功耗实测,只有补上这两项,才能把节能结论从理论推向可部署收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总