英文题目:Does per-frame early exit pay? A compute-matched study of dynamic depth for on-device speech enhancement

标签:#语音增强 | #正则化 | #模型量化 | #端侧运行 | #高效推理

评分:7.5/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5

👥 作者与机构

  • Clément Laroche:机构信息未在 arXiv HTML 中可靠披露
  • Riccardo Miccini:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为单通道含噪语音波形,输出为增强后语音,难点在于助听器等端侧设备只能加速静态整数量化图,且需在实时功耗下兼顾质量与多档位部署。方法链分四步:因果 Conv-FSENet 主干加多级掩膜头构成退出阶梯并输出各深度估计;门控循环单元(Gated Recurrent Unit,GRU)单次路由器基于前端特征在任何时域卷积网络(Temporal Convolutional Network,TCN)栈执行前选择深度并只执行对应前缀;深监督加拐点目标联合训练增强与路由;冻结主干后仅微调掩膜头并施加单调性惩罚以抑制深层退化。与已有早期退出相比,差异在于把单调性作为训练期软约束而非推理后校正,并以修复后静态族作为公平基线。在 VoiceBank-DEMAND 测试集上,修复静态前沿相对同算力专用静态最高提升 0.11 个宽带感知语音质量评估(wideband PESQ,PESQ),并以少 30% 算力匹配最优 PESQ;路由点与修复静态前沿差异仅为 +0.009、-0.001 和 +0.007,路由未抬高质量上限。结论仅适用于语音稠密负载,长暂停与强非平稳难度的外推尚未验证。部署成本上,路由器在 Cortex-M55 上每帧约 26 μs,拆分为多神经网络处理器(Neural-ART NPU,NPU)子图增加约 2.2% 延迟开销。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么要在端侧做?

输入是单通道含噪语音,可以写成干净语音加加性噪声。目标是估计出干净语音,本文在短时傅里叶变换幅度掩蔽框架下完成。

前端把压缩幅度谱映射到通道表示,时域卷积堆叠建模上下文,掩蔽头输出作用于含噪复谱的幅度掩蔽。再经逆变换回到波形。

必须保留的信息是因果性与帧级实时性。论文使用因果空洞深度可分离时域卷积,每 16 毫秒处理 1 帧。掩蔽只依赖当前与过去帧。

部署位置是助听器、耳机与头戴设备这类微控制器,电池与算力共享,实时约束严格。不同产品档位与并发负载还需要不同质量与算力工作点。

因此产品需要的是一个模型族,而不是单个模型。输出是增强后的语音波形,评价用整段宽带感知质量与尺度不变信噪比。

前者越高质量越好,后者越大失真越小。论文的研究问题不是提出更大的增强网络,而是问逐帧早退是否值得。

语音增强 × 早退动态网络: 语音增强负责把含噪信号中的干净语音估计出来,决定输出质量上限;早退动态网络负责在主干不同深度放置预测头并逐帧选择出口,决定为该质量付出多少计算。两者搭配的理由是增强帧难度不均,简单帧不需要跑完全部堆叠,组合后同一套权重既能静态部署在固定深度,也能动态调度深度。

教学例子:可以把增强想象成逐帧擦玻璃,简单帧一擦就干净,困难帧需要多擦几遍。早退就是让模型自己决定每帧擦几遍。

但这只是例子,论文是否省算力要看同配方静态基线与实测时延,不能由例子推定。

同任务同约束下,已有路线各解决了什么?

第一条路线是轻量因果语音增强。已有工作把计算量做到几百万次乘加仍保持可用质量。但通常给出固定网络与固定代价。

没有回答帧难度变化时能否少算。第二条路线是早退动态网络,在主干不同深度放预测头并按输入选择出口。

语音增强中已有无策略多出口、按块概率准则、学习宽度与门控等做法。但多与自身出口比较,缺少与同算力重训静态模型的公平比较。

第 3 条路线是 1 次训练多次部署,从 1 次权重共享训练中抽出多个静态子网。已有工作在端侧语音识别与弹性音乐分离中报告可匹配或超过专用训练。

本文把该思想引入语音增强的深度梯子:先训练一个带全部出口的梯子,再把每个深度当作静态模型使用。第四条路线是嵌入部署与代价度量。

主流边缘工具链只降低一个静态图,动态模型的策略与子图调度要在编译模型之外运行。已有动态工作常用名义乘加数报告代价,忽略路由与分发开销。

也很少把抽出的静态模型量化到整型并测加速器时延,更少逐帧研究质量。本文的对照点正在这里:同配方静态前沿、量化后实测时延、逐帧误差分析三者缺一不可。

要回答的核心问题与限定条件是什么?

核心问题有两个。第一,早退训练带来的好处究竟来自运行时自适应分配计算,还是来自训练脚手架改善了可抽出的静态模型。

第二,在真实微控制器上计入路由、分图与量化后,动态执行是否还站在更好的时延质量前沿上。论文把评估分成两个阶段。

浮点阶段比较路由模型、专用静态模型和修复后静态模型的感知质量与计算量关系。部署阶段把模型量化到整型,在 STM32N6 上测量每帧时延。

再比较固定梯子内节省与跨拓扑前沿位置。限定条件需要先讲清。结论限于语音密集的 VoiceBank-DEMAND 数据集。

作者明确说更稀疏、有长停顿的工作负载不在本研究范围内。路由策略是单次决策,在任何时域堆叠执行前就选定出口。

不是逐堆叠反复决策。硬件上短时傅里叶变换、逆变换与掩蔽留在主机,神经加速器只跑静态整型子图。

方法全景:一个样本走完输入到输出

沿一个 16 毫秒帧走一遍。含噪波形先做 512 点短时傅里叶变换,50% 重叠,得到 257 个频点。取幅度压缩作为输入。

前端用逐点卷积把压缩幅度映射到通道表示。接着是一个单层门控循环单元路由器,它只看前端输出。

在任何时域堆叠运行前输出 1 个类别决策,取值从旁路到最深堆叠。若决策是旁路,则不运行任何时域堆叠,直接用旁路头估计掩蔽。

若决策是第 k 层,则顺序运行前 k 个堆叠,再用第 k 个头估计掩蔽。每个堆叠包含 3 个因果空洞深度可分离残差块。

掩蔽作用于含噪复谱,经逆变换与重叠相加得到增强波形。不同深度的感受野不同,旁路无记忆,最深可看到数十帧。

训练时同一梯子承担两种用途。动态用途按路由器选择的出口计算增强损失,同时深监督要求每个出口都算损失。

静态用途是训练结束后把每个深度单独当作固定模型,比较其质量与算力。随后冻结主干只微调出口头,修复深出口不如浅出口的回退。再重新评估路由是否还有额外收益。

出口梯子如何组织计算,省在哪里?

出口梯子由前端、多个堆叠和多个掩蔽头组成。头 0 只读前端,头 i 读前端加前 i 个堆叠。

路由器同样只读前端特征,因此决策本身不支付堆叠代价。这种单次路由的设计使计算量公式可以直接按所选深度求和。

\[C_{k(t)}=C_{\mathrm{fe}}+\sum_{i=1}^{k(t)}C_{\mathrm{stack},i}+C_{\mathrm{head},k(t)},\]

上式中符号含义是逐帧所选出口决定的计算量,前端、堆叠与头分别对应固定特征变换、时域建模与掩蔽估计。选浅出口跳过的是后面全部堆叠。

而不是只跳过一层。组件分工要讲清。前端负责把压缩谱变成适合时域建模的表示。堆叠负责扩大时间感受野并去噪。

掩蔽头负责把表示变回频点掩蔽。路由器负责在运行堆叠前预测难度并选择深度。

旁路的意义是给静音或极易帧一个几乎不算的选择,这在后续行为分析中很关键。

路由器与状态在跳层时如何处理?

路由器是一个 16 单元门控循环单元,输入是前端输出,输出是出口类别。训练时用直通 Gumbel-Softmax 离散化,使选择可微。

推理时按类别直接分发到对应子图,只执行到所选深度,后续堆叠整个跳过。状态处理是部署细节中的关键。

每个堆叠有自己的空洞卷积环形缓冲,只在该堆叠运行时更新。当被跳过的堆叠恢复运行时,它的状态反映的是该堆叠上次运行时的帧。

而不是最新输入帧。论文强调这比常见离线评估更真实,后者把路由输出写成加权求和,相当于每个出口即使未被使用也在更新。

论文还测试了两种补偿:零阶保持与把上次计算状态传播给更深堆叠,但报告均未挽回质量损失。因此最终保持跳过时状态不变。

这正好是导出子图的自然行为,无需修改固件。驱动导出图走部署路径的整集变化很小,路由决策在两种评估下按位一致。

训练目标如何同时教会增强、出口与路由?

增强损失是幂律压缩谱均方误差,幅度和复数项用压缩指数 0.3 混合,权重 0.3。并在有效语音电平归一化谱上计算。

深监督把该损失同时用于被路由选中的输出和每一个出口,平衡系数为 1。这样浅出口不会因为很少被选中而学坏。

\[\mathcal{L}_{\mathrm{enh}}=\mathcal{L}_{\mathrm{SE}}(\widehat{S}_{k},S)+\frac{\lambda_{\mathrm{ds}}}{R+1}\sum_{j=0}^{R}\mathcal{L}_{\mathrm{SE}}(\widehat{S}_{j},S),\]

上式第一项是路由选中出口的任务损失,第二项是全部出口的平均任务损失。符号中带帽量是各出口估计,S 是干净目标。

接着需要逐帧误差定义与膝点目标。逐帧误差是压缩幅度谱在频率上的均方差。膝点目标选最便宜且误差接近最优的出口。

\[q_{j}(t)=\frac{1}{F}\sum_{f}\left(|\hat{S}_{j}(f,t)|^{c}-|S(f,t)|^{c}\right)^{2}.\]\[k(t)=\min\left\{j:q_{j}(t)\leq\min_{i}q_{i}(t)+\varepsilon\right\}.\]

上两式中 q 是某出口在某帧的压缩幅度误差,k 是该帧的监督目标。路由用交叉熵学习该目标,权重为 0.1。

另有计算代价项把平均路由算力拉向目标工作点。全部训练用 Adam,静态基线去掉路由相关损失但保持相同增强协议。

深监督 × 膝点路由目标: 深监督负责让每个出口独立学会增强任务,保证浅出口本身可用;膝点路由目标负责在当前各出口误差曲线上找收益变平的拐点,用最便宜且接近最优的出口作为监督。两者搭配的原因是只训被选出口会导致浅出口退化,只用深监督又没有逐帧选择信号,组合后主干既有全深度梯度,又有逐帧计算分配信号。

单调性修复只动哪里,为什么能分离两种收益?

只用任务损失训练不能保证越深越好。论文指出近半帧出现深出口差于浅出口,这就是分类早退文献中的过度思考。

此时路由可能只是学会避开有害的深出口,看起来有用,但不是把算力分配给真正需要深度的帧。修复方法是冻结前端、堆叠与策略,只微调出口头。

参数量很小,4 个头共约 33k 参数。微调时保留深监督,并加入单调正则,惩罚每 1 帧随深度增加的误差增量。

优化器用 Adam,学习率较小,正则权重较大,步数 2000。这不是推理后修正,而是训练中软约束。

\[\mathcal{L}_{\mathrm{mono}}=\frac{1}{TR}\sum_{t=1}^{T}\sum_{j=0}^{R-1}\max\bigl(0,\;q_{j+1}(t)-q_{j}(t)\bigr),\]

上式对每帧相邻出口的误差增量取正部平均,T 是帧数,R 是堆叠数。只有当更深更差时才产生惩罚。

修复后梯子变直,再比较路由与修复静态,才能判断路由是否带来超出好静态模型的收益。论文的结论依赖这一步分离。

没有修复的比较会高估路由。

单调性修复 × 过度思考: 过度思考指更深出口在某些帧反而比浅出口误差更大,论文报告只用任务损失训练时近半帧出现回退;单调性修复负责冻结主干只微调出口头,并惩罚随深度增加的逐帧误差增量。两者搭配的意义是先把梯子本身修直,再评估路由,避免把路由避开有害深出口的收益误读为按需分配计算的收益。

数据、基线、指标与硬件条件是否一致?

数据用 16 kHz VoiceBank-DEMAND。训练随机裁成 4 秒片段,配合重混、频带掩蔽、移位与谱增强及电平不变技术。

短时傅里叶变换窗口 512,重叠一半,输入为压缩幅度。测试在全部 824 个片段上报告整段尺度不变信噪比与宽带感知质量。

动态算力是按所选出口实际平均的每秒乘加数。静态基线是关键公平条件。论文训练 12 个专用静态网络,时域宽度取 32、64、96、256。

堆叠数取 1 到 3,通道数固定 128,去掉路由与多出口结构。名义算力覆盖约 5.7 到 41.8 每秒百万乘加,包住路由点的约 6.6 到 20.2 范围。

另有 3 组精确算力匹配的宽深组合,用于判断同预算应给宽度还是深度。所有模型同增强目标、同优化器与早停、同评估流程。

部署条件按原文交代。平台是 STM32N6570-DK,主机为 Cortex-M55,神经加速器为 Neural-ART,只跑静态整型图。

短时傅里叶变换、逆变换与掩蔽留在主机,环形缓冲导出为显式状态张量,使每图为无状态逐帧函数。模型导出为 ONNX,做训练后整型量化。

逐通道缩放加熵校准,经 ST Edge AI Core 编译。报告每帧平均时延,路由器在专用核心上的开销由周期计数折算。

浮点前沿:路由超越的是哪条线,又被哪条线追平?

要回答的比较问题是,在相同名义算力下,路由质量是否高于同配方专用静态,以及修复后静态能否追上路由。公平条件是同增强损失、同训练协议、同测试集。

指标方向是感知质量越高越好,算力越低越好。下表把论文正文报告的代表性浮点数整理成可复述的对照。第一行是路由相对专用静态的优势,第二组是路由相对修复后插值前沿的差距。

条件指标专用静态前沿路由模型修复后前沿对照
同算力约 8.48 每秒百万乘加感知质量约 2.602.719差距小于 0.01
路由点 8.48 算力感知质量差无相对修复插值加 0.009基本重合
路由点 12.18 算力感知质量差无相对修复插值减 0.001基本重合
路由点 20.22 算力感知质量差无相对修复插值加 0.007基本重合

报告显示,相对专用静态,路由在大部分算力范围有清晰优势,低算力段可高出约 0.11 感知质量。但一旦把每个出口修复后当作静态模型,修复前沿几乎与路由前沿重叠。

在匹配算力下差距小于 0.01。论文因此判断逐帧路由没有提高给定算力下的最佳可达质量,但也没有明显降低它。未胜出项是专用静态在公平比较下被两条线同时超过。

这说明专用训练不是最强的可比基线。另一处代价在结论中:用更少算力匹配最佳感知质量时伴随约 1.0 分贝尺度不变信噪比下降,不能只看单一指标。

名义计算量 × 实测时延: 名义计算量负责用乘加次数刻画理论工作量,与具体加速器无关;实测时延负责记录在 STM32N6 上神经加速器加主机协同执行的每帧毫秒数,包含启动、划分和调度开销。两者必须搭配是因为同一乘加数在加宽和加深时硬件效率不同,论文因此不用名义乘加数估计部署代价,而是对每个静态和路由工作负载直接测量。

从前沿图与行为图看,算力省在了哪里?

先看浮点帕累托图的教学价值,横轴是每秒百万乘加,纵轴是感知质量,图中浅蓝点是专用静态,绿色是修复后静态,红色是路由。圆圈大小表示堆叠数,虚线分别是 3 条前沿,像素可见低算力段红色与绿色明显高于蓝色前沿。

看图路径: 1. 先看横轴 MMAC/s 与纵轴 PESQ 的含义,确认向右是更贵向上是更好;2. 再按图例区分浅蓝静态点、绿色修复后点和红色路由点;3. 比较三条前沿线在中低算力段谁在上,高算力段差距如何收窄

原论文 Figure 3:Pareto front for Float32 deployments on the test set.

论文图 3。原论文 Figure 3::“Pareto front for Float32 deployments on the test set.”。

图后解释要回到机制,路由的优势段主要来自中低算力,此时专用静态的前沿较低,而修复后静态通过权重共享与修复已爬到同一高度。论文还报告修复带来 0.04 到 0.11 感知质量提升,同预算下可省约 30% 算力匹配最佳感知质量。这支持训练脚手架本身是主要收益来源,而不是逐帧选择创造了更高上限。

再看路由器行为图的教学价值,该图是一个困难样本重复 4 次,上方面谱图叠加语音活动标记,下方是出口选择曲线,第一遍变淡用于预热并丢弃。像素可见语音段多选处理出口,非语音段多回旁路,原文量化为非语音帧选旁路比例远高于语音帧。

看图路径: 1. 先看上方面谱图与顶部绿色语音活动标记的时间对应关系;2. 再看下方出口选择曲线在语音段与静音段分别停在哪一层;3. 观察第一遍重复变淡的原因是给 GRU 预热并被丢弃

原论文 Figure 4:Example router behaviour on a difficult VoiceBank–DEMAND utterance (0.46,dB input SNR, noisiest…

论文图 4。原论文 Figure 4::“Example router behaviour on a difficult VoiceBank–DEMAND utterance (0.46,dB input SNR, noisiest 5.6,% of the test set, 65.5,% speech-active), repeated four times; the faded…”。

图后解释要加适用条件,加权后相对始终跑最深可省约 58.7% 计算,但这是单困难样本重复播放的结果。测试集统计显示旁路在静音中比在语音中频繁约 2.4 到 3.4 倍,因此该行为在语音密集数据上节省有限。在有长停顿或难度变化的流上才可能降低平均算力,论文明确把稀疏工作负载列为下一步。

哪些对照说明乘加数定价错误,路由开销有多大?

要检验的问题是名义乘加数能否代替部署代价,以及动态拆图与路由本身引入多少额外时延。条件是同一开发板与工具链的 10 个完整整型单图测量。

指标是每帧毫秒数与每百万乘加微秒数,数值越小越好。下表整理原文报告的硬件定价反例,重点不是罗列全部 10 个拓扑,而是保留可运行的成对比较,说明宽与深在加速器上效率不同。

比较对象名义算力关系实测时延硬件含义量化差异
宽度 32 两堆叠与宽度 64 一堆叠相同乘加与参数1.00 与 0.75 毫秒每帧同算力下深更慢排序由时延决定
宽度 96 一堆叠与宽度 32 两堆叠前者多 21% 乘加前者快 15%乘加排序错误宽更快
宽度 32 到 256 同堆叠堆叠内乘加 8 倍时延约 3.1 倍加宽更好利用加速器效率差约 1.7 倍
十拓扑每乘加耗时跨拓扑比较82 到 137 微秒每乘加相差约 1.7 倍不能用乘加换算

表后解释要给出可复现的部署含义,论文因此不使用名义乘加数估计部署代价,而是对每个静态、修复与路由负载直接测量。动态部署拆成前端、路由、三堆叠与四出口共 9 个子图,共享前端与堆叠,存储量相当于一架梯子而非多个独立模型。量化后修复族感知质量变化很小,路由算力漂移至多 2%。策略在伴随核心上每帧约 26 微秒,拆分成独立加速器图增加约 2.2% 时延开销。

下表进一步比较固定梯子内节省与跨拓扑前沿位置,条件是修复后整型模型与路由模型的实测时延,指标是整型感知质量与每帧毫秒数。

模型与变体名义算力整型感知质量实测时延前沿位置判断
静态宽度 64 两堆叠固定10.42.7161.215 毫秒每帧梯子内被路由省时
路由宽度 648.582.6940.930 毫秒每帧省时延质量略降
静态宽度 256 两堆叠固定29.32.7812.472 毫秒每帧梯子内被路由省时
路由宽度 25620.192.7731.668 毫秒每帧大幅省时基本保质
静态宽度 64 一堆叠固定7.32.6840.751 毫秒每帧跨拓扑反超路由

表后解释必须包含未胜出项,固定梯子内路由确实省时延,例如宽度 64 从 1.215 降到 0.930 毫秒,质量仅从 2.716 到 2.694。宽度 256 从 2.472 降到 1.668 毫秒,质量几乎持平。但跨拓扑比较时路由常被另一静态追平或超过,例如路由宽度 32 的 2.639 在 0.769 毫秒,而静态宽度 64 一堆叠以 2.684 在 0.751 毫秒更好。因此论文判断动态深度主要提供一架梯子内的中间工作点,没有创造更好的时延质量前沿。

结论的边界与尚未验证的推测是什么?

直接报告的是在语音密集数据上,修复后静态前沿与路由前沿基本重合,动态执行时延开销小但不改善前沿。有限解释是路由收益的大部分来自深出口退化帧。

修复后该信号被移除。未验证推测是更稀疏、有长停顿的工作负载可能让自动路由更有价值,论文明确留作下一步,不能当作已证结论。

缺失证据不是技术错误,但要指出具体缺项。论文没有报告路由误判率、不同噪声与说话人下的逐帧稳定性,也没有给出多设备、多电压频率下的时延分布。

感知质量与尺度不变信噪比的变化方向不一致时,应同时报告两者,不把自动指标当作听感等价。总体趋势不等于每组每步成立,高算力段路由相对专用静态的差距已收窄。

另一个边界是状态与量化。跳层状态采用自然保留行为,两种补偿均未恢复损失,说明离线加权求和评估会高估路由。量化结论限于所用校准与编译流程。

换工具链或算子改写可能改变划分与时延。复述时应保留这些条件,不承诺换平台仍有相同前沿。

复现应先做什么,需要保留哪些超参数?

先复现浮点前沿,再做部署测量。数据用 VoiceBank-DEMAND,短时傅里叶变换 512 点、50% 重叠、257 频点,输入压缩幅度指数 0.3。

训练裁 4 秒片段,加重混、频带掩蔽、移位与谱增强。增强损失压缩指数与混合权重均为 0.3,深监督权重为 1,路由交叉熵权重为 0.1。

静态网格宽度取 32、64、96、256,堆叠数 1 到 3,通道数 128,测试 824 片段,报告整段感知质量与尺度不变信噪比。再复现膝点路由与修复。

逐帧误差用压缩幅度均方差,膝点容差控制目标工作点。先联合或冻结训练路由,再冻结主干、前端与策略,只微调出口头 2000 步。

学习率 1e-4,正则权重 50。比较 3 条线:专用静态、路由、修复静态,检查路由相对专用静态的优势是否在修复后消失。

部署复现要保留信息条件。短时傅里叶变换、逆变换与掩蔽留在主机,环形缓冲导出为显式状态,九子图划分与整型量化校准保持一致。

直接测每帧时延而不用乘加数换算。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开。

复现应按论文文字与超参数自行实现。

何时值得尝试早退,何时用静态就够了?

值得尝试的场景是需要 1 次训练得到多个档位,或部署流中停顿与难度变化明显,且硬件只支持静态图外调度的情况。此时早退梯子可先作为训练脚手架产出整型静态族。

再保留动态选项在同一前沿上移动工作点。复现时应先验证修复后静态是否已足够好,再决定是否引入路由与分发复杂度。语音密集、变化小的负载用静态部署即可。

论文显示在匹配算力下修复静态与路由差距小于 0.01,跨拓扑时静态宽浅常更快更好,动态的额外编排不能创造新前沿。若目标是最低平均时延,应优先搜索宽度与深度组合。

而不应默认动态更省。

静态模型族 × 动态路由部署: 静态模型族负责为不同档位各编译一个固定深度整型图,每帧付出相同代价;动态路由部署负责把前端、路由、堆叠和出口拆成多个子图,由主机按帧选择执行到哪一层。两者搭配的理由是边缘工具链只支持静态图,动态必须在图外编排,组合后 1 次训练得到一架梯子,既可拆成多个静态档位,也可保留按帧移动工作点的能力。

最终判断要区分两种收益。论文支持的判断是权重共享加单调修复改善了静态族,动态路由在该前沿上不降质但也不提上限。

待验证的是稀疏语音、长静音与并发负载下的自适应价值。学习时应记住方法顺序:先修直梯子,再谈路由;先实测时延,再谈省算力。

📎 论文与评分元数据

排名:前25% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-25 语音/音乐/音频论文速递