英文题目:StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution

标签:#语音超分 | #生成对抗网络 | #流式处理 | #高效推理 | #端到端

评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Yuan Tian:机构信息未在 arXiv HTML 中可靠披露
  • Yang Ai:机构信息未在 arXiv HTML 中可靠披露
  • Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露
  • Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入什么、要改变什么、必须保留什么?

语音超分辨率的输入是一段低采样率语音,例如只保留到 4 kHz 带宽的电话音,目标是恢复到 16 kHz 采样率对应的宽带语音。需要改变的是缺失的高频分量,浊音的谐波延伸、清辅音的噪声能量都需要补出来。必须保留的是原有低频内容不能被改写,否则音色和内容都会漂移,输出仍是一段与输入时间对齐的波形。

初学者容易把这个任务理解成简单的插值放大。插值只能把采样点变密,频谱上高频仍然是空的,听感还是闷。神经超分要真正生成原来不存在的高频包络,并且与低频谐波结构自洽。论文把验证范围限定在 16 kHz 目标采样率,低端分别从 8 kHz、4 kHz、2 kHz 扩展上来,对应 2 倍、4 倍、8 倍扩展,难度逐级加大。

还有一个硬约束来自实时通信。很多已有方法允许看未来几百毫秒再输出,这在离线转写可以接受,在双向通话中就是延迟。StreamWSR 要求零前视,即当前输出只能依赖当前和过去输入,这决定了后面所有卷积和注意力都必须加因果限制。

波形路与频谱路各自卡在哪里?

按建模目标划分,已有神经方法大致分两路。波形路直接从低分辨率波形生成高分辨率波形,优点是保留完整时域信息,不经过压缩声学特征。代表如基于扩散迭代去噪的 UDM+,以及用混合 Transformer-Mamba 做高效波形超分的 TRAMBA。它们的难点是波形序列很长,直接建模计算量大,且难以显式利用听感相关的频域结构。

频谱路先在谱域恢复再转回波形。梅尔谱路先恢复高分辨率梅尔谱,再用神经声码器合成波形,例如 FLowHigh 用单步条件流匹配做谱域超分加声码器重建。梅尔谱在提取时丢掉了相位,系统必须再用声码器隐式恢复相位,链路变长且不易端到端优化。另一支用短时傅里叶谱,幅度加相位齐全时可经逆变换恢复,但相位包裹、非线性强,很多方法只重建幅度、相位用启发式估计,质量受限。AP-BWE 用双路网络显式预测幅度和相位,再经逆短时傅里叶变换重建,结构和训练目标都更复杂。

StreamWSR 的位置是坚持波形域端到端,但把频域监督只放在训练期。它不需要声码器,也不需要显式预测相位,推理完全在波形域完成。这种选择不是为了标新立异,而是为了同时满足零前视流式、低复杂度和完整信号信息 3 个要求。

论文把因果流式形式化成什么操作?

论文把问题定义为给定经 sinc 插值上采样到目标采样率的缺高频波形,恢复缺失高频并输出等长高分辨率波形。输入输出都是时域采样点序列,区别在于高频能量是否完整。模型不改变时长和对齐,只补残差。

因果性被落实为算子约束。无论是卷积还是自注意力,每个帧的输出只允许聚合当前帧及之前帧。训练时可以用掩码模拟这种约束,推理时则天然支持逐段流式推进,不需要缓存未来。论文强调所有卷积和注意力操作都是因果的,这是零前视可流式推理的充分条件。

教学示例可以帮助理解。假设 16 kHz 语音被切成每 80 点 1 帧,模型处理第 100 帧时,只能看到第 1 到 100 帧的压缩特征,看不到 101 帧以后。训练时上三角掩码把未来位置的注意力权重屏蔽掉,推理时则根本不提供未来输入。示例仅用于说明执行顺序,不代表论文做过该具体分段实验。

从低分辨率波形到高分辨率波形经历了哪几步?

整体流程可以按一个样本的真实执行顺序走一遍。低分辨率波形先经 sinc 插值到 16 kHz,得到与目标等长的缺高频波形。接着步长为 80 的因果 1 维卷积把它压成帧级表示,再经核长为 7 的标准因果卷积升到 352 通道。随后 8 个因果长短时建模块依次处理该序列,最后经层归一化、线性层降到 40 维,再用核长 80 步长 80 的因果转置卷积升回波形残差,与最初的上采样波形相加得到输出。

之所以先压缩再建模,是因为 16 kHz 波形每秒 16000 点,直接做注意力代价太大。步长 80 显著缩短主干处理的时间序列,从而降低建模开销。严格流式实现还需要明确分块、历史缓存与边界处理;零前视只排除等待未来输入这一类成本,并不等于实际输出零延迟。残差旁路把上采样输入直接送到末端相加,便于学习补偿量。补齐高频是任务目标,但残差并未被硬性限制在高频频带,因此原有低频是否保持准确仍要靠重建损失与评测检查。

生成路径与监督路径在图中有明确分界:先沿左侧输入到右侧输出的实线观察卷积、建模块和残差旁路,再对照右边灰色虚线框中的 MDCT 判别分支。前者参与推理,后者只在训练时提供信号。把两条路径分开,才能理解为何训练采用谱域监督,而最终语音仍直接由波形域网络生成。

看图路径: 1. 从左侧低分辨率波形沿绿色与蓝色卷积块向右追踪主路径到高分辨率波形;2. 观察顶部直连旁路如何把上采样波形送到末端加法节点形成残差结构;3. 对比右侧虚线框内训练期才出现的三路 MDCT 与 D1 至 DL 判别分支;4. 核对中间重复 N 次的因果长短时建模块与前后归一化线性层的位置

原论文 Figure 1:The overall structure of the proposed StreamWSR.

论文图 1。原论文 Figure 1::“The overall structure of the proposed StreamWSR. The gray regions are appeared only during training. Here, Conv1d represents the 1D convolution.”。

图中左侧蓝色波形是低分辨率输入,沿绿色步长因果卷积、蓝色因果卷积、橙色归一化、红色重复 N 次的建模块、线性层和绿色转置卷积向右推进,顶部黑线是直连到末端加法圆圈的旁路,右侧蓝色波形是输出。右侧虚线框内是判别器,3 路不同 MDCT 设置分别送入 D1 到 DL 打真假分。看到该图后可以确认生成器推理路径完全在波形域,频域只出现在训练监督。

压缩表示如何做到因果且不丢对齐?

第一步压缩用核长 80 步长 80 的因果 1 维卷积输出 40 通道,相当于每 80 个采样点合成 1 帧。第二步核长 7 的标准因果卷积把 40 通道投影到 352 通道,增加表达能力。两个操作都只用左侧历史,避免引入未来。由于步长与转置卷积的步长对称,升采样后残差与输入采样点一一对齐,可以直接相加。

实现细节来自原文配置。投影后通道为 352,空洞深度卷积核长 7、扩张率 2、通道 352,点卷积隐层 512,注意力为 8 头、嵌入维 352。主干堆叠 8 块,线性层再降到 40 维以匹配转置卷积输入。

零前视 × 因果卷积: 零前视指每个输出时刻只允许使用当前和过去的输入,不允许偷看未来帧;因果卷积指通过左侧填充和掩码把卷积核的感受野限制在历史方向。二者搭配的原因是仅有口号式的低延迟不够,必须在算子层面保证不可达未来,组合后 StreamWSR 的每一步推理都满足流式约束,同时保留了卷积对局部波形结构的建模能力。

帧级压缩表示 × 转置卷积: 帧级压缩表示指用大步长因果卷积把 16 kHz 原始波形按 80 点一步降成低时间分辨率的特征序列;转置卷积指用同样步长的因果转置卷积把建模后的特征升回波形残差。二者搭配的原因是直接在 16000 点长序列上做注意力代价极高,压缩后长程建模更便宜,而转置卷积保证升采样仍因果,组合后既降低了 FLOPs 又保持了可流式重建。

每个建模块内部如何分工捕捉长短依赖?

每个因果长短时块先做局部历史建模。因果空洞卷积扩大感受野但不看未来,随后点卷积与 SnakeBeta 激活增强非线性。接着做长程历史建模,掩码多头自注意力用上三角掩码阻止每帧关注未来位置。全块贯穿残差连接与层归一化,稳定变换并保留时序信息。

这种分工的直觉是波形局部有强周期性,空洞卷积足以高效捕捉,而音节间的协同需要更远的记忆,注意力更合适。两者都在因果约束下工作,因此堆叠多层后感受野向过去延伸,不会泄漏未来。

掩码自注意力 × 因果空洞卷积: 因果空洞卷积负责局部历史建模,用扩张感受野捕捉短窗内的周期与过渡而不看未来;掩码自注意力负责长程历史建模,用上三角掩码阻止 attending 到未来帧。二者搭配的原因是单一局部算子难以记住跨音节依赖,单一注意力又对细粒度波形不敏感,组合后每个块同时获得局部精度与长记忆。

训练时频域监督如何只留梯度不留代价?

生成器本身只收低分辨率波形、只出高分辨率波形。训练期引入的谱表示仅用于算损失和训练判别器,推理不执行。判别器是多分辨率谱判别器,对生成波形与真实波形用 3 种 MDCT 配置提取谱,每种配置对应一个子判别器 D1 到 DL。每个子判别器由级联 2 维卷积加 LeakyReLU 再加单通道卷积打分,生成器与判别器用 hinge 对抗目标优化,并加特征匹配损失稳定训练、提升听感一致性。

除对抗外还有两个重建损失。MDCT 谱损失度量生成与真实语音 MDCT 谱的重建误差,并对高频 bin 给稍大权重以鼓励补高频。梅尔谱损失用 80 梅尔滤波器、FFT1024、窗长 320、跳长 40 提取梅尔谱,算 L1 与 L2 距离,提供听感相关约束。总体生成器损失是四项加权和。

\[\mathcal{L}_{G}=\mathcal{L}_{adv}+\mathcal{L}_{FM}+\lambda_{FW\text{-}MDCT}\mathcal{L}_{FW\text{-}MDCT}+\lambda_{Mel}\mathcal{L}_{Mel},\]

该公式把对抗损失、特征匹配损失、加权 MDCT 损失与梅尔损失相加,后两项各有超参数平衡。生成对抗项通过判别器给生成波形打分,特征匹配与两项谱重建则比较相应特征或谱表示。梯度经这些可微计算返回生成器,判别器另用自己的对抗目标交替更新;这些项目的作用各有不同,并非全都是波形之间的显式距离。推理时判别器与谱变换都不运行。

MDCT 谱判别器 × 波形生成器: 波形生成器指直接输入低分辨率波形、输出高分辨率波形的因果网络;MDCT 谱判别器指只在训练时把生成波形与真实波形变换到多分辨率 MDCT 谱上打真假分的网络。二者搭配的原因是波形域 L1 难以表达听感上的高频结构,而谱域对抗能提供分频段的结构化梯度,组合后推理仍是纯波形且无额外代价,但训练获得了频域监督。

数据、切分、基线和指标如何保证可比?

数据集用 VCTK-0.92,约 44 小时 48 kHz 英语语音,110 个说话人多种口音。全部下采样到 16 kHz 作为高分辨率参考,再下采样到 8 kHz、4 kHz、2 kHz 构造低分辨率输入,对应扩展因子 2、4、8。训练时每条波形随机裁成 16,000 点片段,批量 16,共 600k 步,优化器 AdamW,贝塔 0.8 和 0.99,初始学习率 0.0002,指数衰减 0.999,单卡 RTX3090 完成。

基线选了 4 种代表性方法并在相同数据上训练评估。波形类有 UDM+ 和 TRAMBA,频谱类有 FLowHigh 和 AP-BWE,覆盖扩散迭代、Transformer-Mamba、流匹配加声码器、幅度相位双路加逆变换 4 种路线。原文说明所有基线在相同数据集训练和评估,但未给出详细的训练、验证与测试样本数或说话人名单;复现需要另行记录划分。指标分三方面,质量用对数谱距离衡量谱失真、ViSQOL 衡量听感,越小越好与越大越好方向相反。

可懂度用 Whisper 转写算词错率与字错率加短时客观可懂度;复杂度用参数量与生成 1 秒 16 kHz 语音所需浮点运算量衡量。参数量是模型自身的规模,只有 FLOPs 这一列与所测语音时长对应;二者都不直接给出硬件实测延迟。

下表把关键实现配置整理成可核对清单,数字均来自原文实现段落,便于复现时逐项对照。

配置项取值说明
压缩卷积核长步长通道核长 80;步长 80;输出通道 40步长因果 1 维卷积
投影通道与核长352, 7标准因果 1 维卷积
主干块数与注意力头数主干 8 块;注意力 8 头嵌入维 352,隐层 512
训练裁剪长度与批量步数16,000 点, 16, 600k单卡 RTX3090
MDCT 判别器配置数3不同时频分辨率

上表说明压缩与建模的容量分配,以及训练预算的量级。步数与批量描述训练采样的预算,涉及重复抽取,并非互不重复语音条数;裁剪长度决定每次训练看到的上下文,复现时应优先对齐这三项,否则长程建模的感受野评估会失真。该表不能推出性能结论,性能需看后两节的结果表。

三种带宽下质量与代价如何权衡?

要回答的比较问题是相同 VCTK 测试集、相同 16 kHz 目标下,4 种基线与 StreamWSR 在失真、听感、参数量和算量上的位置。统一条件是低端分别为 8 kHz、4 kHz、2 kHz 输入,指标方向为对数谱距离越小越好、ViSQOL 越大越好、参数量与 FLOPs 越小越好。

方法类型与流式8 kHz 到 16 kHz 失真听感4 kHz 到 16 kHz 失真听感2 kHz 到 16 kHz 失真听感参数量算量
UDM+波形,非流式0.88, 4.571.16, 3.991.33, 3.356.3 M, 189.54 G
TRAMBA波形,非流式0.79, 4.640.97, 4.251.07, 3.625.18 M, 0.72 G
FLowHigh频谱,非流式1.22, 4.701.30, 4.311.62, 2.9849.4 M, 212.93 G
AP-BWE频谱,非流式0.69, 4.710.87, 4.300.99, 3.7629.8 M, 5.97 G
StreamWSR波形,可流式0.73, 4.680.92, 4.271.03, 3.819.03 M, 2.12 G

与 UDM+ 相比,StreamWSR 在 3 种设置下 LSD 更低、ViSQOL 更高,且 UDM+ 的扩散迭代导致算量高达 189.54G,参数虽少但算量很高。原文未测实际部署延迟,因此这里反映的是低延迟部署的计算负担,而非证明所有硬件上都不可用。与 TRAMBA 相比,StreamWSR 在三档失真与听感上均占优,TRAMBA 参数和算量更小但质量落后且不支持零前视。与 FLowHigh 相比,StreamWSR 失真大幅更低,听感在高扩展倍数下反超,FLowHigh 的 49.4 M 参数与 212.93 G 算量都更高,但参数量相对 9.03 M 尚不到 10 倍,只有算量差距超过一个数量级。与 AP-BWE 相比,双方质量接近,AP-BWE 在三档的 LSD 均更低,而且在 8 kHz 与 4 kHz 两档 ViSQOL 更高;StreamWSR 仅在 2 kHz 档 ViSQOL 反超,但它依赖双路幅相预测且不可流式,参数与算量也更大。

必须说明的边界是该表只报告质量与复杂度,不报告可懂度,且最优多集中在 AP-BWE 与 StreamWSR 之间,不能据此断言所有语种或噪声下仍成立。零前视优势也没有在这张表内被量化为延迟毫秒数,仅以是否支持流式区分。

可懂度指标是否支持同样的结论?

这张表回答增强后的语音在机器识别与客观可懂度指标上是否改善。全部目标采样率为 16 kHz,输入依次是 8 kHz、4 kHz 和 2 kHz;模型与基线在相同 VCTK 数据上评测。WER 与 CER 由 Whisper 转写计算,越低越好;STOI 越高越好。原表把百分单位写在表头,数据格保持裸值,下表沿用这一口径,并将三项指标分列,避免把词错率读作可懂度得分。

方法8 kHz WER(%) ↓8 kHz CER(%) ↓8 kHz STOI(%) ↑4 kHz WER(%) ↓4 kHz CER(%) ↓4 kHz STOI(%) ↑2 kHz WER(%) ↓2 kHz CER(%) ↓2 kHz STOI(%) ↑
UDM+4.502.1699.7020.3713.0091.9586.6467.6581.92
TRAMBA3.731.6899.4710.275.8694.3233.3123.5787.68
FLowHigh3.811.7599.669.495.3994.9660.8046.4278.59
AP-BWE3.721.6799.776.693.5494.7536.6925.6187.00
StreamWSR3.841.7999.779.855.5594.3039.3327.4987.14

在 8 kHz 输入下,StreamWSR 的 WER 为 3.84%、CER 为 1.79%,均高于 AP-BWE 的 3.72% 与 1.67%,而两者 STOI 同为 99.77%。这一档客观可懂度接近,并非所有识别错误指标都最优。输入降到 4 kHz 后,AP-BWE 的 WER 为 6.69%,StreamWSR 为 9.85%;StreamWSR 的 STOI 94.30% 也低于所列另外两种较强基线的部分结果。因此因果可流式路线的价值在综合权衡,而不是识别指标全面领先。

最难的 2 kHz 输入下,UDM+ 与 FLowHigh 的 WER 分别为 86.64% 与 60.80%,StreamWSR 为 39.33%,但仍高于 TRAMBA 的 33.31% 和 AP-BWE 的 36.69%。StreamWSR 的 STOI 为 87.14%,高于 AP-BWE 的 87.00%,低于 TRAMBA 的 87.68%。词错率与客观可懂度再次出现不同排名,比较时应同时保留模型和指标名称。

这些未胜出项证明当前系统存在取舍,却没有单独隔离因果约束、参数规模与其他结构各自造成多少差距;将差距全部归因于因果或轻量化仍需额外消融。Whisper 错率与 STOI 也属于代理指标,原文未做大规模人耳 MOS。测试集中干净英语语音的结论应与噪声、混响或多语种部署分开,后者需目标场景评测。

拿掉判别器或压缩各会付出什么代价?

消融固定在 2 kHz 输入、16 kHz 输出的最困难设置。rep. D 只把多分辨率 MDCT 谱判别器替换为波形判别器,生成器和其他目标保持原设置;w/o Stride 删除前端步长因果卷积和末端因果转置卷积,让主干直接处理全长波形。下面分别列出质量、识别与计算指标,便于看清到底是哪一项改变。LSD、WER 和 CER 越低越好,ViSQOL 与 STOI 越高越好。

变体LSD ↓ViSQOL ↑WER(%) ↓CER(%) ↓STOI(%) ↑Params. ↓FLOPs ↓
StreamWSR1.033.8139.3327.4987.149.03 M2.12 G
rep. D1.053.7843.4930.8486.719.03 M2.12 G
w/o Stride1.073.6939.4628.4887.168.92 M78.4 G

换波形判别器后,LSD 与 WER/CER 升高,ViSQOL 与 STOI 降低,而生成器参数和推理 FLOPs 保持一致。这支持当前训练协议下多分辨率谱对抗监督的价值。它解释的是训练期指导方式的差异,不是推理时必须再运行 MDCT 判别器;推理只保留波形生成器与残差相加。

去掉步长模块后,LSD 为 1.07、ViSQOL 为 3.69,都弱于完整模型;WER 和 CER 也略高,STOI 则从 87.14% 微升至 87.16%。因此“所有可懂度指标都下降”并不准确。最显著的变化是算量从 2.12 G 升到 78.4 G,而参数量反由 9.03 M 降为 8.92 M:时序长度与模型参数数目控制的是不同计算负担。

这组实验支持帧级压缩有效节省序列建模开销,并在此设置下保持较好的重建结果。它只运行于 2 kHz 输入,其他带宽的同幅度收益尚待测量;原文也没有量化真实设备上的切块延迟、缓存增长与吞吐。STOI 略高这一反例应保留,避免把压缩的作用写成无条件改善每一项指标。

哪些结论超出证据就不该再推?

已验证的范围是 VCTK 英语干净语音、16 kHz 目标、三档扩展。论文未报告噪声、混响、音乐或多语种上的表现,也未报告真实流式部署的帧长、缓存与实测延迟。零前视在原理上支持低算法延迟,但原文只以是否可流式区分,未给出毫秒级延迟测量。

指标层面同样有边界。对数谱距离与 ViSQOL 反映谱失真与预测听感,Whisper 错率与短时可懂度反映机器可懂度,都不是大规模人听 MOS。FLowHigh 在 8 kHz 档 ViSQOL 略高、AP-BWE 在多档失真略优,都说明 StreamWSR 并非全指标最优,其优势是质量、可懂度、复杂度与可流式四者的平衡。

还有两处不能外推。训练用 16000 点随机裁剪与特定 MDCT、梅尔参数,换数据长度或语种需重调权重。参数量 9M 与算量 2G 是生成 1 秒 16 kHz 语音的统计,不等于端到端通话延迟,后者还取决于分帧、调度和硬件。

要复现应先对齐哪几步?

第一步对齐数据构造。把 VCTK-0.92 全部降到 16 kHz 作参考,再降到 8 kHz、4 kHz、2 kHz 作输入,本文未披露详细样本划分与说话人名单,复现时应记录自己的训练和测试划分,并向作者配置核对。不同划分的结果需要标明条件,避免将说话人与口音分布差异混入方法比较。

第二步对齐模型与训练。压缩卷积核长 80 步长 80 通道 40,投影到 352 通道,主干 8 块,空洞核 7 扩张 2,点卷积隐层 512,8 头注意力嵌入 352,线性降到 40 再经核 80 步长 80 转置卷积输出残差。判别器用 3 种 MDCT 配置,谱损失用 80、40、40 配置,梅尔损失用 80 滤波器、FFT1024、窗 320、跳 40。训练裁 16,000 点、批量 16、600k 步、AdamW 学习率 0.0002 指数衰减 0.999。

残差相加 × sinc 插值上采样: sinc 插值上采样先把低采样率输入插到 16 kHz 目标采样率,提供与输出时间对齐的基础波形;残差相加把网络预测的补偿波形加回该输入。前者解决采样网格对齐,后者让网络在已有信号基础上学习修正。补齐缺失高频是训练目标,而非残差只允许包含高频的硬性限制;低频是否准确保留仍由重建损失与质量评测检验。

第三步对齐评估。质量算对数谱距离与 ViSQOL,可懂度用同一 Whisper 版本转写算词错字错加短时可懂度,复杂度统计参数量与每秒 16 kHz 的 FLOPs。2 kHz 档的 39.33% 指 WER,越低越好;对应 STOI 为 87.14%,越高越好。复现出现偏差时应先对齐数据、采样率、识别器与指标计算,再检查填充、缓存及注意力掩码。

误差大小本身并不能诊断是否发生未来信息泄漏。MDCT 高频权重与两项谱损失系数的具体设置也需要核对,原文给出了符号与作用但未列出这些系数的数值。常见误解是把训练期判别器也搬到推理,实际上推理只跑因果生成器加残差相加。

什么条件下值得尝试 StreamWSR?

当任务是实时语音通话或交互语音,需要在不看未来的前提下补高频,且设备预算有限时,StreamWSR 的路线值得尝试。它的可运行策略是单模型端到端波形输出,无需声码器与显式相位预测,训练期的谱监督不增加推理负担。

当任务允许离线、大算力且追求极限失真时,AP-BWE 这类非流式双路谱方法在 8 kHz 档仍有优势,不必强行换成因果模型。当输入极度缺带宽如 2 kHz 时,应预留可懂度仍明显受损的心理预期,原文该档词错率仍近 4 成,需要结合下游识别或增强做联合优化。

未来工作按原文指向是提升鲁棒性与泛化,并拓展到更多实时语音音频任务。读者若要跟进,最需要补的验证是真实流式切块推理的延迟与质量衰减,以及噪声与多语种下的稳定性,这两项在原文中尚不能判断。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-04 语音/音乐/音频论文速递