英文题目:RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation
会议身份:
conference:interspeech:2026:conference-paper-id:chao26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#知识蒸馏 #状态空间模型 #严格因果 #实时处理 #语音增强
评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Rong Chao:机构信息未能从会议 PDF 纯文本可靠映射
- Sung-Feng Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Moreno La Quatra:机构信息未能从会议 PDF 纯文本可靠映射
- Sabato Marco Siniscalchi:机构信息未能从会议 PDF 纯文本可靠映射
- Wen-Huang Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- Szu-Wei Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单通道实时语音增强需在仅用历史与当前帧的严格因果条件下,从噪声复谱中恢复干净幅度与相位,同时满足低算法延迟与低实时率。RT-SEMamba先将复数短时傅里叶变换(Short-Time Fourier Transform,STFT)输入送入因果编码器与因果时频Mamba堆叠进行逐帧建模,再经双解码器输出增强幅度、相位与复谱并由逆变换合成波形。接着冻结的8层教师通过输出级与归一化中间特征级信号,以渐进权重将知识压缩至1层学生,学生编码器、解码器与单模块权重由教师初始化后联合优化。相比依赖增长键值缓存的Transformer,该方案以固定尺寸循环状态实现逐帧递推,避免长序列缓存膨胀与重复计算。在VCTK-DEMAND测试集上,蒸馏后1层学生PESQ从3.06提升至3.18,保持0.11稳态实时率不变,约为8层教师0.29的三分之一,恢复约46.2%的师生PESQ差距。该结论目前仅在该单数据集与16 kHz受控混合条件下成立,未验证混响、移动噪声与跨语料泛化。原文未披露优化器、学习率、批量大小与训练成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/RoyChao19477/RT-SEMamba — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,哪些信息必须保留?
这篇论文研究的是单通道实时语音增强。输入是一段带噪语音波形,里面同时混有目标说话人的干净语音和非平稳噪声,测试时还包含训练没有见过的噪声类型和说话人。目标是从带噪输入中恢复出更接近干净语音的波形,要求听感更清晰、失真和伪影更少,同时下游可懂度不下降。初学者可以这样走一遍样本:把带噪波形做短时傅里叶变换,得到每一时频点的幅度和相位,模型要预测干净语音的幅度和相位,再经逆变换合成增强波形。
必须保留的信息包括输入表示是复谱的幅度和相位、输出同样是幅度、相位和复谱重建结果、评价同时看质量、可懂度和计算开销。论文的输出不只是给出一个增强音频,还要给出在严格流式约束下的质量延迟折中。也就是说,模型在时刻 t 只能看到当前和过去的帧,不能偷看未来帧,这是与离线增强最关键的区别。原文把这种约束落实为全因果网络和一窗长度的算法延迟,默认从原文独立写作,后续所有数字都回到原文核对。
已有路线解决了什么,还缺哪一块流式约束?
已有语音增强路线大致可分为 3 类。第一类是卷积、循环和卷积循环混合网络,以及 Transformer 和 Conformer 结构,它们在非因果评测中取得了很强的分数,相位感知、复谱、子带和面向评价指标的改进进一步提升了时频增强质量。第二类是扩散生成模型,把增强看作条件生成问题,但多数工作同样依赖未来上下文,低延迟流式部署并不直接。第 3 类是显式因果低延迟结构,例如波形域实时模型和基于自监督表示的因果前端,证明了在普通硬件上做实时处理是可行的。
选择性状态空间模型 Mamba 是近期被引入的另一条路线,它用轻量线性递推代替自注意力,理论上具有线性时间与内存复杂度,并已被用于时频增强与分离。论文指出,已有 Mamba 增强系统主要在非因果条件下评测,没有显式强制流式约束。本文的工作位置是把 SEMamba 改成严格因果的实时变体,并研究如何把深层因果模型的表示能力压缩到极浅模型中。相关对照要按同输入、同目标、同运行阶段来理解,不能把离线大模型的分数直接当作同延迟下的胜负。
为什么 Transformer 的缓存和离线 Mamba 都不好直接部署?
流式部署有两个容易混淆的约束。第一个是算法延迟,即为了输出当前帧必须等待多少信号到来。如果模型需要未来帧,就必须引入前视等待,这对助听器、耳机、会议和交互语音是不可接受的。第二个是实时因子和内存带宽,即处理 1 秒音频需要多少计算时间和内存搬运。Transformer 编码器在推理时需要维护不断增长的键值缓存,序列越长,缓存越大,内存占用和带宽压力随之上升。
Mamba 类模型每层只传播固定大小的循环状态,理论上可以做纯递推更新,避免缓存增长。但如果 Mamba 实现中保留了双向时间建模、非因果卷积或非因果归一化,它仍然不是流式模型。论文要解决的问题就是把原来包含非因果组件的 SEMamba 改成全因果,并回答深模型变浅后质量掉多少、能否用蒸馏补回来。举例来说,一个 8 层模型可能质量最高,但每秒乘加运算和实时因子都明显上升;直接把层数砍到 1 层,速度上去了,质量又明显掉下来,这就是中心矛盾。
RT-SEMamba 如何从一帧带噪谱走到增强波形?
RT-SEMamba 工作在复数短时傅里叶变换域。前端对 16 kHz 波形做因果短时傅里叶变换与逆变换,窗长 400 点、跳长 100 点、不做居中,因此算法延迟被限定为一个窗的长度,也就是 25 ms,且不做额外的谱归一化。编码器把输入的幅度和相位映射为深层表示,中间堆叠多个因果时频 Mamba 块,最后由因果幅度解码器和因果相位解码器分别预测增强幅度和相位,再经逆变换得到波形。
沿一个样本走一遍就是:输入 1 帧带噪幅度与相位,经编码器进入时频 Mamba 做时间与频率建模,经解码器得到该帧的估计幅度与相位,送入逆变换输出对应波形片段,状态向前传递处理下 1 帧。时间 Mamba 沿时间单向处理,不做前视;同一帧内的频率轴建模仍可以是双向的,因为不引入跨帧未来信息。每个因果时频 Mamba 块后还加入一个多层感知机,用于增强逐帧建模能力。 下段先导读结构图,帮助建立从编码到解码再到波形的主路径,再看重复堆叠与分支汇合的位置。
看图路径: 1. 先沿从左到右的主路径确认编码器到时频 Mamba 再到幅度与相位解码器的走向;2. 再看虚线框内标注的 x N 含义,确认重复堆叠的是同一个因果块;3. 最后看右侧幅度解码输出如何与逆压缩和逆短时傅里叶变换汇合得到增强波形
论文图 1。原论文 Figure 1:“Architecture of the proposed RT-SEMamba.”。
从实际收到的结构图像素看,右侧可以辨认出因果幅度解码器、因果相位解码器、逆压缩、逆短时傅里叶变换和增强波形,中间虚线框内标注重复次数为 N,框内可见转置卷积和多层感知机模块。幅度分支经过逆压缩后与相位分支汇合进入逆变换,这与正文描述的幅度相位分别预测再合成波形的流程一致。该图只承担结构走向的教学作用,具体卷积核与通道数仍以正文文字为准。论文强调所有时间卷积都用左侧补零的非对称因果填充, utterance 开头缺失的历史上下文用零填充,同时把实例归一化换成沿时间因果填充的通道层归一化,这些改动共同保证了严格因果。
固定状态流式推理省掉了什么计算?
流式推理采用 1 帧进 1 帧出的在线方式,关键是不重复计算过去帧。模型在时间上维护 3 类状态:第一类是时间帧缓冲,保存因果时间卷积所需的过去若干特征帧;第二类是深度可分离 1 维卷积前的内部卷积状态,保存最近的卷积历史;第 3 类是选择性状态空间模型的循环隐状态。每到一个新时刻,模型消费 1 帧输入,更新这 3 类状态,输出 1 帧增强结果,并丢弃过时数值。这样每帧计算量和内存与序列长度基本无关,避免了对整段历史做重复前向。
因果时频 Mamba × 键值缓存: 因果时频 Mamba 负责沿时间和频率分别建模并只用过去帧做递推更新,键值缓存是 Transformer 为看过去而不断增长的显存结构,二者搭配的理由是 Mamba 用固定大小循环状态替代增长缓存,组合意义是让长语音的每帧计算和内存与序列长度无关,更适合边缘端流式推理。
与 Transformer 需要显式管理键值缓存不同,这里不需要随时间增长的缓存结构,内存搬运更平稳。论文还提到混合教师实验中因果时间 Transformer 需要 0.5 s 键值缓存在推理时做未来掩蔽自注意力,虽然同样满足流式约束,但需要额外的缓存管理,这也是最终采用全 Mamba 教师的原因之一。初学者不要把频率轴双向误解为偷看未来,频率双向发生在同一帧内部,不跨时间前视,因此不破坏因果性。
渐进蒸馏如何把 8 层教师教给 1 层学生?
训练分为教师训练和蒸馏两个阶段。教师是 8 层 RT-SEMamba,学生是 1 层或 2 层 RT-SEMamba,编码器、解码器和前端结构共享。蒸馏时教师参数冻结,为了加速收敛,学生的编码器、解码器和单个时频 Mamba 块用预训练教师的对应权重初始化。监督来自三部分:原始增强任务损失、输出级蒸馏损失和中间特征蒸馏损失。任务损失沿用 SEMamba 的幅度、相位、复谱、时域和一致性项 formulation。
输出级蒸馏让学生在幅度、相位和复谱 3 个层面逼近教师预测,权重分别设为 1.0、0.3 和 0.5。中间特征蒸馏先把教师 8 个块的输出做平均聚合得到聚合特征,再对学生块输出和聚合特征分别做按样本归一化以缓解尺度失配,然后求均方误差。渐进体现在权重调度上,蒸馏权重随训练步数从 0 线性爬坡到 1,爬坡长度为总步数的 10%,之后保持全量蒸馏,总目标是任务损失加上 0.5 倍输出蒸馏和 0.1 倍特征蒸馏。
复谱输出蒸馏 × 中间特征蒸馏: 复谱输出蒸馏负责让学生的幅度、相位和复谱预测向教师的最终输出对齐,中间特征蒸馏负责让学生的单层块输出向教师 8 层聚合特征对齐,二者搭配的理由是只学输出容易丢失层内表示,只学特征又不直接约束可听目标,组合意义是同时约束最终目标和内部表示以缩小浅层容量不足带来的差距。
这种设计同时约束了最终可听目标和内部表示,学生不需要增加任何推理结构。原文没有报告教师训练的具体优化器、学习率和轮数等完整超参数,这是复现时需要回到代码核对的缺项,不能从模型名称推定训练实现。
在什么数据、划分和指标下比较才算公平?
实验使用 VCTK-DEMAND 数据集,这是单通道语音增强的常用基准。训练集由 28 个说话人的干净语音与 10 种噪声在 0、5、10 和 15 dB 信噪比下混合而成,共 11572 对带噪干净样本对。测试集来自 2 个未见说话人与 5 种未见噪声,在 2.5、7.5、12.5 和 17.5 dB 下混合,共 824 条,全部重采样到 16 kHz。评价指标包括语音质量评估、信号失真、背景噪声、整体质量和短时客观可懂度,其中前四者越高越好,可懂度同样越高越好。计算开销用参数量、每秒乘加运算和稳态实时因子衡量,实时因子在单张 NVIDIA RTX 5090 上热机后测量,越小越快。算法延迟统一为 25 ms,这是比较公平性的关键条件。
算法延迟 × 实时因子: 算法延迟负责度量为了产生 1 帧必须等待的未来信号长度,由窗长和是否前视决定,实时因子负责度量处理 1 秒音频实际花费的计算时间占比,二者搭配的理由是延迟小不等于算得快,组合意义是必须同时报告 25 ms 延迟约束和稳态实时因子才能判断模型是否真正可流式部署。
只有在相同延迟、相同数据集划分和相同采样率下,层数与蒸馏带来的分数变化才能归因于模型本身。原文与外部因果实时模型的对比表中,部分模型在更大语料上训练但在 VCTK-DEMAND 上评测,解读时要区分同条件蒸馏收益与跨数据训练带来的差异。
层数增加带来多少质量,又付出多少实时开销?
论文首先报告因果时频 Mamba 层数从 1 到 8 的质量延迟折中。直接训练时,1 层到 2 层提升最大,语音质量评估从 3.06 到 3.19;2 层到 4 层只有温和提升,4 层达到 3.29;5 层不再超过 4 层;8 层达到最优的 3.32、信号失真 4.64、整体质量 4.08,因此被选为教师。
开销几乎随深度线性增长,参数量从 1.05M 到 2.74M,每秒乘加运算从 20.56 到 47.35 G/s,实时因子从 0.11 到 0.29。这说明深模型只有边际质量收益,却付出大幅实时成本,而 1 到 2 层适合延迟但质量明显偏弱,这正是做蒸馏的动机。蒸馏后,1 层学生从 3.06 提升到 3.18,2 层学生从 3.19 提升到 3.22 并接近 3 层直接训练模型的 3.20。论文用差距恢复率量化迁移效果,1 层学生在 4 个质量指标上分别恢复了教师与学生差距的 46.2%、19.2%、63.6% 和 34.5%。重要的是蒸馏不增加流式成本,1 层蒸馏学生保持 0.11 实时因子,约为 8 层教师 0.29 的三分之一左右,原文摘要表述为 2.75 倍加速。
下段先提出比较问题:在相同实时因子下蒸馏是否真正上移了质量效率前沿,再看散点图验证。
看图路径: 1. 先确认横轴是实时因子越小越好,纵轴是语音质量评估越高越好;2. 再对比蓝色圆点直接训练模型随层数增加向右上移动的趋势;3. 最后看黄色星形蒸馏学生在相同横坐标下相对蓝色基线的垂直提升幅度
论文图 2。原论文 Figure 2:“Distillation improves quality without increasing la- tency.”。
从实际收到的散点图像素看,横轴为实时因子越小越好,纵轴为语音质量评估越高越好,蓝色圆点为直接训练的不同层数模型,黄色星形为蒸馏学生。1 层蓝色点位于左下,红色长箭头垂直指向上方的 8 到 1 黄色星形,2 层蓝色点上方也有短箭头指向 8 到 2 黄色星形,而 8 层蓝色点位于最右上。这支持了蒸馏在不增加横轴开销的情况下提升纵轴质量的判断,但也显示蒸馏学生仍明显低于 8 层教师,说明压缩有收益也有上限。
教师模型 × 学生模型: 教师模型负责用 8 层因果时频 Mamba 提供高质量上限,学生模型负责只用 1 层或 2 层在相同延迟下做低开销推理,二者搭配的理由是深模型质量高但计算大、浅模型快但质量低,组合意义是通过渐进蒸馏把教师的输出和聚合特征迁移给学生,使学生在不增加运行时开销的情况下上移质量效率折中线。
| 条件 | 指标 | 直接训练基线 | 蒸馏学生 | 教师上限 |
|---|---|---|---|---|
| 相同 25 ms 延迟,1 层结构 | 语音质量评估 | 3.06 | 3.18 | 3.32 |
| 相同 25 ms 延迟,2 层结构 | 语音质量评估 | 3.19 | 3.22 | 3.32 |
| 相同 25 ms 延迟,1 层结构 | 信号失真背景噪声整体质量 | 直接基线更低 | 蒸馏后提升并部分恢复差距 | 8 层最优 |
| 相同稳态测量 | 实时因子 | 1 层 0.11 | 蒸馏 1 层 0.11 不变 | 8 层 0.29 |
| 相同结构 | 参数量 | 1 层 1.05M | 蒸馏 1 层 1.05M 不变 | 8 层 2.74M |
表前比较问题是:在固定算法延迟和相同层数结构下,蒸馏学生相对直接训练基线提升多少,距离教师上限还有多远,是否增加了推理代价,指标方向是质量越高越好、实时因子越小越好。表后解释是:主要收益是 1 层蒸馏在零额外运行时开销下获得 0.12 质量提升,2 层蒸馏进一步达到 3.22;具体代价是仍与 3.32 教师存在差距,且信号失真差距恢复率仅 19.2%,说明浅容量对某些失真维度的拟合仍然受限。未胜出项是 5 层直接训练不再超过 4 层,说明一味加深并不单调变好。
混合教师和频谱可视化支持什么,又不支持什么?
论文做了混合 Mamba 与 Transformer 教师的架构搜索。把 3 层模型中第 2 块换成因果时频 Transformer 后,质量评估从 3.20 变为 3.19,基本无增益且背景与整体指标略降。把 5 层模型中第 4 块换成 Transformer 后,质量评估从 3.27 提升到 3.32,非常接近 8 层全 Mamba 教师的 3.32。这支持了一个有限解释:单个 Transformer 块可以明显增强中等深度模型,使 5 层混合模型匹配 8 层教师。但该混合方案需要同时维护键值缓存和 Mamba 循环状态,增加了流式实现的复杂度,因此论文最终仍采用 8 层全 Mamba 作为教师。
这是一个有代价的反例,不能只看分数最高就选用混合教师。 下段先导读频谱图,明确三块面板的条件与坐标,再解释增强谱更接近哪一侧。
看图路径: 1. 先确认三块面板从左到右依次是带噪、干净和蒸馏增强的条件;2. 再对比低频谐波结构和高频噪声底在三者之间的异同;3. 最后观察增强结果在静音段和语音段是否更接近干净谱而非带噪谱
论文图 3。原论文 Figure 3:“Spectrogram visualization of noisy, clean, and en- hanced speech produced by the distilled RT-SEMamba (8→1).”。
从实际收到的频谱图像素看,三块面板横轴均为时间 0 到 2.5 s,纵轴均为频率 0 到 8000 Hz,颜色条为分贝从负 80 到 0。左侧带噪谱的背景更浑浊、高频噪声底更亮,中间干净谱的谐波结构更清晰、静音段更黑,右侧 8 层到 1 层增强谱在视觉上更接近中间干净谱,语音段的共振峰结构得到保留,首尾静音段的残留噪声明显少于带噪谱。
该图是单样本定性展示,支持蒸馏学生能抑制噪声并保留谐波结构的判断,但不能把单条频谱推广为全测试集的定量结论,也不能从颜色深浅读出精确分贝数值。
| 条件 | 指标 | 直接训练 | 混合教师 | 全 Mamba 教师 |
|---|---|---|---|---|
| 3 层,第 2 块替换 | 语音质量评估 | 3.20 | 3.19 | 未报告 |
| 5 层,第 4 块替换 | 语音质量评估 | 3.27 | 3.32 | 8 层 3.32 |
| 相同流式约束 | 推理状态 | 仅 Mamba 状态 | Mamba 状态加键值缓存 | 仅 Mamba 状态 |
| 参数与延迟 | 复杂度 | 更低 | 更高且需缓存管理 | 8 层最大但无缓存增长 |
| 定性样本 | 频谱形态 | 带噪更浑浊 | 未单独可视化 | 蒸馏增强更接近干净 |
表前比较问题是:在相同因果流式约束下,替换一块 Transformer 是否值得,指标方向是质量越高越好,但还要看是否引入额外缓存管理。
表后解释是:主要收益集中在 5 层混合模型上,3 层混合并无收益;具体代价是推理要维护 0.5 s 键值缓存,论文因此放弃混合教师。未评测边界是混合教师蒸馏到 1 层学生的效果,原文没有报告,不能推定混合教师一定教出更好的浅学生。
哪些结论有边界,不能直接推广?
首先,所有定量结论都来自 VCTK-DEMAND 这一相对小规模基准,训练噪声 10 种、测试噪声 5 种,且多为非混响条件,不能直接推广到混响、远场、多说话人或全频带 48 kHz 场景。其次,与外部因果实时模型的对比中,不少模型在更大语料上训练,论文模型只在 VCTK-DEMAND 上训练,跨表分数差异可能来自数据规模而非结构本身,原文也用符号标明了这些差异,解读时要保留该条件。
第三,实时因子只在单张高端显卡热机后测量,没有报告嵌入式 CPU、数字信号处理器或手机端的延迟、功耗和内存带宽,0.11 实时因子不等于在助听器上同样实时。第四,评价全部是客观指标,没有主观听感测试,自动指标的提升不等于人耳偏好同样提升。第五,蒸馏只验证了 8 层到 1 层和 8 层到 2 层,没有验证更小或更宽的学生、跨结构蒸馏的稳定性,也没有报告多次随机种子的方差。
缺失证据不是技术错误,但相关性不是因果,在未测量误判率和实际端到端延迟之前,不应承诺这些量得到改善。
要复现这条质量效率曲线,先做什么?
复现先固定可比条件。数据按原文划分准备 11572 对训练样本和 824 条测试样本,重采样到 16 kHz,保持训练信噪比 0 到 15 dB、测试信噪比 2.5 到 17.5 dB 的设置。前端用窗长 400、跳长 100、不居中、16 kHz 的因果短时傅里叶变换与逆变换,保证算法延迟为 25 ms,所有时间卷积用左侧补零因果填充,归一化用通道层归一化。先训练 8 层教师,再用教师权重初始化 1 层学生的编码器、解码器和时频块,冻结教师后按任务损失加渐进蒸馏损失训练,输出蒸馏权重 1.0、0.3、0.5,总权重 0.5 和 0.1,爬坡为总步数 10%。
评测同时报告语音质量评估、信号失真、背景噪声、整体质量、可懂度,以及参数量、每秒乘加运算和稳态实时因子。代码方面,原文声明代码将在 GitHub 公开,本次收到的资源状态显示代码链接当前可用,可直接核对前端因果实现、状态传递和损失权重,还需补做的验证是更换随机种子、报告嵌入式端延迟,以及在混响或更大语料上的泛化测试。
| 复现项 | 原文给定 | 待核对缺项 | 可运行策略 |
|---|---|---|---|
| 数据划分采样率 | 11572 对训练 824 条测试 16 kHz | 具体文件列表与随机划分脚本 | 按原文信噪比重建混合 |
| 前端延迟 | 窗长 400 跳长 100 不居中 25 ms | 短时傅里叶实现细节 | 用因果填充复现 |
| 蒸馏权重 | 输出 1.0 0.3 0.5 总权重 0.5 0.1 爬坡 10% | 优化器学习率轮数 | 先用代码默认值再消融 |
| 评测 | 5 个客观指标加实时因子 | 主观听感与端侧延迟 | 先复现客观表再补测 |
| 开源 | 代码链接当前可用 | 权重是否公开 | 以链接实际可达为准 |
表前比较问题是:哪些信息已足够直接重放,哪些必须看代码才能确定,指标方向与运行条件是什么。
表后解释是:主要可复现的是数据协议、延迟约束和蒸馏权重;具体代价是训练超参数和端侧成本缺失,必须回到可用代码核对,不能用默认值代替原文结论。未胜出项是若只复现客观分数而不测实时因子,就无法验证实时主张。
何时值得尝试这条路线,一句话如何复述方法?
当任务要求严格流式、算法延迟锁定在 25 ms 左右、且设备内存带宽受限时,这条路线值得尝试。复述方法是:用全因果时频 Mamba 做 1 帧进 1 帧出的递推增强,每层只维护固定大小循环状态,再用 8 层教师的复谱输出和层聚合特征渐进蒸馏到 1 层学生,推理开销不变而质量明显回升。何时不值得:如果可以容忍离线前视或有充足算力维护大缓存,更深的离线模型或混合注意力可能质量更高;如果目标是全频带或强混响,本文在 VCTK-DEMAND 上的结论需要重新验证。
学习依赖上,先理解因果与实时因子的区别,再理解固定状态与增长缓存的区别,最后理解输出蒸馏与特征蒸馏的分工,就能把从带噪谱到增强波形的整条链路讲清楚,而不只是记住 3.18 和 3.32 两个数字。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


