英文题目:UD-ASD: A Unified Diffusion Model for Anomalous Sound Detection
会议身份:
conference:interspeech:2026:conference-paper-id:gao26c_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#工业应用 #扩散模型 #统一音频模型 #异常声音检测
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Pengxiang Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Yu Qiu:机构信息未能从会议 PDF 纯文本可靠映射
- Yanzhi Song:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
异常声音检测以10 s机器运转音频的对数梅尔谱为输入,以正常与异常二值判定为输出,难点在于仅用正常样本建模分布并在7类机器与域偏移下保持稳定泛化。方法链分三步:条件投影器将离散机器编号映射为条件嵌入并与谱图通道拼接,为后继生成提供机器上下文;条件扩散模型仅在正常数据上学习去噪重建,将任意输入按正常声修复;对帧级重建误差做时间池化得到256维向量,再用2分量高斯混合模型以负对数似然打分,建模误差分布而非简单范数。与逐机训练的自编码器和扩散基线相比,该链条以跨机共享主干加轻量条件引导替代多模型部署,以分布级误差建模替代L1或L2阈值,从而兼顾泛化与特异重建。在DCASE2022 Task 2开发集评测下,统一模型UD-ASD-U的AUC调和均为77.16%与pAUC调和均为62.80%,均高于官方自编码器基线的AUC与pAUC,分别领先约24.15个百分点AUC和10.00个百分点pAUC。其结论适用边界受限于已知准确机器标签条件,失败条件包括标签缺失或错误,且对未见机型的零样本检测尚未验证。原文披露单片段推理约 0.32 s 与 24.4M 参数量,训练耗时与显存占用未披露。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
要解决的现场问题是什么?
异常声音检测的输入是机器运转时采集的音频,目标是判断当前声音是否偏离正常运转声音。论文把正常声音的分布作为学习对象,测试时任何与该分布偏离较大的样本被判为异常。这种设定属于无监督异常检测,训练只用正常音频,测试同时遇到正常与异常。初学者容易误以为这是有监督分类,实际上训练阶段没有异常标签可学,模型也不能靠异常样例调阈值,阈值与分数设计必须来自对正常数据的建模。
现场的第二个约束是机器种类多。传统生成式做法为每种机器训练一个自编码器或扩散模型,机器一多就会带来成倍的存储与训练开销。论文在引言中明确指出,当多种机器同时发声需要并行监控时,一机一模型难以部署。理解这一点才能理解统一模型的动机,不是为了单纯刷分,而是把多个正常分布放在一个网络里学习,同时保留按机器区分重建的能力。
输入在本文中不是原始波形直接建模。音频先经短时傅里叶变换得到对数梅尔谱,也就是白话说的时频图,横轴是时间帧,纵轴是梅尔频率,能量取对数后压缩动态范围。后续的加噪、去噪、求误差与池化都在这张谱图上进行。复述方法时必须保留这一表示选择,因为重建误差的维度、时间池化的对象以及高斯混合的输入都依赖它。
三条已有路线各自卡在哪里?
论文把已有方法分成 3 类。第一类是传统手工特征方法,从时域幅度能量或频域傅里叶表示提取特征,再做异常判断。这类方法依赖领域知识做特征工程,换机器或换环境往往要重新设计,对初学者而言关键教训是特征一旦固定,泛化就受限。第二类是自监督学习方法,利用机器编号或工况等元标签设计辅助任务,学习能让异常成为离群点的判别表示。这类方法在有标签时有效,但论文指出其对环境噪声敏感,且在缺少元数据时适用性下降。
第 3 类是生成式重建方法,先高保真重建正常音频,再用重建误差做异常分数。常见做法包括自编码器和去噪扩散模型。自编码器通过信息瓶颈压缩表示,论文转述的机理是压缩会丢失细微变化,只学到流形分布的粗近似,还可能退化为恒等映射。扩散模型通过显式逐级修复噪声,对偏离正常的数据更敏感,重建异常时会产生更大误差。但两类生成方法在当时大多仍是一机一模型,这是本文要直接替代的部署范式。
对照时要注意输入、目标、监督与运行阶段是否相同。手工特征与自监督方法多在特征或表示层面比较,而本文与可比的生成方法同属重建加打分流程,比较才更公平。论文在结果表中同时列出官方自编码器基线、分类基线与多个生成式方法,目的就是把同为重建路线的对手放在同一数据集与指标下检验,而不是把类别差异当成胜负。
统一建模的形式化任务是什么?
设每段音频附带机器身份标签,例如机器类型或编号,记为条件。任务要求只用正常音频训练一个统一模型,测试时对任意机器的任意片段输出一个异常分数,分数越高越可能是异常。训练集按论文描述覆盖 7 种机器类型,每种机器有 3 个工况分区,每个分区训练有正常声音,测试按正常与异常混合评估。模型在训练时可见机器标签,推理时同样需要提供被测样本的机器标签才能选择正确的条件分支。
这里的学习依赖是条件必须准确。若标签缺失或错误,条件嵌入会引导模型按错误的正常模式重建,误差分布随即失准。论文在局限中明确承认对准确机器标签的依赖,以及未设计对训练未见全新机器类型的零样本检测。因此复述时不能把统一模型理解为无需标签或可直接跨新机器,统一指的是训练与参数共享统一,而不是标签无关。
举一个教学用的例子,不代表论文数据:假设风扇正常谱图是平稳宽带纹理,轴承正常谱图是周期性冲击纹理。若不给条件,模型会把两种纹理混成平均纹理,重建两者都不像。若给了条件,同一套去噪网络可以在风扇分支修出平稳纹理,在轴承分支修出冲击纹理。这个例子只帮助理解条件的作用,实际纹理与数值以论文实验为准。
UD-ASD 让一个样本走完哪条流水线?
跟着一个样本走一遍最清楚。输入是一段 10 秒音频与它的机器编号。音频先变成对数梅尔谱,机器编号同时送入条件投影器得到条件嵌入。条件嵌入与谱图在通道维度拼接,形成带条件的输入。带条件谱图进入扩散模型的前向加噪与去噪网络,输出一张按正常模式修复的重建谱图。原谱图减去重建谱图得到重建误差,沿时间轴做平均池化得到固定维向量,再送入高斯混合模型计算负对数似然,作为异常分数。
下面的总览图把这条流水线画全了,读图时先看主路径再看条件支路,有助于区分表示变换与条件控制。
看图路径: 1. 先从左下音频经短时傅里叶变换到对数梅尔谱的主链路看输入表示;2. 再看顶部机器编号经条件投影器后与谱图拼接的位置;3. 对比中间前向扩散加噪与右侧去噪网络重建两段箭头方向;4. 最后看底部重建误差经时间平均池化进入高斯混合模型的打分出口
论文图 1。原论文 Figure 1:“Overview of UD-ASD. Different colors indicate vari- ous machines.”。
从像素可见,左下是音频经短时傅里叶变换到对数梅尔谱,顶部是机器编号到条件投影器的支路,中间浅蓝大框是前向扩散到高斯噪声再到去噪网络的主体,右侧是重建样本,底部是原始样本与重建样本相减得到重建误差,再经时间平均池化与高斯混合模型输出正常与异常的散点示意。左下虚线框还展开了条件投影器的内部堆叠,包含嵌入、全连接与激活的重复结构。不同颜色边框的谱图表示不同机器,说明同一模型在处理多机数据。这一结构对应论文所说的 3 个阶段:变换与条件编码、条件扩散重建、高斯混合打分。
条件投影器做了什么拼接?
条件投影器是论文强调的轻量模块。白话说,它是把离散编号翻译成稠密向量的小网络。英文名是条件投影器,缩写为条件投影器模块。结构按图注与正文描述包含嵌入层、全连接层与激活的组合,输出的条件嵌入与对应谱图拼接后送入统一扩散模型的每一层,以保证条件信息充分融合。拼接方式是通道拼接,不是逐元素相加,因此网络可以在保留谱图时频结构的同时,额外看到机器身份通道。
对数梅尔谱 × 条件嵌入: 对数梅尔谱负责把原始波形变成保留时频结构的 2 维表示,是扩散模型直接加噪与重建的对象;条件嵌入负责把离散的机器身份变成稠密向量,告诉模型当前谱图属于哪台机器。二者搭配的理由是单一重建网络若不区分机器会混淆不同正常分布,拼接条件后同一套去噪参数可以按机器分支生成,从而用一个模型实现多机专用重建。
需要区分训练与推理的输入差异。训练时拼接的是正常谱图加正确机器条件,目标是学会分机去噪。推理时拼接的是待测谱图加其声称的机器条件,模型仍按该机器的正常模式修复。若待测本身异常,修复结果会偏向正常模板,从而拉大误差。这种设计把多机数据当作相互的数据增强,迫使网络学习更基础的解耦特征,而不是记住单机的表面细节。
条件投影器 × 扩散模型: 条件投影器分工是把机器编号映射为可与谱图通道拼接的嵌入,并在网络各层保持条件信息;扩散模型分工是学习只在正常数据上的加噪去噪映射。搭配原因是扩散本身无机器区分能力,投影器提供轻量分支控制,组合后新增的作用是免去为每种机器重复训练完整生成器,只增加小模块就实现统一训练与分机重建。
复现时要保留的关键是条件与谱图的对齐关系。条件来自同一片段的机器标签,不能跨片段错配。论文未报告投影器嵌入维度与全连接宽度的具体数值,这是复现缺项,只能按图示堆叠自行补齐并记录,不能从模块名称推定实现。
扩散重建与高斯混合各自分工是什么?
扩散主体包含前向加噪与反向去噪两部分。前向按线性高斯噪声表逐步加噪,去噪网络以带条件谱图与时间步为输入预测噪声,再逐步或跳步恢复出无噪声谱图。训练只用正常数据,最小化预测噪声与真实噪声的差异。推理时无论输入正常还是异常,网络都按正常模式去噪,因此异常输入的重建误差天然更大。论文用基于注意力机制的类 U 网结构做噪声预测,训练用去噪扩散概率模型框架,推理用去噪扩散隐式模型采样加速。
打分部分先求谱图差值,再沿时间轴池化。白话说,时间平均池化是把每频率在一段时间内的误差平均掉,保留频率维的整体偏离,得到论文所述的向量,再用高斯混合模型建模正常误差的分布。高斯混合模型的英文是高斯混合模型,本文用两个全协方差分量,动机是机器声与噪声的双峰结构。测试样本的同一流程得到误差向量后,取其在已训混合分布下的负对数似然为分数,越偏离正常误差分布分数越高。
重建误差 × 高斯混合模型: 重建误差分工是度量输入谱图与模型按正常模式修复后输出之间的偏离,异常输入会被强制修向正常而产生大误差;高斯混合模型分工是对正常误差向量的统计分布建模,用负对数似然做异常分数。搭配原因是简单范数只看像素距离而忽略误差的时频相关与多峰结构,组合后新增的作用是把阈值判断变成偏离正常误差分布程度的概率判断。
论文用图解释了为何不用简单范数。简单 L1 或 L2 只看像素绝对差,忽略残余噪声的分布结构与时频连续性。扩散去噪的残差本身接近高斯噪声的混合,用混合模型更贴合。消融节的直方图对比将直接验证这一点,此处先记住分工:扩散负责按正常修复,高斯混合负责判断修复残差是否像正常残差。
训练优化什么,推理如何加速?
训练目标是去噪。每个训练步随机采样时间步与高斯噪声,按闭式前向公式由原始带条件谱图生成加噪谱图,网络预测噪声,最小化预测与真实噪声的误差。优化器按论文实现细节为 AdamW,学习调度为余弦,学习率与批量等超参数在原表中给出,随机种子固定。训练数据只有正常音频,没有异常监督,梯度只来自噪声预测误差,不来自分类损失。论文未报告梯度是否截断或条件投影器是否分阶段冻结,因此复述时只能说两者联合参与去噪优化,不能脑补冻结策略。
去噪扩散概率模型 × 去噪扩散隐式模型: 去噪扩散概率模型分工是定义训练用的马尔可夫加噪与逐步去噪目标,让网络学会按步预测噪声;去噪扩散隐式模型分工是改变采样的联合分布假设,允许跳步或少步生成。搭配原因是训练需要稳定的逐步监督而推理需要速度,组合后新增的作用是训练保持 1000 步扩散的充分性,推理只用约 100 步即可得到可用的重建谱图。
推理加速依靠去噪扩散隐式模型采样。原始逐步去噪需要沿马尔可夫链走完全部步数,速度慢。隐式采样重写联合分布,允许跳步甚至单步预测干净谱图。论文训练用 1000 步扩散,推理用 100 步采样,在精度与速度之间折中。实现上先由加噪谱图与预测噪声直接估计干净谱图,再按需跳步,避免逐级迭代的全部开销。这一加速不改变训练目标,只改变生成路径,是部署时必须保留的条件。
打分模型的训练在扩散训练之后。先用已训扩散对正常训练数据逐个重建并提取池化误差向量,再拟合高斯混合的均值、协方差与混合权重。测试时扩散参数固定,高斯混合参数也固定,只做前向计算与似然评估,不再更新。
数据、划分与指标如何保证可比?
数据集是 DCASE2022 挑战任务二的开发集,包含 7 种机器类型,每种有 3 个工况分区。训练每个分区有上 1000 段正常声音,测试每个分区是正常与异常的均衡混合,每段音频时长 10 秒。音频预处理固定为对数梅尔谱,傅里叶点数、梅尔滤波器数与谱图分辨率均有明确设置,归一化到对称区间。扩散步数、噪声表、网络通道与注意力分辨率等结构超参数在原表列出,推理步数与随机种子也有交代,复现时应原样保留。
评价按官方协议报告曲线下面积与低误报率下的部分曲线下面积,并以跨机器平均后的调和平均作为主要指示。方向都是越高越好。调和平均对短板更敏感,比算术平均更能惩罚在个别机器上的崩溃,因此适合检验统一模型是否偏科。论文还区分了分机训练与统一训练两个版本,前者每机独立训练,后者所有机器联合训练加条件区分,对比时条件除训练数据范围与条件有无外,其余预处理与打分流程保持一致。
曲线下面积 × 部分: 曲线下面积分工是衡量全阈值范围下正常与异常分数的可分性;部分分工是只在低误报率区间衡量可分性,更贴近工业报警不能频繁打扰的约束。搭配原因是只看全量指标会掩盖高误报区的虚高,组合后新增的作用是同时考核整体排序能力与实用工作点的可靠性,论文因此以二者的调和平均作为主要指示。
硬件与成本按原文交代。统一模型参数量与单片段平均推理时间在特定图形处理器上报告,可作为部署预算的起点,但不能直接换算为其他硬件的延迟。复现时需同时记录音频转谱图、扩散采样与混合打分 3 段耗时,否则总体趋势无法对应到瓶颈。
统一模型相对基线与分机模型赢在哪里?
先提出比较问题:在同一数据集与官方指标下,统一条件扩散是否同时优于传统基线与分机扩散。若只赢基线而输给分机版本,则统一的意义只剩省模型;若同时赢两者,才支持跨机联合训练带来表示增益。公平条件是同为重建加打分流程、同一划分与同一指标方向,论文用官方自编码器与分类基线锚定下限,用分机版本做最直接的对照。
下表整理论文正文连续句子中直接报告的可运行收益,不引入原表矩阵的逐机裸值,避免在无逐格绑定时误用。阅读时注意百分点与相对百分比不同,摘要的提升是相对基线的总体指示,风扇上的提升是单机单指标的突出表现。
| 对比维度 | 评价对象 | 基线与协议 | 统一模型结果 | 提升幅度 |
|---|---|---|---|---|
| 总体相对基线 | 全部机器平均 | 官方基线,AUC 与 pAUC 越高越好 | 统一模型优于基线 | 3.44% AUC 提升,2.52% pAUC 提升 |
| 单机突出表现 | 风扇 | 官方自编码器基线,AUC 越高越好 | 统一模型显著更优 | 高出 36.95% AUC |
| 训练划分 | 每分区 | 每分区训练用正常片段,测试正常与异常均衡 | 训练集每分区上 1000 段正常,测试各 50 段正常与 50 段异常 | 划分固定可复现 |
表后解释主要收益与代价。摘要报告的总体提升支持统一模型有效,风扇上的大幅领先被论文解释为扩散对连续频移类异常的细粒度谱细节更敏感,而自编码器压缩会抹掉这些细节。但总体趋势不等于每机都赢,论文也承认个别专用模型在特定机器上可凭借额外层级信息占优。统一的代价是需要准确机器标签做条件,且联合训练的数据混合本身是一种正则,单机拟合误差可能不如分机彻底。复述时应强调可部署收益来自一个模型覆盖多机,而不是每个单项都取最优。
下面的降维散点用于直观检验重建是否把异常拉向正常,读图时先分清原始与重建、正常与异常 4 类点。
看图路径: 1. 先按图例区分蓝色正常原始与红色异常原始的分布位置;2. 再看绿色正常重建与黄色异常重建是否向同一区域靠拢;3. 观察右上与左下两个聚集区中四类点的重叠与分离程度
论文图 2。原论文 Figure 2:“The t-SNE plots of Bearing Section 02.”。
从像素可见,横轴与纵轴是降维后的两个分量,图例区分蓝色正常原始、红色异常原始、绿色正常重建与黄色异常重建。右上聚集区中蓝色与红色原始点相对分离,左下与右下区域中绿色与黄色重建点相互靠拢,尤其右下绿色正常重建成团而黄色异常重建散在其周围。这支持论文的说法:原始正常与异常差异明显,重建后异常被修向正常分布,因而重建误差可用于区分。需要注意该图只是轴承某分区的可视化,不能推广为所有机器的全程结论,且散点重叠程度受降维随机性影响,应结合直方图与数值表一起判断。
打分函数与统一条件各自贡献了什么?
第一个消融问题是打分函数选混合模型是否必要。比较对象是同一重建输出下的 L1 范数、L2 范数与高斯混合,条件是重建网络与池化特征固定,只换最后的分数计算。指标方向仍是越高越好。论文报告混合模型在源域与目标域的 AUC 及部分指标上均优于两种范数,并用风扇某分区的直方图与核密度估计展示分离程度。
下面的三面板图把这 1 对比可视化,读图时重点看正常与异常分布的重叠宽度而不是单峰高度。
看图路径: 1. 从左到右依次对比 L1、L2 与高斯混合三块面板的横轴分数含义;2. 观察每块面板中绿色正常与灰色异常直方图与核密度曲线的重叠宽度;3. 重点看最右侧高斯混合面板两类峰的错开距离是否大于左侧两块
论文图 3。原论文 Figure 3:“The histograms and KDEs for three functions on Fan Section 00, the green represents normal data and the gray means abnormal data.”。
从像素可见,三块面板从左到右依次为 L1、L2 与高斯混合,横轴是各自的分数,纵轴是密度,绿色为正常音频,灰色为异常音频,实线直方与虚线核密度同时显示。左侧两块中绿色与灰色峰高度重叠,右侧高斯混合中绿色峰偏左集中、灰色峰右移且拖尾更长,两类曲线错开更明显。这支持混合模型对多峰误差分布的刻画能力强于像素级范数。但这只是单机单分区的展示,不能证明所有机器上都同等拉开,数值消融仍需以跨机平均为准。
第二个消融是统一与分机的对比。论文给出两个版本:分机版每机独立训练,统一版跨机联合训练加条件投影器。报告显示统一版在调和平均与多数机器上超过分机版,支持跨机数据增强与条件引导的组合有效。论文的机制解释是跨域联合迫使模型学习更基础的解耦特征,起到正则作用,缓解单机过拟合。就近说明一个未胜出边界:统一并未在全部 7 种机器上包揽第一,个别机器上层级信息约束更强的专用模型仍可占优,这恰好说明统一的优势是鲁棒与通用,而不是单点极致。
哪些边界尚未被验证?
论文明确列出两项局限。第一是依赖准确机器标签,若标签缺失或错误,条件分支选错后重建模板与打分分布都会失配,论文未进一步检验这种噪声标签下的性能衰减。第二是未设计对训练未见全新机器类型的零样本检测,统一只覆盖训练出现过的机器集合,新增机器需要重新训练或扩展条件表,不能直接部署。这些不是技术错误,而是证据缺项,复述时应使用待验证的措辞,不能把跨机泛化夸大为跨新机泛化。
另一类限制与成本有关。扩散采样即使加速到 100 步,仍比重建 1 次的前馈自编码器更耗时,论文在特定硬件上报告的单片段时间只是起点,换硬件、换批量或计入谱图计算后结论可能变化。论文未测量误报带来的运维成本,也未报告阈值选择策略,因此不能承诺误判率或运维负担必然改善。相关性同样不是因果,统一版更好的平均分可能来自数据量变大、正则增强与条件引导的共同作用,现有对照无法拆出各自的精确贡献。
还有复现层面的缺项。条件投影器的嵌入维度、训练轮数与高斯混合的初始化方式未完整交代,扩散噪声表的起止值也只给定线性类型。这些缺项不否定主结论,但在复现时必须显式记录自己的补齐选择,否则跨复现的数字不可比。
复现先固定什么,再跑什么?
复现的第一步是固定信息条件。按原文保留音频时长、训练每分区正常片段数与测试均衡构成,以及谱图参数与归一化区间。机器标签必须与音频一一对应,训练与测试使用同一套编号体系,任何重映射都要记录。随机种子固定后,先跑通单机分机版本作为调试基线,再切到统一版本,避免同时引入联合数据与条件模块导致问题难定位。
第二步是固定计算预算。下表把论文连续句子中可直接照抄的开销与采样设置整理为检查清单,阅读时把参数量、步数与单片段时间分开理解,总体趋势不等于每步都同等耗时。
| 环节 | 参数与设置 | 具体数值 | 作用 | 可运行含义 |
|---|---|---|---|---|
| 特征 | 傅里叶点数与梅尔数 | 1024 点,256 滤波器 | 决定时频分辨率 | 预处理必须一致 |
| 表示 | 谱图尺寸与范围 | 256 乘 256,区间对称归一 | 统一扩散输入尺寸 | 越界需检查缩放 |
| 采样 | 训练框架与推理步数 | 去噪扩散概率训练,去噪隐式 100 步推理 | 保精度提速度 | 步数不可随意减 |
表后说明代价与核对动作。100 步推理是论文在精度与速度间的选择,减步可能省时但会改变重建质量,任何改动都应重测 AUC 与部分指标。参数量只反映存储,不等于延迟,谱图计算与混合打分的时间应单独计时。资源状态方面,本次未发现来源绑定且完成验证的开源资源,因此不能声称代码、模型或数据已公开,复现应按论文文字与超参数自行实现,并在报告中注明哪些细节是自行补齐的。
何时值得尝试这种统一重建?
当现场同时监控多种机器、且每种机器能提供可靠的机器编号时,这种统一重建值得尝试。它的直接好处是一个参数集覆盖多机,减少重复训练与存储,同时跨机联合可能提升对细微谱异常的敏感度。尝试前应确认标签质量与工况分区是否与论文类似,若标签缺失严重或新机器不断加入,则应先补标签治理或考虑增量扩展,而不是直接套用。
不值得盲目套用的情况包括单机小数据且标签不可靠,以及对延迟极敏感而无法承担 100 步采样的场景。此时分机自编码器或更轻的单步重建可能更务实。论文特有的误解需要澄清:统一不是免标签,扩散不是因为参数多才好,而是因为显式修复对偏离正常的数据更敏感;高斯混合不是万能打分,它只在正常误差分布可被双峰较好拟合时占优,换了误差表示或池化方式后需重做消融。
收束时回到可核对的事实。方法上记住 3 段:条件拼接、按正常修复、按正常误差分布打分。证据上记住总体提升、风扇单点大幅领先与混合打分优于范数的对照,以及对标签依赖与无零样本设计的边界。复现时先固定数据划分与谱图设置,再固定采样步数与打分拟合,最后才在目标硬件上谈延迟,这样才能把论文的结论转化为自己现场可运行的收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


