英文题目:Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement
会议身份:
conference:interspeech:2026:conference-paper-id:fan26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#波束成形 #麦克风阵列 #端侧运行 #语音增强
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Xulin Fan:机构信息未能从会议 PDF 纯文本可靠映射
- Juan Azcarreta:机构信息未能从会议 PDF 纯文本可靠映射
- Ashutosh Pandey:机构信息未能从会议 PDF 纯文本可靠映射
- Jesus Alvarez:机构信息未能从会议 PDF 纯文本可靠映射
- Ke Tan:机构信息未能从会议 PDF 纯文本可靠映射
- Jacob Donley:机构信息未能从会议 PDF 纯文本可靠映射
- Ritwik Giri:机构信息未能从会议 PDF 纯文本可靠映射
- Buye Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多通道语音增强输入为8通道含混响噪声短时傅里叶变换谱,输出为目标语音波形,难点是低算力边缘模型在低信噪比下掩蔽估计不准、波束成形随之崩溃。第一步由冻结的因果空间网络处理多通道输入,产生延迟增强复数谱与4层中间表征并经延迟传输至边缘,其输出进入下一步作为参考与引导。第二步边缘轻量门控循环网络将延迟谱与多通道输入拼接做空间卷积降维,经3层分裂门控循环单元估计复数掩蔽得到初始目标,同时接受云端分层特征的特征线性调制引导,其目标估计进入下一步做统计融合。第三步对双边目标估计各自计算互协方差向量后经逐帧自适应权重融合,再做时变递归平滑并求解多通道维纳滤波系数作用于当前帧。与仅做延迟输出条件的前人知识助推相比,关键差异是同时传递层级表征与可融合的二阶空间统计,对延迟更鲁棒,该优势受限于仿真房间与固定阵型验证。在标准条件测试集下,完整框架的SI-SDR为5.74 dB,高于边缘基线TinyGRU+MCWF的SI-SDR 1.97 dB。结论限于仿真房间、固定阵型与 64 ms 至 128 ms 延迟区间,未验证真实设备、移动说话人与丢包抖动。边缘侧仅增 1.5% 参数量与 2.4% 乘加运算,未披露端侧实测时延与功耗。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
可穿戴设备为什么需要低算力实时语音增强?
输入是佩戴在头戴或耳戴设备上的多通道麦克风信号,目标是在噪声和混响环境下实时恢复出目标说话人的干净语音。必须保留的信息包括说话内容的可懂度、目标音色不被破坏,以及多通道之间的空间关系,因为后续的波束形成要靠通道间差异来指向目标。输出是增强后的单通道或多通道合并语音,要求延迟足够低,能支撑实时通话。
刚进入语音音频领域的研究生容易把增强理解为单通道去噪,即把一段波形丢给神经网络直接预测干净波形。本文研究的任务更苛刻:一是多通道,设备上有按圆形排列的 8 个麦克风,可以利用空间信息;二是低算力低延迟,模型必须很小、很快,不能照搬云端大模型;三是条件恶劣,信噪比可以低到负值,还混有混响、弥散噪声和多人说话干扰。教学例子:想象你在食堂戴智能眼镜打电话,周围全是人声和餐盘声,网速和电池都不允许把所有音频都传到云端等结果再返回,你的眼镜芯片必须在几十毫秒内自己算出相对清晰的人声,这就是边缘侧模型的处境。
论文的中心矛盾是边缘小模型容量不够,云端大模型能力强但有通信延迟。如果只是把云端结果拿来当答案抄,会因为延迟而对不上当前帧,特别是非平稳噪声变化很快时。本文的判断是频谱细节变化快,但空间统计量变化慢,例如说话人方向在几十毫秒内基本不变,因此云端提供的空间先验即使延迟到达仍有价值。后文将沿着这个判断展开 3 种具体的协作手段。
已有的三条路线各自解决了什么,又卡在哪里?
第一条路线是轻量化边缘模型。论文提到已有多种紧凑增强模型追求低延迟和低功耗,它们通过精简参数和浅层结构实现高效推理。优点是能部署、可实时运行,缺点是建模复杂声场景的能力从根本上受限,在低信噪比下与服务器级方案差距明显。
第二条路线是高容量云端模型。以上下文提到的 SpatialNet 和 TF-GridNet 等为代表,利用大规模空间谱注意力和大量参数,在极低信噪比下仍稳健。优点是性能上限高,缺点是计算和显存开销大,无法直接放在可穿戴设备上。
第三条路线是混合波束形成方法。它把传统空间滤波器与神经网络结合,让数学波束形成器负责空间区分,小网络只负责估计掩蔽或统计量。文中提到最小方差无失真响应和多通道维纳滤波都属于这类做法。优点是物理模型稳定、可解释,缺点是性能被轻量估计器的统计量精度卡住,一旦边缘模型在复杂场景中找错目标,波束形成器就会失效。
第四条相关路线是知识增强协作。原文引用的近期工作假设固定通信延迟,把边缘和云端模型联合训练,用延迟的服务端输出去条件化边缘模型。在目标说话人提取和分离上 gains 明显,但在通用语音增强上提升有限。论文认为这说明只条件化延迟输出不足以捕捉非平稳噪声的快速谱变化,并提出两个未被回答的问题:在有延迟和极小边缘算力下,云端哪类信息最有用,以及如何把知识增强整合进混合波束形成流程。本文正是围绕这两个问题设计实验的。
本文要回答的两个具体问题是什么?
问题一是在通信延迟存在且边缘计算几乎不能增加的前提下,云端传回的哪种信息最能提升边缘推理。候选项包括延迟的增强音频本身、中间层表示,以及由云端估计导出的空间统计量。论文的假设是越接近空间统计的信息越耐延迟,因为方向等空间特性演变慢,而瞬时频谱细节变化快。
问题二是如何让云端信息帮助边缘算出更稳健的空间滤波器,而不只是作为输入拼接的参考。也就是说,协作不能停在特征层,还要进入波束形成器的统计量计算环节。论文为此设计了协同多通道维纳滤波,把两边估计的协方差贡献加权融合。
约束条件很明确:云端模型预训练后冻结,边缘训练和推理时不能改云端;所有云端输出和特征在送达边缘前都要经过与往返延迟对应的帧延迟;边缘侧额外参数和计算量要控制在很小范围内。评价要在标准和挑战两种信噪比条件下进行,指标方向是越高越好。
三招协作是如何串成一个系统的?
先沿一个样本走完流程。输入是 8 通道麦克风的时频谱,每帧每个频点有一个复数向量。云端因果 SpatialNet 和边缘 TinyGRU 同时看到这个输入,云端算出增强语谱图和多层中间特征,经过延迟后送到边缘。边缘把延迟的云端增强谱图拼到当前多通道输入上一起做空间卷积,同时接受云端中间特征的逐层调制,先得到自己的掩蔽估计,再与云端估计一起算出融合的波束形成统计量,最后经协同维纳滤波输出增强语音。
这个全景对应论文图 1,左右两大模型加底部滤波器的结构把三招的位置讲得很清楚。下面的导读帮助你带着问题看图,图后解释再把每个箭头的含义落到文字上。
看图路径: 1. 先从左侧多通道输入沿箭头看到云端模型与边缘模型两条并行路径;2. 再看顶部延迟 Tau 帧的云端增强结果如何作为附加通道进入边缘模型;3. 接着观察中间的层级特征增强箭头指向边缘模型的注入位置;4. 最后沿底部两路协方差与互协方差汇入协同滤波器得到最终输出
论文图 1。原论文 Figure 1:“Overview of the proposed collaborative speech en- hancement system.”。
从像素可见,左侧是云端模型分支,右侧是边缘模型分支,顶部有一路标注延迟 Tau 帧的云端增强波形与当前多通道输入一起进入边缘模型。中间有一条从云端指向边缘的层级特征增强箭头,底部则把云端和边缘各自的互协方差向量经一个受权重控制的开关融合成统一统计量,再与输入自协方差一起送入协同滤波器。图中还用不同图标区分冻结的云端与可训练的边缘,用绿色波形表示干净估计、红色波形表示含噪输入。整个布局说明协作发生在 3 个不同层级:输入层、特征层和统计量层,而不是只在输出端做 1 次混合。
延迟输出拼接与中间特征调制各自做了什么?
云端模型是因果 SpatialNet,由窄带和跨带 Transformer 模块堆叠而成,通过掩蔽未来帧保证因果性。它先在增强任务上预训练到收敛,之后冻结。它提供两类辅助信息:一是最终增强语谱图,即对目标语音的估计;二是选定深度的中间层表示,从早期低层声学线索到深层声源特性,提供多尺度引导。
边缘模型是 TinyGRU,先用空间卷积把多通道压成单通道,再过 3 层堆叠的 SplitGRU 做时序建模,输出复数掩蔽并作用于含噪谱得到初步干净估计,再由此估计导出多通道维纳滤波器做最终合并。原文明确把实部虚部分开堆叠,因此 M 通道输入变成 2M 个实通道,再加云端复数输出的 2 个通道,总共 2 乘 M 加 1 个输入通道。
第一招延迟输入拼接发生在最早阶段。云端增强输出延迟 Tau 帧后作为附加通道拼到多通道输入之前,让空间卷积在降维时就能对照干净参考。论文报告这一招是有效的,但单独用还不够,因为延迟的频谱细节可能已对不上当前非平稳噪声。
第二招是分层特征增强。论文从输入编码层以及第 4、8、12 层共 4 个点取特征,每个特征经 1 乘 1 卷积压缩到标量维度,再延迟对应帧数,然后通过分层特征线性调制注入 TinyGRU 的不同位置:编码器特征调制第一层 GRU 输入,4 层特征调制第二层输入,8 层特征调制第 3 层输入,12 层特征调制最后 GRU 输出。每处调制都由线性投影为每帧生成缩放和偏置参数,再经 Sigmoid 门控做逐元素调制。浅层提供低层谱条件,深层提供更精细的语噪分离线索。
知识增强 × 延迟输入拼接: 知识增强负责说明从云端向边缘传递什么信息和为什么能传递,延迟输入拼接负责说明在边缘入口处如何使用云端已算好的增强语谱图;二者搭配的原因是云端输出虽延迟 64 毫秒以上但仍保留目标语音的干净结构,拼接为辅助通道后,边缘的空间卷积可以直接对照干净参考来抑制当前噪声,新增作用是给小模型一个稳定的目标先验。
分层特征增强 × 特征线性调制: 分层特征增强负责从云端 SpatialNet 多个深度取出层次化表示,从浅层声学线索到深层语噪分离线索,特征线性调制负责把这些表示变成每帧的缩放和平移参数去调制边缘 TinyGRU 的输入和输出;搭配原因是只给最终输出不够表达中间判别过程,逐层调制让边缘在不同抽象层级都得到引导,新增作用是内部状态校正而非仅输入参考。
理解这两招时不要把它们看成重复:拼接给的是可听的参考信号,调制给的是不可听但可用的内部判别状态。前者帮助空间卷积选对方向,后者帮助循环层在不同抽象层次上纠正表示。
协同维纳滤波如何把两边的统计量用起来?
边缘单独做法是用 TinyGRU 估计的目标信号计算协方差统计量,进而求解维纳滤波器系数。但小模型在困难声学条件下估计不准,统计量就会偏,滤波器也随之变差。协同滤波的目标就是引入云端的高质量估计来稳定这个环节。
具体分 4 步。第一步算帧级外积:输入自协方差只与输入有关,两边输入相同所以只在边缘算 1 次;输入与估计目标的互协方差则由两边各自用自己的目标估计分别计算,得到边缘和云端两路向量。第二步做互协方差融合:用边缘最后一层线性层预测的每帧标量权重在 0 到 1 之间加权,越接近 0 越信任延迟但准确的云端统计,越接近 1 越信任实时但较弱的边缘统计。
论文解释在平稳或慢变环境中延迟统计仍高度相关,权重会偏向云端,在突发噪声或空间突变时则偏向边缘。第三步做时变平滑:把融合后的互协方差和自协方差分别用学习到的递归平滑累积,遗忘系数由每帧标量与每频率向量经变换相乘再过 Sigmoid 得到,从而学到频率相关的平滑特性,例如低频积分更长。第 4 步求解滤波器:对平滑后的自协方差求逆再乘融合互协方差得到系数,再与当前输入向量内积得到增强谱。
多通道维纳滤波 × 互协方差融合: 多通道维纳滤波负责利用麦克风阵列的空间多样性求解最优线性合并系数,互协方差融合负责把云端估计和边缘估计各自算出的输入与目标互协方差向量按权重合并;搭配原因是波束形成器的好坏取决于统计量估计质量,云端估计准但延迟、边缘估计实时但弱,融合后得到更稳健的统计量,新增作用是稳定波束形成而非直接替换掩蔽结果。
空间协方差矩阵 × 时变平滑: 空间协方差矩阵负责刻画当前帧各通道输入之间的空间相关性,时变平滑负责用学习到的遗忘系数把瞬时统计量在时间上递归累积;搭配原因是单帧外积噪声大且抖动,直接求逆不稳定,按频率和时间自适应平滑后能兼顾低频长积分与突发变化的快速跟随,新增作用是得到可用于求解滤波器系数的稳定统计量。
关键点是融合权重是网络根据声学条件自适应学的,不是固定超参数;平滑系数对自协方差和互协方差各有一套参数,分别建模。这让系统在延迟不可避免时仍能根据场景变化动态选择信任哪一边。
云端冻结、边缘训练:监督从哪里来?
训练分 2 个阶段。先把云端因果 SpatialNet 用 PCM 损失训练 100 个周期直到收敛,然后冻结它。在边缘训练和推理阶段云端参数不再更新,梯度只流经边缘 TinyGRU 及其新增的拼接投影、调制投影、融合权重预测和平滑参数。论文没有报告云端在边缘训练阶段提供除前向特征外的梯度通道,因此应理解为云端只做前向推理的特征源。
边缘训练与基线都用 Adam 优化器的 AMSGrad 变体,初始学习率千分之一,在第 50 和 80 周期按 0.1 衰减,共训练 100 周期,梯度裁剪最大范数为 0.03。训练目标是增强输出与干净目标信号之间的信噪比损失,训练和评估都以无混响目标信号为参考。音频 16 千赫采样,短时傅里叶用 256 点帧长对应 16 毫秒、128 点跳对应 8 毫秒,得到 129 个频点。训练样本是 4 秒片段,批量 32。
为模拟往返通信延迟,所有云端输出和特征在送达边缘前都要延迟 Tau 帧,每帧 8 毫秒,因此 64 毫秒对应 8 帧。论文未报告是否对延迟做随机抖动或丢包建模,也未报告边缘训练时是否对云端特征加噪声或做停止梯度的额外处理,这些是复现时需要留意的缺项。推理时流程与训练一致,只是云端仍冻结、边缘按流式逐帧计算并维护平滑统计量的前 1 帧状态。
数据、房间和噪声是如何构造的?
干净语音和噪声源来自 DNS 挑战数据集。麦克风是 8 通道圆形阵列,用 Pyroomacoustics 生成房间脉冲响应来仿真多通道输入。每次采样随机抽房间尺寸从 3 乘 3 乘 2 米到 10 乘 10 乘 5 米,阵列放在房间随机位置,墙面吸收系数在 0.1 到 0.7 均匀采样。以 0.5 概率加入 8 到 16 个干扰说话人模拟巴伯尔噪声,弥散噪声源数在 1 到 10 采样,信号干扰比在 5 到 10 分贝采样。
论文构造了难度不同的 2 个数据集,区别只在信噪比:标准集信噪比在负 5 到 10 分贝采样,挑战集在负 10 到负 5 分贝采样。每个数据集仿真 80,000 条训练、21,000 条验证、41,000 条测试。基线是带时变平滑的 TinyGRU 加多通道维纳滤波,参数量 145.1 千,计算量 32.9 百万乘加。云端参考是因果 SpatialNet,不计入边缘开销。评价指标用 SI-SDR、PESQ 和 STOI,方向都是越高越好,其中 SI-SDR 单位为分贝,STOI 单位为百分比。
资源可用性需要如实说明:本次收到的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。复现需要自己按上述仿真描述重新生成数据,或寻找可替代的多通道仿真流程。
三招叠加带来了多大的可运行收益?
要回答的核心比较问题是:在相同的边缘输入和相同的 64 毫秒延迟下,逐步加入三招是否持续带来提升,以及提升是否只是因为边缘变大了。公平条件是云端冻结、边缘训练流程一致、测试集相同,指标方向都是越高越好。下表按消融顺序给出两套数据集上的 SI-SDR,单位为分贝,数值越大表示失真越小。
| 数据集 | 基线 | 加延迟输出拼接 | 再加分层特征增强 | 完整三招协同滤波 |
|---|---|---|---|---|
| 标准集 SI-SDR | 1.97 dB | 3.05 dB | 4.47 dB | 5.74 dB |
| 挑战集 SI-SDR | -1.16 dB | -0.02 dB | 1.35 dB | 2.33 dB |
表后解释需要同时讲收益与代价。完整方法在标准集达到 5.74 dB,在挑战集达到 2.33 dB,相对基线分别提升 3.77 dB 和 3.49 dB。分步看,延迟拼接把标准集从 1.97 dB 带到 3.05 dB、挑战集从 -1.16 dB 带到 -0.02 dB,证明延迟的干净估计确有帮助;再加分层特征增强到 4.47 dB 和 1.35 dB,说明多层条件化让边缘在不同深度都用上了云端信息;最后协同滤波达到最优。
代价是边缘参数增加约 1.5%,计算增加约 2.4%,远小于直接放大模型。未胜出项是基线本身在挑战集仅 -1.16 dB,说明小模型在低信噪比下确实力不从心,这也反衬协作的必要性。需要提醒的是 PESQ 和 STOI 的提升幅度小于 SI-SDR,例如完整方法标准集 STOI 为 85.48% 左右,挑战集为 73.73% 左右,听感与可懂度的改善不如能量失真指标那么陡峭。
放大边缘和拉长延迟会发生什么?
第一个对照是排除参数量解释。把 TinyGRU 隐维度从 96 放到 192 得到 TinyGRU-Large,参数多 198%,计算多 109%,但标准集仅 2.75 dB、挑战集仅 -0.37 dB,明显低于完整协作方法的 5.74 dB 和 2.33 dB。这支持论文的判断:云端信息带来的好处不能靠单纯放大边缘复制。下表把基线、放大基线和完整方法放在同一 SI-SDR 标尺下比较,并列出边缘开销,SI-SDR 单位为分贝,开销为相对比例。
| 数据集 | 基线 SI-SDR | 放大基线 SI-SDR | 完整协作 SI-SDR | 边缘额外开销 |
|---|---|---|---|---|
| 标准集 | 1.97 dB | 2.75 dB | 5.74 dB | 1.5% 参数,2.4% 计算 |
| 挑战集 | -1.16 dB | -0.37 dB | 2.33 dB | 1.5% 参数,2.4% 计算 |
表后解释要讲适用边界。放大基线虽然参数翻倍,但在挑战集仍为负值,说明容量不是唯一瓶颈,空间统计质量才是关键。完整协作只加 1.5% 参数和 2.4% 计算就实现数分贝提升,代价很小。但这不等于所有场景都成立:论文还报告延迟从 64 毫秒拉长到 96 毫秒和 128 毫秒时,标准集 SI-SDR 从 5.74 dB 掉到 4.39 dB 和 4.26 dB,仍远高于基线,表现为优雅降级而非崩溃。这支持空间统计耐延迟的假设,但也说明延迟越大,云端统计与当前场景的错位越大,融合权重会更依赖边缘。未评测的边界包括延迟抖动、丢包、说话人移动过快以及真实录制房间与仿真房间的差异,这些在原文中没有数据,不能推定同样稳健。
哪些结论还没有证据,不能直接承诺?
论文直接报告的是仿真房间、固定延迟、冻结云端条件下的 SI-SDR、PESQ 和 STOI 提升,以及参数和乘加数的增加比例。这些是有证据的,可以复述。有限解释是融合权重在平稳环境偏向云端、在突变时偏向边缘,这符合设计直觉,但原文没有给出权重随时间的曲线或按场景细分的统计,因此只能说机制支持这种自适应,不能说已实测验证了每种突变下的切换行为。
未验证的推测包括实际延迟、误判率和能耗。训练资源、推理开销、输出帧率与实际端到端延迟是四件不同的事:论文给了边缘乘加数和参数量,没有给云端推理耗时、网络传输耗时、设备实测功耗和内存占用,也没有测量在真实可穿戴芯片上的帧率。不能因为乘加只加 2.4% 就承诺续航无影响或延迟一定达标。
另一个限制是数据完全仿真,房间、阵列位置、吸收系数和干扰人数都是随机采样,没有真实录制验证,也没有报告统计显著性方法和置信区间。数值相同不代表指标相同,百分点和相对百分比也不同,阅读时不要把 SI-SDR 的分贝差与 STOI 的百分点差混为一谈。总体趋势成立不等于每条样本都成立,特别是在突发噪声和快速空间切换下,延迟云端统计可能失效,此时系统更依赖边缘,性能下限仍受小模型能力约束。
要复现这个系统,先做什么、保留哪些关键设置?
先复现数据仿真:按 16 千赫、256 点帧长、128 点跳、129 频点处理;房间尺寸、阵列随机位置、吸收系数、干扰说话人概率、弥散源数、信号干扰比和两档信噪比范围都要按原文设置;训练验证测试按 8 万、2 千、4 千划分,用无混响目标作参考。没有公开代码和权重可下载,因此云端因果 SpatialNet 需要自己实现并用 PCM 损失预训练 100 周期到收敛,再冻结。
再复现边缘:实现 TinyGRU 的空间卷积加 3 层 SplitGRU 加复数掩蔽加维纳滤波,输入通道按 2 乘 M 加 1 组织;加入延迟拼接时把云端输出延迟 Tau 帧,64 毫秒对应 8 帧;分层特征取输入编码层和第 4、8、12 层,经 1 乘 1 卷积压缩并延迟后,用每帧线性投影生成缩放和偏置做调制;协同滤波按自协方差单路计算、互协方差双路计算、加权融合、分别时变平滑、求逆求系数的顺序实现。训练用 Adam 的 AMSGrad、初始学习率千分之一、第 50 和 80 周期衰减 0.1、梯度裁剪 0.03、批量 32、4 秒片段、信噪比损失训练 100 周期。
先跑通边缘基线,确认标准集 SI-SDR 在 1.97 dB 附近、挑战集在 -1.16 dB 附近,再逐步打开三招,观察是否复现 3.05、4.47、5.74 分贝的阶梯。还需补的验证是延迟敏感性、真实房间录制、设备端实测耗时和功耗,以及多次随机种子的方差,这些在原文中缺失或只给单点,复现时应自己补齐。
什么时候值得尝试这种云端辅助边缘的思路?
当你的设备算力只够跑十余 10000 参数量级的轻量模型,但又有稳定的低延迟云连接,且任务中有变化缓慢、可被大模型更准估计的统计量时,这套思路值得尝试。多通道语音增强恰好满足:方向等空间统计慢变,大模型估计更准,延迟几十毫秒仍可用。复现优先级是先保证波束形成链路正确,再引入延迟输出参考,最后做分层调制和统计量融合,因为后两者依赖前后维度对齐,调试成本更高。
不值得盲目照搬的情况包括网络延迟抖动大、云端不可用、场景变化极快或隐私不允许上传音频。此时延迟统计可能长期错位,系统会退化为边缘单独工作,额外模块反而增加复杂度。论文特有的误解需要澄清:云端强不等于边缘可以更小,边缘仍需实时估计和融合权重预测;SI-SDR 提升大不等于听感和可懂度同比例提升;乘加增加少不等于端到端延迟和功耗一定少,后者还取决于云端、网络和硬件实现。把这三点想清楚,再决定是否在自己的硬件和网络条件下引入协作。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
