英文题目:BanglaTurn: A Benchmark and Whisper-Based Model for End-of-Turn Detection in Bangla Speech
标签:#轮次切换 | #SFT | #数据集 | #基准测试 | #低资源
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Mizbaul Haque Maruf:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
轮次结束检测输入为播客对话语音片段,输出为说话人是否交出话轮的二分类,难点在于区分真正交接与停顿、填充词和听众反馈造成的假边界。方法链由四步构成:播客音频经说话人分离标注切分出说话人轮次并做语音活动检测分块,接着结合分离启发式与大语言模型初标生成候选标签,再由母语者逐条听辨校正并标注填充词,最后将音频送入Whisper编码器经多尺度池化与分类头输出交接概率。与依赖静音阈值和通用多语言模型的方法不同,该路线显式针对孟加拉语会话韵律做迁移并融合局部与全局声学视图。在留出播客的类别均衡测试集上,本文模型准确率达到84.33%,高于Smart-Turn v3的69.28%。结论仅适用于播客域内的宽带孟加拉语对话,向电话窄带、助手短指令和噪声重叠场景外推尚未验证。原文未披露完整训练时长与算力成本,仅报告CPU端到端延迟在165至191 ms之间。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
本文输入是论文原文提供的文字证据与一张已接收像素的模型结构图,目标是让刚进入语音与音乐音频方向的研究生能复述 BanglaTurn 的做法。必须保留的信息包括语料规模与划分、标注流程的三方来源、模型输入表示与分类结构、测试集来源与不确定性、主结果与基线的对照条件、量化与延迟数字。输出是 1 篇按学习依赖展开的中文技术解读,不引入证据之外的数值或效果断言。
语音交互中的轮次问题可以用日常通话理解。说话人说完一句后,对方需要判断现在能不能接话。判断早了会打断对方,判断晚了会留下尴尬的空白。论文把检测说话人是否真正结束并让出话轮的任务简称为轮次检测,全文只研究一项任务。早期做法只看静音时长,但说话人思考时的句中停顿也有静音,因此需要声学与韵律线索。
孟加拉语有超过 2.3 亿使用者,但在该任务上既没有专用数据集,也没有专用基准。多语言模型 Smart-Turn v3 在孟加拉语会话上表现不佳,论文将其归因于孟加拉语会话在训练数据中占比很薄。研究因此做两件事。第一是构建 BanglaTurn 语料,第二是训练一个基于 Whisper 编码器的二分类模型。解读后文先讲相关路线,再沿一个样本走完音频到标签再到模型输出,然后讲训练与评测条件,最后讨论反证与复现。
此前路线如何处理停顿与真正结束的混淆?
早期轮次系统把静音阈值与基频轮廓、能量模式等韵律特征结合,再用隐马尔可夫模型或条件随机场刻画时序依赖。后续出现基于长短期记忆网络的连续预测,以及融合声学、韵律和词汇线索的神经模型。近年路线包括只用文本预测轮次事件的 TurnGPT,从自监督语音表示学习的话音活动投影,以及面向实时系统的延迟感知预测和多人会话建模。韵律始终是核心线索之一,句末词常通过基频下降、时长拉长和强度降低来标志完成。
静音阈值 × 韵律特征: 静音阈值负责用尾部静音时长做最简单的结束判断,韵律特征负责用末尾基频斜率、能量斜率等刻画句末低降和拉长等完成信号,二者搭配的理由是早期系统把两者线性组合以弥补纯静音无法区分句中停顿的问题,组合意义是在 BanglaTurn 上形成无预训练表示的古典基线,用来检验学习表示是否学到静音之外的线索。
在语音表示一侧,Wav2Vec 2.0 用量化表示上的对比学习,HuBERT 预测被掩蔽的离散隐单元,XLSR 把做法扩展到跨语言预训练。Whisper 在 680,000 小时弱监督数据上训练,覆盖 96 种语言,其中包括孟加拉语,因此论文把它当作迁移起点。相关做法是冻结底层编码器层、只微调顶层,以在适配与泛化之间折中。论文称尚未见到把这类模型适配到低资源语言轮次检测的工作。
孟加拉语语音处理已有众包语音和 BanglaBERT 等语言理解基准,也有朗读语料与韵律标注有声书语料。但朗读中的句边界不等于会话中的轮次结束,因为说话人可以在句边界停顿却仍然占据话轮。论文指出轮次检测没有可比的公开孟加拉语数据集与基准,这就是 BanglaTurn 要填补的位置。
任务的输入输出与标签如何定义?
任务输入是一段 3 秒到 15 秒的播客语音片段,输出是一个二分类标签。端点表示片段结束时说话人真正完成表达并让出话轮,例如我昨天去过市场这类完整陈述。非端点表示同一说话人在片段之后还会继续说。模型训练与评测只用这个二分类目标。
轮次结束检测 × 说话人日志: 轮次结束检测负责判断当前片段结束后说话人是否真正让出话轮,说话人日志负责给出谁在何时说话的时间边界,二者搭配的理由是日志能自动提出谁的片段在换人前结束这一弱标签,组合意义是把无标注播客音频变成可人工核对的二分类样本,但日志错误会直接污染标签所以必须再做语言模型和人工复核。
每个样本除目标标签外还有两个辅助标记。中间填充标记表示片段内部出现犹豫音或话语填充词,结尾填充标记表示最后 1 到 3 个词出现填充词。两个标记相互独立,也与目标标签独立。说话人可以用填充词收尾再让出话轮,也可以说完无填充的完整句子仍继续占据话轮。论文保留这两个标记的理由是填充处的停顿最容易被误判为轮次结束。测试集 319 个片段中有 248 个带中间填充、104 个带结尾填充,且两种标记都与两种标签共同出现。
教学例子仅为帮助理解,不代表论文数据。假设一段音频是说话人说到一半停顿 2 秒再继续,若只看静音会误判为结束。若另一段是说话人说完完整句子后下 1 位说话人紧接着开口,尾部几乎没有静音,纯静音规则又会漏检。论文的标签要区分的正是这两种情况。
从一段播客音频到一个判断,流水线长什么样?
数据流水线按顺序做六件事。先收集公开可看的孟加拉语会话播客,再把音频归一化为 16 千赫、16 位单声道脉冲编码调制格式。接着用 PyAnnote 说话人日志 3.1 切分说话人,该工具组合语音活动检测、ECAPA-TDNN 说话人嵌入和凝聚聚类,相邻同说话人片段合并,短于 2.0 秒的片段丢弃。已知说话人时用参考样本做验证。然后用 Silero 语音活动检测把任意长片段切成 3 秒到 15 秒的块,且尾部静音至多 2.0 秒。最后做轮次状态标注并汇总为 35374 条语料。
模型流水线是另一条路径。输入是 8 秒音频对应的 80 通道对数梅尔谱图,经过微调过的 Whisper 微型编码器得到帧序列,再经多尺度池化拼接成定长向量,最后经分类头输出一个逻辑值。任务不需要转写,只需要音频的声学、韵律与时序结构,因此论文丢掉 Whisper 解码器。下面的结构图值得先建立整体印象,把编码器到池化再到分类的主路径看清楚,然后再读各组件细节安排。
看图路径: 1. 先从顶部编码器框沿中间分叉箭头数出四个并行池化分支;2. 再看四个分支如何汇入中间拼接框然后向下进入分类器框;3. 对照正文确认输入是 8 秒音频的谱图而输出只是一个二分类逻辑值
论文图 1。原论文 Figure 1::“Our proposed model architecture with Whisper-tiny encoder finetuned in Bangla, multi-scale pooling and a classifier.”。
该图顶部是一个宽框表示孟加拉语微调后的 Whisper 微型编码器,向下分出 4 路分别进入最大池化、平均池化、注意力池化和编码器末帧 4 个框,4 路再汇入拼接框,最后向下进入分类器框。按输入到输出的箭头走一遍,就能看到表示先变长再被压缩最后做判断的主路径。拼接是关键汇合点,它把局部突显与整体形状放在同一向量里交给分类头。
编码器与池化各自负责什么,为什么这样搭配?
编码器选用在 Mozilla Common Voice 11 孟加拉语数据上微调过的 Whisper 微型编码器。它的输入是覆盖 8 秒音频的谱图,输出是帧级表示序列。论文的安排理由是编码器已经编码了所需的声学与韵律结构,无需再训练转写解码器。消融中还比较了通用 Whisper 微型编码器与孟加拉语微调版本,以及冻结 0 层、解冻 2 层、解冻 4 层的差异。
Whisper 编码器 × 多尺度池化: Whisper 编码器负责把 80 通道对数梅尔谱图变成保留声学韵律和时序结构的帧序列,多尺度池化负责把该序列压缩成同时保留局部突显和整体形状的定长向量,二者搭配的理由是轮次线索既在结尾音调也在整句形态,组合意义是让分类头同时看到最大值、平均值、注意力加权和末帧 4 种视角。
多尺度池化具体拼接 4 种视角。最大池化捕捉最突显的局部特征,平均池化给出整体表示,注意力池化用可学习查询落到与轮次相关的区域,末帧池化保留最后时刻的时间状态。论文称轮次检测既依赖结尾音素与语调轮廓等局部事件,也依赖整句形态,因此需要同时看局部与整体。分类头是带层归一化、GELU 激活和丢弃的线性层堆叠,最后输出单个逻辑值,用 0.5 作判定阈值。
沿一个样本走完流程有助于复述。取一段 8 秒内的播客块,先算谱图,再过编码器得到帧序列,4 种池化各自压缩后拼接,最后经分类头得到端点概率。若概率大于等于 0.5 则预测为端点,否则为非端点。原文没有给出池化维度、注意力头数与分类头层宽等细节,复现时只能按默认实现补齐并记录为未报告项,不能从模型名推定具体实现。
标注流水线如何从换人边界走到人工确认?
标注先由两个自动来源提出建议。第一个是说话人日志规则。某说话人在另一说话人开始前的最后一个块被提议为端点,其余块提议为非端点。该规则有噪声,因为日志错误、重叠语音和简短应答都会制造虚假的说话人切换。第二个是 Gemini 2.0 Flash Lite 语言模型通道。
固定提示要求对每个片段给出孟加拉语转写、两个填充标记,以及 4 种轮次状态之一。完整与等待映射为端点,未完成与应答映射为非端点,最终只保留二分类标签。
然后由 1 位母语为孟加拉语的标注者听完每个片段并对照两种提议与转写做裁决。两者一致时确认或纠正,两者不一致时只听当前片段独立判断,不听前后音频。填充标记与转写在同一遍检查中核对。该流程有两个明确缺口。一是只有 1 人检查全部标签,因此无法报告标注者间一致性。二是纠正在原地完成且没有记录日志,因此无法报告人工检查改变自动标签的比例。
复述时要区分 3 类信息。已验证的是全量人工听检,论文明确写出每个标签都被检查过。有限解释的是日志加语言模型的组合能降低标注成本,但错误模式未被量化。待验证的是标签错误率与测试集难度选择是否引入偏好,因为同一人既检查标签又挑选测试集,且没有独立核查。
训练用什么损失、优化器与数据划分?
语料共 35374 条,划分为训练 31549 条、验证 3506 条、测试 319 条。训练与验证保持约 80% 端点的自然分布,测试集是 49.84% 端点的平衡集。测试集不是域内随机划分,而是从完全保留的另一档播客中手工挑选的困难样本,共 51.6 分钟,时长仍在 3 秒到 15 秒范围。论文认为这种异源小测试集考查泛化而非域内记忆,但也明确指出小样本使每个数字都不确定,因此需要置信区间。
训练用带逻辑值的二元交叉熵损失,并用动态类别加权防止模型坍缩到多数类。优化器是 AdamW,学习率 5e-5,权重衰减 0.01,梯度裁剪 1.0,批量 16,共 4 轮,线性预热比例 0.2 后接余弦衰减,在单张 48 吉字节 A40 上训练。论文报告了是否微调编码器顶层与是否加入多尺度池化的对照,但未报告随机种子、验证集选模型规则与阈值调参细节,复现时应固定种子并把 0.5 阈值当作既定工作点。
关于资源可得性需要如实说明。本次收到的证据中没有来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。论文正文提到在门控条件下按申请提供研究用音频片段,但本次未能确认可达,不应写成当前可用。
与谁比,在什么条件下比,用什么指标?
比较对象有 4 类。首要是 Smart-Turn v3,在同一测试集上直接评测,神经模型均未见过测试播客。其次是两个古典基线。静音阈值在尾部静音不小于阈值时预测端点,尾部静音定义为峰值能量 35 dB 以内的最后 1 帧之后的时间。逻辑回归用尾部静音加末尾 500 ms 的 4 个韵律特征,包括用 pYIN 估计的基频斜率与相对中值电平、能量斜率、末段语音时长,以及无基频估计的指示变量。两者都在测试播客自身上做分层 10 折交叉验证,因此见过测试说话人与录制条件,分数是乐观的。
误报率 × 漏报率: 误报率负责度量在说话人还要继续时系统抢先判定为结束的比例,漏报率负责度量在真正结束时系统未能响应的比例,二者搭配的理由是把端点当作正类后两类错误对应打断与冷场两种不同代价,组合意义是只看准确率会掩盖阈值选择,必须同时报告才能为语音助手或听写选择工作点。
指标以端点为正类,报告准确率、误报率、漏报率、精确率、召回率与 F1 值。误报对应打断,漏报对应等待时冷场。准确率与 F1 附 95% 百分位自助置信区间,用 319 条测试片段重采样 10000 次得到。延迟与模型体积单独报告。古典基线拟合在测试集上的做法使比较条件不一致,解读时必须保留这一说明,不能把古典基线的数字当作同等条件下的可部署收益。
下表先提出比较问题。异源平衡测试下,学习表示的模型是否优于多语言基线与古典基线,收益主要在少漏检还是少误报,指标方向是准确率与 F1 越高越好,误报率与漏报率越低越好。
| Model | Acc | FPR | FNR | Prec | Rec | F1 |
|---|---|---|---|---|---|---|
| Silence threshold† | 49.22 [43.9, 54.9] | 11.88 | 89.94 | 45.71 | 10.06 | 16.49 [9.6, 23.5] |
| Prosody + silence LR† | 62.07 [56.7, 67.4] | 50.00 | 25.79 | 59.60 | 74.21 | 66.11 [60.2, 71.4] |
| Smart-Turn v3 | 69.28 [63.9, 74.3] | 10.00 | 51.57 | 82.80 | 48.43 | 61.11 [53.7, 67.7] |
| Ours | 84.33 [80.3, 88.1] | 23.75 | 7.55 | 79.46 | 92.45 | 85.47 [81.2, 89.3] |
该表显示本模型准确率 84.33% 对基线 69.28%,置信区间不重叠。更重要的是错误方向。基线精确率高但召回低,漏掉大量真正结束。本模型召回 92.45%,漏报率仅 7.55%,代价是误报率 23.75%。古典基线即使在测试播客上拟合仍远低于神经模型,静音阈值接近随机。这支持论文判断,即该基准考查的是静音之外的线索,但尾部静音分布的人为反转仍可能被模型部分利用。
主结果的收益与代价各是多少?
主结果在 319 条测试集上测得。论文报告本模型准确率 84.33%,95% 置信区间 80.3 到 88.1,Smart-Turn v3 为 69.28%,区间 63.9 到 74.3。未配对双比例检验给出 z 值为 4.50,p 小于 1e-5,论文称该检验对同一切片上比较 2 个模型是保守的。精确率与召回率分别为 79.46% 与 92.45%,基线为 82.80% 与 48.43%,F1 从 61.11% 升至 85.47%。
先看数据集划分表,确认训练、验证与测试的样本量与类别构成,避免把自然分布下的训练优势误读为测试优势。训练与验证约八成是端点,测试是平衡的,这种划分使模型必须在训练偏斜下学会少数类。
| Metric | Training | Validation | Test |
|---|---|---|---|
| Total samples | 31,549 | 3,506 | 319 |
| Endpoint | 25,276 | 2,829 | 159 |
| Non-endpoint | 6,273 | 677 | 160 |
该表确认训练 31549 条中端点 25276 条,验证 3506 条中端点 2829 条,测试 319 条中端点 159 条。测试平衡使准确率更易解释,但小样本使区间约正负 4 个百分点。重提主结果时应增加机制信息。收益集中在漏检从 82 例降到 12 例,代价是误报从 16 例升到 38 例。未胜出项是精确率,本模型 79.46% 低于基线 82.80%,说明更积极地预测端点。应用含义是快速助手可能容忍偶发打断,但听写或辅导场景更怕打断,此时应调高阈值或加短静音超时,论文只报告 0.5 工作点。
编码器微调、池化与量化各自贡献了什么?
消融分离 3 个因素。编码器是通用还是孟加拉语微调,是否加入多尺度池化,以及解冻 0 层、2 层或 4 层。论文称冻结时孟加拉语微调版 F1 略高于通用版,加入池化后在解冻时有帮助,在冻结时略差。最终选择孟加拉语微调加池化加解冻 2 层,准确率 84.33%,F1 85.47%。解冻 4 层加池化得到全表最低漏报率 5.66%,但精确率降到 76.92%,论文推测多出的容量开始拟合训练播客而非任务。解读时必须加上限制,即准确率区间约正负 4 个百分点,行间最大差距 3.14 个百分点,因此消融只提示排序而不能确立优劣。
INT8 量化 × 推理延迟: INT8 量化负责把浮点权重和激活压缩为 8 位整数以减小模型体积和访存开销,推理延迟负责度量从音频输入到二分类输出的端到端耗时,二者搭配的理由是实时轮次检测必须在中央处理器上满足交互时限,组合意义是逐配置检验压缩是否在可接受精度损失内换来体积和速度收益。
量化按配置分别报告。动态 INT8 把模型从约 148 到 149 兆字节压缩到约 39 到 40 兆字节,端到端延迟从 180 到 191 毫秒降到 165 到 170 毫秒。最终模型精度损失 1.26 个百分点,通用编码器损失 0.31 个百分点,但无池化的孟加拉语微调编码器损失 4.70 个百分点,从 84.01% 降到 79.31%。论文称尚未分离该差异的成因。
| Whisper-tiny (BN) + MSP | FP32 | 84.33 | 149.1 | 191.00 |
|---|---|---|---|---|
| Whisper-tiny (BN) + MSP | INT8 | 83.07 | 39.8 | 165.95 |
该表逐行给出量化前后准确率、体积与延迟。阅读时不要把总体趋势推广到每组。压缩比约 73% 与延迟下降 6% 到 13% 是总体描述,具体每行数字不同,且精度损失在不同配置上差异很大。部署前必须按模型逐个检查量化后精度,不能默认最终模型的 1.26 个百分点损失适用于其他变体。下表用原文连续句中的计数整理混淆矩阵,帮助核对误报与漏报的来源。
| 参考与预测 | 预测为端点 | 预测为非端点 | 原文计数对象 |
|---|---|---|---|
| 基线参考为端点 | 77 | 82 | 基线漏掉 82 个真正结束 |
| 基线参考为非端点 | 16 | 144 | 基线误报 16 个未结束 |
| 本模型参考为端点 | 147 | 12 | 本模型漏检降到 12 例 |
| 本模型参考为非端点 | 38 | 122 | 本模型误报升到 38 例 |
该表把 159 个端点与 160 个非端点上的两类错误拆开。收益是漏检大幅减少,代价是误报增加 1 倍以上。结合阈值讨论可知,若把阈值调高,误报会下降但漏报会回升,论文未在保留数据上选择阈值,这项验证留待后续工作。
静音反转、标注者单一与播客域外推有哪些风险?
尾部静音在这批数据上指向反方向。端点片段尾部静音中位数 0.001 秒,非端点为 0.051 秒。原因是切分方式。端点块结束于日志检测到的下一说话人,几乎不留静音,非端点块结束于轮次内部被语音活动检测找到的停顿。这不是孟加拉语轮次的性质,而是语料构建的人为产物。
后果有二。其一,部署系统最依赖的静音线索无法单独解题,常规静音阈值接近随机。其二,学习模型可能把反转线索当作捷径。论文用仅静音回归可达 63.32% 而本模型达 84.33% 来论证捷径不能解释全部性能,但可能解释其中一部分,未来版本应平衡两类的尾部静音。
下表整理原文对静音与韵律各自能力的直接报告,避免把两者混为一谈。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 仅用静音的回归 | 准确率 | 63.32% | 84.33% | 本模型高出约 21 个百分点 |
| 仅用韵律的回归 | 准确率 | 50.78% | 84.33% | 线性韵律远低于学习表示 |
该表显示韵律手工特征单独只有 50.78%,接近随机。末尾基频斜率在端点前下降更陡,与句末低降的文献一致,但在短而填充词多的片段上太弱,线性模型用不上。论文称模型学到的东西不是几个句末韵律测量能捕捉的,这属于有限解释而非因果证明。
不确定性与标签质量是另一组限制。319 条使消融排序不可靠,需要更大跨播客保留集。单一标注者既检查标签又挑选测试集,没有一致性数字来界定标签错误率,真正模糊的片段上测得的准确率部分是与该标注者判断的一致率。域外推风险更大。电话窄带、语音助手短指令、背景噪声与重叠语音都与编辑过的播客不同,论文预期精度会下降,并建议下一步构建电话与助手语音的孟加拉语测试集。
要复现应先做什么,需要补哪项验证?
复现先做数据与评测对齐。按论文收集另一档未参与训练的播客,用同样归一化、日志与语音活动检测切出 3 秒到 15 秒块,保留尾部静音分布的原始记录。标注时至少 2 人独立听检并记录与自动提议的分歧率,测试集挑选与标签核对分开由不同人执行,以补上一致性与挑选偏好的缺项。评测固定 0.5 阈值报告准确率、误报率、漏报率、精确率、召回率与 F1,并用自助法给出区间。
模型复现从 Whisper 微型编码器出发,先复现冻结与解冻 2 层的基线,再加入 4 路池化拼接。损失用带类别加权的二元交叉熵,优化器与学习率按原文设置 4 轮训练。记录随机种子与验证集选模型规则,因为原文未报告这些细节。量化用动态 INT8 逐配置评测体积、延迟与精度,不要把最终模型的损失外推到其他变体。
还需补的验证有三项。第一是平衡尾部静音后的复测,以排除反转捷径。第二是在保留数据上按应用选择阈值,分别给出少打断与少等待两个工作点。第三是跨域测试,至少覆盖电话窄带与短指令助手语音。伦理上注意音频来自公开播客但仍视为创作者作品,发布片段而非整期,不附说话人姓名与来源链接,并提供权利人移除通道。
何时值得尝试这个方案,何时应谨慎?
当任务是低资源语言的会话轮次检测,且只有播客这类较干净的长轮次数据时,该方案值得尝试。Whisper 编码器提供跨语言迁移起点,孟加拉语微调与多尺度池化在冻结与浅层解冻下给出可复现的排序提示,最终模型在异源平衡测试上把漏检从 51.57% 降到 7.55%。INT8 压缩后体积约 40 兆字节、中央处理器延迟 165 到 191 毫秒,满足论文所称的实时可用范围,但应按部署硬件实测。
谨慎情形包括 3 类。一是把 84.33% 直接外推到电话或助手场景,窄带、编解码、有声噪声与短指令韵律都可能使精度下降。二是把消融行间小差距当作确立优劣,区间宽度已超过多数行间差距。三是忽略误报代价,在不能打断的场景沿用 0.5 阈值。此时应先在保留数据上调阈值或加静音超时,并报告阈值选择后的误报与漏报。
回到中心矛盾。停顿不等于结束,静音阈值在该语料上甚至指向反方向,学习表示的价值在于捕捉静音之外的完成线索。论文用古典基线、基线模型与量化对照把收益与代价摆在同一测试条件下呈现,但标签单一、样本小与切分产物仍留下待验证部分。复述方法时记住这条主线,就能把数字放回正确的条件与限制中理解。
📎 论文与评分元数据
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
