英文题目:Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
会议身份:
conference:interspeech:2026:conference-paper-id:saon26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#CTC #语音大模型 #高效推理 #语音 #语音识别
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- George Saon:机构信息未能从会议 PDF 纯文本可靠映射
- Samuel Thomas:机构信息未能从会议 PDF 纯文本可靠映射
- Takashi Fukuda:机构信息未能从会议 PDF 纯文本可靠映射
- Tohru Nagano:机构信息未能从会议 PDF 纯文本可靠映射
- Avihu Dekel:机构信息未能从会议 PDF 纯文本可靠映射
- Luis Lastras:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音感知大语言模型将声学编码器与文本大语言模型级联做转写,逐词元自回归解码成为速度瓶颈,且强语言先验易掩盖声学证据导致幻觉。该方法先以联结时序分类贪婪解码产生草稿并计算帧级熵,若熵低于阈值则直接放行高置信结果。否则将草稿送入大语言模型单次前向验证词元似然,仅接受全部似然高于阈值的假设。若验证失败则从首个低似然位置回退为自回归续写,以声学草稿前缀约束后续生成。相对外挂小草稿模型或多头并行预测,该机制复用冻结CTC编码器本身做非自回归草稿,以熵与似然双重松弛接受准则实现加速与系统组合纠错。在Open ASR基准下,所提双重验证方法的WER为5.58%,低于仅熵接受变体的WER 5.75%。该结论限于CTC训练且冻结编码器的SLM及转写任务,对低接受率语料加速有限,翻译与问答等任务尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
语音大模型为什么又准又慢?
输入是一段语音波形,目标是输出对应的文字转写。当前最准的一类系统是语音感知语言模型,简称 SLM,可以看作注意力编码器解码器在语音上的特例:前端用 Conformer 声学编码器把波形变成帧级向量,中间用适配器把长语音序列压缩投影成语言模型能读的声学嵌入,后端用文本大语言模型逐个预测输出词元。论文交代这类结构占据公开榜单前列,但推理必须自回归进行,每生成一个词元就要做 1 次大模型前向,无法像 CTC 贪心解码那样 1 次性并行输出。
对刚入门的读者,白话是:CTC 像听写时每个时刻独立投票,投票完去重即成句,速度快但语言约束弱;自回归像写作文时边写边看上文,流畅但必须一个词一个词写。半自回归、块预测、 transducer 联合预测时长等路线试图折中,而文本大模型的投机解码则试图用小模型先猜多个未来词再由大模型 1 次验证。本文要解决的矛盾是语音大模型能否不训练额外小模型,仅靠自身已有的 CTC 编码器做草稿,既加速又不损失甚至改善精度。
投机解码 × 自投机解码: 投机解码一般指用小草稿模型先产生多个未来词元再由大目标模型 1 次验证,分工是草稿模型与目标模型分离;自投机解码指复用目标系统自身部件做草稿,分工是省去训练额外草稿模型;搭配到本文的理由是 CTC 头本来就附在冻结编码器上,天然可作草稿,组合后新增的作用是不改模型权重即可获得加速与系统组合纠错。
本解读的输入是论文正文与官方原图像素,目标是让研究生能复述 3 步流程、阈值含义、实验条件与代价。必须保留的信息包括模型规模、阈值设置、词错率与逆实时因子的定义方向、接受率含义以及未公开资源的真实状态。输出按学习依赖展开,先讲任务与相关路线,再走完一个样本的全流程,然后讲训练构造、实验条件、结果与反证,最后讲复现。凡教学举例会明确标注,不虚构数值。
同样想加速,别人用了哪些路线?
论文把相关工作放在 3 条线上。第一条是文本大模型的投机解码,用小草稿自回归模型 1 次产生多个未来词元,再由目标模型 1 次前向验证,失败则从分歧处回退;自投机变体则复用目标模型自身,例如多头同时预测未来位置或用中间层早退做草稿。第二条是语音编码器解码器的加速尝试,文中点名有用小 transducer 解码器配冻结编码器做草稿的工作,侧重缓解重复错误。第 3 条是两遍式语音识别,先用 RNN-T 等快模型出一遍候选再重打分或精修,以及 CTC 与注意力联合打分。
本文与第二条最接近但有三点不同,原文明确报告:一是直接复用 SLM 的 CTC 编码器而非另训解码器做草稿;二是目标不仅是缓解重复,而是利用 CTC 与 SLM 互补错误模式改善词错率;三是用 CTC 帧分布熵做置信度量,对高置信假设可跳过 SLM 验证。理解这组对照很重要:同输入同目标同运行阶段下,是否需要额外草稿模型、是否只求速度不求精度、是否具备跳过验证的门控,是区分各方法的关键,而不是简单比较词错率数字大小。
要测什么:在什么条件下算又快又准?
论文研究的问题可以表述为:在编码器已用 CTC 训练并在适配器训练与大模型低秩微调阶段保持冻结的 SLM 上,能否用 CTC 假设做自投机草稿,在不重训 SLM、不引入独立草稿模型的前提下,同时提升解码吞吐并降低词错率。测什么很明确:一是识别精度,用词错率衡量,越低越好;二是吞吐,用逆实时因子衡量,定义为音频时长除以处理时间,越高越好。与谁比:完整自回归解码是精度与速度的基准,纯 CTC 贪心是速度上限但精度较差的参照。
条件是否一致是复述时必须强调的:所有逆实时因子都在单张 H100 上用 bfloat16 批量解码测得,按音频长度排序并用最大词元数控制自适应分批,验证阶段与回退阶段分开分批,失败样本的声学嵌入在阶段间做中央处理器卸载,还合并了低秩参数、为 granite 模型单独实例化以启用闪注意力、只在 CTC 验证位置计算对数几率。这些优化同时作用于基线与新方法,比较才公平。阈值是操作点控制器,后文会看到 CTC 熵阈值影响远大于 LLM 阈值。
三步流程如何走完一个样本?
先沿一个样本走完输入到输出。输入语音经 Conformer 编码器得到帧级声学向量序列,CTC 头在每帧给出包含空符号的分布,取每帧最大即得贪心对齐路径,去重去空即得 CTC 草稿文本。与此同时,适配器把编码器向量压缩成声学嵌入,与文本提示拼接后送入大模型。第一步看 CTC 每帧分布的熵,若所有帧熵都低于阈值,直接接受 CTC 假设为最终结果,不再调用大模型。
第二步若未被第一步接受,则把 CTC 假设送入大模型做 1 次前向,利用因果掩码并行算出每个草稿词元在给定前缀与声学嵌入下的似然,若全部高于阈值则接受。第 3 步若第二步失败,找到第一个似然不达标位置,保留其之前的最长已验证前缀,从该处恢复自回归生成。
CTC 前缀 × 自回归回退: CTC 前缀指校验通过的最长连续正确草稿段,分工是保留已验证的声学忠实部分;自回归回退指从第一个似然低于阈值的位置起重新逐词元生成,分工是修复幻觉或不流畅后缀;搭配原因是整句丢弃会浪费已算出的可信前缀,组合后只需为不可信后缀支付自回归代价。
声学嵌入适配器 × 文本大模型: 声学嵌入适配器负责把 Conformer 编码器输出的长帧序列下采样并投影到大模型可理解的向量空间,分工是解决时长与空间错位;文本大模型负责在给定声学嵌入与文本提示下计算词元条件概率,分工是做校验与补生成;搭配原因是没有适配器大模型读不懂语音,没有大模型适配器输出无语言约束,组合后语音才能作为条件上下文参与自回归建模。
论文用公式分别定义了 CTC 对输出序列的对齐求和、贪心路径、熵门控条件、SLM 条件分布、似然校验条件以及回退生成目标,最终输出要么是直接接受的草稿,要么是已验证前缀拼接回退生成后缀。实现上验证是整句级的,若失败则整句需从失败点自回归解码,作者指出这限制了低接受率语料上的收益,并用宽松接受准则缓解:不要求与 SLM 独立解码完全一致,只要求 CTC 假设在大模型分布下足够合理。
第一步:CTC 解码与熵门控算什么?
这一节只讲第一步的计算。CTC 把输出序列概率写成所有与其兼容的对齐路径概率之和,每条对齐路径概率是各帧后验的乘积。贪心做法是每帧独立取概率最大的符号,得到对齐后再映射去重去空。对研究生而言,关键是理解帧独立假设带来了并行性,但也丢掉了词元间显式依赖,所以需要后两步的语言模型把关。
熵门控的直觉是:若某帧分布很尖锐,说明编码器很确定;若所有帧都很确定,则整句大概率可信。论文用帧级熵小于阈值作为放行条件,阈值记为 CTC 阈值。阈值越小越严格,越多样本被送往大模型验证,速度越慢但精度越有保障;阈值越大越多样本直接接受,速度越快但风险越高。后文热力图显示该阈值是主要操作旋钮。
CTC 贪心解码 × 自回归解码: CTC 贪心解码负责在每个声学帧上独立取最大后验并去重去空,1 次性给出全文草稿,分工是快而贴近声学;自回归解码负责按已生成前缀逐个用语言模型预测下一个词元,分工是慢而兼顾语言连贯;二者搭配的理由是前者提供可并行验证的完整候选,后者只在校验失败的后缀上补算,组合后新增的作用是把大量高置信语音直接短路,把语言模型算力集中到真正存疑的位置。
第二步与第三步:一次验证与前缀回退如何衔接?
第二步的输入是声学嵌入序列与 CTC 草稿词元序列,大模型在 1 次前向中并行给出每个位置的条件似然。论文解释用熵管第一步、用似然管第二步的原因是第二步需要针对具体假设做验证,而熵只反映分布不确定性不针对假设文本。阈值记为 LLM 阈值,所有位置似然都高于阈值才算通过。若通过,输出即为 CTC 假设,此时精度可能优于纯自回归,因为 CTC 更贴声学,可抑制语言模型偏置导致的流畅但不忠实错误。
若不通过,设失败位置为首个似然低于阈值的下标,保留其之前前缀,从该处开始自回归生成剩余后缀。最终输出是接受的草稿或前缀加生成后缀的拼接。作者提到理论上可用动态规划局部重连 CTC 草稿,但发现对批量推理不高效,因此采用整句验证失败后从失败点重解码的简单策略。
帧级熵门控 × LLM 似然校验: 帧级熵门控负责看 CTC 每帧输出分布的不确定性,若所有帧熵都低于阈值则直接接受,分工是零 LLM 开销的快速放行;LLM 似然校验负责把 CTC 草稿连同声学嵌入送入大模型 1 次前向,逐词元计算条件似然,分工是用语言与声学联合分布做 plausibility 检查;搭配原因是熵只看声学自信不看文本合理性,似然只看文本在语音条件下的合理性,组合后形成先便宜后昂贵的 2 级过滤。
模型是怎么构造和训练的?哪些参数动了?
论文选用 Granite Speech 作为 SLM,因为它满足编码器用 CTC 训练且在后续阶段冻结的约束,并在公开榜单上表现好。实验主体是新训练的 1B 参数 granite-4.0-nano 上的 SLM,编码器 440M 参数,另报告 2B 与 8B 版本作对比。训练数据约 90,000 小时,覆盖英语、法语、德语、西班牙语、葡萄牙语和日语的公开语音识别语料,并加入 CommonVoice 双向合成翻译数据以支持翻译任务,但本文只评估识别。
编码器是 16 层 Conformer,隐维 1024,4 秒块自注意力并以前馈中间预测为条件,输出层 348 维,含 256 个 ASCII 字符与 92 个片假名字符,用字符级 CTC 在所列识别语料上训练 20 轮,批量 256,混合均衡与自然采样。适配器是两层 37M 参数查询变换器,每 15 帧用 3 个可训练查询做 5 倍下采样,叠加编码器 2 倍下采样,10 毫秒 80 维对数梅尔特征总体被压缩 10 倍。适配器与大模型线性模块的 64 秩低秩适配器联合训练 3 轮约 900,000 步,峰值学习率 1e-4,批量 128 句,均衡采样。编码器在此阶段冻结,这是方法可用的前提,未报告联合针对投机优化编码器的结果,列为未来工作。
实验在哪些数据与阈值下运行?
评估覆盖 9 个语料 5 种语言,包括公开语音识别基准的英语测试集以及多语言 LibriSpeech 与 CommonVoice 17.0 等多语集,部分如 GigaSpeech、SPGI 与 TED-LIUM 未参与训练,可检验泛化。指标是词错率与单卡逆实时因子,统计显著性用双比例 z 检验标注。阈值方面,高精度档取 CTC 阈值 0.7、LLM 阈值 0.2,高吞吐档取 CTC 阈值 3.0、LLM 阈值 0.1,其余实验固定 LLM 阈值 0.1 只扫 CTC 阈值。
下图是理解阈值作用的关键,它展示 Earnings-22 上 CTC 熵阈值与 LLM 置信阈值对两指标的影响,左图越绿越好,右图越绿越高。导读时应先看横轴变化带来的颜色跃迁,再看纵轴变化是否带来同样跃迁,从而判断哪个旋钮更敏感。
看图路径: 1. 先看横轴 CTC 熵阈值从 0.70 到 1.5 增大时左右两图颜色如何变化;2. 再看纵轴 LLM 置信阈值在 0.01 到 0.50 之间变化时数值是否明显移动;3. 对比左图词错率与右图逆实时因子随阈值变化的敏感度差异;4. 找到高精度与高吞吐两个工作点在热力图中的大致位置
论文图 1。原论文 Figure 3:“Influence of acceptance thresholds τCT C and τSLM on word error rate and inverse real-time factor for Earnings-22.”。
从像素可见,左图词错率随 CTC 熵阈值增大而明显变红,特别是在 1.0 到 1.2 之间出现跳变,而沿纵轴改变 LLM 阈值时同列颜色变化很小;右图逆实时因子随 CTC 阈值增大而明显变绿,同样在右侧两列大幅升高,而纵轴变化带来的差异远小于横轴。这支持论文结论即 CTC 阈值主导操作点,LLM 阈值影响较弱。因此后文固定 LLM 阈值只调 CTC 阈值是合理的复现起点,高精度与高吞吐两档分别位于热力图左下与右上区域。
主结果:高精度档真的又准又不慢吗?
比较的问题是:在高精度阈值下,自投机解码相对完整自回归能否降低词错率且不损失吞吐;在高吞吐阈值下,加速倍数与精度代价各是多少。公平条件是同模型同硬件同批量流程,指标方向为词错率越低越好、逆实时因子越高越好。下表整理英文公开基准平均与多语平均的关键数字,基线为完整自回归,本方法分高精度与高吞吐两档,并附 2 阶段接受率与纯 CTC 参照,数值保留原文写法。
| 条件 | 指标 | 完整自回归基线 | 高精度自投机解码 | 高吞吐自投机解码 |
|---|---|---|---|---|
| 方法整体声明 | 记录与加速代价 | 自回归搜索为参照 | 1B 大模型加 440M 编码器达 5.58% | 逆实时因子提升 4.4 倍且相对词错率上升 12% |
表后解释:高精度档在英语平均上把词错率从 5.75% 降到 5.58% 且差异在高显著水平,逆实时因子 548 与 564 基本持平,说明精度收益没有以吞吐为代价;接受率显示仅 14% 样本被熵门控直接放行,另有约 47% 经 LLM 验证通过,其余回退,这解释了为什么编码器与回退仍是耗时大头。高吞吐档把逆实时因子推到 2491,约为基线的 4.4 倍,代价是词错率升到 6.56%,相对上升约 12%。未胜出项同样重要:在 CommonVoice 英语上高精度档词错率 6.56% 略高于基线 6.52%,说明总体趋势不等于每组都赢。
下图拆解高精度档各语料耗时构成,导读时先看总量再看分段,有助于定位优化方向。
看图路径: 1. 先沿各语料堆叠柱从下往上区分编码器蓝色段与红色自回归回退段占比;2. 再比较 Earnings-22 与 Tedlium 等小数据柱的绝对高度差异;3. 观察右侧 GigaSpeech 与 SPGISpeech 大柱中黄色与橙色验证段的相对厚度
论文图 2。原论文 Figure 2:“Run times and breakdown for the different passes in the high accuracy SSD regime for granite-speech-4.0-1b.”。
从像素可见,左侧小语料柱中红色自回归回退段占据大部分高度,蓝色编码器段次之,橙色与绿色验证段很薄;右侧大数据柱总量高得多,SPGISpeech 柱显著高于 GigaSpeech 柱,但分段比例类似,红色仍主导。这说明高精度档因 CTC 接受率低、验证通过后仍需回退的样本不少,瓶颈在编码器与回退两端,验证本身开销不大。这也呼应论文的局限:整句验证失败后需重解码,低接受率语料加速有限。
跨模型比较:1B 新模型与竞品处在什么位置?
比较的问题是:在公开英语测试集上,3 种 granite 语音模型经自投机解码形成的速度精度曲线如何,以及与外部领先模型的单点相比位置怎样。公平条件是作者用官方评测工具在同一单卡环境重跑竞品,横轴逆实时因子越高越好,纵轴词错率越低越好,左下为理想区。下图展示多条曲线与两个外部单点,导读时先分清曲线归属再看相对上下位置。
看图路径: 1. 先看图例区分深蓝 1B 与浅蓝 2B、紫色 8B 三条曲线的走向;2. 再定位橙色 canary 与红色 Qwen 单点在横轴吞吐上的位置;3. 比较相同吞吐下深蓝 1B 曲线是否始终位于浅蓝与紫色曲线下方
论文图 4。原论文 Figure 5:“WER and RTFx comparison between granite-speech and leading SLMs on the Open ASR test sets (all on 1 H100).”。
从像素可见,深蓝 1B 曲线整体位于最下方,浅蓝 2B 居中,紫色 8B 居上,说明在相同吞吐下 1B 新模型精度最好;3 条曲线都随吞吐增大而上扬,符合加速换精度的权衡。橙色 canary 单点位于深蓝曲线附近中段,红色 Qwen 单点位于左侧低吞吐区且词错率略高于同吞吐深蓝点。这支持论文的判断即新 1B 模型在该基准上兼具精度与效率,但也要注意这只是该硬件批量条件下的实测,未测量延迟、误判率与部署成本,不能直接推广到流式或单句低延迟场景。
两级验证缺一不可吗?阈值与多语细节说什么?
消融要回答 2 级验证是否都需要。论文对比 3 种策略:双验证、仅 LLM 验证、仅 CTC 验证,在公开基准上扫描阈值得到词错率随逆实时因子变化的帕累托线。下图左下为完整自回归起点,右上为纯 CTC 终点,中间曲线越靠左下越好。导读时先找到两端锚点,再沿中间比较三色线的相对位置。
看图路径: 1. 先确认横轴为逆实时因子、纵轴为词错率,右上为又快又差、左下为又慢又好;2. 再沿绿色双验证曲线从左下 Full AR 端走到右上 Full CTC 端;3. 比较中段红色单 CTC 验证与蓝色单 LLM 验证谁更偏上偏离绿色线
论文图 3。原论文 Figure 4:“Ablation study of verification passes: green = CTC followed by LLM; blue = LLM verification; red = CTC verifi- cation. Results are reported on the ESB/Open ASR test sets.”。
从像素可见,绿色双验证与蓝色单 LLM 验证在左下高精度区几乎重合,都能达到最低词错率,而红色单 CTC 验证在该区明显偏上,最低只能到约 5.75% 而非 5.58%;进入中高吞吐区后蓝色线快速上扬,红色与绿色线更平缓,绿色在大部分区间占优或持平。这说明 LLM 验证是达到最低词错率的关键,CTC 门控则在高吞吐端节省验证开销,双级组合取得最好前沿。
多语与阈值细节进一步限定结论。下表整理多语平均与阈值设置的原文证据,指标方向同前,数值保留原文写法。
| 条件 | 指标 | 完整自回归 | 高精度自投机 | 高吞吐参照 |
|---|---|---|---|---|
| 多语言 LibriSpeech 平均 | 词错率与逆实时因子 | 5.47 与 629 | 5.33 与 699 | 5.73 与 2753 |
| CommonVoice 多语平均 | 词错率与逆实时因子 | 5.06 与 824 | 5.03 与 916 | 7.11 与 2393 |
| 阈值设置 | 高精度与高吞吐 | 自回归无阈值 | CTC 0.7 LLM 0.2 | CTC 3.0 LLM 0.1 |
表后解释:多语上高精度档同样降词错率且提升吞吐,LibriSpeech 平均从 5.47% 到 5.33%,CommonVoice 从 5.06% 到 5.03%,后者提升小且部分子集如前述英语略退,说明收益幅度与语料相关。阈值证据表明 CTC 阈值是主旋钮,固定 LLM 阈值只扫 CTC 阈值即可覆盖操作区间。论文还用实例说明 LLM 验证的 CTC 假设有时比完整自回归更忠实声学,例如把流畅但错误的改写纠回贴近参考的重复与用词,作者将其归因于互补错误与语言模型偏置的缓解,这属于有限解释而非因果证明,待更多误判分析验证。
哪些条件会让方法失效或不可用?
论文明确列出三点局限。第一,要求 SLM 的编码器用 CTC 训练且在适配器与低秩微调阶段冻结,否则没有现成 CTC 头可做草稿,这是适用前提,不满足则方法不可用。第二,只适用于语音识别,不适用于翻译或口语问答等其他语音任务,因为草稿与验证都围绕转写文本的逐词元似然设计。第三,验证是整句级的,失败后需从失败点整句重解码,低接受率语料加速有限,宽松似然准则只能缓解不能根除。
还有两点复现时易误解。资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,只能说论文正文写了在宽松许可下公开,具体链接本次未能确认可达,需读者自行核对。另一点是统计与聚合:平均词错率是多测试集平均,显著性只在英语平均与多语言 LibriSpeech 平均标注了高显著与显著,不能把平均改善理解为每个子集都显著,也不能把自动词错率当作人工可懂度评价。
要复现,先做什么、记什么?
复现先做三件事。第一,准备满足冻结 CTC 编码器约束的 SLM 与对应适配器,若用自训 1B 模型,需按原文记下编码器层数隐维、查询变换器下采样倍数、低秩秩数与训练步数学习率批量,不要从模型名猜实现。第二,实现 3 步解码:贪心 CTC 加全帧熵门控、单次前向的逐词元似然校验加最长前缀保留、失败后缀自回归补生成,并实现验证与回退分开分批与嵌入卸载,否则吞吐不可比。第三,固定 LLM 阈值 0.1 扫描 CTC 阈值 0.7 到 3.0,另设高精度 0.7 加 0.2 的对照点,在单卡批量条件下同时记录词错率、逆实时因子与 2 阶段接受率。
还需补的验证包括:报告每语料接受率与回退比例以解释加速差异;补测单句延迟与不同批量下的吞吐曲线,避免把批量吞吐当成实时延迟;对精度改善做错误类型分析,区分声学忠实性提升与偶然系统组合,不能仅凭个别例子断言因果。若资源链接不可达,应明确记录本次未能确认可达,不虚构下载地址。
何时值得尝试?一句话收束
当已有冻结 CTC 编码器的语音大模型、任务是离线批量转写、希望不重训不加草稿模型就获得更快或更准解码时,该方法值得尝试:先用低 CTC 阈值追求精度红利,再放宽阈值换吞吐,始终监控接受率与回退开销。若任务是流式对话、翻译问答或编码器非 CTC 训练,则不在适用范围。
收束:用自身 CTC 头做草稿、熵门控跳过验证、似然校验保留前缀加回退,是本文同时改善精度与速度的关键;最强证据是英语平均 5.58% 与 4.4 倍加速的两档操作点,主要代价与边界是高速档约 12% 相对词错率上升、低接受率语料加速受限以及整句验证的重解码开销。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



