英文题目:Beyond Transcripts: A Renewed Perspective on Audio Chaptering
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.396
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#评测协议 #多模态模型 #长音频处理 #语音 #音频理解
评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Fabian Retkowski:机构信息未能从会议 PDF 纯文本可靠映射
- Maike Züfle:机构信息未能从会议 PDF 纯文本可靠映射
- Thai Binh Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Niehues:机构信息未能从会议 PDF 纯文本可靠映射
- Alexander Waibel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频章节划分(Audio Chaptering)需将长播客、讲座与视频切分为语义连贯区间并输出连续时间边界,难点在于自动语音识别(Automatic Speech Recognition,ASR)转写错误改变句子粒度、连续时间戳被强制吸附到句子边界造成有损离散化。工作并行验证三类范式:文本基线MiniSeg先用MiniLM编码句子再由RoFormer做序列标注并可拼接停顿、语速、基频、响度与说话人分离标注(Diarization)等手工特征;音频模型AudioSeg先用冻结编码器抽帧再经局部切分Transformer聚合为6s段嵌入最后由文档编码器预测边界;多模态大模型(Multimodal Large Language Model,MLLM)以Qwen2.5-Omni与Qwen3-Omni尝试转写加分章加标题的端到端提示。与纯文本范式相比,关键差异是把建模与评测搬到与转写无关的离散时间网格T1与连续时间T2,避免不同转写粒度虚增分数。在YTSeg全量测试集T1协议6s块下AudioSeg(Whisper Large)达到F1 45.52,显著高于文本加全特征最优的40.30,而Qwen3-Omni上下文示例(In-Context Learning,ICL)仅在30分钟内短音频可达41.30。结论限于英语YouTube主导分布与小规模AMI会议验证,长视频与多说话人下性能骤降且未用视觉线索。原文未披露训练推理部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/xinjli/alqalign — 链接可访问(HTTP 200)
- 第三方资源:https://segeval.readthedocs.io/ → https://segeval.readthedocs.io/en/latest/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么要做章节切分?
这篇论文研究的输入是长音频与其对应的章节结构,典型例子是播客、讲座和优管视频,输出是在时间轴上的一组章节边界,必要时还附带每个章节的标题。目标读者可以这样理解任务:听众很少从头听到尾,而是拖动进度条、跳到相关时刻再返回重听,章节标记就是支撑这种非线性浏览的界面。论文要保留的关键信息是章节天然定义在连续时间上,而传统做法把它当成纯文本切分来做,依赖一份转写文本的句子划分。
作者的输出是一套可复述的方法与评估:3 种建模路线在统一时间网格上的对比,影响因素分析,以及一套与转写无关的评估协议,并发布评估工具包 chunkseg 与纯音频模型 AudioSeg。本文默认从原文独立写作,只依据论文正文证据展开,不引入外部评价。接下来的顺序是先讲任务与既有路线,再讲方法全景与组件计算,然后讲训练与推理、实验条件、结果与反证,最后讲复现与收束。
此前研究把音频章节切分做成了什么,留下了哪些缺口?
此前主流把音频章节切分当作文本切分来做,模型读转写文本,评估也沿用文本切分的句子级指标。论文指出这种处理留下 3 个未解决的问题。第一,音频的作用不清楚,手工声学特征与学习到的语音表示是否真能提升切分,缺乏系统对比。第二,转写质量会改变题面,自动语音识别的错误与句子切分差异会改变句子数量与边界位置,基于不同转写的文本指标不可直接比较,有时分数变高只是因为转写更粗而不是切分更好。
第三,时间戳向句子边界对齐是有损的,会把边界推离真实时刻,并把句子切分产物的偏差带入评估。相关工作方面,早期工作用词汇加手工音频特征做段落切分,近期有工作只用停顿作为声学信息,视频章节工作则更关注视觉线索,对音频本身关注不足。论文因此把研究目标定为方法论基础:给出可比的建模对照、影响因素的实证分析,以及与转写无关的时间评估。
为什么同一组时间边界在不同转写上会算出不可比的分数?
可以沿一个样本走一遍。假设一段 20 分钟的访谈,金标准是第 5 分 10 秒、第 11 分 02 秒两个章节切换点。若用参考转写,它有 200 个句子,切换点被投影到最近的句子边界;若用小型识别模型转写,它可能只有 180 个句子且断句位置不同,同样的两个时刻会被投影到另一套句子序号上。文本指标比较的是句子序号上的二值序列,句子总数与切分粒度变了,指标的分母与容忍结构都变了。
论文把这类做法形式化为文本空间协议:在参考转写上评估记为 R1,在识别转写上评估记为 H1,把识别预测映射回参考转写再评估记为 H2 与 H3,其中 H2 用词级对齐,H3 用最大时间重叠。时间空间协议则另起一条路:T1 把音频时长按固定步长离散成时间块,例如 6 秒一块,把金标准与预测都落到块上再算 F1、B 与 Pk;T2 直接在连续时间上用容忍窗算边界 F1。T1 的关键性质是文本切分指标只要求二值序列,把句子换成时间块后可原样使用,且一旦映射到时间块,转写不再进入指标,因此跨模型可比。
文本空间评估 × 时间空间评估: 文本空间评估分工是把连续时间戳投影到句子边界上再算切分指标,依赖某一份转写文本的句子划分;时间空间评估分工是把金标准与预测都映射到固定时长的时间块或连续时间戳上再算指标,不依赖任何转写;二者搭配的原因是前者沿用文本切分传统但换一份 ASR 就会改变题面难度,后者提供跨文本、跨音频、跨多模态模型的公共标尺,组合意义是先用前者诊断转写的影响,再用后者做公平排名。
初学者容易误以为参考转写更准就一定更适合评估,论文的提醒是参考转写评估假设了转写可用且句子划分固定,而部署时只有识别转写,所以公平比较必须走到时间轴上。
三种路线各自解决什么,全景如何对应到时间轴?
论文比较 3 条路线。第一条是基于文本的 MiniSeg,可选地拼接手工音频特征,输入是句子序列,输出是句子间是否切分。第二条是纯音频的 AudioSeg,不读转写,直接对音频帧建模,输出是时间块上的边界序列。第 3 条是多模态大模型,用提示让模型同时做转写、切分与标题生成,或只预测时间戳与标题。
统一比较的落点都是时间:文本模型的句子级预测经强制对齐或识别器时间戳换算到时间网格,AudioSeg 天然在时间网格上,多模态模型的转写输出同样经强制对齐换算到时间,只有显式预测时间戳的变体才直接用预测时间。为了让读者先建立整体计算图,下面先看 AudioSeg 的 3 段式结构,再进入组件细节。以下导读针对官方原图,阅读时请按输入到输出的主路径观察,不要把装饰性图标当作计算模块。
看图路径: 1. 从左侧输入音频与分块箭头开始,依次经过帧编码、分组到窗口、片段编码再到文档编码器;2. 观察 30 秒块与 6 秒窗口两级时间尺度在何处衔接;3. 确认最右侧输出是与片段数对齐的二值边界序列;4. 区分冻结的音频编码器与可训练的局部变换器和文档编码器的位置
论文图 1。原论文 Figure 1:“AudioSeg processes input audio of duration D through three stages: Frame Encoding extracts frame-level features from 30s chunks using a frozen audio encoder ; Segment Encoding…”。
该图显示输入音频先按 30 秒分块做帧编码,得到连续帧序列,再按 6 秒窗口分组做片段编码,每个窗口经局部变换器得到一个片段表示,最后由文档编码器建模长程依赖并输出二值边界序列。图中冻结标记对应音频编码器不更新,可训练标记对应局部与文档编码器。这个全景的意义是把长音频的计算拆成可分块的局部编码与全序列的全局决策,既控制显存又保留章节所需的长上下文。
文本基线如何加入声音,纯音频模型内部如何计算?
文本基线 MiniSeg 是 2 级层次变换器。第一级句子编码器基于 MiniLM 把每个句子变成定长向量,第二级 RoFormer 文档编码器对句子序列做序列标注,用加权二元交叉熵应对边界稀疏。当加入手工特征时,每个句子对应一个特征向量,涵盖停顿、语速、基频、响度与说话人 7 类派生特征,提取细节在附录中按句子起止时间计算,例如停顿是下一句开始减上一句结束,负值截断为零,语速用空白切词后的词数除以句长并做视频内标准化。融合方式是拼接后线性投影回原维度,再送入文档编码器。
\[Sref = (s1, . . . , sN).\]上式定义参考转写为句子序列,是文本路线的基本单位,也是 R1 与 H2 和 H3 最终要回归的公共坐标。
\[hi = Linear([ei || fi]),\]上式是融合公式,其中句子嵌入与特征向量拼接后经线性层得到送入文档编码器的表示,论文只报告这种拼接融合,不涉及门控或交叉注意力。
句子嵌入 × 停顿特征: 句子嵌入分工是编码语义内容,判断话题是否延续;停顿特征分工是编码上一句结束到下一句开始的时间间隔,捕捉说话人换气、段落停留或后期剪辑留白;搭配理由是语义相似但出现长停顿时往往对应章节切换,组合时把二者拼接后再线性投影回文档编码器维度,让模型同时看到说什么和在哪里停。
纯音频 AudioSeg 分 3 段。帧编码用冻结的预训练音频编码器按 30 秒块独立提取帧再拼接成全长序列,以处理长音频。片段编码把帧按不重叠的 6 秒窗口划分,每个窗口投影到隐维度并前置可学习的片段标记,加上位置嵌入后过局部变换器,取该标记作为片段嵌入,片段总数为时长除以步长向上取整。文档编码用 RoFormer 对片段序列建模,再经线性层输出每个片段的边界概率。
帧编码 × 片段编码: 帧编码分工是用冻结的音频编码器把 30 秒音频块转成稠密帧序列,保留声学与隐含语言结构;片段编码分工是把帧按 6 秒窗口分组并用局部变换器聚合成一个片段向量,承担降采样与局部上下文建模;搭配原因是长音频无法逐帧做全局建模,组合意义是先局部压缩再全局判断边界,得到与 6 秒评估网格对齐的输入。
初学者可举一个教学例子帮助理解,不代表论文数据:若一段 12 秒音频按 6 秒划分得到两个片段,模型输出为第二个片段是边界,则对应第 6 秒附近存在章节切换,实际训练时金标准时间戳落入哪个片段就把该片段标为 1。
监督信号从哪里来,哪些参数更新,推理如何得到时间戳?
MiniSeg 的监督来自投影到句子上的边界序列,损失是加权二元交叉熵,类别权重在附录超参数中记为边界类加权。论文训练了在参考转写、小型识别转写、大型识别转写及其组合上的多个变体,用于检验对转写质量的鲁棒性。AudioSeg 的监督来自连续时间戳离散化到片段网格:包含金标准时间戳的片段标为 1,其余为 0,损失同样是二元交叉熵。音频编码器冻结,局部片段变换器与文档编码器参与训练,附录给出 AudioSeg 默认用 Whisper Large 变体、片段 6 秒、训练 5 轮等配置。
多模态大模型部分以提示与轻量微调为主,包括零样本、上下文示例、分块续写、自级联与 LoRA 微调,默认推理参数沿用模型默认,LoRA 只在 Qwen2.5-Omni 上做了 3 轮训练。推理时文本与多模态路线的句子边界经强制对齐换算成时间,AudioSeg 的片段边界直接换算成时间戳,因此 T1 与 T2 都能计算。
\[Tgold = {t1, . . . , tK} and ˆTpred = {ˆt1, . . . , ˆtL}.\]上式定义连续时间评估中的参考边界集合与预测边界集合,T2 在此基础上用固定容忍窗判定命中,而不是用文本切分的 Pk 指标。
强制对齐 × 章节投影: 强制对齐分工是给出每个句子或转写词在音频时间轴上的起止时间;章节投影分工是把连续的金标准时间戳映射到最近的句子边界或时间块上,生成离散监督标签;搭配原因是文本模型输出的是句子级决策而评估有时要落到时间上,组合意义是让文本预测能换算成时间区间参与统一比较,但投影本身是有损离散化。
需要指出的缺项是论文未报告逐模块梯度路径的消融,也未给出 AudioSeg 在不同冻结策略下的完整对照,复现时应按冻结音频编码器、训练后 2 级编码器的原文安排执行,不要自行解冻底层编码器。
数据、转写、指标与对比条件如何设置才可比?
主数据集是 YTSeg,包含 19299 个英文优管视频及其转写与章节,论文为每个样本增补 3 类标注并已公开:时长区间、说话人区间与两版识别转写。时长分为短、中、长、超长四档,超长占比仅约百分之几而短视频占比近 40%;说话人按说话人数与主导说话人占比分为单说话人、弱单说话人与多说话人。转写用 Whisper Tiny 与 Whisper Large 生成,大模型词错率更低,但小型模型句子更粗、句子数更少,这个粒度差异正是评估不可比的来源。跨域验证用 AMI 会议语料,其切分风格与优管章节差异大。
模型方面文本基线含 MiniSeg 各训练变体与 LLaMA 和 WtP 零样本对照,纯音频含 6 种音频编码器的 AudioSeg 变体,多模态含 Qwen2.5-Omni 与 Qwen3-Omni 的多种提示策略。主评估用 T1 离散时间协议,块长 6 秒,对应 YTSeg 平均句长,指标为时间网格上的 F1、B 与 Pk,其中 F1 与 B 越高越好,Pk 越低越好。文本与多模态预测经强制对齐得到句子开始时间再落到网格,AudioSeg 直接在 6 秒窗口上预测。
自级联 × 上下文学习: 自级联分工是把多模态任务拆成先转写再只看文本切分,或先转写再同时看音频与文本切分,用以分离语言能力与听觉增益;上下文学习分工是在提示中给出带章节标记的转写示例,约束输出格式与章节粒度;搭配原因是直接端到端提示容易丢转写或循环生成,组合意义是先稳定格式再度量音频是否带来额外提升。
多模态因上下文长度只在 30 分钟以下视频上报告主结果,分块策略每 30 秒续写 1 次并附带上文,标题质量另用时间匹配与全局拼接两套协议分别度量结构正确部分的标题与全文标题集合。
谁在统一时间网格上领先,领先多少,代价是什么?
本节要回答的核心比较问题是当所有预测都被换算到 6 秒时间网格上,文本、纯音频与多模态谁的边界更准,比较条件是同一 YTSeg 测试集与同一 T1 指标方向,纯音频不占转写便宜,文本与多模态都要经过对齐换算。下表选择原文多模态对照表的可行行列,用于说明提示策略与自级联中音频增益的量级,阅读时注意该表仅覆盖 30 分钟以下视频且 F1 越高越好。
| Strategy1 | F1 (↑) | B (↑) Pk |
|---|---|---|
| Default | 3.43 | 2.34 |
| ICL | 18.86 | 12.93 |
| Self-casc. T+A | 17.96 | 12.52 |
| LoRA | 24.67 | 17.44 |
| ICL | 41.30 | 35.22 |
| Self-casc. T | 21.98 | 18.25 |
| Self-casc. T+A | 36.14 | 30.51 |
表中默认提示几乎失效而上下文示例带来大幅提升,自级联中同时看音频与文本明显好于只看文本,这支持音频提供互补信号的判断,但也显示多模态高度依赖提示与指令跟随。为回答主结果中的可部署策略与基线对比,下表用原文连续原句整理文本基线、手工特征与纯音频编码器的关键数字,条件为全量 YTSeg 上的 T1 评估,F1 越高越好。
| 条件 | 指标 | 文本基线 | 加全部手工特征 | 纯音频最强编码器 |
|---|---|---|---|---|
| 全量 YTSeg,T1 时间网格 | F1 越高越好 | 37.76 左右 | 40.30 | 45.52 |
| 参考转写训练测参考 | F1 越高越好 | 40.01 | 未报告 | 不依赖转写 |
| 跨转写鲁棒性 | F1 越高越好 | 37.76 与 36.38 | 未单独报告 | 不依赖转写 |
表后需要解释主要收益与具体代价。纯音频 Whisper Large 的 45.52 显著高于文本最强组合的 40.30 左右,报告显示手工特征中停顿带来约 2.87 的提升而音高与语速无提升,全部特征合在一起并未远超单用停顿。代价有三:其一,纯音频依赖的 Whisper 编码器本身在类似优管数据上训练过,可能包含领域匹配红利。
其二,文本联合训练在参考与识别转写上能提升鲁棒性,但小型识别转写训练的模型反而略好于大模型转写训练的模型,说明词错率低不直接等于切分好;其三,多模态在短音频上可用但长音频受上下文限制,分块续写会陷入生成循环。以下导读针对时长效应图,横轴为分钟,纵轴为 F1,曲线经平滑处理。
看图路径: 1. 先确认横轴是分钟为单位的时长,纵轴是时间网格上的 F1 分数;2. 比较 AudioSeg 曲线在 10 分钟附近的峰值与 30 分钟后的快速下降;3. 观察长尾处文本加特征模型与 AudioSeg 的相对位置变化
论文图 2。原论文 Figure 2:“Relation between duration and segmentation performance across models. Smoothed using LOESS.”。
该图显示 AudioSeg 在 10 分钟附近达到峰值并在 30 分钟前明显领先,超过 20 至 30 分钟后所有模型快速下降,到 60 分钟以上文本加特征反超 AudioSeg。原文用数据分布解释这种收敛:超长视频训练占比低且边界密度从每分钟 1.178 降到 0.170,同时说话人更复杂,因此长尾结论受样本稀疏限制,不应推广为文本路线在长音频上普遍更优。
停顿、说话人与非语音线索各自贡献什么,反例在哪里?
本节要回答的比较问题是手工特征与编码器选择中谁真正起作用,公平条件是固定 MiniSeg 训练在小型识别转写上或固定 AudioSeg 结构只换音频编码器,指标方向仍是 F1 越高越好。下表整理说话人、时长与时间戳定位的特有细节,均为原文直接报告的数字,阅读时注意区分可部署的切分收益与仅用于诊断的时间戳误差。
| 条件 | 指标 | 基线或对照 | 本方法或现象 | 比较对象 |
|---|---|---|---|---|
| 多说话人视频 | F1 越高越好 | 26.10 | 29.05 | 加说话人特征 |
| 超长视频 | F1 越高越好 | 13.28 | 15.17 | 文本加特征对比纯音频 |
| 训练分布 | 占比与密度 | 6.3% 超长 | 38.4% 短视频 | 边界密度 0.170 对比 1.178 每分钟 |
表后解释收益与反例。说话人特征总体只带来约 0.67 的提升,但在多说话人子集提升约 2.95 而单说话人无影响,说明总体平均掩盖了 targeted 增益。
非语音线索方面,用 DeepFilterNet 滤除音乐与音效后 AudioSeg 下降约 2.21,支持章节切换附近的音乐与音效是纯音频优势来源之一,但这只是有限解释而非因果证明。未胜出项包括音高与语速无提升,适配多模态流水线的 AF3 与 Qwen3 音频编码器反而弱于原始 Whisper,论文推测这类编码器为上游大模型消费而优化,不适合轻量切分头。多模态时间戳是明确失败条件:不生成转写时几乎失效,生成转写但用预测时间戳评估仍很低,换成强制对齐时间后分数反超,说明瓶颈是时间定位而非话题判断。
以下导读针对说话人占比图,横轴从左到右主导占比下降即多人程度上升。
看图路径: 1. 先确认横轴是主导说话人占比,从左 1.0 向右递减到 0.4;2. 比较单说话人端各模型的分层与多说话人端的收敛趋势;3. 重点观察 AudioSeg 在全程是否保持在最上方
论文图 3。原论文 Figure 3:“Relation between dominant speaker proportion and segmentation performance across models, for videos <30 minutes. Smoothed using LOESS.”。
该图显示越往右多说话人方向所有模型都下降,但 AudioSeg 全程保持在最上方,文本加全部特征次之,加说话人特征在右端相对基线拉开差距,而 Qwen2.5 微调版本全程偏低。像素可辨的趋势支持多说话人更难切分,但右端样本量与置信带变化大,不宜读出精确数值,原文分表中的单人与多人 F1 落差与此一致。
评估协议本身有多大损耗,结论边界在哪里?
论文用 Oracle 切分量化了文本协议的固有损耗:即使每次都选离真值最近的句子边界,文本协议也只能达到约 73% 至 81% 的 F1,剩余损失来自连续时间向离散句子的投影。协议对比还显示同一组时间预测在更粗的识别转写上会得到虚高的文本分数,因此跨转写比较文本分数不可靠,而 T1 在排序上与文本协议基本一致,支持用它做跨范式排名。
粒度敏感性方面,更粗的时间块会让 F1 普遍升高,AudioSeg 在 8 秒与 10 秒非对齐重分箱时出现非单调波动,原文明确这是重离散化伪影而非真实性能变化,连续时间的 T2 容忍窗结果趋势一致。结论边界包括主要依赖单一英文大集 YTSeg,仅在小规模 AMI 上验证跨域;未微调更大的 Qwen3-Omni;只用文本与音频而未用视觉线索如场景切换与幻灯片。风险方面主要是章节错误导致导航不便,可修正且无安全关键影响。
资源可用性以正文声明为准,评估包与模型已声明公开,YTSeg 增补标注已合入数据集仓库,第三方对齐与评估库链接本次可达但不应视为论文证据本身。
要复现统一比较,先做什么,需要哪些信息条件?
复现的第一步是固定评估而不是固定转写。建议先实现 T1 的 6 秒网格:按音频时长向上取整得到块数,把金标准时间戳落到块上得到二值序列,对文本模型先用识别器时间戳或 CTC 强制对齐得到每句开始时间再落到网格,对 AudioSeg 直接用 6 秒窗口输出。指标用 segeval 库的默认参数算 F1、B 与 Pk 即可,原文明确块长选 6 秒是因为接近平均句长。数据方面需要 YTSeg 的参考转写、章节时间戳、两版 Whisper 转写,以及增补的时长与说话人标注;跨域可用 AMI 会议。
模型方面文本基线按 MiniLM 句子编码器加 RoFormer 文档编码器搭建,AudioSeg 按冻结音频编码器加局部片段变换器加 RoFormer 搭建,片段 6 秒、音频块 30 秒是可直接采用的起点。多模态复现要注意只在 30 分钟以下报告主结果,提示必须规定章节标记格式并给出示例,否则会出现缺标记、缺转写、空章节与生成循环 4 类失败。标题评估若要复现,需分别实现时间匹配与全局拼接,前者只在起止误差都在容忍窗内时比较标题文本,后者把标题按时间拼接后整体比较。
硬件方面原文只给出 LoRA 在 3 卡上的 30 小时训练说明,AudioSeg 与 MiniSeg 的完整算力未充分报告,复现时应先在短视频子集上验证流程再扩展到全量。
何时值得尝试纯音频,何时仍用文本加停顿?
综合全文,直接报告的是纯音频 AudioSeg 在统一时间网格上领先文本最强变体,停顿是手工特征中几乎唯一的显著增益,说话人特征只在多说话人子集有效,词错率低不直接带来切分提升,联合参考与识别转写训练提升鲁棒性。有限解释是 Whisper 编码器隐含语言结构与领域匹配可能放大了纯音频优势,非语音音乐音效是优势来源之一,多模态能判断话题但时间定位差因此必须生成转写再做强制对齐。
待验证的是长音频与会议域的泛化、更大规模多模态微调的效果,以及视觉线索的增益。实践建议是若应用以短视频与单说话人为主且允许音频建模,优先尝试冻结语音编码器加片段聚合的纯音频路线;若系统必须输出可解释的句子级章节或部署受限于文本流水线,则在文本模型上先加停顿时长再考虑说话人特征,不必堆叠音高与语速。复现时先跑通 T1 排名与 Oracle 损耗上限,再做时长与说话人分层,最后才比较标题质量,避免用文本分数跨转写直接排名。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


