英文题目:Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
会议身份:
conference:aaai:2026:conference-paper-id:37542
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准测试 #对比学习 #鲁棒性 #音视频 #声源定位
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jia Li:机构信息未能从会议 PDF 纯文本可靠映射
- Wenjie Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Ziru Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Yunhui Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Yapeng Tian:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频分割输入为同步视频帧与对应音频片段,输出发声物体的二值掩膜,难点在于模型需同时完成视觉边界分割与跨模态对应判定,否则会把视觉显著但静音的物体误分割。该方法先以90%正对与10%负对均衡采样构造训练对,使负对对应空真值掩膜进入分割分支以抑制误激活。接着将音频特征经线性投影与末级视觉特征经空间池化映射到同一通道维度并计算余弦相似度,得到可判定的对应分数。然后用二分类交叉熵将正对相似度推向1、负对推向0,并与掩膜分割损失和音视分布正则联合训练,使相似度门控直接决定是否分割。在AVSBench-S4基准下,TPAVI+Ours的G-mIoU指标为87.672,高于TPAVI的35.032。与仅增加负样本仍依赖隐式融合的基线不同,该机制以显式分类器引导的相似度建立决策边界,实际意义是在保留正样本分割质量的同时将负场景误激活压至近零。该结论适用边界受限于静音、均匀采样白噪声与跨大类异屏声音构成的合成负样本,尚未验证混响、多源重叠与近类混淆等真实声场下的失败条件。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
任务到底要求模型做什么?
输入是一段视频加一段音频,目标是输出一张二值掩膜,标出当前正在发声的像素。论文把输入切成每秒一个片段,实践中每个片段取最后 1 帧,一段视频取 5 个时刻,共 5 帧待分割。白话说,模型要同时回答两个问题:哪里是物体边界,以及这里的声音和画面是否对应。第二个问题是音频-视觉分割区别于纯视觉分割的关键,英文是 audio-visual segmentation,简称 AVS。
现有做法在标准集上分数很高,但标准集几乎全是正样本对,也就是声音来源恰好是画面中最显眼的物体。模型于是学会一条捷径:看到显眼的救护车、乐手就描出来,不必真听音频。论文把这种捷径称为视觉先验偏置,英文是 visual prior bias。它的危害在静音、白噪声、异类画外音下暴露,模型照描不误。
音频-视觉分割 × 视觉先验偏置: 音频-视觉分割负责在听到声音时找出并描出画面中正在发声的像素,视觉先验偏置则指模型跳过听觉验证、只按画面中显眼物体描轮廓;两者搭配才能解释本文矛盾:正样本分数高不代表听懂了声音,负样本全黑才是是否真用音频的试金石,组合意义是把评测从只看描得准不准扩展到该沉默时能否闭嘴。
下面这张救护车对照图把问题说得最直观,同一街景画面配 4 种音频,只有第一列是真救护车声,后三列都应输出空掩膜。前 3 个基线行在四列都给出白色车形,本方法行只在第一列给出白色车形。读图时不要只看描得像不像,更要看该黑时黑不黑,这正是后文全部鲁棒性设计的起点。
看图路径: 1. 先看第一行音频条件从救护车原声到静音噪声画外音的变化;2. 再逐行对比前三行基线在负音频下仍有白色救护车掩膜;3. 最后看最后一行本方法在三列负音频下输出全黑
论文图 1。原论文 Figure 1:“Performance in Different Audio Scenarios.”。
像素细节支持上述判断:前三行掩膜在静音、噪声、画外音列下保持与原声列近乎相同的白色团块,说明输出与音频条件无关;最后一行在三列负音频下为全黑图,说明输出受音频门控。论文报告这不是个例,而是多个当前最优方法在新基准上的系统性失败,因此需要先重建评测,再改训练。
与声源定位和已有分割方法有何不同?
同输入同目标的第一条路线是声源定位,英文是 sound source localization。它也用音频加画面找发声处,但输出是框或热力图,精度到区域级。代表做法用对比学习或类别对齐区分多声源,优点是定位粗目标快,缺点是给不出像素级边界。本文任务要求像素级掩膜,因此热力图不能直接替代。
同输入同目标的第二条路线是音频-视觉分割本身。从编码器加简单融合起步,逐步发展出多模态变换器、音频查询引导、大规模分割基础模型如 SAM 和 Mask2Former 的变体。论文点名的基线包括 TPAVI、AVSegFormer、Stepping-Stones、SAMA-AVS、CAVP 等,它们在正样本上不断刷新交并比,但评测协议没有负音频。
同运行阶段的第 3 类工作是试图缓解偏置的改进,例如对比学习增强语义或解耦量化语义分解。论文承认这些努力,但报告在静音、噪声、画外音下它们仍主要按视觉显著性分割。同期还有针对声源定位的负音频评测研究,思路相近,但本文同时给出可插拔的训练对策。教学例子:这好比都是听声找人,前者只要求手指大概方向,后者要求用剪刀沿人体剪出轮廓,精度要求不同,失误代价也不同。
新基准如何构造正负音频条件?
论文把问题形式化为给定成对片段集合,每帧预测二值掩膜。关键补充是负样本必须输出空掩膜。原文把挑战归纳为缺少跨模态验证机制,即用音频证据去否决视觉假设的能力。没有这种能力,架构上就不可能正确处理负对。
正样本对 × 负样本对: 正样本对指画面与原配音频语义对齐、真值掩膜非空的输入,负样本对指同一画面配静音、白噪声或异类画外音、真值为空掩膜的输入;正样本训练描画能力,负样本训练拒绝能力,两者按约 9 比 1 混合才能同时教会模型何时描与何时不描,组合意义是把二值分割目标从单任务变成存在性判断加精细描边的双任务。
为此论文复用已有数据集构造 AVSBench-Robust,覆盖 3 种视频场景。单源子集 S4 有 4932 段视频,训练 3452 段、验证 740 段、测试 740 段;多源子集 MS3 有 424 段视频,训练 296 段、验证 64 段、测试 64 段;语义子集 AVSS 有 12356 段视频,训练 8498 段、验证 1304 段、测试 1554 段。每段视频配 4 种音频:原声正对、静音、背景噪声、画外音。
噪声是作者生成的 5 秒白噪声,采样率 44100 赫兹,均匀采样区间为负一到一;画外音取自不同大类的语义无关声音,考验细粒度对应。
这种构造把评测从单一正分布扩展到正负混合分布。训练时仍以原数据集为主,评测时 4 种音频逐一替换同一画面,相当于固定视觉、只扰动听觉的对照实验。若模型真用音频,输出应在负条件下坍缩为空;若只用视觉,输出应保持不变。后文所有全局指标都建立在这个对照逻辑上。
整体框架让一个样本走完哪条路?
沿一个样本走一遍有助于定位每个模块。输入是 1 帧画面加一段音频,音频先转语谱图进 VGGish 网络得到 128 维音频特征,画面进变换器视觉骨干得到 4 层多尺度特征。两路特征先做 1 次相似度对齐计算,判断是否对应;再进融合模块与解码器,决定描出什么形状。
融合模块 × 语义特征金字塔解码器: 融合模块分工是计算音频特征与多尺度视觉特征的归一化点积相似度并以此加权更新视觉特征,语义特征金字塔解码器分工是把融合后的多尺度特征上采样恢复到原图分辨率输出二值掩膜;前者决定哪里该被声音增强,后者决定边界画得多精细,搭配理由是相似度门控需要一个能把门控结果落成像素的执行器,组合意义是判断与描边解耦又串联。
框架图把上下两路画得很清楚,上半粉色区是正对全量数据,下半蓝色区是约 10% 的负对。中间黄色块是共享视觉特征,正对红色音频经线性层后与视觉池化特征拉近,负对蓝色音频经线性层后与同一视觉特征推远。右侧各有一个融合模块加语义金字塔,正对监督出白色物体,负对监督出全黑。双流设计让同一视觉输入因音频不同走向不同输出。
看图路径: 1. 沿左侧正样本与负样本两条输入支路看到各自音频骨干与共享视觉骨干;2. 找到中间最大化相似度与最小化相似度的两条虚线箭头汇合处;3. 再看右侧融合模块加语义金字塔后正样本出白掩膜负样本出全黑
论文图 2。原论文 Figure 2:“Framework Overview. Given video frames and an audio clip as inputs, our approach can robustly identify and segment sounding objects in video frames.”。
结合像素可见的箭头可以复述:音频骨干与视觉骨干分离提取,线性层与自适应平均池化把 2 模态对齐到同一维度,虚线双箭头标注最大化与最小化相似度,实线黑箭头把原始特征送入融合,绿色虚线把预测掩膜与真值连成分割损失回路。该图同时说明训练只用小比例负对即可划清边界,不必重写整个分割网络,这为后文即插即用到 TPAVI 和 AVSegFormer 上埋下伏笔。
相似度门控与分割损失各算什么?
编码器与融合沿用已有设计,音频是 AudioSet 预训练的 VGGish,视觉是金字塔视觉变换器,层级尺寸按二的幂次缩小,融合用空洞空间金字塔池化加归一化点积计算注意力,再用 1 乘 1 卷积更新视觉特征。解码器用全景特征金字塔上采样恢复细节。这些是执行描边的底座,本文不改结构,改的是何时允许描边。
新增的判断分支取最后 1 级视觉特征做空间池化,音频特征经线性层投影到同维度,然后算余弦相似度。符号含义是 FA 为音频特征,FV 为视觉特征,上帽符号表示投影池化后的对齐版本,输出是标量相似度分数。计算目标是正对趋一、负对趋零,为后文二分类损失提供输入。
\[s(FA, FV ) = cos( ˆFA, ˆFV ).\]分类器引导体现在对相似度分数加 Sigmoid 后算二分类交叉熵,正对标签为一,负对标签为零。该损失把相似度推向两端,形成可分的距离分布。分割损失仍是预测掩膜与真值之间的二值交叉熵,负对真值为空掩膜,自然产生压制梯度。第三项是音频-视觉正则项,用散度约束被掩膜加权的视觉特征与音频特征分布相近。
\[LSeg = LBCE(Mpred\]平衡训练 × 分类器引导的相似度学习: 平衡训练分工是往训练流中掺入约 10% 的负音频对并给空真值,让分割损失学会压制输出,分类器引导的相似度学习分工是用二分类损失显式拉开正负对的余弦相似度分布;前者提供反例数据,后者提供决策边界,搭配理由是只加反例会让模型在描与不描之间摇摆,组合意义是相似度成为是否启动分割的门控信号。
总目标是三项加权求和,权重为两个超参数。第一项决定是否分割,第二项保证对应存在时形状正确,第三项保证掩膜内视觉与音频分布一致,第四路隐式监督即负对空真值压制误激活。原文强调这不是复杂架构,而是给旧模型补一个显式决策门。
训练时数据比例和监督如何配合?
训练保留约 10% 的负对,论文报告这是兼顾鲁棒性、精度与效率的经验点。构造上正对来自原视频原声,负对来自静音、白噪声、异类声音的采样混合。每个批次同时含正负对,相似度分支见正负标签,分割分支见非空与空真值,两路梯度同时回传。推理时不需要额外阈值手工开关,相似度门控已内化到特征与融合中,直接输出掩膜,负对自然输出接近全黑。
原文未报告优化器类型、学习率、训练轮数、权重冻结细节与硬件耗时,因此复现时不能臆测这些超参数,只能按本节给出的可复述部分先搭数据流:视觉与音频双编码、线性对齐、余弦相似度、二分类损失加分割损失联合训练。论文明确说方法可接到 TPAVI 与 AVSegFormer 上,说明改动是外挂式,不依赖特定解码器。未给出的缺项应在复现记录中标为待查,不从模型名推定实现。
一个关键训练现象是只加负对不加分类器会恶化。多源集上全局交并比从五十九点多掉到五十五点多,模型在描与不描之间混淆。加上分类器后单源全局交并比跃升到八十七点多,误激活降到零附近。图四的分布变化是直接证据,训练前正负相似度重叠,训练后分居两端,这支持门控确实被学会,而非分割头偶然压低输出。
评测测什么、条件是否对齐、指标方向如何?
评测问题是同一画面换音频后输出是否跟随音频变化。对照基线包括融合派的 TPAVI、提示派的 AVSegFormer,以及 SAMA-AVS、Stepping-Stones、CAVP、COMBO 等,接入本方法后记为加 Ours 的变体。条件对齐方式是固定视频、替换 4 种音频逐一测试,正样本用交并比与 F 分数看描得准不准,负样本用误激活率看乱描多不多。指标方向是交并比与 F 分数越高越好,误激活率越低越好。
全局指标把两端综合起来。全局交并比是正样本交并比与负样本补集的调和平均,全局 F 分数是正负 F 分数的类似综合,全局误激活率是全部负条件下误激活率的平均。这些设计防止只刷正样本高分。论文还做未见音频与混合音频对照,检验是真对应还是记住噪声模式。
\[G-mIoU = 2 · mIoUP · (1 −mIoUN )\]数据划分与采样已在问题节交代,聚合对象是测试集帧级像素平均。原文未报告多次随机种子的方差与显著性检验,也未报告延迟与算力开销,因此不能承诺更快更省,只能讨论精度与鲁棒性。资源状态方面,未发现来源绑定且完成验证的开源仓库,不得声称代码已公开,复现应以论文文字与公式为准。
误激活率 × 全局交并比: 误激活率分工是统计负样本预测掩膜中被点亮像素占全图的比例,直接度量乱描程度,全局交并比分工是用调和平均综合正样本交并比与负样本交并比,度量两端兼顾的整体能力;前者只看克制,后者看准确加克制,搭配理由是单看正样本分数会掩盖负样本崩溃,组合意义是逼模型不能靠牺牲一端换另一端的高分。
主结果在正负两端各付出什么代价?
先看语义子集的全局对照,问题是正负兼顾时谁更稳,公平条件是同一 AVSS 测试集与同一全局协议,指标方向为前两列越高越好、末列越低越好。表中四行都含基线与本方法变体,可直接比较全局收益。
| TPAVI (Zhou et al. 2024) | 41.90 | 45.51 | 0.103 |
|---|---|---|---|
| AVSegFormer (Gao et al. 2024) | 47.41 | 49.69 | 0.116 |
| Stepping-Stones (Ma et al. 2024) | 49.10 | 48.03 | 0.184 |
| AVSegFormer + Ours | 54.62 | 65.09 | 0.003 |
表后解释需要同时看到收益与代价。AVSegFormer 加本方法后全局交并比与全局 F 分数领先同表基线,全局误激活率降到千分之三量级,支持门控有效。但原文也承认正样本单项可能略降,因为模型被迫放弃纯视觉捷径,这是用少量正样本精度换负样本克制力的权衡。未胜出项同样值得记:Stepping-Stones 在该表全局误激活率最高,说明其渐进训练并未解决负音频误描。
多源与单源的大表用整理表呈现,问题是固定画面换音频时输出是否坍缩,条件是同一视频配原声、静音、噪声、画外音。整理保留原文报告的量级:单源基线全局交并比仅三十多,全局误激活近 0.19;接入本方法后全局交并比跃升到八十七点多,误激活降到零附近。多源基线全局交并比约五十九,接入后升到六十多到七十多,误激活同样压到接近零。代价是多源正样本交并比略降,例如 TPAVI 变体在多源正样本上从五十四降到五十出头,但全局分仍占优。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 单源 S4 全局 | 全局交并比 | 35.032 | 87.672 | TPAVI 对比本方法 |
| 单源 S4 全局 | 全局 F 分数 | 21.479 | 82.461 | TPAVI 对比本方法 |
| 单源 S4 负样本 | 误激活率 | 0.186 | 0.000 | TPAVI 对比本方法 |
| 多源 MS3 全局 | 全局交并比 | 59.468 | 65.427 | TPAVI 对比本方法 |
| 多源 MS3 负样本 | 全局误激活率 | 0.072 | 0.001 | TPAVI 对比本方法 |
看图路径: 1. 先确认顶部四组音频列与第二行四种多人室内外画面;2. 对比中间三行基线在静音噪声画外音列仍残留白色人体碎块;3. 再看底部两行本方法在原声列保留完整人体而负音频列全黑
论文图 3。原论文 Figure 3:“Performance comparison of different AVS models under various audio conditions on the Robust-MS3 dataset.”。
多源可视化进一步支持数值结论。原声列各方法都能描出白色人体,真值行在负音频列全黑,而中间三行基线在负音频列仍残留碎块,只有底部两行本方法在负音频列接近全黑。这说明基线输出主要由视觉显著性驱动,音频替换几乎不改变形状。本方法在原声列保留完整多目标,证明门控不是一刀切置黑,而是有条件抑制。
分类器引导是不是不可省的一环?
消融问题是负样本与分类器各自贡献多少,公平条件是以 TPAVI 为基线、固定 S4 与 MS3 测试集,指标方向同主结果。表中叉勾分别表示是否加入负样本与二分类损失,可逐行剥离,重点观察全局交并比、全局 F 分数与全局误激活率三项是否同步改善。
| Negative | samples LBCE G-mIoU↑ | G-F↑ | G-FPR↓ |
|---|---|---|---|
| × × | 35.032 | 21.479 | 0.186 |
| S4 ✓ × | 34.847 | 21.993 | 0.189 |
| ✓ ✓ | 87.672 | 82.461 | 0.000 |
| × × | 59.468 | 51.036 | 0.072 |
| MS3 ✓ × | 55.489 | 30.057 | 0.095 |
| ✓ ✓ | 66.605 | 70.590 | 0.004 |
表后解释要强调反例的作用与边界。只加负样本不加分类器时,S4 全局交并比从 35.032 微降到 34.847,MS3 从 59.468 降到 55.489,误激活率反而上升,报告为有害。这支持没有显式边界时反例会让训练混淆。同时加入两者后 S4 跃升到 87.672,MS3 升到 66.605,误激活率降到 0.000 与 0.004 水平,支持分类器是把反例转化为门控的关键。未评测边界是更高噪声多样性与真实街景混响,原文未覆盖。
相似度分布图是机制层面的反证。左图正负对分数挤在 0.450 到 0.525 之间,紫色重叠区很大,说明旧特征无法区分对应与否;右图负对聚在 0.30 附近、正对聚在 0.70 附近,纵轴计数从 240 量级变为 4000 量级,中间出现空白带,说明二分类损失确实拉开距离。读数看趋势是重叠到分离,这与分割输出从乱描到该黑则黑一致。
看图路径: 1. 先看左图正负对相似度分数都挤在 0.475 到 0.525 附近高度重叠;2. 再看右图负对集中在 0.30 附近而正对集中在 0.70 附近完全分开;3. 注意纵轴计数从两百量级变为三千量级但分离趋势不变
论文图 4。原论文 Figure 4:“Cosine similarity distributions between paired features before and after training.”。
比例与真对应检验用整理表呈现,核心是 10% 是否够用,以及模型是否只是记住噪声。原文报告单源加 10% 负对即从 35.032 升到 87.672,加到 20%-30% 增益边际很小;混合原声加噪声的融合音频仍保持 77.18 交并比,仅比纯原声 78.15 略降,支持模型优先利用相关声源而非简单抑制已知噪声。代价是该检验只用噪声混合,未测语音加语音的细粒度干扰。
| 条件 | 指标 | 原声 | 融合音频 | 结论 |
|---|---|---|---|---|
| 单源 S4 | 交并比 | 78.15 | 77.18 | 混合噪声仅微降 |
| 单源 S4 | F 分数 | 88.22 | 86.44 | 仍保持高位 |
| 多源 MS3 | 交并比 | 51.27 | 50.76 | 优先相关声源 |
| 多源 MS3 | F 分数 | 64.51 | 63.60 | 非简单置黑 |
| 训练比例 | 全局交并比增益 | 35.032 | 87.672 | 10% 已足够 |
上表说明融合音频检验与比例检验指向同一结论:10% 负对已能建立门控,继续增加到 20%-30% 收益有限,而原声与融合音频在 S4 与 MS3 上均只微降,模型没有把已知噪声一律置黑,仍优先响应相关声源。
哪些结论还不能推广?
论文自述两点局限值得初学者先记住。第一,方法性能受骨干容量限制,门控再好也画不出骨干看不清的边界,多源小目标与遮挡仍是难点。第二,基准虽覆盖静音、噪声、画外音,但未完全刻画真实世界的混响、重叠语音、长时偏移与开集类别,实验室的白噪声与跨类异音只是近似。
从证据等级看,全局提升是论文直接报告,有多表多图支持;视觉偏置源于训练集全正对的解释是有限解释,合理但未做训练分布的因果干预证明,只能表述为支持而非证明;真实部署一定更可靠则是未验证推测,不应承诺。此外缺失的证据包括多次运行方差、阈值敏感性、推理延迟与显存占用,未测量这些量就不能声称又快又省。相关性不等于因果,相似度分开与分割变好同时出现,支持门控有用,但不能排除空真值分割损失本身也贡献压制。
复述时要区分 3 类表述。报告类用报告显示,如基线误激活高、本方法误激活近零;支持类用支持,如分布分离支持真对应学习;推测类用可能待验证,如更大负样本多样性可能进一步提升。缺失不是错误,但写复现计划时要把缺项列为必补验证。
要复现应先搭什么、再查什么?
先搭数据流与评测流。按划分复刻 S4、MS3、AVSS 的训练验证测试切分,为每段测试视频生成 4 种音频:原声、静音、5 秒白噪声、跨大类异音。评测固定画面、轮换音频,分别统计正样本交并比与 F 分数、负样本误激活率,再算全局交并比、全局 F 分数与全局误激活率。实现时注意百分点与相对百分比不同,误激活率是像素比例,交并比是区域重叠,不能混算。
再搭模型改动。以任一已有分割网络为底座,保持其编码融合解码不变,外挂一路对齐分支:音频线性投影、视觉末层池化、余弦相似度、Sigmoid 二分类损失,正对标签一、负对标签零,负对分割真值置空,总损失为二分类加分割加音频视觉正则。训练先用 10% 负对起步,观察全局误激活是否降到接近零且正样本不过度坍缩,再试更高比例。
先做什么的清单是:跑通正样本基线、加负音频评测暴露偏置、加负对复现混淆现象、加分类器复现分离与压制、做融合音频对照排除死记噪声。还需补的验证是多种子方差、不同噪声强度、真实混响与多说话人重叠。资源状态必须如实写:本次未发现可用仓库绑定,不写已公开或可下载,若未来拿到链接再按可达性单独核验。
何时值得尝试这种门控思路?
当你的任务同时要求描得准与该沉默时闭嘴,且训练集几乎全是正对,就值得尝试本文思路。它的本质是把存在性判断从分割头里拆出来,用一个轻量相似度分类器显式监督,再用空掩膜教会分割头服从门控。适用条件是能构造可信负对:静音易得,噪声可合成,画外音需跨类采样避免泄漏。若负对与正对语义过近,门控可能误伤,需要先做小比例试探。
不值得盲目照搬的情形是纯视觉分割或音频恒有声的封闭集,此时门控增加训练复杂度而收益有限。若骨干本身分割很弱,应先提升描边能力,否则门控学会拒绝也掩盖不了边界粗糙。论文特有的误解是把正样本微降当失败,实际上全局分大幅领先才是更贴近部署的判据;另一个误解是把全黑当模型变保守,融合音频对照显示相关声源仍被优先保留,支持这是条件抑制而非一律置黑。
一句话收束:先用负音频照出视觉捷径,再用小比例负对加分类器引导把捷径堵上,评测永远同时报告正负两端,这就是这篇论文留给新人的可复述方法。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



