英文题目:CONNECTING SPEECH TO WORDS THROUGH IMAGES
会议身份:
conference:eusipco:2026:conference-paper-id:0000436
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#自监督学习 #弱监督学习 #音视频 #语音 #关键词检测
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Pirlogeanu, Gabriel:机构信息未能从会议 PDF 纯文本可靠映射
- Oneata, Dan:机构信息未能从会议 PDF 纯文本可靠映射
- Cucu, Horia:机构信息未能从会议 PDF 纯文本可靠映射
- Kamper, Herman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理视觉接地语音的词级关联,输入为图像及其口头描述音频,输出是将词表中每个书面词定位到若干语音片段并给出时间边界,难点在于口头描述与图像字幕内容并不一致且无任何转写监督。词汇构建步骤用Tag2Text、BLIP-2和GIT三种图像描述模型为每张图像生成字幕,取交集去停用词并词形还原后保留高频100词形成动态词汇表。候选过滤步骤按字幕是否包含目标词选出可能包含该词的话语集合,将上一步的词汇输出转化为待对齐的语音候选集。定位聚合步骤在候选集内对两两话语抽取HuBERT第七层特征并做连续或离散对齐,经区间堆叠聚合选出跨话语最一致的高频公共子序列作为关键词片段。与Olaleye等固定标签器的参数化注意力卷积方法不同,该方法以动态词汇加非参数发现实现开放词检索,并保留可检查的对齐证据以提升可解释性。在MIT Places Audio Captions测试集下,CFA的定位性能下降为24.6%,高于DFA的定位性能下降20.2%。该结论适用边界受限于英语名词及高频共现较弱的词汇,对boxing ring类强共现词及字幕召回不足的词会系统性失效,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么不用转写?
这篇解读的输入是论文原文提供的文字证据,目标是让刚进入语音或音频方向的研究生能够复述方法并核对实验条件。必须保留的信息包括数据来源与划分、词汇表做法、两种对齐方法的计算方式、聚合评分与阈值、评价指标与取前十的聚合方式,以及原文明确报告的超参数和开销。输出是 1 篇按学习依赖展开的中文技术解读,不做超出证据的推断。
任务的起点是一种视觉 grounding 语音数据集,也就是图像和口头描述成对出现的数据。具体做法是先有一组图像,请人看图说话并录音,得到每张图像对应一段自发口述,而不是朗读文本。这种收集方式的动机在引言中讲得很直接:对于识字率低、没有文字形式,或者整理转写代价太高的语言,仍然可以先把图像和语音配对存下来。论文要解决的问题就是在这种没有文本监督的条件下,把书面词和语音片段连起来。
这里的书面词不是人工转写,而是来自图像字幕系统对图像的自动描述。白话说,图像字幕就是看图写话模型,给一张场景图输出一句英文描述。论文先用多个看图写话系统给每张图像生成描述,再从描述中整理出高频词作为词汇表。然后对词表中的每个目标词,只保留那些图像字幕包含该词的语音,再在这些语音内部寻找反复出现的声音片段,认为它就是该词的发音。整个过程不使用语音的文字转写,监督只来自视觉侧的字幕。
需要先区分两个评价概念。关键词检出是判断整条语音是否包含目标词,只要句子找对就算对。关键词定位更严格,要求返回的时间区间与真实词区间有足够的重叠,论文用交并比阈值来判定。检出是定位的上界,如果句子都找错,定位一定错;如果句子找对,还可能因为边界切不准而定位错。后文所有数字都要先问清是检出还是定位,是哪个交并比阈值,以及是对多少个候选取平均。
同类路线做了什么,本研究卡在哪个缺口?
按同输入、同目标、同监督来对照,相关工作可以分成 3 条线。第一条是视觉 grounding 语音的整体学习,例如从原始感官输入联合发现视觉物体和口语词,或者从联合音视频分析中学习类词单元。这类工作证明了图像和语音可以互相提供监督,但不一定直接输出书面词到语音区间的映射。
第二条是跨语言或跨模态的词发现。论文明确提到从视觉 grounding 语音中做双语词典发现,以及用无监督模式发现从语音中找重复片段。作者借鉴的无监督词发现思路是:目标词会出现在集合内所有语音中,因此最频繁的公共子序列很可能就是目标词。这条线提供了对齐与堆叠的技术原型,但原来不针对书面查询词做过滤和定位。
第 3 条是与本文目标最接近的视觉 grounding 关键词定位。论文点名的对照是 Olaleye 等人的工作,主要想法是用图像标注器给音频到关键词网络提供弱监督。原文指出的关键差别是:那种做法的关键词集合受限于单个图像标注器的输出范围,而本文的词汇表是根据当前语料动态生成的,来自多个图像字幕系统的交集。本文还实现了一个更新版的神经基线,也就是带注意力的卷积网络,用作可运行的比较对象,而不是只比较概念类别。
要回答的具体问题与成功标准是什么?
具体问题可以写成一个可执行流程。给定图像语音对集合,对词表中每个书面查询词,找出最可能包含该词的语音片段,并按分数返回前 10 个。成功标准有两个层次。检出层次看返回片段所在的整条语音是否真的包含查询词。定位层次看返回的时间区间与真实词区间的交并比是否超过阈值,论文主要报告交并比为 0.5 和 0.752 档。
举一个教学用的例子,不代表论文数据。假设目标词是 road,先找出所有图像字幕包含 road 的语音,得到一个候选集合。再把集合内语音两两对齐,如果 road 的发音在多条语音中重复出现,对齐分数就会在对应时间区堆高。最后按堆叠分数切分并排序,取分数最高的片段作为 road 的语音实例。这个例子只是帮助理解过滤、对齐、聚合 3 步,例子中的数值和效果不是论文报告。
论文还设置了一个理想条件对照帮助理解上限。用语音的真实转写来过滤,也就是只保留转写中真正包含目标词的语音,再跑同样的对齐与聚合。这个转写 topline 不是可部署方法,因为它用到了本任务假设不存在的监督。它的作用是回答:如果过滤完全正确,对齐与排序本身能做到多好,从而把字幕噪声带来的损失分离出来。
两步全景:先建词表,再过滤对齐聚合
方法全景只有两大步。第一步是词汇表构建,用预训练图像字幕模型给语料中的图像生成描述,经过词形还原和去停用词后,取最频繁的词作为目标意义空间。第二步是关键词定位,对每个查询词先按图像字幕过滤语音,再把选出的语音两两对齐,最后用区间堆叠把反复对齐的区域找出来。每个词最终关联一组语音片段,就形成了书面词到口语片段的映射。
沿一个样本走一遍有助于建立依赖关系。输入是一张图像和它对应的口述语音。表示阶段有两条分支:图像分支变成若干句自动字幕,再变成词集合;语音分支变成 HuBERT 特征,再变成离散单元序列或保留连续特征。组件阶段先判断该样本的图像词集合是否包含目标词,决定是否进入候选集合。
进入集合后,该语音会与其他候选语音逐帧或逐单元比较,得到对齐分数。目标是让目标词对应的时间区在多次比较中都获得高分。输出是切分后的候选片段及其平均分数,分数最高的若干个被认为是该词的语音实例。
原文图一的文字说明与上述路径一致:从视觉 grounding 语音语料出发,从字幕高频词建词表,找到图像字幕包含目标词的语音,再对齐并聚合得到最对齐的音频片段。由于本次没有收到官方原图像素,这里只依据图注和正文转述,不描述图中颜色、位置或曲线形状。
词汇表与过滤:字幕词如何决定比较谁?
词汇表构建的细节是教学起点。论文对语料中的图像使用 3 个图像字幕系统,分别是 Tag2Text、BLIP-2 和 GIT,每个系统用束搜索生成一句字幕。然后用 SpaCy 的英文小模型做词形还原并去掉停用词。每张图像最终关联的词集合取 3 个系统输出的交集,词汇表取其中最频繁的 100 个词,并排除背景这类视觉上无 grounding 的词。开发集和测试集各自独立跑一遍这个过程。
视觉 grounding × 关键词定位: 视觉 grounding 负责提供弱监督,判断哪些语音可能包含目标词,分工是缩小搜索集合;关键词定位负责在被选出的语音集合内部找出时间区间,分工是精确定位;二者搭配的原因是语音本身没有文字标注,只能靠图像字幕先过滤再对齐,组合后新增的作用是把书面词和语音片段直接对应起来。
过滤规则可以直接复述。给定书面查询词,如果图像字幕包含该词,则保留对应的音频图像对。用集合写法就是保留满足该词出现在图像字幕中的配对。过滤和建词表用同一组图像字幕系统,字幕中的词同样做词形还原。这样做的安排理由在原文写得很清楚:只在可能包含目标词的语音之间做比较,避免在全库上做昂贵的无监督发现,同时让重复出现的公共子序列更可能就是目标词。
这里要提醒一个依赖关系。字幕描述的是图像内容,而语音描述的也是同一图像,但二者措辞不一定一致。机器字幕与人口述之间存在固有的描述差异,论文也引用了人类描述本身就有多样性的证据。因此过滤的精度和召回直接决定后续对齐的输入质量,这是后文消融重点考察图像字幕系统数量的原因。
对齐计算:离散与连续两条路各算什么?
对齐阶段的输入是经过滤后属于同一个目标词的多条语音。记两条语音为输入话语,对齐要回答的是其中一条语音在时刻的片段出现在另一条语音中的可能性。两种方法都依赖 HuBERT 表示,论文明确用英语 HuBERT 模型的第七层特征,并指出该层在音素区分上是最优层。为避免对齐静音或背景噪声,还用 Pyannote 做语音活动检测。
离散特征对齐的做法是先把 HuBERT 特征用聚类编码为离散单元,再对两条单元序列用 Smith-Waterman 动态规划做局部对齐。从对齐结果构造二值评分函数,匹配上记为一,否则记为零。连续特征对齐的做法是不做聚类,直接在特征空间算余弦相似。对一条语音在时刻的特征,取它与另一条语音所有时刻特征的最大相似作为分数,再用高斯平滑使信号不那么噪声化,并把低于最大值一定比例的分数置零,该比例由超参数控制。
离散特征对齐 × 连续特征对齐: 离散特征对齐先把 HuBERT 特征聚类为离散单元再用 Smith-Waterman 做动态规划,分工是得到二值匹配信号且运行更快;连续特征对齐直接在特征空间算余弦相似并取最大相似,分工是保留更多声学细节但计算更慢;搭配比较的原因是二者共享同一过滤与堆叠框架,组合意义在于揭示精度与效率的权衡。
原文还交代了实现与速度差异。离散方法高效,可在中央处理器上运行。连续方法需要矩阵乘法,论文跑在 Tesla T4 图形处理器上。两者的速度差别是复现时必须考虑的部署条件,不能只看精度数字。
聚合与切分:如何从多次对齐得到可排序片段?
聚合要解决的问题是单次两两对齐很 noisy。论文采用区间堆叠,也就是对每条语音的每个时刻,把它与其他所有候选语音的对齐分数求和。堆叠值越高,说明该区域与集合中更多语音的片段对齐,越可能包含查询词。这一步把两两证据变成了 utterance 级别的帧分数。
图像字幕 × 词汇表构建: 图像字幕负责把图像转成文字描述,分工是提供视觉概念的文字来源;词汇表构建负责词形还原、去停用词并取高频词,分工是形成可检索的目标意义空间;搭配的原因是单字幕系统噪声大,需要多系统取交集提高精度,组合后新增的作用是动态得到与当前语料相关的可定位词表。
切分与评分紧接着堆叠。先丢弃低于阈值的分数,该阈值取为最大堆叠分数的一定比例。然后用静音或零值帧作为边界,把连续非零区域切成片段。每个片段的分数取其帧级数值的平均。排序时分数高的片段排在前面,论文最后对每个词取前 10 个片段做评价。
区间堆叠 × 片段评分: 区间堆叠负责把一条语音与同词集合内其他所有语音的对齐分数相加,分工是累积跨句重复证据;片段评分负责按静音或零值切分连续区并取帧平均值,分工是把帧级证据变成可排序的候选;搭配的原因是单次两两对齐噪声大,只有反复出现才可信,组合后新增的作用是给出每个候选包含目标词的排序依据。
阈值在这里起两个不同的作用,不宜混淆。一个是连续对齐内部的局部阈值,用于把低相似压成零,得到稀疏信号。另一个是聚合后的阈值,用于去掉堆叠噪声。论文在开发集上调参,离散方法的聚合阈值与连续方法的局部阈值和聚合阈值都有明确报告,后文复现节会集中列出。理解这两个阈值的位置是复述方法的关键。
本研究训练了什么,没有训练什么?
此点需优先说明:主方法无神经网络训练阶段。离散与连续 2 类对齐均属非参数或无监督发现方法,调用已有 HuBERT 特征、聚类、动态规划、余弦相似、高斯平滑和语音活动检测。论文未报告对 HuBERT 参数的微调,也未报告超出引用方法之外的聚类中心重训细节。未报告内容即为缺项,不可从模型名称推定参数是否更新,也不可将参数冻结等同于系统输出确定。
实际计算过程属检索与对齐流程。对每个查询词,先按字幕过滤获得候选语音清单,再对清单内语音成对计算对齐分数,再堆叠、阈值化、切分和排序。离散分支计算主要为聚类查表与动态规划,连续分支计算主要为帧级余弦相似与最大值搜索加平滑。论文明确报告超参数:离散方法聚合分数阈值为 0.4,对齐步骤沿用引用方法超参数,仅相似阈值设为 4;连续方法局部对齐阈值为 0.7,聚合分数阈值为 0.3。
作为对照的神经基线存在训练过程,但其并非本文提出方法。该基线输入为语音段和词表词,预测该词是否出现在语音中,监督来自图像字幕。其结构包括卷积网络、基于输入词的注意力池化,以及 2 层感知机。定位时取注意力权重峰值,并在峰值前后取固定窗口作为返回片段。论文说明该窗口位移超参数在开发集上调过。该基线的训练与推理开销在原文无可核对数字,因此不可声称其更快或更省,仅能按证据陈述主方法对齐耗时。
数据、划分、词汇与评价按什么条件执行?
数据来自 MIT Places 音频字幕数据集,是图像与口头英语描述配对的大集合。图像是森林、幼儿园教室、汽车内饰等场景,口述字幕通过众包收集,是自发口述而非朗读。论文从 400000 对中抽取 20000 对做实验,其中一万用于开发,一万用于最终评价。原始数据集不提供人工转写,为了评价需要用自动语音识别得到转写,再用强制对齐得到词级时间戳。转写用英伟达 NeMo 的 Parakeet 模型,对齐用基于多语言语音模型的联结时序分类强制对齐器。
下表把可核对的数据规模、词汇规模、语音时长、阈值与耗时放在一起,目的是让复现者 1 次核对实验条件是否一致。阅读时先看比较问题:不同方法是否在同一数据划分、同一词表构造和同一取前十规则下比较。表中每一行的数字都有原文连续句支撑,不引入表格之外的推算。
| 环节 | 对象 | 数量或阈值 | 单位与说明 | 运行条件 |
|---|---|---|---|---|
| 数据划分 | 语音图像对 | 20k,总量中抽取,10k 开发,10k 评价 | 对,开发与评价各 10k | MIT Places 子集 |
| 词汇规模 | 高频词表 | 100 | 个,排除无 grounding 词 | 开发与测试独立构建 |
| 语音时长 | 平均口述 | 10 秒,约 20 词 | 秒与词数,平均值 | 自发口述 |
| 聚合阈值 | 离散方法 | 0.4 | 比例,相对最大堆叠分 | 开发集调参 |
| 局部与聚合阈值 | 连续方法 | 0.7,0.3 | 比例,局部与聚合各一 | 开发集调参 |
| 对齐耗时 | 250 条语音 | 2 分 15 秒,24 秒 | 连续方法与离散方法 | 图形处理器与中央处理器 |
表后需要解释这些条件的含义与代价。数据划分决定了所有方法看到的候选集合大小,词汇规模决定了平均要对 100 个词各跑 1 次过滤与对齐。阈值决定了稀疏程度,调得过高会丢掉真词区,调得过低会引入噪声堆叠。耗时行显示连续方法比离散方法慢很多,这是后文讨论效率权衡的直接证据。未胜出的一项在这里也要点明:连续方法精度占优,但需要矩阵乘法与图形处理器,而离散方法可在中央处理器上较快运行,这就是用精度换速度的代价。
主结果测什么,谁与谁比,支持什么判断?
主结果回答两个问题。第一,在理想转写过滤下,对齐与排序本身的上限有多高。第二,在视觉字幕过滤下,离散方法、连续方法和神经基线谁更好。比较的公平条件是同一数据子集、同一词表构造思路、同一 HuBERT 第七层特征,以及同一取前十算精度的方法。指标方向是精度越高越好,交并比阈值越严格越难。
关键词检出 × 关键词定位: 关键词检出只判断整条语音是否包含目标词,分工是衡量过滤与排序是否找对句子;关键词定位进一步要求时间区间与真值重叠超过交并比阈值,分工是衡量边界是否找准;搭配的原因是前者是后者的严格上界,组合意义在于区分错误来自选错句子还是切错边界。
下表不重复尚无逐字连续句支撑的完整精度矩阵,而是把原文用完整句子直接报告的上限、损失与相对改进放在一起。这样可以避免把不同指标的差值混进同一模型列,也避免把自动指标当成人工评价。阅读时注意百分点与相对百分比不同,相对改进不能直接换算成绝对精度差。
| 比较 | 指标条件 | 参照 | 报告的关系 | 取值规则 |
|---|---|---|---|---|
| 理想上限 | 交并比 0.5 | 转写过滤 | 超过 84% | 两种方法定位精度 |
| 视觉相对理想 | 交并比 0.5 | 转写对照 | 下降 24.6%,20.2% | 连续与离散绝对性能下降 |
| 连续相对离散 | 更严格切分 | 离散方法 | 相对改进 27.7% | 连续方法更有效 |
| 本文相对神经基线 | 定位与检出 | 注意力卷积网络 | 约 23%,31% | 本文最佳设置超出基线 |
| 聚合方式 | 每个词 | 前 10 片段 | 精度取前 10 | 词间平均 |
表后解释主要收益与具体代价。收益是两种视觉 grounding 方法都超过神经基线,且连续方法在严格阈值下相对离散方法有明显优势。代价是视觉监督相对理想转写有 20 个百分点量级的绝对下降,说明字幕与口述措辞不一致是主要瓶颈。反例在原文有定性描述:共现词难以区分,例如与拳击台同时出现的词会被互相检索到,与雪山同时出现的词也会互相混淆。这说明即使过滤正确,对齐仍可能选中容易对齐的共现词,而不是查询词本身。
字幕系统数量如何改变精度与召回的权衡?
消融要回答的是字幕质量如何影响最终定位。论文用字幕词与语音转写词的重合来衡量字幕质量,字幕词同时出现在转写中才算正,指标是精度与召回,并在词表的 100 个词上平均。实验比较了单个字幕系统、两个系统取交集、3 个系统取交集对下游定位的影响。
原文报告的趋势是 3 个系统的字幕性能相近,但精度召回权衡不同。GIT 召回最好,BLIP-2 和 Tag2Text 精度更好。在 4 种定位设置下,精度更好的两个系统下游定位更好,说明少而准的候选比多而 noisy 的候选更重要。进一步取多个系统的交集可以提高精度但损失召回,3 个系统取交集在 4 种设置中的 3 种取得最好结果。
另一个特有细节是离散与连续方法对字幕精度的依赖不同。在较低交并比阈值下,离散方法对字幕精度的依赖更弱,在单字幕设置下离散方法持续优于连续方法。加上离散方法快很多,论文把发挥离散方法潜力作为未来工作。这是一个未胜出项的正面说明:连续方法总体最好,但在 noisy 过滤下离散方法更稳,不能把总体趋势推广到每一组设置。
哪些失败已被证实,哪些边界尚未评测?
已证实的失败模式有两类。第一类是共现词混淆,论文用检索示例说明预测边界本身切得较好,但词义归属会错。例如与环同时出现的盒子会被检索到,与山同时出现的雪也会被检索到。这种错误在理想转写下仍然存在,说明问题不只来自字幕过滤,还来自排序与对齐本身偏好容易对齐的重复片段。第二类是字幕与口述的措辞差异,机器字幕提供的是合理的图像描述,但人类口述同一图像时用词本来就有多样性,因此过滤会漏掉或引入样本。
未评测的边界需要明确列出。论文没有测量误判率随阈值变化的完整曲线,没有报告推理延迟与实际部署成本的系统对比,也没有做人类听感评价。总体趋势不等于每组每步都成立,例如连续方法总体占优不等于在单字幕或低阈值下仍占优。相关性也不是因果,字幕精度高伴随定位好,但不能直接断言提高字幕精度必然同等提高定位,因为召回下降会同时减少候选。
还有一个容易误解的地方。转写 topline 的检出按定义是满分,但定位仍不完美,常因共现导致模型预测了更容易对齐的词。这恰好说明本任务的难点分为两段:找对句子和切准边界。视觉方法在这两段上都有损失,复现时应分别记录检出与定位,而不是只看定位数字。
复现先做什么,需要哪些信息条件?
复现时首先重建数据与评价参考。抽取相同 20000 对并按开发与评价各 10000 划分,用相同自动语音识别与强制对齐获得转写与词时间戳。注意原文未提供人工转写,评价参考本身带有识别与对齐误差,复现报告应说明此点,而非将自动参考视为金标准。
接下来重建词汇表。用 3 个指定图像字幕系统各生成 1 句字幕,做词形还原并去停用词,取交集后再取高频 100 词并排除无 grounding 词。开发与测试独立执行,避免用测试词表泄漏到开发调参。随后对每个词按字幕过滤语音,再运行离散或连续对齐、堆叠、阈值化、切分与排序。关键超参数按原文保留:离散聚合阈值 0.4,连续局部阈值 0.7、聚合阈值 0.3,离散对齐相似阈值 4,其余对齐超参数沿用引用方法。语音活动检测与 HuBERT 第 7 层特征属需保持相同的信息条件。
关于可用性,原文证据中未发现来源绑定且完成验证的资源,因此不可声称代码、模型或数据已公开。复现者应按论文文字自行实现过滤、对齐与聚合,并记录硬件条件。连续方法需图形处理器,离散方法可在中央处理器运行,对齐 250 段语音的耗时量级差异属预算规划的直接依据。还需补充的验证包括更换字幕系统组合、报告不同交并比下的完整精度,以及记录共现词错误的比例,此类内容在原文仅有趋势或定性示例,无可直接复用的完整数字。
何时值得尝试这个方法,结论是什么?
当研究场景是有图像和口述但没有转写,且目标是给语音片段赋予可读的词义时,这个方法值得尝试。它的适用条件很具体:图像内容与口述内容相关,目标词在视觉上可 grounding,且能接受返回片段存在共现混淆。如果目标词是抽象词或图像中不可见的概念,过滤本身就会失效,不应期待对齐能补救。
方法选择的判断可以总结为三句话。过滤用多系统交集换精度,代价是召回下降。对齐用连续特征换精度,代价是速度与硬件要求。用堆叠换鲁棒性,代价是需要调两个位置不同的阈值。最强证据是原文用完整句子报告的相对关系:在严格切分下连续方法相对离散方法有明显改进,最佳设置超出神经基线约 20 到 30 个百分点量级,而视觉监督相对理想转写仍有 20 个百分点量级的绝对损失。
最终结论按证据分层表述。论文直接报告的是方法可行且超过所实现的神经基线。有限解释是多字幕交集与连续特征是主要收益来源。未验证的推测是能否直接迁移到低资源语言的英语词关联,论文只在结尾提出未来计划,没有给出 Hindi、Yoruba 或日语数据的实测数字。因此把它当作下一步待验证工作,而不是已证明的跨语言效果,才符合原文的证据边界。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 8 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses