英文题目:INTER-AUDIO DIVERSE DECODING FOR AUDIO DIFFERENCE CAPTIONING IN UNSUPERVISED ANOMALOUS SOUND DETECTION SCENARIOS
会议身份:
conference:eusipco:2026:conference-paper-id:0001127
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#检索增强 #主观评测 #大语言模型 #异常声音检测 #音频字幕生成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Nishida, Tomoya:机构信息未能从会议 PDF 纯文本可靠映射
- Kanamori, Yusuke:机构信息未能从会议 PDF 纯文本可靠映射
- Purohit, Harsh:机构信息未能从会议 PDF 纯文本可靠映射
- Dohi, Kota:机构信息未能从会议 PDF 纯文本可靠映射
- Endo, Takashi:机构信息未能从会议 PDF 纯文本可靠映射
- Kawaguchi, Yohei:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为无监督异常声音检测(Unsupervised Anomalous Sound Detection,UASD)中检出的异常机器声 xa与给定单个正常机器声 xn,输出为一句话自然语言差异描述,难点在于两段同机器同工况音频高度相似,且训练时无异常声、无配对差异标注可用。方法沿用检索增强差异字幕框架:冻结通用音频字幕模型分别描述两段音频,再用大语言模型(Large Language Model,LLM)汇总为差异句,本文只改推理时解码。第一阶段组内多样波束搜索(Diverse Beam Search,DBS)将每路音频波束分为多组,后组叠加与先前组候选的汉明距离惩罚以扩大措辞覆盖;第二阶段跨音频判别搜索额外叠加与对侧音频第一阶段全部候选的相异惩罚,使两路候选集合相互远离;最后将两阶段每路共10条候选送入GPT-4.1归纳为一句话。第二段相对第一段的差异由LLM从两组描述的用词差异中推断。主观评测在33对洁净机器声上显示完整方法平均意见分(Mean Opinion Score,MOS)高于单波束基线RAG-BS和仅第一阶段变体RAG-DBS,且基线有7对输出无可听差异而完整方法为0对。该结论限于洁净声与单正常样本简化设置,阀门类点击音色微差被直接剔除,音高变化类仍弱于显式训练的ADIFF,噪声与域偏移鲁棒性、多正常样本检索影响均未验证。原文未披露训练与推理成本量化。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,什么信息必须保留?
输入是两段声音,一段是在无监督异常声音检测运行中被判为异常的机器声,另一段是用来对比的正常机器声。目标是输出恰好一句话,用自然语言说清第二段相对第一段在听感上哪里不一样。必须保留的信息是可复述的流程条件:只用正常声音做检测训练、不收集异常声做差异训练、不为目标机器标注专用描述、允许使用在任意音频描述数据上预训练的通用描述模型,以及最后汇总只依赖文字层面的比较。
初学者容易把这个任务理解成给模型一段异常声就让它直接说病因。论文的设定更窄也更可操作:先固定一个可比的正常参照,再描述两者之间的可听差别。参照的选择在原文框架里是到正常训练集中检索与异常声在嵌入空间最近的邻居,本文为简化设为给定单个正常声。诊断价值来自对比,而不是来自模型记住某种机器故障名称。
无监督异常声音检测 × 音频差异描述: 无监督异常声音检测的分工是只用正常声音训练并判断偏离正常分布的声音,音频差异描述的分工是把这种偏离翻译成一句可读的自然语言,两者搭配的原因是检测只给是否异常的判定而检修需要知道哪里不一样,组合意义在于用一句正常与异常的对比说明把检测结果连接到故障排查动作。
另一个必须保留的前提是声音很像。正常与异常来自同一台机器、同一类工况,差别可能是间歇出现的撞击、低频嗡鸣的减弱或某种振动的增加。如果描述模型只输出最稳妥的通用句,例如机器在运转、发动机在空转,那么两边的文字几乎一样,后续汇总就没有证据可用。论文要解决的正是这种证据在第一步就被抹平的问题。
已有路线在相同输入和监督下能做什么,不能做什么?
第一条路线是有监督的音频差异描述。它输入两段音频,直接训练一个模型输出差异句。这条路线在差异类型明确且有人标注的成对数据时是直接的,但无监督异常检测的设定恰好缺少异常声,更缺少同一领域内的人工差异标注,因此难以照搬。
第二条路线是预定义属性增减标签。例如只预测音色属性是增强还是减弱。这种表示不需要差异句标注,但表达能力受限,写不出包含间歇性、低频、撞击感等组合细节的句子。
第三条路线是用现有音频描述数据自动构造差异训练数据。做法是随机配对音频片段,用大语言模型从各自的描述中派生差异句。这样可以扩大训练来源,甚至可能迁移到不同领域,但它仍然需要训练一个差异模型,并且随机配对的差异往往比较大,与同一机器正常与异常之间细微差别的分布不完全一致。
第四条路线是论文延续的免训练框架。先用预训练音频描述模型对正常声和异常声各自独立生成描述,再让大语言模型总结差异。它的优点是不需要差异标注也不需要针对差异任务训练,只付出推理时调用大语言模型的成本。缺点同样写得很明确:标准束搜索倾向于通用描述,两段相似声音的独立最优描述可能几乎相同,大语言模型只能说没有可听差别或给出空洞判断。后续的 2 阶段解码就是只动推理时解码,不动模型权重,试图在同一框架内补上判别线索。
为什么单条最优描述会把细微差别弄丢?
可以沿着一个样本走一遍失败过程。输入是一段正常带锯声和一段异常带锯声,人耳能听出异常侧多了一点间歇性高频成分或撞击感。音频描述模型是自回归模型,给定音频和已生成的前缀,逐词预测下一个词的对数概率,整句得分是各步对数概率之和。全局最优不可 tractable,常用束搜索在每一步保留得分最高的若干条扩展路径。
问题在于得分最高往往对应最常见、最安全的措辞。通用句在训练数据中出现得多,先验概率高,即使音频里有细微异常,模型也可能不冒险写出低频嗡鸣减弱或偶发撞击这类更具体但风险更高的词。两边各自独立做 1 次这样的保守选择,结果就是两句通用话高度重合。
举一个教学用的例子,不是论文报告的数值:正常侧输出机器在运转,异常侧输出机器在运转并带一点振动。如果汇总模型只看到这两句,它至多能说异常侧多了振动,但无法判断振动是持续还是间歇,是高频还是低频,是否伴随撞击。若两边连振动一词都没有,汇总只能认输。论文的思路因此不是让单句更准,而是让每侧 1 次给出多句、且两侧互相拉开,靠集合覆盖真相。
两阶段解码在整个管线里处在什么位置?
管线分成描述阶段和汇总阶段。描述阶段的输入是异常声和正常声,输出是每侧各一组文字描述。汇总阶段的输入是这两组文字加上一段提示词,输出是一句话的差异描述。提示词的大意是设定模型为音频质量分析员,给定两组短文本描述,推断第二段相对第一段的差别,只输出一句话。
音频描述模型 × 大语言模型汇总: 音频描述模型的分工是把每段声音独立转成文字候选,大语言模型汇总的分工是比较两组文字并压缩成一句差异句,两者搭配的原因是前者有声音到文字的接地能力而后者有文字间比较与归纳能力,组合意义在于不需要成对差异标注也能得到差异句,前提是前级文字里已经出现可比的判别线索。
新方法只改描述阶段的解码器。第 1 阶段叫音频内多样束搜索,对每段声音独立运行,目标是组内多样。第二阶段叫跨音频判别束搜索,不再独立,而是让一侧的生成参考另一侧第 1 阶段的候选,目标是两侧互斥。每个阶段每侧都保留多个组,每组多条束,最后每侧把两个阶段的候选并在一起交给大语言模型。
这样安排的理由在原文有明确分工。第 1 阶段解决单侧通用化,第二阶段解决双侧相似性。如果只做第 1 个阶段,两边可能各自多样但仍撞车。如果直接把两侧联合解码,作者担心解码成本上升过多,因此采用顺序 2 个阶段,先各自铺开再互相推开。作者也说明同样的跨音频判别项原则上可以接到核采样等其他解码策略上,但本文只实现并验证束搜索版本。
第一阶段如何让同一段声音说出不一样的话?
先把记号讲清。设输入声音为正常声或异常声中的一个,词表为有限集合,长度为 t 的候选由之前词序列扩展一个新词得到。每一步维护多个组,每组保留固定条数的束。组按顺序更新,第一组只按原始声学得分选最优扩展。从第二组开始,得分要加上与前面各组候选的差异奖励,权重为正的正则参数,差异用汉明距离度量并在参考集合上平均。
组内多样性 × 跨音频判别性: 组内多样性的分工是让同一段声音的不同束组说出不同侧面,避免所有候选都收敛到最通用的机器运转句,跨音频判别性的分工是让正常声音的候选主动远离异常声音另 1 阶段的候选,两者搭配的原因是只多样不互斥时两边仍可能各自多样却彼此重合,组合意义在于同时扩大单侧覆盖面并拉开两侧距离,提高汇总阶段拿到互补证据的概率。
具体动作是逐时间步、逐组筛选。候选集合是上一时刻本组保留路径与词表的笛卡尔扩展,从中按声学得分加组间差异惩罚选出前若干条作为本组当前时刻的束。重复更新所有组,就得到同一音频的多个组别描述。组数和每组束宽在实验中取相等,这是沿用多样束搜索文献中认为最高效的设置。
需要提醒的是,这里的多样是文字层面的互斥,不是声学层面的可解释性保证。模型可能用同义词、句式变化制造表面差异,也可能引入语法错误。原文报告正则参数在一定范围内输出变化不大,但再继续增大会增加语法错误,这就是多样性奖励的直接代价。
第二阶段如何让正常与异常两组描述互相推开?
第二阶段保持同样的分组结构,但打分多了一项跨音频差异奖励。生成正常声候选时,参考的是异常声第 1 阶段的全部组候选;生成异常声候选时,参考的是正常声第 1 阶段的全部组候选。权重是另一个正的正则参数。第一组的更新只含声学得分加跨音频差异项,从第二组开始同时加组内差异项和跨音频差异项。
多样束搜索 × 跨音频判别束搜索: 多样束搜索的分工是按组顺序更新并用与前面各组不同的惩罚项维持组间差异,跨音频判别束搜索的分工是在此基础上再加一项与另一段声音参考候选集不同的惩罚项,两者搭配的原因是前者只解决单音频内部的通用化,后者才解决双音频高度相似时的可比性,组合意义是形成先各自铺开再互相推开的 2 阶段推理时解码流程。
执行顺序是关键。外层是时间步循环,内层先对正常和异常各做完第 1 阶段的全部组更新,再对正常和异常各做第二阶段的全部组更新。也就是说跨音频参考用的是同一时间步另一侧第 1 阶段已经算好的候选,而不是上一时刻的旧候选。这种顺序设计沿用了多样束搜索逐组顺序更新的思想,目的是避免同时联合搜索带来的成本膨胀。
迭代到最大步数后,按原始声学得分在每组取最高序列,每侧每阶段得到与组数相等的句子数,2 阶段合并后每侧的描述集合规模翻倍。两组集合一起送入大语言模型做汇总。当集合里出现互补线索时,大语言模型更容易写出包含减少了嗡鸣、增加了间歇撞击等具体内容的差异句;若集合里仍无相关线索,汇总也不会凭空产生可靠细节。
本研究训练了什么,没有训练什么,真实计算是什么?
本研究没有训练音频描述模型,也没有训练差异描述模型。音频描述骨干沿用已有工作,即音频编码器加映射网络加文本解码器的结构,文本解码器为 GPT-2 类型,音频编码器与对比模型共用层次化音频 Transformer 结构。汇总阶段调用现成的大语言模型完成一句话压缩。所有可学习参数在本文实验中视为冻结,真实计算发生在推理时。
推理时的计算包括三部分。第一是音频编码与自回归解码,束搜索在每一步扩展、打分、截断,本文方法因为分组和 2 阶段使候选数和打分项多于单束基线。第二是差异惩罚的计算,需要在词序列之间算汉明距离并平均,这部分随组数和束宽增长。第三是大语言模型汇总,需要把两组多句描述 1 次性读入并生成一句输出,输入长度明显长于单句基线。
原文明确省略了此前工作中的基于对比相似度的后处理,理由是它与本文贡献正交且对基线和新方法都可用。这意味着复现时不需要实现该精修步骤也能比较解码本身的效果,但也不能把省略该步骤后的绝对分数直接等同于完整系统的部署分数。没有报告训练资源、推理延迟、每秒帧数或显存占用,因此不能从冻结参数得出系统输出确定或延迟更低的结论。
在什么声音上测,与谁比,条件是否一致?
测的是干净机器声的正常与异常配对,目的是聚焦机器状态本身的细微差别,避免背景噪声成为可比线索。数据来自两个来源,一是 DCASE 2022 任务二的 MIMII-DG,二是 DCASE 2023 任务二评估集中新引入的 3 种机器类型。配对按工况随机匹配正常与异常,阀门类被省略,原因是所有方法都未能抓住其点击声的轻微音色变化,这个失败边界被明确留下而没有用猜测圆场。
比较对象包括 4 个可运行策略。基线是原始检索增强单束方法,用普通束搜索独立生成单条描述后汇总。第二个是只做多样束搜索的变体,相当于只保留第 1 个阶段。第三个是完整 2 阶段方法,同时做组内多样和跨音频判别。第 4 个是有代表性的学习型差异描述方法,在中间粒度输出上与本文方法句子长度最接近,以保证细节量级可比。描述骨干在可比方法间保持一致,汇总用同一大语言模型与同一提示词。
下表把解码配置的比较问题固定下来。公平条件是总束预算对齐与骨干一致,指标方向是后续主观评分越高越好,代价是束数与惩罚项带来的计算与语法风险。表中数值保留原文写法,裸值不擅自加单位。
| 方法 | 每侧总束预算 | 组数与每组束宽 | 组内多样权重 | 跨音频判别权重 |
|---|---|---|---|---|
| 检索增强单束基线 | 25 | 单组多束 | 0.0 | 0.0 |
| 仅多样束搜索变体 | 25 | 5 组每组 5 束 | 5.0 | 0.0 |
| 参数鲁棒区间 | 不适用 | 不适用 | 3.0 | 7.0 |
表前已提出比较问题与公平条件,此段解释表的来源与限制。束宽与组数的对应关系来自原文对后两种方法取相等设置与对基线取更大总束宽的说明,权重取值来自原文设定的正则参数与鲁棒区间观察。最后一行不是一个可运行方法,只表示权重在该区间内输出变化不大,超出后语法错误增加,因此不能把该区间理解成性能最优区间。表格没有包含推理时间与显存,比较时只能谈描述质量,不能谈效率胜负。
主观评分如何组织,客观分析又在量什么?
主观评估针对每对音频的差异句。3 名非专家听众听每对音频,按 5 点量表打分,从完全不匹配到完全匹配,中间档覆盖部分匹配但有错误、一般匹配、大体良好。评分要求是差异句是否说出可辨别的差别且避免错误陈述,不评流畅度或语言自然度。平均意见分按机器类型和总体平均汇报。
客观分析不看最终一句话的好坏,只看描述集合是否为另一侧提供了新信息。做法是固定每种方法每侧恰好 5 句,保证比较起点一致。基线从 25 条束中取分最高的 5 条假设,多样束搜索取每组最高 1 条共 5 条,完整方法取第二阶段每组最高 1 条共 5 条。另设一个对照,独立运行更大组数的多样束搜索但只取后 5 组,用第 1 阶段的前 5 组充当参考,以分离跨音频判别项相对独立多样解码的增量。
两个客观量各有分工。语义重叠用句子嵌入余弦相似度衡量,对每句算它与另一侧 5 句的最大相似度再平均,取最大是因为只要对方有一句能对上就不算新信息。词汇新颖性用双词组衡量,收集一侧 5 句的全部双词组,数其中未出现在另一侧双词组集合中的个数与比例。语义相似度低不等于最终差异句正确,词汇新颖也不等于声学真实,它们只是描述集合可比性的代理指标。
| 评估范围 | 总音频对数 | 来自早期数据集对数 | 来自新机器类型对数 | 基线判为无差异对数 |
|---|---|---|---|---|
| 全部干净机器声配对 | 33 | 24 | 9 | 7 |
| 配对方式与省略项 | 33 | 24 | 9 | 0 |
表前已说明要回答的评估规模问题,此段解释表中数字的含义与边界。总数与两部分来源数来自原文按工况随机匹配的说明,基线输出无可听差别的计数来自原文对 7 对失败的报告,而完整方法在这些配对上没有出现同样的认输输出。第二行表示省略阀门类后仍保持总数不变的口径,最后一格为 0 表示完整方法未产生该特定认输句,不表示它在所有配对上都正确。表格不包含每台机器的平均意见分数值,因为原文以图形汇报而无可逐字引用的连续数值句,此处不硬写像素读数。
完整方法相对基线和学习型方法改变了什么?
论文报告的总体趋势是完整 2 阶段方法平均意见分高于原始单束基线,并在多台机器上高于只做第 1 阶段的变体,说明跨音频判别阶段带来了单侧多样之外的增量。基线在 33 对中有 7 对直接输出没有可听差别,而完整方法没有产生这种认输句。代表性例子显示基线未能指出任何差别,多样变体抓住了嗡鸣减少,完整方法进一步写出间歇增加的振荡撞击声。这支持多句互斥集合能让汇总模型看到更宽的差别谱。
与学习型差异方法的比较更细。完整方法在齿轮箱、带锯、磨床 3 类上更高,在其他机器上互有胜负,总体上在没有训练专用差异模型的情况下达到可比或更好的平均表现。例子层面,完整方法在带锯例子里补充了撞击声,在齿轮箱例子里用增加的振动或 rattling 代替了动态、多变这类较粗的词。这些是论文用实例支持的判断,不是跨所有样本的保证。
必须同时保留未胜出项。滑块例子是完整方法分数最低的例子之一,学习型方法正确描述了音高变化,而检索增强类方法只提到次要线索或给出难以解释的描述。论文给出的有限解释是学习型方法在多样差异数据上训练后对音高类差别泛化更好,而基于独立描述的方法除非底层描述主动提到音高,否则容易漏掉。这是一个明确的适用边界:若差别主要在音高且底层描述词表很少谈音高,多样与互斥只能增加偶然命中率,不能保证覆盖。
第一阶段和第二阶段各自贡献了什么证据?
客观分析把两个阶段拆开。相对普通束搜索,完整方法压低了句子嵌入相似度的上尾,极高相似的撞车情形大多消失,而低相似区间的分布保持可比。这意味着方法主要消除的是两边几乎说同一句话的失败,而不是把所有句子都推向语义无关。词汇层面,完整方法增加了新颖双词组的数量。基线的新颖双词组比例看起来不低,但论文指出这是因为基线句子更短,分母小导致比例虚高,因此应看计数与比例的联合表现,而不是单看比例。
对照实验进一步分离第二阶段的作用。只取后 5 组的独立多样解码对照与显式跨音频判别解码相比,后者在语义与词汇指标上仍更能拉开两侧,支持跨音频惩罚项不是简单增加组数就能替代的。但同样要说明限度:这些指标只证明描述集合更不相同,没有证明每一句都声学为真。语法错误随权重增大的观察提醒我们,过度推开可能以语言质量为代价,而主观评分明确不评流畅度,因此语言代价在主要指标里是被屏蔽的。
复述时应把结论限定为支持而非证明。证据支持 2 阶段解码提高了判别线索出现在集合中的机会,从而帮助汇总,但不支持它在所有机器、所有差别类型上都成立。阀门类的整体失败与滑块音高例子的落后就是现成的反例,说明在某些细微音色与音高差别上,当前管线仍缺关键表示。
哪些差别仍说不好,哪些量根本没有测?
直接报告的失败包括阀门类点击声的轻微音色变化,所有方法都未抓住,已被移出主评估并留作未来工作。滑块类音高变化是另一个弱点,基于独立描述的方法容易只写次要线索。正则参数过大增加语法错误,说明判别奖励不是越大越好。2 阶段合并使送入大语言模型的文字量翻倍,推理成本高于单句基线,但原文未给出延迟、吞吐、显存或调用费用的测量,因此不能承诺效率改善或成本可忽略。
未测量的量需要逐项点名。没有误判率实验,差异句写得具体不代表异常判断更准。没有统计显著性方法与置信区间的说明,3 名非专家评分的聚合方式只给出平均,没有报告一致性。没有在带噪录音上的主结果,干净声的选择是为了聚焦状态差别,但部署中噪声是常见干扰,结论不能直接推广到带噪场景。没有对提示词敏感性、不同大语言模型、不同音频描述骨干的系统比较,复现时更换其中任一环节都可能改变绝对效果。
相关性与因果也要分开。客观指标与主观分数同向变化支持集合差异性与汇总质量相关,但不能证明新颖双词组越多差异句越正确,因为新颖词可能是幻觉。论文没有把词汇新颖性当成正确性,这一点在复述时必须保留,否则会夸大方法的保证。
要复现这个方法,先做什么,后验证什么?
先固定可运行的最小闭环。准备 1 对干净的正常与异常机器声,按同一工况配对。加载与原文一致的音频描述骨干与映射加解码结构,不做任何差异训练。实现分组束搜索,先做音频内多样阶段,再做跨音频判别阶段,组数与每组束宽取 5,组内与跨音频权重取 5.0,最大步数与分词、停句规则与所用解码器保持一致。每侧保留 2 阶段候选后,用同一提示词让大语言模型只输出一句话。
再补 3 组验证。第一组是基线对齐,普通束搜索取更大总束宽并只保留单条或前 5 条假设,保证总候选预算可比。第二组是消融,只关跨音频权重得到仅多样变体,再与完整方法对比,以确认增量来自跨音频项而非组数。第 3 组是失败 probing,专门构造音高变化与轻微音色变化样本,检查底层独立描述是否出现相关词汇,若底层从不提音高,则不应期待汇总凭空写对音高。
信息条件与开源状态必须如实写。当前没有可用的代码、模型或数据链接证据,因此只能按论文文字复现,不能声称官方实现已公开。权重下载与系统可运行是三件不同的事:即使描述骨干权重可得,分组与跨音频惩罚的解码逻辑仍需自行实现,大语言模型调用版本与提示词细节也会影响输出。还需补的验证包括带噪条件、更多评分者与一致性报告、不同骨干与不同汇总模型的稳健性,以及推理开销的实测。
何时值得尝试这个思路,如何一句话记住它?
当任务满足 3 个条件时值得尝试:异常样本不可得因而无法训练专用差异模型,手头有通用音频描述模型且它能用通用词谈论目标机器声,正常与异常声音高度相似而单句描述总是撞车。此时把推理预算花在多组互斥描述上,比反复调单束的截断策略更可能给汇总留下证据。若差别主要在音高或极细微音色,且底层描述很少使用相关词汇,则应先验证词汇覆盖,否则多样解码的收益会打折。
检索增强差异描述 × 跨音频判别解码: 检索增强差异描述的分工是提供整体框架,先检索可比正常声再生成描述再汇总,跨音频判别解码的分工是替换其中独立单束解码的薄弱环节,两者搭配的原因是框架解决了无异常训练数据时的流程可行性而解码解决了相似声音下证据不足的问题,组合意义是在不训练差异模型的前提下把细微声学差别保留到最后的文字比较环节。
一句话记忆是先各自说开再互相说开,最后让第三方总结成一句。各自说开对应组内多样,互相说开对应跨音频判别,第三方总结对应大语言模型的一句话压缩。记住这个顺序就记住了复现顺序,也记住了代价所在:描述集合变大、输入变长、语法风险上升,而正确性仍受底层描述诚实度的约束。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
区域 5 · 查看论文原页
区域 6 · 查看论文原页
区域 7 · 查看论文原页
区域 8 · 查看论文原页
另有 24 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses







