英文题目:MASKED WAVELET SCATTERING TRANSFORM NEURAL FIELD FOR SOUND FIELD RECONSTRUCTION
会议身份:
conference:eusipco:2026:conference-paper-id:0000341
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#信号处理 #低资源 #空间音频信号 #声场重建
评分:5.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Luan, Xinmeng:机构信息未能从会议 PDF 纯文本可靠映射
- Verburg, Samuel A.:机构信息未能从会议 PDF 纯文本可靠映射
- Fernandez-Grande, Efren:机构信息未能从会议 PDF 纯文本可靠映射
- Scavone, Gary:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
声场重建需从7×7稀疏观测恢复1730点连续头相关传输函数幅度场,难点在于可用被试极少而个体差异大,深度模型易过拟合稀疏点并丢失多尺度结构。掩码小波散射神经场第一阶段在10个被试上联合优化预测场与二值加权掩码,筛选跨个体一致的小波散射通道并输出冻结掩码。第二阶段以多层感知机神经场拟合单个目标的稀疏观测,并将冻结掩码后的散射损失与观测损失联合优化以正则化连续重建。与直接约束全部散射系数的方法不同,二值掩码显式阻断向参考个体的复制漂移,仅保留可泛化的统计先验,因而更适配小样本声场外推。在HUTUBS仿真数据集7个频率与Subjects 6-10双耳平均的评测设置下,MSNF的指标对数谱失真LSD为5.34 dB,低于NF的指标对数谱失真LSD 6.10 dB。实验仅建模幅度并将数据重采样至规则网格,球谐基线截断处理也影响对比口径。该结论适用边界受限于单库仿真评估,尚未验证相位建模、外推与跨库泛化,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪一处困难?
本文的输入是稀疏的声场测量,目标是从这些稀疏点恢复整个空间上的声场。作者把问题限定在频域声压的幅度部分,记为在 2 维空间坐标上的连续函数,实际只能通过传声器阵列得到离散采样版本。输出要求是全空间的重建,理想是连续形式,实际用足够高分辨率的近似代替,文中也称之为上采样问题。作为概念验证,作者选择头相关传输函数上采样,也就是给定少数空间方向上的头相关传输函数幅度,推断全部 1730 个空间角度上的幅度。
需要保留的关键信息是数据稀缺与个体差异并存:一方面测量头相关传输函数实验成本大,可用数据集远小于计算机视觉,深度学习容易过拟合;另一方面不同人的头相关传输函数由各自解剖结构决定,在某些尺度上相似、在另一些尺度上差异很大。于是目标不是简单拟合观测点,而是显式利用多尺度表示,只保留在有限数据集中表现一致的特征。
本文开场就要交代输出是 1 篇可核对的方法复述:只讲原文实际做的幅度重建、2 阶段流程和对照条件,不扩展到相位重建或未报告的效果。
已有路线有哪些,本文站在哪一条线上?
第一条线是声场重建与头相关传输函数插值。传统做法包括基于球谐展开的方法,用截断球谐基做最小二乘拟合,再重建到任意采样方案;深度学习做法包括生成模型、物理信息神经网络、可微物理模型,以及近期受到关注的神经场方法,即把目标表示为坐标到声压的连续函数。原文引用了检索增强神经场和考虑被试与数据集的神经场等工作,说明神经场已成为头相关传输函数建模的候选骨干。第二条线是小波散射变换。
它通过小波卷积级联与非线性模运算提取多尺度特征,得到近似平移不变的表示,可看作滤波器固定且有数学保证的卷积网络,在小数据集上曾显示出优于端到端学习卷积网络的潜力。应用上,它既被用作无需训练的骨干,也被用作固定编码器配合可学习网络,还被用于微正则梯度下降类的随机场生成、音频分类、音频纹理合成和感知声音匹配。特别是把联合时频散射特征放进优化损失做声音匹配的思路,与本文把散射系数放进重建损失的直觉相近。
第三条线是非均匀场的掩蔽处理,原文提到有用像素空间掩蔽处理非均匀场的工作,但掩蔽是人工定义的。本文的定位是首次把小波散射变换作为声场重建的先验,并把人工掩蔽改为从小规模多被试数据中自适应学习的二值掩蔽。教学上可以这样理解例子:球谐好比用一组全局光滑基去拟合,神经场好比用一个连续函数拟合器去拟合,而本文是在拟合器之外再加一个多尺度统计检查员,只检查那些大家都一致的通道。
问题如何形式化,观测与待求量分别是什么?
沿一个样本走完流程有助于建立依赖关系。输入是某个被试、某个频率、某个耳朵的稀疏观测,例如从 7×7 等间隔观测网格出发。表示阶段把该头相关传输函数看作 2 维图像,坐标对应方位角与仰角,取幅度并归一化处理。组件阶段先用小波散射变换把全空间场变成零阶、1 阶和 2 阶系数的集合,再用掩蔽向量对这些系数加权。目标阶段要求重建的连续场同时满足两件事:在稀疏观测位置与实测值接近,在加权散射系数上与参考实现的对应系数接近。
输出是全空间高分辨率幅度的连续神经场,可在 1730 个评估角度上采样比较。原文做了简化声明:只考虑幅度分量,把实部虚部分开处理是提到的备选但未采用;把球坐标问题当作图像处理是为了通用框架,作者认为已足够引入方法,球坐标建模可能更好但未在本研究中采用。这些简化是复述时必须保留的边界,不能把幅度结果推广为复数声场结果。
两阶段框架的全景是什么,谁训练谁冻结?
本文提出掩蔽小波散射变换神经场,简称 MSNF,分为两个阶段。第 1 阶段叫掩蔽识别,从有限的多被试数据集中学习掩蔽系数;第 2 阶段叫神经场重建,用学到的掩蔽指导单个头相关传输函数的重建。第 1 阶段同时优化多个预测数据实现和掩蔽向量,损失包含数据项与散射项;第 2 阶段为每个待重建的头相关传输函数单独训练一个多层感知机,损失包含观测损失与掩蔽散射系数损失,并采用两子阶段训练策略。
原文明确的可训练量是:第 1 阶段可训练的是掩蔽与估计场,第 2 阶段可训练的只是网络参数。参考实现的选择是第 2 阶段用第 11 号被试的散射系数作为掩蔽散射损失的目标,原文说明第 1 阶段中任一被试都可选,但实验固定选 11 号。整个重建以单样本单网络的方式进行,每个头相关传输函数都要训练一个独立网络,这意味着方法不是 1 次训练后前向推理多个新人的生成模型,而是每个新人都要做 1 次优化。
小波散射变换 × 神经场: 小波散射变换负责提供固定的多尺度统计描述子,它用级联小波卷积加模运算抽取平移不变的零阶、1 阶和 2 阶系数;神经场负责提供连续空间坐标到声压幅度的可优化映射,它以多层感知机表示整个待重建场;二者搭配的原因是稀疏观测本身不足以约束全空间插值,需要把散射系数差异作为正则项加进损失,让神经场在拟合观测点的同时其全空间输出的散射统计向参考实现靠拢,组合后新增的作用是把先验从像素空间搬到可解释的多尺度统计空间。
散射系数如何计算,掩蔽以什么方式作用?
小波散射的计算按阶数展开。零阶是信号与局部平均滤波器的卷积,得到大尺度平均,近似平移不变但丢失高频。1 阶是对信号与一组膨胀旋转后的莫莱小波卷积取复模,再做局部平均;2 阶是对 1 阶取模后的结果再做 1 次同样的小波变换取模并平均,用于找回 1 阶平均丢失的高频信息。原文只计算尺度递增路径,因为非递增路径被认为不携带能量,并把展开截断到 2 阶,因为更高阶能量很小可忽略。
最终散射系数是零阶、1 阶和 2 阶的拼接,总数由尺度数与方向数决定,原文给出总数表达式为 1 加尺度方向项再加 2 阶组合项。掩蔽是一个与散射系数等长的向量,通过哈达玛积逐系数相乘加权。直觉是跨实现相似的系数应得大权重,差异大的系数应得小权重。第 1 阶段的散射损失是预测数据与随机挑选的目标数据的加权散射系数均方误差,随机挑选的设计是为了迫使掩蔽去发现共性而非记住某个固定配对;若没有该项,联合优化将退化为平凡拟合。
掩蔽 × 散射系数: 散射系数负责罗列从粗平均到不同尺度与方向组合的全部多尺度能量通道;掩蔽负责给每个通道一个权重,大的权重表示该通道在多个人之间高度相似因而可迁移,小的权重表示个体差异大因而应忽略;搭配的原因是头相关传输函数既有跨人共享的结构也有很强的个性化解剖差异,若不加区分地约束全部系数会把参考人的个性细节复制过来,组合后新增的作用是只保留一致性统计结构的可控筛选器。
随后需要说明网络侧的组件。骨干是多层感知机,输入空间坐标,输出对应声压。输入先转到笛卡尔坐标,再经随机傅里叶特征层做正弦映射,然后接单隐层与双曲正切激活。随机傅里叶特征的作用在原文中明确对应缓解谱偏置,即网络学低频快、学高频难的问题。
随机傅里叶特征嵌入 × 谱偏置: 谱偏置指神经网络先学低频、难学高频的现象,它会让高频耳廓细节被平滑掉;随机傅里叶特征嵌入负责把输入坐标先经正弦变换映射到更高维空间,人为提供高频基;搭配的原因是 HRTF 上采样恰恰需要在高频重建出瓣结构,组合后新增的作用是让单隐层多层感知机也能表达高频空间变化,而不是只靠加深网络。
两个阶段的损失与训练顺序是什么?
第 1 阶段的训练采用批量学习,每批包含多个不同的目标数据实现,以及从全部目标数据中随机选择的散射系数。损失由两项组成:数据损失是预测与目标在空间点上的均方误差,散射损失是加权散射系数的均方误差,总损失是散射损失加小正权重乘数据损失。原文把权重记为阿尔法并取很小的值,实验取千分之一,批量大小取 10,第 1 阶段在 200 轮结束。
需要指出原文未完整报告掩蔽的初始化、是否约束为严格二值还是连续松弛后二值化、以及梯度如何流过掩蔽的具体实现,这些缺项在复述时应标为未报告,不从名称推定实现。第 2 阶段的损失同样有两项:观测损失是在稀疏测量位置的预测与观测均方误差,掩蔽散射损失是在对应空间位置对预测与所选目标实现做小波散射变换后的加权均方误差,总损失是两个权重分别加权之和,并用 GradNorm 自适应平衡两个权重。
训练顺序是两子阶段:前 100 次迭代只用观测损失训练,之后再用总损失训练,总共 400 轮。优化器采用在自适应矩估计特征基下的洗牌优化 2 阶方法。两个阶段使用基于可用空间坐标的不同数据集划分,并采用全批量训练。
观测损失 × 掩蔽散射损失: 观测损失负责在稀疏测量位置上约束预测值与实测值的数据保真;掩蔽散射损失负责在重采样后的规则网格上约束预测场与参考场的加权散射系数距离;搭配的原因是前者只管已知点、后者管全空间的统计合理性,二者用权重因子平衡并用 GradNorm 自适应调节,组合后新增的作用是在欠定逆问题中同时保证已知点准确和未知点不偏离跨人共性。
网络与优化超参数如何设置,复现先对齐什么?
复现时先对齐网络与优化配置,再谈结果。输入是方位仰角,先转笛卡尔坐标,再经尺度参数为 1 的随机傅里叶特征层,然后是 256 单元单隐层加双曲正切激活。第 1 阶段批量大小为 10,权重阿尔法为千分之一,第 1 阶段在 200 轮结束。第 2 阶段总共 400 轮,其中掩蔽散射约束从第 100 轮开始加入。优化器为 2 阶洗牌优化方法在自适应矩估计特征基下的变体。
损失权重用梯度归一化策略自适应平衡。下表把训练配置整理为可核对条目,阅读问题是给定相同数据时训练预算与启动时机是否一致,公平条件是所有神经场类方法共享骨干结构,指标方向不在此表而在结果表。
| 阶段 | 参数 | 取值 | 启动或结束 | 备注 |
|---|---|---|---|---|
| 第 1 个阶段 | 批量大小 | 10 | 全批量之外的批量学习 | 随机选目标散射 |
| 第 2 个阶段 | 隐层宽度 | 256 单元 | 单隐层加双曲正切 | 随机傅里叶尺度 1 |
| 第 2 个阶段 | 总轮数 | 400 轮 | 第 100 轮加入散射项 | 两子阶段策略 |
| 基线对照 | 球谐基线 | 4 阶截断 | 35 阶用于重采样 | 无掩蔽版无 2 个阶段 |
表后解释代价与反例。两子阶段的含义是先让网络拟合观测点,再加入统计正则,避免早期被参考实现带偏。
无掩蔽版本不用该策略,因此它的偏差 partly 来自缺少预热与缺少筛选的混合影响,不能把它的全部差距都归因于掩蔽。每个头相关传输函数单独训练意味着计算量随被试数、频率数和耳侧线性增长,原文未报告硬件、时长与推理延迟,这是复现预算中的缺项。
数据、划分、网格与对照条件是否一致?
实验在头相关传输函数开源仿真数据集 HUTUBS 上进行,该数据集空间分辨率较高,有 1730 个空间角度,覆盖方位角与仰角范围,计算半径为 0.74 米。评估频率取 7 个,从 2067 赫兹到 14470 赫兹。第 1 阶段用 10 个被试即 11 号到 20 号识别掩蔽,第 2 阶段以 11 号被试散射系数为参考,对 6 号到 10 号被试做方法评估,左右耳独立处理并视为两个通道。实现上每个通道、每个频率、每个被试的头相关传输函数被当作 2 维图像,坐标对应方位与仰角,只用幅度。
为满足 2 维小波散射库对等间隔网格的要求,数据用球谐重采样到 24×24 规则网格,方位与仰角区间分别取 0 到圆周率与 0 到 2 倍圆周率;测试观测则重采样到 7×7 网格。两种重采样都用球谐并截断到 35 阶。比较对象包括球谐插值、神经场和无掩蔽的散射神经场。球谐插值在实验中截断到 4 阶,作者说明这是基于实验结果表现最好的选择。
纯神经场采用与第 2 阶段相同的网络结构,只用观测损失训练。无掩蔽版本只优化总损失且不采用两子阶段策略,因此对照链同时检验了骨干、散射约束与掩蔽筛选各自的作用。下表把数据与网格条件整理为可核对的配置,表中数值与单位均来自原文连续句,阅读时先确认比较问题是不同方法在相同观测与评估网格下比较,再看指标方向。表前说明至此已给出公平条件与指标方向,表中条件列即为复现时必须对齐的划分与网格。
| 条件 | 指标或参数 | 取值一 | 取值二 | 说明 |
|---|---|---|---|---|
| 评估频率 | 频率点,赫兹 | 2067,4134,6200 | 8269,10336,12403,14470 | 共 7 个频率点 |
| 被试划分 | 被试编号 | 11 号到 20 号共 10 人 | 6 号到 10 号用于评估 | 参考取 11 号 |
| 散射网格 | 网格尺寸 | 24×24 规则网格 | 方位 0 到圆周率 | 仰角 0 到 2 倍圆周率 |
| 重采样阶数 | 球谐截断阶数 | 35 阶用于重采样 | 4 阶用于球谐基线 | 基线选最优阶数 |
| 观测网格 | 稀疏观测 | 7×7 等间隔网格 | 评估 1730 点 | 幅度归一化到 0 到 1 |
表后需要解释主要收益与代价。
统一网格与统一频率保证了比较的公平性,但也带来代价:2 次球谐重采样本身会引入误差,24×24 网格是对连续场的离散近似,7×7 观测是非常稀疏的条件。未胜出项在后文结果中体现,这里先记下边界:原文只验证幅度,未验证相位;左右耳独立处理,未利用双耳关联;球坐标建模的潜在增益未评测。
主结果测什么,谁在什么指标上更好?
测量问题是从 7×7 稀疏观测插值到与真值数据集匹配的 1730 个空间点,比较对象是球谐、纯神经场、无掩蔽散射神经场与本文掩蔽版本。指标有 3 个:对数谱失真衡量参考与估计在方向与频点上的谱相似度,越小越好;归一化均方误差衡量幅度误差能量占比,越小越好;归一化互相关衡量波形结构相似度,越大越好。聚合口径是跨评估被试与双耳的平均。
原文报告掩蔽版本在 3 个指标上都最优,具体为对数谱失真 5.34,归一化均方误差 0.14,归一化互相关 87.79%,而球谐、纯神经场和无掩蔽版本的对应值分别为对数谱失真 6.64、6.10、6.37,归一化均方误差 0.23、0.20、0.21,归一化互相关 69.66%、84.74%、79.37%。支持的判断是掩蔽的统计先验在只有少量实现时仍能提升重建,且即使无训练数据的单层感知机单样本表示也能超过常用球谐基线。
限制是总体平均最优不等于每个频率每人每耳都最优,原文未给出按频率或按被试的分解与显著性检验,因此不能把平均趋势推广为全程成立。下表为核心结果的数字对照,表中策略均为实际可运行策略,未用事后最优值代替。
| 指标方向 | 球谐基线 | 纯神经场 | 无掩蔽散射神经场 | 本文掩蔽版本 |
|---|---|---|---|---|
| 对数谱失真越小越好 | 6.64 | 6.10 | 6.37 | 5.34 |
| 归一化均方误差越小越好 | 0.23 | 0.20 | 0.21 | 0.14 |
| 归一化互相关越大越好 | 69.66% | 84.74% | 79.37% | 87.79% |
表后解释收益与代价。
最大收益出现在互相关与谱失真上,说明掩蔽版本更好地保持了整体瓣结构;代价是每个样本都要优化 400 轮,且依赖 11 号参考与 10 人掩蔽。未胜出项值得注意:纯神经场已明显好于球谐,说明连续表示本身就有收益;无掩蔽版本在互相关上反而低于纯神经场,说明不加筛选的散射约束可能有害,这正是需要掩蔽的反证。
球谐插值 × 散射神经场: 球谐插值负责用截断球谐基的最小二乘拟合作传统连续基线,它代表无学习先验的常用做法;散射神经场负责在同样神经场骨干上加无掩蔽的散射约束,它代表有统计先验但无筛选的对照;搭配比较的原因是只有同时看到传统基线、纯神经场、无掩蔽版本和有掩蔽版本,才能分离出神经场连续表示的收益和掩蔽筛选的收益,组合后新增的作用是构成消融链条,证明改进来自保留一致结构而非单纯增加约束。
掩蔽是否必要,无掩蔽会发生什么?
消融链由 3 个对照构成:球谐代表传统基线,纯神经场代表去掉一切散射约束,无掩蔽散射神经场代表保留散射约束但去掉掩蔽与两子阶段。原文的高频例子取第 6 号被试右耳 14470 赫兹,压力归一化到 0 到 1 区间,从 7×7 观测插值到 1730 点。定性描述是掩蔽版本最接近真值,在保持整体结构的同时细节更精细;无掩蔽版本的精细化偏离了纯神经场的重建,反而更像已知的 11 号参考实现;球谐出现伪影且未能抓住瓣结构,而神经网络类方法能抓住瓣结构。
机制解释是无掩蔽约束会把参考人的个性细节复制过来,掩蔽的作用就是阻断这种复制,只允许一致通道通过。需要区分直接报告与有限解释:复制现象是作者对该高频例子的定性观察,有图为例证,但原文未给出复制程度的定量度量,也未报告去掉两子阶段但保留掩蔽、或保留两子阶段但去掉掩蔽的细粒度消融,因此不能把无掩蔽版本的全部差距都精确归因于掩蔽权重。
教学例子是把参考人想象成口音很重的朗读者,无掩蔽好比要求学生连口音一起模仿,掩蔽好比只要求模仿大家一致的语法而不模仿口音。
哪些边界未评测,哪些推测尚未验证?
第一,已验证的只是幅度重建,实部虚部作为 2 通道的备选在原文中明确提到但未采用,相位误差、双耳线索与后续听感的影响未测量,不能承诺听感改善。第二,数据边界是 HUTUBS 仿真数据的子集,第 1 个阶段 10 人、评估 5 人、参考固定为 11 号,换参考人是否稳定、更少或更多人时掩蔽是否稳定、跨数据集泛化如何,均未报告,属于待验证。第三,网格边界是 24×24 规则网格与 7×7 观测,7×7 之外的稀疏度、非均匀采样、噪声条件与球坐标建模的潜在增益未评测。
第四,成本边界缺失:训练资源、推理开销、输出帧率与实际延迟未分别讨论,不能从总体平均改善推定每步延迟改善。第五,方法表述缺项:掩蔽的初始化与二值化方式、梯度路径、随机选择目标的具体分布、GradNorm 的更新频率均未完整交代,复现时需把这些记为缺项而非自行假定。原文的相关性不等于因果,例如高频例子中掩蔽版本与真值相似支持了掩蔽有用,但单样本定性例子不能证明所有高频都如此。
资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开,只能按论文引用的数据集名称与库名称去核对原文。
复现先做什么,需要保留哪些超参数与信息条件?
先准备数据:获取 HUTUBS 仿真头相关传输函数,取 7 个指定频率,划分 11 号到 20 号做掩蔽识别、6 号到 10 号做评估、11 号做参考,左右耳独立处理,只取幅度。用球谐把散射计算用数据重采样到 24×24 规则网格,把观测重采样到 7×7 网格,重采样截断 35 阶,基线截断 4 阶,评估采样到 1730 点并把幅度归一化到 0 到 1。再实现散射:用小波散射库计算零阶到 2 阶系数,只保留尺度递增路径,拼接为完整系数向量,掩蔽向量与之等长并做哈达玛积。然后实现 2 阶段优化:第 1 阶段批量 10、阿尔法千分之一、200 轮,同时学场与掩蔽。
第 2 阶段用单隐层 256 单元加双曲正切与尺度为 1 的随机傅里叶特征,前 100 轮只用观测损失,后 300 轮加入掩蔽散射损失并用梯度归一化平衡权重,总 400 轮,每个频率每个被试每耳单独训练。评估时按原文聚合口径计算对数谱失真、归一化均方误差与归一化互相关,注意百分点与相对百分比不同,不同指标差值不能混放。还需补的验证是更换参考人、改变稀疏度、报告按频率分解与多次随机的波动,以及记录硬件与时长。
若复现中发现表头、图注或算术冲突,应明确标注冲突而不自行编造划分来圆成一致。
何时值得尝试,一句话收束是什么?
当重建任务满足 3 个条件时值得尝试本文思路:观测非常稀疏但需要在全空间得到连续估计,可用先验数据很少且个体差异大,以及多尺度结构中有部分跨样本一致、部分高度个性化。此时可先用小规模多样本学一个通道级掩蔽,再在单样本重建中只约束一致通道,避免把参考个体的细节复制过来。若数据量充足或个体差异很小,直接学习或全局约束可能更简单;若连少量多样本都没有,掩蔽无从学习,方法退化为纯神经场。
本文的中心判断是改进来自筛选而非约束本身,无掩蔽约束反而可能低于纯神经场就是证据。收束时回到可核对事实:在 7×7 到 1730 点的幅度上采样条件下,掩蔽版本在平均对数谱失真、归一化均方误差和归一化互相关上优于球谐、纯神经场与无掩蔽版本,但结论限于幅度、限于所用划分与网格,且每个头相关传输函数需单独优化,未验证相位、延迟与跨数据集泛化。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
区域 5 · 查看论文原页
区域 6 · 查看论文原页
区域 7 · 查看论文原页
区域 8 · 查看论文原页
区域 9 · 查看论文原页
区域 10 · 查看论文原页
区域 11 · 查看论文原页
另有 16 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses










