英文题目:PERCEPTUALLY ALIGNING REPRESENTATIONS OF MUSIC VIA NOISE-AUGMENTED AUTOENCODERS

会议身份:conference:eusipco:2026:conference-paper-id:0000041

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #听觉与音乐认知 #音乐 #音频编码

评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Bjare, Mathias Rose:机构信息未能从会议 PDF 纯文本可靠映射
  • Cantisani, Giorgia:机构信息未能从会议 PDF 纯文本可靠映射
  • Pasini, Marco:机构信息未能从会议 PDF 纯文本可靠映射
  • Lattner, Stefan:机构信息未能从会议 PDF 纯文本可靠映射
  • Widmer, Gerhard:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理从音乐音频估计感知惊奇度的问题,输入为高维音乐波形压缩后的潜序列,输出为与人类期望一致的信息内容 Information Content / IC 及对脑电响应的预测增量,难点在于常规自编码器潜空间缺乏感知显著性与粗细结构的对应排序。方法链分三步:先以噪声增强潜变量微调一致性自编码器 Consistency Autoencoder / CAE 使粗结构承载感知关键信息,再用因果 Transformer 汇总历史上下文,最后以自回归整流流 Rectified Flow 模型估计下一帧负对数似然作为惊奇度。与冻结表征加扩散不同,该训练迫使同一输入在多信噪比下同时满足感知重建损失。与已有方法相比的关键差异是将扩散的频谱信噪比偏置反向用于表征学习,而非仅用于生成。在合成爱尔兰单声部数据集 SYN 与歌声数据集 VOC 上,对齐空间在中间噪声水平与符号期望模型 IDyOM 的 Spearman 秩相关达到峰值并高于未对齐空间与基线,且在歌声脑电编码中于 \(t\) 为 0.2 到 0.6 范围显著更优。结论仅在音高主导的单声部与歌声场景验证,未证明对节奏音色等特征的外推性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要交付什么?

输入是 1 篇研究音乐感知表征的英文论文,目标读者是刚进入语音音乐音频方向的研究生。目标任务有两个层面,一是让自编码器的潜表征按感知显著性组织起来,二是证明这种组织能改善潜扩散模型的解码与音乐惊奇度估计。必须保留的信息包括自编码器如何加噪微调、感知损失扮演什么角色、自回归整流流如何算信息量、重建实验与两类惊奇度实验的条件与对照,以及原文明确承认的代价与未验证部分。输出是 1 篇可核对、可复述方法的中文技术解读,不做营销式判断,教学用的例子会标为例子,不虚构数值。

音乐欣赏与认知中的核心现象是自我相似性形成预期,而实际输入违背预期时产生新颖感或惊奇感。计算建模常用自回归预测的负对数似然或信息量来估计这种惊奇,并在行为与神经层面得到过验证。但此前工作多用单声部符号数据的音高与时值,或用手工挑选的少数音频特征,对真实音频的丰富性覆盖不足。直接对高维音频建模又很困难,于是近期路线是先用音频自编码器把波形压成潜序列,再在潜序列上训练自回归扩散模型并计算信息量。

本文要解决的矛盾是,已有工作猜测粗结构对应音高这类感知特征,但自编码器训练时并未显式强制这种对应,扩散噪声空间的惊奇度估计因此可能没有用好层次结构。

同输入同目标的路线有哪些,本文站在哪里?

第一条路线是符号域的预期模型,以信息动态模型为代表。它在压缩后的符号域工作,输入是音符的音高与时间,目标是预测下一个音符的惊奇度,监督来自大量符号语料的统计规律,运行阶段是离散自回归预测。它的优点是经过严格的感知验证,缺点是丢掉了音色、混响、演唱细节等声学丰富性。本文把它用作参照标准,而不是要替代它,后文用斯皮尔曼等级相关比较音频模型的信息量与该符号模型的信息量是否一致。

第二条路线是音频特征加贝叶斯预测推断。输入是波形导出的少数特征序列,目标是检测随机声音序列中的变化或统计规则违背,运行阶段是在线更新预测分布。它的适用范围受限于手工特征,难以推广到不受控的真实音乐刺激。本文继承其问题意识,但把特征学习交给自编码器与扩散模型。

第三条路线是潜扩散惊奇度估计。输入是音频自编码器潜序列,目标同样是估计惊奇度,监督是重建损失加扩散去噪损失,运行阶段是教师强制下的似然计算。本文直接延续这条路线,并指出其缺口,即潜空间的组织不是感知对齐的。图像与梅尔谱图上的相关工作显示,自然数据的功率谱近似幂律,低频功率高,高频功率低,结合扩散过程对所有频率同等加噪的谱信噪比性质,生成过程可看作频域自回归,先恢复粗的低频结构,再补充细的高频结构。

去掉低频再去掉高频的噪声顺序会明显变差,而均匀去除信息的噪声过程仍可工作,这说明特征在噪声过程中出现的顺序影响生成。本文的判断是,这些像素域洞察是否能迁移到潜扩散、以及是否应主动施加感知层次,仍未被充分探索,这正是本文要补的对照。

为什么不对齐潜空间就难以估计好惊奇度?

举一个教学例子,例子,不是论文数据。假设一段歌声包含稳定的音高进行、颤音细节和录音底噪。人耳最敏感的是音高进行,其次是颤音与音色,最不重要的是底噪。如果自编码器把三者混放在同一尺度的潜维度里,扩散模型在中等噪声下可能先丢掉音高而保留了底噪的某种纹理,此时计算的信息量就不能反映人感知的惊奇。理想情况是把音高进行放在即使加噪也不易被淹没的粗结构,把底噪放在稍加噪声就被淹没的细结构,这样中等噪声的信息量恰好保留音高而洗掉次要信息。

论文把上述直觉形式化为两个可检验的主张。第一,加噪潜训练结合感知损失能学会这种由粗到细的层次。第二,这种层次能改善潜扩散解码,具体表现为与符号音高预期模型更一致,以及更好地预测听歌声音乐时的脑电信号。注意这不是说噪声本身创造了感知知识,感知知识来自重建损失中的感知加权,噪声只提供按显著性分层的压力。如果不用感知损失而只加噪,模型可能按能量或易重建性分层,未必是感知显著性,这是复述时不能颠倒的因果。

方法全景:一个样本如何走完输入到惊奇度?

沿一个 10 秒音乐片段走完全流程。波形输入编码器得到压缩潜变量,训练时该潜变量被按不同强度插值到高斯噪声,再送给以潜为条件的随机一致性解码器重建波形,重建与输入之间的感知加权复谱图差异作为损失。推理或评估重建时,可以对干净潜变量加不同信噪比的噪声再解码,得到不同粗糙度的重建,用听感距离检验粗结构保留了多少显著信息。

惊奇度估计走另一条支路,把长音频切成潜序列,用因果变换器总结过去潜变量,用扩散网络学习从噪声到当前潜变量的连续流,测试时用瞬时变量变换公式计算下一步的负对数似然作为信息量,并在不同扩散噪声水平重复该计算。

两个阶段的分工很清晰。第一阶段决定表征的几何,即什么信息放在哪里。第二阶段决定序列的预测,即给定过去未来有多意外。第一阶段不对齐,第二阶段在中等噪声下可能看到的是混杂信息。论文因此先微调自编码器,再冻结表征训练自回归整流流,最后在合成爱尔兰单声部曲调与真实歌声数据集上比较信息量,并用脑电编码模型检验信息量能否解释听歌时的神经响应。

自编码器与感知损失各自做什么,为何要一起加噪?

第一阶段用的一致性自编码器由编码器与解码器组成。编码器把音频样本映射为压缩潜变量,解码器是以编码器输出为条件的随机一致性模型,通过一致性训练学会重建。原文明确该训练隐式最小化感知加权的复谱图差异,即重建与输入之间的损失函数。更一般地,现代潜扩散自编码器通常在重建损失中包含感知损失或附加感知损失,因此都可纳入该框架。白话说,编码器负责压缩,解码器负责在压缩约束下恢复听感上重要的成分,感知损失负责告诉模型什么是重要。

感知对齐 × 噪声增强自编码器: 感知对齐指最显著的信息放在最粗的潜结构、次要信息放在更细结构;噪声增强自编码器在训练时对潜变量加不同强度噪声并要求重建干净音频,迫使编码器把满足感知损失的关键信息放在抗噪的粗结构中,二者搭配把扩散前向过程的谱信噪比性质变成显式的表征组织原则。

谱信噪比性质 × 粗结构与细结构: 谱信噪比性质指同等强度噪声先淹没谱功率低的细结构、后影响谱功率高的粗结构;粗结构因此是低噪声下仍能提供梯度的稳定载体,细结构是高频细节载体,论文用这一不对称性解释为何加噪训练能把音高类显著特征推向粗结构。

一致性自编码器 × 感知损失: 一致性自编码器负责把音频压成紧凑潜序列并用一致性解码器重建,感知损失负责定义什么算重建得好,即加权复谱图差异与听感距离,前者提供压缩与生成接口,后者提供显著性标尺,加噪同时最小化多噪声水平下的该损失才形成层次。

关键实现选择是固定潜变量方差。原文指出,若不固定,编码器可以通过增大潜变量方差来提高期望信噪比,从而削弱加噪效果。为此作者用层归一化把潜变量方差固定到与噪声分布方差一致,噪声方差设为 1,期望信噪比改由从有偏逻辑正态分布采样插值系数来控制,参数为均值负 1、标准差 1。教学上可以这样理解,例子,把音量旋钮焊死,只允许改变噪声旋钮,这样不同训练步的难度才可比。原文报告该分布经验上效果最好,但未给出该超参数的完整搜索表格,复现时应视为待确认的经验选择。

自回归整流流如何把潜序列变成可算的信息量?

第二阶段训练自回归整流流模型。记潜序列第 n 个元素为干净数据,前向过程把它与标准高斯噪声按时间系数线性插值,时间系数从逻辑正态分布经 Sigmoid 采样,均值与标准差取 0 与 1。一个扩散网络以含噪当前帧与因果变换器总结的过去为条件,预测从噪声指向数据的向量场,优化目标是该预测与真实位移的均方误差,对序列所有位置平均。生成时可自回归采样,但本文不生成,而是用教师强制方式,结合神经常微分方程的瞬时变量变换公式计算下一步预测的负对数似然,作为信息量。

自回归整流流 × 信息量: 自回归整流流用因果变换器总结过去潜变量并用扩散网络预测下一步的连续流,信息量是该下一步预测的负对数似然,用作惊奇度的计算估计,前者提供可算似然的序列模型,后者把模型不确定性对应到听觉预期违背。

潜扩散解码 × 噪声水平: 潜扩散解码指在自编码器潜空间训练扩散模型来复现潜数据分布,噪声水平控制前向过程破坏信息的程度,论文在不同噪声水平计算信息量并比较与符号模型和脑信号的一致性,中等噪声成为检验对齐是否把音高信息提前到粗结构的关键对照维度。

需要区分原始目标、近似与优化步骤。原始目标是估计听感惊奇,近似是用模型似然代替人的预期,优化步骤是最小化向量场回归误差。原文未给出似然计算的数值积分步数与误差容限等细节,这是方法复述中的具体缺项,不应从模型名称推定实现。训练时噪声调度的均值标准差取 0 与 1,与自编码器微调时的负 1 与 1 不同,前者服务于扩散建模,后者服务于控制表征分层,二者不可混用。

微调与序列建模的训练安排是什么,什么被冻结?

自编码器部分是微调而非从零训练。起点是公开的 Music2Latent 检查点,数据、架构与超参数与原工作相同,只把一致性步调度改为固定为预训练模型的最终步长。噪声增强体现在训练时对潜变量按整流流形式的插值加噪,噪声方差为 1,插值系数从均值负 1、标准差 1 的逻辑正态分布采样。编码器与解码器同时用带噪潜训练的版本记为同时训练两者,冻结编码器只训练解码器以修正训练推理失配的版本记为只训练解码器,完全不用修正的版本记为空对照。原文未报告优化器、学习率、步数等微调预算,这是复现时的缺项。

序列建模部分重新训练自回归整流流。最大序列长度降到 3125,对应约 5 分钟音频,用 AdamW、基础学习率 10 的负 4 次方、750,000 步余弦调度加 10,000 步线性热身,噪声调度为均值 0 标准差 1 的逻辑正态。涉及歌声时,在小型私有歌声数据集上微调 36,000 步,基础学习率 5 乘 10 的负 5 次方,热身 12,000 步。私有歌声数据的具体内容与划分未公开,这是限制跨团队复现的明确边界。梯度路径方面,原文只说明对所有序列位置同时优化向量场回归误差,未说明是否对编码器回传梯度,按 2 阶段描述应理解为序列阶段不更新自编码器,但原文没有逐句写明冻结动词,复述时应标注该推断的依据是 2 阶段分工而非显式冻结声明。

实验按什么问题组织,条件与指标方向是什么?

重建实验回答粗结构是否保留了更多感知显著信息。做法是编码多样化的 10 秒 MusicCaps 音乐片段,再按与训练相同的潜加噪过程构造 4 种粗糙度,信噪比取无穷大、4、1、0.25,然后解码重建。指标中 ViSQOL 越高越好,SI-SDR 越高越好,FAD 越低越好,其中 FAD 用 VGGISH 与 CLAP 两种特征计算,用于衡量低信噪比下重建偏离输入但仍合理的分布真实感。比较对象是同时训练编码器与解码器的对齐模型、只训练解码器的未对齐修正模型、以及无修正的空对照。公平条件是同一批片段、同一加噪过程、同一指标实现。

惊奇度实验回答对齐是否改善扩散噪声连续统上的音乐惊奇估计。合成数据集是爱尔兰单声部曲调,录制数据集是带自动转录的歌声。符号侧用信息动态模型提取每个音符音高的信息量,音频侧用对齐与未对齐潜空间训练的自回归整流流在不同噪声水平计算信息量,再按音符配对求斯皮尔曼等级相关,显著性水平为 5%。基线是前人音频扩散惊奇度方法。

脑电实验用 20 名被试、64 通道、18 首歌声歌曲,预测量是信息量与波形包络,包络用希尔伯特变换幅度计算,回归用岭回归,刺激响应时滞取负 100 到 700 毫秒并加 50 毫秒边缘余量,留一试次交叉验证,以全模型减去仅包络模型的皮尔逊相关增量为信息量贡献。

下表整理序列与脑电建模中原文明确给出的可运行配置,数值与单位保留原文写法,裸值不擅自添加单位,时间窗单位在表头交代,学习率按原文科学计数写法保留。表前已说明比较问题是不同阶段的训练预算与条件是否一致,表后会解释这些配置对复现的意义与缺失项。

配置项序列长度优化与调度微调学习率噪声调度参数脑电时滞窗
歌声微调未报告36k 步,12k 步热身5 × 10−5未报告同主模型
自编码器微调未报告常数一致性步未报告−1,1不适用

表后解释如下。主序列模型的配置最完整,给出了可直接设置的序列长度、优化器、步数与噪声调度,是复现时优先照抄的部分。歌声微调只给了步数、热身与学习率,数据私有且未报告划分,这是主要代价,意味着他人无法逐字复现歌声侧的提升,只能用自有歌声数据重做流程验证趋势。自编码器微调缺失学习率与步数,且噪声调度参数虽报告为经验最优,但未附搜索范围,因此复现应先固定该参数跑通流程,再补做小范围敏感性验证。时滞窗与余量的报告支持脑电部分的重跑,但通道聚合是先取电极中位数再跨被试平均,复述时不能简化为单通道相关。

重建实验显示了什么,代价在哪里?

先提出比较问题。在同一加噪粗糙度下,对齐表征的重建是否在听感距离上更接近输入,在低信噪比下是否仍能产生合理的分布,以及干净重建是否付出代价。公平条件是同一 MusicCaps 片段、同一信噪比构造、同一指标,指标方向为 ViSQOL 与 SI-SDR 越高越好,FAD 越低越好。下表转写原文表一中同时训练编码器与解码器的对齐行,单位按原文,ViSQOL 与 SI-SDR 为裸值,FAD 为裸值,信噪比条件保留原文写法,行数受篇幅限制只列对齐行的 4 个信噪比,完整三向比较见表后文字。

信噪比条件训练方式ViSQOL 越高越好SI-SDR 越高越好FAD-VGG 越低越好
∞E,D3.73-5.181.53
4.0E,D3.48-9.052.46
1.0E,D3.19-15.733.64
0.25E,D2.87-29.785.01

表后解释主要收益与具体代价。原文报告,在小于无穷大的信噪比下,比较同时训练两者与只训练解码器,对齐表征的感知信息保留总是更高,ViSQOL 相近而 SI-SDR 更高;比较同时训练两者与空对照,在小于无穷大的信噪比下两者指标都更高,除了信噪比 0.25 处的 SI-SDR 例外。在该最低信噪比下,对齐模型的 FAD 远低于对照,说明随机解码器在输入信息大量丢失后会编造合理但偏离输入的内容,这是听感距离与分布距离分化的直接证据。

代价是干净重建略有下降,对齐行与未对齐行在无穷大信噪比下 ViSQOL 同为 3.73 附近而 SI-SDR 略低,原文与相关工作一致地观察到噪声增强带来干净重建损失。未胜出项必须保留,即 0.25 信噪比下 SI-SDR 的例外与干净重建的轻微下降,不能只讲中等噪声的优势。

音高惊奇度与脑电预测是否支持层次假设?

音高惊奇度侧的比较问题是,音频模型的信息量与感知验证过的符号音高预期模型的信息量在哪个噪声水平最一致。原文用图展示斯皮尔曼相关随噪声水平的变化,报告对齐潜空间呈现先升后降的倒 U 形,峰值在 0.5 到 0.7 之间,2 个数据集一致,最高相关出现在对齐空间;未对齐空间与基线没有这种规律。由于本次没有收到该图的像素,只能依据正文归因引用趋势,不能声称看到具体曲线颜色、坐标刻度或峰值数值。

支持的判断是,达到某噪声水平后音高相关的大部分信息已存在,加入更多信息反而降低相关,这与中等噪声洗掉音色细节而保留音高的假设一致。限制是除歌声未对齐在 0.3 到 0.7 区间外其余在 5% 水平显著,但原文未给出相关系数的数值表与置信区间,也未报告配对样本量,因此不能换算为可部署的误差下降。

脑电侧的比较问题是,对齐空间算出的信息量能否比未对齐与基线更好地解释听歌声时的神经响应。原文报告,在多数噪声水平下对齐方法显著更强,集中在 0.2 到 0.6,中等噪声附近提升最大,与音高惊奇度侧的高相关区间呼应;头皮地形显示额中央区广泛正效应,且跨被试与电极一致。最佳点在对齐表征的高噪声 t 等于 0.6 附近,与仅用音高信息预测脑电的前人结果一致,而未对齐表征没有这种对应。原文据此认为前人假设在对齐表征中得到更好支持。

相关性不是因果,脑电预测提升支持信息量与神经信号的关联,但不证明被试在该噪声水平只用了音高,原文也提出未来需识别高噪声下除音高外的其他特征以及低噪声新增特征为何损害预测。

去掉哪一部分会怎样,噪声水平与训练方式如何对照?

第一个对照是训练推理失配修正。只训练解码器冻结编码器的未对齐模型修掉了加噪评估时的分布失配,但仍不如同时训练编码器与解码器的对齐模型,这说明收益不只来自让解码器见过噪声,而是来自编码器学会把显著信息放入粗结构。空对照在加噪下最差,说明不用任何修正直接评估带噪潜变量会低估表征质量,这是方法论文中必须保留的公平性细节。

第二个对照是噪声水平的扫描。重建侧从无穷大到 0.25 单调变差,但对齐优势在中等与低信噪比更明显;惊奇度侧对齐呈现中间最优,未对齐没有稳定峰。这构成反证,即若只看干净重建,对齐的优势会被掩盖甚至反转,只有扫描噪声才能看到层次。原文未做去掉感知损失只留加噪、或去掉加噪只留感知损失的完整消融,因此不能说拿掉后必然怎样,只能说现有证据支持两者组合的充分性而非各自必要性。超参数侧,序列阶段用 0 与 1 的逻辑正态,自编码器用负 1 与 1 的有偏逻辑正态,原文只说后者经验最好,未报告网格,这是待补的敏感性验证。

哪些结论有边界,哪些量没有被测量?

数据边界方面,歌声微调数据私有,合成曲调依赖特定转录与自动转录管线,MusicCaps 重建片段多样但仅 10 秒,跨风格、跨语言歌声与长结构的泛化未被验证。指标边界方面,重建用听感距离与分布距离,惊奇度用等级相关,脑电用相关增量,均未报告误判率、延迟、推理开销、输出帧率与实际延迟,因此不能承诺这些量得到改善。统计边界方面,脑电报告均值加标准误与通道显著性,但未给出多重比较校正细节与效应量分布,音高相关未给数值与区间,总体趋势不等于每首歌、每被试、每噪声步都成立。

资源状态是正文开源声明的唯一依据。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。原文摘要提到预训练权重位于某代码托管地址,但按本次证据规则,在没有可用状态验证前只能转述为原文声称,不写当前可用或已公开。训练资源方面,原文未报告硬件型号、显存、时长与推理成本,复现预算无法从证据估算,这是独立于方法正确性的缺项。

要复现应先做什么,需要哪些超参数与信息条件?

第一步复现重建层次。获取 Music2Latent 架构与检查点,按原文固定一致性步为预训练最终值,用层归一化固定潜方差为 1,噪声方差为 1,从均值负 1 标准差 1 的逻辑正态采样插值系数,同时微调编码器与解码器。评估时编码 MusicCaps 片段,按信噪比无穷大、4、1、0.25 加噪解码,计算 ViSQOL、SI-SDR 与两种 FAD,并与只训练解码器和空对照比较。若干净重建略降但加噪下听感距离更好,则复现了核心趋势。

第二步复现惊奇度。用最大长度 3125、AdamW、基础学习率 10 的负 4 次方、750,000 步余弦加 10,000 步热身、均值 0 标准差 1 的逻辑正态训练自回归整流流,教师强制计算信息量并在多噪声水平与信息动态模型求等级相关,检查对齐空间是否出现 0.5 到 0.7 的峰而未对齐没有。歌声侧需自备数据并记录划分,因为原文私有数据不可得。第三步复现脑电编码。用岭回归、负 100 到 700 毫秒时滞加 50 毫秒余量、留一试次交叉验证,比较全模型与仅包络模型的皮尔逊增量。还需补的验证包括感知损失与加噪各自的消融、噪声调度参数敏感性、以及除音高外的特征在高噪声下的构成分析。

何时值得尝试这种对齐,如何一句话记住它?

当任务依赖潜扩散在中等噪声下的解码质量,且感知显著性可由重建损失定义时,值得尝试把潜方差固定后的噪声增强微调作为表征对齐手段,再在对齐空间训练序列扩散并扫描噪声水平寻找与感知最一致的工作点。当目标只是干净重建的最高保真,或感知显著性无法写入损失时,不应期待该方法带来收益,原文的干净重建代价已经提示了这一点。

一句话记忆是,用可控噪声逼编码器把听感上重要的东西写进最抗噪的粗结构,次要的东西写进细结构,中等噪声的信息量因此更像人感知的惊奇。常见误解是把噪声当作正则化万能药,实际上噪声只决定分层的压力方向,显著性标准仍来自感知损失;另一个误解是把倒 U 形峰值当作普适最优噪声,实际上峰值位置依赖表征、数据与任务,换数据集需重扫。未来工作应先补齐训练预算与统计细节,再系统识别不同噪声水平浮现的音乐特征,论文已明确提出这一方向。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 2 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 2 页

区域 2 · 查看论文原页

另有 16 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eusipco-2026 论文汇总