英文题目:BINAURAL TARGET SPEAKER EXTRACTION USING INDIVIDUALIZED HRTF
会议身份:
conference:eusipco:2026:conference-paper-id:0000356
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#CNN #多通道 #空间音频信号 #去混响 #目标说话人提取
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Ellinson, Yoav:机构信息未能从会议 PDF 纯文本可靠映射
- Gannot, Sharon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
双耳目标说话人提取需从双通道混合中恢复目标在左右耳的波形,同时保留耳间电平与时间线索并在混响下仅保留直达声,难点在于左右通道须联合处理且不能依赖说话人注册语音。编码阶段将双通道混合短时傅里叶变换送入复数值U型网络编码器提取时频特征,保留幅度与相位结构并经跳跃连接支撑重建。线索注入阶段在瓶颈处对个体头部相关传输函数线索编码并复制至各时间帧,再与混合编码逐帧逐元素相乘形成目标方向约束。精炼重建阶段将融合张量送入多层自注意力与全连接层精炼,再经解码器重建双耳复频谱,并以尺度不变信号失真比与频域平均绝对误差多阶段加权训练抑制音乐噪声。与依赖说话人嵌入或到达方向独热向量的方法不同,该方法以个体头部相关传输函数同时提供幅度与相位线索,直接锚定双耳结构并使输出主导为直达声。在θd为负60度的评测条件下,Bi-TSE-HRTF的ΔITD指标为0.0 ms,低于BDE-BiTSE的ΔITD指标1.0667 ms。该结论适用边界受限于两说话人全重叠、无加性噪声、固定半径与已知目标方向,混响下去混响质量下降且尚未验证多人多噪与头部相关传输函数失配等失败条件。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 数据相关资源:https://doi.org/10.35111/ewkm-cg47 → https://catalog.ldc.upenn.edu/LDC93S6A — 链接可访问(HTTP 200)
- 演示资源:https://bi-ctse-hrtf.github.io — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出要保留什么?
这篇论文处理的是双耳场景下的鸡尾酒会问题。输入是戴在听者左右耳的两路麦克风收到的混合语音,论文聚焦两个同时说话人的情形,不加背景噪声,并假设声源到听者的距离固定。输出不是单路干净语音,而是左右两路双耳信号,要求同时做到两件事。第一是把目标说话人的语音分离出来,第二是保留目标的空间线索,让听者仍能感知目标从哪个方向来。白话说,干净还不够,位置不能错。
为理解位置不能错,需要先建立双耳线索的概念。耳间强度差,英文为 Interaural Level Difference,缩写为 ILD,描述同一声音到达左耳和右耳的幅度差异。耳间时间差,英文为 Interaural Time Difference,缩写为 ITD,描述到达时间的差异。这两组差异是人判断方位的重要依据。论文把是否保持这两组差异作为与信噪比、语音质量并列的考核维度。
论文还区分了两种助听系统形态。双侧独立处理,英文为 bilateral systems,指左右设备各自独立处理,只输出本侧单通道,难以保持双耳线索。多输入多输出联合处理,英文为 Multi input Multi output,缩写为 MIMO,指把两侧麦克风信号联合处理并输出双耳信号,更有利于保持自然的空间感。本文属于后者,模型 1 次输出左右两路。
耳间强度差 × 耳间时间差: 耳间强度差负责刻画左右耳幅度差异,耳间时间差负责刻画到达时间差异;二者搭配的理由是人耳靠这两组差异判断声源方位,组合意义是双耳提取不仅要语音干净,还要让提取后信号的这两组分布与目标一致,否则听感位置会偏移。
学习依赖上,先要接受一个前提。论文不靠预先录制的目标说话人示例做线索。白话说,不听音色认人。原因是作者观察到当两个说话人音色接近,例如同性别时,基于说话人嵌入的线索难以区分。因此论文转向空间线索,用听者本人的头相关传输函数对准目标方向,作为提取的主要依据。这个选择决定了后面全部方法设计和对照实验。
同任务、同线索的相关路线如何对照?
相关工作可以按输入、目标和线索是否相同来对照。第一类是双耳波束形成,例如双耳线性约束最小方差波束形成,英文为 Binaural Linearly Constrained Minimum Variance,缩写为 BLCMV。这类方法用空间约束分离声源并保持双耳线索,输入同样是双耳信号,目标同样是保留空间感的分离输出,但实现是信号处理框架,不是本文的复数神经网络。论文把它作为可运行基线之一,在相同双麦克风条件下比较。
第二类是基于深度神经网络的双耳目标说话人提取。论文具体比较了布尔方向性嵌入的双耳目标说话人提取,文中记为 BDE-BiTSE。该方法同样处理双耳混合并输出双耳信号,线索是目标到达方向,英文为 Direction of Arrival,缩写为 DOA。论文按原文描述中最强的变体进行训练和比较,并且强调训练数据与本文方法完全相同,以保证条件一致。这是理解结果公平性的关键。
第 3 类是单麦克风或多麦克风的目标说话人提取,线索是注册语音、视觉信息、相对传递函数或到达方向。注册语音,英文为 enrollment utterance,指预先录制的一段目标说话人语音,用于提取说话人特征。相对传递函数,英文为 Relative Transfer Function,缩写为 RTF,描述目标相对参考麦克风的空间关系。这些方法与本文的输入或输出形态不同,不能直接当作同条件胜负,只能作为路线背景。论文引用它们是为了说明空间线索通常优于单麦克风方案,以及说话人嵌入线索在相似音色下存在困难。
因此,公平比较只发生在双耳输入、双耳输出、两麦克风的设置下。论文明确说明所有基线都在该设置下评估。后续看到质量指标和双耳线索指标的取舍时,应回到这个对照口径,而不是把不同输入形态的方法混在一起排名。
两个说话人的双耳混合如何建模?
论文把问题写成短时傅里叶变换域的叠加。记混合双耳信号为 xb,时间帧索引为 n,频率点索引为 k。目标说话人的消声语音为 sd,干扰说话人的消声语音为 si。目标方向记为方位角与俯仰角组合,干扰方向同样表示。每个声源到双耳的传输函数记为 h,论文把它理解为房间内所有反射对应的头相关脉冲响应的叠加,但为表达清晰仍按直接路径方向索引。
头相关传输函数,英文为 Head-Related Transfer Function,缩写为 HRTF,描述听者对来自某个方向声波的双耳响应。其时域对应为头相关脉冲响应,英文为 Head-Related Impulse Response,缩写为 HRIR。房间脉冲响应,英文为 Room Impulse Response,缩写为 RIR,在本文中由镜像法生成的多次反射叠加头相关脉冲响应构成。
目标信号的定义值得复述。论文把目标定义为目标语音按直接路径头相关传输函数渲染到左右耳的结果,而不是带混响的房间信号。这意味着在混响房间中,理想输出是去混响的双耳目标。评价时也是拿提取结果与该直接路径目标比较。
约束条件有两个。第一是保持目标的空间线索,第二是在混响下只保留直接路径。算法被提供的是听者本人的个性化头相关传输函数数据库,覆盖各方位和俯仰方向。论文提到个性化可以通过人体测量实现,但本文实验直接使用数据库中的测量值,不研究个性化估计本身。沿一个样本走一遍,输入是左右两路混合的复数谱,线索是目标方向对应的双耳头相关传输函数,目标是直接路径渲染的双耳目标谱,输出是估计的双耳目标谱。
方法全景:线索在何处介入网络?
方法名为 Bi-TSE-HRTF,可理解为使用头相关传输函数的双耳目标说话人提取。整体流程是监督式提取。编码器先把双耳混合谱压缩成特征,瓶颈处引入头相关传输函数线索,再经解码器重建双耳复数谱。线索不是拼在输入波形上,而是作用在编码后特征的时间帧上,通过逐帧相乘施加选择。
双耳目标说话人提取 × 头相关传输函数: 双耳目标说话人提取负责从左右耳混合中只保留目标说话人并输出双耳信号,头相关传输函数负责提供目标方向到达双耳的幅度和相位关系;二者搭配的理由是方向对应的双耳关系比说话人音色更稳定,尤其在同性别难分时仍可区分,组合后网络按方向线索做提取,同时保留目标的空间感。
网络主干是 U-Net 结构。编码器由 5 个下采样卷积块组成,解码器由 5 个上采样转置卷积块镜像对应,中间有跳跃连接帮助重建。激活函数是复数修正线性单元,英文为 complex-valued ReLU,做法是对实部和虚部分别做修正线性单元。解码器最后还有一层不带激活的卷积,以便输出可正可负的实部和虚部,满足复数谱的表示需要。
瓶颈部分是关键。编码后的混合特征先做自注意力,头相关传输函数分支也做自注意力并考虑左右通道之间的关联,然后把头相关传输函数嵌入复制到每一时间帧,与混合特征逐元素相乘,再经过多层自注意力和全连接后送入解码。论文描述中瓶颈前后各有自注意力,之后还有 4 层自注意力。这种安排的意图是让方向线索在压缩表示上筛选目标,而不是在原始波形上做掩蔽。
需要区分的是,该自注意力把通常的 softmax 替换为复数修正线性单元,以直接处理复数张量。论文未给出梯度路径和注意力权重归一化的进一步推导,解读时只按原文实现陈述,不补猜归一化性质。
编码、瓶颈与解码各自完成什么计算?
编码器的任务是把双耳复数谱变成紧凑特征。每块包含 2 维卷积、全局层归一化和复数激活。输入保持双通道复数形式,而不是把实部虚部分成 4 个实通道。这是与消融对照 Bi-TSE-HRTF-RI 的直接区别,后者把复数输入拆成实部虚部拼接,通道数翻倍。
复数神经网络 × 实部虚部分开处理: 复数神经网络负责直接在复数短时傅里叶变换域保持幅度和相位的联合运算,实部虚部分开处理负责把复数拆成独立实通道拼接输入;搭配比较的理由是检验相位结构是否需要复数运算来保持,组合意义是论文用消融对比说明复数路径在混响下对双耳线索保持更有利。
瓶颈的任务是施加提取线索。具体动作可复述为 4 步。第一步对编码后的混合特征做自注意力,第二步对头相关传输函数做能捕捉左右通道关系的自注意力并经全连接投影到与混合特征一致的维度,第三步把头相关传输函数嵌入复制到每个时间帧并与混合特征逐元素相乘,第 4 步再经多层自注意力和全连接后交给解码器。逐元素相乘的含义是按方向线索对每帧特征加权,方向匹配的成分被保留。
解码器的任务是把加权后的特征还原为双耳复数谱。5 个上采样块与编码器对应,跳跃连接把细节传回,以提高重建精度。最终卷积不加激活,保证实部虚部可取负值。
直接路径 × 混响: 直接路径负责决定感知的声源方向,混响负责叠加多次反射形成房间脉冲响应;搭配理由是按优先效应只需保留直接路径的头相关传输函数即可锚定方向,组合意义是模型在混响房间中以直接路径渲染为监督目标,从而同时实现提取和去混响。
另一个消融是 Bi-TSE-DOA,用独热编码的方向向量代替头相关传输函数,经全连接映射到瓶颈维度,其余损失和目标不变。这个对照直接检验头相关传输函数是否不可替代。论文报告该变体干扰抑制和双耳线索保持都更差,尤其在混响下,支持头相关传输函数携带了比单纯方向编号更丰富的双耳幅度相位结构。
损失函数如何分阶段训练?
训练是监督式的。消声条件下,目标由目标语音与对应头相关传输函数卷积生成。混响条件下,先仿真房间并只保留首达声,即零阶反射,作为直接路径目标。头相关传输函数线索先从 48 kHz 下采样到 16 kHz,再经快速傅里叶变换转到频域。每个训练步中,同一混合的两个说话人轮流作为目标,通过切换头相关传输函数线索并平均损失,以提高数据利用率。
尺度不变信号失真比损失 × 平均绝对误差损失: 尺度不变信号失真比损失负责优化时域波形整体失真,平均绝对误差损失负责约束频域幅度谱的细节连续性;搭配理由是只用前者会出现音乐噪声这类频谱断裂失真,组合后先保证分离能力再补频谱约束,最后再微调以兼顾听感和数值指标。
损失由两项加权组成。第一项是尺度不变信号失真比损失,英文为 Scale Invariant Signal to Distortion Ratio,缩写为 SI-SDR,作用在时域波形上。第二项是频域平均绝对误差,英文为 Mean Absolute Error,缩写为 MAE,作用在左右通道幅度谱上,用于缓解只用时域损失时出现的音乐噪声。音乐噪声指因频域估计不连续造成的音调状失真。
论文采用多阶段策略。先只用尺度不变信号失真比损失训练到足够水平,再引入幅度平均绝对误差损失以改善频谱准确性和听感,最后再只用尺度不变信号失真比损失微调,因为幅度损失容易在训练集上过拟合。原文未报告优化器类型、学习率、批量大小和早停阈值的完整取数,复现时应视为缺项,不从模型名称推定。
语音数据来自 WSJ0-CSR1 个数据集。论文说明训练和验证都用该数据集,评估也包含该数据集的消声与混响版本。原文证据未给出划分人数、语句不重叠方式和验证集规模的完整说明,这部分同样按缺项处理。
房间、头模与语音如何构造?
双耳脉冲响应按镜像法构造。做法是把多次反射对应的头相关脉冲响应按增益缩放并按时延移位后叠加。直接路径对应目标或干扰方向的头相关脉冲响应,反射路径对应各阶镜像源方向。混响时间在指定区间内随机采样,听者位置在房间内均匀抽取。房间是可配置墙面材料的鞋盒形房间,消声情形用零阶仿真。
头相关传输函数来自 RIEC 数据库。该库包含 105 名受试者、每人 865 个方向,论文聚焦其中 1 名受试者。通过声学空间朝向格式工具箱检索任意方向的头相关传输函数,并用 SofaMyRoom 框架仿真消声和混响条件。听者被置于房间中,其测量得到的头相关传输函数决定双耳响应。
语音处理参数在原文中有完整连续的一句话,可直接作为复现起点。语音采样后随机选择、裁剪或补零到固定时长,再做短时傅里叶变换。下表把该句中的关键参数整理成可核对的形式,阅读时先看比较问题:训练输入的时间长度、采样率和谱分析是否一致,这决定了模型看到的帧数和频率维度。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 5 | 1 | 2 | 48 kHz;16 kHz |
上表对应语音信号的采样率、时长、窗长和重叠率。表前提出的问题是输入表示是否可比,表后需要强调的代价是固定时长带来裁剪或补零,补零段不含语音信息,裁剪可能截断语句,都会影响训练样本的有效语音比例。论文未报告补零掩蔽或有效时长加权的细节,复现时应保持原文的随机裁剪补零流程,不要自行改为按语音活动检测切分,否则训练分布会变化。
评测混合与指标如何组织?
评测集的构造条件同样有原文连续句可核对。每个评测集包含固定数量的语音混合,且两个说话人都轮流作为提取目标,因此样本数是混合数的 2 倍。混合的信号干扰比在负 5 到正 5 分贝区间内均匀抽取,重叠率为 100%,即全程重叠,这是较难的情形。
指标分为 3 类。第一类是语音质量与可懂度的侵入式指标,包括尺度不变信号失真比、宽带与窄带语音质量感知评估,英文为 Perceptual Evaluation of Speech Quality,缩写为 PESQ,以及短时客观可懂度,英文为 Short-time Objective Intelligibility,缩写为 STOI。第二类是非侵入式神经网络平均意见分,英文为 DNS-MOS,给出信号质量、背景质量和总体质量。第 3 类是双耳线索保持指标,比较提取信号与目标信号的耳间强度差与耳间时间差联合概率密度函数,一致则说明空间线索得到保持,还报告耳间强度差误差与耳间时间差误差。
下表把评测混合规模、干扰比、重叠率和一个图示示例的房间条件放在一起,目的是核对实验条件是否一致。阅读时先确认比较对象是否都在双麦克风、双耳输出的设置下,再看指标方向:失真比、语音质量、可懂度和平均意见分越高越好,双耳线索误差越小越好。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 1500 | 3000 samples | — | — |
| 来源句二 | 5 | 100% | — | — |
| 来源句三 | 3 | 60 | 90 | 10;0.63 s |
上表的前四列是评测协议,最后一列是论文展示双耳线索分布所用的一个具体示例条件,包括目标与干扰方向、混响时间和分析频带。该示例说明论文在 500 Hz 附近、耳间强度差不显著的频带仍考核分布一致性。需要强调的限制是,该示例只是单点图示,不能代替全评测集的平均误差,方向估计的单例结果同样不能推广为全集定位精度。
主结果支持什么,代价在哪里?
论文在消声和混响两种条件下比较了未处理、双耳波束形成、同期深度网络基线、方向线索变体、实部虚部变体和本文复数模型。原文以表格形式报告了平均意见分、尺度不变信号失真比、宽带与窄带语音质量、可懂度以及双耳线索误差。由于本次可绑定的原表矩阵证据缺失,这里不逐格复述该表的具体分值,只按正文直接陈述的趋势讲可验证的判断,并明确标注逐值缺项。
正文直接报告的趋势是,在消声条件下,本文方法在失真比、语音质量和平均意见分上具有竞争力,同时在耳间强度差和耳间时间差误差上优于基线。在混响条件下,本文方法仍能保持语音清晰度和方向性并降低混响,但在失真比和语音质量上低于 BDE-BiTSE。换句话说,质量指标让出部分分数,双耳线索指标取得明显优势。这是全文最核心的取舍。
论文还用方向估计说明时间差误差的实际含义。做法是为所有候选方向计算耳间时间差并建立方向与时间差查找表,再把输出估计的方向与真值比较。单例结果显示,基线存在较大的定位偏移,而本文方法在该示例中保持空间一致。解读时必须加上限定:这是计算成本约束下的单个示例,不是全集统计,不能据此声称所有方向都零误差。
另一个可复述的证据是联合概率密度函数的对齐程度。论文展示了提取信号与消声目标在耳间时间差与耳间强度差平面上的分布,本文方法的分布与目标更接近,而基线出现偏移。分布更集中还被解释为去混响的迹象,即直接路径在输出中占主导。这个解释属于有限解释,因为集中也可能受分离残差抑制的影响,论文未做分解验证。
拿掉复数运算或换成方向编号会怎样?
消融比较了两个可运行变体。第一个是 Bi-TSE-HRTF-RI,把复数输入拆成实部虚部拼接,通道数从两路变为 4 路,线索同样拆分,其余损失和目标不变。第二个是 Bi-TSE-DOA,用独热方向向量代替头相关传输函数,经全连接映射到瓶颈维度。两个变体都保留了原文损失定义和双耳直接路径目标,因此属于同条件对照。
正文报告,方向变体的失真比和语音质量更低,干扰抑制不足,双耳线索保持也差,尤其在混响下。这支持头相关传输函数不可替代的判断。注意措辞:这是该数据集、该单受试者头模和该训练流程下的对照结果,不是方向线索在一切系统中必然失败的证明。
实部虚部变体在消声条件下失真比和双耳线索保持与复数模型接近,但在语音质量上更低,在混响下线索保持退化更明显。这支持复数运算对相位结构保持有帮助的判断,但同样有边界:论文未报告参数量是否严格对齐,通道数变化可能带来容量差异,因此不能把全部差距唯一归因于复数运算。
论文还做了方位扫描来展示空间分辨率。做法是用覆盖方位区间的头相关传输函数逐个提取并相对目标计算失真比,画出类似波束图的曲线,峰值出现在真值方向,主瓣宽度反映对轻微头相关传输函数偏差的稳定性。该实验按原文是定性展示空间选择性,未报告主瓣宽度数值和统计显著性,复现时应按相同扫描流程重做,不要把单图的峰形当成全方向的分辨率指标。
哪些边界尚未验证?
第一个边界是说话人数和噪声。论文为表达清晰聚焦两个同时说话人,并假设无噪声环境。实际助听场景常有多于两个声源和环境噪声,本文未报告这些条件下的性能,因此不能把结论推广到含噪多人场景。
第二个边界是个性化与泛化。实验聚焦 RIEC 库中的单一受试者,算法被提供该听者的全方向头相关传输函数。跨受试者泛化、用错头模、方向估计存在误差、声源移动或距离变化时的表现,原文未系统报告。方位扫描只说明对轻微偏差有一定稳定性,未给出可容忍的角度范围统计。
第三个边界是混响目标的定义。混响下的监督目标是只保留首达声的直接路径渲染,这有利于方向锚定和去混响,但也意味着早期反射中有用的响度和自然感可能被去掉。论文未做听感偏好与自然度的主观实验,客观指标不能代替助听佩戴者的实际感受。
第 4 个边界是可绑定证据的缺失。本次解读可用的结构化原表清单为空,因此主结果表的逐格分值无法以可验证绑定的形式复述。凡涉及具体分贝和语音质量分的记忆,都应回到论文原文表格核对,不应引用本解读的转述值。训练超参数、计算量、推理延迟和模型规模同样未在可用证据中完整出现,部署成本无法判断。
复现先做什么,后补哪项验证?
复现的第一步是重建数据管线。按原文用 WSJ0-CSR1 语音,经随机选择、裁剪或补零到固定时长后做短时傅里叶变换。用 RIEC 单受试者头模,经下采样和频域转换得到线索。用镜像法叠加头相关脉冲响应生成双耳脉冲响应,消声用零阶仿真,混响随机采样混响时间并在房间内均匀抽取听者位置。混响监督目标只保留首达声。
第二步是实现网络与训练阶段。编码器与解码器各五块并加跳跃连接,瓶颈处复制头相关传输函数嵌入并与每帧混合特征逐元素相乘。先只用时域失真比损失训练,再加入频域幅度平均绝对误差,最后再用时域损失微调。每个混合的两个说话人轮流作为目标并平均损失。基线必须在相同双麦克风、双耳输出和相同训练数据下重训或重评,尤其是 BDE-BiTSE 的最强变体,不能用其他论文的跨数据集分数代替。
第三步是按问题组织评估。先测消声下的分离与双耳线索误差,再测混响下的清晰度、方向性和去混响,再做方向变体与实部虚部变体的消融,最后做方位扫描验证峰值是否落在真值方向。指标方向要先固定:质量与可懂度越高越好,双耳线索误差越小越好,分布对齐用联合概率密度函数目视加误差数值共同判断。
还需补的验证包括含噪与 3 人以上混合、跨头模泛化、方向误差鲁棒性、主观听感,以及训练与推理开销。资源状态方面,数据集链接当前可用,演示页当前可用,但这只说明链接可达,不代表代码与权重可运行,复现前应先确认论文是否实际公开了可运行实现。
何时值得尝试这种线索?
当任务要求双耳输出且位置不能错,同时说话人音色接近导致注册语音线索不可靠时,值得尝试用目标方向的个性化头相关传输函数做线索。它的价值在于把方向的双耳幅度相位结构直接交给网络做选择,并在混响下以直接路径为目标兼顾去混响。
当只有单通道、无法获得目标方向或没有个性化头模时,不应硬套该方法。方向未知时的估计误差、头模失配和多人强混响都可能削弱优势,需要先补相应的鲁棒性实验。
回到全文取舍,本文方法在消声下兼顾质量与空间一致,在混响下以部分客观质量为代价换取更好的双耳线索保持。研究生复述时应抓住三句话:线索是目标方向的本人头相关传输函数,作用点是瓶颈特征的逐帧加权,目标是直接路径渲染的双耳信号。其余结论都要回到原文表格和实验条件核对,不把单例定位结果和单频带分布图推广为全集保证。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
区域 5 · 查看论文原页
另有 12 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses




