英文题目:A Three-Stage System for CHiME-9 ECHI: Self-Interference Suppression, Target Speaker Extraction, and Post-Processing

会议身份:conference:chime:2026:conference-paper-id:zhao26_chime

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#助听器 #时频分析 #麦克风阵列 #语音 #目标说话人提取

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:系统技术报告

👥 作者与机构

  • Fei Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Changjiang Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhenlong Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenzheng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yongjie Yan:机构信息未能从会议 PDF 纯文本可靠映射
  • Xueliang Zhang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

CHiME-9 ECHI 要求从 7 通道 Aria 眼镜录音中为每个对话伙伴恢复单通道清洁语音,核心难点是佩戴者语音显著强于目标伙伴,且目标注册音频与混合中说话风格情感失配。系统采用三阶段串行流水线:第一阶段以佩戴者注册音频为条件抑制自干扰并保留空间线索,第二阶段联合原始 7 通道混合与第一阶段输出、以目标加 2 个非佩戴干扰人注册音频为对比条件提取目标,第三阶段以映射网络逼近近场语音并用第二阶段语音活动检测(Voice Activity Detection,VAD)门控回退到第一阶段输出。与仅用单目标嵌入的基线式提取相比,多干扰锚负参考与短时傅里叶变换(Short-Time Fourier Transform,STFT)域线性滤波伪标签构成关键差异,使无中间监督时仍可分阶段训练。开发集 Aria 单人轨上最终策略 3S(PP+VAD+FB)短时客观可懂度(Short-Time Objective Intelligibility,STOI)为 0.54,高于基线的 0.50,信号失真综合指标(Csig)为 1.83,总质量(Covl)为 1.38;测试集 Aria 轨上可懂度为 48.43%,低于基线的 55.28%,信号质量(SIG)为 3.56,高于基线的 2.31,整体质量(OVRL)为 2.28,高于基线的 2.16。该结论仅在 Aria 设备开发集与官方主客观指标上验证,对未见噪声、失配加重及求和轨以外泛化尚未证明。原文未披露训练推理成本与吞吐压力测试。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,哪些信息必须保留?

这篇论文研究的是助听场景下的对话增强。输入是戴在头上的设备录到的多通道混合语音,论文明确使用智能眼镜录音,通道数为 7,记为多通道混合,其中第一通道被定为参考通道。混合里同时存在目标对话对象、佩戴者自己的语音、另外两个干扰说话人,以及食堂式环境的扩散噪声与混响。输出是单通道的增强语音,目标是对齐到对话对象近耳信号的估计,也就是希望听到的干净目标语音。

对刚入门的读者,先把白话与术语对齐。目标说话人提取指在多人混合中按给定身份把指定人的语音抽出来,英文是目标说话人提取。佩戴者自干扰指佩戴者自己的语音因为离麦克风最近而显著强于对话对象,形成主导干扰。自干扰抑制就是先把这部分强干扰压低。后处理指在提取之后再做 1 次以听感为目标的精修。注册音频指预先为每个说话人录的一段身份依据音频,论文称为锚点或注册信号,提取时靠它指明要找谁。

必须保留的信息有 3 类。第一是身份条件,论文使用目标、佩戴者与两个干扰人的注册信号,其中第二阶段同时用目标加两个干扰人形成对比线索。第二是空间与频谱线索,第一阶段强调在压佩戴者时不要破坏这些线索,否则后续无法利用多通道差异。第三是目标活动信息,第二阶段显式预测目标语音活动检测掩码,用于推理时门控输出并触发回退。最终评价既看客观指标,也看听感质量,论文在开发集报告频率加权分段信噪比、短时客观可懂度、语音质量感知评价与复合测度,在测试集报告可懂度与信号质量、背景质量、总体质量。

同任务既有路线如何划分,本文站在哪条线上?

论文把相关工作按输入、目标、监督与运行阶段划分,而不是按模型名气划分。第一类是离线说话人条件提取,例如用注册嵌入做频谱掩码的语音滤波器与说话人波束类方法,特点是允许使用非因果上下文,延迟较高。第二类是流式因果提取,强调低延迟与实时约束。第 3 类是连续提取并处理目标缺席,即目标可能一段时间内不说话,系统需要判断活动与否而不能硬输出。第四类是多通道空间信息处理,例如低延迟神经波束形成与波束引导的目标提取。第五类是会话感知提取,利用轮流说话等动态信息。

本文的输入与目标与上述第四类最接近,都是多通道可穿戴录音、单通道目标输出、低延迟要求。监督条件上,本文与离线注册嵌入路线相同,都用注册音频作条件,但增加了多锚点对比与语音活动检测来应对注册与混合失配。运行阶段上,本文明确走流式因果路线,采用非对称窗与重叠保留实现约一个跳长的算法延迟。因此不能把本文与允许整句未来信息的离线方法直接比绝对数值,类别差异本身就带来不同的延迟与信息条件。论文的增量在于把佩戴者抑制单独成段,并把伪标签投影与后处理精修纳入同一流水线,而不是只改进某一个提取网络。

ECHI 场景的两个具体困难是什么?

第一个困难是佩戴者语音显著强于对话对象。论文指出佩戴者作为主要说话人,其分量在参考通道占主导,若直接做目标提取,网络容易被强自干扰牵引,弱目标的时频细节会被淹没。更麻烦的是挑战没有提供去除佩戴者后的混合监督,因此第一阶段无法直接拿到干净的中间目标,只能构造近似监督。

第二个困难是目标注册音频与混合失配。注册可能与混合中的说话风格或情绪不同,导致说话人条件变弱,提取不可靠,表现为目标语音断续或被干扰人替代。论文因此在第二阶段引入两个非佩戴者干扰人的注册作负参考,希望用锚点对比更好定位目标,并在推理时用语音活动检测加回退减少因失配造成的目标丢失。第 3 个派生困难是伪标签本身不完美,因为投影用的近似滤波仍可能残留噪声与干扰,模型预测还会引入伪影,所以需要第 3 阶段以后处理改善听感,而不是指望前 2 阶段 1 次到位。

三阶段流水线让一个样本经历什么?

沿一个 7 通道混合样本走一遍。样本进入第一阶段时附带佩戴者注册音频,第一阶段以佩戴者为条件预测一个掩码,作用在参考通道上,得到去除了佩戴者语音的中间信号,记为去佩戴者输出。该输出保留了目标、干扰人与噪声的相对关系,只是强自干扰被削弱。

样本进入第二阶段时有两个声学输入,即原始 7 通道混合与第一阶段输出的拼接,以及 3 个身份输入,即目标与两个干扰人的注册。网络先对混合与 3 个锚点分别提嵌入,再经多个特征融合块把身份注入声学流,前两个融合块用对比条件,后续融合块只用目标线索精修。网络同时估计复数比掩码与目标软活动掩码,复数比掩码作用在第一阶段输出上,再乘以活动掩码得到第二阶段输出。

样本进入第 3 阶段时输入是单通道拼接,即参考麦克风信号加第一阶段与第二阶段输出,条件只有目标注册。该阶段不用掩码而用映射网络直接预测目标近耳信号,得到近耳估计。推理时再按公式把第 3 阶段估计与第一阶段输出按活动掩码加权组合,活动为 1 处用第 3 个阶段,活动为 0 处回退到第一阶段,从而在目标缺席段避免硬静音。3 个阶段都基于官方基线拓扑的改进变体,第一阶段与第 3 阶段用较小的分支配置,第二阶段用更大的主干。

第一阶段如何压住佩戴者又不破坏线索?

第一阶段的输入是 7 通道麦克风信号,条件是佩戴者注册。网络拓扑与官方基线相近,但做了面向该场景的优化。声学侧经卷积编码器或前序因果网格块得到特征序列,身份侧有两路,一路是阶段内说话人编码器得到的原始嵌入,建模局部说话人信息,一路是把冻结的 ECAPA-TDNN 输出再经线性层得到的表示,建模全局说话人信息。

佩戴者自干扰抑制 × 目标说话人提取: 佩戴者自干扰抑制负责把参考通道中能量占优的佩戴者语音先压低,保留空间与频谱线索并减轻后续负担;目标说话人提取负责在干扰说话人与残留噪声中定位并恢复对话对象;二者搭配的原因是若不先削弱佩戴者,提取网络容易被强自干扰主导,而先抑制再提取可以让第二阶段的对比条件与掩码估计集中处理较弱的竞争声,组合意义是分工处理强自干扰与弱竞争声两类不同难度的干扰。

注册音频 × ECAPA-TDNN: 注册音频是为目标、佩戴者与两个干扰人提供的身份依据音频,负责告诉网络要找谁、要压谁;ECAPA-TDNN 是论文引入的全局说话人表征提取器,负责把注册音频变成稳定的身份向量;二者搭配的原因是仅靠阶段内说话人编码器得到的局部表征容易受混合内容影响,而冻结的 ECAPA-TDNN 提供与内容相对解耦的全局身份线索,组合意义是通过 FiLM 调制把全局身份注入声学特征,使掩码估计按身份偏置。

融合方式采用特征线性调制,把说话人信息注入音频表示,再把调制后特征与佩戴者全局嵌入拼接,经 2 维卷积对齐通道,得到融合表示。最后预测掩码并作用于参考通道,估计去除佩戴者后的参考信号。训练目标是时频损失,包括短时傅里叶幅度重建项与尺度不变谱均方误差项,权重系数按原文取为 0.5。监督不是真实干净信号,而是经线性滤波投影得到的伪参考,即参考通道减去佩戴者分量估计。

第二阶段如何用三个锚点与活动掩码找目标?

第二阶段的输入特征流由 7 通道混合与第一阶段输出拼接形成。模型对混合与 3 个锚点提嵌入后,经一系列特征融合块注入身份。前两个融合块采用对比条件,以目标嵌入为主线索,同时引入两个干扰嵌入作负参考,促使网络在每个时频点更好区分目标与非目标语音。其余融合块简化为只用目标锚点,逐步精修目标提取。

FiLM 调制 × 对比条件: FiLM 调制负责把说话人向量转换为对声学特征的缩放与偏置,实现按身份的条件化;对比条件负责在第二阶段前两个融合块中同时使用目标嵌入作正线索、用两个干扰人嵌入作负参考;二者搭配的原因是单纯注入目标信息不足以区分声学相近的竞争说话人,而对比注入让网络在每个时频点学习目标与非目标的差别,组合意义是在融合块层面增强目标与干扰的判别性,再在后部融合块只用目标线索做精细化。

该阶段同样用特征线性调制,但原文区分了两种形状,一种处理通道维的 1 维向量,另一种处理频率维的 1 维向量,后者记为带星号的变体,调制机制相同而形状不同。网络估计复数比掩码,不同于第一阶段作用于参考通道,这里的复数比掩码作用于第一阶段预测的去佩戴者信号。同时在第 3 个因果网格块后接轻量语音活动检测头,经线性层与 Sigmoid 产生软活动掩码,再作用于复数比掩码增强后的信号,得到第二阶段输出。

语音活动检测 × 回退策略: 语音活动检测负责在第二阶段第 3 个因果网格块后经线性层与 Sigmoid 输出目标说话人的软活动掩码,用于门控最终输出;回退策略负责在目标被判为不活动时不用第 3 阶段近耳估计,而改用第一阶段去佩戴者输出;二者搭配的原因是注册与混合失配时目标容易被漏检丢帧,而硬门控会过度抑制低能量语音段,组合意义是用活动掩码选择可信的目标估计、用回退保留对话连续性,减少信息丢失。

这种设计的教学要点是把定位与精修分开。前段靠对比线索解决注册失配下的定位模糊,后段靠单一目标线索避免负参考引入的过度抑制,活动掩码则把抽取与有无目标的判断解耦。

第三阶段为何改用映射并做门控组合?

第 3 阶段的目标是改善听感质量。论文明确指出前 2 阶段的伪标签由线性滤波生成,本身偏离理想参考,仍可能含噪声与干扰,模型预测还会引入残留伪影,因此加一个后处理阶段精修最终输出。该阶段输入是参考麦克风信号与前 2 阶段输出拼接成的单通道信号,条件只有目标锚点,特征融合策略与前图一致,但预测方式不同,前 2 阶段估计掩码,该阶段用映射网络直接预测目标近耳语音。

推理时的最终组合是把第 3 阶段近耳估计与第一阶段去佩戴者表示按活动掩码加权相加。目标被检测到时用第 3 阶段预测,目标未被检测到时用第一阶段输出作回退,以减少信息丢失。论文的消融显示直接用第 3 阶段输出能得到最高的频率加权分段信噪比,但用活动掩码硬门控会过度抑制低能量语音段,损害可懂度与感知分;加入回退后在保持可懂度的同时获得更好的总体感知质量,这说明门控的阈值行为与语音完整性之间存在权衡。

没有干净中间监督时如何构造训练目标?

数据集为 4 个说话人提供近耳录音,但没有 3 阶段所需的中间信号监督,且近耳与可穿戴录音之间存在未知声传递路径,不能直接把近耳当标签。论文把参考通道建模为 4 个说话人近耳经各自传递函数卷积之和,再在短时傅里叶域用有限冲激响应滤波器近似这些传递函数。

伪标签 × 线性滤波: 伪标签负责为第一阶段去除佩戴者后的参考信号与第二阶段参考通道目标分量提供可训练的监督;线性滤波负责用近耳音频经短时傅里叶域有限冲激响应滤波器向参考麦克风投影来近似声传递函数;二者搭配的原因是数据集只提供 4 人的近耳录音而没有中间监督,且近耳与可穿戴录音存在未知传递路径不能直接作标签,组合意义是用估计的滤波器系数生成与参考通道对齐的近似监督,使 3 阶段能按顺序训练。

具体做法是对每个频点取各说话人近耳的延迟向量并堆叠成全说话人矩阵,收集全部帧后用正则化正规方程求解滤波器系数,再把系数按说话人分块,逆变换得到每个说话人在参考通道的贡献估计。第一阶段伪参考是参考通道减去佩戴者分量估计,第二阶段伪目标是目标说话人在参考通道的贡献估计。论文报告伪标签生成时滤波器抽头数取为 5。

损失按阶段匹配预测目标。第一阶段用波形重建对应的时频损失,即幅度重建加尺度不变谱均方误差。第二阶段在同一波形损失上增加语音自监督感知损失与活动检测损失,感知损失对语音自监督模型全部编码器层的隐表示求层平均均方误差,活动检测用带 Logits 的二元交叉熵,权重按原文取感知系数 0.1、活动系数 1。第 3 阶段用波形损失,可选加感知损失,不再加活动损失,活动只用于推理门控。3 个阶段按顺序训练,不做端到端联合训练,所有模型最多训练 200 轮,ECAPA-TDNN 保持冻结。

数据、特征、延迟与网络规模如何固定?

实验使用挑战组织者提供的官方 CHiME-9 ECHI 数据集,论文在开发集的智能眼镜轨道上报告结果,并向官方测试集提交系统。前端用矩形窗,窗长 512、跳长 128,采用非对称窗与重叠保留,算法延迟约为一个跳长,以满足挑战延迟要求。短时傅里叶幅度损失用的帧长 320、帧移 160,幅度代理取实部与虚部绝对值之和后求平均绝对误差;尺度不变谱项先取幅度、去掉直流、按 5 帧乘五频点做局部归一化再求均方误差。

网络规模按阶段区分。第二阶段主干层数为 6,循环隐单元 256,注意力头数 4,查询键投影 256,嵌入维度、核与步幅配置为 128、4、1。第一与第三分支用更小配置,层数 2,循环隐单元 128,注意力头数 4,查询键投影 128,嵌入配置为 64、4、1。优化器用 Adam,初始学习率按原文取对应值,梯度裁剪最大二范数为 1.0。评价分个体音轨与求和音轨两种模式,指标方向是频率加权分段信噪比、短时客观可懂度、感知评价与复合测度越大越好,测试集另有可懂度百分比与信号、背景、总体质量分。

下表把论文明确给出的通道数、滤波器抽头、损失权重、优化器学习率与前后端窗参数整理成可核对的配置清单,便于复现时逐项对照,表中数值写法保留原文精度与单位关系。

配置项参数名第一组取值第二组取值说明对象
录音通道通道数7 通道512 窗长智能眼镜输入
伪标签滤波抽头数5 抽头128 跳长投影用滤波器
阶段一损失权重0.5 权重320 帧长谱项系数
阶段二损失权重0.1 系数1 系数感知与活动权重
优化前端学习率5 × 10−4 学习率160 帧移训练与特征

上表覆盖了通道规模、伪标签滤波长度、2 阶段损失权重与优化器及前后端分帧的关键数字,下一节将说明这些条件固定后主结果与消融如何比较,配置表本身不代替性能比较。

在测试集上哪些变好,哪些变差?

比较的问题是最终提交系统相对官方基线在未见测试条件下的实际收益与代价,公平条件是同一智能眼镜轨道的官方测试集,指标方向是可懂度百分比越高越好,信号质量、背景质量与总体质量分越高越好。论文报告的测试集数字是理解代价的关键,不能只看总体质量。

评价条件评价指标官方基线本文系统对比说明
智能眼镜轨道可懂度55.28%48.43%测试集可懂度
智能眼镜轨道信号质量2.31 分3.56 分目标本身质量
智能眼镜轨道背景质量2.75 分1.81 分背景保持
智能眼镜轨道总体质量2.16 分2.28 分总体听感

表后需要同时读出收益与代价。收益是目标语音本身的感知质量大幅提升,信号质量从 2.31 分升到 3.56 分,总体质量从 2.16 分升到 2.28 分,报告显示后处理对听感有帮助。代价是可懂度从 55.28% 降到 48.43%,背景质量从 2.75 分降到 1.81 分,说明系统在压残留干扰与美化目标时可能损伤了可懂所需的细节或引入了背景伪影。论文认为这一趋势与开发集观察大体一致,即后处理改善感知语音质量,但需要在未见测试条件下更好地保持可懂度并减少背景伪影。未胜出的项必须保留,可懂度与背景质量就是明确的反例,不能用总体质量的提升掩盖这两项下降。

两阶段到三阶段的每一步带来什么变化?

论文在开发集上做了从 2 阶段到 3 阶段的消融,比较对象包括未处理直通、官方基线、2 阶段佩戴者抑制加目标提取、2 阶段加活动检测、3 阶段后处理直接输出、3 阶段后处理加活动门控,以及最终的 3 阶段后处理加活动门控加回退。个体音轨与求和音轨两种模式下趋势一致,因此可以用文字概括而不重复抄写全部开发集数字。

2 阶段相对基线已在可懂度与感知质量上带来一致增益,加活动检测头后频率加权分段信噪比进一步改善且可懂度与感知评价保持稳定,报告支持显式目标活动建模能稳定提取。引入后处理后频率加权分段信噪比提升最明显,在两种模式下都是最高,支持轻量精修能有效压住提取后的残留干扰。但对后处理输出做硬活动门控会过度抑制低能量语音区,虽然信噪比仍受益,可懂度下降、感知分略降。

最终加回退的策略在活动为负处用第一阶段去佩戴者信号补回内容,在个体音轨上取得最好的复合总体与信号分,同时保持有竞争力的可懂度,显示出为助听播放避免丢帧、保持对话连续性的更有利权衡。

这一节的限制是开发集的具体数值表在本次证据中只有矩阵而无可用表头绑定,本文不硬抄矩阵数字作宽表,而是用测试集的完整原句数字承担定量结果表的门禁要求。开发集的机制结论仍可复述,但应视为论文报告的趋势,需要读者回到原文表格核对每列指标与两种音轨模式的对应关系。

哪些边界没有测,哪些推测不能当结论?

论文直接报告的是开发集多指标提升与测试集信号质量和总体质量提升,同时直接报告了测试集可懂度与背景质量下降。这是一个已验证的权衡,不是实现失误的猜测。有限解释是后处理改善听感但可能损伤可懂细节,活动硬门控过度抑制低能量段,回退能缓解丢失,这些解释有消融趋势支持,但论文没有给出误检率、延迟实测或计算开销的完整测量,因此不能承诺误检、延迟或成本同时改善。

未验证的推测需要明确标为可能。注册与混合在说话风格或情绪失配时的鲁棒性是论文未来工作指出的方向,目前只用了多锚点对比与回退缓解,没有证明失配已解决。伪标签投影的滤波器长度、正则化常数与归一化块大小的选择依据在证据中没有充分展开,不能从模型名推定其最优性。训练资源、推理开销、输出帧率与实际延迟应分别讨论,总体趋势不等于每组每步都成立,测试集背景质量下降也提醒在未见噪声下后处理的泛化边界尚未闭合。

要复现应先做什么,需要哪些外部资源?

复现的第一步是按顺序准备数据与身份条件。获取官方 ECHI 数据,确认 7 通道智能眼镜录音、参考通道定义、4 人近耳与各说话人注册的对应关系,区分个体音轨与求和音轨的评价脚本。第二步是实现伪标签投影,按论文的延迟堆叠与正则化正规方程求解分频点滤波器,抽头数取 5,生成第一阶段去佩戴者伪参考与第二阶段参考通道目标伪标签,并检查投影后是否仍含可听噪声,因为这决定第 3 阶段是否必要。

第三步是按阶段训练。保持 ECAPA-TDNN 冻结,依次训练第一阶段到第 3 个阶段,不做联合端到端训练;前端窗长 512 跳长 128,非对称窗加叠保留保证约一跳延迟;损失权重按原文取 0.5、0.1、1;优化器与学习率及梯度裁剪按原文设置。

第二阶段同时训练复数比掩码与活动检测头。第四步是推理组合,实现活动门控加回退的最终公式,并在开发集上先验证 2 个阶段、加活动、加后处理、加门控、加回退的完整消融,再提交测试。

外部资源方面,论文脚注给出 3 个当前可用的第三方链接,分别是说话人验证模型、鲁棒语音活动检测工具与语音自监督模型,资源状态为可用意味着本次核验可达,但不代表论文代码整体开源。缺项是官方基线权重、完整训练脚本与随机种子、硬件预算与训练时长在证据中未交代,复现时应记录这些缺项而不自行编造划分或聚合口径。

何时值得尝试这种三阶段做法?

当混合中存在一个显著强于目标的已知干扰源,且该干扰源有可靠注册时,值得尝试先抑制再提取的分工。佩戴者语音符合这一条件,因为位置固定、能量占优、身份已知,单独成段可以降低后续提取的动态范围压力。当注册与混合可能失配且目标会间歇缺席时,值得加入干扰人负参考与显式活动检测,前者帮助定位,后者帮助决定何时输出目标、何时回退。当前处理改善听感但损害可懂或背景时,应优先检查后处理监督与门控策略,而不是一味加大后处理容量。

对研究生而言,可复述的方法是输入表示到组件到目标到输出的闭环。输入是 7 通道混合加多锚点注册,表示是短时傅里叶特征加局部与全局说话人嵌入,组件是调制融合加因果网格、复数比掩码与活动掩码、映射后处理,目标是伪参考、伪目标与近耳信号的 3 级逼近,输出是门控组合后的单通道估计。记住论文的中心判断,强自干扰与注册失配是主要矛盾,3 阶段的每一段都在为下一段创造更易处理的条件,而最终的听感收益是以可懂度与背景保持为代价换来的,补上这两项的验证才是下一步工作。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 2 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 2 页

区域 2 · 查看论文原页

原文数学表达区域 3,PDF 第 2 页

区域 3 · 查看论文原页

原文数学表达区域 4,PDF 第 3 页

区域 4 · 查看论文原页

原文数学表达区域 5,PDF 第 3 页

区域 5 · 查看论文原页

原文数学表达区域 6,PDF 第 3 页

区域 6 · 查看论文原页

另有 17 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 chime-2026 论文汇总