英文题目:SCANS: Supervised Contrastive Temporal Alignment of Neural Responses and Speech Stimuli
会议身份:
conference:interspeech:2026:conference-paper-id:hassan26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#注意力机制 #对比学习 #脑信号 #语音 #言语神经解码
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- K M Naimul Hassan:机构信息未能从会议 PDF 纯文本可靠映射
- Donald S. Williamson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
匹配失配任务以64通道EEG片段为输入,需从同一语音信号的N个非重叠候选包络中选出时间同步的一项,难点在于EEG噪声大、维度高且被试差异显著。所提SCANS先用扩张卷积前端将EEG与语音包络投影到128维共享空间并扩大感受野提取局部特征,输出序列进入下一步精炼。接着对称跨模态注意力以对方模态为键值做相互精炼并加入位置嵌入保持时序,再经全局平均池化与L2归一化得到可比嵌入。最后将EEG与音频嵌入拼接后经多层感知机分类头输出匹配logit,并以交叉熵加监督对比对齐损失联合优化全局同步。与仅在末层比较的晚融合编码器不同,该链路在特征提取全程交换信息,以身份矩阵为监督稳定共享隐空间并提升跨被试泛化。在SParrKULee数据集2023赛制评测设置下,SCANS的Total Score为86.1,高于Thornton等人的Total Score 82.13。该结论适用边界限于荷兰语听故事范式与3 s及5 s窗和2选1及5选1设置,跨语言与在线助听部署尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么值得做对齐?
本文的输入是两类时间信号。一类是非侵入式脑电信号,原文使用 64 导联记录,时间分辨率达到毫秒级,适合捕捉皮层对连续语音的快速响应。另一类是语音刺激的声学包络,原文经 28 子带伽马通滤波组与幂律压缩提取,再与脑电统一降采样到 64 赫兹。输出是一个选择动作:在给定一段脑电和来自同一语音信号的多个不重叠候选语音段时,指出哪一段是在记录时实际播放的同步段。
必须保留的信息包括窗长、候选数、被试划分方式和指标聚合对象,因为正确率的高低只有在相同任务难度和相同泛化条件下才可比。本文的输出是 1 篇可复述方法的中文解读,按任务与路线、方法全景、组件计算、训练推理、实验条件、结果反证、复现收束的顺序展开。脑电与语音对齐之所以值得做,是因为它是神经语音解码的基础映射。一方面,听觉研究需要把特定的神经响应与所注意的声学输入联系起来。
另一方面,脑机接口需要用这种映射验证生理性语音感知,或为语音重建提供真值对应。难点在于脑电噪声大、维度高、个体差异大,而语音动态变化快,两者物理量纲与统计分布都不同,直接比较容易被伪相关淹没。因此论文把问题形式化为匹配失配分类,用可计数的正确率来衡量是否真正抓住了时间同步关系。
已有路线如何从 late fusion 走到多层对齐与对比学习?
早期可运行的基线是扩张卷积网络联合提取脑电与语音特征,再用余弦相似度分类匹配段。后续工作沿 3 个方向改进。第一是集成与高频调制方向,通过多数投票减少噪声误差,或加入高频语音调制提升精度。第二是结构增强方向,引入多头注意强调任务相关脑电成分,用门控循环单元建模语音时间依赖。第三是融合时机方向,传统做法是各自编码到最后才比较,被称为后期融合,原文指出它常常无法弥合模态差距。
为此有工作在每个隐藏层后插入基于注意的相关模块,让两种模态在特征提取过程中逐步对齐;也有双向映射框架比较一侧网络浅层与另一侧网络深层,使最终分类同时包含低层与高层特征。这些方法受脑电噪声与跨被试变异限制,泛化所需的共享模式容易被遮蔽。另一条路线引入对比学习目标,用信息噪声对比估计损失拉近匹配的脑电语音对、推开失配的干扰项,迫使网络学习更具判别力的共享隐空间。
原文认为该路线的前人实现有两个局限:一是自监督对比通常需要海量数据,而脑电语音严格 1 对一映射限制了正负对的多样性;二是独立编码器直到最后比较才交换信息,错过了特征提取阶段的跨模态依赖。SCANS 的定位正是对这两点的回应:用跨模态注意实现全程交互,用有监督的严格同步标签稳定共享隐空间。
任务的操作定义与难度旋钮是什么?
设脑电段为待解释的神经响应,候选集合包含多个语音段,其中只有一个是在记录时播放的真值匹配段,其余为来自不同刺激或远离时间偏移的干扰段。模型要学习一个函数,从集合中正确识别同步刺激。难度由两个旋钮控制。一是窗长,原文实验取 3 秒与 5 秒,窗越长包含的神经声学信息越多,但对长时建模与数据切分提出更高要求。二是候选数,原文实验取 2 与 5,候选越多偶然猜中的概率越低,5 选 1 时随机水平为 20%,2 选 1 时随机水平为 50%。
评价时训练用重叠滑动窗增大密度,评估用非重叠切分并在连续段之间保留 1 秒缓冲,避免时间泄漏,保证统计独立。每个脑电段对应 1 次 1 对多选择,干扰项特意从不同刺激或远距离偏移采样,充当困难负例。理解这个定义后,才能明白后文正确率数字的含义:它不是重建语音波形的保真度,而是在固定窗长与候选数下选对同步段的比例。
匹配失配分类 × 时间对齐: 匹配失配分类是本任务的操作定义:给定一段脑电和来自同一语音信号的多个不重叠候选语音段,模型必须选出时间上同步的那一段;时间对齐是它要解决的物理对应关系,即神经响应与语音包络在时间轴上的同步关系。二者搭配的原因是直接回归连续语音波形困难,而离散选择能给出可核对的正确率;组合意义在于把难以量化的追踪问题转化为可在固定窗长和候选数下比较的分类问题。
初学者容易把匹配失配误解为判断语音内容是否相同。教学例子是:两段语音内容可以都讲同一句话,但只有与脑电记录时刻对齐的那一段才是匹配段,另一段即使内容相似,只要时间偏移足够远就是干扰项。本文例子仅用于说明定义,不附加无源的效果数值。
SCANS 让一个样本走完输入到输出经历了什么?
SCANS 为脑电与语音各设一个结构相同的编码器,每个编码器包含扩张卷积前端与跨模态注意变换器,最后接一个共享的分类头。沿一个样本走一遍:64 导脑电先经空间卷积投影到 128 维,单通道语音包络也投影到同一 128 维;两者各自经过 3 层扩张卷积扩大感受野并做层归一化;随后进入对称的跨模态注意块,脑电特征作为查询去注意语音的键与值,语音分支则反向操作,实现相互精炼;注意块内加入位置嵌入保留时间顺序,经前馈层与残差连接稳定训练。
序列经全局平均池化压缩为定长嵌入并做归一化,得到脑电嵌入与语音嵌入;一方面用两者余弦相似度矩阵计算有监督对比对齐损失,另一方面把每个候选的脑电与语音嵌入拼接送入浅层多层感知机输出打分,取最高分作为预测的同步段。训练目标是分类损失与对齐损失的加权和,权重系数取 0.5,兼顾单次试验判别与批次全局同步。推理时对每个脑电段比较全部候选的打分,不需要额外检索库。 本段之后是方法总览图的前导读。
阅读时先确认左右两条编码支路的输入输出,再看中间前端与注意模块的展开,最后核对右侧两个损失的引出位置,这样才能把文字描述与框图箭头一一对应。
看图路径: 1. 先从左侧脑电与语音两条输入支路沿箭头向右追踪到嵌入向量与分类头;2. 再看中间扩张卷积前端框内三层扩张卷积与残差连接的堆叠顺序;3. 然后观察右侧跨模态注意框内查询与键值的交叉连线方向;4. 最后核对两个损失分支分别从嵌入层和分类头引出的位置
论文图 1。原论文 Figure 1:“Model Architecture of SCANS. The framework uses a Dilated Convolutional Frontend (DCF) to project 64-channel EEG and speech envelopes into a shared 128-dimensional space using…”。
图中左侧显示脑电与语音各自经过预处理后进入编码器,每个编码器内依次是扩张卷积前端与跨模态注意变换器,两条支路之间有交叉曲线表示查询与键值的互换。中间展开显示前端由 1 维卷积加 3 层不同扩张率的扩张 1 维卷积与层归一化组成,右侧展开显示注意块由层归一化、多头注意、层归一化、位置嵌入与全连接层组成。右侧输出部分显示归一化嵌入分别引出对比对齐损失与分类头交叉熵损失。这一结构对应正文强调的全程融合思想:模态交互不是只在最后打分时发生,而是在注意块内部已经发生。
前端、注意块与分类头各自算什么?
扩张卷积前端的输入是已投影到 128 维的序列,操作是 3 层核大小为 3、扩张率按指数增大的扩张卷积,每层后接线性整流激活与残差连接,最后做层归一化。它的作用是用较少参数获得大感受野,同时保留时间分辨率,适合捕捉语音包络的长时调制与脑电的慢漂移。脑电支路多一步空间卷积,把 64 通道线性组合为 128 维,可理解为可学习的空间滤波器,用于抑制伪迹与突出听觉相关成分。
跨模态注意变换器的输入是前端输出的序列,操作是层归一化后加位置嵌入,再做 4 头注意与 512 维前馈网络,并用丢弃正则化稳定。关键是双通路对称设计:一路以脑电为查询、以语音为键值,另一路角色互换,使每个编码器都能根据对方上下文选择性精炼自身表示。输出序列经全局平均池化变为定长向量并做归一化,便于用余弦距离度量相似度。
分类头的输入是对每个候选拼接后的脑电与语音嵌入,操作是经 64 单元隐层与线性整流激活再输出标量打分,隐层使用 0.3 的丢弃率,最后取打分最大者为预测。这一设计把表示对齐与决策分离:嵌入负责可比性,打分负责单次试验选择。
扩张卷积前端 × 跨模态注意: 扩张卷积前端负责在各自模态内扩大时间感受野,用少量层覆盖长时语音调制与脑电慢变化,同时保持时间分辨率;跨模态注意负责让脑电特征去查询语音的键与值、反之亦然,在特征提取中途就交换信息。二者搭配的原因是仅靠后期融合难以弥合脑电与语音包络的模态差距,而仅靠注意又缺少局部声学与空间滤波基础;组合意义在于先把 64 导脑电与单通道包络投影到同一 128 维空间,再用对称注意做相互精炼。
语音包络 × 脑电嵌入: 语音包络是经滤波组与压缩提取的缓慢幅度变化,代表语音的时间节奏,是与脑电追踪最相关的声学表示;脑电嵌入是经空间卷积与扩张卷积再经跨模态精炼后的定长向量,代表该时间窗的神经响应。二者搭配的原因是两者采样率与物理量纲不同,必须先下采样到同速率并做标准化才能比较;组合意义在于经全局平均池化与归一化后,两者在共享隐空间用余弦相似度直接度量同步程度,为对比损失与分类头提供共同基础。
需要提醒的是,原文未报告注意层数堆叠的具体层数与丢弃率的完整消融,只给出头数、前馈维度与分类头结构,因此复述时不猜测去掉某层必然带来多少下降,只说明原文给出的安排理由是扩大上下文与全程交互。
两个损失如何分工,监督信号从哪里来?
分类损失的输入是分类头对多个候选的打分集合,目标是让真值同步段的打分最高。实现是标准的交叉熵:对打分做指数归一化,最大化真值索引的概率。它的监督来源是每次试验的同步标签,即哪个候选是实际播放段。有监督对比对齐损失的输入是批次内所有脑电嵌入与语音嵌入的余弦相似度矩阵,目标是让矩阵对角线最显著。
做法是把相似度乘以可学习的温度参数,再分别沿行与列做交叉熵:行方向保证给定脑电时对应语音最相似,列方向保证给定语音时对应脑电最可辨,两者取算术平均。与常规自监督对比不同,这里的目标矩阵是严格的单位矩阵,因为实验的时间同步决定了第几个脑电只匹配第几个语音,不允许多正例的柔性聚类。分子把同步对拉近,分母把批次内所有其他配对推开。总损失是分类损失加 0.5 倍的对齐损失。
原文解释该权重的意图是防止过拟合到单次试验的特定干扰项,迫使模型学习以时间身份为锚的模态不变隐空间。优化器采用 AdamW,初始学习率为 0.001,配合学习率在平台期下降的调度器与早停。原文未报告批次大小、训练轮数上限与早停耐心值的具体数字,这是复现时需要补齐的缺项,不从模型名称推定。梯度路径方面,对比损失同时更新两个编码器,分类损失经拼接嵌入回传到两个编码器,温度参数可学习;原文未给出梯度截断或停止梯度的特殊设计,故不猜测。
分类损失 × 有监督对比对齐损失: 分类损失负责解决单次试验内的 1 对 N 减 1 选择,即对每个候选输出打分并用交叉熵惩罚选错同步段;有监督对比对齐损失负责在整个训练批次上拉近同步的脑电与语音嵌入、推开不同步组合,用对称的行列交叉熵实现双向约束。二者搭配的原因是只看单次试验容易过拟合到特定干扰段,而只做全局对齐不直接优化选择决策;组合意义在于以总损失中权重系数平衡局部判别与全局模态不变表示。
一句话总结:分类损失管选对本次候选,对齐损失管在批次范围内让同步表示全局可比,两者监督都来自实验记录的时间同步真值。
数据、预处理与切分条件是否一致?
SCANS 在 SParrKULee 数据集上训练与评估,该数据集被用于相关听觉脑电解码挑战,原文描述包含 168 小时 64 导脑电,来自 105 名被试,被试在隔音室经耳机听连续荷兰语故事,刺激以单耳或双耳呈现,覆盖安静与竞争说话人条件。划分沿用挑战预设,测试分为被试内与留出被试两类。训练集规模随挑战年份变化,原文表格区分 2023 与 2024 配置,测试集的时长与人数也分别报告。预处理方面,脑电经 0.5 赫兹高通滤波、多通道维纳滤波去伪迹与平均参考,再降采样到 64 赫兹。
语音包络经 28 子带伽马通滤波组与幂律压缩提取并降采样到 64 赫兹;两者再做标准化,以缓解被试间幅度差异,保证跨模态注意的统计分布一致。切分方面,同步的脑电与音频流按窗长切分,训练用 64 采样点即 1 秒步长的重叠滑动窗增大密度,评估用非重叠切分并加 1 秒缓冲防泄漏。候选干扰项从不同刺激或远距离偏移采样。实现基于 PyTorch。
指标包括正确率、平均被试正确率与被试间标准差,分别回答总体选对比例、按被试平均后的水平与跨人稳定性。指标方向是正确率越高越好,标准差越低越好。
被试内测试 × 留出被试测试: 被试内测试指测试被试在训练中出现过但刺激语音未见过,用于检验对新语音内容的泛化;留出被试测试指测试被试完全未在训练中出现,用于检验对新大脑个体的泛化。二者搭配的原因是脑电存在显著的个体差异,只测其一会高估实用性;组合意义在于同时报告两套平均被试正确率与被试间标准差,才能判断模型学到的是被试不变的神经语音对应还是记住了特定人的模式。
复述时必须同时核对数据集、模型、阶段、指标与聚合对象,数值相同不代表指标相同。例如总体正确率与平均被试正确率在数值上可能接近,但聚合方式不同,不能混用。
主结果在什么条件下比谁高出多少?
以下两张表按问题组织:第一张聚焦 2 选 1、3 秒窗的挑战赛条件,比较总分与两类被试的平均正确率及方差;第二张聚焦 5 选 1、5 秒窗的高难度条件,比较留出被试的平均正确率与稳定性。每张表前说明比较问题与公平条件,表后解释收益与代价。 第一张表要回答的问题是:在 2023 挑战赛定义的 2 候选、3 秒窗条件下,SCANS 相对当年可运行的最强基线是否同时提升精度与稳定性。
公平条件是同一数据集划分与同一窗长候选数,指标方向为平均正确率越高越好、标准差越低越好,总分是被试内与留出被试平均正确率的加权平均。
| 任务条件 | 评价指标 | 挑战赛前最佳 | SCANS 报告 | 比较含义 |
|---|---|---|---|---|
| 2 候选 3 秒窗 | 总分 | 82.13 | 86.1 | 总分提升约 4 个点 |
| 2 候选 3 秒窗被试内 | 平均被试正确率 | 前最佳基线 | 87.09% MSA | 被试内精度领先 |
| 2 候选 3 秒窗留出被试 | 平均被试正确率 | 前最佳基线 | 84.12% MSA | 跨人泛化领先 |
| 2 候选 3 秒窗稳定性 | 被试间标准差 | 前最佳 5.27% 至 7.70% 区间 | 3.75% 与 3.12% | 方差明显更低 |
| 2 候选 3 秒到 5 秒 | 被试内正确率 | 86.86% | 88.66% | 长窗带来增益 |
表后解释如下。报告显示 SCANS 总分达到 86.1,超过当年领先模型的 82.13,增益主要来自被试内 87.09% 与留出被试 84.12% 两项同时领先。
更关键的是稳定性:前人模型的被试间标准差多在 5% 到 7% 区间,而 SCANS 降到被试内 3.75% 与留出被试 3.12%。代价是该表未展示每次试验的误判分布与推理开销,总体趋势不等于每个被试都提升。未胜出项方面,原文表格中仍保留多个基线的历史数值,说明在更早的扩张卷积基线上精度更低,但本文解读不把类别差异当同条件胜负,只强调在相同窗长候选数下的可运行比较。
第二张表要回答的问题是:在 2024 挑战赛定义的 5 候选、5 秒窗、仅考核留出被试的条件下,SCANS 能否在随机水平仅 20% 的高难度下保持判别力与低方差。公平条件是同一 5 选 1 任务与同一 5 秒窗,指标为留出被试平均正确率越高越好、标准差越低越好。
| 任务条件 | 评价指标 | 挑战赛前最佳 | SCANS 报告 | 比较含义 |
|---|---|---|---|---|
| 5 候选 5 秒窗留出被试 | 平均正确率 | 前最佳模型为参照 | 69.33% | 高难度下显著领先 |
| 5 候选 5 秒窗留出被试 | 领先幅度 | 前最佳模型为参照 | 6.53% | 相对前最佳的增量 |
| 5 候选 5 秒窗留出被试 | 稳定性 | 前最佳方差更高 | 4.60% | 方差最低 |
| 5 候选 5 秒窗被试内 | 正确率 | 随机水平 20% 为参照 | 74.66% | 约 4 倍于随机水平 |
| 5 候选留出被试 3 秒到 5 秒 | 标准差变化 | 15.99% | 4.60% | 长窗稳定预测 |
表后解释如下。
报告显示 SCANS 在 1 对 4 范式下留出被试平均正确率达到 69.33%,超出前最佳模型 6.53 个百分点,且被试间标准差为 4.60%,为同期最低。另一证据是被试内 74.66% 的正确率约为 20% 随机水平的 4 倍,说明判别力不是靠猜测。反例是 3 秒窗下 5 候选留出被试的标准差曾高达 15.99%,增至 5 秒才降到 4.60%,表明短窗在高难度下跨人方差很大,长窗提供了必要的信息密度。
限制是原文仅在留出被试条件下报告该难度,未给出被试内方差的完整对照,也未测量延迟与计算成本,因此不能承诺实际助听设备的实时收益。
窗长与候选数变化支持什么,又反证了什么?
原文没有给出去掉对比损失或跨模态注意的逐项消融表格,因此本节只能按窗长与候选数的对照来讨论,这属于论文特有的任务难度分析,不是模块消融。测的是什么:固定候选数比较 3 秒与 5 秒,固定窗长比较 2 选 1 与 5 选 1,观察精度与被试间标准差的变化。与谁比:同一 SCANS 在不同任务配置下的自身对照,以及与挑战赛基线在相同配置下的横向比较。条件是否一致:评估切分均为非重叠加缓冲,干扰项采样策略一致,区别仅在窗长与候选数。
关键数字已在结果表中列出:2 选 1 被试内从 86.86% 升至 88.66%,留出被试在 5 秒 2 选 1 下仅下降约 1.77 个百分点,5 选 1 留出被试标准差从 15.99% 降至 4.60%。支持的判断是跨模态注意有效利用了扩展时间上下文,对比对齐学到了被试不变的共享模式。反证是难度放大多候选时精度必然回落,5 选 1 的绝对正确率(%)远低于 2 选 1,说明模型并未解决高难度下的全部混淆。另一个反例是短窗高难度下方差极大,表明单靠对比损失不能在信息不足时稳定跨人预测。
原文未报告训练时长、参数量与推理帧率,也未报告不同随机种子的波动,因此不能把 1 次最优值当作可部署的期望收益。若要补验证,应固定随机种子多次训练并报告置信区间,同时记录单位时长音频的推理耗时。
哪些结论有直接证据,哪些还只是可能?
直接报告的是在给定划分与预处理下的分类正确率与被试间标准差,证据是表格与正文复述一致的数字,例如总分 86.1、留出被试 69.33% 与多处标准差。有限解释的是跨模态注意利用长时上下文、对比损失捕捉被试不变模式,这些解释与窗长增益和跨人小落差一致,但原文未提供注意力权重分布或嵌入可视化来证明机制,故用支持而非证明来表述。
未验证的推测包括对真实助听器或脑机接口的实时增益、对其他语言与年龄群的泛化、对伪迹更重数据的鲁棒性,原文未测量误判率分解、延迟与算力成本,因此不承诺这些量得到改善。数据方面,刺激为荷兰语故事、特定实验室环境,被试数量与时长有限,结论外推到其他语言需谨慎。方法方面,温度参数可学习但初值与动态未交代,批次大小与早停细节缺失,超参数敏感性未知。
相关性不等于因果:长窗与高精度同时出现,不能排除训练样本重叠度或评估样本数变化的影响。总体趋势不等于每组每步都成立,平均正确率高不代表每个被试都高,标准差低只说明离散小,不说明误差类型可接受。
要复现先做什么,需要补哪项验证?
复现先做数据与切分。按原文下载 SParrKULee 并沿用挑战划分,脑电做 0.5 赫兹高通、多通道维纳滤波、平均参考后降采样到 64 赫兹,语音包络用 28 子带伽马通滤波组加幂律压缩后降采样到 64 赫兹,两者做标准化。切分时训练用 1 秒步长重叠窗,评估用非重叠窗加 1 秒缓冲,干扰项从不同刺激或远距离偏移采样,窗长与候选数严格取 3 秒或 5 秒、2 或 5。模型按前端 128 维、3 层扩张卷积、4 头注意、512 维前馈、分类头 64 单元隐层与 0.3 丢弃搭建,总损失权重取 0.5,优化器用 AdamW 初始学习率 0.001 加平台期下降与早停。
先跑通 2 选 1、3 秒窗的被试内与留出被试两条评估,核对总分与两项平均正确率是否接近原文,再跑 5 选 1、5 秒窗的留出被试。还需补的验证包括固定多种子重复训练报告均值与区间、记录训练时长与推理延迟、保存嵌入相似度矩阵检查对角线是否显著、分析错误是否集中在特定被试或特定故事段。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开,复现时应以论文文字与官方挑战渠道为准。
本次未能确认可达的资源一律按未能确认处理,不做可用性承诺。
何时值得尝试这种组合,何时不必?
当任务是脑电与语音包络的时间同步选择,且存在跨被试泛化要求时,值得尝试扩张卷积加跨模态注意再加有监督对比的组合。它的前提是能获得严格的时间同步标签,可构造单位矩阵目标;它的收益是同时优化单次选择与批次全局可比性,在原文条件下精度与稳定性双升。实现要点是先统一采样率与统计分布,再做对称的查询键值交换,最后用加权总损失联合训练。
当数据极少、窗极短或候选极多时,不必期待同样增益,因为对比分母的多样性不足、短窗信息密度不够,原文中 15.99% 的短窗方差就是提醒。当目标是重建语音波形细节或实时增强语音时,该方法只是提供对齐真值,不能直接替代重建与增强模块。常见误解是把平均正确率高理解为每个被试都好,或把对比损失理解为无监督聚类。纠正如下:平均值掩盖个体差异,需看标准差;本对比是有监督的严格 1 对一同步,不是语义相似性聚类。
另一误解是把后期融合与全程融合等同,实际上本文的关键差异是在特征提取中途就交换信息,而非只在最后打分。收束一句话:在相同窗长候选数与相同划分下,SCANS 报告了更高的正确率与更低的跨人方差,但其实用价值仍需补上多种子、延迟成本与跨语言验证才能确定。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
