英文题目:SUBJECT‑INDEPENDENT AUDITORY ATTENTION DECODING FROM MOBILE EEG VIA CONTRASTIVE LEARNING

会议身份:conference:eusipco:2026:conference-paper-id:0000276

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #脑信号 #语音 #言语神经解码

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Tanveer, M. Asjid:机构信息未能从会议 PDF 纯文本可靠映射
  • Jensen, Jesper:机构信息未能从会议 PDF 纯文本可靠映射
  • Alickovic, Emina:机构信息未能从会议 PDF 纯文本可靠映射
  • Tan, Zheng-Hua:机构信息未能从会议 PDF 纯文本可靠映射
  • Østergaard, Jan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

听觉注意解码需从双人竞争语音场景下的44导移动脑电中判别被试注意的是哪一路说话人,输出为目标语音选择,其难点在于跨被试泛化差,且持续注意、注意切换与自然对话导致神经语音耦合不稳定。方法链第一步由二维卷积脑电编码器将多通道脑电映射为时序脑电嵌入,保留注意相关的神经动态以供后续对齐。第二步由音频编码器将包络、32带梅尔谱与Wav2Vec 2.0融合特征映射到同一嵌入空间,并计算掩码SigLIP相似度得到匹配分数,其相似度输出直接作为分类判决依据。第三步由扩张卷积重建模块从脑电嵌入重建目标包络,以重建损失约束嵌入保留可解释的语音包络结构并与对比损失联合训练。与传统包络刺激重建相比,关键差异是以判别式脑电语音对齐替代纯信号估计,并用权重矩阵屏蔽同音频跨样本伪负对,其实质是让模型学习注意驱动的跨模态区分特征而非仅拟合波形。在留一组交叉验证协议下,三特征对比学习流水线的准确率为67.0%,高于仅梅尔谱加包络变体的准确率64.3%。该结论适用边界受限于丹麦语、正常听力、实验室摆位的三类双人竞争任务,尚未验证耳机式少通道、听损人群与强混响移动条件下的外推性能。原文未披露训练、推理或部署成本

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要解决的多说话人注意问题有多难?

本解读的输入是论文原文提供的标题、摘要、方法、实验与结果文字,目标是让刚进入语音音乐音频方向的研究生能复述出跨被试移动脑电听觉注意解码的完整做法,必须保留的关键信息包括数据规模与采集条件、预处理与划分方式、3 模型结构与损失构成、训练窗长与优化设置、评估窗长与指标方向,否则后续复现会缺条件。输出是 1 篇按学习依赖展开的中文技术解读,不做超出原文的营销判断,所有数字只讲原文实际报告的值。

听觉注意解码这个任务要回答的是,在有两个或更多人同时说话时,仅从听者的脑电信号判断他正在听哪一路。白话说就是鸡尾酒会问题的大脑版本:耳朵收到的是混合声,大脑却锁定了其中一路,模型要把这种锁定读出来。英文名是 auditory attention decoding,缩写为 AAD,后文统一简称 AAD。难点在于脑电信噪比低、个体差异大、真实场景还有注意力切换和对话轮替,实验室里固定听一路的方法搬到可穿戴设备上容易失效。

听觉注意解码 × 刺激重建: 听觉注意解码负责在多说话人混合中判断听者正在注意哪一路声音,刺激重建负责从脑电信号中还原出与该路声音对应的表征再做相关比较,二者搭配的理由是重建给出可比较的连续信号而解码给出判决逻辑,组合意义是把难以直接分类的神经跟踪问题转化为可计算相关差距的选择问题。

论文把研究对象限定为移动脑电上的被试无关 AAD。白话说,被试无关就是训练时没见过测试的人,测试时直接拿新人的脑电做判断,英文为 subject-independent。移动脑电就是用便携放大器在更自然的视听环境下记录,本文用 44 导头皮通道。论文同时覆盖 3 种自然范式:持续注意其中一路、中间切换 2 次注意、以及在双人对话与单人干扰之间保持注意,这让评估不只看干净持续段,还要看切换和对话动力学。

术语速查:初学者先固定哪几个词?

包络指语音幅度随时间慢变化的轮廓,与大脑跟踪语音节奏密切相关,后文简称包络。梅尔谱指按人耳感知尺度划分频带的时频能量表示,能保留谱时间结构,后文简称梅尔谱。Wav2Vec 2.0 指在大规模语音上自监督预训练的深层表征,能编码更高层语音语言结构,后文简称 Wav2Vec 表征。三者拼接后作为音频编码器的输入,目标是同时提供可重建的基准与可对比的细节。

脑电编码器指把多通道脑电映射为嵌入的 2 维卷积网络,音频编码器指把拼接语音特征映射到同一嵌入空间的网络,重建模块指从脑电嵌入还原包络的扩张卷积网络。对比损失指基于 Sigmoid 配对分类的 SigLIP 风格目标,皮尔逊损失指重建与目标包络负相关。留一组交叉验证指每次留一组被试做测试的轮换协议,英文为 leave-one-group-out,缩写为 LOGO,后文统一用 LOGO 指代该协议。

已有路线走了多远:包络重建与深层表征各缺什么?

常见的 AAD 路线是刺激重建,白话说就是先学一个从脑电到语音表征的映射,测试时把重建结果分别与候选说话人的真实语音表征做相关,谁相关高就判注意谁,英文为 stimulus reconstruction,缩写为 SR。传统做法多用语音包络,因为包络是语音慢幅度起伏,与神经跟踪存在时间锁定关系,计算简单且可解释。原文明确指出包络对频谱和语言结构的刻画有限,因此近年工作引入谱图、梅尔谱以及 Wav2Vec 2.0 这类自监督表征来提供更丰富的依据。

另一条演进是判别式框架。白话说,不再只追求把波形重建得多像,而是直接优化脑电与语音谁跟谁配对,英文为 contrastive learning,缩写为 CL。原文以 SigLIP 风格目标为代表,把批量内每个脑电向量与每个音频向量的点积经可学习温度与偏置调整后过 Sigmoid,变成匹配为 1、不匹配为 0 的二分类问题,从而强化目标语音与脑电的关联。本文的定位是把 CL 与 SR 结合:既保留基于相关的判决接口,又用对比目标学习更具泛化性的映射,并在持续注意、切换注意和对话 3 种条件下比较包络、梅尔谱与 Wav2Vec 2.0 的贡献。

相关工作的对照要按同输入同目标来理解。线性包络 SR 多在被试内训练测试,条件是同一人的不同试次,优点是参数少可解释,缺点是换人要重训。非线性 SR 加深层网络能在跨被试上建模更复杂映射,但若只用重建损失仍可能欠判别力。CL 路线同样用脑电语音配对,但监督来源是配对标签而非逐点波形误差,运行阶段仍可回到相关比较做选择。论文的增量正在于在同一移动脑电数据集上,用留组交叉验证同时检验 CL 加多特征是否在短窗和未见被试上都带来可运行的提升。

同条件对照:线性基线与无对比非线性差在哪?

同输入同目标的对照应放在同一数据集与相近窗长下看。线性基线用包络做被试内回归,优点是可解释且数据需求小,缺点是跨人要重训,在原文图示中整体低于两个非线性跨被试配置。无对比非线性同样用 LOGO 训练并做包络重建,但没有对比目标,它的精度介于线性基线与全管线之间,说明深层映射本身已带来泛化收益。

全管线在保持 LOGO 的前提下加入对比目标与三特征,图示中进一步抬高曲线,尤其在短窗保持优势。这组对照的监督来源不同:线性与无对比主要靠波形重建误差,全管线多了一路配对判别监督,运行阶段三者都可回到相关比较做二选一。类别差异不能当同条件胜负,例如不能用被试内线性在单人上的高点去否定跨被试管线的均值,也不能把搜索最优或事后最优当可部署收益,论文保留的都是实际可运行策略的比较。

问题如何形式化:输入输出与判决规则是什么?

形式化时先沿一个样本走完全程。输入是一段多通道脑电,例如 5 秒窗内 44 导以 64 赫兹采样的时间序列,以及两路候选语音各自算出的音频特征。表示阶段是把脑电送入 2 维卷积脑电编码器得到脑电嵌入,把所选语音特征送入音频编码器得到音频嵌入,二者维度对齐为批量、32 通道、时间长度。组件阶段是重建模块从脑电嵌入还原目标语音包络。目标阶段同时计算对比损失与皮尔逊相关损失。输出是注意判决:在测试窗内比较重建或嵌入与两路候选语音的相似度,相似度高者判为被注意。

举一个教学例子帮助理解,但它不是论文数据:假设第 3 秒到第 8 秒左喇叭是女声、右喇叭是男声,指示要求听左侧,模型用该窗脑电得到嵌入后,分别与左右两路音频嵌入算相似度,若左侧分数高于右侧则记 1 次正确。这个例子只说明判决是二选一比较,不附带任何准确率数值。真正的评估是把这种二选一正确率按不同窗长聚合,窗越长证据越多,准确率通常越高,但延迟也越大。

需要提前固定的概念是时间窗。训练统一用 5 秒窗且 50% 重叠,评估则用 2 秒到 30 秒甚至 35 秒的不同窗长来量化分类与重建精度。另一个固定概念是被试无关划分:24 人分成 6 组每组 4 人,每次留一组做测试,其余做训练,验证从训练集中每被试每条件随机留一个试次,这样每个被试恰被测试 1 次且训练验证测试无重叠。

方法全景:三模型管线如何分工协作?

管线由 3 个模型共同贡献训练损失。第一个是 2 维卷积脑电编码器,把多通道脑电映射为脑电嵌入。第二个是音频编码器,把所选语音表示映射为同一空间的音频嵌入。第三个是重建模块,从脑电嵌入重建语音包络。所有卷积都做填充以保持时间长度,卷积块由卷积层、归一化、GELU 激活与丢弃组成,其中 2 维用实例归一化、1 维用组归一化,最右侧重建模型的 3 段 1 维卷积分别用扩张率为 1、2、4 来扩大感受野。

对比学习 × 刺激重建: 对比学习负责把匹配的脑电与语音嵌入拉近、把不匹配的推远以学习判别结构,刺激重建负责从脑电嵌入还原目标语音包络并保留相关判决接口,二者搭配的理由是判别目标增强跨被试泛化而重建目标保留可解释的时域对齐,组合意义是在同一训练中同时优化嵌入可分性与重建相关性。

训练时批量内每个脑电向量与每个音频向量都被视为独立实例。对角线是匹配对,目标为 1,非对角线是名义上的不匹配对,目标为 0。但数据集中相同音频会出现在不同被试或试次中,若直接按标准 SigLIP 惩罚所有非对角高相似,就会把真重复 penalize 掉。为此论文引入掩码权重矩阵,对音频完全相同但下标不同的非对角对把权重设为 0,使其不贡献梯度,只聚焦真正的负对比。同时计算重建包络与原始目标包络的皮尔逊相关并取负作为重建损失,总损失为对比损失加相关损失。

推理时不重新训练。给定一段未见被试的脑电与两路候选语音,模型算出匹配相似度或重建相关,比较哪一路更高即判为注意目标。验证阶段保存验证损失与准确率同时改善的检查点,准确率按二值比较计算:匹配目标音频的相似度超过不匹配干扰音频即算正确。这种设计保留了传统 SR 基于相关的判决习惯,又让嵌入空间在训练中见过判别压力。

组件与计算:编码器输入什么、输出什么形状?

脑电编码器的输入是预处理后的头皮脑电。原始用 64 导设备经改装得到 44 导头皮加 20 导耳周阵列,本文只分析 44 导头皮信号。音频侧先提取 3 种特征:包络取希尔伯特变换幅值并降采样到 64 赫兹以对齐脑电,32 频带梅尔谱用短时傅里叶变换参数 512 点窗长、250 点跳长得到同样 64 赫兹帧率,Wav2Vec 特征用预训练 base-960h 模型提取后上采样到 64 赫兹再经主成分分析降到 64 通道,最后三者沿通道维拼接。白话说,包络是慢起伏曲线,英文为 envelope,梅尔谱是按人耳尺度划分的时频能量,英文为 mel-spectrogram,Wav2Vec 2.0 是自监督语音表征,后文分别简称包络、梅尔谱与 Wav2Vec 表征。

包络 × Wav2Vec 2.0 表征: 包络负责刻画语音慢幅度起伏并与神经响应保持时间锁定,Wav2Vec 2.0 表征负责提供经自监督训练得到的高维谱语言结构信息,二者搭配的理由是包络稳定但信息稀疏而深层表征丰富但维度高,组合意义是让音频编码器同时看到可重建的时域基准与可对比的判别细节。

嵌入形状是理解对齐的关键。记批量为 N、时间为 T,脑电嵌入与音频嵌入都是 N 乘 32 乘 T,32 是嵌入通道数,T 因填充而与输入窗长一致。对比计算时取向量点积再经可学习温度缩放与偏置平移,过 Sigmoid 得到 0 到 1 的匹配概率。掩码矩阵同样是 N 乘 N,只有音频完全相同且下标不同的非对角位置为 0,其余为 1。重建分支输出与包络同采样率的波形,再与目标包络算皮尔逊相关系数 r,损失取负相关以最大化正相关。

梅尔谱 × 对比损失掩码: 梅尔谱负责提供 32 频带的谱时间能量分布以补充包络之外的频谱结构,对比损失掩码负责把音频完全相同的非对角样本对权重设为 0 以免误罚,二者搭配的理由是重复刺激会在批量对比中制造假负例,组合意义是让模型在利用更丰富音频特征的同时不被数据集重复刺激误导。

原文未报告编码器具体层数与每层核大小之外的全部超参数,也未说明拼接后音频编码器如何处理不同特征量纲的归一化细节,这些属于具体缺项,复现时只能按图示卷积块结构与已给采样率重做,不从模型名称推定归一化或初始化实现。梯度路径按文字可确认对比损失同时更新脑电与音频编码器,重建损失主要经重建模块回传到脑电编码器,但原文未给出是否对 Wav2Vec 主干微调的说明,实际是先离线提取再降维,因此可认为预训练语音主干冻结,只训练编码器与重建模块。

训练如何组织:数据划分、批量构造与优化何时停?

训练数据组织严格围绕被试无关。将 24 人分成 6 组每组 4 人做留一组交叉验证,每折用 5 组训练、剩余 1 组测试,从训练集中每被试每条件随机留一个试次做验证,保证训练验证测试无重叠且每人恰被测试 1 次。训练窗固定 5 秒且 50% 重叠,批量大小为 64,优化器为 Adamax,学习率为 0.0003,共训练 50 轮。检查点在验证损失与准确率改善时保存,准确率即匹配相似度超过干扰相似度的比例。

被试无关 × 留一组被试交叉验证: 被试无关负责要求模型在训练未见过的被试上直接解码,留一组被试交叉验证负责把 24 人分成 6 组每次留一组做独立测试并轮换,二者搭配的理由是只有严格隔离训练验证测试被试才能检验泛化,组合意义是每次测试都对应真正的新用户条件而非同一人不同试次的复用。

批量构造是对比学习的关键。每个批量内 N 个脑电与 N 个音频两两配对,共 N 乘 N 个判定。对角为正例,非对角原则上为负例,但若两处音频波形完全相同则把该非对角权重设 0,不让它产生梯度。这种掩码只处理完全相同的重复刺激,不处理内容相近但波形不同的情况,原文未报告重复比例与掩码触发频率,这是复现时需要自行统计的缺项。优化目标是总损失最小化,即 Sigmoid 对比损失加负皮尔逊相关,验证时同时看损失下降与二选一准确率上升,避免只重建得像但选不对。

该节对应无训练模型的说明是:Wav2Vec 主干与主成分降维不参与本研究训练,前者是离线调用预训练模型提取,后者是线性降维到 64 通道,真正的梯度训练只发生在脑电编码器、音频编码器与重建模块。原文未报告学习率衰减、权重衰减、丢弃率具体值与早停耐心,也不报告单折训练时长与显存占用,因此训练成本部分只能按已给批量与轮数复述,不能推定硬件预算。

实验条件:被试、刺激、记录与预处理如何对齐?

先讲被试与刺激。数据集包含 24 名母语为丹麦语、听力正常的参与者,年龄 23 到 51 岁,平均 35.7 岁,标准差 8.9 岁,其中男性 12 名,所有刺激均为丹麦语。记录时参与者居中而坐,扬声器位于正负 30 度与正负 90 度方位,屏幕在 0 度给指示,声音以 67 分贝声压级呈现,原始音频采样 44.1 千赫兹。3 种条件各录 180 秒试次:持续注意做 8 试次,只听固定一路;切换注意做 8 试次,在 35 到 55 秒与 125 到 145 秒随机区间切换 2 次;对话注意做 9 试次,在双人对话段与单人段之间交替但注意保持在指定源,每条件另有 1 个练习试次。

再讲记录与预处理。脑电用 64 导便携放大器加改装帽,其中 20 个帽电极被两个 10 通道耳周阵列替代,得到 44 导头皮加 20 导耳周,采样 500 赫兹,参考为 FCz,阻抗保持在 20 千欧以下,本文只用 44 导头皮。预处理先转共同平均参考,用 50 赫兹陷波去工频,再做 0.1 到 40 赫兹带通去慢漂与高频伪迹,用扩展信息最大化独立成分分析做伪迹分量人工剔除,再带通到 1 到 30 赫兹并降采样到 64 赫兹以对齐音频特征。音频侧包络、梅尔谱、Wav2Vec 特征最终都对齐到 64 赫兹,梅尔谱 32 频带,Wav2Vec 降到 64 通道后三者拼接。

为把上述条件 1 次性核对,整理成下表。表中数字全部来自原文连续句子,不做四舍五入,不补单位,裸值保留原样,单位只出现在原句自带的位置。

条件分组对象与指标原文报告值 1原文报告值 2备注
被试24 名丹麦母语者,12 名男性2412年龄 23-51 岁
记录头皮导联与耳周导联4420放大器 64 导改装
呈现声压级与音频采样67 dB SPL44.1 kHz居中听音
范式试次长度与各条件试次数180 s8 / 8 / 9持续/切换/对话

表后需要说明该表的用途与边界。该表只解决可复现的采集配置,不代替解码精度。它的价值是让复现者先对齐通道数、采样率、声压与试次结构,再谈模型,否则同样的网络在不同对齐下无法比较。代价是它不包含阻抗、参考、滤波器阶数与独立成分剔除标准等细节,未胜出项是耳周 20 导在本文未被分析,因此不能把本表结论推广到耳周或入耳设备。未评测边界包括不同语言刺激与听力损失人群,原文被试均为听力正常丹麦语者。

主结果:长窗与短窗各能到多少?与谁比才公平?

要回答的核心问题是跨被试条件下不同评估窗长的二选一准确率,以及对比学习加多特征是否超过不加对比的非线性重建与被试内线性基线。比较的公平条件是后两者在原文中分别对应留组训练的非线性包络重建与同一数据集的被试内线性包络重建,评估窗长取与前人相同的 2 到 35 秒范围,指标方向都是准确率越高越好,重建侧看目标包络相关是否显著高于干扰。

评估窗长评估对象指标方向本方法准确率对比对象
2–30 s跨被试 3 条件平均越高越好61.4%短窗下限
2–30 s跨被试 3 条件平均越高越好79.1%长窗上限
30 s跨被试平均约值越高越好80%30 秒均值附近

表后解释主要收益与具体代价。报告显示评估窗从 2 秒拉到 30 秒,分类准确率从 61.4% 到 79.1%,30 秒均值约 80%,这支持长窗累积证据带来更稳判决的判断。原文图示比较显示非线性模型已超过被试内线性基线,而加入对比目标后进一步超过不加对比的非线性版本,即使在较短窗也保持优势,这支持对比目标加音频特征带来更泛化映射的解释。代价是短窗绝对值仍只略高于随机猜测之上,30 秒延迟对实时助听 steering 并不实用,且均值趋势不等于每组每条件都成立,分组表显示第 5 组在 30 秒仅 74.6% 而第 3 组达 84.5%,个体与组间差异依然明显。

分条件看,对话条件准确率最高,其次为持续注意,切换注意最低。对话最高看似反直觉,但原文解释为模型在复杂对话动力学中仍能抓住注意线索,重建侧目标包络相关显著高于干扰,配对检验显著,且对比模型在各条件下都拉大了目标与干扰的差距。需要区分的是包络相关高不直接等于分类准,持续注意的目标相关最高而对话最低,但对话的分类准确率反而更高,这说明判别间隙比绝对相关更关键,相关性也不是因果证据。

消融:拿掉梅尔谱或 Wav2Vec 会掉多少?

消融要回答每个音频特征对对比目标的贡献。做法是固定管线与留组协议,每次从音频表示中移除一种特征后重新训练与评估,评估窗取 5 秒,指标包括二选一准确率、目标包络皮尔逊 r 与干扰 r。公平条件是训练窗、优化器、划分都与全特征一致,只有音频输入维度变化,指标方向是准确率高好、目标 r 高好、干扰 r 低好。

音频特征组合评估窗与协议5 秒准确率目标 Pearson r干扰 Pearson r
Wav2Vec + Mel-spec. + Envelope5 s,LOGO67.00.0710.008
Wav2Vec + Envelope5 s,LOGO65.70.0710.008
Mel-spec. + Envelope5 s,LOGO64.30.0690.012
Envelope only5 s,LOGO62.10.0680.012

表后解释收益、代价与未胜出项。全特征时 5 秒准确率 67.0% 为最高,移除梅尔谱降到 65.7%,移除 Wav2Vec 降到 64.3%,只用包络时 62.1% 最低,这支持高层语言信息提供更多判别性神经特征的有限解释。但目标与干扰的皮尔逊 r 几乎不变,目标 r 在 0.068 到 0.071 之间,干扰 r 在 0.008 到 0.012 之间,说明准确率提升主要来自嵌入可分性而非重建波形更像。未胜出项是只用包络的对比管线与无对比的重建管线差距需要结合原文末行理解:原文强调同时用对比与三特征时准确率最大,但相关变化很小。未评测边界是未单独测试只用 Wav2Vec 或只用梅尔谱,也未报告不同窗长下的消融曲线,不能把 5 秒结论推广到 2 秒或 30 秒。

限制在哪里:哪些结论不能从现有证据推出?

首先是精度与延迟的权衡。论文直接报告的是 2 秒 61.4% 到 30 秒 79.1%,这属于中等偏上的跨被试水平,但 2 秒仍接近可用下限,30 秒才接近 80%,对于需要快速跟随注意切换的助听应用,现有证据不支持低延迟高可靠同时成立。切换条件本身精度低于持续与对话,也说明 2 次随机切换点附近的跟踪仍是难点,原文未给出切换点前后细粒度时间曲线,不能判断延迟几秒能跟上。

其次是泛化边界。留组验证只覆盖 24 名听力正常丹麦语成人的室内扬声器场景,扬声器角度、声压、语言、听力状态都固定。未测量误判率在不同性别年龄组是否均衡,未报告耳周通道、真实噪声街景、多轮对话轮替下的表现,因此不能把结论推广到听损人群、其他语言或可穿戴耳机形态。训练验证测试划分虽严格,但验证每被试每条件只留一试次,验证方差可能不小,原文未给置信区间与多次随机种子的波动。

最后是成本与实现缺项。原文未报告参数量、浮点运算量、训练时长、推理帧率与内存占用,无法判断 3 模型管线在移动端的实际开销。未给出丢弃率、归一化细节、学习率调度与早停耐心,也未说明掩码触发比例与音频拼接后的归一化方式,这些都属于复现时必须补记的缺项。缺失证据不是技术错误,但在补齐前只能用可能或待验证来表述因果,例如只能说对比目标可能通过拉大目标干扰间隙帮助对话条件,不能说它必然在所有新场景降低误判。

复现先做什么:按什么顺序重建管线?

第一步重建数据与对齐。按实验条件节复刻 44 导头皮选择、64 赫兹对齐、1 到 30 赫兹带通、包络希尔伯特幅值、梅尔谱 512 点窗长 250 点跳长 32 频带、Wav2Vec base-960h 离线提取加主成分降到 64 通道再拼接。先检查拼接后时间长度与脑电窗长一致,再检查 5 秒窗 50% 重叠的切片数与试次 180 秒的对应关系,避免差 1 帧导致对比配对错位。

第二步重建划分与批量。实现 24 人分 6 组每组 4 人的留组循环,每折训练用 5 组、测试用剩余 1 组,验证从训练集每被试每条件随机留一试次。批量取 64,构造 N 乘 N 相似度矩阵并实现掩码:仅当音频完全相同且下标不同时权重为 0,其余为 1。损失实现为 Sigmoid 对比损失加负皮尔逊相关,优化器用 Adamax 学习率 0.0003 训练 50 轮,保存验证损失与准确率同时改善的检查点。

第三步重建评估。训练窗固定 5 秒,评估时用滑动或拼接方式得到 2 秒到 30 秒窗的判决,指标为匹配相似度超过干扰的比例,重建侧同时记录目标与干扰 r 及配对检验。先复现 61.4% 到 79.1% 的主曲线与 30 秒约 80% 的均值,再复现 5 秒消融的 67.0%、65.7%、64.3%、62.1% 四点。若资源状态允许再核对代码与数据,但本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码模型或数据已公开,只能按论文文字重做。

何时值得尝试这种做法?

当任务是跨被试、多条件、需要保留相关判决接口的 AAD 时,这种对比加重的建管线值得尝试。它的适用条件很具体:有多路候选语音可算包络、梅尔谱与深层表征,评估允许秒级窗长累积证据,且训练批量能构造足够多的真负例并用掩码排除重复刺激。此时全特征加对比在原文 5 秒点上比只用包络高约 5 个百分点,比单缺一项高 1 到 3 个百分点,这种差距在需要稳定性的离线分析中有实际意义。

当任务要求极短延迟、单通道耳机端实时运行或面向听损与多语言人群时,不建议直接照搬。2 秒 61.4% 的起点意味着短窗误判仍频繁,切换条件的相对弱势也提示跟随突变需要额外机制,而 3 模型与三特征拼接的开销在原文未被量化,端侧部署前必须补测推理延迟、功耗与内存。复现后还需补的验证包括多次随机种子下的组间方差、切换点附近的时间分辨曲线、以及只用轻量特征时的精度保持度,只有这些补齐后才能判断它是实验室最优还是可部署收益。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 8 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eusipco-2026 论文汇总