同一骨干跑通检测与分类:MEGConformer 靠归一化弥合保留集偏移
该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。
该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对五类想象词跨被试解码零样本跌至机会水平的问题,论文用共享三维卷积前端加留一被试预训练再做小样本校准,最强证据是 64 通道三维卷积加仅调分类头在每类 60 样本约 25 分钟校准下达到 53.71%,代价是源域训练准确率高达 92.3% 且被试间方差大。
针对功能磁共振时间分辨率不足以区分言语与语言加工阶段的问题,该工作用词 onset 对齐的皮层脑电高频信号做时空预测微调,在三个语音模型上提升脑对齐且保持下游任务,同时以时间平均与打乱对照证明毫秒结构带来额外增益,但数据仅为 9 人单播客因而覆盖与多样性受限。
针对颅内语音神经假体跨会话漂移,ALIGN 用多源对抗会话不变学习加中间层对齐与时间拉伸增强,在 T12 与 T15 上相对基线降低音素错误率与词错误率,但远期大间隔与伪标签自训练仍是主要边界。
该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对脑电与语音采样率不对齐且单路编码只看目标相关特征的问题,TIDENet 用可训练转置卷积做脑电重采样、用结构共享双路编码分别建模相关与无关特征,在 Cocktail Party 和 AVED 上取得最高的 SDR、SI-SDR、STOI、ESTOI 和 PESQ,但单加语音双路时增益有限且 ESTOI 最优变体不是全量模型。
共收录 1 篇 uai-2026 会议论文的 Reader 深度解读
针对尝试发声下无对齐声学目标且数据只有约 5 小时伪语音的问题,Brain2Speech-Net 用可微音素瓶颈加深度隐马尔可夫模型对齐到预训练语音合成隐空间做单遍合成,闭集语音词错率做到 0.068 并以约 0.5 实时因子运行,代价是开集词错率升至 0.472 且仍依赖合成伪语音目标。