论文解读

同一骨干跑通检测与分类:MEGConformer 靠归一化弥合保留集偏移

该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

零样本失灵时再校准:想象言语跨被试解码的快速适应路径

针对五类想象词跨被试解码零样本跌至机会水平的问题,论文用共享三维卷积前端加留一被试预训练再做小样本校准,最强证据是 64 通道三维卷积加仅调分类头在每类 60 样本约 25 分钟校准下达到 53.71%,代价是源域训练准确率高达 92.3% 且被试间方差大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

毫秒级颅内信号能否把语音模型调向大脑的时间分层

针对功能磁共振时间分辨率不足以区分言语与语言加工阶段的问题,该工作用词 onset 对齐的皮层脑电高频信号做时空预测微调,在三个语音模型上提升脑对齐且保持下游任务,同时以时间平均与打乱对照证明毫秒结构带来额外增益,但数据仅为 9 人单播客因而覆盖与多样性受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8700 字 阅读 →
论文解读

跨天解码为何会塌:ALIGN 用对抗对齐剥离会话线索

针对颅内语音神经假体跨会话漂移,ALIGN 用多源对抗会话不变学习加中间层对齐与时间拉伸增强,在 T12 与 T15 上相对基线降低音素错误率与词错误率,但远期大间隔与伪标签自训练仍是主要边界。

 · 更新于 2026-09-24 · 约 23 分钟 · 11050 字 阅读 →
论文解读

把混叠的音频表示拆开:AudioSAE 用稀疏自编码器解剖 Whisper 与 HuBERT

该文在 Whisper 与 HuBERT 每层编码器激活上训练 BatchTopK 稀疏自编码器,用跨种子稳定性、分类探测与消融、转向和脑电相关验证特征,最强证据是转向使虚假语音检出平均下降 70% 而词错误率仅从 5.1% 升至 5.5%,代价是彻底擦除语音概念需移除 19-27% 特征且强转向会破坏识别。

 · 更新于 2026-09-24 · 约 21 分钟 · 10239 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

用可训练插值对齐脑电、以双路编码放大目标差异的目标说话人提取

针对脑电与语音采样率不对齐且单路编码只看目标相关特征的问题,TIDENet 用可训练转置卷积做脑电重采样、用结构共享双路编码分别建模相关与无关特征,在 Cocktail Party 和 AVED 上取得最高的 SDR、SI-SDR、STOI、ESTOI 和 PESQ,但单加语音双路时增益有限且 ESTOI 最优变体不是全量模型。

 · 更新于 2026-09-24 · 约 21 分钟 · 10280 字 阅读 →
每日研究速递

uai-2026 论文深度解读

共收录 1 篇 uai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 3 分钟 · 1181 字 阅读 →
论文解读

不用先转文字:音素瓶颈加单调对齐如何把尝试发声的脑信号直接变成可懂语音

针对尝试发声下无对齐声学目标且数据只有约 5 小时伪语音的问题,Brain2Speech-Net 用可微音素瓶颈加深度隐马尔可夫模型对齐到预训练语音合成隐空间做单遍合成,闭集语音词错率做到 0.068 并以约 0.5 实时因子运行,代价是开集词错率升至 0.472 且仍依赖合成伪语音目标。

 · 更新于 2026-09-24 · 约 18 分钟 · 8960 字 阅读 →