论文解读

短窗相关性太 noisy:用多尺度高斯混合稳住 HMM 发射分布

针对双人竞争听觉注意解码中短窗 Fisher-z 相关方差大、单尺度无监督 GMM 难分 attended 与 unattended 分量的问题,论文提出跨 8 种窗长共享均值、方差按 1/(N_L-1) 缩放的多尺度 GMM 联合估计 HMM 发射参数,在 72 分钟全量下 1 秒窗提升 1.82 个百分点、在 6 分钟数据下提升 8.32 个百分点,但数 …

 · 更新于 2026-09-24 · 约 21 分钟 · 10460 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把解码和平滑写进同一个概率模型:MSM 如何做到逐采样点的听觉注意解码

针对双说话人竞争下脑电信噪比低而窗级解码在分辨率与精度间折中问题,论文用马尔可夫切换模型把包络回归与注意状态转移联合建模并用 EM 逐采样点估计,在 KULeuven 数据上取得与 HMM 后处理相当的中位精度而中位切换检测延迟显著更短,代价是对初始化敏感且仍依赖线性回归假设。

 · 更新于 2026-09-24 · 约 17 分钟 · 8417 字 阅读 →
论文解读

移动脑电跨被试解码注意说话人:对比学习为何比只重建包络更稳

该研究用三模型对比学习加包络重建做跨被试听觉注意解码,在 24 人移动脑电三种自然范式上 2 秒窗 61.4% 到 30 秒窗 79.1%,代价是依赖 5 秒训练窗与多特征音频编码且短窗绝对精度仍有限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9769 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

不要语言模型改错,还能从皮层电流读出句子吗

该研究用会话对齐加 Conformer 加 CTC 直接从皮层神经活动解码字符序列,在验证集上报告字符错误率为 23.80%,代价是跨会话信号漂移仍大且词边界错误集中。

 · 更新于 2026-09-24 · 约 21 分钟 · 10166 字 阅读 →
论文解读

同一骨干跑通检测与分类:MEGConformer 靠归一化弥合保留集偏移

该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

零样本失灵时再校准:想象言语跨被试解码的快速适应路径

针对五类想象词跨被试解码零样本跌至机会水平的问题,论文用共享三维卷积前端加留一被试预训练再做小样本校准,最强证据是 64 通道三维卷积加仅调分类头在每类 60 样本约 25 分钟校准下达到 53.71%,代价是源域训练准确率高达 92.3% 且被试间方差大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

毫秒级颅内信号能否把语音模型调向大脑的时间分层

针对功能磁共振时间分辨率不足以区分言语与语言加工阶段的问题,该工作用词 onset 对齐的皮层脑电高频信号做时空预测微调,在三个语音模型上提升脑对齐且保持下游任务,同时以时间平均与打乱对照证明毫秒结构带来额外增益,但数据仅为 9 人单播客因而覆盖与多样性受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8700 字 阅读 →
论文解读

跨天解码为何会塌:ALIGN 用对抗对齐剥离会话线索

针对颅内语音神经假体跨会话漂移,ALIGN 用多源对抗会话不变学习加中间层对齐与时间拉伸增强,在 T12 与 T15 上相对基线降低音素错误率与词错误率,但远期大间隔与伪标签自训练仍是主要边界。

 · 更新于 2026-09-24 · 约 23 分钟 · 11050 字 阅读 →
论文解读

少通道也要分清四声:CAT-Net 用双向交叉注意力融合脑电与肌电

针对普通话四声在脑电中细微难分且跨人易失效的问题,CAT-Net 用脑电与肌电双分支时空编码加双向交叉注意力融合与域对抗训练,在 20 个脑电通道加 5 个肌电通道上报告了默读 88.08% 与出声 87.83% 的五折精度以及留一被试 85.10% 与 83.27% 的跨被试精度,但消融显示去掉融合与单模态后精度大幅下降且重度异常被试仍明显偏低。

 · 更新于 2026-09-24 · 约 20 分钟 · 9706 字 阅读 →
每日研究速递

uai-2026 论文深度解读

共收录 1 篇 uai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 3 分钟 · 1181 字 阅读 →
论文解读

不用先转文字:音素瓶颈加单调对齐如何把尝试发声的脑信号直接变成可懂语音

针对尝试发声下无对齐声学目标且数据只有约 5 小时伪语音的问题,Brain2Speech-Net 用可微音素瓶颈加深度隐马尔可夫模型对齐到预训练语音合成隐空间做单遍合成,闭集语音词错率做到 0.068 并以约 0.5 实时因子运行,代价是开集词错率升至 0.472 且仍依赖合成伪语音目标。

 · 更新于 2026-09-24 · 约 18 分钟 · 8960 字 阅读 →