从干净音素到真实唇读错误:用三阶段课程让重建模型适应噪声
针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。
针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。
针对 27 人、每人不足半小时数据的封闭 50 句表面肌电解码任务,论文用已发布单被试检查点初始化、多被试预训练再加目标被试微调达到 21.7% 字符错误率和 31.9% 词错误率,而 3 分钟校准与约 13 分钟全量校准无显著差异,但评估句一旦从所有训练数据中移除则退化到 78.6% 字符错误率。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该研究用卷积模型从舌超声和唇视频预测标准化基频曲线,在 TaL1 上 L+T 中位 Spearman 相关达 0,72、在 TaL80 上达 0,66,而词重音越高预测越准、单纯扩大 articulatory 上下文增益有限。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对事件相机记录的语音致振恢复语音的问题,论文提出两阶段振动到语音模型 EV2A,用 8 个 8×8 感兴趣区域做视觉前端加语音增强端到端训练,在真实薯片袋振动数据上相对事件版视觉麦克风降低词错误率 0.48 但仍保留金属感与表示损失等代价。
针对唇读受视觉歧义和说话人差异影响且输出可靠性难判断的问题,论文引入贝叶斯不确定性和熵不确定性及其组合来估计词错误率并做主动学习选难样本微调,在 VoxLRS-SA 及合成池上显示不确定性与词错误率强相关且高不确定性微调在同等标注量下达到或超过随机采样,但估计需少量有标数据拟合映射且小数据微调本身不稳定。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对连续西班牙语静音发音重建中说话人发音差异大且数据少的问题,论文提出每轮按音素平均误差自适应调整帧级损失权重的方法,在肌电和唇读两种模态上以字符错误率为主要证据显示多数说话人可懂度提升,但增益随预训练增强而减小且呈说话人依赖。
该文研究无帧级肌电-音频对齐时如何从口面肌电合成语音,选择把肌电协方差功率映射到冻结 HuBERT 离散单元再用现成声码器发声,最强证据是 H 线性预测肌电功率达 r=0.85 且 vec(E) 加音素引导解码显著降低单元错误率,代价是词错误率仍在 50% 以上且仅单例 ALS 验证。
该文只用静默构音肌电与文本转写、用对称正定矩阵表示通道间相关再接门控循环网络与联结时序分类损失做音素级序列转换,在大词表单被试上报告音素错误率 48.47% 与词错误率 73.53%,代价是仍需双向整句解码且主要证据来自单名健康被试。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
论文把 V-JEPA 2 延续到约 62 小时无标注声道实时核磁上,用冻结编码器加轻探针测跨域音素、口吃二分类与舌切除前后迁移,最强证据是跨域音素 κ 升至 0.352 而口吃仅小幅提升,代价是单卡小批量、短窗与三例临床样本的局限。
针对普通话四声在脑电中细微难分且跨人易失效的问题,CAT-Net 用脑电与肌电双分支时空编码加双向交叉注意力融合与域对抗训练,在 20 个脑电通道加 5 个肌电通道上报告了默读 88.08% 与出声 87.83% 的五折精度以及留一被试 85.10% 与 83.27% 的跨被试精度,但消融显示去掉融合与单模态后精度大幅下降且重度异常被试仍明显偏低。