论文解读

从干净音素到真实唇读错误:用三阶段课程让重建模型适应噪声

针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。

 · 更新于 2026-09-24 · 约 19 分钟 · 9118 字 阅读 →
论文解读

封闭句库里练多人模型,再用三分钟校准新用户:表面肌电语音解码的个性化路径

针对 27 人、每人不足半小时数据的封闭 50 句表面肌电解码任务,论文用已发布单被试检查点初始化、多被试预训练再加目标被试微调达到 21.7% 字符错误率和 31.9% 词错误率,而 3 分钟校准与约 13 分钟全量校准无显著差异,但评估句一旦从所有训练数据中移除则退化到 78.6% 字符错误率。

 · 更新于 2026-09-24 · 约 23 分钟 · 11142 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

看不见声带时还能猜出音高吗:从舌唇运动预测基频的上下文与重音检验

该研究用卷积模型从舌超声和唇视频预测标准化基频曲线,在 TaL1 上 L+T 中位 Spearman 相关达 0,72、在 TaL80 上达 0,66,而词重音越高预测越准、单纯扩大 articulatory 上下文增益有限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8690 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只用 64 个像素点的振动,能恢复出可懂的语音吗

针对事件相机记录的语音致振恢复语音的问题,论文提出两阶段振动到语音模型 EV2A,用 8 个 8×8 感兴趣区域做视觉前端加语音增强端到端训练,在真实薯片袋振动数据上相对事件版视觉麦克风降低词错误率 0.48 但仍保留金属感与表示损失等代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9755 字 阅读 →
论文解读

看不准也要说准:用不确定性估计误差并挑出难样本做说话人自适应

针对唇读受视觉歧义和说话人差异影响且输出可靠性难判断的问题,论文引入贝叶斯不确定性和熵不确定性及其组合来估计词错误率并做主动学习选难样本微调,在 VoxLRS-SA 及合成池上显示不确定性与词错误率强相关且高不确定性微调在同等标注量下达到或超过随机采样,但估计需少量有标数据拟合映射且小数据微调本身不稳定。

 · 更新于 2026-09-24 · 约 17 分钟 · 8421 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

难发的音就多练:按音素误差自适应加权的静音语音重建

针对连续西班牙语静音发音重建中说话人发音差异大且数据少的问题,论文提出每轮按音素平均误差自适应调整帧级损失权重的方法,在肌电和唇读两种模态上以字符错误率为主要证据显示多数说话人可懂度提升,但增益随预训练增强而减小且呈说话人依赖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8121 字 阅读 →
论文解读

肌电功率为何能对齐自监督语音表示:emg2speech 的无对齐合成路径

该文研究无帧级肌电-音频对齐时如何从口面肌电合成语音,选择把肌电协方差功率映射到冻结 HuBERT 离散单元再用现成声码器发声,最强证据是 H 线性预测肌电功率达 r=0.85 且 vec(E) 加音素引导解码显著降低单元错误率,代价是词错误率仍在 50% 以上且仅单例 ALS 验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9671 字 阅读 →
论文解读

无声时肌肉还在说话:用通道协方差把肌电直接译成音素

该文只用静默构音肌电与文本转写、用对称正定矩阵表示通道间相关再接门控循环网络与联结时序分类损失做音素级序列转换,在大词表单被试上报告音素错误率 48.47% 与词错误率 73.53%,代价是仍需双向整句解码且主要证据来自单名健康被试。

 · 更新于 2026-09-24 · 约 19 分钟 · 9104 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

把互联网视频先验搬进声道核磁:Arti-JEPA 何时帮得上音素,何时帮不上

论文把 V-JEPA 2 延续到约 62 小时无标注声道实时核磁上,用冻结编码器加轻探针测跨域音素、口吃二分类与舌切除前后迁移,最强证据是跨域音素 κ 升至 0.352 而口吃仅小幅提升,代价是单卡小批量、短窗与三例临床样本的局限。

 · 更新于 2026-09-24 · 约 22 分钟 · 10941 字 阅读 →
论文解读

少通道也要分清四声:CAT-Net 用双向交叉注意力融合脑电与肌电

针对普通话四声在脑电中细微难分且跨人易失效的问题,CAT-Net 用脑电与肌电双分支时空编码加双向交叉注意力融合与域对抗训练,在 20 个脑电通道加 5 个肌电通道上报告了默读 88.08% 与出声 87.83% 的五折精度以及留一被试 85.10% 与 83.27% 的跨被试精度,但消融显示去掉融合与单模态后精度大幅下降且重度异常被试仍明显偏低。

 · 更新于 2026-09-24 · 约 20 分钟 · 9706 字 阅读 →