把互联网视频先验搬进声道核磁:Arti-JEPA 何时帮得上音素,何时帮不上
论文把 V-JEPA 2 延续到约 62 小时无标注声道实时核磁上,用冻结编码器加轻探针测跨域音素、口吃二分类与舌切除前后迁移,最强证据是跨域音素 κ 升至 0.352 而口吃仅小幅提升,代价是单卡小批量、短窗与三例临床样本的局限。
论文把 V-JEPA 2 延续到约 62 小时无标注声道实时核磁上,用冻结编码器加轻探针测跨域音素、口吃二分类与舌切除前后迁移,最强证据是跨域音素 κ 升至 0.352 而口吃仅小幅提升,代价是单卡小批量、短窗与三例临床样本的局限。
针对普通话四声在脑电中细微难分且跨人易失效的问题,CAT-Net 用脑电与肌电双分支时空编码加双向交叉注意力融合与域对抗训练,在 20 个脑电通道加 5 个肌电通道上报告了默读 88.08% 与出声 87.83% 的五折精度以及留一被试 85.10% 与 83.27% 的跨被试精度,但消融显示去掉融合与单模态后精度大幅下降且重度异常被试仍明显偏低。
针对目标语言只有健康人语音时分类器把目标语言当成健康信号的问题,论文用健康人拟合的岭回归残差去除语言可预测成分,在 5 个骨干、3 个任务、3 个目标语言上把平均 F1 从 0.52 提升到 0.87,但语言信息并未完全消除且评估仍限于印欧语系。
共收录 1 篇 uai-2026 会议论文的 Reader 深度解读
在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。
针对唇腭裂语音随严重程度差异大的识别难题,论文用不同严重程度组合微调 Whisper-small 并在 Jetson 上实测,NOMIMOSE 把合并词错误率从 62.46% 降到 22.72%,NOMIMO 把合并音素错误率降到 18.44%,CLP-only 拿到最接近零的公平性得分 -22.85,而微调模型保持 0.167-0.171 实时系数和约 …
音频分类 | 6.7/10
语音编码 | 5.5/10
语音识别 | 7.9/10
音频分类 | 8.8/10
语音识别 | 7.2/10
音频事件检测 | 6.7/10
语音识别 | 6.4/10
语音识别 | 7.0/10
音乐理解 | 7.3/10
语音情感识别 | 5.7/10
领域适应 | 7.6/10
语音伪造检测 | 7.7/10
说话人日志 | 8.2/10
领域适应 | 4.2/10