论文解读
严重程度拉开差距时仍要可用:用严重程度混合微调 Whisper-small 并在 Jetson 上实测
针对唇腭裂语音随严重程度差异大的识别难题,论文用不同严重程度组合微调 Whisper-small 并在 Jetson 上实测,NOMIMOSE 把合并词错误率从 62.46% 降到 22.72%,NOMIMO 把合并音素错误率降到 18.44%,CLP-only 拿到最接近零的公平性得分 -22.85,而微调模型保持 0.167-0.171 实时系数和约 …
针对唇腭裂语音随严重程度差异大的识别难题,论文用不同严重程度组合微调 Whisper-small 并在 Jetson 上实测,NOMIMOSE 把合并词错误率从 62.46% 降到 22.72%,NOMIMO 把合并音素错误率降到 18.44%,CLP-only 拿到最接近零的公平性得分 -22.85,而微调模型保持 0.167-0.171 实时系数和约 …
该挑战用同一批十六类方言音频同时考辨别与转写,统一基线仅 53.62% 辨别准确率与 18.10% 转写错误率,最强受限系统做到 83.19% 与 11.08%,而困难方言与混淆方向显示两任务相关但不可互相替代。
论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。
共分析 30 篇语音/AI 论文
语音识别 | 7.4/10
语音识别 | 5.9/10
语音识别 | 6.1/10
共分析 18 篇语音/AI 论文
语音识别 | 8.4/10
共分析 49 篇语音/AI 论文
语音识别 | 9.1/10
共分析 22 篇语音/AI 论文
语音识别 | 8.1/10
音频检索 | 7.3/10
多模态模型 | 5.1/10
语音识别 | 6.2/10
语音识别 | 5.9/10
语音合成 | 7.9/10
共分析 29 篇语音/AI 论文
语音识别 | 4.7/10