论文解读
把听力筛查藏进播客静音里:间歇采集能省多少点击又保住多少精度
该研究把短暂宽带点击嵌入播客自然静音进行间歇采集与加权平均,在 1.5×播放约每分钟 102 次点击下取得平均约 5 dB 误差并把舒适度从 1.0×的低位提升到高位,代价是点击过少时误差底抬高。
该研究把短暂宽带点击嵌入播客自然静音进行间歇采集与加权平均,在 1.5×播放约每分钟 102 次点击下取得平均约 5 dB 误差并把舒适度从 1.0×的低位提升到高位,代价是点击过少时误差底抬高。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对连续西班牙语静音发音重建中说话人发音差异大且数据少的问题,论文提出每轮按音素平均误差自适应调整帧级损失权重的方法,在肌电和唇读两种模态上以字符错误率为主要证据显示多数说话人可懂度提升,但增益随预训练增强而减小且呈说话人依赖。
该文研究无帧级肌电-音频对齐时如何从口面肌电合成语音,选择把肌电协方差功率映射到冻结 HuBERT 离散单元再用现成声码器发声,最强证据是 H 线性预测肌电功率达 r=0.85 且 vec(E) 加音素引导解码显著降低单元错误率,代价是词错误率仍在 50% 以上且仅单例 ALS 验证。
该文只用静默构音肌电与文本转写、用对称正定矩阵表示通道间相关再接门控循环网络与联结时序分类损失做音素级序列转换,在大词表单被试上报告音素错误率 48.47% 与词错误率 73.53%,代价是仍需双向整句解码且主要证据来自单名健康被试。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
BioSync 用多头自注意力建模模态间交互并并联线性拼接分支,在两个合成队列上以认知队列 AUC 0.928 和代谢队列准确率 0.764 为最强证据,代价是干净数据优势微弱且临床推断仍待真实队列验证。
语音情感识别 | 6.0/10