两个老师教一个流式编码器:在保住健康语音的同时听懂电子喉
针对电子喉语音与健康语音域失配且大模型难流式部署的问题,论文用冻结自监督模型的离散音素目标加电子喉微调识别模型的瓶颈特征做三阶段渐进蒸馏,最好的 Mel-Conformer 把电子喉词错误率从最强零样本基线的 39.3% 降到 21.2%,代价是仍需平行语料做对齐且只用识别探测验证,ONNX 单核实时率为 0.30。
针对电子喉语音与健康语音域失配且大模型难流式部署的问题,论文用冻结自监督模型的离散音素目标加电子喉微调识别模型的瓶颈特征做三阶段渐进蒸馏,最好的 Mel-Conformer 把电子喉词错误率从最强零样本基线的 39.3% 降到 21.2%,代价是仍需平行语料做对齐且只用识别探测验证,ONNX 单核实时率为 0.30。
针对构音障碍语音识别中离散 token 与识别目标错位且随严重程度漂移的问题,该文用迭代伪标签更新、可微端到端优化与严重程度不变正则学习 DSI token,在 UASpeech 与 TORGO 上显著优于可比 HuBERT 连续与离散基线,系统组合后最低词错误率分别为 18.90% 和 6.38%,代价是需内容平行的健康对照与额外的端到端训练。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
针对清醒脑肿瘤手术中电刺激引起的短暂构音障碍难以实时听辨的问题,论文提出录音去噪加 Whisper 切分加 MFCC 加 GRU 的二分类方法,在计数与 DO80 任务上报告约 90% 以上验证精度,但合并任务出现过拟合且异常样本仍偏少。
该研究用同一批句子在字面与反讽语境下诱发法语朗读并测量语速、基频与强度,报告两组均未出现稳定显著的反讽标记,个体策略差异大于诊断组间差异,代价是仅 10 人小样本与强语境消除了对韵律的依赖。
该研究用 Seed-VC 把健康对照的持续元音转换成癌与良性黏膜病变的嗄声并请专家做 GRBAS 与四级可信度评定,结果显示转换声不总被判为人工但仍可被感知且常规声学差值解释不了,提示先别直接拿去训练分类器。
该研究以 27 例唇口咽癌后自发对话语音检验 Whisper large 转写,发现字符错误率与感知严重度呈强负相关并以 50% 为界分出两组,重度组多层错误率平均高约 42.82%,其中词法与句法层代价最大而纯词性类别差异最小。
该研究把原来只给朗读打一个总分的可懂度模型改造为按轮次打分的时间序列方法,在 13 例舌切除患者的半结构化临床对话上检验临床医生说话是否影响患者下一轮可懂度,最强证据是 7 例中存在显著关联且 PMB01 约 40% 变化可被解释,代价是 10 秒窗导致的时间粒度粗糙且个体差异极大。
该研究把转写词错率当作后续音素对齐的前置条件,在未见过的健康与病理法语数据上比较四类系统,最强证据是训练数据与评测风格越接近误差越低,而代价是没有任何模型在犹豫词和不同病理间保持稳定。
该研究让三组帕金森患者分别接受适配音乐、随机音乐和无音乐的四周步态训练,用 30 秒 pataka 重复任务比较干预前后音节间期离散度,最强证据是音乐组节律离散度下降而无音乐组上升且整体音乐效应 p=0.018,代价是样本小且大量依赖 Praat 手工校正。
该研究在法语朗读任务中比较言语失用症、帕金森构音障碍、小脑性共济失调构音障碍与典型对照的韵律成组,报告显示三组都保留四级边界与两级节奏突显的清单但分布不同,而失用症组以过多边界和词内边界形成最碎的切分。
该研究以标准化朗读任务的时间声学测量为输入,用主成分分析加层次聚类找出慢而分段与快而连续的第一维度和节律规整性的第二维度,得到 5 个与疾病分期和感知严重度不完全对应的口语轮廓,但样本小且仅用时间测量因而不能单独判定临床严重度。
该研究用句中焦点问答任务比较 15 名普通话自闭症儿童与 15 名年龄匹配典型发展儿童,显示典型组靠焦点音节基频提升加焦点后压缩标记焦点,而自闭症组基频使用受限、转而靠焦点后振幅与时长压缩实现区分,代价是焦点音节增强不足且模式随声调变化。
该研究用同一句话在 50%、100%、200%、400% 四档用力下比较“大声”与“有意念”两种外部提示,报告显示提示间声学与感知差异很小而档位间差异显著,但 400% 用力反而平均强度与音高范围下降,代价是自然度与清晰度的权衡仍未解开。
该研究用 80 名口腔与口咽癌患者的伪词解码任务检验可懂度评分是否随词表、面对面与远程场景和评估者经验而变,结果显示词表与场景无显著差异而重度损伤段专家评分幅度更收敛,但专家效应仍是待解释的代价。
针对卒中后失语命名中发音变异和多重尝试导致转写不可靠的问题,论文把判断改成音频与提示文本在共享空间的配对,用两组法语命名数据在留一说话人评估下报告最高 0.90 准确率,代价是仍需在失语数据上微调且重度损伤集上降到 0.85。
针对帕金森病理语音增强数据少且声学 atypical 的问题,论文在 PC-GITA 上系统比较变换型、生成型与噪声增强对预测式 CR 与生成式 SB 模型的影响,最强证据是噪声增强带来最稳健的大幅提升,而生成式合成在比例增大时反而损害性能,且病理与常态语音间的差距依然存在。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究针对波兰儿童浊卷舌擦音发音部位分类,用支持向量机比较梅尔倒谱、谱描述子、摩擦噪声与新提出谱比值特征及多种特征选择方法,最强证据是梅尔倒谱加谱描述子加谱比值配合套索选择达到灵敏度 0.72 与特异度 0.81,代价是小样本与类别不平衡下的稳定性仍需更多验证。