把可懂度比较搬进声道:九维收缩变量为何能替掉上千维自监督特征
针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。
针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。
该文把语料看作语音相似 utterance 图,先用零模型检验其聚类与模块度,再按社区分层加稀有音素播种做时长预算选择,在孟加拉语和英语 20% 预算下均显著降低合成可懂度误差,孟加拉语还以 4.5 倍更少训练时间超过全量训练。
论文把带侧支亥姆霍兹腔的通气耳道建模为二端口传输问题,导出音频带预算只由总腔体积与通孔面积之比决定,再用危害加权注水分配证明低频选择在通气类中接近无效而中高频匹配设计可达十二分贝,代价是每 1 分贝言语代价约换 1.3 分贝防护。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究以法语单音节与双音节无意义词为材料,用声学时长与喉头仪信号加听辨实验检验耳语中清浊对立的保持机制,最强证据是耳语仍可听辨且时长对比基本保留,代价是塞音后接口塞音时尾音节清浊时长对比消失。
本研究以法语快速噪声言语测试固定四人声嘈杂条件追踪 10 岁至 20 岁九个月正常听力者的 RSB50,报告随年龄平均改善 1,93 dB 并以中介模型显示 Stroop 不一致条件反应时解释 20,5% 的总效应而数字广度无显著路径,代价是熟悉度顶格与横断面设计无法确立因果。
该研究以 CLEAR 文本经合成语音再由 Whisper Tiny 识别为链路,用全局可读性指数与词错误率检验文本复杂度是否影响识别,最强证据是转写前后指数相关 0.97 而指数与错误率相关仅 0.03 且回归无法预测,代价是人类判断仍保留约负 0.28 的相关而未做真人听测验证。
针对非专家用户难以编写 PsyToolkit 脚本的问题,DYE 用 R 与 Shiny 图形界面拼装强迫选择与李克特量表并生成可直接导入编译的代码与图片,代价是目前仅覆盖 PsyToolkit 有限子集且多元素需顺序呈现。
该研究把句子真假判断改为听句看单图做符合判断,用正常、戴咬合块、咬合块加鸡尾酒噪声三条件验证敏感性,用 1.0 版 87.7% 与 1.1 版 97.9% 的正常条件正确率暴露并修复图像歧义问题。
该研究把原来只给朗读打一个总分的可懂度模型改造为按轮次打分的时间序列方法,在 13 例舌切除患者的半结构化临床对话上检验临床医生说话是否影响患者下一轮可懂度,最强证据是 7 例中存在显著关联且 PMB01 约 40% 变化可被解释,代价是 10 秒窗导致的时间粒度粗糙且个体差异极大。
该研究以 21 名助听器佩戴者区分 ada 与 aga 的三线索权重和三种朝向的谱时调制检测阈为证据,显示第二共振峰线索利用与对应调制敏感性相关,但样本小且高频爆破条件多未完成使结论仍为相关性支持而非因果证明。
该试点研究用实时上移第二共振峰的听觉反馈扰动检验可懂度需求是否增强听觉运动适应,在两名法语被试上未发现系统性效应,只在个别被试上看到与假设一致但不一致的趋势,且暴露了顺序与消洗不彻底的方法局限。
该研究以法语重音短语为节奏单位,用脑电的成对相位一致性检验三角波跟随语速的能力,初步显示老年人在三倍速下耦合消失并伴随理解与复述分数下降,但神经证据目前仅为每组一人的试点分析,须等待六十人规模的完整处理来确认。
该工作研究无训练介入式可懂度预测,用冻结语音基础模型分层嵌入的参考测试分布距离代替人评,在英文编码增强与中文增强数据上显示 Whisper 末端层加 Fréchet Audio Distance 相关最强且跨语种比词错误率稳健,代价是需要成对参考与更大模型开销。
该文用逐个辅音静音加孤立词识别的方法定义掩蔽致误识率来给辅音排序,最强证据是控制另一变量后频率与误识率负相关而功能负载正相关,代价是静音为上限式探针且只覆盖单个辅音与自动识别代理。
该研究用同一句话在 50%、100%、200%、400% 四档用力下比较“大声”与“有意念”两种外部提示,报告显示提示间声学与感知差异很小而档位间差异显著,但 400% 用力反而平均强度与音高范围下降,代价是自然度与清晰度的权衡仍未解开。
该研究用德语三档自然语速与其 PSOLA 时长对齐版本做清晰度评分与 A/B 偏好实验,证明全局语速强烈预测清晰度但重音、有声段保持与元音频谱保持贡献独立方差,而线性伸缩不能复原自然缩减的分布。
该个案以四组同音节五声调重复任务结合五位母语听辨与基频时长声学测量,显示总体听辨正确率仅 36.1% 且高调 T1 仅 6%,代价是单被试、无纵向干预对照,不能推广为群体规律。
该研究用 80 名口腔与口咽癌患者的伪词解码任务检验可懂度评分是否随词表、面对面与远程场景和评估者经验而变,结果显示词表与场景无显著差异而重度损伤段专家评分幅度更收敛,但专家效应仍是待解释的代价。