论文解读

把可懂度比较搬进声道:九维收缩变量为何能替掉上千维自监督特征

针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。

 · 更新于 2026-09-24 · 约 21 分钟 · 10088 字 阅读 →
论文解读

先验证结构再采样:社区感知的语音合成核心集选择

该文把语料看作语音相似 utterance 图,先用零模型检验其聚类与模块度,再按社区分层加稀有音素播种做时长预算选择,在孟加拉语和英语 20% 预算下均显著降低合成可懂度误差,孟加拉语还以 4.5 倍更少训练时间超过全量训练。

 · 更新于 2026-09-24 · 约 17 分钟 · 8377 字 阅读 →
论文解读

通气耳塞的因果预算:体积除以孔径决定能省下多少分贝

论文把带侧支亥姆霍兹腔的通气耳道建模为二端口传输问题,导出音频带预算只由总腔体积与通孔面积之比决定,再用危害加权注水分配证明低频选择在通气类中接近无效而中高频匹配设计可达十二分贝,代价是每 1 分贝言语代价约换 1.3 分贝防护。

 · 更新于 2026-09-24 · 约 18 分钟 · 8786 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

声带不振动时,法语清浊对立靠时长和邻音保住,但塞音连缀会中和

该研究以法语单音节与双音节无意义词为材料,用声学时长与喉头仪信号加听辨实验检验耳语中清浊对立的保持机制,最强证据是耳语仍可听辨且时长对比基本保留,代价是塞音后接口塞音时尾音节清浊时长对比消失。

 · 更新于 2026-09-24 · 约 19 分钟 · 9098 字 阅读 →
论文解读

四人声嘈杂中听句子的青春期改善:抑制反应时部分传递年龄效应

本研究以法语快速噪声言语测试固定四人声嘈杂条件追踪 10 岁至 20 岁九个月正常听力者的 RSB50,报告随年龄平均改善 1,93 dB 并以中介模型显示 Stroop 不一致条件反应时解释 20,5% 的总效应而数字广度无显著路径,代价是熟悉度顶格与横断面设计无法确立因果。

 · 更新于 2026-09-24 · 约 23 分钟 · 11487 字 阅读 →
论文解读

可读难了,机器还能听准吗:可听性中结构复杂度与识别错误的解耦

该研究以 CLEAR 文本经合成语音再由 Whisper Tiny 识别为链路,用全局可读性指数与词错误率检验文本复杂度是否影响识别,最强证据是转写前后指数相关 0.97 而指数与错误率相关仅 0.03 且回归无法预测,代价是人类判断仍保留约负 0.28 的相关而未做真人听测验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8739 字 阅读 →
论文解读

不会写脚本也能用 PsyToolkit:DYE 把感知评测做成图形化拼装

针对非专家用户难以编写 PsyToolkit 脚本的问题,DYE 用 R 与 Shiny 图形界面拼装强迫选择与李克特量表并生成可直接导入编译的代码与图片,代价是目前仅覆盖 PsyToolkit 有限子集且多元素需顺序呈现。

 · 更新于 2026-09-24 · 约 17 分钟 · 8118 字 阅读 →
论文解读

把百科知识换成一张图:用句子验证任务测言语可理解度

该研究把句子真假判断改为听句看单图做符合判断,用正常、戴咬合块、咬合块加鸡尾酒噪声三条件验证敏感性,用 1.0 版 87.7% 与 1.1 版 97.9% 的正常条件正确率暴露并修复图像歧义问题。

 · 更新于 2026-09-24 · 约 20 分钟 · 9632 字 阅读 →
论文解读

把可懂度放进对话时间里:舌切除患者与临床医生轮流说话时的动态测量

该研究把原来只给朗读打一个总分的可懂度模型改造为按轮次打分的时间序列方法,在 13 例舌切除患者的半结构化临床对话上检验临床医生说话是否影响患者下一轮可懂度,最强证据是 7 例中存在显著关联且 PMB01 约 40% 变化可被解释,代价是 10 秒窗导致的时间粒度粗糙且个体差异极大。

 · 更新于 2026-09-24 · 约 20 分钟 · 9528 字 阅读 →
论文解读

听得到却听不懂:助听效果差异是否来自对精细声学线索的提取能力

该研究以 21 名助听器佩戴者区分 ada 与 aga 的三线索权重和三种朝向的谱时调制检测阈为证据,显示第二共振峰线索利用与对应调制敏感性相关,但样本小且高频爆破条件多未完成使结论仍为相关性支持而非因果证明。

 · 更新于 2026-09-24 · 约 20 分钟 · 9693 字 阅读 →
论文解读

想让人听懂时,说话人会更用力抵抗被扭曲的听觉反馈吗

该试点研究用实时上移第二共振峰的听觉反馈扰动检验可懂度需求是否增强听觉运动适应,在两名法语被试上未发现系统性效应,只在个别被试上看到与假设一致但不一致的趋势,且暴露了顺序与消洗不彻底的方法局限。

 · 更新于 2026-09-24 · 约 15 分钟 · 7247 字 阅读 →
论文解读

语速加快时大脑跟不上节奏:健康老化中三角波耦合与言语理解的初步证据

该研究以法语重音短语为节奏单位,用脑电的成对相位一致性检验三角波跟随语速的能力,初步显示老年人在三倍速下耦合消失并伴随理解与复述分数下降,但神经证据目前仅为每组一人的试点分析,须等待六十人规模的完整处理来确认。

 · 更新于 2026-09-24 · 约 17 分钟 · 8106 字 阅读 →
论文解读

不训练也能估可懂度:Whisper 末端表示加分布距离何时比词错误率更稳

该工作研究无训练介入式可懂度预测,用冻结语音基础模型分层嵌入的参考测试分布距离代替人评,在英文编码增强与中文增强数据上显示 Whisper 末端层加 Fréchet Audio Distance 相关最强且跨语种比词错误率稳健,代价是需要成对参考与更大模型开销。

 · 更新于 2026-09-24 · 约 16 分钟 · 7721 字 阅读 →
论文解读

把一个辅音静音后单词还认得出来吗:用声学掩蔽给辅音贡献排序

该文用逐个辅音静音加孤立词识别的方法定义掩蔽致误识率来给辅音排序,最强证据是控制另一变量后频率与误识率负相关而功能负载正相关,代价是静音为上限式探针且只覆盖单个辅音与自动识别代理。

 · 更新于 2026-09-24 · 约 18 分钟 · 8763 字 阅读 →
论文解读

喊“大声点”与“用点意念”:帕金森说话人为何调不准用力刻度

该研究用同一句话在 50%、100%、200%、400% 四档用力下比较“大声”与“有意念”两种外部提示,报告显示提示间声学与感知差异很小而档位间差异显著,但 400% 用力反而平均强度与音高范围下降,代价是自然度与清晰度的权衡仍未解开。

 · 更新于 2026-09-24 · 约 17 分钟 · 8423 字 阅读 →
论文解读

语速变慢就更清楚吗:还原程度不只由全局时长决定

该研究用德语三档自然语速与其 PSOLA 时长对齐版本做清晰度评分与 A/B 偏好实验,证明全局语速强烈预测清晰度但重音、有声段保持与元音频谱保持贡献独立方差,而线性伸缩不能复原自然缩减的分布。

 · 更新于 2026-09-24 · 约 20 分钟 · 9538 字 阅读 →
论文解读

台山话声调在痉挛型构音障碍中为何高平调最先丢失

该个案以四组同音节五声调重复任务结合五位母语听辨与基频时长声学测量,显示总体听辨正确率仅 36.1% 且高调 T1 仅 6%,代价是单被试、无纵向干预对照,不能推广为群体规律。

 · 更新于 2026-09-24 · 约 14 分钟 · 6886 字 阅读 →
论文解读

用伪词堵住语言补偿之后,可懂度评分还变吗

该研究用 80 名口腔与口咽癌患者的伪词解码任务检验可懂度评分是否随词表、面对面与远程场景和评估者经验而变,结果显示词表与场景无显著差异而重度损伤段专家评分幅度更收敛,但专家效应仍是待解释的代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9127 字 阅读 →