只听说话方式不看说了什么:手工声学特征叠加 YAMNet 嵌入检测阿尔茨海默病
该研究只用语音音频区分阿尔茨海默病与健康对照,用 Librosa 手工声学均值特征与冻结 YAMNet 的 1024 维嵌入拼接后训练分类器,在 160 条合并数据上以 70% 训练 30% 测试取得 89% 测试准确率,代价是小样本、无人口学控制且未报告延迟与误判细节。
该研究只用语音音频区分阿尔茨海默病与健康对照,用 Librosa 手工声学均值特征与冻结 YAMNet 的 1024 维嵌入拼接后训练分类器,在 160 条合并数据上以 70% 训练 30% 测试取得 89% 测试准确率,代价是小样本、无人口学控制且未报告延迟与误判细节。
针对单看基频会把重音归因给音高的问题,该文选择在平滑后的基频线上同时编码瞬时强度与局部音节速率,并在意大利诗歌朗读上展示联合线索如何区分延续类边界,代价是颜色只表相对快慢且跨录音比较仍需归一化。
该文要解决超声舌成像中音频同步与头动记录分散、布线复杂的问题,选择无线 OptiTrack 六自由度头姿态加触发与时间戳统一采集的轻量方案,直接报告了设备布置与对齐检查流程,但完整的几何运动校正仍留待未来验证。
该试点以 9 名乳腺癌幸存者和 13 名健康对照的叙事语音比较韵律特征与 MFCCs,用逻辑模型树加十折交叉验证报告 86% 对 82% 的准确率,代价是 MFCCs 需 11 个系数且临床可解释性不足。
针对连续语音韵律短语标注耗时问题,论文提出依赖完整主流美式英语 ToBI 训练的加速分组标注法 Rapid-ToBI,报告双人三分类一致性 κ=.87 而 Wavelet 在中间短语处漏检 78.5%,代价是仍需受训标注员且仅在约十分钟奥巴马讲话上验证。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
论文比较北美英语人类与 Parler-TTS 在陈述句和极性问句中实现对比性焦点的声学线索,发现人类按句型反转 F0 策略而合成语音跨句型高度一致,且在语速与强度上整体偏离人类,最强证据来自贝叶斯逻辑回归的 95% 可信区间方向差异,代价是强度在人类数据中受录音变异掩盖而未能复现经典效应。
该研究以非裔美国英语使用者产出的多义短语 you good 及单义对照句为材料,用 Praat 标 F0 峰位置与 OpenFace 加 findgest 标眉毛运动,检验句类与多义性对峰位、眉毛活动频率、抬眉分布与声手峰时序的影响,最强证据是句类显著决定 F0 峰落在第二词与眉峰相对更早,而疑问句并未带来更多眉毛活动或抬眉。
该研究用三音节形容词、名词、动词在对比焦点、窄焦点及两种焦点后条件下的对照发音实验,显示焦点使第二、三音节元音的基频、时长和能量一致抬高,而所谓词末重音与倒数第二重音的音节间差异并不稳定,仅频谱倾斜等个别指标支持重音解释。
该研究以陈述句的词末重音为基线,比较撒奇莱雅与法兰澳阿美语的疑问词首与祈使句动后小品的高音位置,提出高音重联而非重音移位的统一解释,代价是仅依赖八位发音人的声学描写而未做统计检验与感知验证。
本研究以半自发科姆语语料检验词干首位置是否伴随超发音式的元音分化,发现三个共有元音在重音位置共振峰更分散且时长略长,但声调未建模与词界混淆仍是主要代价与限制。
该研究用话语补全任务比较 77 名西班牙加泰地区俄语遗产儿童与单语俄语和加泰西语双语对照组在特殊疑问句核配置上的分布,发现遗产儿童以 72% 的目标俄语型保持与社会语言的区别,但默认升降型显著少用并出现句末附加重音的非目标型。
针对无正式书写系统的 Amchi Konkani 口语转写问题,论文用冻结编码器的 Marathi IndicConformer 只微调 CTC 解码层并叠加约 5000 词众包词典与约 80 条正则后处理,把词错误率从 35.1% 降到 21.3%,代价是仅在小规模故事集上验证且依赖人工维护的词典与规则。
该研究用视觉世界眼动范式检验英语真诚与反讽韵律的实时加工时间进程,发现韵律类型主效应不显著,而基频升高预测更多看向真诚目标、基频与谐噪比升高预测更少看向反讽目标,但初始注视偏置与刺激问题使交互式与模块式之争仍无定论。
该探索性研究让 4 名波斯语者在句中 8 次即时模仿美国英语三音节词重音,比较模仿前与第 1、4、8 次相对时长、平均基频、峰值基频和峰值强度的母语模型偏离,发现时长最稳定趋近而基频峰值与强度改进有限且不一致,代价是样本小且个体差异大。
该研究用窄焦点语境下的四种语序×语调组合做合适度评级,检验韵律能否独立标记动词后窄焦点以及窄焦点语序是否必须配典型语调,最强证据是典型窄焦点得分最高但三类错配仍可接受且与基线无显著差异,代价是丰富词汇语境可能掩盖了线索在信息不足时的真实权重。
该研究用德语产出数据的静态参数聚类与基频轮廓聚类对照人工标注的重音类型,再以随机森林比较它们对突显评分的预测力,发现轮廓四类解与人工类型预测力相近,但聚类不等同于音系类别,且重音有无仍是最强预测因子。
该研究用电磁发音仪比较词首与词中音节的辅音手势,显示元音音长效应出现早并溢出到相邻辅音而重音效应出现晚并延伸到后一音节,由此在不依赖固定音步域的条件下形成逆时关系,但代价是词首辅音几乎不受调制且长词第三音节的解析仍依赖音系假设。
该研究用实时磁共振测量塞茨瓦纳语短语末尾四个发音手势的时长、位移与峰值速度,检验单阶段边界减速与双阶段重音加边界协调两种解释,最强证据是时长出现两次拉长而位移与速度只渐进增大,代价是位移趋势统计不稳且结论依赖八位被试的特定材料。
该研究把西班牙语最小重音对嵌入完整句子并用 5 级声音连续体加 2 种节拍对齐做二选一判断,结果显示声音步骤主导判断而手势对齐无可靠影响,反应时同样无可靠加速,代价是更自然的语速与手势变异可能稀释了视觉线索的权重。