强边界前的下倾有多陡:德语标题与间接引语区分母语者与法语学习者
该研究让 20 名德语母语者与 20 名法语学习者朗读两篇德语故事,用边界前最后两个重读音节基频最大值计算半音每秒斜率,报告标题处母语者下降更陡且间接引语仅母语者显著分化,代价是每人仅两个标题样本且间接引语依赖特定生僻动词。
该研究让 20 名德语母语者与 20 名法语学习者朗读两篇德语故事,用边界前最后两个重读音节基频最大值计算半音每秒斜率,报告标题处母语者下降更陡且间接引语仅母语者显著分化,代价是每人仅两个标题样本且间接引语依赖特定生僻动词。
针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。
该研究以 13 名初学英语母语者为对象比较 7.5 小时显式形式聚焦与隐式意义聚焦教学,用三选一感知任务检验词重音时延长短和疑问句末调,结果总体无显著净增益,但显式组在词重音识别上更稳定而隐式组在疑问句语调选择上略有松动,代价是样本小、训练短且感知只是间接目标。
该研究用完整与缩减形式的词汇启动任务检验法语学习者对英语 schwa 脱落的表征问题,初步报告显示缩减启动词降低正确率且效应随水平增强,支持缩减形式经由完整形式生成而非等价存储,但样本小且未报告可复算的定量主效应表。
针对发声谐波污染唇端扫频响应的问题,该研究用闭口校准加高阶小啁啾变换分离嗓音与扫频重建声道响应,在 90 赫兹到 1100 赫兹基频的/a/静态仿体上识别前四个共振并给出频率与带宽,代价是在共振一致与低基频处误差与分离难度明显增大。
该研究以标准化朗读任务的时间声学测量为输入,用主成分分析加层次聚类找出慢而分段与快而连续的第一维度和节律规整性的第二维度,得到 5 个与疾病分期和感知严重度不完全对应的口语轮廓,但样本小且仅用时间测量因而不能单独判定临床严重度。
该研究以扩展版 MOCHA TIMIT 的声学与发音同步记录为依据,用带通滤波加包络差与成对相位一致性比较下颌、整体上部发音器官与喉头活动对声学振幅慢调制的跟随程度,报告喉头信号的音节级协调最强且音节层普遍强于超音节层,但未给出可复用的数值阈值与因果证明。
该研究以 17 例肌张力障碍患者术前与术后 6 个月、12 个月的文本朗读为对象,用混合线性模型检验韵律声学参数变化,报告仅平均基频在术前与术后 12 个月之间显著不同,其余参数稳定,作者将其解读为无韵律层面的整体改善但也无有害效应。
该研究把同一套 10 题口哨语四选一听辨任务分别放在户外节日与两间教室施测,用缺失率与正确率随题序的回归斜率加 bootstrap 推断比较情境效应,最强证据是户外组缺失率显著随时间上升而教室组证据不足,代价是户外组词汇题正确率多在随机水平之下且样本与环境混杂无法分离。
该研究用卷积模型从舌超声和唇视频预测标准化基频曲线,在 TaL1 上 L+T 中位 Spearman 相关达 0,72、在 TaL80 上达 0,66,而词重音越高预测越准、单纯扩大 articulatory 上下文增益有限。
该研究用同一 TCN 分割模型对比绝对特征与帧间差分、保留或去掉重叠前单人语音、打乱帧顺序三类扰动,显示 WavLM 在 DIHARD III 上达 0,680 F1-score 而 MFCC 仅 0,424,且打乱时序会系统性推高重叠类概率,代价是扰动结论依赖小样本长重叠段与伪概率曲线。
该综述按 PRISMA 筛出 2014-2025 年 27 项急救电话语音研究,发现 78% 做呼叫优先级排序且近半依赖情绪识别,但仅 7 项评估临床或运行影响、14 项依赖模拟语料,说明算法性能不等于分诊可用性。
该研究把语种识别改写为二值语音属性上的独立伯努利似然,用二值自编码器加按频率估计的激活概率做闭集判分,在 FLEURS 上以 mms-lid-126 嵌入达到与 PLDA 相当的精度,同时保留按属性回看判分依据的能力,代价是在 ECAPA-TDNN 与未见语种上出现更明显的性能下降。
以 95 次自发语 donc 比较话语标记与常规连词在口吃组与对照组的实现,显示总时长与整体不流畅分布无显著差异,而尾音/k/占比、前暂停与前音高跳变呈现组别与用法交互,但样本仅 18 人且只覆盖一个词。
本研究以五名熟练编码者的 2148 个 CV 键为对象,用线性混合模型检验词类、句内位置与朗读任务对辅音和元音时长的影响,发现说话人差异主导时长而常规语言学因素解释力不足,代价是模型仅解释约三成方差且编码语速整体慢于自然口语。
该研究让 4 名 8 岁儿童重复经声码器降质的法语鼻元音与口元音,用鼻音度量化产出,发现通道减少与插入偏移使鼻元音口音化而口元音鼻音化并在 4 通道最严重,但个体差异大且样本仅 4 人。
该项目要解决多人视频对话中语言、非语言、视觉与时间线索难以统一建模的问题,选择先定义多维度交际行为再建模其关系并生成电影剧本式描述,以虚构与真实语料上的泛化为证据方向,代价是本文仅提出路线而未报告可验证的模型与定量结果。
论文把 TiCodec 的时间不变分支放在编码器不同深度和不同片段采样下逐项对照,发现第 2 层保波形细节、第 3 层保感知与说话人,再用双分支 Dual-TIRE 组合两者,代价是解码结构与训练约束更复杂且跨域增益并不覆盖全部指标。
该研究用触屏界面 ToneCanvas 让 10 名母语者和 9 名无声调经验的法语者先描后默画 9 对双音节词的声调轨迹,发现总体对比幅度无显著组间差异但中段与 T2/T3 动态段存在局部差异,说明手势可支撑声调编码但快速变调控制仍是难点。
该研究用 12 人 948 句的问答诱发语料比较宽聚焦与窄聚焦,报告后聚焦区稳健的去重音与聚焦区时长和强度的增强,而聚焦区 F0 峰值升高仅为趋势,代价是朗读任务与合并信息性和纠正性窄聚焦限制了推广。