先按非韵律证据找句子,再看调形:伦敦多族裔英语疑问句与强调 lengthening 的升降调
该研究用下一轮回答与听辨到的辅音拉长作为非韵律筛选标准,从 8 名东伦敦加勒比裔青少年的半自发访谈中得到 192 个可用目标,并报告极问句 84%、陈述问句 64%、强调辅音拉长 79% 为升降调,而细部 F0 差异小且分布高度特异。
该研究用下一轮回答与听辨到的辅音拉长作为非韵律筛选标准,从 8 名东伦敦加勒比裔青少年的半自发访谈中得到 192 个可用目标,并报告极问句 84%、陈述问句 64%、强调辅音拉长 79% 为升降调,而细部 F0 差异小且分布高度特异。
用普通话双音节词的情绪 Stroop 任务比较 23 名音乐家与 20 名非音乐家,报告显示音乐家在韵律和语义任务中反应更快且在韵律准确率探索性分析中占优,但组别与一致性的交互不显著,说明优势在加工速度而非冲突调节,且情绪类别仅限高兴与生气。
针对远场多通道会议中混响噪声与重叠语音的日志难题,该工作把神经 FCASA 的高斯源方差模型推广为瘦峰广义高斯与学生 t 分布的重尾模型并统一为高斯尺度混合训练目标,在 AMI、AliMeeting 和 CHiME-6 上报告了日志错误率与 Jaccard 错误率下降,但部分形状参数会退化且跨语料直接迁移仍明显变差。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。
该工作研究无训练介入式可懂度预测,用冻结语音基础模型分层嵌入的参考测试分布距离代替人评,在英文编码增强与中文增强数据上显示 Whisper 末端层加 Fréchet Audio Distance 相关最强且跨语种比词错误率稳健,代价是需要成对参考与更大模型开销。
该研究用 30 人模仿五种核音调的实验检验核前非重读音节上的基频轨迹如何实现,报告了晚起上升与线性上升在模仿中合并、平台刺激未被复现、上升均在重音附近启动的证据,代价是仅覆盖六音节短语和实验室模仿条件。
论文用单篇民间故事田野录音比较动词前宾语与动词后宾语,发现后者在平均强度、平均基频和基频滑音幅度上显著更低而动词不受语序影响,该模式支持非突显成分易后置的解释,代价是时长无显著差异且信息状态效应只在合并语序时显著。
该研究用异性别 AX 辨别任务比较粤语与英语听者辨别泰语五声的表现与所用基频维度,发现粤语组辨别灵敏度更高,两组都依赖基频轮廓这一最有效线索,但只有英语组还追踪缺乏区分力的起点基频,代价是该结论依赖在线相关分析且未按声调对拆分验证。
该研究以标准化朗读任务的时间声学测量为输入,用主成分分析加层次聚类找出慢而分段与快而连续的第一维度和节律规整性的第二维度,得到 5 个与疾病分期和感知严重度不完全对应的口语轮廓,但样本小且仅用时间测量因而不能单独判定临床严重度。
该研究以扩展版 MOCHA TIMIT 的声学与发音同步记录为依据,用带通滤波加包络差与成对相位一致性比较下颌、整体上部发音器官与喉头活动对声学振幅慢调制的跟随程度,报告喉头信号的音节级协调最强且音节层普遍强于超音节层,但未给出可复用的数值阈值与因果证明。
该研究以 17 例肌张力障碍患者术前与术后 6 个月、12 个月的文本朗读为对象,用混合线性模型检验韵律声学参数变化,报告仅平均基频在术前与术后 12 个月之间显著不同,其余参数稳定,作者将其解读为无韵律层面的整体改善但也无有害效应。
本研究用 4 段签证面试自然语音和 129 名尼日利亚听者的匹配假装评分,检验 4 种核调型在话语延续、强调、尊重礼貌与文化得体上的概率性差异,最强证据是 RISE-FALL 相对 FALL-LOW 更可能被判为延续与得体,而 RISE-RISE 始终偏向不礼貌不得体,但效应是梯度而非范畴且高度依赖语境。
该研究把同一套 10 题口哨语四选一听辨任务分别放在户外节日与两间教室施测,用缺失率与正确率随题序的回归斜率加 bootstrap 推断比较情境效应,最强证据是户外组缺失率显著随时间上升而教室组证据不足,代价是户外组词汇题正确率多在随机水平之下且样本与环境混杂无法分离。
该研究用 Markina 巴斯克语中性陈述与是非问听辨任务检验母语与西语为母语的二语听者,显示母语者四条件均高于 95% 而二语者在多短语问句仅约 24% 正确、在单短语陈述约 61% 正确,说明核轮廓之外的整体音高形状决定问句解读。
针对梅尔谱缺相位信息导致相位一对多难学的问题,PhaseGAN 用插值加 ICCRN 先恢复幅度谱再用 R3-GAN 生成相位谱,在 LJSpeech 上报告 UTMOS 4.238 等最优感知指标,代价是两阶段分别训练且推理仍需 6.42G 量级计算。
用影子跟读检验香港粤语 T2-T5 与 T3-T6 并调是否向相反声调启动靠拢,最强证据是基线可分而跟读出现中度与强趋同且真人强于 AI、视频强于图片,代价是合并者仅每对 2 人而无法定论。
论文以索伊科拉英格里亚语一足与两足三音节词为对象,用第二与第三元音时长和十一基频测量检验音步切分的语音实现,最强证据是双足词第二元音显著更长,而代价是单人小样本与说话人变异使第三元音与音高只能作渐变性解释。
该研究以 20 期西班牙公共台新闻中 417 个句末耳语为对象,检验说话人、重音位置与话语因素的制约,最强证据是耳语起点集中在重音及重音后音节而非话语转换,代价是样本仅两人两地口音且无声学参数建模。
该研究以 16 名母语人的宽聚焦与问答及纠正性窄聚焦录音比较音高峰、词首强度与词尾时长,发现窄聚焦以后焦压缩和边缘增强为标志,宽聚焦中前动词宾语呈现边界前重置与增强,整体更支持边界增强而非普遍的节律重音。