滑音与元音之争:变异行为能否区分两类音?
该研究用连续重复的/ujujuj/与/wiwiwi/结合电磁发音仪追踪与线性判别指数检验滑音与元音是否随语境和韵律位置同等变异,最强证据是词首共强化而词尾重音仅元音强化且唇舌协同方向相反,但代价是仅覆盖/u-i/与/w-j/组合且无公开数据代码。
该研究用连续重复的/ujujuj/与/wiwiwi/结合电磁发音仪追踪与线性判别指数检验滑音与元音是否随语境和韵律位置同等变异,最强证据是词首共强化而词尾重音仅元音强化且唇舌协同方向相反,但代价是仅覆盖/u-i/与/w-j/组合且无公开数据代码。
该研究以法语问答诱发的半自发语料检验喉化与信息焦点的关联,再用交叉拼接只插入喉塞音的感知实验验证听者是否据此作窄焦点解读,最强证据是插入喉塞音使窄焦点判定的胜算比变为约 4.97 倍,代价是仅覆盖句末焦点与人工插入的自然度限制。
该研究把多语言音素识别器输出的国际音标序列接上单语种 n 元音位组合模型做闭集语种识别,在 FLEURS 上达到与近期声学系统可比的准确率,但音素识别错误率和解码对照显示该序列并非真正与语言无关。
该研究用 383 名法英双语人的朗读句和 VOCALISE 系统比较单语与双语条件下的似然比分数,发现双语比较显著压低相似度并削弱同一说话人优势,使同人跨语言分数向异人分数靠拢。
该研究以法语合成语音为对象,用强制对齐加共振峰提取得到元音空间面积、元音内离散和元音间距离三类指标,并在系统层用斯皮尔曼相关对照平均意见分,最强证据是元音间高度对比/a-i/与/i-E/在 F1 上显著相关而多边形面积不显著,代价是离散指标整体偏弱且结论限于单语料单说话人风格。
该研究针对越南语词尾不除阻的塞音/p,t,k/难以靠爆破辨认的问题,在 C1VC2 伪词载体句中测量元音后段共振峰与强度过渡,发现即使无爆破仍在 70% 后出现显著分化,但分析目前只限 5 名女性高调发音。
该研究以普通话与西安话双元音为对象,用广义加性混合模型分离声调贡献并比较基频与第一共振峰极值对齐,再用函数主成分加随机森林只看第一共振峰预测四声,最强证据是跨说话人分类达到普通话 49% 与西安话 43%,代价是只覆盖两个双元音且未直接观测发音运动。
针对流式语音识别只能用过去和很小当前块导致词错误率上升的问题,SENS-ASR 用过去帧经上下文模块蒸馏句子嵌入教师得到的语义向量拼接增强每帧表示,在 160 毫秒小块上报告了词错误率下降,但大块和全上下文增益消失且需额外训练教师与上下文模块。
该研究把主动规划、口头对话与非言语通信统一为一个零样本提示驱动的 LLM 代理工作流,并在 Pepper 机器人上与基于规则的多策略基线对比,主动性离线重放占优而用户体验总体接近,但推理延迟与样本不均衡仍是主要代价。
针对西班牙语初学者学法语难元音的问题,该研究用五天个性化重读双音节无意义词训练比较四种隐性纠正反馈,发现以声学距离度量的元音产出普遍改善且超韵律操控组优势显著,但未报告可听度与长期保持之外的代价细节。
该文在严格分块流式条件下检验 Conformer-Transducer 编码器中的自注意力,发现其退化为对角局部模式,进而用一维可变形卷积替换或直接删除自注意力,在 LibriSpeech 与 TEDLIUM-2 上保持词错误率基本不变并显著降低实时率与参数量。
该试点研究用实时上移第二共振峰的听觉反馈扰动检验可懂度需求是否增强听觉运动适应,在两名法语被试上未发现系统性效应,只在个别被试上看到与假设一致但不一致的趋势,且暴露了顺序与消洗不彻底的方法局限。
该研究用电磁发音仪测量意大利语四音节伪词中跨辅音元音间距,显示当其中一个元音带重音时元音到元音协同发音减弱且重读元音目标更极端,支持手势缪模型的作用域超出重读音节,但前向与后向效应的不对称仍受重音位置混淆限制。
该研究用两次模仿之间插入元音归类任务是否拉大声学差异来检验二语模仿能否走自动选择性知觉模型的语音模式,预备结果显示组间无显著差异且出现与元音相关的变化模式,不支持语音模式解释并提示音系表征仍在起作用,但样本小、试次损失大导致统计力不足。
该研究以 28 名母语者与汉语双语和三语学习者的朗读与半自发法语为对象,用六个节奏度量比较组别与任务交互,最强证据是元音度量随任务系统性上升而辅音度量保持稳定,代价是仅%V 与半自发下 Varco-V 显示组间偏离且语速未显式建模。
该研究以法语重音短语为节奏单位,用脑电的成对相位一致性检验三角波跟随语速的能力,初步显示老年人在三倍速下耦合消失并伴随理解与复述分数下降,但神经证据目前仅为每组一人的试点分析,须等待六十人规模的完整处理来确认。
该研究以重音结尾的节奏组为锚点比较四种教学干预,报告显示本体感觉干预在半自发话语中减少不流利并稳定重音手势同步,但样本仅 12 人且起跑线不齐,推广需谨慎。
该研究以约 7 小时朗读与约 29 小时自发对话中 40 人的 36445 个/ai,au,ia,ua/为对象,用元音空间面积与混合广义加性模型刻画 F1-F2 动态轨迹,显示短时长引起局部中央化而口语语体引起整体轨迹下移且不改变曲率,代价是未报告可复现的切分与建模参数细节。
该研究以拉美人工智能微工人的半自发访谈为对象,用时长与频谱重心刻画词尾 coda /-s/ 的弱化,并在 4172 个保留样本上以线性混合模型检验教育、就业与收入的调节作用,但因样本小且只保留较长切分,结论只能视为待验证的趋势。
该研究用塞音加响音或阻塞音的首辅音丛与塞音加央元音加辅音的对照做知觉辨别任务,发现普通话母语者对塞音加 r 的修复与塞音加 s 相当而显著多于塞音加 l,支持拼音 r 在音系上表现为阻塞音而非响音,但刺激中约 78% 的 r 实现仍接近元音性声学特征,提示知觉归类更多由音系地位决定。