论文解读
只用三个元音能判断年龄吗:科西嘉塔拉瓦方言的尝试与落空
该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。
该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。
该研究用巴黎两所极端社会位置学校的 36 名 8-10 岁儿童朗读任务,报告了女孩在清塞音 VOT 更长、浊塞音前置浊化更长、H1-H2 更高三项指标上均与成年女性方向一致的性别差异,并显示 VOT 性别差在优势学校更大而嗓音质量性别差在弱势学校更大,代价是样本小、无中间阶层且塞擦化仅做听辨加频谱图二分判断而未做统计检验。
该研究用 8 种权力亲疏负担组合诱发提议句并对整句基频建模,报告面子威胁越高平均基频越低且距离效应最强,但权力呈现反向的局部差异,代价是朗读任务与非完全相同句式限制了自然度。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该文用 14 维说话人一致构音特征比较 VCTK 苏格兰、英格兰、爱尔兰口音,以 DTW 对齐达到 99% 分类准确并以最优传输扩展到非平行语料,但 OT 需要约 7.5 分钟语音和上百聚类点才稳定。
该文把语音智能体的文化能力重新定义为事件限定的交互能力,用语音事件与交互契约约束韵律时机与参与管理,并以附录的事件卡与最小对诊断补足词错率与平均意见分测不到的得体性,代价是增加人工判断与规范界定负担且不提供新数据集验证。