打码说话为何变慢:法语补码口语中音段时长与手动键结构的协同
本研究以五名熟练编码者的 2148 个 CV 键为对象,用线性混合模型检验词类、句内位置与朗读任务对辅音和元音时长的影响,发现说话人差异主导时长而常规语言学因素解释力不足,代价是模型仅解释约三成方差且编码语速整体慢于自然口语。
本研究以五名熟练编码者的 2148 个 CV 键为对象,用线性混合模型检验词类、句内位置与朗读任务对辅音和元音时长的影响,发现说话人差异主导时长而常规语言学因素解释力不足,代价是模型仅解释约三成方差且编码语速整体慢于自然口语。
该研究用 16 人录音与 8 名女性回访的二选一辨认任务检验普通话问句与陈述语调的感知产出关系,发现听自己更准、刺激中韵律区分度越大越好辨认,但听者自身区分度的作用只体现在问句与陈述的不对称偏移上且受声调制约。
该研究用触屏界面 ToneCanvas 让 10 名母语者和 9 名无声调经验的法语者先描后默画 9 对双音节词的声调轨迹,发现总体对比幅度无显著组间差异但中段与 T2/T3 动态段存在局部差异,说明手势可支撑声调编码但快速变调控制仍是难点。
该研究用 12 人 948 句的问答诱发语料比较宽聚焦与窄聚焦,报告后聚焦区稳健的去重音与聚焦区时长和强度的增强,而聚焦区 F0 峰值升高仅为趋势,代价是朗读任务与合并信息性和纠正性窄聚焦限制了推广。
该研究以 51 个 NotebookLM 生成播客为样本,用发音率与言语率检验面向不同听众的提示词与说话人性别的影响,发现提示词对发音时长的预测力强于性别,而男女声在停顿使用上趋同但在播客尾段发音率上出现分化,代价是 diarization 存在幻觉且输入文本未做控制。
该研究以十地带口音普通话自发独白为对象,用元音辅音区间节律指标加整体距离聚类,报告吴方言口音偏向重音定时、粤闽口音元音占比偏高、厦门口音与官话聚类相近,而节律距离不平行于词汇距离。
该研究追问词尾 schwa 形成额外音节时延续升调与对比降调如何重新对齐,利用 30 人 1078 个轮廓的已标注语料和 20 加 20 人的新产出实验,报告非南部延续调在 schwa 上掉调而南部保持上升、两地对比调都提前达峰后下降,并提议用次级关联保留非南部延续调的 H% 编码,代价是感知验证尚未完成。
针对西班牙成人初学者英语词重音问题,研究用 9 小时动词-声调式具身感知训练检验识音与产出,最强证据是非同源词识音显著进步与朗读复述差异稳定存在,代价是整体进步不显著且高度依赖双语背景与词类别。
该研究用德语朗读生产实验检验限定性是否为语言冗余因子,发现冠词前边界 B1 上定冠词显著短于不定冠词而冠词后 B2 无显著差异,且词频主效应不显著,但图片预熟悉可能抬高了可预测性这一代价限制了词频解释。
该研究让 6 位伊博语母亲对婴儿和成人唱同一首摇篮曲与游戏歌,报告对婴儿演唱平均基频抬高约 79-91 赫兹、基频范围扩大约 32-56 赫兹且频谱倾斜更高,而倒谱峰突出度和谐噪比在控制音高后无显著差异,代价是样本小且未直接编码声调实现。
该研究以《我是演说家》48 名选手的 96 段 30 秒语音为样本,用九个韵律参数预测比赛名次,发现平均第三共振峰越高名次越好,女性则靠基频变化范围取胜,但整体预测力弱且只在开场显著。
该研究用 48 对本科生四轮立场表态加案例讨论检验事先立场一致是否影响随后语速差,发现不一致显著增大语速差而时间顺序本身也带来发散,且代理感与社交吸引力只在匹配与否条件下反向调节,但全为探索性混合模型结果且无代码数据公开。
论文以朗读为参照比较 50 名护理员在访谈与模拟照护中的音节级基频、能量、时长对比和元音离散度,用贝叶斯混合模型与 k-means 聚类报告了照护语音基频升高与超调制及两组个体策略分化,但能量区分弱、轮廓分离度仅中等且存在地域与朗读表现力的混杂。
论文以北卡舒布语名词变格中的重音位置变异为自然对照,用同一语音位置的重读与非重读元音比较检验时长、基频和强度,结果显示元音时长是主要声学相关物而强度作用较小且基频无显著作用,但分析只覆盖后元音并排除了词首词尾与短语重音条件。
该研究以一名高级贝阿恩奥克语哨语者的隔离词哨音为对象,用中点哨音基频比较元音、用归一化三次多项式轮廓检验辅音发音部位的协同发音痕迹,显示元音库压缩为四类且齿龈语境系统性抬高元音起始段,而/i/对语境不敏感,但结论限于单人小样本探索。
针对 360 度远场多说话人重叠对话的音视频识别与说话人归属问题,AUVIS 在官方基线五阶段流水线上保留基线检测与跟踪、只做切分与聚类参数解耦和网格优化,用开发集上聚类 F1 到 0.906 的 14.8% 相对提升带动联合误差 17.09% 相对下降,而识别字错误率仅相对下降 0.9% 到 0.4943。
该研究用图片命名诱发 196 个单音节词并以生长曲线与线性混合模型比较 18 名 4 至 7 岁白语儿童与 12 名北方成人基线,报告习得顺序为 T35 大于 T55 大于 T214 与 T51,代价是各年龄组时长系统性偏长且降调 T51 在三组中均未达成人轮廓。
该研究以 12 名天津话发音人的 5608 个语料比较无焦点与窄焦点下七类弱元素的基频,显示焦点主要做整体垂直抬升而不改变曲线形状,且只有词缀等四类能显著承接 prominence,而功能类与结构助词等则基本不扩展。
该研究用受控朗读与声门图接触商检验喉发音体模型关于低后元音应更收缩的预测,发现共振峰不能预测收缩,[ɑ] 仅比[æ] 高约 0.009 且都在常态嗓音范围内。
该研究用发音产出实验检验英语 since-when 问句在不信与信息寻求语境下是否韵律不同,发现不信语境下 when 更长、基频均值与最低值更低而基频极差更宽并伴随更深的基频谷与句末更低的基频轨迹,但主语 they 无可靠差异且句末低边界的证据需谨慎解读。