论文解读

句法标出焦点后重音为何变轻:普通话分裂句的韵律补偿

该研究用十六人半自发问答对比书面与口语的焦点实现,发现书面窄焦点靠分裂句而口语靠韵律,无标记窄焦点的四声 f0 范围更大且主语分裂时长更短,说明句法已标记时韵律按经济性减弱但仍高于宽焦点基线。

 · 更新于 2026-09-25 · 约 16 分钟 · 7927 字 阅读 →
论文解读

急救电话里的情绪不等于病情:27 项语音辅助分诊研究的任务、证据与落地差距

该综述按 PRISMA 筛出 2014-2025 年 27 项急救电话语音研究,发现 78% 做呼叫优先级排序且近半依赖情绪识别,但仅 7 项评估临床或运行影响、14 项依赖模拟语料,说明算法性能不等于分诊可用性。

 · 更新于 2026-09-25 · 约 16 分钟 · 7849 字 阅读 →
论文解读

把一个辅音静音后单词还认得出来吗:用声学掩蔽给辅音贡献排序

该文用逐个辅音静音加孤立词识别的方法定义掩蔽致误识率来给辅音排序,最强证据是控制另一变量后频率与误识率负相关而功能负载正相关,代价是静音为上限式探针且只覆盖单个辅音与自动识别代理。

 · 更新于 2026-09-25 · 约 18 分钟 · 8763 字 阅读 →
论文解读

濒危遗产语还分得清三种问句吗:保加利亚犹太西班牙语的问句语调

以半自发话语补全任务比较 18 名保加利亚犹太西班牙语与保加利亚语双语者及 18 名单语者,报告是非问句多以高边界结尾、特指问句多低降、选择问句前升后降的分布,并显示双语者的保加利亚语更接近单语者但仍有 heritage 影响。

 · 更新于 2026-09-25 · 约 19 分钟 · 9501 字 阅读 →
论文解读

普通话里听谁更突出:快速韵律转写一致性为何偏低

该研究用 146 句普通话 TED 演讲做听辨式显著词标注,发现 65 名母语者的两两一致性平均 Kappa 仅 0.251,提示在声调语言中基于声音显著性的短促判断并不稳定。

 · 更新于 2026-09-25 · 约 19 分钟 · 9324 字 阅读 →
论文解读

总时长没有区别时区别藏在哪里:donc 话语标记用法的分段与边界策略

以 95 次自发语 donc 比较话语标记与常规连词在口吃组与对照组的实现,显示总时长与整体不流畅分布无显著差异,而尾音/k/占比、前暂停与前音高跳变呈现组别与用法交互,但样本仅 18 人且只覆盖一个词。

 · 更新于 2026-09-25 · 约 22 分钟 · 10621 字 阅读 →
论文解读

声调中和下温州话高低调域为何不同时消失:位置、轮廓与年龄的线索重组

该研究以瑞安温州话双音节连读变调中仍为重音的音节为对象,用广义加性混合模型与线性混合效应模型检验基频、辅音时长与嗓音质量如何分别编码高低调域,显示词首基频仍强而词中减弱、元音间浊闭塞时长与元音起始段气嗓仍稳健,且青年组各维度区分均弱化,代价是跨调对的邻接声调未能完全控制故只能做调对内中和结论。

 · 更新于 2026-09-25 · 约 21 分钟 · 10148 字 阅读 →
论文解读

打码说话为何变慢:法语补码口语中音段时长与手动键结构的协同

本研究以五名熟练编码者的 2148 个 CV 键为对象,用线性混合模型检验词类、句内位置与朗读任务对辅音和元音时长的影响,发现说话人差异主导时长而常规语言学因素解释力不足,代价是模型仅解释约三成方差且编码语速整体慢于自然口语。

 · 更新于 2026-09-25 · 约 21 分钟 · 10394 字 阅读 →
论文解读

听得准的人一定说得清吗:普通话问句与陈述语调的感知与产出关联

该研究用 16 人录音与 8 名女性回访的二选一辨认任务检验普通话问句与陈述语调的感知产出关系,发现听自己更准、刺激中韵律区分度越大越好辨认,但听者自身区分度的作用只体现在问句与陈述的不对称偏移上且受声调制约。

 · 更新于 2026-09-25 · 约 17 分钟 · 8484 字 阅读 →
论文解读

听不清鼻音时,孩子跟着念也会丢掉鼻口对比:声码器模拟下的鼻音度证据

该研究让 4 名 8 岁儿童重复经声码器降质的法语鼻元音与口元音,用鼻音度量化产出,发现通道减少与插入偏移使鼻元音口音化而口元音鼻音化并在 4 通道最严重,但个体差异大且样本仅 4 人。

 · 更新于 2026-09-25 · 约 20 分钟 · 9654 字 阅读 →
论文解读

把对话拆成可对齐的多维交际行为再生成剧本:MINERAL 的多参与者建模路线

该项目要解决多人视频对话中语言、非语言、视觉与时间线索难以统一建模的问题,选择先定义多维度交际行为再建模其关系并生成电影剧本式描述,以虚构与真实语料上的泛化为证据方向,代价是本文仅提出路线而未报告可验证的模型与定量结果。

 · 更新于 2026-09-25 · 约 19 分钟 · 9177 字 阅读 →
论文解读

时间不变信息放在哪一层抽、用什么片段学:TiCodec 的 TIRE 拆解与 Dual-TIRE

论文把 TiCodec 的时间不变分支放在编码器不同深度和不同片段采样下逐项对照,发现第 2 层保波形细节、第 3 层保感知与说话人,再用双分支 Dual-TIRE 组合两者,代价是解码结构与训练约束更复杂且跨域增益并不覆盖全部指标。

 · 更新于 2026-09-25 · 约 17 分钟 · 8497 字 阅读 →
论文解读

用手指画出声调:非母语者能靠手势复现普通话声调对比吗

该研究用触屏界面 ToneCanvas 让 10 名母语者和 9 名无声调经验的法语者先描后默画 9 对双音节词的声调轨迹,发现总体对比幅度无显著组间差异但中段与 T2/T3 动态段存在局部差异,说明手势可支撑声调编码但快速变调控制仍是难点。

 · 更新于 2026-09-25 · 约 16 分钟 · 7727 字 阅读 →
论文解读

窄聚焦不只抬高音高峰:法语三区韵律的再量化

该研究用 12 人 948 句的问答诱发语料比较宽聚焦与窄聚焦,报告后聚焦区稳健的去重音与聚焦区时长和强度的增强,而聚焦区 F0 峰值升高仅为趋势,代价是朗读任务与合并信息性和纠正性窄聚焦限制了推广。

 · 更新于 2026-09-25 · 约 19 分钟 · 9419 字 阅读 →
论文解读

听不见反馈的声音怎么做识别:把马拉地语聋人语音映射到日常任务词表

针对标准马拉地语识别在聋人语音上接近失效的问题,论文用冻结编码器的迁移学习加日常任务词表约束,把词错误率从 97% 降到 64%,代价是仍高达 64% 且依赖单人小词汇后处理。

 · 更新于 2026-09-25 · 约 22 分钟 · 10762 字 阅读 →
论文解读

跳过转写直接做摘要:用句子向量把多语言语音送进法语摘要器

该研究把长语音切成片段并编码为与法语句向量对齐的语音片段向量,直接送入改造后的法语编码器解码器生成法语摘要,在呼叫中心对话和小规模跨语言合成语音上报告了与级联和音频大模型对照的可核对结果,但大模型对照为零样本且跨语言语音为合成。

 · 更新于 2026-09-25 · 约 19 分钟 · 9459 字 阅读 →
论文解读

提示词比性别更能改变播客节奏:NotebookLM 双人播客的语速与停顿实测

该研究以 51 个 NotebookLM 生成播客为样本,用发音率与言语率检验面向不同听众的提示词与说话人性别的影响,发现提示词对发音时长的预测力强于性别,而男女声在停顿使用上趋同但在播客尾段发音率上出现分化,代价是 diarization 存在幻觉且输入文本未做控制。

 · 更新于 2026-09-25 · 约 21 分钟 · 10156 字 阅读 →
论文解读

带口音的普通话还是整齐的音节节律吗:十地口音的连续统证据

该研究以十地带口音普通话自发独白为对象,用元音辅音区间节律指标加整体距离聚类,报告吴方言口音偏向重音定时、粤闽口音元音占比偏高、厦门口音与官话聚类相近,而节律距离不平行于词汇距离。

 · 更新于 2026-09-25 · 约 23 分钟 · 11285 字 阅读 →
论文解读

母语里没有的降升调,法国人就听不出:英语升调与降升调的辨别实验

该研究用 ABX 辨别任务比较法国人与美国人对英语升调与降升调的区分,显示法国人显著更差,支持语调对比也存在音系性耳聋,但美国母语人仅 79% 正确率说明频率与语境仍是重要限制。

 · 更新于 2026-09-25 · 约 16 分钟 · 7946 字 阅读 →
论文解读

年长者更容易被念偏的词启动:词汇表征稳固性下降的启动实证

该研究用长时重复启动范式比较青年与年长成人在最小语音偏离下的词汇激活,报告年长组出现偏离启动而青年组没有,支持稳固性下降解释,但未测量神经机制与日常听词代价。

 · 更新于 2026-09-25 · 约 16 分钟 · 7889 字 阅读 →