论文解读

皮肤拉伸为何只让日本人更常听到长元音:体感与母语音位表征的配合

该研究以日语长短元音辨别任务检验口面部皮肤拉伸是否改变听觉判断,最强证据是体感条件下日本组报告长元音比例显著上升而法国组无显著变化,同时法国组心理测量函数斜率显著更平,代价是效应只在有该音位对比的母语者中显现且机制仍为解释性推测。

 · 更新于 2026-09-25 · 约 19 分钟 · 9343 字 阅读 →
论文解读

词尾 schwa 多出一个音节时,法语升调是换地方还是变形状

该研究追问词尾 schwa 形成额外音节时延续升调与对比降调如何重新对齐,利用 30 人 1078 个轮廓的已标注语料和 20 加 20 人的新产出实验,报告非南部延续调在 schwa 上掉调而南部保持上升、两地对比调都提前达峰后下降,并提议用次级关联保留非南部延续调的 H% 编码,代价是感知验证尚未完成。

 · 更新于 2026-09-25 · 约 19 分钟 · 9300 字 阅读 →
论文解读

不重建波形也能帮识别:在中间表示上练目标说话人提取

针对多人同时交谈的重叠语音识别问题,该工作在 AV-HuBERT 识别主路径之外并联一个在 FBank 特征层面重建目标与干扰的 AV-TSE 辅助任务,并在 MCoRec 开发集上把词错误率从 49.90% 降到 49.55%,代价是需要仿真混合数据提供干净特征监督且推理时不使用提取分支。

 · 更新于 2026-09-25 · 约 16 分钟 · 7630 字 阅读 →
论文解读

喊谁听得出来:距离感是否藏在呼唤的韵律里

该研究用 1.0 米、2.5 米、4.0 米三距离呼唤任务检验听者能否仅凭语音判断目标听者,最强证据是全听者准确率 0.702 与目标听者准确率 0.748 均高于 0.333 的随机水平,代价是样本仅 4 人且词相关差异机制尚未做声学分解。

 · 更新于 2026-09-25 · 约 18 分钟 · 8703 字 阅读 →
论文解读

定冠词更短吗:德语冠词边界时长如何标记已知与未知

该研究用德语朗读生产实验检验限定性是否为语言冗余因子,发现冠词前边界 B1 上定冠词显著短于不定冠词而冠词后 B2 无显著差异,且词频主效应不显著,但图片预熟悉可能抬高了可预测性这一代价限制了词频解释。

 · 更新于 2026-09-25 · 约 18 分钟 · 8737 字 阅读 →
论文解读

保留高维语音表示,只用一层分类器:KAN 为何比全连接更省且更稳

该工作以 XLS-R 高维表示为输入,对比单层全连接与单层 KAN 后端,在 21LA 上把聚合 EER 从 2.38% 降到 1.07%,代价是后端参数从 2.05k 增至 22.54k 但仍远小于主流系统,且在 FoR 等个别集上 KAN 并未取胜。

 · 更新于 2026-09-25 · 约 18 分钟 · 8844 字 阅读 →
论文解读

喊“大声点”与“用点意念”:帕金森说话人为何调不准用力刻度

该研究用同一句话在 50%、100%、200%、400% 四档用力下比较“大声”与“有意念”两种外部提示,报告显示提示间声学与感知差异很小而档位间差异显著,但 400% 用力反而平均强度与音高范围下降,代价是自然度与清晰度的权衡仍未解开。

 · 更新于 2026-09-25 · 约 17 分钟 · 8423 字 阅读 →
论文解读

声调语言里靠什么赢得演讲:普通话演讲比赛中的共振峰与音高策略

该研究以《我是演说家》48 名选手的 96 段 30 秒语音为样本,用九个韵律参数预测比赛名次,发现平均第三共振峰越高名次越好,女性则靠基频变化范围取胜,但整体预测力弱且只在开场显著。

 · 更新于 2026-09-25 · 约 16 分钟 · 7688 字 阅读 →
论文解读

只留韵律能听出精神分裂症谱系障碍吗:人类感知与机器分类的平行验证

该研究用自适应低通滤波去掉可懂语义后,比较 33 名评分者对 25 人语音的韵律判断与 108 个声学时序特征训练的逻辑回归分类器在 251 人数据上的表现,两者准确率均为 80.0%,代价是灵敏度中等且韵律标记与症状总分无显著关联。

 · 更新于 2026-09-25 · 约 17 分钟 · 8278 字 阅读 →
论文解读

听见介音需要多长时间:语速与音节结构如何塑造普通话/j/的时间累积

该研究用门限范式追踪普通话介音/j/的/i/感评分如何随声学片段增长而累积,显示门限、慢速、CGVX 结构和普通话母语组带来更高评分,而快速语速与 GVX 结构和日语初级组构成主要代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10370 字 阅读 →
论文解读

语速变慢就更清楚吗:还原程度不只由全局时长决定

该研究用德语三档自然语速与其 PSOLA 时长对齐版本做清晰度评分与 A/B 偏好实验,证明全局语速强烈预测清晰度但重音、有声段保持与元音频谱保持贡献独立方差,而线性伸缩不能复原自然缩减的分布。

 · 更新于 2026-09-25 · 约 20 分钟 · 9538 字 阅读 →
论文解读

可操控的全双工对话:在会说话的同时听懂指令与保住话轮

SteerDuplex 针对全双工语音模型可操控性不足,用 Moshi 骨干加针对性监督微调建立语气人设语速操控,再用两阶段连续性感知的混合奖励强化学习改善打断响应与暂停等待,代价是仍存在过早让出话轮与奖励钻空子的权衡。

 · 更新于 2026-09-25 · 约 21 分钟 · 10239 字 阅读 →
论文解读

照护语音不是统一变温柔:两组护理员用不同声学策略进入照护情境

论文以朗读为参照比较 50 名护理员在访谈与模拟照护中的音节级基频、能量、时长对比和元音离散度,用贝叶斯混合模型与 k-means 聚类报告了照护语音基频升高与超调制及两组个体策略分化,但能量区分弱、轮廓分离度仅中等且存在地域与朗读表现力的混杂。

 · 更新于 2026-09-25 · 约 20 分钟 · 9978 字 阅读 →
论文解读

在变调中找重音:北卡舒布语用同一词的不同读法分离时长与强度

论文以北卡舒布语名词变格中的重音位置变异为自然对照,用同一语音位置的重读与非重读元音比较检验时长、基频和强度,结果显示元音时长是主要声学相关物而强度作用较小且基频无显著作用,但分析只覆盖后元音并排除了词首词尾与短语重音条件。

 · 更新于 2026-09-25 · 约 20 分钟 · 9559 字 阅读 →
论文解读

哨音只剩一个频率时,元音靠高低区分、辅音藏在元音开头里

该研究以一名高级贝阿恩奥克语哨语者的隔离词哨音为对象,用中点哨音基频比较元音、用归一化三次多项式轮廓检验辅音发音部位的协同发音痕迹,显示元音库压缩为四类且齿龈语境系统性抬高元音起始段,而/i/对语境不敏感,但结论限于单人小样本探索。

 · 更新于 2026-09-25 · 约 26 分钟 · 12779 字 阅读 →
论文解读

说话人向量记得是谁,却也记住了房间:噪声、混响与修复如何重塑嵌入空间

该研究以 LibriTTS 子集与 LibriTTS-R 对照比较 X-Vector 与 ECAPA-TDNN 在加噪、混响、加静音与神经声码器重建下的嵌入空间结构,报告 ECAPA-TDNN 更稳健但强混响与音频修复仍使类间可分性与最近说话人分类明显下降,而 X-Vector 对环境伪影更敏感。

 · 更新于 2026-09-25 · 约 17 分钟 · 8298 字 阅读 →
论文解读

白语透镜下的普通话声调:早期双语儿童为何先会升调

该研究用图片命名诱发 196 个单音节词并以生长曲线与线性混合模型比较 18 名 4 至 7 岁白语儿童与 12 名北方成人基线,报告习得顺序为 T35 大于 T55 大于 T214 与 T51,代价是各年龄组时长系统性偏长且降调 T51 在三组中均未达成人轮廓。

 · 更新于 2026-09-25 · 约 17 分钟 · 8346 字 阅读 →
论文解读

粤语者为何更准分辨英语重音:把重音听成声调的两类同化解释

研究以双音节英语重音辨别与粤语声调同化任务检验知觉同化解释,粤语组辨别灵敏度显著高于英语组并把首末音节分别同化为 T1/T3 与 T4/T1 的两类对立,但证据限于无元音弱化的双音节词与行为选择数据。

 · 更新于 2026-09-25 · 约 21 分钟 · 10257 字 阅读 →
论文解读

弱元素也能被强调吗:天津话七类弱成分的整体抬高与各自封顶

该研究以 12 名天津话发音人的 5608 个语料比较无焦点与窄焦点下七类弱元素的基频,显示焦点主要做整体垂直抬升而不改变曲线形状,且只有词缀等四类能显著承接 prominence,而功能类与结构助词等则基本不扩展。

 · 更新于 2026-09-25 · 约 16 分钟 · 7688 字 阅读 →
论文解读

想让人想买,先让人感到愉悦:用知觉情绪约束合成广告语音

该研究比较有无知觉情绪中间约束的语音嵌入-购买意愿模型,用反向传播改写语音嵌入再做零样本合成,听评显示有约束语音在开放与封闭说话人上都显著提升购买意愿和愉悦感,但 arousal 未拉开差距且语速被推得过快时反而有害。

 · 更新于 2026-09-25 · 约 22 分钟 · 10640 字 阅读 →