每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

记住同一条船:UniqueShip 用船舶身份隔离重测水下舰船分类

针对随机切分让同一艘船同时出现在训练与测试导致虚高的问题,UniqueShip 按 MMSI 隔离船舶、按天隔离背景构建 2460 小时船舶音频与 4218 艘船的基准,最强 Swin 加 Mel 基线在无泄漏下准确率为 0.665,而引入泄漏可抬高 0.08-0.21,且船数翻倍增益 2.4-2.6 点约为时长翻倍 0.8-1.3 点的两到三倍。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
论文解读

法语浊唇阻塞音是变懒了还是正在音变:从/b/与/v/的近音化看弱化起点

该研究用 20 人会话语料手工标注 6961 个/b/和 10844 个/v/并做持阻段声学比较,发现元音间/b/约 21% 实现为近音、全位置/v/约 38% 为近音且词内位置弱化率最高,个体层面两音弱化率正相关 r=0.7,但词频效应仅在女性中显著,支持处于规约化减弱而非已完成音位重组阶段。

 · 更新于 2026-09-24 · 约 21 分钟 · 10217 字 阅读 →
论文解读

对不准音高时如何跟谱:用演奏法识别补齐对齐式跟谱

针对混合音乐中扩展长笛技法难以只靠音高对齐跟谱的问题,论文把 Antescofo 的对齐机与轻量识别器 ipt~做松耦合混合切换,在 11 类技法上报告宏 F1 为 93.4%±0.1,但混合跟谱以增加延迟为代价换取跨演奏的稳定性。

 · 更新于 2026-09-24 · 约 24 分钟 · 11734 字 阅读 →
论文解读

突出时听者为何反而少用频谱线索:英语紧松元音感知的产生镜像

本研究用 7×7×2 重合成 hid-heed 连续体检验 f0 突显如何改变频谱与时长线索权重,结果显示突显使频谱斜率变平而时长稳定,支持产生镜像而非全局增强,但三阶交互与设计差异仍限制推广。

 · 更新于 2026-09-24 · 约 22 分钟 · 10592 字 阅读 →
论文解读

发得出却听不出:粤语 T2-T5 近合并如何被最小对比例稳住

论文以粤语上升调 T2-T5 为对象,用发音与感知分离的样例模型证明最小对比例决定生产端平衡距离,而感知端随功能负荷下降更快塌缩,零负荷时走向完全合并,代价是一维基频目标与理想化词库的简化。

 · 更新于 2026-09-24 · 约 20 分钟 · 9780 字 阅读 →
论文解读

声学没变好、词汇却在接管:普通话儿童声调加工从独立到权衡

该研究用普通话一声到二声的 Ganong 任务追踪 1 到 6 年级儿童与成人,发现声学语音加工与词汇依赖各自从一年级起保持稳定,但二者关系在 12 岁左右才从独立转为成人式的此消彼长的权衡,且高语文水平是出现权衡的条件,代价是低水平儿童尚无此策略性补偿。

 · 更新于 2026-09-24 · 约 18 分钟 · 8946 字 阅读 →
论文解读

声调是否藏在第一共振峰里:普通话与西安话双元音上的时间耦合检验

该研究以普通话与西安话双元音为对象,用广义加性混合模型分离声调贡献并比较基频与第一共振峰极值对齐,再用函数主成分加随机森林只看第一共振峰预测四声,最强证据是跨说话人分类达到普通话 49% 与西安话 43%,代价是只覆盖两个双元音且未直接观测发音运动。

 · 更新于 2026-09-24 · 约 17 分钟 · 8354 字 阅读 →
论文解读

同一个 53 调形,为何低水平粤语者把普通话一声听宽了

论文用普通话 55 到 51 连续体上的辨认与区分任务检验粤语母语音系规则对跨语言声调感知的影响,最强证据是低普通话水平组边界左移变宽而高水平组接近北京对照组,代价是该结论依赖特定连续体与三组被试条件且未验证生产与泛化。

 · 更新于 2026-09-24 · 约 20 分钟 · 9965 字 阅读 →
论文解读

二语模仿是绕过音系的语音模仿吗:一次打断语音模式的直接检验

该研究用两次模仿之间插入元音归类任务是否拉大声学差异来检验二语模仿能否走自动选择性知觉模型的语音模式,预备结果显示组间无显著差异且出现与元音相关的变化模式,不支持语音模式解释并提示音系表征仍在起作用,但样本小、试次损失大导致统计力不足。

 · 更新于 2026-09-24 · 约 20 分钟 · 9728 字 阅读 →
论文解读

声调难量化:连续表征记得住声调,离散单元却偏向音素

论文以普通话和约鲁巴语为对象,用探针分类证明自监督隐变量同时编码音素与声调而 K 均值等离散化更伤声调,并显示残差式多级量化能部分挽回声调但仍不及连续基线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9295 字 阅读 →
论文解读

用长语境找韵律:从 YouTube 检索到 wav2vec2 二选一的韵律最小对基准

论文用长字符串检索条件化短串韵律以免除逐条标注,构建四个韵律最小对基准并微调 wav2vec2-base 做二选一分类,在各自验证集上报告均超 90% 但存在音频重复导致偏高估计的代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9555 字 阅读 →
论文解读

不预设几类声调:用函数型主成分加非参数聚类重看开封话低调

针对开封话低调变体靠专家看图分类、难以刻画动态的问题,论文用函数型主成分分析提取基频曲线动态再用狄利克雷过程高斯混合做不定类数聚类,在 456 个低调音节上得到下降、凹降、上升三类,并以广义加性混合模型回放验证,其中下降类占 284 例为多数而上升类是前人未报告的新发现。

 · 更新于 2026-09-24 · 约 23 分钟 · 11518 字 阅读 →
论文解读

在节日广场上听懂口哨话:缺失数据随时间爬升时还能怎么谈识别率

该研究把同一套 10 题口哨语四选一听辨任务分别放在户外节日与两间教室施测,用缺失率与正确率随题序的回归斜率加 bootstrap 推断比较情境效应,最强证据是户外组缺失率显著随时间上升而教室组证据不足,代价是户外组词汇题正确率多在随机水平之下且样本与环境混杂无法分离。

 · 更新于 2026-09-24 · 约 20 分钟 · 9605 字 阅读 →
论文解读

听得准的人一定说得清吗:普通话问句与陈述语调的感知与产出关联

该研究用 16 人录音与 8 名女性回访的二选一辨认任务检验普通话问句与陈述语调的感知产出关系,发现听自己更准、刺激中韵律区分度越大越好辨认,但听者自身区分度的作用只体现在问句与陈述的不对称偏移上且受声调制约。

 · 更新于 2026-09-24 · 约 17 分钟 · 8484 字 阅读 →
论文解读

皮肤拉伸为何只让日本人更常听到长元音:体感与母语音位表征的配合

该研究以日语长短元音辨别任务检验口面部皮肤拉伸是否改变听觉判断,最强证据是体感条件下日本组报告长元音比例显著上升而法国组无显著变化,同时法国组心理测量函数斜率显著更平,代价是效应只在有该音位对比的母语者中显现且机制仍为解释性推测。

 · 更新于 2026-09-24 · 约 19 分钟 · 9343 字 阅读 →
论文解读

粤语者为何更准分辨英语重音:把重音听成声调的两类同化解释

研究以双音节英语重音辨别与粤语声调同化任务检验知觉同化解释,粤语组辨别灵敏度显著高于英语组并把首末音节分别同化为 T1/T3 与 T4/T1 的两类对立,但证据限于无元音弱化的双音节词与行为选择数据。

 · 更新于 2026-09-24 · 约 21 分钟 · 10257 字 阅读 →
论文解读

从文本到手脸编码:用法语补唇语钥匙数量给阅读材料排难度

该研究用自动标注从 200 篇儿童文本中抽出 129608 个法语补唇语钥匙并统计 10 个音位变量,为按学习复杂度挑选视频胶囊提出可复算的排序依据,但尚未完成聋人学习者验证。

 · 更新于 2026-09-24 · 约 16 分钟 · 7905 字 阅读 →
论文解读

标签不够时让模型自己补课:伪标签与同属平滑的蝙蝠叫声识别

针对蝙蝠被动声学监测中标注稀缺问题,论文固定紧凑 BAT 骨干比较半监督路线与目标构造,报告伪标签在欧洲十分之一标签下闭合至多 61.5% 全监督差距并迁移到南非野外录音,同属加均匀平滑再提升物种宏 F1 达 4.73 个百分点。

 · 更新于 2026-09-24 · 约 17 分钟 · 8352 字 阅读 →