论文解读

把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?

该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8711 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

法语浊唇阻塞音是变懒了还是正在音变:从/b/与/v/的近音化看弱化起点

该研究用 20 人会话语料手工标注 6961 个/b/和 10844 个/v/并做持阻段声学比较,发现元音间/b/约 21% 实现为近音、全位置/v/约 38% 为近音且词内位置弱化率最高,个体层面两音弱化率正相关 r=0.7,但词频效应仅在女性中显著,支持处于规约化减弱而非已完成音位重组阶段。

 · 更新于 2026-09-24 · 约 21 分钟 · 10217 字 阅读 →
论文解读

重音位置决定成败:法语初学者俄语词重音为何首音节偏强、弱化元音分不清

该试点研究让 4 名学俄约半年的法语母语者朗读 40 个最小对立词,用时长、基频、强度和共振峰检验四个假设,报告显示重音实现强烈依赖音节位置且强度被当作位置标记误用,代价是样本仅 4 人且朗读任务受西里尔字母熟悉度干扰。

 · 更新于 2026-09-24 · 约 21 分钟 · 10090 字 阅读 →
论文解读

听觉反馈不一致时口腔如何调整:辅音语境与掩蔽噪声共同塑造元音适应

该研究用实时共振峰扰动范式检验目标元音/E/在/p/、/b/、/m/语境和高低掩蔽噪声下的听觉运动适应,发现被试总体发生补偿性适应但高噪声下/p/适应最大而低噪声下辅音效应消失且邻近元音出现整体扩张,代价是内部传导与外部扰动的不一致无法被完全掩蔽且低噪声下扰动失败率更高。

 · 更新于 2026-09-24 · 约 19 分钟 · 9088 字 阅读 →
论文解读

用无标注空管语音改造 Whisper 编码器:BEARD 为何要把自监督放在中间层并用蒸馏拴住解码器

针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。

 · 更新于 2026-09-24 · 约 18 分钟 · 8619 字 阅读 →
论文解读

文件名对不上内容、全员标注缺失:把 MOCHA-TIMIT 九个说话人重新对齐

针对 MOCHA-TIMIT 文件名与内容不一致且缺乏统一音素与韵律标注的问题,作者用 Whisper 校对加人工质检加英式英语 MFA 强制对齐生成 8 层标注,在 msak0 和 fsew0 共 920 句人工标注上达到约 80.4%-80.5% 音素分类正确率与 14.0-15.9 毫秒边界平均误差,但 19.5% 残余混淆仍集中在元音长短、双元音与连 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9942 字 阅读 →
论文解读

阿尔茨海默病是元音更集中还是更夸张:半控制地图任务下的 F1 与 F3 证据

该研究用地图任务比较 5 名轻中度阿尔茨海默病女性与 5 名健康老年女性的意大利语元音共振峰,发现 F1 与 F3 存在组间差异并呈轻微元音空间扩张趋势,但样本仅 10 人且 FCR 差异不显著,不能作为确诊依据。

 · 更新于 2026-09-24 · 约 21 分钟 · 10078 字 阅读 →
论文解读

把 ResNet 做大做宽之后,说话人验证的误差降了多少,能耗又涨了多少

该研究在 VoxCeleb2 上系统改变 ResNet 的深度、宽度和残差块分布并用机器级传感器实测训练能耗与碳排放,最强证据是 ResNet-419-D 相对 ResNet-200-D 仅把平均 EER 从 3.44% 降到 3.35% 却耗电约 4 倍达 895.67 kWh,而中等规模的 ResNet-50-D 及其向中间层集中块的变体以约 50 …

 · 更新于 2026-09-24 · 约 15 分钟 · 7451 字 阅读 →
论文解读

合成儿童语音该放在哪一步:只做自监督预训练才增益的儿童语音识别

针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。

 · 更新于 2026-09-24 · 约 16 分钟 · 7789 字 阅读 →
论文解读

大模型造数据、小模型干活:库尔德语低资源语音识别的节俭路线

针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
论文解读

在手术室里听出细微口吃:用 GRU 把脑刺激引起的言语障碍自动分成正常与异常

针对清醒脑肿瘤手术中电刺激引起的短暂构音障碍难以实时听辨的问题,论文提出录音去噪加 Whisper 切分加 MFCC 加 GRU 的二分类方法,在计数与 DO80 任务上报告约 90% 以上验证精度,但合并任务出现过拟合且异常样本仍偏少。

 · 更新于 2026-09-24 · 约 17 分钟 · 8478 字 阅读 →
论文解读

浊音去哪了:普通话听者用送气与否重新划分法语塞音

该研究让 20 名未学过法语的普通话母语者用拼音自由转写法语 18 个 CV 塞音并做拟合度评分,显示法语浊塞音被稳定同化为普通话不送气塞音,而法语清塞音是否被听成送气取决于嗓音起始时间长短,代价是中间嗓音起始时间段出现大变异且元音与发音部位会系统改变判断。

 · 更新于 2026-09-24 · 约 22 分钟 · 10788 字 阅读 →
论文解读

唇部收缩多少与感觉费力多少:构音努力自评的测量方法与个体差异

该研究用唇圆展无发声收缩加视觉反馈与视觉模拟量表测量主观构音努力,35 人队列平均呈二次关系而个体函数形态与任务执行差异大,代价是孤立口面动作与仅用表面肌电表征生理努力限制了向连续言语的直接推广。

 · 更新于 2026-09-24 · 约 22 分钟 · 10712 字 阅读 →
论文解读

只有 32 小时班巴拉语数据时,把解码器对折而不砍掉

针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9131 字 阅读 →
论文解读

仙居话低调域的气嗓音能维持多久:老年组到韵尾与青年组退到韵腹的对照

该研究以 20 名女性发音人的 73 词两遍朗读与四项声学指标追踪高低调域对立,显示低调域用气嗓音实现但青年组差异更小且维持时间更短,而仙居话的弱化速度慢于北部吴语,代价是只覆盖第三调类与女性样本且未报告基频主导程度的直接验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9554 字 阅读 →
论文解读

反讽没有单一声音:自闭症成人与神经典型成人的产出为何都偏离原型

该研究用同一批句子在字面与反讽语境下诱发法语朗读并测量语速、基频与强度,报告两组均未出现稳定显著的反讽标记,个体策略差异大于诊断组间差异,代价是仅 10 人小样本与强语境消除了对韵律的依赖。

 · 更新于 2026-09-24 · 约 20 分钟 · 9642 字 阅读 →
论文解读

提前发出下一个元音有多难:年龄减少了元音间预期协同发音,双任务却没有

该研究以/papa/与/papi/中 V1 受 V2 影响的声学距离指数检验预期性 V 到 V 协同发音,发现老年人指数低于年轻人而双任务无显著影响,支持年龄相关资源下降假说而不支持本次双任务过载假说。

 · 更新于 2026-09-24 · 约 18 分钟 · 8701 字 阅读 →
论文解读

法语嘎裂嗓能量化吗:H1-H2 与 H1\*-H2\* 在法英复述任务中的对照检验

论文以法语为实验组、英语为对照组,用复述童话反派台词诱发嘎裂嗓,对比 H1-H2 与 H1*-H2* 与视听定性判断的一致性,报告校正量 H1*-H2* 在英语对照中达 89% 而在法语中仅 72% 且出现双向误判,因此不建议直接移植英语阈值。

 · 更新于 2026-09-24 · 约 17 分钟 · 8499 字 阅读 →
论文解读

八类法语口音为何难分:小而偏的训练集与人类听辨上限共同设限

该文把 CFPR 扩展为八类口音评测基准并做 87 人听辨实验,再用冻结的 MMS-LID-256 训练八分类器,报告在 CFPR 上整体准确率 40.98% 而人类多数投票为 70.4%,代价是中部与东部分类互相混淆且增强后大类反而下降。

 · 更新于 2026-09-24 · 约 20 分钟 · 9907 字 阅读 →