把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?
该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。
该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该研究用 20 人会话语料手工标注 6961 个/b/和 10844 个/v/并做持阻段声学比较,发现元音间/b/约 21% 实现为近音、全位置/v/约 38% 为近音且词内位置弱化率最高,个体层面两音弱化率正相关 r=0.7,但词频效应仅在女性中显著,支持处于规约化减弱而非已完成音位重组阶段。
该试点研究让 4 名学俄约半年的法语母语者朗读 40 个最小对立词,用时长、基频、强度和共振峰检验四个假设,报告显示重音实现强烈依赖音节位置且强度被当作位置标记误用,代价是样本仅 4 人且朗读任务受西里尔字母熟悉度干扰。
该研究用实时共振峰扰动范式检验目标元音/E/在/p/、/b/、/m/语境和高低掩蔽噪声下的听觉运动适应,发现被试总体发生补偿性适应但高噪声下/p/适应最大而低噪声下辅音效应消失且邻近元音出现整体扩张,代价是内部传导与外部扰动的不一致无法被完全掩蔽且低噪声下扰动失败率更高。
针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。
针对 MOCHA-TIMIT 文件名与内容不一致且缺乏统一音素与韵律标注的问题,作者用 Whisper 校对加人工质检加英式英语 MFA 强制对齐生成 8 层标注,在 msak0 和 fsew0 共 920 句人工标注上达到约 80.4%-80.5% 音素分类正确率与 14.0-15.9 毫秒边界平均误差,但 19.5% 残余混淆仍集中在元音长短、双元音与连 …
该研究用地图任务比较 5 名轻中度阿尔茨海默病女性与 5 名健康老年女性的意大利语元音共振峰,发现 F1 与 F3 存在组间差异并呈轻微元音空间扩张趋势,但样本仅 10 人且 FCR 差异不显著,不能作为确诊依据。
该研究在 VoxCeleb2 上系统改变 ResNet 的深度、宽度和残差块分布并用机器级传感器实测训练能耗与碳排放,最强证据是 ResNet-419-D 相对 ResNet-200-D 仅把平均 EER 从 3.44% 降到 3.35% 却耗电约 4 倍达 895.67 kWh,而中等规模的 ResNet-50-D 及其向中间层集中块的变体以约 50 …
针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。
针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。
针对清醒脑肿瘤手术中电刺激引起的短暂构音障碍难以实时听辨的问题,论文提出录音去噪加 Whisper 切分加 MFCC 加 GRU 的二分类方法,在计数与 DO80 任务上报告约 90% 以上验证精度,但合并任务出现过拟合且异常样本仍偏少。
该研究让 20 名未学过法语的普通话母语者用拼音自由转写法语 18 个 CV 塞音并做拟合度评分,显示法语浊塞音被稳定同化为普通话不送气塞音,而法语清塞音是否被听成送气取决于嗓音起始时间长短,代价是中间嗓音起始时间段出现大变异且元音与发音部位会系统改变判断。
该研究用唇圆展无发声收缩加视觉反馈与视觉模拟量表测量主观构音努力,35 人队列平均呈二次关系而个体函数形态与任务执行差异大,代价是孤立口面动作与仅用表面肌电表征生理努力限制了向连续言语的直接推广。
针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。
该研究以 20 名女性发音人的 73 词两遍朗读与四项声学指标追踪高低调域对立,显示低调域用气嗓音实现但青年组差异更小且维持时间更短,而仙居话的弱化速度慢于北部吴语,代价是只覆盖第三调类与女性样本且未报告基频主导程度的直接验证。
该研究用同一批句子在字面与反讽语境下诱发法语朗读并测量语速、基频与强度,报告两组均未出现稳定显著的反讽标记,个体策略差异大于诊断组间差异,代价是仅 10 人小样本与强语境消除了对韵律的依赖。
该研究以/papa/与/papi/中 V1 受 V2 影响的声学距离指数检验预期性 V 到 V 协同发音,发现老年人指数低于年轻人而双任务无显著影响,支持年龄相关资源下降假说而不支持本次双任务过载假说。
论文以法语为实验组、英语为对照组,用复述童话反派台词诱发嘎裂嗓,对比 H1-H2 与 H1*-H2* 与视听定性判断的一致性,报告校正量 H1*-H2* 在英语对照中达 89% 而在法语中仅 72% 且出现双向误判,因此不建议直接移植英语阈值。
该文把 CFPR 扩展为八类口音评测基准并做 87 人听辨实验,再用冻结的 MMS-LID-256 训练八分类器,报告在 CFPR 上整体准确率 40.98% 而人类多数投票为 70.4%,代价是中部与东部分类互相混淆且增强后大类反而下降。