英文题目:English Vowel Perceptual Training under Multitalker Babble: A Comparison of Humans and Large Language Models

会议身份:conference:interspeech:2026:conference-paper-id:dong26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #模型比较 #言语感知 #语音属性识别

评分:5.0/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Wenwei Dong:机构信息未能从会议 PDF 纯文本可靠映射
  • Alif Silpachai:机构信息未能从会议 PDF 纯文本可靠映射
  • Catia Cucchiarini:机构信息未能从会议 PDF 纯文本可靠映射
  • Helmer Strik:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务输入为安静与语音形噪声下美国英语单音节词音频,输出为/E/-/æ/与/eI/-/aI/两组元音对的二选一词选择,难点在于荷兰母语者对非母语元音对比在噪声下高度混淆,且最优多说话者babble人数难以用人因实验穷举。方法链分三步:先用荷兰听者完成前测-训练-后测的高变异语音训练,训练期叠加2人与6人babble且仅训练期给正误反馈,其输出的准确率变化作为人类基线进入下一步对比;再将相同刺激送入Wav2Vec2.0、Whisper-large-v3与Qwen2.5-Omni-7B,以强制对齐置信度、编辑距离选词或角色提示二选一模拟相同行为;最后新增安静与语音形噪声微调做匹配与失配对照,以检验跨噪声迁移。与仅在英语上预训练的Wav2Vec2.0相比,多语言大规模预训练被作者用来解释更鲁棒的声学语音表征,使微调主要强化通用声学生音知识而非特定噪声适配。在SSN测试集下,Qwen2.5-Omni-7B的准确率为75.00%,高于Wav2Vec2.0的准确率62.50%。结论仅适用于2种元音对、2人与6人babble及100试次短时在线训练,尚未验证更多说话人数、长训练与不同熟练度外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么要找最优 babble 人数

这篇论文的输入是英语单音节单词录音,目标是在二选一迫选中选出听到的词,核心对比是 /E/–/æ/ 与 /eI/–/aI/ 两组元音。学习者是母语为荷兰语的成人英语学习者,共 70 人,自评流利度均值 3.76,标准差 0.81,量表 1 为完全不流利,5 为非常流利。研究者关心的是感知训练阶段是否要在背景里加多人同时说话的 babble,以及加 2 人还是 6 人更有利。直接动机很具体:如果每次换一种 babble 人数都要另招一组学习者做完整前后测,时间与招募成本很高。

论文因此提出用神经模型先模拟,再把有效条件搬到计算机辅助语言学习系统。需要保留的关键信息是训练只给 100 个试次,前后测各 64 个试次,且前后测分别用不同说话人录制以避免记忆效应。

高变异语音训练 × 多人 babble: 高变异语音训练负责提供多个说话人、多个单词语境下的目标对比,让学习者形成可泛化的范畴;多人 babble 负责在训练音频背景中叠加 2 人或 6 人朗读混合声,制造可控的竞争听觉环境。二者搭配的理由是只在安静下练高变异可能无法迁移到噪声测试,而在 babble 下练高变异可以直接检验噪声中的范畴鲁棒性,组合意义是把泛化来源和抗噪来源分开考察。

安静训练不等于噪声测试能自动变好,这是全文反复检验的假设。作者明确指出已有噪声下感知训练的研究存在,但训练在噪声中是否优于安静训练,对第二语言音段感知仍证据有限且不清楚。也就是说,不能把在安静下能识别直接推广为在噪声下也能识别,也不能把在一种 babble 下的进步推广为所有噪声都进步。

前人已经比较过什么模型,为什么还要引入多语模型

前人路线包括用隐马尔可夫模型和基于 Kaldi 的深度信念网络声学模型模拟日本人听美国英语 /r/–/l/ 难度,以及模拟日语长短元音对日本人与美国人难易不同。另一条直接前作比较了时延神经网络与 Wav2Vec2.0 在安静和言语形噪声下的元音对辨别,发现 Wav2Vec2.0 在多人 babble 训练后有与学习者类似的提升。但该前作的模型主要用单语英语训练,且在言语形噪声下表现远差于人类。于是本文要回答三件事:多语模型能否像学习者一样从多人 babble 训练获益,哪个模型在元音对准确率提升上最像学习者,训练噪声与测试噪声匹配是否比用 babble 训练提升更大。

言语形噪声 × 多人 babble: 言语形噪声负责提供频谱形状像长时语音谱但无语言内容的稳态掩蔽,主要考验能量掩蔽下的声学分辨;多人 babble 负责提供可理解度随人数变化的语音掩蔽,同时包含能量掩蔽和信息掩蔽。二者搭配的理由是测试集同时设安静和言语形噪声条件,可以区分模型是只记住了特定 babble 纹理还是真正提升了元音范畴,组合意义是为训练与测试是否匹配提供对照基线。

言语形噪声在本研究中不是随意白噪声,而是由同一批 6 名美国英语说话人朗读《白牙》段落的 babble 导出频谱包络后生成的稳态噪声。训练用 babble 则是另一些说话人朗读《绿野仙踪》段落并混合而成,且不与测试或训练刺激说话人重叠。这种构造保证了掩蔽声与目标词在说话人上分离,避免模型或人类靠记住特定说话人嗓音作答。

与单语模型路线相比,多语路线的差异在哪里

同输入同目标下,前作的时延神经网络与 Wav2Vec2.0 已能模拟 babble 训练后的提升方向,但 Wav2Vec2.0 在言语形噪声下绝对值远低于人类,且只在英语上训练,可能不反映第二语言学习模式。本文的对照保持了同运行阶段,即都是预训练后加短期微调再测前后测,而不是从零训练,因而比较的是预训练表示加少量适应的效果。差异在于 Whisper 与 Qwen2.5-Omni-7B 见过多语与多环境数据,参数与数据多样性更大。结果上,安静集三者起点都高于或接近人类,但噪声集只有语音大语言模型接近人类。

这不支持把类别差异当同条件胜负:不能说大模型全面胜出,因为在安静集 Whisper 已触顶而增益为零,在噪声集 Wav2Vec2.0 与 Whisper 绝对值仍差。合理的读法是多语大模型在噪声鲁棒性上更像人类趋势,但机制是否相同未验证。

要测的三个问题如何对应到可执行的比较

第一个问题是多语模型能否获益,操作化为微调前后在安静测试集与言语形噪声测试集上的词选择准确率是否上升。第二个问题是谁最像人类,操作化为比较提升方向、6 人是否优于 2 人、以及噪声下绝对准确率与人类的距离。第三个问题是匹配训练是否更强,操作化为再加安静训练集和言语形噪声训练集两种微调条件,看同背景训练测试是否超过 babble 训练的增益。

所有比较都用词选择准确率作统一指标,人类是直接按键选择,模型则通过各自解码规则映射到同一二选一。论文没有承诺延迟、误判率或部署成本的改善,也没有测量这些量,解读时不能把准确率提升读成系统更快或更省。

从一段音频到一次二选一,整体流程如何走通

先沿一个样本走完全程。输入是一段美国人读的单音节目标词录音,同时给定两个文字选项,例如包含 /E/ 与 /æ/ 的最小对立词。人类被试听完后按二选一按键,训练阶段会得到正误反馈,前后测不给反馈且前后测说话人与训练熟悉化说话人都不同。对模型而言,同一段音频进入各自系统后必须输出两个选项之一,才好与人类准确率并排比较。Whisper 先做自动语音识别得到转写文本,再分别计算转写与两个选项的字符级编辑距离,距离小者为模型答案。

语音大语言模型则把音频加两个选项一起写进提示,要求模型扮演母语为荷兰语的英语学习者并选出听到的词,直接输出选择。Wav2Vec2.0 沿用前作做法,用强制对齐置信度比较两个词假设与音频的匹配度,分高者为答案。

Whisper × 语音大语言模型: Whisper 负责把整句语音直接转写为文字,再用编辑距离映射到二选一单词,体现大规模弱监督多语识别路径;语音大语言模型 Qwen2.5-Omni-7B 负责接收音频加两个文字选项的提示并直接选择听到的词,体现把听觉输入与语言指令联合建模的路径。二者搭配的理由是同为多语预训练但接口不同,可以比较转写加距离打分与指令式选择的差异,组合意义是检验哪种多语建模方式在噪声下更接近人类学习者的错误模式。

数据集划分是固定的:前后测各 64 试次,拆成两个小测验各 32 试次,对应 8 词乘 4 元音;训练阶段 100 试次,对应 25 词乘 4 元音。前测用 1 男 1 女录制,后测换另外 1 男 1 女录制。训练背景有 4 种:2 人 babble、6 人 babble、安静、言语形噪声,但人类只做前两种,模型 4 种都做。熟悉化阶段在前测前和训练前各有 12 试次,3 词乘 4 元音,安静背景,说话人与正式集不重叠。

三个模型的打分与选择规则各自分工是什么

Wav2Vec2.0 用的是 Huggingface 的 wav2vec2-base-960h,在 Librispeech 960 小时上预训练。它的选择不靠直接分类,而是靠对齐打分:对同一段音频分别与正确词和错误词做强制对齐,得到置信度,置信度高的一端记为选对。这种做法把序列识别问题转成可比的二选一,但也意味着它的分数依赖对齐工具的实现细节,原文引用了 torchaudio 相关流程。Whisper 用的是 whisper-large-v3,预训练数据量级为 5,000,000 小时,支持 99 种以上语言。它的分工是先转写后比距离,编辑距离定义为把一个字符串变为另一个所需的最少字符插入、删除、替换次数,距离小者胜出。

这种规则对短单音节词很敏感,一个字母差就会改变选择。语音大语言模型用的是 Qwen2.5-Omni-7B,多模态输入,可接受文本、图像、语音和视频。它的分工是把角色设定、任务说明、音频和两个选项一起交给模型,让模型直接作答,避免了外部距离计算。

Wav2Vec2.0 × 强制对齐置信度: Wav2Vec2.0 负责对输入语音提取自监督声学表示并经微调输出字符序列假设;强制对齐置信度负责衡量同一段录音与正确词和错误词两个文本假设的匹配程度,分高者视为模型选择。二者搭配的理由是该模型不直接输出二选一,需要一个与人类二选一迫选可比的打分规则,组合意义是把开放识别转化为与人类相同的两词选择准确率。

理解这 3 种映射很关键:同样的准确率数字背后是不同决策路径。Whisper 的错误可能来自识别错一个音素后距离判错,Wav2Vec2.0 的错误可能来自对齐置信度对噪声更敏感,语音大语言模型的错误则包含指令跟随与听觉判断的混合。因此不能把准确率相同直接读成感知机制相同。

模型如何微调,人类如何训练,更新量是否可比

人类的训练是高变异语音训练,在线完成,前测训练后测设计,训练阶段给正确性反馈,前后测不给反馈。35 人随机分到 2 人 babble 组,另 35 人分到 6 人 babble 组,每人刺激顺序随机。模型的训练对应微调:先用预训练模型测前后测集,再用 4 种训练条件分别微调,再测微调后前后测集。Wav2Vec2.0 用联接时序分类损失,较低学习率,2 轮。Whisper 同样较低学习率,2 轮。语音大语言模型用低秩适配,只训练新加的小低秩矩阵,冻结原始参数,以减少计算与显存,同样是面向目标任务的短期特化。

低秩适配 × 联接时序分类损失: 低秩适配负责冻结语音大语言模型原始参数,只训练新加入的小低秩矩阵,实现参数高效微调;联接时序分类损失负责在 Wav2Vec2.0 微调时处理语音帧与字符标签未对齐问题,给出序列级监督。二者搭配的理由是不同模型结构需要不同的高效或对齐适配手段,但都只用 2 轮小学习率微调以模拟短时感知训练,组合意义是让人类的 1 次训练阶段对应模型的有限更新量。

原文没有给出具体学习率数值、优化器类型、批量大小、随机种子与硬件预算,也没有说明是否冻结 Whisper 或 Wav2Vec2.0 的编码器层。这些是复现缺项,不能从模型名字推定实现。能确定的是微调轮数都控制为 2,意图是模拟人类短时训练而非充分收敛。梯度路径方面,原文只明确了损失类型与参数高效方式,未报告逐层梯度或停止梯度细节,因此不能猜测哪一层学到了元音范畴。

没有训练人类新模型时,这节的计算到底是什么

本研究没有从零训练任何声学模型,训练一词在这里只指两件事:人类的感知训练过程与模型的微调过程。人类的计算是听辨决策加反馈修正,重复 100 次后检验范畴边界是否移动。模型的计算是已有预训练权重上的少量梯度更新,Wav2Vec2.0 靠联接时序分类损失对齐字符,Whisper 靠原识别目标继续适配,语音大语言模型靠低秩矩阵更新适配指令选择。推理时没有搜索最优或 oracle 重打分,都是单次前向得到答案后按规则映射,不存在事后最优值替代可部署收益的问题。若把无训练误读为确定性求解是错误的:即使冻结主参数,解码采样与提示措辞仍可能带来波动,原文未报告方差,因此不能承诺稳定性。

测试集、背景噪声与统计方法如何保证条件一致

测试背景只有两种:安静与言语形噪声。人类在前后测都做这两种背景,模型微调前后也都测这两种背景。人类为避免记忆效应,前测只用前测集,后测只用后测集;模型则前后测集都可测,论文用两套测试集平均准确率与人类比较。这个聚合口径差异必须记住:人类数字是单集前后对比,模型数字是双集平均后对比,数值相同不代表同一指标。

人类结果用线性混合效应模型检验,报告了元音、前后测与背景交互的显著性,事后比较说明 /eI/–/aI/ 显著高于 /E/–/æ/,安静显著高于噪声,只有噪声下前后测提升显著。训练条件 2 人与 6 人 babble 无显著主效应,这是理解后文 6 人数值更高但统计不显著的关键。指标方向是准确率越高越好,增益用训练后减训练前,单位为百分点,不是相对百分比。

数字背后的单位与聚合如何核对才不混淆

所有准确率都是百分比,增益都是百分点相减,不是相对百分比。例如人类噪声下 82.32% 到 85.76% 的差是 3.44 个百分点,不能说成提升 3.44%。平均准确率的聚合对象要分清:有人类前后测平均、模型前后测集平均、两元音对总平均。原文用 AVI 表示前后测集平均提升,TAVI 表示两元音对总平均提升,Avg 表示前后测集平均准确率。同一数值出现在不同表可能指不同聚合,不能仅因数字相同就认定同一指标。核对时要同时确认数据集、前后测阶段、模型或人群、背景、元音对与聚合方式六项,缺一项就不能并排比较。

babble 训练后谁进步了,谁在噪声下更接近人类

先看安静测试下训练前的起点差异,这决定了后文天花板效应的解释。下表整理安静测试中两组元音训练前的平均准确率,比较问题是起点是否已很高以致难再提升,公平条件是都用预训练模型或人类前测,指标方向为准确率越高越好。

测试背景元音对比L2 听者训练前Wav2Vec2.0 训练前Whisper 训练前
安静/E/–/æ/83.30%84.37%93.75%
安静/eI/–/aI/97.86%96.87%100%

表中 L2 听者与 Wav2Vec2.0 在/E/–/æ/上起点相近且低于/eI/–/aI/,Whisper 在两组上都最高甚至超过人类,语音大语言模型则两组都是 87.50%,为最低。

表后解释是这种起点差异带来天花板效应:人类、Wav2Vec2.0 与 Whisper 在安静下已接近上限,留给 babble 训练的提升空间小,这可以解释为何语音大语言模型反而显示更大增益。训练后安静集上人类 6 人组平均提升 2.59% 但前后测差异不显著,Wav2Vec2.0 仅在 2 人组提升 4.68%,语音大语言模型在 2 人与 6 人组分别提升 4.68% 与 3.12%。未胜出项是 Whisper 在安静集上 2 人与 6 人组增益均为 0.00%,并非模型退化,而是起点已在满分附近。 再看噪声测试,这是本文最看重的对照。

下表比较言语形噪声下 6 人 babble 训练后的绝对水平与整体前后测增益,比较问题是在更难的掩蔽下谁的绝对值与人类距离最小,公平条件是同为噪声测试,指标仍为准确率越高越好。

测试背景元音对比L2 听者 6 人组训练后语音大模型最高平均整体前后测增益
言语形噪声/E/–/æ/80.89%78.12%3.44%
言语形噪声/eI/–/aI/93.21%90.62%85.76%

表中人类在噪声下两组分别为 80.89% 与 93.21%,语音大语言模型最高平均为 78.12% 与 90.62%,距离人类最近,而 Wav2Vec2.0 与 Whisper 平均都低于 70%。

表后需要同时说明收益与代价:收益是人类与所有模型在噪声下都从 6 人训练获益大于 2 人训练,且人类整体在噪声下从 82.32% 提升到 85.76%,对应提升为 3.44%,安静下无显著提升;代价是模型即使提升,Wav2Vec2.0 与 Whisper 在噪声下的绝对值仍远低于人类,只有语音大语言模型保持在 75% 上下,与人类随背景变难而下降但仍可辨的模式更一致。

三个研究问题各自得到什么证据等级的回答

第一个问题报告为多语模型能从多人 babble 训练获益,证据是语音大语言模型在安静与噪声下都有正增益,Whisper 在噪声下也有增益。第二个问题报告为语音大语言模型最像人类,证据是提升趋势同为 6 人大于 2 人,且噪声下绝对值最接近人类,而 Whisper 与 Wav2Vec2.0 在噪声下低于 60% 起点且绝对值差距大。第三个问题报告为匹配噪声训练增益更大,证据仅来自模型对照,人类未做该条件,因此不能写成人类也一定如此。所有回答都要加限制:人类 6 人优于 2 人数值上成立但统计不显著,安静集多组触顶,噪声集小模型绝对值仍远差。总体趋势不等于每组每步都成立,例如 Wav2Vec2.0 在安静训练后噪声测试反而下降,就是明确反例。

换成安静或噪声训练,匹配条件是否比 babble 更强

这个对照只有模型参与,人类没有做,因此不能直接推广到人类。安静测试中,所有模型在安静训练后都有提升,语音大语言模型平均提升 4.68 个百分点为最大;用言语形噪声训练时,只有语音大语言模型在安静测试上平均提升 9.37 个百分点。噪声测试中,用安静训练时 Wav2Vec2.0 平均下降 7.81 个百分点,Whisper 提升 6.25 个百分点,语音大语言模型提升 9.37 个百分点;用噪声训练时三者都提升,Whisper 平均提升最大。

论文据此回答第三个问题:Whisper 与语音大语言模型在训练测试噪声匹配时,元音对增益大于用 babble 训练。反证是 Wav2Vec2.0 在噪声测试下只从噪声训练获益,安静训练反而降分,说明小模型更依赖条件特异调整,泛化能力弱。作者的有限解释是,大规模多语预训练带来更鲁棒的声学语音表示,微调主要强化通用声学语音知识而非适配特定噪声,因而能跨安静与噪声迁移;这属于支持性解释,不是因果证明,待验证。

哪些边界没有测,哪些推论不能做

第一,人类只做了 2 人与 6 人两种 babble,各 100 个训练试次,没有测试更多人数或更长训练,论文明确说可能低估了训练潜力。第二,没有按 proficiency 分组,尽管不同水平学习者表现可能不同,平均数可能掩盖分组趋势。第三,人类训练条件无显著效应,6 人数值更高不能读成 6 人显著更优。第四,模型与人类聚合口径不同,模型是前后测集平均,人类是前后分集,不能把小数点后差异当成严格胜负。第五,资源状态方面,本次可核对的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。生成式人工智能使用声明仅为语法拼写检查,未用于生成科学内容或分析。

还需补哪项验证才能用于教学系统

若要把结论搬到计算机辅助语言学习系统,还缺三项验证。一是人类匹配噪声训练对照,即让一组学习者直接在言语形噪声或安静下训练,再与 babble 组比较,否则模型上的匹配更优不能直接指导教学。二是按水平分组与延长训练,检验初学者与高水平者是否都需要 6 人 babble,还是不同起点需要不同人数。三是泛化到新词新说话人的保持测试,原文前后测已换说话人,但仍需延迟后测以区分短时适应与范畴学习。

在这些补齐前,何时值得尝试的回答是:当目标是噪声下元音辨别且已有前后测集时,可先用语音大语言模型筛选候选 babble 人数与训练量,再小规模招募验证,不把模型排序直接当成教学定论。

要复述方法,先固定哪几件不可变的事

先固定刺激与划分:目标为美国人读的单音节词中 /E/–/æ/ 与 /eI/–/aI/,前后测各 64 试次,训练 100 试次,前后测说话人分别为 2 对 1 男 1 女,熟悉化 12 试次说话人独立。训练 babble 用《绿野仙踪》朗读混合,测试用言语形噪声由《白牙》朗读的 6 人 babble 导出,两批说话人不重叠。再固定任务:人类二选一迫选,训练给反馈,前后测不给反馈,每人顺序随机;模型必须映射到同一二选一,Whisper 用字符级编辑距离选小者,Wav2Vec2.0 用强制对齐置信度选高者,语音大语言模型用提示直接选择并设定为荷兰母语英语学习者角色。

微调固定为低学习率 2 轮,语音大语言模型用低秩适配冻结主参数。评估固定为词选择准确率,模型取前后测集平均,人类取前后分集,比较时保留百分点口径。缺失的具体学习率、优化器、批量与种子需要补记实验日志才能算完整复现。

复现清单与可运行策略的最小集合

最小可运行集合包括 4 种训练背景各 100 条的音频混合脚本、固定前后测表、3 种模型的映射代码与 2 轮微调脚本。基线必须保留预训练未微调的成绩,否则无法计算增益。比较对象必须保留实际可运行的 2 人与 6 人 babble 微调,而不是只报最优值。需要记录随机种子、学习率、批量、解码温度与提示全文,因为语音大语言模型的指令措辞会改变选择。统计部分复现人类需用线性混合效应模型检验元音、前后测与背景交互,并做事后比较,不能只比均值。若资源不可达,应明确写本次未能确认可达,不虚构下载链接。

给新生的结论:记住什么,忘掉什么

记住任务定义:二选一元音辨别,前后测换说话人,训练给反馈,指标是词选择准确率。记住关键对照:安静起点高会有天花板,噪声下人类与模型都下降,但只有语音大语言模型下降后仍贴近人类。记住方法映射:Whisper 靠转写加编辑距离,Wav2Vec2.0 靠对齐置信度,语音大语言模型靠提示直接选,3 种分数不可混为一谈。忘掉营销式判断:没有证据说大模型已替代人类被试,没有证据说 6 人一定显著最优,没有证据说匹配训练对人类也最优。下一步若要复现,先重跑预训练基线与 2 轮微调的增益,再补人类匹配噪声组与分组分析,用百分点报告并注明聚合口径。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总