英文题目:Deep learning-based predictions of perceived listening effort and intelligibility across enhanced, synthetic, natural, and binaural speech
会议身份:
conference:interspeech:2026:conference-paper-id:hoffner26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#助听器 #知识蒸馏 #言语感知 #语音可懂度评估
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Dirk Eike Hoffner:机构信息未能从会议 PDF 纯文本可靠映射
- Hartmut Schoon:机构信息未能从会议 PDF 纯文本可靠映射
- Rainer Huber:机构信息未能从会议 PDF 纯文本可靠映射
- Jan Rennies:机构信息未能从会议 PDF 纯文本可靠映射
- Bernd T. Meyer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为含噪、增强、合成与双耳空间语音,输出为言语可懂度与感知听力努力的客观预测,难点在于无干净参考时兼顾空间释放掩蔽、增强失真与合成语音的感知差异。方法链第一步由前馈神经网络估计帧级三音素后验并以其不确定性表征识别退化,舍弃隐马尔可夫转录级后进入聚合。第二步由预训练WavLM-Large提取波形表征并结合听力图经双向长短时记忆网络与多头注意力,以教师学生范式回归听觉感知指标。第三步在独立听力努力集上学习线性映射到听力量表,并经心理测量函数拟合估计言语识别阈,再以较优耳策略选取双耳通道中数值较高的一侧输出。相对短时客观可懂度与听觉感知指标等侵入式方法的机制差异在于两者均无需干净参考,仅从后验分散或蒸馏感知指标推断感知,故可用于真实单端场景。在增强语音听力努力任务下,HASA-Net+的相关系数指标为0.98,高于PHOBI的相关系数指标0.94。结论限于正常听力德语与英语句测试、特定噪声与房间条件,对听损人群与重度混响的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留什么?
本文的输入是处理后或含噪的语音波形,目标是预测人的两个主观量。第一个量是言语可懂度,用白话说就是一句话里能听对多少词,实验中常用 50% 词正确的阈值信噪比来表示,阈值越低说明在更吵时还能听懂。第二个量是听觉费力度,用白话说就是听懂有多费劲,即使词都听对了,费力度仍可能很高。论文要回答的是两个已有的深度学习非侵入模型能否跨任务工作:既预测双耳空间场景的可懂度,也预测增强语音与合成语音的费力度。
必须保留的信息是模型原理不同、数据来自 3 套独立听测、映射方法不同,以及报告的相关系数与误差的具体条件。输出是 1 篇可核对的解读,读者能按输入到输出复述计算与实验条件。本文没有公开代码与数据的可用声明,因此不写已公开,只讲论文内可验证的步骤。
侵入式预测 × 非侵入式预测: 侵入式预测负责用干净参考信号做对齐比较,分工是提供失真上限的度量,如 STOI 和 HASPI;非侵入式预测负责只看待测的含噪或处理后信号,分工是在没有参考的真实场景下直接打分。搭配理由是听力研究既需要实验室可解释的基准,也需要助听器和在线通信中可部署的盲估计,组合意义在于本文只检验非侵入路线能否同时覆盖可懂度和费力度。
言语可懂度 × 听觉费力度: 言语可懂度负责回答听对了多少词,分工是给出百分比或 50% 阈值信噪比;听觉费力度负责回答听懂有多累,分工是在可懂度饱和为高值时仍能区分条件的努力评分。搭配理由是两者都受声学退化影响但变化区间不同,组合意义在于用同一模型输出经不同映射同时预测两者,可以检验模型捕捉的是表层词错误还是更一般的听觉处理难度。
同输入同目标的前人路线如何对照?
在侵入式路线中,论文点名了言语可懂度指数、短时客观可懂度及其扩展版、助听器言语感知指数第二版。这些方法的共同输入是干净参考加待测信号,共同目标是预测可懂度,共同监督是声学与听觉模型先验。它们在受控条件下成功,但运行阶段要求有参考,因此不能直接用于真实助听器在线打分。
非侵入路线试图摆脱参考,例如非侵入短时客观可懂度用统计模型估计干净包络,盲判别式预测器用混合语音识别系统的词后验离散度映射到词级可懂度,端到端识别器用解码阶段不确定性或多模型集成不确定性预测可懂度。听觉费力度方面,论文提到基于音子后验的费力度估计模型,但原文只分析了费力度预测。本文的对照点是同为非侵入、同为深度学习、同为用识别不确定性或模仿侵入指标,但在运行阶段都不需要参考。
区别在于 PHOBI 来自常规识别器的音子后验熵类度量,HASA-Net+ 来自对侵入指标的教师蒸馏,前人多只做单说话人自然语音或单耳噪声,本文扩展到双耳、增强与合成语音。
为什么可懂度高了还要测费力度?
一个例子可以帮助理解。假设两段语音的可懂度都是 95%,一段是安静下自然语音,一段是经过增强但残留失真的语音。从词正确率看两者相同,但听者对第二段需要更集中注意,更容易疲劳。如果只优化可懂度,就会误以为两者等价。论文要解决的正是这种饱和区间的区分问题。
技术难点有三点。第一,模型当初不是为费力度设计的,直接拿可懂度代理量去预测费力度需要额外映射,且映射必须在独立数据上拟合,不能在测试集上偷看。第二,空间场景存在双耳释放掩蔽,噪声从侧方来时人耳阈值会下降,单耳模型若不处理双耳会系统性高估阈值。第三,增强算法与合成语音带来训练未覆盖的失真类型,例如食堂噪声中的背景人声片段、文本转语音的韵律与混响组合,模型可能把干扰语音当目标或对新音色误判。
本文把这 3 个难点分别对应到 3 套数据:空间可懂度、增强语音费力度、合成语音费力度。
两个模型的全景与单样本走通
先沿一个样本走完全程。取一句德语 Oldenburg 句子测试句,结构固定为名字加动词加数字加形容词加宾语,与语音形稳态噪声按某信噪比混合,再经头相关传输函数卷积成左右耳。PHOBI 路径是把每一耳波形分帧送入前馈神经网络,得到每帧的三音子后验,再计算固定时滞下后验对的平均 KL 散度即平均时间距离,不确定性越大表示退化越重,最后经心理测量函数或线性映射转成阈值或费力度。
HASA-Net+ 路径是把波形送入预训练的 WavLM-Large 得到表征,与经稠密层处理的听力图一起送入双向长短时记忆,再经两个多头注意力分支分别预测助听器感知指数与质量指数,本文只取感知指数分支,再做同样映射。两条路径的共同点是都不需要干净参考,不同点是前者是识别副产物的无监督不确定性,后者是有监督地模仿侵入指标。论文选择两者正是因为原理不同,可以检验不同原理是否都泛化。
PHOBI 组件:三音子后验如何变成分数?
PHOBI 的前端是一个混合自动语音识别系统,由前馈神经网络加隐马尔可夫模型组成。训练时用 960 小时英语有声书 LibriSpeech,并做 3 类增广:加噪声、加助听器算法处理、加房间仿真的空间信息。训练完成后丢弃隐马尔可夫解码阶段,只保留前馈网络估计的三音子概率。直觉是清晰语音下每帧后验尖锐,只激活少数三音子;噪声下分布被抹平,多个三音子同时激活。
量化用平均时间距离,计算所有相隔固定时滞的三音子分布对的平均 KL 散度。散度越大说明时间结构仍清晰,越小或越混乱则表示退化。这个度量不解码文字,因此对语言的依赖主要来自训练语料的音子 inventory,但论文用英语训练的模型去预测德语句子,本身就是 1 次跨语言泛化检验。
三音子后验 × 平均时间距离: 三音子后验负责由前馈神经网络对每帧输出上下文相关的音子概率分布,分工是把声学清晰度转成概率尖锐程度;平均时间距离负责计算固定时滞下所有后验对的平均 KL 散度,分工是把分布被噪声抹平的程度量化为一个数值。搭配理由是清晰语音后验尖锐而噪声下弥散,组合意义是无需解码文字即可用不确定性作为可懂度和费力度的代理指标。
HASA-Net+ 组件:教师信号与听力图如何接入?
HASA-Net+ 的输入也是原始波形,但特征来自预训练的 WavLM-Large 基础模型。听力损失模式经处理后的听力图再经稠密层编码,与语音表征拼接后送入双向长短时记忆层,随后分叉到两个多头注意力分支,一个预测助听器感知指数,一个预测助听器质量指数。本文只用感知指数分支,因此后文的 HASA-Net+ 均指该分支。训练语料是 VCTK-DEMAND 与 TIMIT 合计 700 以上英美说话人,并做加噪、加混响、增强、去混响与声码器处理。教师信号是侵入式指标的计算值,学生模型在没有参考时模仿该值。
这种做法的好处是可以用大量合成退化自动生成教师标签,代价是学生的上限受教师指标本身的局限约束。在本研究的 3 套听测中,听者均为正常听力,因此听力图分支应处于正常模式,但论文未报告具体听力图取值,这是复现时需要补齐的缺项。
教师-学生 × WavLM-Large: WavLM-Large 负责把原始波形转成通用的语音表征,分工是提供抗噪的声学特征;教师-学生负责用已有的侵入式 HASPI 和 HASQI 打分作为教师目标,分工是把需要参考的指标蒸馏成无需参考的预测器。搭配理由是直接采集大量人评代价太高而侵入式指标已有验证,组合意义是 HASA-Net+ 用双向长短时记忆加多头注意力分支同时学习对 HASPI 的盲模仿。
较好耳聆听 × 双耳整合: 较好耳聆听负责把左右耳分别送入单耳模型后取数值更优的一侧,分工是以最简单的策略实现空间释放掩蔽;双耳整合负责显式建模双耳差分和房间混响交互,分工是更精细地解释混响房间的角度效应。搭配理由是本文要检验简单策略是否足够,组合意义在于作者放弃原文 PHOBI 的复杂双耳整合而统一用较好耳,以便公平比较 PHOBI 与 HASA-Net+。
本研究训练了什么,没有训练什么?
需要明确区分既有模型训练与本研究的计算。本研究没有重新训练 PHOBI 的前馈网络,也没有重新训练 HASA-Net+ 的 WavLM 加双向长短时记忆加注意力权重。论文实际做的是调用已有模型做推理,再拟合两个映射。第一个映射针对费力度:在独立数据集上让听者对哥廷根句子测试句的 80 种处理打分,处理包括变速、变调、低通高通滤波、加噪、加混响与变声器,对每个条件计算模型输出均值与主观费力度均值,做线性拟合,得到斜率与截距后再用于增强与合成两套数据的预测。
第二个映射针对可懂度:把 10 句语音与噪声按负 40 到 20 分贝以 0.5 分贝步长混合,计算模型输出,拟合 S 形心理测量函数,取 50% 可懂度对应的信噪比作为阈值。双耳处理统一用较好耳策略,即左右耳分别打分取数值更优者。阈值存在常数偏置,用消声室语音与噪声共位于 0 度的条件学习一个修正偏置,对 2 个模型同样执行以保证公平。原文未报告线性拟合的具体系数、S 形函数的斜率参数与拟合优度,也未说明梯度与冻结细节,因为本阶段无梯度更新。
三套听测各测什么,条件是否一致?
第一套是空间可懂度,8 名正常听力被试,材料为 Oldenburg 句子加语音形稳态噪声,用自适应程序测 50% 阈值。空间经头相关传输函数仿真 3 类房间:消声室、办公室、食堂,语音固定在前方 0 度,噪声从负 180 到 180 度多个方位呈现。评价指标是阈值信噪比,越低越好,比较的是人测阈值与模型阈值在不同房间与角度下的曲线形状、相关系数与均方根误差。
第二套是增强语音费力度,11 名正常听力被试,材料仍为 Oldenburg 句子,噪声为稳态语音形噪声与含背景说话人的非稳态食堂噪声,先测阈值再在多个信噪比下呈现处理与未处理句,用 1 到 13 努力等级分类单位打分,14 表示完全听不到,增强算法是基于子带言语可懂度指数做频带能量重分配加压缩的 AdaptDRC。
第 3 套是合成语音费力度,23 名正常听力被试,材料为谷歌文本转语音男女声各 4 段、每段两句符合电信建议的内容,加混响时间为 0.54 秒的混响与 5 种噪声在各自信噪比下呈现,空间经头相关脉冲响应生成 6 种语音噪声方位组合,共 240 条刺激,同样用 1 到 14 量表打分。3 套数据合计超过 10500 条评分,来自 39 名听者,但 3 套的句子、噪声、房间与量表锚点不完全相同,因此跨数据集只能比较趋势与泛化,不能直接比较绝对分值。
空间可懂度:双耳释放掩蔽能否复现?
本节的比较问题是,在房间与噪声方位同时变化时,两个只用较好耳的模型能否复现人的阈值曲线,公平条件是同一左右耳合成、同一较好耳取优、同一单点偏置校正,指标方向是阈值越低越好、相关越高越好、误差越小越好。总体报告显示消声室相关最高,混响房间相关下降但仍在 0.88 以上,PHOBI 在三间房的相关均略高于 HASA-Net+,误差平均小约 1.4 dB。
下表按房间整理原文报告的相关与误差,PHOBI 为单值误差,HASA-Net+ 为校正与未校正两个误差并列,用于说明单点校正并非在所有房间同时最优。
| Room | PHOBI r | HASA-Net+ r | PHOBI RMSE | HASA-Net+ RMSE corrected / uncorrected |
|---|---|---|---|---|
| Anechoic | 0.97 | 0.94 | 1.0 dB | 1.8 dB / 4.5 dB |
| Office | 0.91 | 0.88 | 2.3 dB | 4.5 dB / 1.3 dB |
表中消声室一行对应原文最高相关与最小误差,办公室与食堂两行显示相关下降而误差增大,且办公室 HASA-Net+ 校正后 4.5 dB 反而大于未校正 1.3 dB,食堂则为 2.7 dB 与 3.2 dB,这直接支撑后文关于偏置与房间有关的判断。
看图路径: 1. 先看三块面板标题确认房间:消声室、办公室、食堂,再看横轴噪声方位角与纵轴阈值信噪比方向;2. 对照图例区分浅灰主观数据、黑色圆点 PHOBI、深灰菱形 HASA-Net+ 在 0 度共位处的高点;3. 比较噪声移到正负 90 度附近时三条曲线的下降幅度,判断空间释放掩蔽是否被复现;4. 重点观察办公室与食堂面板中 HASA-Net+ 与主观曲线的整体偏置和左侧角度的偏离
论文图 1。原论文 Figure 1:“Spatial intelligibility predictions of HASA-Net+ (darker diamonds) and PHOBI (black dots) for the SIspatial dataset.”。
从像素看,消声室 3 条曲线在 0 度共位处形成高峰,在正负 90 度附近形成低谷,说明空间释放掩蔽被 2 个模型捕捉。办公室面板中浅灰主观曲线整体高于消声室,深灰 HASA-Net+ 曲线系统性偏低,尤其在左侧角度偏离更大。食堂面板中黑色 PHOBI 曲线在 0 度高于主观而在侧方接近主观,深灰 HASA-Net+ 在负 100 度附近出现过低的谷值,提示对该房间左侧角度的建模不足。论文还用单音子加较好耳做了对照,发现消声室复杂双耳整合相关为 1.0 高于较好耳的 0.97,食堂两者接近,办公室较好耳反而更高,这支持较好耳在多数条件下够用,但在混响建模上仍有改进空间。
增强与合成语音的费力度:改进方向与簇内真相
本节的比较问题是,模型能否预测增强带来的费力度下降,以及对未见过的合成音色与空间配置是否仍单调,公平条件是同一信噪比与噪声类型下比较处理与未处理对,同一线性映射用于全部条件,指标方向是费力度等级越低越好、预测与主观越接近回归线越好。增强集上总体线性相关很高,HASA-Net+ 为 0.98 而 PHOBI 为 0.94,但均方根误差是 PHOBI 的 1.2 ESCU 更小,HASA-Net+ 为 1.9 ESCU。合成集上总体相关为 0.94 与 0.96,但按噪声类型拆分的簇内相关大幅下降,HASA-Net+ 在 0.43 到 0.75 之间,PHOBI 在 0.62 到 0.91 之间。
下表按数据集整理原文报告的总体相关与增强集误差,以及合成集按噪声拆分后的簇内范围,用于说明全局单调成立但簇内分辨率有限。
| Dataset | HASA-Net+ overall r | PHOBI overall r | PHOBI RMSE | HASA-Net+ RMSE |
|---|---|---|---|---|
| LEenhanced overall | 0.98 | 0.94 | 1.2 ESCU | 1.9 ESCU |
| LEsynthetic overall | 0.94 | 0.96 | intra-cluster 0.62 to 0.91 | intra-cluster 0.43 to 0.75 |
| LEsynthetic per-noise r | 0.59, 0.75, 0.43, 0.50, 0.71 | 0.79, 0.89, 0.62, 0.81, 0.91 | — | — |
表中增强集一行显示高总体相关下 PHOBI 误差更小,合成集总体行与分噪声行显示总体相关高而簇内相关明显走低,且 PHOBI 在各噪声上的 5 个 r 值系统性高于 HASA-Net+,这与后文色块簇与箭头方向的像素观察相互印证。
看图路径: 1. 先看四个子图标题区分左两列是增强语音的费力度,右两列是合成语音的费力度;2. 在子图 a 与 b 中沿横轴模型预测与纵轴主观均值看回归线,并顺着箭头看未处理到已处理点的移动方向;3. 在子图 c 与 d 中按颜色区分五种噪声簇,按形状区分六种空间配置,观察簇内分散与簇间整体趋势;4. 核对每个子图左上角标注的相关系数与均方根误差,区分全局高相关与簇内低相关的差异
论文图 2。原论文 Figure 2:“(a & b ): Predictions for the LEenhanced dataset of HASA-Net+ (a) and PHOBI (b) for different noise types (legend a [proc 一个星号: processed version of noise (caf: cafeteria noise,…”。
从像素看,子图 a 与 b 中多数箭头从右上指向左下,表示处理后主观与预测同时下降。例外是食堂噪声在负 10 与负 15 分贝处箭头指向预测上升而主观下降,2 个模型都出现,论文解释为食堂噪声中的可懂片段被模型当成目标语音而给出偏高的费力度。子图 c 与 d 中 5 种噪声形成明显色块簇,同一颜色内不同形状点的分散较小,说明模型能区分噪声大类但对同一噪声内的空间与说话人细微差异分辨率有限。右两列的回归虚线与灰色置信带显示全局单调成立,但不能推广为每簇内都精确。
偏置校正与特征选择改变了什么?
论文做了两类可复述的对照。第一类是阈值偏置校正。PHOBI 存在常数偏置,用消声室共位条件学一个偏置,为公平对 HASA-Net+ 同样执行,并同时报告校正与未校正误差。结果是消声室 HASA-Net+ 校正误差 1.8 分贝而未校正 4.5 分贝,办公室校正 4.5 分贝而未校正 1.3 分贝,食堂校正 2.7 分贝而未校正 3.2 分贝。这说明单点校正不能在所有房间同时最优,办公室出现校正后反而变差,提示偏置与房间有关,单点外推有局限。
第二类是音子粒度与双耳策略。把三音子换成单音子并保持较好耳,或把较好耳换成复杂双耳整合,消声室复杂整合相关达 1.0,食堂两者接近,办公室较好耳更高。这支持复杂整合在消声室有优势但在混响房间不稳定。未胜出项是 HASA-Net+ 在左侧角度与食堂低信噪比处的系统性偏离,以及增强集中 2 对食堂低信噪比箭头方向错误,这些负结果比平均相关更能指导改进。未评测边界包括听损听者、真实助听器处理链与实时延迟,论文未给出这些条件下的数字。
哪些结论有支持,哪些只是可能?
论文直接报告的是在 3 套特定数据上的相关与误差,支持的判断是 2 个模型都能复现空间释放掩蔽的大趋势,都能预测增强带来的平均费力度下降,都对合成语音保持全局单调。需要限定的是总体趋势不等于每组都成立,食堂低信噪比的反例与簇内低相关就是反证。可能的解释如模型把背景人声当目标,属于待验证的推测,因为没有做干扰语音分离或词级对齐来证明。
缺失证据不是技术错误,但复述时要指出:线性映射系数未公开,心理测量函数斜率未公开,听力图具体取值未公开,推理开销与帧率未报告,因此不能承诺延迟或成本改善,也不能把自动指标当人评。百分点与相对百分比不同,阈值分贝差与费力度等级差是不同量纲,不能混放在同一模型列下比较大小。相关高不代表因果,也不代表去掉某组件必然变差,论文没有提供去掉 WavLM 或去掉注意力分支的消融,因此不做此类断言。
复现先做什么,需要补哪项验证?
若要复现,先按 3 步走。第一步重建双耳刺激:用论文注明的 Oldenburg 句子、语音形噪声、自适应测阈流程,以及三间房的头相关传输函数,语音固定前方,噪声按相同方位呈现,左右耳分别保存。第二步调用模型:PHOBI 用英语 LibriSpeech 训练的前馈网络输出三音子后验并计算平均时间距离,HASA-Net+ 用 WavLM-Large 表征加正常听力图经双向长短时记忆与注意力得到感知指数分支,双耳均用较好耳取优。
第 3 步拟合映射:在独立的 80 条件哥廷根句子集上拟合费力度线性映射,在负 40 到 20 分贝以 0.5 分贝步长上拟合 S 形函数求阈值,并用消声室共位条件学偏置。何时值得尝试是当你需要在无参考条件下快速筛查增强算法或合成语音的相对排序时。还需补的验证是公开映射系数、在听损听者上重测、报告推理耗时与内存,以及对食堂噪声做词级可懂片段标注以检验天花板效应的解释。
资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码模型或数据已公开,一切以论文内步骤为准。
一句话收束:何时信,何时疑?
可信的是跨任务泛化的大方向:在未覆盖的增强与合成条件下,2 个模型的排序能力依然成立,且原理不同的两条路线殊途同归。要怀疑的是绝对分值与单点校正的外推:房间变化会改变偏置,食堂背景人声与合成细微空间差异会降低簇内精度。实践建议是把模型用于算法迭代中的相对比较与不良条件筛查,而不是直接替代听测做临床阈值判定。后续工作应补齐映射参数、听损验证与开销测量,并尝试对 HASA-Net+ 引入显式双耳整合以改善左侧角度与混响房间的预测。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

