英文题目:AUDITORY MODEL PERSONALIZATION BASED ON TRANSIENT-EVOKED OTOACOUSTIC EMISSIONS
会议身份:
conference:eusipco:2026:conference-paper-id:0000271
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#医疗音频 #端到端学习 #正则化 #音频生成
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Xu, Yong-Yue:机构信息未能从会议 PDF 纯文本可靠映射
- Liu, Yi-Wen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理以短声点击为输入、以耳道内瞬态诱发性耳声发射波形为输出的听觉模型个性化问题,难点在于耳蜗放大与相干反射高度非线性且个体差异大,直接拟合难以同时保证生理合理与波形保真。方法先由双向级联滤波器结构前向传播点击并经耳蜗基底膜不规则反射系数产生反向散射波,再经中耳反向滤波与衰减合成仿真发射以形成频率依赖延迟。然后以多分辨率频谱与时域波形及频谱包络损失联合平滑与分布约束优化外毛细胞健康向量与反射系数及非线性参数,反向传播贯穿级联递归结构实现端到端可微调参。最后采用多起点与参数分组梯度策略从不同健康初值独立优化并选择最低损失解以缓解非凸局部极小。相对直接拟合传输线模型或不可产生发射的并行卷积近似,该机制差异在于保留纵向耦合与相干反射物理结构的同时获得实时可微调参能力。在传输线模型仿真损伤评测设置下,平坦损伤条件的误差指标为1.01 dB,低于频谱维度的误差指标的2.92 dB。结论适用边界仅限仿真验证的平坦与斜坡及陷波损伤和正常耳波形重建,尚未验证多种真实听损耳的外推能力,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,先把任务边界说清
这篇解读的输入是论文正文给出的双向级联滤波器方法、损失设计、优化流程与两类验证,目标是让刚进入语音音乐音频领域的研究生能复述出从点击声到仿真发射再到参数更新的完整动作。必须保留的信息包括模型改了哪里、损失有哪五项、优化了哪些参数、仿真与实测各用了什么条件、结果数字是在什么指标下得到的。输出是一套可核对的中文技术说明,不做超出原文的效果承诺。
本文只研究 1 个任务:给定一只耳朵实测或仿真的瞬态诱发耳声发射波形,把计算耳蜗模型的参数调到能近似复现该波形,并从参数读出可能的耳蜗状态,这个过程被作者称为模型个性化。举例来说,就像给同一款助听器算法配不同耳朵,输入都是同一个短促点击,输出的耳道回波却因耳蜗放大与反射不同而不同,任务就是反推是哪组内部参数造成了这种不同。
瞬态诱发耳声发射是短声脉冲诱发的、由耳蜗产生并经中耳传回耳道的声学响应,白话说就是耳朵在被点击声激一下之后自己漏出来的一点延迟回声。级联非对称谐振器快速作用压缩模型是本文的骨干,白话说就是一串级联的带通滤波器模拟基底膜行波,再加一个随声压自动调节增益的压缩环节模拟外毛细胞放大,后文简称为原模型。
传输线模型是用来产生仿真目标发射的另一套生物物理模型,白话说就是更细致但计算更重的耳蜗仿真器,后文简称为传输线模型。原文明确声明没有发现可验证的公开代码模型数据资源,因此本解读不声称任何链接当前可用,一切以正文文字为准。
术语小结:后文简称如何对应?
为保证全文简称固定,这里集中核对 1 次。原模型指级联非对称谐振器快速作用压缩模型,传输线模型指用作仿真目标的生物物理耳蜗模型,发射指瞬态诱发耳声发射,健康向量指外毛细胞功能完整性沿耳蜗的分布,反射向量指各通道反射系数。后向衰减与输入缩放分别指耳道与耳蜗之间的量纲与失配换算,中耳滤波分前向与后向两组,通带不同。损失五项分别为多分辨率短时傅里叶损失、时间均方根误差、对数谱幅度误差、平滑项与分布项,优化为分区多起点梯度下降。这些对应关系贯穿前文,指代均可唯一回指,前置概念先于依赖它的结论出现。
已有路线为什么没有直接解决个性化?
学习这篇论文要先分清 3 条路线各自的取舍。第一条是传输线结构的生物物理模型,它能刻画外毛细胞电运动性带来的放大等细节,但通常需要数值积分求解偏微分方程,不适合实时应用与基于梯度的优化。第二条是深度学习近似路线,例如用卷积网络并行结构去逼近耳蜗力学以达到实时,但原文指出其并行结构缺少产生耳声发射所需的纵向耦合机制,而且它是去逼近另一个模型而非直接对齐生理实测。
第 3 条是本文选择的路线:以原模型为骨干,因为它既按人类实验数据精心设计又保持实时效率,且其非线性无限冲激响应递归结构让人联想到循环神经网络,可以借助随时间反向传播与反向模式自动微分得到机器精度的梯度,从而做端到端调参。最新版本已经有可微的编程实现,这是本文能做梯度优化的前提。
原文还说明,瞬态诱发与畸变产物耳声发射都被视为评估耳蜗放大的客观量,但据作者所知将其用于听觉模型个性化此前基本未被探索,所以本文要验证的是这条想法的可行性,而不是宣称已经解决临床诊断。
同输入同目标的对照应怎么看?
按同输入、同目标、同监督与同运行阶段做有源对照,结论会更稳。传输线模型与本文方法同目标都是解释耳蜗力学,但前者在离线精细仿真阶段占优,后者在实时可微调参阶段占优,不构成同条件胜负。卷积近似模型与本文方法同输入都是声压波形,但前者缺少纵向耦合因而难以生成发射,后者特意保留级联耦合,类别差异不应写成同条件胜负。
直接用发射评估耳蜗放大的生理文献与本文同监督信号,但前者止于指标判读,后者进一步把指标变成模型参数的梯度信号,这是本文的增量。复现时应保留这种对照视角:若把本文方法换成纯并行网络去拟合发射,需要先回答逆行延迟与相干反射由谁产生,否则拟合很可能只记住波形而丢掉可解释的损伤定位。
要拟合的到底是哪个波形,约束是什么?
形式化地说,输入是一个短促点击声,目标是另一段记录到的耳道压力波形即目标发射,待求的是一组模型参数。优化要在最小化仿真发射与目标发射差异的同时,满足外毛细胞条件在生物上合理的约束,并保证过程对不同初值足够稳健。难点在于高度非凸:主动放大的非线性与级联滤波的相互作用会让损失面有很多局部极小,直接梯度下降容易卡住。
另一个难点是过拟合:只看波形误差可以调出一组数学上很像但生理上不可能的参数,例如相邻通道健康度剧烈跳变或反射系数分布异常。因此问题被写成带正则的复合损失最小化,而不是单纯的波形回归。验证分两步走:先用传输线模型产生已知损伤形态的目标发射,看方法能否反推出损伤位置与程度,这属于跨模型验证;再用本校采集的正常听力人耳实测发射,看方法能否为每一只耳朵调出一组能复现其独特频谱包络的参数,这属于实测验证。
两步的输入输出单位与预处理都不同,不能混为一谈。
方法全景:一个样本如何走完输入到输出?
沿着一只耳朵的一个点击样本走一遍,流程是清晰的。点击声先乘以输入缩放增益,把声压换算成送入耳蜗的无量纲驱动,再经过前向中耳带通滤波进入级联滤波器。前向级联逐级产生各通道的基底膜输出,每 1 级输出乘以该通道的反射系数,模拟被局部不规则散射出来的那一小部分。所有反射分量进入后向低通链逐级向耳道方向累加,最后经过后向中耳滤波并乘以后向衰减增益,换算回耳道声压得到仿真发射。
优化时比较仿真发射与目标发射的复合损失,用梯度下降更新健康向量、反射向量、输入输出缩放与两个非线性参数,多起点中最优的保留为该耳的个性化结果。图注与正文把该流程画成个性化管线与双向级联模型两部分,本次没有收到官方原图像素,因此这里只依据文字归因描述,不对图中颜色曲线或模块位置做断言。理解这条主路径后,再看公式与组件会更容易定位每个参数在链条上的作用点。
双向结构里四个模块各自算什么?
第一个模块是中耳接口。前向用 4 阶带通滤波器表征经中耳传入的频率响应,通带为低频到中频范围;后向用两个 2 阶滤波器级联且通带更窄,以体现低频返回增益的下降。输入信号乘以增益把声压转为无量纲驱动,后向末端乘以衰减增益把力学量转回耳道声压,原文解释该衰减综合了耳蜗内小反射、卵圆窗与镫骨间大阻抗失配以及量纲换算三方面因素。第二个模块是带阻尼修正的前向路径。
它沿用原模型的级联结构,标准模型中有由相对去阻尼因子决定的级增益计算式,为模拟耳蜗导管内被动能量耗散与纵向功率衰减,作者把常数项乘以 0.94 的因子,引入每级约 0.54 分贝的稳定衰减,此后每级输出称为一个通道。
级联非对称谐振器 × 快速作用压缩: 级联非对称谐振器负责模拟基底膜上行波经过的一串 2 级滤波,决定各通道的频率选择与传播延迟,快速作用压缩负责根据输入声压动态调节滤波器增益以实现非线性压缩,二者搭配的理由是前者提供纵向耦合的行波结构、后者提供外毛细胞放大的可调增益,组合意义是既保留实时级联计算,又让增益可被梯度反向调节。
第三个模块是相干反射产生机制。理论认为瞬态诱发发射源于基底膜机械不规则引起的相干反射,因此为每个通道引入一个反射系数,组成反射向量。某通道的基底膜输出乘以其反射系数后进入后向路径,与衰减因子共同模拟行波被随机粗糙散射的过程。
外毛细胞健康向量 × 反射系数向量: 外毛细胞健康向量分工是刻画沿耳蜗各通道的主动放大完整性,直接控制前向增益大小,反射系数向量分工是刻画基底膜机械不规则引起的局部散射强度,决定进入后向路径的反射量,二者搭配的理由是发射信号同时受放大与散射影响,必须分开建模才能区分听力损失与个体细结构,组合意义是让优化能同时估计病变位置与反射分布。
第四个模块是后向传输路径。为体现正逆波传输不对称,后向不用主动放大的谐振器,而用一串 1 阶低通滤波器近似被动逆向传播,理由是生理证据显示被动基底膜响应缺少尖锐共振峰。每通道截止频率设为对应前向特征频率的 1.1 倍,且在每通道把本通道反射分量与更顶端传来的累积后向波相加,从而形成随频率变化的延迟,即文中所说的色散图呈现与频率倒数相关的延迟特性。
前向传输路径 × 后向传输路径: 前向传输路径分工是把耳道点击经中耳送入级联滤波器并逐级放大,后向传输路径分工是把各通道反射分量逐级汇总并送回耳道形成仿真发射,二者搭配的理由是只有双向结构才能产生可与实测对比的耳声发射波形,组合意义是把原来只做正向听觉分析的模型扩展为可生成发射的闭环个性化模型。
没有训练神经网络,这里的优化到底更新什么?
本研究没有训练一个新的神经网络,也没有冻结与微调的常规划分,该节讲的是对单耳参数的直接优化过程,必须把这一点说清楚。待优化的参数集合包括健康向量、反射向量、输入输出缩放以及两个非线性参数,其中一个调节外毛细胞非线性函数的速度灵敏度,另一个控制非线性的不对称性并影响 2 阶失真产物。
损失共有五项:多分辨率短时傅里叶损失用多个窗长在采样率 44 点 1 kHz 下捕捉多尺度时频特征,时间域均方根误差惩罚波形逐点差异,对数谱幅度误差在 0.6 到 8000 赫范围内比较频谱,另加两项生物约束。健康向量的每个元素经函数限制在零到一之间,并用 1 阶差分平方和惩罚空间不连续;反射向量用排序后与零均值高斯理论分位数的均方差约束整体分布,但不约束不规则的具体空间位置。
多分辨率短时傅里叶损失 × 对数谱幅度损失: 多分辨率短时傅里叶损失分工是在多个窗长下比较时频谱以抓住非平稳发射的时间频率结构,对数谱幅度损失分工是在频域比较对数幅度以抓住共振峰与衰减形态,二者搭配的理由是单看波形均方误差易被大峰值主导而忽略频谱细节,组合意义是让拟合同时顾及波形对齐与听损相关的频谱形态。
优化采用分区方案:健康向量因直接控制主动增益且要穿过饱和区,给较大的固定学习率 0.05;其余参数采用从 0.002 开始的余弦衰减学习率,以保证数值稳定并让健康向量主导整体增益特性。所用优化器为自适应矩估计优化器,全程迭代 1500 次。为缓解非凸带来的局部极小,采用多起点策略,从健康、轻度受损、中度受损 3 种生理初值分别独立优化,取最终损失最低者为全局估计。
平滑约束 × 分布约束: 平滑约束分工是惩罚外毛细胞健康向量的 1 阶差分以保持空间连续性,分布约束分工是要求排序后的反射系数贴近零均值高斯分位数以保持随机粗糙假设,二者搭配的理由是单纯追求波形拟合会产生剧烈跳变或非生理的反射解,组合意义是用生物合理性正则把优化拉回可解释的参数区间。
原文未给出五项损失权重的自动搜索过程,只报告了两组经验超参数,拟合传输线数据与实测数据时时间项权重不同,复现时应原样保留而不应自行调优。
仿真与实测的条件各是什么,指标方向如何?
实验按问题组织,先看测什么与条件是否一致。仿真部分用传输线模型产生不同耳蜗条件下的目标发射,包括代表正常听力的平坦形态、代表 1 kHz 以上高频滚降到 8 kHz 处二十或 30 分贝的斜坡形态,以及通过扰动极点模拟的 3 kHz 或 4 kHz 局部切迹形态。刺激为峰值等效声压级 80 分贝的点击,输出去掉刺激伪迹,做法是用 1.0 毫秒的刺激后消隐窗处理。
实测部分采集 29 名正常听力被试共五十八耳,每名被试呈现 1600 次点击,平均级约为 79.8 正 -3.7 分贝峰值等效声压级,经伦理委员会批准。实测点击响应先经 0.6 到 8000 赫的有限冲激响应带通滤波,再做伪迹剔除,丢弃幅度最大的 20% 可能含头动或清嗓伪迹的响应,然后平均以提高信噪比。比较公平性上,仿真与实测的幅度量级不同,因此输入输出缩放的初值分开设置,拟合传输线数据与实测数据用不同初值。
损失权重也分开设置,不能混用。指标方向要记清:时域均方根误差与频域对数谱误差越小越好,听力图差异指传输线增益下降与拟合模型增益下降在各特征频率处的平均差,越小表示损伤估计越准;个体区分度用耳间与耳内距离比表示,越大表示不同耳朵的差异相对同耳重复测量的波动越大;拟合好坏还用主成分空间中的跨域耳间耳内比衡量,越大表示拟合波形更靠近其自身目标而非其他耳朵。
下表整理仿真侧的关键链路条件,表中数字与单位均来自原文连续句,阅读时注意前向与后向滤波通带并不相同。
| 条件 | 指标 | 仿真刺激 | 预处理 | 模型侧设置 |
|---|---|---|---|---|
| 后向返回 | 窄通带 | 0.8-4 kHz 级联 | 常数项缩放 | 因子 0.94 |
| 行波衰减 | 每级衰减 | 约 -0.54 dB 每级 | 前向链 | 逐级累积 |
| 中耳接口 | 前向阶数 | 4 阶带通 | 后向阶数 | 2 阶级联 |
表后需要说明代价与边界:仿真验证的优势是损伤形态已知,可以直接算听力图差异,但它只是跨模型拟合,不能证明对真实病耳同样有效。
后向通带更窄与每级衰减的引入让延迟与幅度更符合生理,但也意味着模型对低频与高频边缘的拟合能力受限,这与后文切迹低频边缘的小失配是呼应的。未胜出项在这里就已出现:原文承认传输线发射幅度一般大于实测发射,因此必须为两类数据设不同初值,说明同一套初值不能通吃所有目标。
跨模型验证:损伤形态还原到什么程度?
跨模型验证测的是能否从发射波形反推损伤。做法是在特征频率 0.25、0.5、一、二、四、六、8 kHz 处计算增益下降,即扰动参数后模型响应的均方根能量与健康基线响应的分贝差,再与传输线真值的增益下降比较得到听力图差异。原文报告在高频滚降场景下模型能有效跟踪高频斜率,在空间局域缺损场景下能准确定位 3 kHz 附近的切迹中心,但在低频边缘可见小失配。
原文以表格给出 5 种形态的听力图差异、时域误差与频域误差,但本次可核对的连续原句不足以逐字覆盖该表全部数字,因此这里不转写该表数值,只做定性转述以避免编造证据:总体趋势是平坦与斜坡形态的差异较小,切迹形态的差异相对较大,其中 4 kHz 切迹的差异大于 3 kHz 切迹。支持的判断是该框架有能力拟合不同形态产生的发射并进一步推断耳蜗损伤,限制是这仍是仿真到仿真的验证,且增益下降只是听力损失的代理指标,不等同于临床听阈。
复现时应注意该结果依赖多起点与分区学习率,若只用单一起点,遇到未知听力剖面时更容易陷入局部极小。
实测验证:拟合波形是否真靠近自己那只耳朵?
实测验证测的是个性化是否抓住了耳间差异。先对 0.6 到 4000 赫的发射谱包络做平滑以抑制噪声与细结构波动,同时保留每耳独特特征。个体独特性先用耳间与耳内距离比确认,数值较大表明不同耳朵之间的变异超过同耳重复测量的变异。然后把五十八耳实测数据做主成分分析,前两个主成分解释总方差的 80% 以上,再把 15 个个性化模型的拟合发射投影到同一子空间,看星形标记是否落在对应圆形目标附近。
原文报告拟合发射位于其目标簇附近,并用跨域耳间耳内比定量支持,数值大于一且明显高于随机,表明拟合谱更靠近自身目标而非五十七只非目标耳。同样地,原文还展示了一耳内多次点击平均后的时域波形与谱包络对比,拟合曲线贴近平均后的实测,但本解读因无像素不描述曲线颜色与具体峰值。需要保留的细节是实测拟合把时间项权重调高以平衡各项贡献,且输入输出缩放初值与仿真不同,这说明跨域复现时不能直接照搬仿真超参数。
下表整理实测侧可核对的条件与评估数字,表中数字与单位均有原文连续句支撑。
| 条件 | 指标 | 实测采集 | 预处理 | 评估结果 |
|---|---|---|---|---|
| 点击呈现 | 次数与量级 | 1,600 次,79.8±3.7 dB peSPL | 平均增信噪比 | 剔除 20% 伪迹 |
| 带通滤波 | 通带范围 | 0.6-8 kHz FIR | 谱分析 | 0.6-4 kHz 包络 |
| 主成分 | 方差解释 | 81.06% 前 2 维 | 58 耳空间 | 投影对比 |
| 个体区分 | 耳间耳内比 | 7.42 实测域 | 同耳波动 | 耳间更大 |
| 拟合贴近 | 跨域比值 | 4.02 跨域 | 57 只非目标 | 更近自身 |
表后解释主要收益与代价:收益是方法能为正常听力耳调出贴近自身的发射谱,支持用发射做耳蜗状态评估的想法。
代价是评估依赖平滑与主成分投影,若平滑过强会抹掉细结构,若只看投影距离会忽略波形相位误差。未胜出与未评测边界必须点明:实测只覆盖正常听力被试,真实生理状态未知,框架对不同类型听力损伤的泛化尚未验证;十五耳的展示是随机抽取以保证可视清晰,不代表全部五十八耳的误差分布,复现时应报告全量统计而非只看抽样子集。
哪些结论还不能下,缺了哪项验证?
区分 3 类表述很重要。直接报告的是仿真损伤可被跟踪与实测谱可被贴近;有限解释的是参数集反映了潜在耳蜗条件,因为实测被试的精确生理状态未知,只能说参数与发射形态一致,不能说等于临床诊断。未验证推测是向听力应用的延伸,原文用可能引出下游应用,但未测量误判率、延迟或成本,因此不承诺这些量得到改善。相关性不等于因果:拟合误差小支持模型能复现发射,不证明估计的健康向量就是真实外毛细胞损伤图。
缺失证据不是技术错误,但复现与引用时要明确缺项:缺少病耳数据、缺少畸变产物发射验证、缺少与听阈或耳蜗调谐直接对比。原文讨论部分已承认仅在正常听力验证,未来需要更大规模与多类型损伤数据;还指出畸变产物发射是两列波共同作用,一列从失真产生处直接返回中耳,另一列先到特征位置再经相干反射返回,比本文的单反射路径更难刻画,因此把该扩展列为未来工作。
总体趋势不等于每组都成立,切迹边缘的失配提醒我们边缘频率的外推要谨慎。
要复现,先准备什么,按什么顺序调?
复现先做三件事。第一,准备可微原模型实现与双向扩展:前向保留级联结构并加入常数项缩放,后向按 1 阶低通链实现,截止频率取对应前向特征频率的 1.1 倍,反射向量与健康向量按通道数初始化。第二,准备目标发射与预处理:仿真目标用 80 分贝点击并做 1.0 毫秒消隐,实测目标按 0.6 到 8000 赫滤波、剔除大幅值响应后平均,注意两类数据的幅度不同,输入输出缩放初值要分开。
第三,按原文保留优化设置:1500 次迭代,健康向量固定大学习率,其余参数余弦衰减,自 3 种生理初值多起点运行并取最低损失者。先沿单耳单点击走通前向到后向再到损失的前向计算,确认能产生有频率依赖延迟的发射,再开梯度更新。常见误解是把反射系数当成增益微调,实际上它是散射强度的随机粗糙假设,受高斯分布约束而不约束位置;另一个误解是把健康向量平滑当成可有可无,实际上它是防止相邻通道跳变的关键正则。
原文未给出权重搜索与硬件预算,复现时不应自行宣称训练资源或推理帧率,实际延迟需单独测量。资源状态方面,本次未发现可验证的公开资源,因此按不可用处理,不写已公开或当前可用。
何时值得尝试这个方法?
当研究目标是从无创发射反推耳蜗放大与反射的个体差异,且需要一个可实时运行又可求梯度的模型时,这个方法值得尝试。它的价值在于把生物物理的纵向耦合与机器学习的自动微分结合起来,让发射波形直接成为调参信号,而不是只做正向仿真。适用条件很具体:有高质量的目标发射与清晰的预处理,有合理的初值覆盖,有生物约束防止非生理化解,且评估同时看时域、频域与损伤代理指标。
若目标是临床分型或助听器增益处方,还需补上病耳数据、与听阈调谐的对照以及对误判与成本的测量,才能从拟合能力走向可用性。回到中心矛盾:易调性、生物保真与实时效率三者冲突,本文用可微级联加后向路径与复合损失给出一个可行的折中,但折中点是否落在真实人耳上,仍待更多数据验证。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
区域 3 · 查看论文原页
区域 4 · 查看论文原页
区域 5 · 查看论文原页
区域 6 · 查看论文原页
区域 7 · 查看论文原页
区域 8 · 查看论文原页
区域 9 · 查看论文原页
另有 7 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses








