英文题目:END-TO-END CLOSED-LOOP FRAMEWORK FOR COCHLEAR IMPLANT PROCESSING USING AUDITORY MODELS
会议身份:
conference:eusipco:2026:conference-paper-id:0000281
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#CNN #端到端学习 #语音 #音频修复
评分:5.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Van Heghe, Julie:机构信息未能从会议 PDF 纯文本可靠映射
- Torfs, Guy:机构信息未能从会议 PDF 纯文本可靠映射
- Verhulst, Sarah:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人工耳蜗需将同一声学输入转换为多电极脉冲驱动的螺旋神经节响应,电流沿耳蜗扩散与电诱发非线性使声电神经表征难以对齐。框架先以正常听力通路经基底膜振动、内毛细胞转导、突触与螺旋神经节神经元级联产生参考响应,为闭环提供生理目标。接着可学习刺激网络以双分支分别预测22电极归一化权重分布与全局电流幅度,经降采样对齐脉冲率后送入高斯电流扩散模型形成并行多电极激励。然后同一螺旋神经节模型将扩散后激励转为重建响应,两路包络经1ms最小池化平均绝对误差计算损失并反向传播只更新刺激网络,全部听觉模型参数冻结。与ACE严格交错单电极刺激以回避串扰不同,该方法把电流扩散显式建模进可微闭环,允许同时激活多电极以直接逼近参考神经包络。在5000条TIMIT独立测试集下,DNN-CI闭环刺激的包络平均绝对误差指标为0.0934,低于ACE基线的包络平均绝对误差指标0.6261。该结论适用边界受限于干净英语朗读语音与8kHz以下带宽仿真,尚未验证噪声、多语种、音乐与主观可懂度外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,先保留哪些关键信息?
本文的输入是一段声学语音波形,采样率为 20 kHz,幅度归一化到 70 dB SPL。目标不是直接提升可懂度分数,而是让电刺激诱发的螺旋神经节神经元响应更接近同一段声音在正常听觉下产生的响应。必须保留的信息包括两条通路使用相同输入、比较发生在神经响应层面、刺激受生理约束。输出是电极特异的脉冲序列,包含每个电极在每个时刻是否刺激以及给多大幅值。
对于刚进入音频领域的研究生,可以把人工耳蜗理解为绕过受损耳蜗的电刺激装置。声音先被处理成电脉冲,再通过植入的电极刺激听神经。传统做法是滤波器组加包络提取加电极映射,本文把传统编码换成两个可训练网络,并用听觉模型提供训练信号。
学习时先沿一个样本走完全程。取一段 TIMIT 语音,送入正常听觉模型得到参考响应 r,同时送入电极选择网络和电流幅度网络得到脉冲,再经电流扩散与电刺激神经元模型得到响应 r 帽。损失比较 r 与 r 帽的包络差异,梯度沿植入通路回传,只更新两个刺激网络,听觉模型参数冻结。这样闭环的含义是刺激设计直接接受神经响应失配的反馈。
已有路线做了什么,本文为何换一条监督信号?
相关工作可以按输入、目标和运行阶段对照。第一类是前端增强路线,例如 DeepACE 与 NNACE,把深度学习放在降噪或语音增强环节,输入是带噪语音,目标是更干净的声学特征,仍沿用常规刺激编码。第二类是助听器闭环建模,例如文献 7 的工作,用可微听觉通路模型优化听力损失补偿,输入是声学信号,目标是神经响应保真度,但处理对象是声学放大的助听器,不是电刺激。
本文与第一类的区别在于监督位置不同。前端增强优化的是声学前端,本文优化的是刺激模式本身,监督信号是两条通路的螺旋神经节响应差异。与第二类的区别在于执行器不同。助听器仍输出声音,人工耳蜗输出电脉冲,需要额外处理脉冲宽度、刺激速率、电极数与电流扩散。本文沿用了助听器闭环的思想,但把执行器换成电刺激,并引入扩散模型显式处理通道交互。
这种对照说明本文不是在相同条件下打败降噪模型。降噪模型解决前端信噪比,本文解决电诱发响应与正常响应的系统性失配。两者的输入都是语音,但目标层不同,评价也不同,因此不能把降噪指标直接当作神经保真度的证据。
要解决的差距在哪里,为何常规策略不够?
问题是声学听觉与电听觉在神经表征上的差距。论文指出多数植入用户在噪声、竞争说话人等复杂条件下难以达到正常听觉的感知水平,背后是电刺激产生的神经活动与正常耳蜗处理不同。常规高级组合编码器采用严格顺序交错刺激,目的是减少重叠电场带来的频谱涂抹,但它并没有在优化中显式使用电流扩散的生物物理模型。
可以举一个教学例子帮助理解,但它不是论文实验。假设两个相邻电极同时给中等电流,若忽略扩散会以为兴奋区互不重叠,实际电流在耳蜗内扩散会导致中间区域被双重驱动。交错刺激用时间错开回避这个问题,代价是放弃了并行编码的自由度。本文的做法是把扩散写进模型,让优化器在知道会扩散的前提下学习分布与幅度。
任务形式因此是受约束的刺激学习。约束包括 22 个电极、每电极 5 kHz 刺激率、50 微秒脉冲宽度、归一化电流在 0 到 1 之间、总刺激水平不超过 1。这些约束来自高级组合编码器的设计与商用系统的电极数,当前跨被试固定,临床应用需要个体化。优化变量是每个时刻的电极分布与全局电流因子,评价是神经响应包络误差。
两条通路如何并排比较,梯度走哪条路?
方法全景是两条并行通路加一个可训练刺激器。正常听觉通路依次是基底膜振动、内毛细胞转导、突触和螺旋神经节神经元,频带数为 201,覆盖耳蜗频率拓扑。植入助听通路依次是声刺激模型、可学习刺激器、电流扩散模型和同样的螺旋神经节神经元模型,频带数为 100。两条通路接收同一声学输入,分别产生 r 与 r 帽。
正常听觉通路 × 植入助听通路: 正常听觉通路负责给出参考目标,它把同一段声波经过基底膜、内毛细胞、突触和螺旋神经节神经元变成参考神经响应 r;植入助听通路负责给出待优化对象,它把同一段声波先经可学习刺激器变成电脉冲,再经电流扩散和同一类神经元模型变成电诱发响应 r 帽;两者搭配的理由是输入相同则差异只能归因于编码与刺激方式,组合意义是把刺激器设计变成让 r 帽逼近 r 的闭环优化问题。
训练时前向走两条路,反向只走一条可更新的路。具体动作是同一波形同时进入冻结的正常模型与待训练的植入链路,计算包络损失后,梯度穿过可微的扩散模型与神经元近似模型,一直传到电极选择网络与电流幅度网络,听觉外周模型的参数不更新。推理时只需要植入链路,不需要正常通路。正常通路只在训练时提供目标。
为处理采样率不一致,网络内部用步长为 4 的平均池化把 20 kHz 声学输入降到 5 kHz 脉冲率对应的时间网格。正常响应在算损失前被映射并下采样到 100 带表示,使两边带数一致。这个对齐步骤是公平比较的前提,否则带数不同无法逐带相减。
刺激器如何把声音变成电极脉冲?
刺激器由两个联合优化的网络组成。第一个网络预测每个时间步在 22 个电极上的归一化刺激分布,形式是分类任务,输出可理解为电流在空间上的分配权重。第二个网络预测全局电流缩放因子,形式是回归任务,输出在 0 到 1 之间,用平移双曲正切激活实现,含义是占从听阈到最大舒适级之间电动态范围的比例。两者相乘得到每个电极的脉冲幅度,形成并行脉冲序列。
电极选择网络 × 电流幅度网络: 电极选择网络即 DNN-CIelectrodes 负责每个时刻在 22 个电极上的归一化分布,做法是分类任务,回答电流该往哪里去;电流幅度网络即 DNN-CIcurrents 负责全局电流缩放因子,做法是回归任务,回答总体给多大,输出限制在 0 到 1 的动态范围比例内;两者搭配的理由是把空间分布与总体强度解耦,组合后相乘才构成完整的电极特异脉冲幅度序列。
与高级组合编码器的关键区别是时序。高级组合编码器用严格顺序交错减少通道交互,本文允许同时激活多个电极,并用扩散模型承担解释交互的责任。为保证安全与舒适,总刺激水平有严格上界,最大电流因子不超过 1。论文把脉冲宽度、刺激率与电极数固定,尚未学习这些硬件参数。
两个刺激网络共享同一种基础结构,即 dCoNNear 结构。每个堆叠包含 4 个记忆块,空洞率按 2 的幂增长,堆叠重复 2 次。块内先做逐点卷积,再做空洞深度卷积以覆盖长时上下文,配合残差与跳跃连接和线性整流激活,隐通道数为 256,卷积核大小均为 32。这种结构同时利用过去与未来上下文,适合建模听觉的时序依赖。
听觉模型各模块算什么,为何需要卷积近似?
正常通路的 4 个模块各有分工。基底膜模块描述耳蜗不同位置对不同频率的振动,体现频率拓扑。内毛细胞模块描述机械振动到感受器电位的转导。突触模块描述内毛细胞带状突触的释放与编码。螺旋神经节神经元模块用霍奇金赫胥黎类神经元模型描述动作电位与适应、不应性。植入通路的刺激模型产生电极特异脉冲序列,扩散模型用高斯型扩展函数描述电流沿耳蜗的分布,再接入同样的神经元模型。
解析听觉模型 × 可微卷积近似: 解析听觉模型负责保留已知的非线性和微分动力学,例如基底膜振动、内毛细胞转导、突触与霍奇金赫胥黎类神经元,但它不可直接求梯度;可微卷积近似即 dCoNNear 负责用卷积网络复刻解析模型的输入输出行为,使整条通路可反向传播;搭配的原因是直接对解析模型求梯度不可行,组合意义是梯度能穿过听觉外周到达刺激器,而参数更新仍只落在刺激器上。
解析模型准确但包含非线性与微分动力学,不能直接支持基于梯度的端到端训练。做法是用卷积网络拟合解析模型的输入输出行为,输入输出按模块缩放到 0 到 1 或负 1 到 1,例如内毛细胞感受器电位与神经元响应缩放 10 倍,突触与植入电流缩放 0.01 倍。基底膜与内毛细胞沿用已预训练的 dCoNNear 模型,突触与神经元阶段重新训练,扩散模型直接纳入。
电流扩散模型 × 同时刺激: 电流扩散模型负责用高斯型扩展函数描述电流沿耳蜗的泄漏与交叠,把各电极脉冲变成分布式的兴奋模式;同时刺激指允许同一时刻多个电极并行激活,不再强制高级组合编码器的严格交错;搭配理由是传统交错是用时序避开未建模的通道干扰,而本文显式建模了干扰因而敢于并行,组合意义是并行脉冲经扩散模型后仍能得到生理上可解释的神经输入,同时用总刺激上限保证安全。
这种近似的质量需要单独验证。论文在独立测试集上报告了归一化 L1 误差,正常突触模型为 0.85%,正常神经元模型为 1.12%,植入神经元模型为 5.0%。植入侧误差更高,论文解释为电诱发响应更复杂,涉及电流扩散与多位置神经元激活的非线性交互。近似误差的存在意味着后文的神经失配一部分可能来自模型本身,而不完全是声与电的本质差异。
分哪两阶段训练,损失与更新范围是什么?
训练分两个阶段。第一阶段训练可微听觉模块。用 TIMIT 语音通过解析模型生成输入输出数据集,共 20000 个定长窗,25% 留作验证。信号归一化到 70 dB SPL,采样 20 kHz,窗长 2048 样点约 102 毫秒,两侧各加 256 样点上下文以避免边界伪影。数据组织为样本数、通道数与时间长度的 3 维张量。
优化目标是预测输出与解析输出之间的 L1 损失,用 Adam 优化器,学习率为 0.0001,训练 30 轮。实现基于 Python 的 Keras 与 TensorFlow 后端,在三块英伟达 A30 上运行。
第二阶段训练刺激器。同一波形进入冻结的正常模型得到 r,同时进入待训练的刺激器、扩散与植入神经元模型得到 r 帽。损失是两者包络之间的平均绝对误差,外加 1 毫秒最小池化项,权重为 0.5。同样用 Adam 优化器,学习率为 0.0001,训练 30 轮。参数更新仅限于两个刺激网络,听觉模型冻结。
包络平均绝对误差 × 最小池化窗口: 包络平均绝对误差负责度量正常与植入两条通路螺旋神经节响应包络之间的逐点差距,是主要的优化目标;最小池化窗口指在 1 毫秒时间窗内先做最小池化再算误差,权重为 0.5,负责降低对尖峰时刻精确对齐的敏感性;搭配理由是神经脉冲的逐点对比过于苛刻,组合意义是在保留高时间分辨率的同时让优化更关注包络走向而非单点抖动。
需要明确未报告的缺项。论文未说明批量大小、学习率衰减、早停与随机种子,也未报告梯度裁剪或权重初始化细节。最小池化的具体实现是取窗内最小值,但未给出边界填充方式。复现时应先按已报告的窗长、上下文、带数与缩放因子搭建数据管线,再补记这些缺项的实际选择。
数据划分、基线与指标条件是否一致?
数据来自 TIMIT 连续语音语料,包含多说话人与方言。听觉模块训练用 20000 个窗,验证占 25%。刺激器训练与评价使用独立的 5000 个 TIMIT 测试样本。论文强调测试样本在训练中未见过,但训练、验证与测试都来自干净语音,没有噪声、混响、其他语言、非语音刺激或更高采样率条件。分析频带受训练数据限制在 8 kHz 以下。
基线是常规高级组合编码器刺激策略,驱动同一植入听觉链路。比较时声输入相同,神经元模型相同,差异只在刺激模式。指标是正常与植入螺旋神经节响应经 1 毫秒最小池化后的包络平均绝对误差,误差越小表示越接近。正常响应在比较前映射到 100 带,与植入侧对齐。
下表整理数据与刺激约束的论文特有细节,便于复现时核对条件而非只看结果。表前的问题是训练与评价的数据条件和硬件约束是否明确,公平比较要求输入、带数对齐与指标方向一致。
| 数据与约束 | 具体条目 | 训练划分 | 测试划分 | 硬件约束 |
|---|---|---|---|---|
| 语音来源 | TIMIT 连续语音 | 20000 窗,25% 验证 | 5000 独立样本 | 采样 20 kHz |
| 信号标定 | 70 dB SPL 归一化 | 2048 样点窗加 256 样点双侧上下文 | 干净语音,未见样本 | 8 kHz 以下频带 |
| 听觉带数 | 正常 201 带,植入 100 带 | 正常响应下采样到 100 带再比较 | 相同对齐流程 | 脉冲 5 kHz 每电极 |
| 刺激约束 | 22 电极,50 微秒脉宽 | 电流归一化 0 到 1 | 总电流因子不超过 1 | 跨被试固定,未个体化 |
上述表格把数据划分、带数对齐与硬件约束放在同一行,便于检查比较是否在相同输入与相同评价网格下进行。需要指出的边界是所有条件都是干净语音与固定参数,噪声鲁棒性、个体化动态范围与功耗尚未评测。最小池化窗口选 1 毫秒是为了在高时间分辨率与对逐点抖动的容忍之间折中,权重 0.5 是当前概念验证的选择,不是搜索最优。
主结果在什么指标上改善了多少,有无反例?
主结果的比较问题是,在相同植入听觉链路下,可学习闭环刺激是否比常规高级组合编码器更接近正常神经包络。公平条件是同一测试集、同一神经元模型、同一 100 带对齐与同一 1 毫秒最小池化包络平均绝对误差,误差方向是越小越好。论文报告优化系统把该误差从 0.6261 降到 0.0934,对应约 6.6 倍改善。定性插图显示代表性频带上闭环响应的包络更贴近正常参考,而高级组合编码器偏离更大。
| 比较条件 | 评价指标 | 高级组合编码器基线 | 闭环刺激本方法 | 改善倍数 |
|---|---|---|---|---|
| 相同 5000 个 TIMIT 测试样本 | 1 毫秒最小池化包络平均绝对误差 | 0.6261 | 0.0934 | 约 6.6 倍 |
| 同一植入神经元与扩散链路 | 螺旋神经节响应包络失配 | 偏离正常包络较大 | 更贴近正常包络 | 包络对齐改善 |
| 正常响应下采样到 100 带 | 跨通路带数一致后比较 | 作为参考目标 | 作为优化目标 | 仅包络层面 |
| 干净语音 8 kHz 以下 | 未测噪声与竞争说话人 | 未验证鲁棒性 | 未验证鲁棒性 | 不推广到噪声 |
| 允许同时刺激加总电流上限 | 受约束的脉冲幅度序列 | 严格交错 | 并行加扩散建模 | 功耗未评测 |
表后需要解释收益与代价。收益是包络失配大幅下降,支持闭环优化能学到不同于交错刺激的分布与幅度组合。代价与反例同样明确。第一,该指标与训练目标一致,属于训练目标上的成功,不能自动等同于言语可懂度、时间精细结构或噪声鲁棒性提升。第二,可微近似本身有误差,植入神经元近似误差为 5.0%,高于正常侧的 0.85% 与 1.12%,部分失配下降可能受益于近似模型的特定行为。第三,未胜出项是常规策略在简单条件下的可用性与硬件成熟度,本文并行刺激的功耗与真实通道交互尚未在硬件上验证。
若只看模块精度,哪部分最弱并如何影响结论?
论文没有做拿掉某模块后性能必然如何的标准消融,但提供了可微模块精度的分解,可按问题组织。测的是卷积近似相对解析模型的归一化 L1 误差,条件是独立 5000 样本,指标方向越小越好。结果是正常突触 0.85%,正常神经元 1.12%,植入神经元 5.0%。这说明正常通路的参考目标更可信,植入侧的正向仿真本身不确定性更大。
| 评估对象 | 评价指标 | 正常突触模型 | 正常神经元模型 | 植入神经元模型 |
|---|---|---|---|---|
| 相同解析模型生成的数据 | 输入输出行为复刻精度 | 误差最低 | 误差居中 | 误差最高 |
| 电流扩散加多位置激活 | 非线性交互复杂度 | 不涉及扩散 | 声驱动相对简单 | 电驱动更复杂 |
| 对主结论的影响 | 包络改善的可解释性 | 参考目标较稳 | 参考目标较稳 | 需更多生理验证 |
| 未评测边界 | 多模块级联的总误差 | 未单独报告级联误差 | 未对照实验数据 | 待补生理对照 |
表后解释是植入侧误差高并不否定主结果,但限制了因果表述。论文的讨论明确指出,多模块组合行为验证有限,正常与植入响应的部分差异可能反映建模不准确,而非声与电的本质差异。更严格的验证需要对照生理或实验参考数据,并报告级联误差如何传播到最终包络指标。训练中冻结听觉模型的做法使近似误差固定,优化器可能利用近似模型的平滑特性,这是复现时需要记录的适用条件。
哪些结论尚未验证,推广时最易误解什么?
第一个限制是评价单一。论文仅用包络平均绝对误差这一客观度量,它与训练目标一致,只能刻画包络走向的子集,不能覆盖频谱细节、时间精细结构与感知相关特性。若目标是提升可懂度或噪声鲁棒性,需要补充或替换损失与评价指标。
第二个限制是模型验证有限。解析模型来自已有文献,但本文对多模块组合行为的验证不足,缺乏与生理数据的广泛对照。因此 6.6 倍改善是模型内的包络失配下降,不是临床效果的承诺。相关性不等于因果,近似误差不是技术错误,但必须在解读时保留。
第三个限制是数据与频带。训练、验证与测试都用 TIMIT 干净语音,测试虽为未见样本,但仍是同语料、同语言、干净条件。论文明确要求未来用独立数据集、不同语言、非语音刺激与更具挑战的声学条件检验泛化。频带限制在 8 kHz 以下,源于训练数据带宽,未来可用更高采样率数据或替代表示扩展。第四,并行刺激的功耗与真实硬件通道交互尚未评估,不能从仿真中的包络改善推定延迟、功耗或每步都成立。
复现先做什么,需要保留哪些超参数?
复现的第一步是重建数据管线。取 TIMIT 语音,归一化到 70 dB SPL,重采样或保持 20 kHz,切分为 2048 样点窗并在左右各加 256 样点上下文,生成 20000 个序列并留 25% 验证,另留 5000 个独立样本做测试。记录说话人划分,避免测试泄露。所有输入输出按模块缩放到 0 到 1 或负 1 到 1,内毛细胞与神经元相关量缩放 10 倍,突触与植入电流缩放 0.01 倍。
第二步是训练或获取可微模块。基底膜与内毛细胞可沿用已预训练的 dCoNNear 模型,突触与神经元阶段按 L1 损失训练,结构为每堆叠 4 个记忆块、重复 2 次、隐通道 256、卷积核 32,优化器为 Adam,学习率 0.0001,训练 30 轮。验证归一化 L1 误差是否接近 0.85%、1.12% 与 5.0%,若植入侧明显偏大应先检查扩散与带数对齐。
第三步是搭建闭环。固定脉冲宽度 50 微秒、刺激率每电极 5 kHz、电极数 22,电流归一化 0 到 1,总电流因子不超过 1。刺激网络加步长 4 的平均池化以匹配脉冲率,正常响应映射并下采样到 100 带。用 1 毫秒最小池化包络平均绝对误差加权重 0.5 的池化项训练刺激器,同样用 Adam 学习率 0.0001 训练 30 轮,只更新刺激器。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开,复现应按论文文字自行实现并补记缺失的批量大小与随机种子。
何时值得尝试这种闭环,还需补哪项验证?
当研究目标明确是让电诱发神经响应逼近正常响应包络,且能在仿真中显式写出电流扩散与神经元动力学时,这种闭环值得尝试。它把刺激学习变成有生理目标的优化,允许并行刺激并在模型内解释交互,适合做概念验证与策略探索。当目标是直接提升噪声下可懂度、降低功耗或满足实时硬件约束时,不应直接套用本文结论,因为这些量未被测量。
复现成功后最需要补的验证是生理对照与泛化测试。一方面用生理或实验参考数据检验多模块级联行为,区分建模误差与声电本质差异。另一方面用独立语料、其他语言、非语音刺激、带噪与竞争说话人条件检验包络改善是否保持,并补充时间精细结构与感知相关指标。只有在这些验证之后,才能讨论该框架向个体化动态范围、更宽频带与真实硬件的延伸。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 6 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses