英文题目:Relative Importance of Formants to the Intelligibility of Vocoded Speech in Cochlear Implant Simulation
会议身份:
conference:interspeech:2026:conference-paper-id:cai26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#心理声学实验 #言语感知 #语音 #语音可懂度评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Ying Cai:机构信息未能从会议 PDF 纯文本可靠映射
- Yuting Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Xuefei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Fei Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究普通话句子在人工耳蜗模拟下仅靠前三个共振峰轨迹维持可懂度的能力,输入为普通话 Hearing in Noise Test男声句子,输出为逐词复述正确率,难点在于包络提取与频带粗化后难以分离各共振峰的语言学贡献。处理链分三步衔接:先用线性预测编码按16毫秒Hanning窗、50%重叠逐帧提取共振峰频率与幅度轨迹并合成为正弦波语音,再将该稀疏信号送入预加重、分带包络提取与噪声调制的噪声声码器,最后在宽带与3种声码器配置下组织10名母语听者完成16条件句子识别。与既有宽带正弦波研究相比,机制差异在于把缺失一个共振峰的对照嵌入可配置的植入处理,借此观察频谱与时间约束如何重塑感知权重。在宽带非声码器条件下,缺失F2条件的句子识别分数为31.4%,低于全保留F1F2F3条件的句子识别分数97.2%。高分辨率声码器保持该排序,降低包络截止频率使F1与F2差距缩小至不显著,减少频带数则发生翻转使F1权重超过F2。结论边界限于安静环境、普通话单男声与模拟听者,噪声掩蔽、非声调语言泛化及频率与强度线索分离尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要回答哪两个问题?
本文的输入是普通话听力测试句材料,目标是测出句子可懂度。研究者先把原始语音压缩成只保留前 3 个共振峰轨迹的正弦波语音,再把这些正弦波句送进噪声声码器,模拟人工耳蜗语音处理器的分带包络处理。输出是听者复述出的正确词比例。全文围绕两个目标展开。第一是相对重要性:在模拟耳蜗条件下,第一、第二、第三共振峰轨迹中哪一条对可懂度贡献最大。
第二是参数调节:声码器的频带数和包络截止频率是否会改变上述排序。必须保留的关键信息是:被试是 10 名 19 到 25 岁母语为普通话的正常听力年轻人,材料是男性说话人录制的普通话听力噪声测试句,每句 10 个音节,每种实验条件用 10 句且不重复,听者最多重放 3 遍后复述。声码器条件包括宽带未声码器、8 频带 200 赫兹截止、8 频带 100 赫兹截止、4 频带 200 赫兹截止 4 种,共振峰条件包括保留全部 3 条的 F1F2F3 和每次去掉一条的 F1F2、F1F3、F2F34 种,共 16 种组合。
最终结论是总体上第二共振峰最重要、第三共振峰影响最小,但频带减少到 4 个时第一共振峰反而变得更重要。本文没有训练神经网络,没有提供可运行代码,资源状态为本次未发现可用公开资源,因此复述时只讲刺激构造和听辨流程。
此前关于包络和共振峰的研究走到了哪一步?
人工耳蜗领域此前大量工作集中在时间包络上。原文回顾指出,多数处理器提取多个频带的时间包络去调制电脉冲串,已有模拟和临床研究显示在安静下有限的包络信息足以支撑基本理解。但在噪声和混响下包络不够用,原因之一是电极数通常不超过 20 多个导致频谱分辨率远粗于正常听觉,其二是标准策略丢弃时间精细结构和相位。另一条路线是正弦波语音。
原文引用早期工作说明,用跟踪共振峰的调频调幅正弦波替代原始语音,可以去掉谐波结构和基频轮廓,只留下稀疏的声道信息,而普通话母语者仍能达到较高的句子识别率。已有对正常听力者的研究进一步比较前 3 个共振峰,发现第二共振峰轨迹最关键,第三共振峰影响最小,还有通过增强第二共振峰峰值改善元音分辨的报道。
本文的衔接点很明确:此前关于共振峰权重的工作多在宽带非声码器语音上完成,缺少在模拟耳蜗分辨率下是否成立的检验,也缺少处理器参数如何调节权重的系统比较。因此本文不是重复验证包络够用,而是把共振峰删除范式搬进声码器框架。
为什么要先做正弦波再做声码器,两步各解决什么混淆?
如果直接对原始语音做声码器处理并测可懂度,无法分离出共振峰的单独贡献,因为原始语音同时含有基频、谐波、 burst、摩擦噪声等多种线索。第一步做正弦波合成,就是用线性预测编码分析逐帧提取共振峰频率和幅度轨迹,再用正弦波重新合成。这样得到的刺激只剩 3 条轨迹,听者能听懂就说明这 3 条轨迹本身携带了足够的语言信息。第二步再做噪声声码器处理,是为了施加人工耳蜗特有的信息瓶颈:分带、整流、低通取包络、噪声调制、再滤波叠加。
这样可以观察同样的共振峰缺失在高分辨率和低分辨率下损失是否相同。举例说明:比如条件 F1F3 表示只保留第一和第三共振峰轨迹、删掉第二共振峰,如果该条件得分远低于保留全部 3 条的 F1F2F3,就把差值归因于被删的第二共振峰。这里的例子只是帮助理解条件命名,不代表原文报告了该例的具体数值。真正的数值比较必须回到后文结果表中的原文数据。
从一句话到可懂度分数,完整链条是怎样的?
拿原文示例句他刚才讲话时吞吞吐吐走完全程。输入是男性说话人录制的宽带原句,频谱上表现为从低频到高频连续分布的能量,浊音段在低频有很强的谐波和基频结构,清擦音在高频有弥散噪声。接着做正弦波化:用 16 毫秒汉宁窗、帧间 50% 重叠做线性预测编码分析,逐帧估计前 3 个共振峰的中心频率和幅度,生成 3 条随时间起伏的正弦波。此时频谱只剩 3 条细轨迹,分别对应 F1、F2、F3。再按 4 种共振峰条件生成刺激:全部保留,或删掉 F3、删掉 F2、删掉 F1。
然后做声码器处理:先经 1200 赫兹截止的 1 阶高通预加重,再送入覆盖 80 到 7600 赫兹的 4 或 8 个 4 阶巴特沃斯带通滤波器组,每带全波整流加 100 或 200 赫兹截止的 4 阶巴特沃斯低通提取包络,用包络调制白噪声后再经同带带通滤波,最后各带叠加并把均方根能量缩放到与输入一致。
最后做听辨:被试在隔声室用左侧头戴耳机在舒适级听音,先用 40 句非实验句在 8 频带 200 赫兹截止的 F1F2F3 条件下带反馈练习,再随机顺序测 16 种条件,每条件 10 句不重复,每句最多听 3 遍,复述出尽可能多的词,得分是 10 句中正确词数除以总词数。 下面先看 3 类语谱长什么样,再对应到上述 3 步。
看图路径: 1. 先看三块子图的横轴时间 0 到 2.5 秒和纵轴频率 0 到 8 千赫兹是否一致;2. 再对比子图 a 宽带语谱的弥散能量与子图 b 三条稀疏正弦轨迹的对应位置;3. 最后看子图 c 声码器版本在 1 到 5 千赫兹附近的纵向模糊条带如何变粗
论文图 1。原论文 Figure 1:“Example spectrograms of (a) a wideband (non-vocoded) speech (‘ta1 gang1 cai2 jiang3 hua4 shi2 tun1 tun1 tu3 tu3’ in Mandarin, or ‘He was stammering when he spoke just now’ in…”。
图 1 给出同一句话的 3 种形态。子图 a 是宽带原句,能量从 0 到 8 千赫兹连续分布,低频浊音条带很黑,高频也有摩擦和瞬态成分。子图 b 是只含前 3 个共振峰的正弦波版本,能量收缩为三簇随时间弯曲的细轨迹,大致分布在 3 千赫兹以下,高频弥散成分消失,这正是去掉谐波和基频后剩下的最小结构。子图 c 是再经噪声声码器后的版本,轨迹变粗变模糊,时间上出现纵向条带感,说明分带包络调制把细线抹成了带限噪声的起伏。理解这张图就能理解后文比较的公平性:4 种共振峰条件的区别只在于 b 阶段少了哪条线,而 4 种声码器条件的区别只在于 c 阶段抹得多狠。
正弦波合成与噪声声码器各自做了什么计算?
正弦波合成组件的输入是原始波形分帧,操作是线性预测编码分析估计共振峰,输出是 3 条频率和幅度都随时间变化的正弦波之和。原文明确给出窗长 16 毫秒汉宁窗、50% 重叠,并引用外部网站的合成代码,但本次未验证该链接可达,不作为可用资源陈述。噪声声码器组件的输入是上述正弦波句,操作分 5 步:预加重、分带带通、全波整流加低通取包络、包络乘白噪声、同带再滤波后求和并做均方根能量归一。关键参数是频带数取 4 或 8,包络低通截止取 100 或 200 赫兹。滤波器均为 4 阶巴特沃斯,频率范围固定为 80 到 7600 赫兹。
共振峰 × 正弦波语音: 共振峰负责提供声道谐振决定的频谱峰位置随时间变化的语言学信息,正弦波语音负责把这种信息提纯为只跟踪共振峰中心频率和幅度的 3 条正弦波,二者搭配的理由是去掉基频、谐波结构和细微频谱细节后仍能测出共振峰本身对可懂度的贡献,组合意义是得到可逐条删除 F1、F2、F3 的最小可懂语音材料。
时间包络 × 噪声声码器: 时间包络负责携带每个频带内能量随时间起伏的慢变信息,噪声声码器负责模拟人工耳蜗处理即分频带提取包络再用包络调制噪声并叠加,二者搭配的理由是现有人工耳蜗策略主要传包络而丢弃时间精细结构,组合意义是把正弦波句进一步退化为频谱分辨率受限的模拟耳蜗听感。
沿样本走一遍有助于固定指代:同一句吞吞吐吐先被压缩成 3 条线,再按删除方案只留两条线,最后被声码器抹成带限噪声。后文说去掉 F2 最伤,指的就是在第二步少了中间那条线后,第 3 步和听辨阶段的可懂度下降最大。
本研究有没有训练模型,实际计算和练习过程是什么?
本研究没有训练任何神经网络或声码器参数,不存在梯度、优化器、冻结与更新、早停等概念,也不能把无训练理解为确定性求解。真实计算过程是信号处理仿真加人工听辨。仿真部分是确定性滤波和包络运算,给定同一输入和同一组截止频率就能重算出同一波形,但听辨分数仍受被试状态和随机试次顺序影响。
练习过程是每名听者在正式测试前先听 40 句非实验句,条件固定为声码器 8 频带 200 赫兹截止的 F1F2F3 并给反馈,目的是熟悉正弦波加声码器的失真音质,减少学习效应污染正式比较。正式测试的 16 个条件随机排序,且句子在条件间不重复,避免同一句话被反复听到带来的记忆效应。统计前先把百分比分数经合理化反正弦变换转为合理反正弦单位再做方差分析,显著性用重复测量方差分析和事后两两比较,去掉一条共振峰的 3 组比较采用邦费罗尼校正后阈值为 0.017。
频带数 × 包络截止频率: 频带数负责决定频谱划分有多粗即模拟电极通道多少,包络截止频率负责决定每个带内保留多快的时间起伏即低通滤波上限取 100 赫兹还是 200 赫兹,二者搭配的理由是它们分别从频域和时域限制人工耳蜗能传的信息量,组合意义是可以检验共振峰重要性排序是否随处理器参数改变。
理解这组参数搭配才能读懂后文交互作用:频带数改变主要压缩频域分辨率,截止频率改变主要限制时域起伏速度,二者都会改变 F1 和 F2 谁更易被保留。
被试、材料、条件与指标如何保证可比?
被试是南方科技大学便利抽样招募的 10 名正常听力普通话母语者,6 男,年龄 19 到 25 岁,均值 22 岁,均给予报酬,并经学校伦理委员会批准。材料取自普通话听力噪声测试数据库,共 24 个表,每表 10 句,每句 10 个音节,由基频 75 到 180 赫兹的男性说话人录制。实验在隔声室单耳左侧呈现。指标是每条件 10 句中正确复述词数占比,纵轴为正确率百分比,越高越好,误差条为均值正负 1 倍标准误。显著性标记中 S 表示配对差异显著,ns 表示不显著。
比较的公平条件是:比较不同共振峰时固定声码器参数,比较不同声码器参数时固定共振峰组合,且句子不跨条件重复、顺序随机、重放次数上限一致。原文还报告了频带划分的具体截止点,这是复现滤波器组的关键。 下面整理声码器滤波器参数,提出的问题是不同频带数是否只是通道数不同还是划分点也不同,公平条件是预加重和总频率范围一致,指标方向不涉及好坏只涉及复现精度。
| 参数 | 8 频带划分点 | 4 频带划分点 | 共同设置 | 在链条中的作用 |
|---|---|---|---|---|
| 预加重高通 | 1200 Hz | 1200 Hz | 1 阶高通 | 提升高频再分带 |
| 总频率范围 | 80 to 7600 Hz | 80 to 7600 Hz | 4 阶巴特沃斯带通组 | 限定模拟耳蜗频段 |
| 带通截止序列 | 80, 212, 416, 730, 1214, 1960, 3108, 4876, 7600 Hz | 80, 416, 1214, 3108, 7600 Hz | N=4 and 8 | 决定频谱分辨率 |
| 包络低通 | 100 or 200 Hz | 100 or 200 Hz | 4 阶巴特沃斯加全波整流 | 决定保留多快的时间起伏 |
| 输出归一 | 与输入均方根一致 | 与输入均方根一致 | 白噪声调制后叠加 | 保证响度可比 |
表后解释:8 频带划分更密,4 频带划分更粗,但都覆盖 80 到 7600 赫兹且都先经 1200 赫兹预加重,因此分辨率差异可归因于带数本身。
主要代价是频带减半会大幅拉低整体可懂度,后文结果显示 8 频带显著高于 4 频带。未胜出项是 4 频带条件,它不是失败实现,而是用来暴露低分辨率下权重翻转的必要边界。
去掉哪条共振峰最伤句子识别,声码器损失有多大?
核心问题是测什么:固定声码器时删掉不同共振峰的损失;与谁比:以保留全部 3 条的 F1F2F3 为上限基准;条件是否一致:同一子图内声码器参数相同;指标方向:正确率越高越好。宽带下 3 条全保留达最高,删 F3 只轻微下降,删 F1 或 F2 则大幅下降,且删 F2 最低。
声码器 8 频带 200 赫兹截止下同样是删 F3 损失小、删 F2 损失最大,3 组配对差异均显著。把宽带与该声码器条件做双因素重复测量方差分析,声码器主效应和共振峰主效应均显著,交互不显著,事后显示宽带显著高于声码器,说明声码器本身带来整体损失,但未改变 F2 最重要的排序。 下面先看 4 种处理下的柱状结果,再回到数字表核对宽带基准。
看图路径: 1. 先确认四个子图纵轴都是正确率百分比,横轴都是 F1F2、F1F3、F2F3、F1F2F3 四种共振峰条件;2. 再看每个子图内 F1F3 柱最低还是 F2F3 柱最低,判断缺 F2 还是缺 F1 更伤;3. 最后对比子图上方标注为显著性的横线 S 与非显著性 ns 出现在哪些配对上
论文图 2。原论文 Figure 2:“Sentence recognition scores under (a) wideband (non-vocoded), (b) vocoded (N=8, fcut-off=200 Hz), (c) vocoded (N=8, fcut-”。
图 2 有 4 个子图。子图 a 是宽带,F1F2F3 白色柱最高,F1F2 次高,F2F3 中等,F1F3 最低,3 条显著性横线均为 S。子图 b 是 8 频带 200 赫兹截止,排序形状与 a 相似,仍是缺 F2 的 F1F3 最低,3 组均为 S。子图 c 是 8 频带 100 赫兹截止,F1F2 仍明显高于另两组,但 F1F3 与 F2F3 之间标为 ns 即差异不显著,说明降低截止频率后 F1 与 F2 的差距缩小。子图 d 是 4 频带 200 赫兹截止,整体高度大幅压低,且最低柱从 F1F3 变为 F2F3,意味着此时缺 F1 比缺 F2 更伤,3 组均为 S。
读图时注意纵轴都是正确率百分比,柱高下降即性能下降,但跨子图比较还需结合方差分析的显著性,不能只看柱高。 为避免只记形状不记数值,下面用原文连续句覆盖的宽带数字建表,比较问题是删哪条损失多大,公平条件是同为宽带非声码器,指标方向为正确率越高越好。
| 条件 | 保留轨迹 | 去掉轨迹 | 句子识别率 | 相对基准的损失含义 |
|---|---|---|---|---|
| F1F2F3 | F1, F2, F3 | 无 | 97.2% | 上限基准 |
| F1F2 | F1, F2 | F3 | 85.7% | 轻微下降 |
| F2F3 | F2, F3 | F1 | 50.7% | 大幅下降 |
| F1F3 | F1, F3 | F2 | 31.4% | 下降最大 |
表后解释:该表显示 F3 影响最小,F2 最重要,F1 居中。
主要收益是确立了后文声码器比较的基准形状。具体代价是即使只删一条,删 F1 或 F2 都会把接近满分的识别率拉到 50% 左右或更低,说明两条低频轨迹缺一不可。未胜出项 F1F3 得分最低,它恰恰证明了 F2 的价值,而不是方法失败。
宽带语音 × 声码器语音: 宽带语音负责给出未做声码器退化的正弦波句基准可懂度,声码器语音负责给出经过分带包络调制后的退化可懂度,二者搭配的理由是只有在同一组共振峰删除条件下对比才能分离出声码器处理本身的损失,组合意义是判断 F2 主导的结论在正常分辨率和模拟耳蜗分辨率下是否一致。
包络截止频率和频带数如何改写 F1 与 F2 的排序?
除核心结果,论文特有的第二类细节是参数调节的交互作用。先看包络截止频率:固定 8 频带,比较 200 赫兹与 100 赫兹。方差分析显示截止频率主效应不显著,数值为 F1,9 等于 1.65、p 等于 0.231,共振峰主效应显著,交互显著 p 等于 0.043。事后除 F1F3 条件下两截止有差异外,其余配对无显著差异。但关键变化在相对排序上:200 赫兹时 F1F2 与 F2F3 差异显著,而 100 赫兹时该配对变为不显著,说明 F1 与 F2 的差距被抹平。
再看频带数:固定 200 赫兹截止,比较 8 频带与 4 频带。方差分析显示带数主效应显著,F1,9 等于 159.78、p 小于 0.0001,共振峰主效应和交互均显著,事后 8 频带显著高于 4 频带。关键翻转在 4 频带下删 F1 的 F2F3 条件反而低于删 F2 的 F1F3 个条件,即 F1 变得比 F2 更重要。原文解释为低谱分辨率对 F1 和 F2 的退化程度不同。
第一共振峰 × 第二共振峰: 第一共振峰负责主要与开口度和元音高低相关的低频能量轨迹,第二共振峰负责主要与舌前后位置相关的中频轨迹,二者搭配做删除对比的理由是单独去掉 F1 或 F2 后剩下的两条轨迹不同,可直接读出哪条缺失更伤句子识别,组合意义是发现默认条件下缺 F2 更伤,但在 4 频带时缺 F1 反而更伤。
这里要区分直接报告与有限解释:翻转现象是报告显示的柱高和显著性支持的,有限解释是谱分辨率差异导致权重变化,可能但需进一步验证频带划分位置的影响。适用条件是安静下普通话正弦波句,不能推广到噪声或英语。
哪些边界没有测,不能推出什么因果?
原文明确留了 3 个未评测边界。第一是只在安静下测试,噪声掩蔽很可能调节共振峰权重和整体识别率,因此不能把 F2 最重要的结论推广到噪声或混响。第二是只用普通话这种声调语言,音高感知对可懂度有额外支撑,是否适用于英语等非声调语言待验证。第三是正弦波合成同时保留了频率和幅度信息,没有分离两者贡献,此前有研究称某些条件下去掉幅度线索不显著影响正弦波可懂度,但在本研究的声码器框架下频率与强度各自多重要尚未检验。
此外样本仅 10 名年轻人、每条件仅 10 句,统计上依赖重复测量和反正弦变换,个体差异和句子难度的影响不能忽略。相关性不等于因果:观察到 4 频带下 F1 更重要,不等于增加频带必然单调恢复 F2 优势,中间带数未测。未测量延迟、功耗和真实植入者表现,因此不能承诺改变频带分配就能改善临床可懂度,只能说为处理器设计提供了待验证的线索。
要复现这套刺激和流程,先做什么、保留哪些参数?
复现先做材料准备:获取普通话听力噪声测试句中男性说话人录制的 10 音节句,划分出练习用的 40 句和正式 16 条件各 10 句共 160 句加备用,确保句子不跨条件重复。接着做正弦波合成:用 16 毫秒汉宁窗、50% 重叠做线性预测编码分析提取前 3 条共振峰轨迹,合成 F1F2F3、F1F2、F1F3、F2F34 种版本,注意保留频率和幅度双信息。
然后做声码器:预加重 1200 赫兹 1 阶高通,总带 80 到 7600 赫兹,4 频带截止取 80、416、1214、3108、7600 赫兹,8 频带截止取 80、212、416、730、1214、1960、3108、4876、7600 赫兹,每带 4 阶巴特沃斯带通、全波整流、4 阶巴特沃斯低通取包络,截止取 100 或 200 赫兹,包络调制白噪声后同带再滤波叠加并做均方根归一。测试时用隔声室左侧耳机舒适级,先做 40 句 8 频带 200 赫兹 F1F2F3 带反馈练习,再随机顺序测 16 个条件,每句最多放 3 遍,计正确词占比并做合理化反正弦变换后再统计。
还需补的验证是:补充噪声条件、补充英语材料、分离频率与幅度线索,并记录被试听力阈值和呈现声压级以保证可比。代码与数据状态为本次未发现可用公开资源,不写已公开。
何时值得借用这套删除范式,记住哪条可操作的结论?
当你的问题是频谱信息在低分辨率下谁更关键,而不是包络够不够用时,值得借用先正弦波提纯再声码器退化的两步删除范式。它用最少的轨迹数给出可解释的排序:默认 8 频带和宽带下优先保 F2,其次保 F1,F3 可优先舍去;但当通道很少如 4 频带时,要重新校准,因为此时 F1 的缺失更致命,降低包络截止到 100 赫兹也会缩小 F1 与 F2 差距。
实际做处理器设计时,一方面要保留人类语音自然的共振峰层级,另一方面可通过频带分配去维持目标共振峰的显著性,但这只是论文支持的设计启示,不是已验证的临床增益。初学者复述方法时应能说清:输入是什么句子、两步处理各丢了什么、16 条件如何交叉、指标方向和统计阈值是什么,以及安静普通话边界之外还需要补噪声和跨语言验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

