英文题目:BeatGain - A Rhythmic Pattern Enhancement Algorithm for Music Listening with Cochlear Implants
会议身份:
conference:interspeech:2026:conference-paper-id:lentz26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#助听器 #信号处理 #主观评测 #音乐 #音乐源分离
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Benjamin Lentz:机构信息未能从会议 PDF 纯文本可靠映射
- Theresa Hartmann:机构信息未能从会议 PDF 纯文本可靠映射
- Anil Nagathil:机构信息未能从会议 PDF 纯文本可靠映射
- Ian Bruce:机构信息未能从会议 PDF 纯文本可靠映射
- Rainer Martin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
人工耳蜗聆听音乐时频谱分辨率受限而时间包络相对保留,输入为包含人声与多乐器的立体声混音,输出为降复杂度且节拍更清晰的重混信号,难点在于切分音等弱拍事件会抬高感知复杂度并干扰主脉冲。BeatGain先用Spleeter将混音分离为人声、贝斯、鼓和其他四路干声,其输出进入Driedger谐波打击声分离以提纯各干声的打击成分。预训练BeatThis!估计四分音符节拍与小节位置并经线性插值得到十六分音符网格,再按四分音符与八分音符位置放大两倍、非网格十六分音符衰减至零构造时变增益信号。该增益仅作用于贝斯、鼓和其他干声的打击成分并与保留人声的干声重混参数叠加,最终重混输出增强信号。与仅整体放大打击乐的重混基线不同,该方法引入度量位置相关的时变调制而非全局频谱加权,因而能选择性稀疏节奏纹理。在10首流行摇滚片段的双选听测评测下,V+2P相对未处理信号的节奏清晰度偏好分数为90.0%,高于BeatGain相对未处理信号的节奏清晰度偏好分数87.6%。结论目前仅适用于4/4拍且四干声均活跃的短片段,未验证其他拍号、真实人工耳蜗用户与长期偏好外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
人工耳蜗听音乐难在哪里?输入目标与必须保留的信息是什么?
本文输入是一段已混音的流行或摇滚音乐波形 x(n),目标是输出一段更适合人工耳蜗聆听的重混波形 y(n)。必须保留的是人声可懂度与整体音乐可辨认性,不能为了突出节奏把歌曲变成只剩鼓点的噪声。
人工耳蜗(cochlear implants,CI)用白话说就是替代耳蜗的电极,直接用电脉冲刺激听神经。它能传送声音包络的起伏,但区分相邻频率的能力即频谱分辨率(spectral resolution)很差,还存在频率位置错配与动态压缩。因此音高与音色受损严重,而时间包络相对完好。
行为证据显示,这类听众偏好节拍清晰、乐器较少、人声鼓贝斯突出的混音。于是增强策略不能指望恢复精细频谱,只能在重混层面做减法与突出:保留人声,简化伴奏,强化与节拍对齐的打击事件。
本文聚焦的矛盾是:以往方法只调各声部整体音量或谐波打击比例,没有显式利用小节内的强弱位置,导致切分等弱拍事件仍会干扰脉冲清晰度。
人工耳蜗 × 频谱分辨率: 人工耳蜗指经耳蜗内电极阵列直接刺激听神经恢复听觉的装置,分工是把声波包络转为电脉冲序列;频谱分辨率指区分相邻频率精细结构的能力,在电听中因电流扩散、频率位置错配和压缩而受限。二者搭配的原因是包络时间线索相对完好而音高音色线索严重受损,因此增强不能依赖精细频谱,只能利用节拍时间结构,BeatGain 选择节奏增强正是该组合意义的直接结果。
本解读的输出是一套可复述的流程:从四声部分离到谐波打击分离,再到节拍跟踪与增益调制,最后到客观与主观验证。学习依赖是先理解电听约束,再理解重混基线,最后理解节拍引导为何是互补而非替代。
已有两条路线做了什么?为什么还要做节奏结构?
第一条路线是声源分离与重混。早期用谐波打击分离把音乐拆成谐波与打击两部分,后来用深度网络把混合拆成人声等独立声部再重混,还有工作把两者结合,对每个分离声部再控制其谐波与打击贡献。
第二条路线是频谱简化,用主成分分析或自适应子空间跟踪对时频表示做稀疏化,突出主旋律。两者结合的研究同时做打击增强与频谱简化,并在噪声下言语可懂度上也显示收益。这些工作的共同点是调频谱平衡与声部权重。
论文指出,节奏清晰不仅取决于打击成分是否响,还取决于它们在时间上的组织。打击事件会与同时的频谱成分互相干扰,对频谱分辨率有限的人工耳蜗听众尤其不利。全局增强节奏声部只能部分缓解。
另一层是节奏自身结构复杂度:从信息论看事件越不规则越难预测,从音乐理论看 4/4 拍一小节 4 个等距拍点构成层级,四分音符位置稳定,强拍缺失而弱拍出现即切分会增加感知复杂度。因此作者假设显式增强时间上强的事件、衰减度量上弱的事件,可以降低节奏复杂度并提高脉冲清晰度。
声源分离重混 × 谐波打击分离: 声源分离重混指先把混音拆为人声、贝斯、鼓、其他 4 个声部再按权重相加,分工是控制乐器间平衡;谐波打击分离指在每个声部内按频谱纹理方向区分横向谐波线与纵向打击瞬态,分工是控制持续音与敲击成分的比例。二者搭配的原因是只调声部无法单独突出鼓点,只做谐波打击分离又无法保留人声主导,组合后才能实现保留人声并抑制伴奏谐波的基线,BeatGain 在此框架上再叠加节拍调制。
这就是 BeatGain 的定位:不是再调 1 次整体音量,而是在已有重混框架内嵌入度量引导的时间调制。
任务如何形式化?只研究哪种节拍?
任务是给定单通道混音 x(n),在保留音乐平衡的前提下输出 y(n),使得节奏复杂度估计下降、节奏清晰度偏好上升,同时与原混音的结构偏离可控。
论文把范围明确限定在常见的 4/4 拍,即每小节四拍、拍点近似等距,可细分为八分与十六分音符。不同位置有权重层级:四分音符与八分音符网格是强而简单的脉冲,中间的十六分音符离网格位置是不稳定、易制造切分的来源。
举例说明:若鼓在正拍上敲而在两拍之间加了细碎加花,后者就是本文要衰减的对象,这只是帮助理解强弱概念的教学例子。
若主歌本身是高度切分的放克节奏,同样的衰减会改变风格,这就是适用边界,教学例子不代表论文测试了该风格。问题不包含歌词识别、多声道重构或实时低延迟约束,评估也不测量误判率与延迟改善。
BeatGain 全景:一个样本如何从输入走到输出?
沿一个样本走完全程有助于建立索引。输入 x(n) 同时进入两路:一路进入 Spleeter 得到人声 v(n)、贝斯 b(n)、鼓 d(n)、其他 o(n) 4 个声部,每个声部再经中值滤波谐波打击分离得到谐波分量与打击分量,共 8 路。
另一路进入 BeatThis!网络估计四分音符拍点及其在小节中的位置,再经线性插值细化为十六分音符时刻 t(k) 与位置 w(k)。底部增益计算模块根据 w(k) 查增益表并生成随时间变化的包络,再按声部缩放到各分量。
每路分量先乘固定重混系数,再乘时变增益,最后在中央加号处求和得到 y(n)。关键设计是只有贝斯、鼓、其他的打击分量跟随节拍包络,人声与其他谐波分量不受时间调制,从而在强化脉冲的同时不破坏人声连续性。
下图为论文提出的 BeatGain 处理管线框图,读图时先抓主路声部分离与侧路节拍跟踪,再看二者在底部增益计算与中央求和处的汇合方式,该对应关系是复述时必须保留的结构特征。
看图路径: 1. 先沿顶部输入 x(n) 经 Spleeter 到四个声部的主路径确认分支结构;2. 再看左侧节拍跟踪到十六分音符插值再到底部增益计算的侧路走向;3. 对比人声支路只有固定加权而贝斯鼓其他支路多出一级时变增益乘法的位置
论文图 2。原论文 Figure 1:“Block diagram of the proposed BeatGain processing pipeline. After stem separation, a rhythm-aware remix proce- dure generates the enhanced output signal y(n).”。
该框图显示顶部长条为声部分离,中间 4 个谐波打击分离盒各分出两路,左侧节拍跟踪经十六分音符插值进入底部增益计算,最终 8 路加权信号在中央加号汇总为输出 y(n)。可见节奏信息不是后处理叠加,而是作为乘性包络嵌入重混求和之前,这是全文复述时必须保留的结构特征。
节拍到增益:位置、窗口与增益表如何算出包络?
节拍侧的具体动作分 3 步。第一步,BeatThis!给出四分音符拍点时刻与小节位置,线性插值得到十六分音符时刻 t(k),离散采样点为采样率与时刻的乘积,k 为全曲连续编号,w(k) 为 1 至 16 的度量位置。
第二步,以每个采样点为中心加汉宁窗,窗长随局部十六分音符时长自适应,相对宽度参数取 0.9,大于 0.5 时相邻窗重叠。第 3 步,用增益表查 w(k) 得到该位置的放大或衰减因子,按原型公式叠加各窗贡献再加偏置,保证未选中位置可衰减到零。
原型包络再按线性缩放规则分配到各分量,缩放系数在 0 至 1 之间,0 为不受影响,1 为全量应用。论文概念验证采用简单可解释的模式:所有对齐到四分与八分音符网格的位置放大 2 倍,网格之间的十六分音符位置衰减到零。
下图为一小节内两种增益模式示例,速度为 60 拍每分钟,读图时注意峰谷对齐的度量位置含义以及蓝色与红色虚线在峰高和谷底上的差异,该差异决定了稀疏化强度。
看图路径: 1. 先确认纵轴为增益 γ(n) 从 0 到 2、横轴顶部为度量位置 1 至 16 的范围;2. 比较蓝色实线在八分音符位置的等高峰与在间隙回到零的谷;3. 观察红色虚线峰高参差且谷底不归零的更复杂对照形态
论文图 1。原论文 Figure 2:“Example gain signals in one measure with a tempo of 60 beats/min.”。
像素显示蓝色实线有 8 个等高峰约达 2,谷底归零,周期对应八分音符间隔;红色虚线峰高参差,谷底约 0.5 不归零。横轴顶部标注 1 至 16 及下一小节 1,底部为 0 至 4 秒时间,纵轴为增益值。这说明蓝色模式强化最规则脉冲并完全抑制离网格事件,红色模式保留更多细节但稀疏化较弱,论文实验采用蓝色正是为了最大化脉冲清晰度的对照效果。
节拍跟踪 × 度量位置: 节拍跟踪指用 BeatThis!网络估计四分音符拍点时刻,分工是给出随速度变化的时间锚点;度量位置指拍点在一小节十六分音符网格中的编号 1 至 16,分工是给出音乐理论上的强弱权重。二者搭配的原因是只有时刻不知道强弱,只有网格不知道速度,组合并经线性插值得到十六分音符时刻 t(k) 和位置 w(k) 后,才能把增益表精确对齐到每一拍的强弱结构上。
原型增益信号 × 声部分量缩放: 原型增益信号指由增益表和汉宁窗叠加生成的公共时间包络 γ(n),分工是定义何时放大何时衰减;声部分量缩放指用系数 gu 按规则调节该包络对每个谐波或打击分量的作用强度,分工是决定谁跟随节奏调制。二者搭配的原因是节奏增强不应作用于人声,组合后仅让贝斯、鼓、其他的打击分量跟随原型包络,既强化主脉冲又保持人声连续,新增作用是节拍选择性稀疏化。
图 2 红色虚线是举例的更复杂模式,对每拍区别对待,八分音乘 1、十六分音乘 0.5,本文实验未采用红线,仅用于说明增益表可表达更细的层级。
本研究训练了什么?没训练的部分如何调用?
本研究没有训练任何新神经网络,必须明确说明以免误解。Spleeter 与 BeatThis!均为预训练深度模型,直接推理调用:前者负责四声部分离,后者在原混音上估计拍点。
谐波打击分离采用基于幅度谱中值滤波的方法,按谱结构垂直或水平取向分类,无需训练,按论文沿用文献配置,分离阶段采样率为 22.05 kHz。真正的构造工作是规则式增益设计与参数冻结。
固定系数丢弃贝斯鼓其他的谐波分量,完整保留人声谐波与打击,仅留打击放大系数 α 为可调;时间调制侧固定蓝色增益表与 0.9 窗宽,仅对上述 3 路打击分量全量应用,其余分量不受影响。推理时对整首曲目离线计算拍点、插值、窗口叠加与加权求和,不存在梯度更新、优化器步骤或重置时机。
未报告项是拍点估计错误时的回退策略与分离失败的检测,复现时应记录拍点置信度并保留原始拍点文件,否则无法区分是增益设计问题还是上游估计问题。也不能从冻结参数推定系统输出确定,因为分离与拍点估计本身仍有不确定性。
实验条件:数据、基线、模拟聆听与指标方向是什么?
客观评估用 IKA 人工耳蜗流行音乐数据集全部 15 段短摘录,均为包含人声鼓贝斯其他的摇滚流行且各声部活跃;主观听试从中选 10 段,要求含比八分音符更细的节奏细分,编号为 3、4、5、6、8、9、10、11、12 和 15。
基线是纯声部重混 V+αP,采用与 BeatGain 相同的固定加权但关闭度量调制;当 α 为 1 记为 V+P,α 为 2 记为 V+2P。BeatGainα 则在相同加权与 α 基础上打开 3 路打击的时间调制,α 为 1 时简记 BeatGain。客观指标有 2 个方向:Buyens 复杂度分数 0 至 100 越低越简单,尺度不变信号失真比越大表示偏离原混音越小。参数在 0 至 5 扫描。
主观采用双选迫选范式,17 名正常听力被试对每对信号就总体印象与节奏清晰度分别表态,信号经 8 通道 Greenwood 刻度带通噪声激励声码器模拟人工耳蜗听觉,频率范围 100 Hz 至 8 kHz,采样率 16 kHz,响度归一到负 27 响度单位,耳机为拜亚动力 DT-770 M,随机顺序呈现。统计用二项检验加 Bonferroni-Holm 校正,显著水平 5%。
资源状态方面,未发现来源绑定且完成验证的资源,不得声称代码模型或数据已公开,演示链接仅为论文脚注提及,本文不作可达性断言。
客观曲线显示了什么权衡?语谱图如何佐证稀疏化?
客观平均结果显示,两种处理都比未处理原信号的平均复杂度大幅降低,BeatGain 在整个 α 范围内复杂度低于纯重混,α 为 1 处最高,α 减小偏向人声或 α 增大增强打击都会降低复杂度,且高 α 区 BeatGain 下降更陡,支持度量引导比均匀放大更有效地稀疏节奏。
尺度不变信号失真比同样在 α 为 1 附近最大,偏离两侧失真增大,BeatGain 略低于纯重混,反映额外时间调制带来结构改动。论文据此指出存在权衡:超过一定程度降低复杂度必然更偏离原混音,极端 α 不合适。
复杂度估计 × 尺度不变信号失真比: 复杂度估计指 Buyens 等人用速度、粗糙度、脉冲清晰度等加权得到的 0 至 100 感知复杂度分数,分工是回答音乐是否更简单清晰;尺度不变信号失真比指补偿整体电平后衡量处理信号偏离原混音的结构失真,分工是回答是否改得过多。二者搭配的原因是只看复杂度会鼓励过度简化,只看失真会阻碍任何增强,组合才能揭示以 α 为参数的权衡曲线,BeatGain 的价值正在于用略增失真换取更低复杂度。
下图为 4 种版本语谱图对比,阅读前先确认四面板共享频率与时间轴以及右侧分贝颜色刻度,再对比横向谐波线与纵向打击线的保留与去除情况,该视觉证据与复杂度分数的机制解释相互印证。
看图路径: 1. 先确认四块面板共享纵轴频率 0 至 5 kHz 与横轴时间 0 至 4 秒及右侧分贝刻度;2. 比较最左原混音弥散底色与处理后面板深蓝背景上凸显的横竖亮线;3. 重点看最右 BeatGain 面板中竖向打击线更稀疏且横向谐波残留更少的区域
论文图 3。原论文 Figure 3:“Spectrograms of original music signal excerpt and different processed versions of the music piece “Invisible Familiars - Disturbing Wildlife” (sample 6 from the IKA CI Pop Music…”。
四面板从左到右为原信号、V+P、V+2P、BeatGain,曲目为样本 6 的 Invisible Familiars 片段。可见原图背景浅蓝弥散且横向谐波线密集,处理后背景转深蓝,贝斯衰减与谐波线消失如 1.2 至 2.3 秒段,人声横线如 0.5 至 1.5 秒保留,竖向打击线在 V+P 中仍密而不规则,在 V+2P 中整体增亮,在 BeatGain 中最稀疏且对比最强。这与复杂度下降的机制解释一致。
可运行策略间的比较:打击放大量与节拍引导各贡献多少?
要回答比较问题,需固定声码器与响度归一条件,比较 4 个可运行策略:未处理、V+P、V+2P、BeatGain。指标方向是第一方法偏好百分比越高越受偏好,单位为百分比,显著性以星号数量表示证据强度。
下表按原文图 5 数值整理,偏好数值为裸值、单位见表头,显著性按原文星号标注,星号越多证据越强,表内同时覆盖总体印象与节奏清晰度两个评价维度。
| 对比 | 总体印象第一方法偏好 / % | 节奏清晰度第一方法偏好 / % | 总体显著性 | 节奏显著性 |
|---|---|---|---|---|
| BeatGain 对 V+2P | 52.4 | 59.4 | 不显著 | p 小于 0.01 |
| V+2P 对 V+P | 72.9 | 83.5 | p 小于 0.001 | p 小于 0.001 |
| BeatGain 对 V+P | 58.8 | 71.2 | p 小于 0.05 | p 小于 0.001 |
| V+2P 对 未处理 | 77.6 | 90.0 | p 小于 0.001 | p 小于 0.001 |
| BeatGain 对 未处理 | 69.4 | 87.6 | p 小于 0.001 | p 小于 0.001 |
| V+P 对 未处理 | 71.8 | 85.9 | p 小于 0.001 | p 小于 0.001 |
表后解释是:所有处理都显著优于未处理,说明重混基线本身已有效;V+2P 显著优于 V+P 说明单纯把打击从 1 倍提到 2 倍就有收益;BeatGain 对 V+P 在 2 维度都显著,说明节拍引导超出基线。关键差异在 BeatGain 对 V+2P,总体印象 52.4 未达显著而节奏清晰度 59.4 达显著,支持节奏专项改善不必然等比转化为总体偏好。未胜出项必须指出:总体印象上 BeatGain 未能显著击败均匀放大的 V+2P,这是复现时不应夸大的边界。
下图为对应条形图,读图前先区分上下两组评价维度与横轴百分比范围,再逐行核对条形长度、前端数值与星号,该视觉对比可直接支撑上表的增量收益判断。
看图路径: 1. 先区分上半总体印象与下半节奏清晰度两组横向条形图的指标含义;2. 逐行核对条形前端白色数字即第一方法偏好数值与右侧星号显著性;3. 重点比较每组第一行 BeatGain 对 V+2P 在长度与星号上的组间差异
论文图 4。原论文 Figure 5:“Preference scores (in percent) for the first method over the second method based on (a) overall impression and (b) rhythmic clarity.”。
像素显示上组总体印象条形普遍短于下组节奏清晰度,BeatGain 对 V+2P 在上组最短且无星号,在下组变长且带两星;V+2P 对未处理在下组达 90.0 为全图最长。这直观表明节奏维度的效应量大于总体印象,且均匀放大已是强基线,节拍引导是增量收益而非颠覆。
哪些条件未验证?相关性与因果如何区分?
论文直接报告的是正常听力者经声码器模拟后的偏好与复杂度估计下降,这支持方法有效,但可能待验证的是真实人工耳蜗用户的偏好是否一致,原文讨论也呼吁在该人群中进一步验证。
未验证的推测包括其他增益模式、非 4/4 拍、按信号特征或听者个性化的参数,以及对言语可懂度的迁移,文中仅作展望,不能当作已证结论。缺失证据不是技术错误:未测量延迟、计算开销、拍点错误率,不承诺实时可行。
声码器 8 通道与特定响度归一是模拟选择,不等同于临床设备。总体趋势不等于每段每步成立,个别高度切分曲目可能因抑制弱拍而改变风格,复现时应分曲目报告而非只看平均。相关性不等于因果,复杂度分数下降与偏好提升并存不能直接证明前者导致后者。
复现先做什么?关键超参数与信息条件有哪些?
复现的第一步是准备数据与基线:获取 IKA 数据集 15 段摘录,按论文选出 10 段子集,分离阶段统一到 22.05 kHz 做声部分离与谐波打击分离,听试前再按声码器要求重采样到 16 kHz 并做响度归一。先跑通两个可运行基线,再打开节拍调制得到目标方法。
下表整理复现必须冻结的配置,数值与单位保留原文写法,裸值不擅自添单位,指标单位按原文在条件列与备注中交代,表中同时覆盖数据、模型与听试 3 类信息条件。
| 条件 | 参数取值 | 作用对象 | 指标或单位 | 备注 |
|---|---|---|---|---|
| 增益窗相对宽度 | 0.9 | 十六分音符窗长 | 相对比值 | 大于 0.5 致重叠 |
| 分离采样率 | 22.05 kHz | 声部分离与谐波打击分离 | kHz | 沿用文献配置 |
| 声码器采样率 | 16 kHz | 模拟聆听 | kHz | 8 通道带通 |
| 声码器频段 | 100 Hz 至 8 kHz | 模拟聆听 | Hz 至 kHz | Greenwood 刻度 |
| 响度归一 | -27 LUFS | 试听电平 | LUFS | 均衡响度 |
| 被试规模 | 17 人均龄 29.4 岁 | 主观偏好 | 岁与人数 | 正常听力 |
| 参数扫描 | 0 至 5 | 打击放大量 | 无量纲 | 1 为默认 |
| 未处理复杂度 | 27 | 客观参照 | % | 图中省略以利显示 |
表后说明是:任何一步都要保存拍点文件与增益包络以便回查;若拍点错位,应先检查拍点估计输出而非调增益表。还需补的验证是真实用户听试、拍点鲁棒性测试与计算耗时记录,论文未提供代码可运行断言,复现不应假设一键可跑。被试标准差与样本编号等细节应与原文核对,避免把模拟条件误读为临床条件。
何时值得尝试 BeatGain?一句话收束是什么?
当听众是频谱分辨有限但包络跟随较好的人群、曲目以 4/4 拍流行摇滚为主、且已有声部分离重混管线时,值得尝试在 3 路打击上加入本文的八分网格增强与十六分间隙抑制。
若曲目切分是风格核心、拍点估计不可靠或需严格保真原混音,则应谨慎或先做分曲目试听。常见误解是把均匀调响打击等同于节奏增强,本文证据表明两者分工不同:前者提高整体显著性,后者通过度量位置做时间稀疏化,总体印象的未显著差异恰好说明音乐偏好是多维的。
收束是:BeatGain 用简单的节拍引导在可接受的失真代价下降低复杂度并显著改善节奏清晰度,是重混框架的有益扩展,但向临床与多拍号推广仍需补真实用户与鲁棒性证据。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



