英文题目:Head-Worn Dipole Microphone Array-based Speech Enhancement System for Single-Sided Deafness
会议身份:
conference:interspeech:2026:conference-paper-id:takaki26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#助听器 #波束成形 #麦克风阵列 #语音增强
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Ken Takaki:机构信息未能从会议 PDF 纯文本可靠映射
- Kouei Yamaoka:机构信息未能从会议 PDF 纯文本可靠映射
- Yoshihiro Kawahara:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
单侧聋患者的核心困难是聋侧直接侧向来话听不清,而传统助听器多增强前方声源,输入为眼镜端多通道混合语音与多方向竞争噪声,输出为侧向目标语音的增强信号。本文构建眼镜式偶极子与全向混合阵列,先由4全向加4偶极子同步采集并经光纤转接进入计算机,再在假头上实测全方位传递函数以刻画头部遮挡,最后以最小方差无失真响应波束成形器进行侧向指向增强。与共位全向阵列相比,该组合利用偶极子天然侧向8字形指向弥补了小孔径阵列对侧向敏感度不足的问题,具有物理指向与阵列增益叠加的意义。在TIMIT语料四方向言语形噪声评测条件下,2偶极子加1全向波束成形的SDR为3.06 dB,高于3全向波束成形的SDR 2.28 dB。该结论仅限消声室传递函数加仿真混合的离线评估,未验证真实混响、多说话人与佩戴误差下的外推能力。因此其适用边界尚未验证真实混响与佩戴偏移下的失败条件。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
单侧聋用户真正听不清的是哪个方向?
输入是这篇 Interspeech 2026 展示论文的正文证据与两张官方原图像素,目标是让刚进入语音音频领域的研究生能核对条件、复述方法并理解适用边界,必须保留的关键信息是硬件布放、信号采集链路、波束形成器定义、仿真协议与按角度展开的指标。本文输出按学习依赖从任务矛盾讲到硬件全景、组件计算、构造与仿真、实验条件、结果与反证,最后给出复现清单。
单侧聋用白话说就是一侧耳朵基本失效,另一侧正常,困难不在听不到正前方的说话人,而在听不到聋侧正侧方大约 90 度方向的说话人。传统助听的英文叫 forward directionality,前向指向性,即把增强波束对准听者正前方,压制侧方和后方。对双耳听力下降者这很合理,但对单侧聋用户等于把本来就弱的侧方进一步放小。论文引用的用户体验工作指出问题方向是正侧方而不是正前方,这就决定了后续硬件不能沿用前方差分波束形成,而要把敏感轴转到侧面。
单侧聋 × 前向增强: 单侧聋指一侧耳基本听不到、同侧正侧方来话最难捕捉的需求侧分工,前向增强指传统助听把波束对准正前方以压制他向干扰的供给侧分工,两者搭配的矛盾在于前向波束的零陷和增益分配并不覆盖正侧方,因而需要把波束设计目标从前方改到侧方,组合意义是明确评价必须按入射角展开而不是只看前方信噪比。
从可复述的角度,先记住一个样本的走向:聋侧正侧方来一段语音,同时对角方向来成形噪声,头戴眼镜阵列同时拾取两者,多通道信号进电脑做侧向保真的波束形成,最后经耳机回放给用户。评价不是只报一个平均分,而是把语音入射角扫一圈,看侧向是否提升、前方是否退化。这个角度依赖的思维是全文的纲,后面所有硬件选择和仿真设置都围绕它展开。
同输入同目标的已有路线差在哪里?
按同输入、同目标、同运行阶段对照,已有路线主要有两条。第一条是助听器常用的指向性麦克风或多全向差分波束形成,输入同样是头戴多通道,目标同样是提升目标语音,但运行阶段把波束固定在前方。第二条是智能眼镜上的头戴全向阵列波束形成,探索了眼镜形态的语音增强,但同样没有把评价重点放在侧向可懂度。论文的差异不是换了一个更大的神经网络,而是换了传感器物理:引入偶极麦克风,让单个振膜本身就对侧向有区分力。
这种对照不能直接读成谁胜谁负,因为目标方向不同。前向系统在前方指标上天然占优,侧向系统在侧向指标上占优,只有在同一目标角、同一噪声布局、同一通道数约束下比较才公平。论文为此设置了同位置的三全向阵列作为直接对照,并在同一仿真协议下比较三偶极与混合配置,这才是可运行策略之间的比较。类别差异本身不是胜负证据,后文结果必须按角度分别解读。
要解决的输入输出与约束是什么?
论文要解决的任务可以形式化为侧向语音增强。输入是眼镜侧边线阵列拾取的多通道含噪语音,目标语音方向在评价时围绕听者扫描,重点是 90 度正侧方;干扰是来自正负 45 度与正负 135 度 4 个对角方向的语音形噪声。输出是单通道增强语音,经耳机监听。约束包括可穿戴形态、实时演示、通道数有限,以及头部遮挡带来的左右不对称传递函数。
举一个教学例子帮助理解,但不代表论文实测值:假设用户右耳失聪,右侧 90 度有人问路,同时左前、右前、左后、右后都有人群 babble,能量相近。理想系统应保持右侧响应不失真,同时压低 4 个对角方向。论文用仿真复现了这个例子:语音逐角度摆放,噪声固定在 4 个对角,评价指标随语音角变化。这意味着结果不是单点数字,而是一条随角度变化的曲线,读结果时必须先确认横轴是语音角而不是噪声角。
系统从镜腿到耳机经历了哪几步?
方法全景是一条 8 通道眼镜助听演示链路。镜腿侧挂一条线阵列,包含 4 个全向通道和 4 个偶极通道,共 8 通道脉冲密度调制同步输出,经过脉冲密度调制到 ADAT 光信号转换器,再经 USB 音频接口进入电脑,在电脑上做最小方差无失真响应波束形成,最后输出到耳机。转成光域的作用按原文是大幅降低记录中的电噪声,这对小振膜微机电麦克风尤为重要。
下面这张系统框图与阵列实物图是理解布放的关键,先看文字导读再看图:左端是麦克风,右端是耳机,中间 3 段是转换与计算,下面两张照片区分了外侧与内侧。
看图路径: 1. 先从左到右沿麦克风到转换器再到电脑再到耳机的主链路数出五个方框;2. 再看下面板中外侧与内侧两张阵列照片上红色与绿色箭头的指向差异;3. 确认眼镜转接件位于阵列右端、线束位于左端的安装关系;4. 对照上面板第一框中 4 通道全向加 4 通道偶极的标注与下面板 8 个振膜的对应关系
论文图 1。原论文 Figure 1:“(a) Block diagram of our 8-channel glasses hearing system for demonstration. (b) The detailed illustration of the linear microphone array attached to the glasses.”。
上方面板用 5 个方框给出主路径:眼镜上的 4 通道全向加 4 通道偶极麦克风指向脉冲密度调制到 ADAT 转换器,再到 USB 音频接口,再到电脑处理器括号标注 MVDR,最后到耳机输出。原图像素中第一框下方可见眼镜示意与红色框标出的镜腿位置,中间两框可见电路板照片,链路箭头自左向右。下面板给出线阵列细节:上方外侧视图用绿色箭头标出 4 个全向麦克风,向下指;红色箭头标出 4 个偶极麦克风,向上指;右侧是灰色眼镜转接件,左端是线束。
下方内侧视图从背面看同一条形板,4 个偶极振膜与转接件位置对应。两图对照可确认偶极开孔分别朝眼镜内外两侧,声轴指向正侧方,这正是侧向波束的物理基础。演示时用户可经耳机直接监听波束形成输出,并可在手动与基于学习的语音活动检测之间选择以更新噪声协方差,这是实时链路的可操作入口。
偶极与全向振膜各自做了什么计算?
先讲白话再给英文。偶极麦克风英文 dipole microphone,靠前后两个进声孔的声程差形成 8 字形指向,对轴向的压力梯度敏感;全向麦克风英文 omnidirectional microphone,对各个方向压力大小近似同等响应。论文把 4 个全向以 12 毫米间距排成线阵,相邻偶极放在全向间的中点,每个偶极的开孔朝眼镜外侧与内侧,声程长 11 毫米。前者空间混叠约在 14.3 千赫,后者约在 15.6 千赫,均高于本研究 16 千赫采样下 8 千赫的有效带宽上限,因此带内不会因栅瓣导致方向模糊。眼镜转接件装在阵列右端,用于固定到镜腿。
偶极麦克风 × 全向麦克风: 偶极麦克风靠前后两个声孔的声程差形成 8 字形指向,天然对轴向敏感、对法向抑制,分工是提供单点级的侧向区分力;全向麦克风对各方向增益近似相等,分工是提供无偏的基准幅度和阵列布放自由度;搭配理由是偶极单点已有方向性,再做阵列波束形成时可用更少通道获得侧向增益,而全向通道可补全偶极在某些角度的凹陷,组合后形成 2 偶极加 1 全向的混合波束形成器。
信号模型按帧与频点写成多通道观测等于目标频谱乘以目标方向导向矢量再加噪声向量。符号含义是:小写 x 为观测向量,s 为消声源频谱,a 为阵列导向矢量,n 汇总全部噪声,M 为通道数,k 为频点,l 为帧序号,theta_t 为目标方向。计算目标是在该频点求一组权重 w,使得输出 y 等于权重共轭转置乘以观测,同时满足对归一化导向的无失真约束并最小化输出噪声功率。实现上先指定参考通道为全向前中通道的头相关传递函数 h_ref,用实测传递函数 h 除以该参考得到归一化导向,再结合噪声协方差矩阵求闭式解。短时傅里叶变换窗口长 512 点、跳长 128 点,采样率 16 千赫,即每帧 32 毫秒、帧移 8 毫秒。
导向矢量 × 噪声协方差矩阵: 导向矢量刻画目标方向到各通道的传递函数相对关系,分工是定义无失真约束的方向;噪声协方差矩阵刻画各频点噪声在通道间的 2 阶统计,分工是告诉波束形成器从哪里压制干扰;搭配理由是最小方差无失真响应需要在保持目标方向增益为 1 的前提下最小化输出噪声功率,二者组合才算出权重,缺其一则无法在侧向保真的同时压制对角噪声。
沿一个样本走完:90 度侧向语音经假头与眼镜的实测传递函数到达 8 个通道,对角噪声同样经各自传递函数到达,电脑按当前目标角取出对应归一化导向,结合纯噪声段估计的噪声协方差算出权重,对含噪帧加权求和得到增强谱,再逆变换回放。这里的关键信息条件是权重依赖目标角的导向与噪声段统计,目标角错了会把语音当干扰压掉,噪声统计不准则压制方向偏离。
没有神经网络训练时到底计算了什么?
本研究没有训练神经网络声学模型,也没有报告梯度路径、优化器、损失冻结或重置时机,因此 training 一节的任务是讲清真实发生的构造与估计计算,而不是虚构训练曲线。实际计算分为 3 类。第一类是响应测量:在消声室把阵列装到眼镜再戴到假头 SAMAR HATS Type 4700M 上,沿方位角以 7.5 度步进测量传递函数,这是后续所有仿真的空间底座。
第二类是仿真混合:取 TIMIT 洁净语音,按角度经传递函数 spatialize,叠加 4 个对角方向的语音形噪声,并把语音电平标定到 90 度方向单全向通道处信号失真比为 0 分贝,保证各角度比较的起点一致。第 3 类是波束形成器估计:用每段前 5 秒纯噪声计算理想噪声协方差,再对后 5 秒含噪语音逐频求最小方差无失真权重并应用。
实测传递函数 × 仿真混合: 实测传递函数是在假头戴眼镜阵列条件下消声室按方位角实测的多通道响应,分工是提供含头部遮挡的真实空间特征;仿真混合是将洁净语音经该响应与对角方向成形噪声按协议叠加,分工是可控地复现侧向语音加噪声评价场景;搭配理由是不做真实多人现场录音也能按角度扫描评估,组合意义是用实测空间加合成内容实现可重复的角度依赖评价。
需要明确的缺项是:论文未报告学习型语音活动检测的具体模型结构与训练数据,只说演示时可在手动与基于学习的系统之间切换以更新噪声协方差;也未报告实时处理的延迟与算力。因此不能从无训练推定系统输出确定,也不能承诺低延迟。理想噪声协方差在仿真中是 oracle,用纯噪声段直接估计,属于事后可知的上界条件,不能代替可部署的在线估计收益,后文结果必须带着这个前提去读。
数据协议与指标方向如何保证可比?
测什么、与谁比、条件是否一致,是读实验的三问。测的是不同语音入射角下的增强质量,与谁比包括单全向、单偶极、三全向波束形成、三偶极波束形成、2 偶极加 1 全向波束形成共 5 种处理。条件一致性体现在同一批 TIMIT 语音材料、同一假头实测传递函数、同一四方向成形噪声布局、同一电平标定与同一理想噪声协方差估计流程,每条件生成 40 段、每段 10 秒,前 5 秒纯噪声用于估计,后 5 秒噪加语音用于评价。指标方向是信号失真比越高越好、扩展短期客观可懂度越高越好、语音质量感知评估越高越好,三者分别看能量、懂度与听感。
信号失真比 × 扩展短期客观可懂度: 信号失真比衡量目标语音能量相对失真加干扰的整体比值,分工是看能量级改善;扩展短期客观可懂度衡量短时包络相关支撑的可懂度,分工是看听懂层面改善;搭配理由是能量提升不必然转化为可懂度提升,论文同时报告两者加语音质量感知评估,避免只看能量指标高估助听收益。
下表把硬件与信号处理的关键参数收拢到一处,数字与单位保留原文写法,阅读时先确认采样与分帧决定了频率分辨率,再确认空间采样决定了可用带宽。
| 配置项 | 器件或参数 | 几何与采样 | 混叠或分帧 | 测量步进 |
|---|---|---|---|---|
| 全向子阵 | IM73D122V01 共 4 通道 | 间距 12 mm | 混叠约 14.3 kHz | 方位 7.5° 步进 |
| 偶极子阵 | SKR0610 共 4 通道 | 声程 11 mm | 混叠约 15.6 kHz | 方位 7.5° 步进 |
| 处理链路 | PDM 经 ADAT 经 USB 到 PC | 采样 16 kHz | 窗长 512 点 跳长 128 点 | MVDR 逐频加权 |
表前的问题是硬件几何是否限制了评价带宽,公平条件是同一阵列同一假头同一消声测量,指标方向是混叠频率越高则可用带宽越宽。表后解释是两种子阵的混叠点都高于 8 千赫奈奎斯特频率,说明 16 千赫采样下的语音主带不受栅瓣污染;7.5 度步进保证了角度曲线足够密,能分辨 90 度侧向峰与前后凹陷;512 点窗与 128 点跳是在频率分辨率与跟踪速度之间的常规折中,但论文未做该折中的消融,因此不能断言此分帧最优。代价是 8 通道同步与光电转换增加了演示硬件复杂度,未评测低通道或单端采集的退化边界。
侧向 90 度到底提升了多少?
核心结果必须按角度读。单麦对照显示偶极单麦在 90 度以信号失真比与可懂度占优,全向单麦在负 45 度到 45 度前方占优,这符合单点指向的物理直觉。3 通道波束形成后,偶极与混合波束形成器在 90 度超过三全向波束形成器。原文在该方向报告三全向、三偶极、2 偶极加 1 全向的信号失真比为 2.28、3.24、3.06 分贝,可懂度为 0.453、0.484、0.495,语音质量为 1.247、1.282、1.278。混合配置相对同位置三全向提升 0.78 分贝信号失真比与 0.04 可懂度。有趣的是偶极参与的波束形成器在负 45 度到 0 度区间也超过三全向,说明优势不只是一个单点。
下图是按语音角展开的三指标极坐标对比,先看导读再看图:3 张图共享角度,图例区分单麦虚线与 3 通道实线,径向越大表示指标越好。
看图路径: 1. 先看三张极坐标图的标题与角度刻度,确认 0 度在上、90 度在右、180 度在下;2. 再按图例区分粉蓝虚线单麦与红蓝绿实线三通道波束形成的径向大小;3. 重点比较 90 度方向上蓝色与绿色实线相对红色实线的外扩幅度;4. 检查负角度到正前方区间三条实线的交叉,判断偶极优势是否只在侧向
论文图 2。原论文 Figure 2:“Comparison of objective metrics on different speech incident angles under speech-shaped noise.”。
从像素可见左图信号失真比中两条单麦虚线明显内缩,粉色单全向在前方尚可但在侧后方塌陷,浅蓝单偶极在侧向外扩但在前方内收;3 条实线整体外扩,其中深蓝三偶极与绿色混合在 90 度右侧最外,红色三全向在该方向稍内,证实了侧向增益。中图可懂度中 3 条实线在 90 度附近形成外凸峰,绿色混合峰值略高于深蓝,红色稍低;单麦虚线整体偏内,前方与侧向均低。
右图语音质量中 3 条实线差异小于左图,但在 90 度附近深蓝与绿色仍外于红色,单麦虚线在中心附近徘徊。纵轴分别为分贝、可懂度 0 到 0.6、语音质量 1.0 到 1.3,径向向外为变好,不能把曲线向内直接读成算法失效,而应读成该角度干扰与目标空间夹角小。像素不能精确读出每步数值,精确数字以正文引用的 90 度 3 组值为准。
下表把 90 度可运行策略与标定起点收拢,便于核对比较是否同条件,表中单位保留原文组写方式。
| 语音角与噪声布局 | 指标 | 单全向标定起点 | 3 全向波束形成 | 本方法混合 |
|---|---|---|---|---|
| 90° 语音加 ±45° 与 ±135° 噪声 | ESTOI | 未报告单点值 | 0.453 | 0.495 |
| 90° 语音加 ±45° 与 ±135° 噪声 | PESQ | 未报告单点值 | 1.247 | 1.278 |
表前的问题是在 90 度谁相对谁提升了多少,公平条件是同传递函数、同噪声布局、同理想噪声协方差、同 40 段平均,指标方向均为越高越好。表后解释是主要收益来自偶极单点指向与阵列增益的叠加,混合配置以 2 偶极加 1 全向达到接近三偶极的水平,代价是语音质量提升幅度小于失真比,且该表只覆盖 90 度单点,不能推广到全角度平均;未胜出项是三全向在前方负 45 度到 45 度并不弱,单全向在该区间甚至优于单偶极,若只看前方会得出相反结论,这正是必须按角度报告的原因。
拿掉偶极或减少通道会发生什么?
论文的消融不是去掉神经网络层,而是比较通道组成。把三偶极换成三全向,90 度信号失真比从 3.24 分贝掉到 2.28 分贝,可懂度从 0.484 掉到 0.453,说明偶极的贡献在侧向为正。把三偶极换成 2 偶极加 1 全向,信号失真比从 3.24 微降到 3.06 分贝,可懂度反而从 0.484 微升到 0.495,语音质量从 1.282 微降到 1.278,说明混合用一个全向替换一个偶极并未明显损失侧向,甚至在可懂度上略优,这支持了混合设计的合理性。单麦层面,单偶极在侧向优于单全向,但在前方劣于单全向,说明单点指向是有代价的方向选择。
另 1 维度的隐式消融是波束形成开关:3 通道波束形成整体外于单麦虚线,证实多通道增益独立于传感器选型。但论文未做通道数从 3 到 8 的扫描,未做非理想噪声协方差下的退化,也未做混响房间的对照,因此不能回答通道越多必然越好,也不能把理想协方差下的 0.78 分贝当成在线可得。至少两类特有细节值得记住:一是噪声固定在 4 个对角而语音扫描,这放大了侧向的空间可分性;二是电平标定锚定在 90 度单全向 0 分贝,不同角度的绝对值受头部遮挡影响,跨角度比较绝对值时需谨慎。
哪些边界没有测、不能承诺?
缺失证据不是技术错误,但必须明确边界。第一,噪声协方差用纯噪声段理想估计,实际部署需在线语音活动检测,检测错误会直接恶化权重,论文只在演示中提供手动与学习型切换,未报告误判率与延迟下的指标。第二,测量在消声室完成,无混响、无头部转动、无眼镜滑动,真实佩戴的位置扰动会改变导向,侧向峰可能偏移。第三,评价用 TIMIT 朗读语音加语音形噪声共 40 段平均,未报告方差、显著性与主观听感,自动指标不能当成人评,0.04 可懂度提升的感知显著性待验证。
第四,资源方面未报告训练资源因为无训练,也未报告推理开销、输出帧率与端到端延迟,不能承诺实时性已达标,只能说演示了实时波束形成。第五,代码模型数据均无可用声明,本次资源状态为未发现可验证的公开链接,不得声称已公开。总体趋势不等于每组每步都成立,尤其语音质量在某些角度 3 条实线接近,优势可能不稳定。
复现先做什么、用什么参数?
复现应先复空间再复算法最后复评价。空间复现需要同形态眼镜线阵:4 个 IM73D122V01 按 12 毫米间距,4 个 SKR0610 放在中点且开孔朝内外、声程 11 毫米,右端加眼镜转接件固定到镜腿,戴到假头上在消声室按 7.5 度步进测传递函数,同步采集脉冲密度调制经 ADAT 光隔离再经 USB 进电脑。算法复现按 16 千赫、512 点窗、128 点跳做短时傅里叶变换,参考通道选全向前中,以头相关传递函数归一化导向,用前 5 秒纯噪声估计噪声协方差,对后 5 秒逐频求最小方差无失真权重。评价复现用 TIMIT 语音逐角度摆放,4 个对角加语音形噪声,把 90 度单全向电平标到 0 分贝,每条件 40 段 10 秒,报告信号失真比、可懂度与语音质量随角度的变化。
何时值得尝试:如果目标用户明确是单侧聋且痛点在正侧方,且可接受眼镜形态与有线演示链路,偶极混合阵列值得一试;如果主要场景是正前方会议或强混响教室,则不应直接套用本结论,还需补在线噪声协方差、头部转动鲁棒性与主观可懂度验证。信息条件上必须保留理想协方差这一前提,任何把 0.78 分贝当成开箱收益的说法都是误读。
一句话之外的完整判断是什么?
回到中心矛盾:前向系统解决的是前方听清,单侧聋需要的是侧向听清,传感器物理必须跟着目标转。论文用眼镜侧挂的偶极加全向混合阵列,把单点 8 字形指向与多通道最小方差无失真结合,在消声实测加受控仿真下让 90 度侧向的可懂度与失真比超过同位置三全向,其中 2 偶极加 1 全向以更省偶极的方式接近三偶极水平。这是对侧向增强路线的存在性证明,不是全场景优于全向的普遍结论,前方区间全向仍有优势,语音质量提升也较小。
对初学者而言,可带走的方法是按角度评价、按传感器物理选型、用理想条件定上界再补在线估计;可带走的警惕是相关性不是因果、自动指标不是人评、上界不是部署收益。下一步最缺的一项验证是在线语音活动检测误差与头部扰动下的角度鲁棒性,补上它才能从演示走向可佩戴的助听方案。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

