论文解读

以外毛细胞损伤为靶点的仿生助听补偿:从听力图个性化到人耳可懂度验证

该研究针对外毛细胞损伤导致的可懂度下降,用听觉模型响应的正常与损伤差异训练 dCoNNear 助听模型,并在 19 名受试者的矩阵测试中获得显著可懂度提升,但客观音质指标 HASQI 出现下降 trade-off。

 · 约 15 分钟 · 7333 字 阅读 →
论文解读

真人对话里多说话人提取为何变难:静音太多与注册语音对不上

针对真实四人对话中目标说话人长期静音与朗读式注册语音失配问题,该工作用随机 VAD 掩蔽损失把 STOI 从 0.55 提升到 0.60、fwSegSNR 从 4.35 提升到 5.12,代价是仍需保留部分静音训练并受注册相似度制约。

 · 更新于 2026-09-25 · 约 18 分钟 · 8816 字 阅读 →
论文解读

四人餐馆对话要听清谁:CHiME-9 ECHI 在眼镜与助听器上做因果多说话人抽取

论文研究餐馆噪声下四人对话的同伴语音抽取,选择带说话人注册的目标说话人抽取与因果约束,用听音转写正确率与 P.835 质量分证明头部系统相对基线有实质提升,而客观指标与听感排名不一致且保留噪声与保真度不可兼得。

 · 更新于 2026-09-25 · 约 17 分钟 · 8300 字 阅读 →
论文解读

年轻听众能分开的增强差别,为何在年长听众组平均中变平

该研究用同一套自然对白与九种增强和锚点条件比较年轻正常听力组与四个年长听力组的绝对质量评分,报告年长组系统间可分差异收缩而整体水平随听阈加重下移,最强证据是核心增强两两对比点数范围的缩小与条件平均分差,代价是输出信噪比较高且助听模式高度简化。

 · 更新于 2026-09-25 · 约 17 分钟 · 8277 字 阅读 →
论文解读

低延迟下还要能转向:FiLM-OSN 如何保住指向性与双耳关系

针对助听器 10 ms 延迟与头影效应下的可转向增强问题,论文提出 FiLM 条件化的 OnlineSpatialNet 与 IPD 相位保持损失,在 8 ms 窗条件下恢复指向性并在 PESQ/ESTOI/SI-SDR 上接近 32 ms 基线,代价是仍需固定主瓣宽度与衰减上限且依赖仿真 HARTF 训练。

 · 更新于 2026-09-25 · 约 19 分钟 · 9372 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
论文解读

多通道子带切分与说话人调制的实时目标语音提取:MBSRNN 如何把空间线索装进 20 毫秒

针对助听设备的多通道目标说话人提取问题,MBSRNN 用 33 子带切分分别处理混合语音与注册语音并以 FiLM 交错 LSTM 注入说话人信息,在 CHiME-9 开发集流式条件下把 fwSNRseg 从基线约 2.2 提升到约 4.4 至 4.6,代价是约 53.1M 参数与处理一秒片段约 224.3 GMACs 运算量以及 STOI 未稳定提升。

 · 更新于 2026-09-25 · 约 18 分钟 · 8792 字 阅读 →
论文解读

先压住佩戴者自己的声音,再找对话对象:CHiME-9 ECHI 三阶段提取解读

针对可穿戴多通道录音中佩戴者自干扰过强与注册音频失配问题,论文用佩戴者抑制加目标提取加后处理三阶段流水线,在开发集上多数客观指标超过官方基线,在测试集上以可懂度下降为代价换取目标语音质量与总体质量提升。

 · 更新于 2026-09-25 · 约 19 分钟 · 9229 字 阅读 →
论文解读

同一套因果 Mamba 核心如何兼顾 16 毫秒流式与高延迟离线增强

该文针对 CHiME-9 Task2 多通道助听增强的延迟与跨通道建模矛盾,采用延迟感知外壳加单向时间 Mamba 核心的解耦结构,在助听器开发集上因果配置以 1.36M 参数和 0.005 实时率超越官方基线,离线加深配置进一步提升指标但延迟增至秒级。

 · 更新于 2026-09-25 · 约 18 分钟 · 8549 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 30 分钟 · 14943 字 阅读 →
论文解读

听得到却听不懂:助听效果差异是否来自对精细声学线索的提取能力

该研究以 21 名助听器佩戴者区分 ada 与 aga 的三线索权重和三种朝向的谱时调制检测阈为证据,显示第二共振峰线索利用与对应调制敏感性相关,但样本小且高频爆破条件多未完成使结论仍为相关性支持而非因果证明。

 · 更新于 2026-09-25 · 约 20 分钟 · 9693 字 阅读 →
论文解读

不估相位、只控增益:有界掩蔽与交叉注意力如何在 20 毫秒内做目标说话人提取

该文在因果多通道 TF-GridNet 基线上把复谱回归改为有界幅度掩蔽加混合相位复用并配多分辨率谱损失,方法 2 再把全局 FiLM 换成 16 个说话人令牌的交叉注意力 FiLM,在 CHiME-9 开发集上以频率加权信噪比下降为代价换取 Csig 感知质量提升且保持 20 毫秒算法延迟。

 · 更新于 2026-09-25 · 约 16 分钟 · 7751 字 阅读 →
论文解读

不动主模型只调混合旋钮:用感知奖励微调多通道语音增强

该文在因果多通道时频网格网络基线不动的情况下,用近端策略优化学习少量混合系数,以感知函数相对基线的提升为奖励,在助听器四通道与眼镜七通道发育集上取得小幅稳定改进,但混合结构保守且奖励依赖预训练评估模型。

 · 更新于 2026-09-25 · 约 18 分钟 · 8625 字 阅读 →
论文解读

相位对不齐就不能用细粒度损失:用对齐参考加递归增强做 20 毫秒可穿戴目标语音提取

针对四人围桌、佩戴者遮挡与极低信噪比下的低延迟目标语音提取,该工作用近距到远距投影生成相位幅度对齐的训练参考以启用 SI-SNR 训练,并用固定零陷波束形成抑制佩戴者语音加确定性递归增强渐进精炼,在 Aria 设备上显著超过基线,但频率补偿会以残留噪声为代价恢复高频。

 · 更新于 2026-09-25 · 约 19 分钟 · 9459 字 阅读 →
论文解读

不改模型也能治啸叫:用啸叫与降噪混合数据微调语音增强网络

该工作把预训练实时语音增强网络用离线合成啸叫样本加原始降噪数据联合微调,报告显示 60% 啸叫加 40% 降噪配比在在线啸叫抑制上明显提升而降噪 PESQ 仅从 2.564 降到 2.556,代价是 75% 高啸叫配比时 PESQ 降到 2.47 且 SDR 从 17.62 降到 16.79。

 · 更新于 2026-09-25 · 约 20 分钟 · 9690 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

在低频要降噪、高频要保方向时:按频点凸切换松绑双耳约束

针对双耳助听中降噪与干扰声方向保持的矛盾,论文提出按频点在高降噪与严格保方向之间做凸组合切换,并在与松弛联合双耳约束相同方向误差下获得更高信干噪比,其代价是在大松弛量时部分频点仍需求解松弛优化而耗时增加。

 · 更新于 2026-09-25 · 约 18 分钟 · 8529 字 阅读 →
论文解读

只用语音活动判断和谁在交谈:多人轮替如何变成可计算的对齐分数

针对助听器要在多人同场中判断助听器用户想和谁交谈的问题,论文提出只用每人二值语音活动流的多人贝叶斯最小重叠间隙框架,用会话对齐分数刻画群体轮替,并在真实 2、3、4 人对话上分别报告 97.1%、90.1% 和 90.4% 的平均伙伴识别准确率,代价是需要数十秒到数百秒的积分窗口才能观察到充分轮替。

 · 更新于 2026-09-25 · 约 18 分钟 · 8690 字 阅读 →
论文解读

开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13172 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 69 分钟 · 34077 字 阅读 →