论文解读

不均匀噪声下同时算出传递函数与各通道噪声:可学习的确定性最大似然波束形成

针对麦克风间距未知、增益未校准且各通道噪声功率不同的自组织阵列,论文用确定性最大似然把语音序列与传递函数的闭式解代入似然,只留对角噪声协方差做数值优化,在 4 通道 LibriSpeech 仿真上把阵列信噪比做到 21.18/20.63 dB 而逼近已知噪声的广义特征值波束形成上限,代价是每条语音单独迭代约 2000 轮且混响下客观可懂度与音质提升有限。

 · 更新于 2026-09-24 · 约 22 分钟 · 10633 字 阅读 →
论文解读

稀疏程度随房间而变:把最小二乘加多重稀疏约束的模型族展开为可学习的 ADMM 网络

针对语音激励、混响与噪声变化下的批量声学系统辨识,该工作把最小二乘加多重稀疏约束的参数化模型族用交替方向乘子法求解并展开为 ADMM-SysIDNet,在 Bar-Ilan 实测房间冲激响应与 LibriSpeech 激励下以归一化均方偏差为指标优于最小二乘和 ADMM-ℓ1,代价是依赖分混响条件的离线训练与批量观测流程。

 · 更新于 2026-09-24 · 约 21 分钟 · 10068 字 阅读 →
论文解读

低信噪比谐波噪声下先做循环平稳波束形成再做神经网络去噪

针对旋转机械主导的低信噪比谐波噪声,该文用单通道循环平稳最小功率无失真响应做前端抑制谐波再接轻量掩蔽网络,在合成与真实发动机噪声上报告了一致提升,但维纳滤波对照显示增益互补而非可替代,且依赖噪声频率稳定可估计。

 · 更新于 2026-09-24 · 约 17 分钟 · 8446 字 阅读 →
论文解读

主噪声关不掉时,如何把扬声器漏进参考麦的声音减掉

针对多通道前馈主动噪声控制中次级扬声器到参考麦的声反馈在主噪声持续存在时难以标定的问题,论文提出用参考组到反馈组的相对传递矩阵加协方差相减来估计并扣除反馈分量,仿真报告显示其降噪接近理想无主噪声标定上界而直接估计与无补偿基线失稳或仅约负 2 分贝,代价是需要两次受控测量与额外反馈麦组。

 · 更新于 2026-09-24 · 约 18 分钟 · 8980 字 阅读 →
论文解读

不改模型也能治啸叫:用啸叫与降噪混合数据微调语音增强网络

该工作把预训练实时语音增强网络用离线合成啸叫样本加原始降噪数据联合微调,报告显示 60% 啸叫加 40% 降噪配比在在线啸叫抑制上明显提升而降噪 PESQ 仅从 2.564 降到 2.556,代价是 75% 高啸叫配比时 PESQ 降到 2.47 且 SDR 从 17.62 降到 16.79。

 · 更新于 2026-09-24 · 约 20 分钟 · 9690 字 阅读 →
论文解读

眼镜框上有麦、耳朵处无麦:辅助滤波器为何在方向偏离时失效

针对增强现实眼镜耳处无误差麦克风导致无法直接做有源噪声控制的问题,论文验证辅助滤波器虚拟传感的必要性并推导其方向敏感性,用自由场仿真显示固定滤波器在方向失配时退化,而按声源方向从有限滤波器库中选择可在因果区内部分恢复性能,但仍不及逐方向重标定。

 · 更新于 2026-09-24 · 约 17 分钟 · 8360 字 阅读 →
论文解读

把谱质心压进全极点模型:用搬运代价对齐频移峰

针对小频移下谱平均被抹糊的问题,该文把熵正则 Wasserstein 重心约束为给定阶数全极点谱,用 Sinkhorn 加反射系数参数化梯度下降求解,在 TIMIT 五音素上以平衡准确率与 F1 略优于非参数重心,但优化非凸只能得到次优平稳点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9195 字 阅读 →
论文解读

长脉冲响应拆成两个短滤波器:RLS-NKP 如何用两个可变遗忘因子兼顾精度与跟踪

针对长回声路径辨识问题,论文把长度为 L 的脉冲响应拆成两个短分量滤波器并为各自设计可变遗忘因子,在网络与声学回声消除仿真中报告了比固定遗忘因子 RLS-NKP 更低失调与更快跟踪,但未给出失调数值的表格且依赖对角协方差等简化假设。

 · 更新于 2026-09-24 · 约 17 分钟 · 8143 字 阅读 →
论文解读

只用 5 到 10 分钟实录,如何扩出 19 小时还带逐采样标注的引擎声

该文用转角域重采样加阶次跟踪从实录提取随转速和扭矩变化的谐波指纹,再驱动谐波加噪声合成器生成带四通道嵌入标注的音频,证据是 8 个子集上阶次结构随工况对应且基线网络可收敛,代价是高阶细节为参数化改动而非逐频复刻。

 · 更新于 2026-09-24 · 约 22 分钟 · 10873 字 阅读 →
论文解读

只用朗读时的停顿和用词,能反推中风病灶在哪、有多大吗

该研究用图片描述语音的声学流畅性与文本流畅性双路特征加注意力多示例学习,在 742 人 SONIVA 语料上不依赖影像预测中风状态、偏侧、体积三分级和 12 个半球脑叶受累,并报告左半球偏文本、右半球偏声学的特征依赖梯度与定位性能差距。

 · 更新于 2026-09-24 · 约 18 分钟 · 8882 字 阅读 →
论文解读

同向干扰难分开时:用跨阵列非目标估计做后置滤波的声点形成

针对目标与干扰在单个阵列看来同方向而波束形成失效的问题,该研究用几何约束线性解混做空间滤波、再用跨阵列非目标估计构建多通道维纳后置滤波,在三阵列混响实验中多数指标超过 NMF 与 NTF 基线,但稀疏先验强度与混响条件会带来失真与抑制的权衡。

 · 更新于 2026-09-24 · 约 21 分钟 · 10154 字 阅读 →
论文解读

简单输入画不准、精细能量难手绘:AudioSketch 如何调制出有语义的时间能量

针对单张图像对应多种合理声音的一对多图像到音频生成问题,AudioSketch 用轻量图像到音频映射复用预训练文本到音频扩散模型并以 ControlNet 注入能量轨迹,再用语义条件能量调制器把简单时间戳转换为精炼能量,在 VisualSound 上无控制时以 16.21 的 FD 与 12.41 的 IS 领先同类,而代价是对平滑归一化选择敏感且客观起振对 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8996 字 阅读 →
论文解读

给耳蜗模型装上逆行路:用瞬态诱发耳声发射反推外毛细胞状态

针对耳蜗个体差异难以直接调参的问题,该文在可微 CARFAC 上增加后向传输与相干反射路径,以复合损失拟合瞬态诱发耳声发射波形,在传输线模型仿真与 58 耳实测数据上显示可还原不同听力损失形态,但对真实生理状态与泛化仍需更多验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8669 字 阅读 →
论文解读

场景决定何为噪声:自动上下文去噪如何先判场景再去异物

该文把去噪目标改为随声场景变化的界内与界外事件,用先做声场景分类再做条件掩蔽去噪的两阶段网络,在六类场景配对数据上以可运行的 UNet 为基线对比,学习到的上下文取得最高 SI-SDR 但合成混合的统计失配仍是主要代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9951 字 阅读 →
论文解读

看不见的生成器:用通用音频语义加图结构抓环境音伪造痕迹

针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
论文解读

把未知系统推出去:用代理锚定学习做语音合成来源归属与开放集检测

该文把 TTS 来源追溯写成先判断是否见过再归属到具体系统的两阶段问题,用 Wav2Vec2-BERT 嵌入加 Proxy-Anchor 学习结构化嵌入空间,在 MLAAD v9 合并架构类上报告 99.76% 闭集准确率与 2.04% 的 FPR@95,代价是依赖手动合并架构与保留校准集调阈值。

 · 更新于 2026-09-24 · 约 18 分钟 · 8741 字 阅读 →
论文解读

不靠攻击仿真堆料:用对抗嵌入与时间无关读出做音频水印

针对剪切拼接易失同步的问题,AWARE 用时频域对抗优化嵌入水印并以时间无关检测器解码,在保持 PESQ 约 4.26 与 STOI 约 0.99 的同时在多种编辑下保持低误码率,代价是逐样本迭代嵌入开销与神经压缩等条件仍有残留误差。

 · 更新于 2026-09-24 · 约 17 分钟 · 8149 字 阅读 →
论文解读

一个通用扰动为何能在不同 ASR 上都让转写偏向同一目标

该文研究针对 Whisper 系列的通用、有迁移性的目标性声学攻击,提出 MuteOut 随机掩码优化,以较大的扰动预算换取跨模型的目标词成功率,同时用词错率和语义分数量化通用性与迁移性之间的折中。

 · 更新于 2026-09-24 · 约 20 分钟 · 9635 字 阅读 →
论文解读

冻住检测器、只训练回溯翻译器:持续伪造语音检测里的遗忘与适配矛盾

针对新伪造语音出现时微调整个检测器会遗忘旧数据的矛盾,该工作冻结定制 ResNet18 主干、只训练 128 维嵌入后的轻量回溯翻译器做类条件分布对齐,在 FoR、ITW 和中文 ADD22 上保持源域 95.0% AUC 与 9.74% EER 的同时把目标域做到约 95-98% AUC,代价是目标域 EER 比全量重训高约数个百分点。

 · 更新于 2026-09-24 · 约 16 分钟 · 7753 字 阅读 →
论文解读

用听者自己的双耳线索抓目标说话人:个性化头相关传输函数做双耳提取

该文以目标方向对应的个性化头相关传输函数为线索,用全复数神经网络从双耳混合中提取目标并保留双耳线索,在无混响下取得清晰提取、在混响下兼顾去混响,但混响下的客观语音质量仍低于同期强基线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9312 字 阅读 →