把噪声当刻度:用回归预测朗伯德效应的强度
该文把朗伯德检测做成由干净语音预测诱发噪声级的回归任务,比较卷积、卷积加长短期记忆、变换器编码器三类架构与三类高维表示加六类可解释声学线索的组合,在留出德语数据集上显示卷积加 WavLM 泛化最可靠,而增加音高与谱倾斜能显著降低损失,但中间噪声级与跨数据集泛化仍是主要代价。
该文把朗伯德检测做成由干净语音预测诱发噪声级的回归任务,比较卷积、卷积加长短期记忆、变换器编码器三类架构与三类高维表示加六类可解释声学线索的组合,在留出德语数据集上显示卷积加 WavLM 泛化最可靠,而增加音高与谱倾斜能显著降低损失,但中间噪声级与跨数据集泛化仍是主要代价。
该文在严格分块流式条件下检验 Conformer-Transducer 编码器中的自注意力,发现其退化为对角局部模式,进而用一维可变形卷积替换或直接删除自注意力,在 LibriSpeech 与 TEDLIUM-2 上保持词错误率基本不变并显著降低实时率与参数量。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该研究用卷积模型从舌超声和唇视频预测标准化基频曲线,在 TaL1 上 L+T 中位 Spearman 相关达 0,72、在 TaL80 上达 0,66,而词重音越高预测越准、单纯扩大 articulatory 上下文增益有限。
该研究用同一 TCN 分割模型对比绝对特征与帧间差分、保留或去掉重叠前单人语音、打乱帧顺序三类扰动,显示 WavLM 在 DIHARD III 上达 0,680 F1-score 而 MFCC 仅 0,424,且打乱时序会系统性推高重叠类概率,代价是扰动结论依赖小样本长重叠段与伪概率曲线。
针对嵌入式音频芯片同时卡住内存与单帧算力的问题,该研究用因果声谱分离主干加门控深滤波实现可部署分离,在芯片实测单帧 10.43 ms 内达到 4.70 dB cSDR,代价是比装不进芯片的最强基线低约 0.5 至 0.7 dB 且连续上下文训练不可省略。
共分析 27 篇语音/AI 论文
该文把去噪目标改为随声场景变化的界内与界外事件,用先做声场景分类再做条件掩蔽去噪的两阶段网络,在六类场景配对数据上以可运行的 UNet 为基线对比,学习到的上下文取得最高 SI-SDR 但合成混合的统计失配仍是主要代价。
该文以目标方向对应的个性化头相关传输函数为线索,用全复数神经网络从双耳混合中提取目标并保留双耳线索,在无混响下取得清晰提取、在混响下兼顾去混响,但混响下的客观语音质量仍低于同期强基线。
针对埋地供水管道分布式声传感数据的多标签识别与时空定位问题,论文用事件级标签加像素级掩膜联合训练并在推理时用类激活图输出热力图,在保持多标签分类的同时把定位从零提升到可用水平,代价是需要人工矩形掩膜标注且只在单一工况 testbed 上验证。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。
该研究把正常听觉与电刺激听觉都写成可微模型,用同一段语音驱动两条通路并以螺旋神经节神经元包络误差为目标训练双网络刺激器,在 TIMIT 干净语音上把包络平均绝对误差从 0.6261 降到 0.0934,代价是仅用单一包络指标、干净语音和 8 kHz 以下频带且允许同时刺激。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对单通道语音增强中幅度与相位分工不同的问题,论文把实数分支的幅度掩蔽与复数分支的加性复数修正并联并在瓶颈处交换信息,在参数量对齐的卷积去噪自编码器与卷积循环网络上以短时客观可懂度、语音质量感知评估和尺度不变信号失真比为指标验证,并在乘加操作数上付出更少计算代价。
针对多通道回放攻击检测,论文用经典波束形成在方位俯仰网格上计算声学图并配约 6k 参数卷积网络,在 ReMASC 上六麦阵列取得约 10.1% 等错误率,最强证据是多阵列与多波束形成器对照,代价是小阵列与未见环境下明显退化。
针对只有正常机声可训练的异常声音检测,该文用两层 MuReNN 加注意力与可训练幂变换提取谱时调制并以 Deep SVDD 把正常样本压向超球面中心,在 MIMII 上平均 AUC 达 90.3%,代价是在 -6 dB 强噪声下落后于带去噪重建的 DeSpaWN。
Murzinograph 用三维确定性卷积自编码器把频谱图窗口序列压成三维加时间的轮廓轨迹,以牺牲精细重建为代价换取人可读的可视化,并在音乐、鸟鸣、鲸歌与约 2 小时的山谷田野录音上展示跨材料的一致性与社区解读价值。
针对影视非语音非音乐音效在检索与程序化生成之间频繁切换的问题,QuAP 用混合检索加六个程序化模型加规则助手统一工作流,主证据是 16 人用户评估与 MUSHRA 在六类中五类显著改善和 FSD50K 上 MobileNetV3 检索占优,代价是 Rocket 与 Jet 等类别仍不够逼真且仅支持六类。
针对目标说话人提取中干扰声与目标方向接近且混响模糊空间线索的问题,该工作在 SpatialNet 骨干上加入区域方向卷积、高斯核距离编码与混响参数调制,并在方位差为零的极端条件下报告大幅提升,但小距离间隔叠加相似混响指纹时仍有退化。