小模型留不住背景声:用分块蒸馏把双分支个性化增强做进端侧
针对已知说话人提取任务,论文提出掩码加深滤波的 DualDF 并用逐块特征蒸馏把块数与隐层压缩,教师约 12 块 224 维、学生在 6 块 120 维等配置下仍保持目标音质,代价是背景抑制主要依赖掩码分支且轻量学生仍需教师监督。
针对已知说话人提取任务,论文提出掩码加深滤波的 DualDF 并用逐块特征蒸馏把块数与隐层压缩,教师约 12 块 224 维、学生在 6 块 120 维等配置下仍保持目标音质,代价是背景抑制主要依赖掩码分支且轻量学生仍需教师监督。
针对二语流利度评估中声学加文本的朴素双模态融合在转写含噪时会低于纯声学基线的问题,论文用声学自监督嵌入加 BERT 文本加六维心理语言学标记的三模态投影加 BiLSTM 融合恢复并超过基线,在 Speechocean762 上达到 82.60% F1、在 Avalinguo 上达到 95.84% F1,代价是依赖转写与三编码器拼接带来的额外计算量。
该研究在八麦克风声学无人机检测定位任务上对比保形预测、证据学习与异方差回归,报告显示保形方法按构造实现名义覆盖、证据不确定性与分类错误相关而异方差回归定位误差最低,但纯噪声输入下模型仍保持 0.93 以上置信度而无法拒绝无效目标。
针对噪声加混响同时存在的语音与音乐恢复问题,论文把多麦克风观测的最小二乘数据保真项与正则项组成反问题并用前向后向算法展开为 10 层网络,在已知或估计房间冲激响应与噪声标准差的条件下,LibriSpeech 上多麦克风展开结构取得最好客观与主观指标,代价是依赖房间与噪声先验且去混响层数与去噪器规模不可过小。
针对固定通道神经音频编解码器换通道数就要换结构的问题,VCNAC 用分流卷积加统一量化瓶颈实现单套参数原生支持 1 通道、2 通道和 6 通道,在 7.9 kbit/s 量级取得与更高码率基线可比的主客观重建质量,代价是依赖合成环绕声训练且中置与后置通道客观指标仍偏低。
针对吉他缺乏力度标注的问题,该工作用虚拟乐器渲染带力度标签的合成数据先学力度曲线,再把冻结的力度子模块拼到在真实录音上训练的音高转录模型中,合成集上平均绝对误差从约 32 降到约 7 但跨音色误差增大,而在 GuitarSet 与 EGDB 上的音符转录 F 值只提升约 0.1 个百分点。
针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。
论文以 M2D 自监督 ViT 为对象,用音频激活概率熵找出类特异神经元,报告其在未见任务上接近全类别覆盖与跨任务共享,并以不足 1% 神经元的失活验证其对分类的功能影响与局限。