先增强弱模态再拉平贡献:EBMC 如何缓解文本主导的多模态情感竞争
针对文本主导、音频视觉被压制且噪声鲁棒性差的问题,EBMC 用解耦加补偿先增强弱模态、再用能量协调与样本级信任蒸馏拉平贡献,在 MOSI/MOSEI/IEMOCAP 上取得可复述的提升,代价是两阶段多损失联合调参与额外蒸馏计算。
针对文本主导、音频视觉被压制且噪声鲁棒性差的问题,EBMC 用解耦加补偿先增强弱模态、再用能量协调与样本级信任蒸馏拉平贡献,在 MOSI/MOSEI/IEMOCAP 上取得可复述的提升,代价是两阶段多损失联合调参与额外蒸馏计算。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对 F0 可控声码器在大规模多说话人训练和噪声下是否仍可控的问题,论文用概率潜变量替代确定性特征并以重合成谱误差做数据筛选,报告显示筛选能阻止错误数据拖累训练、上移 F0 时清浊判断更准而下移与高频区仍有挑战、噪声下优于基线,但筛选阈值仍需人工设定。
论文把虚拟模拟看作固定时长区间上的算子学习,用傅里叶域参数化加帧重叠相加实现单采样率训练、多采样率推理,在 Big Muff Pi 输入级上上采样与基线相当且可直接下采样,代价是帧缓冲结构和内部上采样带来的计算量。
论文把标准评测中已知机器身份的假设拿掉后联合评测,发现判别式模型退化最小而依赖机器专属分数的方法退化明显,且退化程度与隐式机器识别准确率相关,但局部密度归一化为例外显示识别准不是高检测性能的必要条件。
该文在 AVEC2014 上用固定的两层感知机隔离融合设计的影响,以线性加权平均管模态可靠性、有序加权平均管特征显著性做向量保留式联合加权,在分类取得 85.7% 准确率与 0.88 的 AUC、回归取得 8.1 的均方根误差与 0.44 的一致性相关系数的同时,在 0 分贝强噪声下仍保持相对可控的退化,代价是可靠性打分依赖的信号质量指示与排序后权重构造细节 …
针对小型弦乐重奏近场麦克风串音问题,论文把去串音做成 P 进 P 出的多通道分离,并在训练时对输入与目标施加同一随机置换以强制通道置换等变,在未见房间布局和真实 URMP 录音上提升 SDR,但低频与未见乐器上的增益仍然有限。
针对仅用正常录音训练时自编码器会重建异常输入的问题,该研究把每段音频压缩为一条 LPC 谱包络并只用正常字典的记忆加权来重建,在 MIMII 上以 90.6% 平均 AUC 超过 GRLNet 的 77.2%,代价是 Toy-conveyor 这类依赖细粒度时频线索的机器类型上 LPC 平滑可能削弱区分性。
该研究把 DiffRIR 从单声源扩展为多声源联合优化并把学习率调到 3×10-2,用 24 条 RIR 实现频谱误差下降,同时揭示空间不变晚期残响在多声源下存在时间衰减精度的结构性代价。
针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。
论文以 Whisper-small 为对象,用梯度与 Fisher 灵敏度定位可剪部位并做无微调一次幅度剪枝,最强证据是解码器自注意力 50% 稀疏度在 LibriSpeech test-other 上绝对词错误率下降 2.38%,代价是解码器前馈与早期解码器层在同等稀疏度下灾难性退化且全局均匀剪枝在 40% 附近崩溃。
针对含噪机器声中最近邻匹配不可靠的问题,该研究用机器与噪声标注加混合对齐做保留式再预训练,在受控信噪比与噪声失配下相对 BEATs 提升低信噪比约 4.1、平均约 3.1,代价是仍与嵌入混合上界有差距且依赖固定的 0.5 混合系数。
该文研究已知麦克风与声源位置下用直达与反射距离估计鞋盒房间六面墙的问题,提出三距离全求解器与两距离正交求解器并结合 RANSAC 剔除误检,最强证据是已知 chirp 与未知移动音乐两类仿真及 ScanNet++ 伪合成与实录中仍能找回多面墙,代价是逐墙剔除会误删他墙对应距离且后几面墙更难找。
论文用同一比特流解码器比较固定阈值、自适应阈值和有限时域保持三种因果策略,在噪声 0.06 处自适应把确认可用性从 0.868 提到 0.936、时域保持把总可用性提到 0.981,而 64 采样重复丢点下预测只提总可用性不提确认率,代价是长间隙下误差和假锁定上升。
针对加性噪声下传统加权预测误差去混响鲁棒性下降和多通道延迟观测导致矩阵求逆复杂度为 O(M^3L^3) 的问题,论文用观测自相关矩阵主特征向量重建参考信号并压缩延迟观测子空间,在 8 麦克、混响时间 800 毫秒、白噪声与扩散噪声各两种信噪比仿真中提升去混响增益,代价是压缩维度与迭代近似带来性能与复杂度权衡。
针对特设麦克风网络中到达时差含大量离群点时方向估计易陷入局部极小的问题,该文把估计写成内点数最大化并用两点临界点枚举保证全局最优,在合成数据上 80% 离群率下仍保持可用、在 13 段室外无人机实录上优于离散化与最小二乘,代价是计算量随测量数平方增长且依赖内点界的选取。
针对短于两分钟与低信噪比录音中相关系数与归一化错位难以区分对齐与错位片段的问题,该工作用时域卷积编码器学习三谐波潜在表示并与原始相关分数线性融合做检索式时间戳估计,在跨电网训练与测试下把全部长度成功率从 77.63% 提升到 85.63%,短录音从 55.14% 提升到 73.14%,代价是仍依赖短时傅里叶提取与十五秒容差判定且长录音增益收窄。
该研究在八麦克风声学无人机检测定位任务上对比保形预测、证据学习与异方差回归,报告显示保形方法按构造实现名义覆盖、证据不确定性与分类错误相关而异方差回归定位误差最低,但纯噪声输入下模型仍保持 0.93 以上置信度而无法拒绝无效目标。
论文把视频会议中的识别崩溃拆成传输失真与人类过度表达两条链路,用 MLD-VC 配对数据与声学分布证据定位到语音增强导致的第一二共振峰上移,并以跨平台微调平均降低 17.5% 字符错误率为收益验证该机制。
针对跨生成器泛化难的问题,论文用音频条件扩散模型的 DDIM 反演重建差异与音频视觉交叉注意力做双路检测,在 MMDF 未见生成器与外部基准上取得领先,但单次反演约一分钟的计算开销是主要代价。