论文解读
深度冗余时做减法:用浅层对齐让伪造语音检测走得更远
针对 Transformer 伪造语音检测器深层冗余且域外泛化差的问题,论文用 XLS-R 加 1 到 4 层 MTLA 分类器并以角距离把浅层向末层对齐,在 19LA 训练、多域评测下以 479.11K 分类器参数取得域外增益,但过强对齐与过深堆叠仍会退化。
针对 Transformer 伪造语音检测器深层冗余且域外泛化差的问题,论文用 XLS-R 加 1 到 4 层 MTLA 分类器并以角距离把浅层向末层对齐,在 19LA 训练、多域评测下以 479.11K 分类器参数取得域外增益,但过强对齐与过深堆叠仍会退化。
针对同传要在质量与延迟之间选读或写的问题,REINA 用完整音频与截断音频下对数概率之差估计信息增益来训练独立策略网络,在 MUST-C 与 CVSS-C 上提升归一化流效率,但截断适配训练与单调约束不可缺且德语高延迟点仍有反例。
针对同一视频中文本、视觉、音频情感倾向不一致的问题,TiCAL 先用高置信锚表生成单模态伪标签并在双曲空间结构化,再用典型性和一致性做三阶段动态融合,在 MOSI 上报告 Acc-2 为 88.10,代价是需要完整三模态和多阶段调参。
📄 缺失与偏置并存时如何做鲁棒的多模态情感分析:门控序列修复与平衡跨模态注意的协同 会议论文 ID:conference:icassp:2026:icassp-arnumber:11460389
语音识别 | 7.5/10
空间音频 | 8.0/10
这篇论文旨在解决传统Dropout方法依赖随机掩码、正则化效果不透明且难以精确控制的问题。其核心方法是提出一种确定性公式,将Dropout重新表述为一个可直接加入训练损失函数的显式正则化项,并推导出了适用于Transformer架构中注意力机制(Q、K、V)和前馈网络的正则化表达式。与已有方法相比,