先对齐再分家:PLUM-Net 用原型标签拆开共有与私有表征
针对多模态共有信息与私有信息纠缠且统一监督忽视模态差异的问题,PLUM-Net 采用多级语义对齐加原型单模态标签加双分支解耦加私有精炼的两阶段流程,在 CMU-MOSI 上报告 ACC-2 88.2%/90.3% 与 MAE 0.448,但严重类别不平衡与缺模态时性能可能明显下降。
针对多模态共有信息与私有信息纠缠且统一监督忽视模态差异的问题,PLUM-Net 采用多级语义对齐加原型单模态标签加双分支解耦加私有精炼的两阶段流程,在 CMU-MOSI 上报告 ACC-2 88.2%/90.3% 与 MAE 0.448,但严重类别不平衡与缺模态时性能可能明显下降。
针对多模态情感分析中忽视个性差异与浅层融合的问题,PSA-MF 用个性-情感对齐提取个性化文本情感再做多级融合,在 MOSI 和 MOSEI 上取得报告的最优结果,代价是依赖双 BERT 文本编码与多阶段融合结构。
针对多模态伪造中模态割裂与跨模态语义推理不足的问题,ConLLM 采用预训练模型分模态抽取加对比对齐与类 GPT 变换器精炼的两阶段结构,在音频、视频与音视频六个基准上报告了更低的等错误率与更高的准确率,但其增益依赖预训练权重与训练数据覆盖且推理代价仍需权衡。
针对文本、音频、视频情感分析中模态内结构丢失与跨模态语义错位问题,SSU 用句法与文本引导的模态图加全局语义锚与多视角对比学习统一融合,在 CMU-MOSI/MOSEI 上报告最高精度并以 0.3B 参数、0.015s 构图保持轻量,代价是依赖文本质量与句法解析条件。
针对多用户 OFDM 下多模态 Token 经 Modified Rapp 功放非线性失真导致任务精度与能效下降的问题,MAPS 用两阶段训练在嵌入空间联合优化跨模态对齐与均衡 PAPR 抑制,在 IBO=3 dB 时相对同条件基线获得约 64.5% AVQA 精度提升与约 64.4% 任务导向能效提升,代价是引入方差均衡与锚定重构等额外约束以稳定训练。
在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。
针对二元音频问答中模型因语言先验而虚报存在的幻觉,TAD 以静默音频为对照做对比解码并仅在首步用音频增益门控惩罚肯定词,在 AudioCaps-Hallucination 与 Clotho-AQA 上提升拒绝能力但在部分设置下以精度与准确率下降为代价。
语音识别 | 7.4/10
音频检索 | 7.2/10
说话人验证 | 7.8/10
音乐检索 | 7.3/10
音频分离 | 5.7/10
音频分类 | 7.8/10
音乐理解 | 6.5/10
音视频理解 | 6.0/10
音频分类 | 8.1/10
对比学习 | 7.5/10
音乐理解 | 8.0/10
音频检索 | 8.0/10
音频理解 | 8.5/10