多人对话先找对说话人,再把文本的情绪理解教给声音和画面
该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。
该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。
针对音频频谱 token 远多于文本导致多模态 MoE 路由崩塌的问题,CoPRIME 用对比学习加 ELBO 路由与熵正则做音频文本对齐,在 MOSEI 和 IEMOCAP 零样本与少样本情绪任务上超过稠密与 LIMoE 式基线,代价是引入对比加 ELBO 加四个辅助损失共六项损失与两个权重的调参负担。
针对音频与文本同质、视觉与二者异质的问题,MDF 只对音频做文本剥离得到声音分量,再用正交约束强化异质并用标签导出的贡献监督权重生成器,在 CMU-MOSI 上取得 MAE 0.692 等最好或次好结果,但视觉增益与权重估计仍受单模态预测误差限制。
针对文本主导压制音频与视觉的模态竞争问题,PaSE 用模态内原型校准与熵正则最优传输对齐语义,再用双阶段融合与 Shapley 梯度调制平衡优化,在 MOSI、MOSEI 和 IEMOCAP 上报告最优结果,但缺失代码可用性与显著性检验等复现细节。
针对多模态共有信息与私有信息纠缠且统一监督忽视模态差异的问题,PLUM-Net 采用多级语义对齐加原型单模态标签加双分支解耦加私有精炼的两阶段流程,在 CMU-MOSI 上报告 ACC-2 88.2%/90.3% 与 MAE 0.448,但严重类别不平衡与缺模态时性能可能明显下降。
针对多模态情感分析中忽视个性差异与浅层融合的问题,PSA-MF 用个性-情感对齐提取个性化文本情感再做多级融合,在 MOSI 和 MOSEI 上取得报告的最优结果,代价是依赖双 BERT 文本编码与多阶段融合结构。
MultiMood 针对纯文本情感支持丢失非语言线索且回复不可靠的问题,用视频音频文本三路编码加对话压缩与 PPO 加 GRPO 可信对齐,在 MESC 四任务与 DFEW 表情识别上取得最优平均表现,代价是策略预测仍弱于专用基线且压缩会损失信息。
针对文本、音频、视频情感分析中模态内结构丢失与跨模态语义错位问题,SSU 用句法与文本引导的模态图加全局语义锚与多视角对比学习统一融合,在 CMU-MOSI/MOSEI 上报告最高精度并以 0.3B 参数、0.015s 构图保持轻量,代价是依赖文本质量与句法解析条件。
论文用 8 个大语言模型读文本情感与 2 个音频模型听语音情感,在播客、有声书和 TED 演讲三类数据上按效价、唤醒度、优势度算皮尔逊相关,最强证据是效价相关可达 0.6 以上而唤醒度和优势度普遍偏低,且加上下文也不能稳定提升,代价是后两类数据集只能用音频模型预测代替人工标注。
针对同一视频中文本、视觉、音频情感倾向不一致的问题,TiCAL 先用高置信锚表生成单模态伪标签并在双曲空间结构化,再用典型性和一致性做三阶段动态融合,在 MOSI 上报告 Acc-2 为 88.10,代价是需要完整三模态和多阶段调参。
针对文本音频视频缺失与传感器噪声并存导致情感预测失效的问题,TMDC 先在完整数据上学习去噪的特有与共享表示再用可见模态补全缺失模态,在 MOSI、MOSEI 和 IEMOCAP 的七种缺失组合及加噪条件下报告了优于所列基线的平均准确率,代价是两阶段训练与共享表示冗余。
在文本+ 语音输入上用固定编码-时序-融合流水线对比 Transformer 与 Mamba 时序主干,并用二维高斯软目标训练 9×9 Valence-Arousal 联合分布头,在说话人无关 LOSO 协议下主系统达 73.0%±0.3 UA 且分布质心可跟踪连续效价/唤醒,但延迟优势在该句长下未出现。
RAFM-SER++ 以文本为查询、语音为键值的单向残差注意力替代双向跨模态 Transformer,结合 BYOL 式对齐与注意力池化,在 IEMOCAP 上达到 81.10% BACC、ESD 上 95.39% BACC,同时将可训练参数从 8.9M 降至 3.6M 并提升推理吞吐。
针对语音情感识别中时序依赖不稳定与计算冗余问题,SETEAB 在 TIM-Net 基础上引入深度可分离下采样、SE-Res2Block、TEAB 与全局加权双向融合,在 5 个库平均上以 0.06 - 0.12 GFLOPs 实现 47.69% UA 与 45.23% F1,并在跨库平均 WA 上达到 37.53% 且保持 0.4 - 0.5M 参数量级。
论文把 ASR 监督前端是否丢弃声学信息当作可证伪假设,在同一 Qwen3.5-4B 流水线中对比 Whisper 与三类重建式编解码器,并用分层探针、几何比值与仅调 LM 头选项行的因果小手术证明声学结构在最终隐状态仍可恢复而 MCQA 失效主要来自读出对齐,但换前端本身不能解决情绪与环境声字幕的欠利用。
针对单模态易受噪声与信息缺失影响的问题,论文用 Wav2Vec2、MFCC 与统计声学特征经 BiLSTM 建模音频、用 ResNet50-BiLSTM 建模视频,并以多头交叉注意力做特征级融合,在 MELD 上微平均 93.7% 与 IEMOCAP 上 90.3% 准确率上验证效果,但未报告训练超参细节与统计显著性。
共分析 1 篇语音/AI 论文
针对全量微调语音自监督基座模型代价高、MLP 适配器表达受限的问题,KanAdapter 以并行瓶颈中的 GR-KAN 可学习有理激活替换固定激活,在说话人验证、情感识别与伪造检测上以减少 94.7% 至 97.5% 可训练参数接近全量微调,并在两阶段持续学习上相对全量微调降低 83.6% 错误率。
论文针对语调情感与字面语义冲突时主流语音情感识别显著退化的问题,提出解耦声学与语义双通路并做高能量筛选与查询融合的 DAS 框架,在 378 条高冲突 TWIN-SER 上取得 59.38% 加权准确率的最好结果,代价是零样本通用集上不及大预训练模型且小样本恐惧与厌恶类仍难分。
针对未见说话人上情感识别易受说话人差异干扰的问题,论文用 wav2vec 2.0 做编码器、ECAPA-TDNN 做说话人判别器并以熵最大化做对抗,在 IEMOCAP 测试集报告 60.63% UA,代价是交替训练更复杂且存在原文内部数字不一致与未验证的跨库边界。