英文题目:Leveraging Modality-Specific Label Distributions for Enhanced Multimodal Emotion Recognition
会议身份:
conference:interspeech:2026:conference-paper-id:shi26e_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#对比学习 #多模态学习 #音视频 #语音 #语音情感识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Xiaohan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Xingfeng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态情感识别以语音、文本和人脸视频为输入,输出统一的7类情感标签,难点是各模态情感倾向经常分歧而传统方法只用统一硬标签监督。该工作提出模态标签分布框架MoLD,先由模态私有编码器抽取表示并预测各模态标签分布,再经跨模态融合为每个模态聚合互补信息,最后将融合表示与分布向量拼接后联合预测统一标签,并以对比式相似性损失约束跨模态一致。与早期拼接和注意力融合的关键差异是把模态私有监督从离散标签放宽为标签分布学习,并让预测分布直接参与最终表示,从而保留模糊性和互补性。在EmotionTalk中文交互数据集官方7分类划分上,MoLD在全模态下达到58.96%非加权平均召回率和59.67%宏平均F1,相对最强注意力基线提升2.91个百分点UAR和2.42个百分点F1。该结论目前仅在单一数据集下验证,对缺失模态、跨语言和跨语料的外推尚未证明。原文未披露推理延迟与部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?要解决的多模态情绪识别难在哪?
这篇解读的输入是 Interspeech 2026 论文提出的 MoLD 框架,目标是让刚进入语音、音乐、音频领域的研究生能核对原文并复述方法。必须保留的信息包括任务定义、数据条件、编码器冻结与微调安排、分布分支与融合分支的走向、三项损失的监督来源、以及主结果与消融的比较条件。输出是一套按学习依赖展开的中文技术说明,不做营销式判断。任务本身是多模态情绪识别,也就是把同一条话语的语音、文本和面部视频放在一起,判断它属于高兴、惊讶、悲伤、厌恶、愤怒、恐惧、中性中的哪一类。
白话说,模型要听语气、看字面、看表情。英文叫 multimodal emotion recognition,缩写 MER,后文统一叫多模态情绪识别。难点在于 3 个模态并不总说同一件事。一个人可能文字很平静,但声音发抖,表情僵硬。如果训练时只给一个统一的多模态硬标签,模型就被迫把这种分歧抹平,学不到每个模态各自的倾向。
论文的出发点就是把模态专属的标签信息显式建模,而不是只在特征层面做更复杂的融合。沿一个样本走一遍有助于建立全局感。输入是一条话语的 3 路信号,分别经过语音、文本、视频编码器变成序列表示,再经过时序精炼。每一路一方面参与跨模态取信息,得到该视角的融合向量,另一方面单独预测一个情绪标签分布。融合向量和分布向量拼接成模态感知表示,3 路再拼接成整体表示,最后经全连接加 Softmax 输出多模态情绪类别。
训练时 3 类监督同时起作用,分别管最终分类准不准、分布像不像、跨模态一致不一致。
已有路线做了什么?为什么还缺分布视角?
已有多模态情绪识别工作大多沿着表示加融合走。白话说,先把每路特征做好,再想办法合在一起。英文叫 fusion,后文统一叫融合。早期融合是在特征层把多路投影到共享空间再联合建模,晚期融合是各模态先各自做高层表示再在决策层汇总,混合融合是在多个阶段同时做特征层和决策层交互。论文提到这些方法取得了有竞争力的结果,但都依赖统一的多模态情绪标签,忽略了模态专属标签可能带来的语义线索和一致性约束。
另一条线是模态专属信息建模和标签分布学习。白话说,不再只给一个对错分明的类别,而是给每个类别一个概率,描述模糊和多情绪共存。英文叫 label distribution learning,缩写 LDL,后文统一叫标签分布学习。论文引用了文本情绪分布学习和视觉情绪分布学习的工作,指出它们停留在单模态分布建模,没有研究分布如何在模态之间相互作用。在多模态场景下,不同模态可能有不同情绪倾向,只独立建模每个模态不足以捕捉互补性。
这就引出 MoLD 的位置。它不是再换一种融合算子,而是增加一路分布监督和一路一致性约束。相关工作的对照要按同输入、同目标、同监督来理解。同样用语音加文本加视频做情绪分类的方法才是可比对象,只做单模态分布的方法说明了分布建模的可行性,但不能直接当成多模态基线。论文后文用多层感知机式早期融合、多任务离散标签辅助、交叉注意力融合作为可运行的对照,这是理解收益口径的关键。
问题如何形式化?输入输出和监督各是什么?
形式化上,每条样本有 3 路输入序列和两类标注。一类是统一的多模态离散情绪标签,用于最终分类。另一类是每个模态各自的情绪标签,并进一步组织成模态专属标签分布,用于分布分支的监督。输出是多模态情绪类别的概率向量,取概率最大者为预测类别。评价用无加权平均召回率和宏平均 F1。
白话说,前者是每个类别召回率的平均,不让大类主导结果。英文叫 Unweighted Average Recall,缩写 UAR,后文统一叫 UAR。宏平均 F1 英文叫 Macro-F1,后文统一叫 F1,方向都是越高越好。需要区分的 3 个概念是模态专属离散标签、模态专属标签分布、多模态统一标签。离散标签是 1 个类别,分布是一个向量,统一标签是汇总判断。
论文的方法依赖 EmotionTalk 同时提供这两层标注这一信息条件。如果只有统一标签,分布损失就没有真值可用,这是复现时先要确认的数据前提。另一个易误解点是分布不是人工凭空编的软标签,而是数据集中每个模态标注转化或提供的真值分布,预测分布要与它对齐。论文用 KL 散度衡量这种对齐,用交叉熵衡量最终分类,用对比损失衡量跨模态一致,三者各管一件事。
MoLD 全景:一个样本如何走完四步?
MoLD 全名是模态专属标签分布框架,白话说就是让每个模态都说出自己的情绪倾向,再带着这个倾向去融合。英文叫 Modality-specific Label Distribution-based framework,后文统一叫 MoLD。整体分 4 步。第一步是模态专属编码,用预训练自监督编码器加 Mamba 精炼得到序列表示,同时每路经池化加全连接加 LogSoftmax 得到分布向量。第二步是跨模态融合,对每个目标模态做两步交叉注意力加平均池化,得到该视角的融合表示。
第三步是拼接,把融合表示和同模态的分布向量拼成模态感知表示,再把 3 路拼成整体表示。第 4 步是预测与约束,整体表示经全连接加 Softmax 得到最终类别,同时用三项损失联合优化。下面先看总体结构图,建立分支走向,再拆每个组件的计算。总体结构图是理解分叉与汇合的关键。它把编码、融合、分布、预测放在一张图里,箭头表示数据流向。
读图时不要先纠结 Mamba 内部细节,先确认主路径从输入到输出经过哪些框,再确认分布支路在何处分叉、在何处重新汇合。
看图路径: 1. 先从底部自监督编码器向上看,找到分叉为融合支路和分布支路的位置;2. 再看跨模态融合框内两次交叉注意力的查询与键值箭头走向;3. 最后看右侧 Mamba 框内从全连接经卷积到状态空间再与门控相乘的路径
论文图 1。原论文 Figure 1:“Overall architecture of the proposed MoLD framework.”。
这张总体结构图显示了论文实际采用的安排。左侧和中下是模态专属编码器,每个模态从自监督编码器出发,分出两条向上的箭头,一条经 Mamba 得到精炼序列,另一条经平均池化加全连接得到分布向量。中上是跨模态融合框,内部有两个交叉注意力加 1 次平均池化,输出该模态视角的融合表示。右侧单独放大了 Mamba 内部,从底部全连接分两路,一路经卷积、激活、状态空间模型,另一路经全连接加激活,两路相乘后再经全连接输出。
绿色回路表示标签分布学习监督,融合表示与分布向量在后段拼接后再进入情绪预测模块。这种先分叉再拼接的画法对应正文公式的组织,先有序列精炼,再有分布预测,再有两步融合,最后是拼接预测。
编码器做了什么?哪路更新、哪路冻结?
编码部分要回答 3 个动作。提取、精炼、预测分布。提取用 HuBERT 处理语音、RoBERTa 处理文本、DINOv2 处理视频,分别得到语音帧序列、文本 token 序列、视频帧序列,记为不同长度但相同隐层维度的矩阵。原文明确说语音和文本编码器做微调,视频编码器保持冻结。这是复现时必须照做的参数安排,不能从模型名字推定都微调或都冻结。
精炼用 Mamba 块对每个模态序列做长程建模,输入输出维度不变。预测分布是对原始编码输出做平均池化,再经全连接和 LogSoftmax 得到长度为类别数的向量。注意分布分支用的是池化前还是精炼前的表示,原文写的是对编码器输出做池化,这意味着分布分支不经过 Mamba,梯度路径与融合分支不同。未报告的是池化是时间维平均还是加权平均之外的细节,以及全连接是否带偏置和激活,论文没有给出这些实现细节,应记为缺项而不猜测。
模态专属标签分布 × 标签分布学习: 模态专属标签分布指语音、文本、视频各自看到的情绪倾向,用长度为类别数的向量表示;标签分布学习指不只学一个硬类别,而是学整个分布并用 KL 散度约束预测分布靠近真值分布。二者搭配的原因是单一多模态硬标签抹掉了分歧,而分布保留了模糊和共存信息,组合后每个模态既有表示向量又有分布向量,为后续拼接提供互补语义。
Mamba 块 × 自监督编码器: 自监督编码器指 HuBERT、RoBERTa、DINOv2 这类在大规模无标注数据上预训练的特征提取器,负责把原始语音、文本、视频变成帧或 token 序列;Mamba 块是接在编码器后增强长程建模的序列模块。搭配原因是预训练特征偏局部和通用,Mamba 对其做进一步时序精炼后再分两路,一路做融合,一路做分布预测。
对初学者来说,可以把编码器想象成翻译,把波形、文字、图像翻译成同一维度的向量语言,Mamba 是润色,让长句子前后照应,分布分支是让每路先表态。比喻之后要回到真实信号。翻译对应预训练编码的前向计算,润色对应 Mamba 的状态更新,表态对应池化加全连接输出的概率向量。这些向量后文会被直接拼接,所以维度需要对齐,拼接后的长度是融合维度加类别数。
融合与预测如何拼接?两步注意力查谁?
跨模态融合模块英文叫 Cross-Modality Fusion,后文统一叫融合模块。它的输入是 3 个精炼后的序列,输出是每个目标模态各一个融合向量。以目标模态为语音举例,另两路为文本和视频。第一步以语音序列为查询,以文本序列为键和值做交叉注意力,得到中间表示。第二步以中间表示为新查询,以视频序列为键和值再做 1 次交叉注意力,最后平均池化成一个向量。
对文本和视频做对称操作,各自得到自己的融合视角。白话说,每个模态都当 1 次主角,把另两路的信息按相关性取过来。英文叫 cross-attention,后文统一叫交叉注意力。得到融合向量后,关键动作是拼接。把该模态的融合向量与其分布向量拼在一起,得到模态感知表示。
再把语音、文本、视频 3 路模态感知表示拼在一起,得到整体表示。整体表示经全连接加 Softmax 得到最终情绪概率。这里的拼接不是加权求和,维度直接相加,分布部分保留了可解释的类别倾向,融合部分保留了跨模态上下文。
跨模态融合模块 × 交叉注意力: 跨模态融合模块是为目标模态从另两个模态取信息并压缩成一个向量的结构;交叉注意力是其中取信息的计算方式,以目标模态为查询、另一模态为键和值。搭配理由是直接拼接无法做不对齐序列间的选择性聚合,而两步交叉注意力让目标模态先看模态 a 再看模态 b,组合后得到模态专属的融合表示。
模态感知表示 × 多模态表示: 模态感知表示是单个模态的融合向量与其标签分布拼接后的向量;多模态表示是 3 个模态感知表示再拼接成的整体向量。分工是前者保留该模态视角下的跨模态信息加情绪倾向,后者汇总三视角做最终分类,搭配理由是最终分类器既能看到融合特征又能直接看到分布先验。
需要提醒的是,单模态评估时融合模块被移除,因为没有其他模态可查。这不是把融合换成单模态自注意力,而是直接用模态专属表示构成多模态表示的退化设置。原文在实验流程中明确说了这一点,复现单模态时要照做,否则比较条件不一致。
一致性约束如何把分歧拉回同一语义空间?
一致性约束的动机是分布分支鼓励保留差异,融合分支如果没有约束可能各说各话。论文引入模态相似性损失,白话说就是让每个模态的融合表示不要离整体表示太远。英文叫 modality similarity loss,后文统一叫相似性损失。具体做法是先把整体表示经全连接投影到共享嵌入空间,再对每个模态的融合表示与投影后的整体表示计算基于余弦相似度的温度对比损失。英文叫 contrastive learning,后文统一叫对比学习,InfoNCE 是其常用形式。同一条样本的模态表示与整体表示为正对,不同样本之间为负对,优化目标是拉近正对、推远负对。
模态相似性损失 × 对比学习: 模态相似性损失要求各模态融合表示与整体多模态表示在语义上靠近;对比学习是实现该要求的方式,基于余弦相似度和温度系数的 InfoNCE 把同一样本的表示拉近、不同样本推远。搭配后,分布分支保留差异,相似性分支约束一致,二者共同平衡互补与一致。
这个损失与分类损失、分布损失共同构成总损失。总损失的权重不是固定超参数,而是对可学习标量做 Softmax 得到,并与网络一起优化。白话说,模型自己学 3 个任务各占多大比重。原文没有给出温度系数、负样本构造范围、投影维度等细节,这些是缺项,复现时需要回到代码或补充实验才能确定,不能从对比学习这个名字推定具体实现。还要区分原始目标与优化步骤。
原始目标是语义一致,近似是对比损失,优化步骤是加权求和后反向传播。原文未说明是否对某些分支停止梯度,因此不猜梯度是否截断。
训练分几项损失?优化器和轮数如何设置?
训练是监督学习,有明确的训练阶段。损失有三项。第一项是情绪分类损失,对最终预测概率用交叉熵,以统一多模态标签为监督。第二项是标签分布损失,对每个模态的预测分布与真值分布求 KL 散度并在样本和模态上平均,以模态专属分布为监督。第三项是相似性损失,以对比方式约束融合表示与整体表示的一致性,无需额外人工标注,监督来自同一样本的配对关系。
三项加权求和后优化,权重由可学习参数经 Softmax 得到。实现条件按原文交代。代码用 Python 3.7 和 PyTorch 1.11.0,在单块 NVIDIA Tesla V100、32 GB 内存、Xeon Gold 6248 CPU 的机器上训练和评估。特征提取用中文预训练模型,语音是 chinese-hubert-large,文本是 chinese-roberta-wwm-ext,视频是 dinov2-giant,视频编码器冻结。Mamba 状态扩展尺寸为 16,卷积宽度为 4。
预测模块的全连接带 0.5 的丢弃率。优化器用 Adam,学习率为 1 乘 10 的负 4 次方,训练 30 轮,批大小为 32。原文没有报告学习率调度、早停、梯度裁剪、随机种子和多次运行的方差,这些是复现时需要补记的缺项。单模态训练时融合模块移除,其余组件保持相同,这是为了检验分布建模在缺少跨模态信息时是否仍然有效。
数据是什么?标签一致性差到什么程度?
数据用 EmotionTalk 语料,白话说是一个大规模中文互动多模态情绪数据集。规模是 19250 条话语,来自 744 段对话,总计约 23.6 小时语音。每条话语有离散情绪类别、连续情感强度和说话风格描述,覆盖音频、视觉、文本 3 个模态。关键信息条件是它同时提供每个模态的专属情绪标签和统一的多模态情绪标签,类别包括高兴、惊讶、悲伤、厌恶、愤怒、中性等 7 类。评估沿用官方的七分类训练、验证、测试划分,指标用 UAR 和 F1。
论文先做了标签一致性分析,这是理解为什么需要分布建模的直接证据。分析把每条样本按多模态标签与 3 个模态标签的对齐情况分组,统计各组占比。读环形图时先确认对象是全部样本的构成比例,再看各扇区百分比,最后对照图例确认 8 种模式。
看图路径: 1. 先确认环形图中心为 EmotionTalk 及外圈为百分比构成;2. 再对比完全一致扇区与音频加视频一致扇区的弧长大小;3. 最后核对底部图例中八类一致模式与颜色的对应关系
论文图 2。原论文 Figure 2:“Label Consistency Analysis Between Multimodal and Modality-Specific Labels.”。
这张环形图显示只有 24.5% 的样本是全对齐,64.2% 是部分对齐,11.3% 是完全不对齐。其中音频加视频对齐是最常见的部分模式,占 24.9%。其余扇区包括单音频对齐 9.0%、单文本对齐 4.0%、单视觉对齐 12.7%、音频加文本对齐 9.5%、文本加视频对齐 4.3%。像素上可以直接比较弧长,全对齐蓝色扇区与音频加视频橙色扇区明显大于其他扇区,灰色完全不对齐扇区不可忽略。这个分布支持论文的判断,跨模态情绪表达存在系统性差异,只用统一标签会丢失信息。但它显示的是相关性而非因果,不能直接推出加上分布一定涨多少,只能说有建模空间,具体收益要看对照实验。
主结果测什么?在什么条件下赢了谁?
主结果要回答 3 个问题。测什么,与谁比,条件是否一致。测的是 EmotionTalk 七分类的多模态情绪识别,以及单模态设置下的模态专属标签预测。比较对象包括不可学习的参考界和可学习的对照。可学习对照有早期拼接的多层感知机、加模态专属离散标签为辅助任务的多任务模型、基于注意力融合的交叉注意力模型。
参考界有多数类预测、均匀随机预测和直接用真值标签分布得到的近似上界。指标方向都是越高越好。先看参考界给出的任务难度。多数类和随机预测的 UAR 在 14% 左右,F1 在 8% 到 12% 左右,而用真值分布的上界达到 66.56% UAR 和 67.50% F1。这说明任务有明确 headroom,但上界用了真值分布,属于事后最优,不能当成可部署收益。
表前需要明确比较问题和公平条件。这里的比较问题是,在同样用 3 模态输入和同样划分下,显式建模分布加一致性约束是否超过只做融合或只加离散辅助标签的方法。公平条件是都用官方划分和 UAR 加 F1 评价,可运行策略是多层感知机、多任务、交叉注意力,搜索最优和真值上界另行标明。
| 条件 | 指标 | 多数类与随机下界 | 真值分布上界 | 可运行对照的相对提升 |
|---|---|---|---|---|
| 多模态七分类 | UAR | 14.29%,14.52% | 66.56% | 超交叉注意力 2.91%,超多层感知机 4.88% |
| 多模态七分类 | F1 | 8.44%,11.90% | 67.50% | 超交叉注意力 2.42%,超多层感知机 6.01% |
| 单模态分布建模 | UAR | 文本单模态难 | 视频单模态难 | 语音 1.80%,文本 1.86%,视频 1.21% |
| 单模态分布建模 | F1 | 同上 | 同上 | 语音 1.54%,文本 0.44%,视频 0.73% |
| 训练配置 | 轮数与批大小 | 30 轮 | 批大小 32 | 学习率 1 乘 10 的负 4 次方 |
表后解释要给出主要收益与代价。论文报告 MoLD 在多模态下超过交叉注意力 2.91% UAR 和 2.42% F1,超过标准多层感知机 4.88% UAR 和 6.01% F1。
在单模态的模态专属标签预测上,相对交叉注意力也有稳定提升,语音、文本、视频 3 路 UAR 分别提升 1% 到 2% 左右。这些数字支持显式分布有助于单模态和多模态两端。代价是需要模态级标注、3 路编码器和两步注意力,推理开销和显存大于单路模型。未胜出项要如实说明。文本单模态的绝对性能明显低于语音和视频,论文表格中文本单模态 UAR 在 27% 到 33% 区间,视频在 37% 到 51% 区间,语音在 50% 以上。
这说明文本分支本身较弱,分布建模虽有提升但没有改变模态强弱排序。原文没有报告显著性检验和多次运行方差,因此不能把百分点差异说成统计显著,只能说在本次划分和单次报告口径下观察到一致提升。
拿掉哪一块掉多少?单模态还稳吗?
消融要回答每个组件是否必要,以及单模态退化后是否仍然有效。消融条件包括去掉分布损失、去掉相似性损失、去掉融合模块。去掉融合模块时不是换成另一种融合,而是直接组合模态专属表示构成多模态表示。单模态评估时同样移除融合模块,其余组件保持相同,与单模态多层感知机对照。表前先明确问题。
这里的问题是,三项中哪一项对最终 UAR 和 F1 影响最大,以及分布分支在没有跨模态信息时是否还有增益。公平条件是同一数据划分、同一指标、同一训练轮数,比较的是去掉前后的差值,方向是下降越多说明该组件越重要。
| 消融或单模态条件 | UAR 变化 | F1 变化 | 对照与设置 | 论文支持的判断 |
|---|---|---|---|---|
| 去掉分布损失 | 下降 1.92% | 下降 2.64% | 完整 MoLD 对照 | 分布建模最影响 F1 |
| 去掉相似性损失 | 下降 1.90% | 下降 1.08% | 完整 MoLD 对照 | 一致性约束有效 |
| 去掉融合模块 | 下降 1.33% | 下降 3.31% | 直接组合表示 | 融合最影响 F1 |
| 单模态语音 | 提升 0.64% | 提升 0.89% | 对单模态多层感知机 | 分布仍有效 |
| 单模态视频文本 | 视频提升 5.63%,文本提升 1.32% | 视频提升 4.75%,文本提升 1.05% | 对单模态多层感知机 | 视频增益最大 |
表后解释要结合数字讲机制。
去掉分布损失带来 1.92% UAR 和 2.64% F1 下降,去掉相似性损失带来 1.90% UAR 和 1.08% F1 下降,去掉融合模块带来 1.33% UAR 和 3.31% F1 下降。这支持每块都有贡献,且分布和融合对 F1 影响更大。单模态下相对多层感知机,语音提升 0.64% UAR 和 0.89% F1,文本提升 1.32% 和 1.05%,视频提升 5.63% 和 4.75%。视频增益最大,可能与视频编码器冻结后分布分支补了判别信息有关,但这只是有限解释,原文没有做特征可视化或冻结与微调的交叉对照,因此记为可能、待验证。
反例是消融没有给出只保留分布不要融合的轻量部署成本,也没有报告延迟和参数量,拿掉一块后是否值得要在实际预算下重测。
哪些结论有边界?什么没测不能承诺?
先区分 3 类表述。论文直接报告的是在 EmotionTalk 官方划分上的 UAR 和 F1 数字,以及去掉某组件后的下降幅度。有限解释是分布保留模糊信息、相似性增强一致、融合捕获互补,这些有消融支持但没有因果证明。未验证推测是分布与模态不变信息的关系,论文在未来工作中明确说要研究模态不变与模态专属信息及其标签分布的关系,目前还没有结论。边界有 4 条。
第一,数据边界。结果只在中文互动语料上验证,没有跨语言、跨场景、跨标注体系的测试,不能推广到英文会议或音乐情绪任务。第二,标注边界。方法依赖模态专属标签分布真值,没有该标注的数据集无法直接复用,弱监督或伪分布是否可行未评测。第三,统计边界。
没有多次随机种子、置信区间和显著性检验,不能把一两个百分点的差距说成稳定胜出。第四,成本边界。没有报告参数量、训练时长、推理延迟和显存占用,不能承诺精度提升不带来开销。总体趋势不等于每组都成立。文本模态绝对性能偏低,完全不对齐样本占 11.3%,这些困难子集上的表现没有单独报告。
相关性不是因果,一致性分析显示分歧普遍存在,但不能反推分歧越大分布收益越大,这需要按对齐程度分组评估,而原文没有做这项分析。
复现先做什么?冻结、特征和损失如何对齐原文?
复现先做三件事。第一,确认数据与标注。下载 EmotionTalk 并按官方七分类划分组织数据,检查每条样本是否有 3 个模态的专属标签和统一标签,以及分布真值的构造口径是否与官方基线一致。类别数、划分文件、缺失模态的处理都要先对齐,否则指标不可比。第二,对齐特征与冻结。
语音用中文 HuBERT 大模型,文本用中文 RoBERTa,视频用 DINOv2 giant。语音和文本微调,视频冻结。Mamba 状态扩展 16、卷积宽度 4,预测全连接丢弃率 0.5,Adam 学习率 1 乘 10 的负 4 次方,30 轮,批大小 32。单模态运行时移除融合模块,不要自行加入自注意力替代。第三,对齐损失与权重。
三项损失分别是交叉熵、KL 散度、InfoNCE 对比损失,总权重经 Softmax 从可学习标量得到并联合优化。投影维度、温度、负采样范围原文未给,需要在复现记录中标为缺项,先用常见默认值跑通流程,再做敏感性分析。资源状态方面,本次收到的证据中没有完成 HTTPS 验证的代码、模型或数据链接,因此不能写代码或权重已公开,只能写按论文文字复现。若未来拿到官方仓库,再核对冻结层、池化维度、拼接顺序和评估脚本。
验证时先复现参考界,多数类约 14.29% UAR 和 8.44% F1,随机约 14.52% UAR 和 11.90% F1,真值分布上界约 66.56% 和 67.50%,确认数据管道无误后再跑可运行基线,最后跑完整 MoLD 和三项消融。
何时值得尝试?一句话带走什么?
当你的任务同时满足 3 个条件时值得尝试 MoLD 思路。第一,有多个模态且它们的判断经常打架,用统一标签训练总觉得抹掉了信息。第二,你能拿到或构造出模态级的软标注,不只是最终答案。第三,你能负担 3 路编码加两步注意力的训练和推理成本。这时可以先给每路加一个分布预测头,用 KL 约束它,再把分布向量拼回融合向量,最后加一个对比约束让各视角不要跑太偏。
如果只有统一标签,或者部署只允许单路小模型,就不要硬套完整框架,可以只借鉴分布思想做标签平滑或辅助任务。带走的一句话是,分歧本身是信号,把每个模态的情绪倾向显式写成分布再融合,比只在特征层面做更复杂的融合更直接。复述方法时按样本走向说。输入 3 路信号,编码加精炼,分布与融合分叉,拼接预测,三损失联合优化。数字只引用原文报告的口径,多模态相对交叉注意力提升 2.91% UAR 和 2.42% F1,消融下降幅度最大在 1% 到 3% 量级,单模态视频提升最明显。
未测的延迟、跨语言泛化和困难子集表现需要补验证后再做选型结论。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

