英文题目:Finding Emotions Where They Belong: Rethinking Audio Emotion Recognition through Masked Temporal Affective Grounding

标签:#语音情感识别 | #SFT | #音频事件检测 | #数据集构建 | #语音

评分:7.3/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Abdelrahman Mohamed:Aalborg University;Pioneer Centre for AI
  • Lars Kai Hansen:Technical University of Denmark;Pioneer Centre for AI
  • Zheng-Hua Tan:Aalborg University;Pioneer Centre for AI

📌 核心摘要

音频情绪识别(Audio Emotion Recognition,AER)长期把整段录音判为单个标签,在多人、重叠与背景笑声下标签归属含糊不清。本文把任务重构为时间情感定位(Temporal Affective Grounding,TAG),要求模型输出多个语音片段各自的起止时间、转写、音色描述(tone description)与情绪标签。数据链先用语音活动检测(Voice Activity Detection,VAD)与 WhisperX 强制对齐清洗 IEMOCAP、MELD 与 Emov-DB,再由 Flamingo-Next 生成音色并经 openSMILE 声学特征规范化,最后拼接成含 2 到 4 个片段的多段样本。训练提出掩蔽时间情感定位(Masked Temporal Affective Grounding,M-TAG),在完整语言建模损失外增加情绪首词元损失与距离加权时间戳损失,并在第二遍前向前向中掩蔽音色与语音上下文以迫使模型依赖音频。相对最强基线 Audio-Reasoner,EMO-TAG 在 MELD 多段集情绪时长 F1 达到 54.55%,超出 23.12 个百分点,IEMOCAP 多段集达到 63.72%,超出 35.17 个百分点。该结论限于 8 类基本情绪与最长 30 秒的拼接评测,细粒度情绪与真实长对话外推尚未验证。单次训练使用 8 张 AMD MI250X 约 46 小时,全部探索约 30000 GPU 小时。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,哪里会含糊?

这篇论文的输入是一段最长 30 秒的音频,录音里可能有多个说话人、笑声、噪声、停顿甚至空段。目标不是给整段录音贴一个情绪词,而是输出一个有序的语音段序列,每个段给出起始时间、结束时间、该段转写、音色描述和情绪标签。必须保留的信息是情绪归属于哪段语音及其时间范围,输出是严格格式化的文本序列,时间用离散词元表示。

含糊点在于常用评测把一条含多说话人或重叠语音的录音当作单标签样本,模型猜对标签也可能用错了依据,或者依据不足却蒙对。论文把 8 类情绪作为训练和评测的主标签,包括中性、快乐、悲伤、愤怒、惊讶、恐惧、厌恶和沮丧,并区分原始集、清洗后精炼集、噪声子集和人工拼接的多段集。初学者可以这样复述方法边界:它不估计情绪表达在音素级的精确起止,而是把情绪标签对齐到可懂的语音段区间。

理解这一点后,后续的损失设计和指标才有意义,否则容易把时间误差当成标注噪声而忽略归属错误。

同输入同目标的工作在做什么,本文改了哪一步?

通用音频语言模型同时做转写、描述和情绪识别,专用情绪模型则生成情绪描述或用情绪轮奖励做强化学习,时间定位一侧有给推理步骤打时间戳和给复杂场景生成带时间描述的工作,最接近的是语音情绪 diarization,它逐帧标注情绪出现时刻。本文的输入同样是音频,目标同样含情绪,但监督和运行阶段不同:它不要求人工逐帧标注情绪起止,而是用语音活动检测加转写对齐得到语音段边界,再把情绪绑定到段上,这样可以用较少人工成本构造可微调规模的数据。

另一条差异是训练方式,近期工作常用强化学习优化结构化输出,本文坚持用监督学习加精心设计的损失,理由是转写和音色描述的生成方式不多,强化学习容易拉长生成并分散对音频的注意力。初学者常误以为加了推理文本就等于可解释,论文指出现有模型的推理常与预测情绪不一致,且正确标签不代表定位正确。

对照时不要把类别差异当同条件胜负:能打时间戳的通用模型与只做分类的情绪模型在本文多段定位任务上本就不对等,论文为此用较宽松的抽取器把基线自由输出转为统一格式再评分。

为什么整句分类的评估会失真?

问题来自数据与任务假设不匹配。论文检查发现很多被当作单样本的录音含有多说话人、重叠、背景笑声或空音频,若仍按单标签训练和评测,就无法判断模型是用目标语音、无关线索还是运气得到正确答案。解决思路是把音频情绪识别改写为时间情感定位任务,给定音频预测语音段集合,每个段是一个五元组,含起止时间、转写、音色和情绪。训练样本包含 1 到 4 个段,段格式形如说话人标记加引号转写加起止词元再加音色与情绪字段。时间用步长 0.25 秒量化,连续时间戳按四舍五入映射到最近档并截断到上限。

时间情感定位 × 语音段: 时间情感定位负责回答情绪属于录音中哪一段时间,语音段负责提供可承载该答案的单位,包括起止时间、转写、音色描述和情绪标签,二者搭配的理由是只有把标签绑定到具体语音区间,才能在多说话人或多事件录音中消除整句标签的归属歧义,组合意义是把分类问题转为结构化定位问题。

举例说明:一条拼接录音前 2 秒是愤怒的指责,后 2 秒是悲伤的道歉,整句分类只能输出一个词,必然丢掉一个事件,而定位任务要求输出两个带边界的段,评测才能同时检查找对和放对。这个例子是教学用例,不是论文数值。论文还构造了噪声子集专门收录多说话人或重叠等难样本,用来检验模型在归属不清时的行为。

方法全景:一个样本走完输入到输出

沿一个样本走一遍有助于建立依赖顺序。输入音频先经编码器和投影进入语言模型,模型自回归生成完整目标序列,序列中时间边界是特殊词元。第一条前向通路用全因果上下文计算语言建模损失,监督转写、时间戳、音色和情绪的全部词元。第二条前向通路复用同一输入序列但加注意力掩蔽,只保留时间戳词元和每个情绪标签首词元的 logits 用于辅助损失,其余 logits 丢弃。总目标是语言建模损失加情绪损失加起止时间损失的加权和。

训练按课程推进:先单段学格式,再引入掩蔽定位损失并加随机噪声或静音防模型只猜音频首尾,最后引入两段到 4 段录音学多事件区分。 下面导读图一展示了两条前向通路如何分工,重点是掩蔽只作用于第二条通路而不破坏第一条的完整监督。

看图路径: 1. 先看顶部输入条确认语音文本时间音色情绪的排列顺序;2. 再对比第一条全上下文路径与第二条掩蔽路径的可见勾叉差异;3. 最后看底部总损失把四项加权相加的汇合位置

原论文 Figure 1:Overview of our objective.

论文图 1。原论文 Figure 1::“Overview of our objective. The first forward path calculates the language modeling loss using the full sequence.”。

从像素可见顶部输入条按语音、转写、起止时间、音色、情绪首词元排列,第一条路径 5 个上下文全部打勾并汇入语言建模损失,第二条路径列出 3 种掩蔽组合分别保留或遮挡语音与音色,随后分叉为时间戳损失和情绪损失,底部公式把四项相加。这种双通路设计的安排理由在原文有明确说明:情绪与时间戳在目标序列中占比小,梯度易被转写和音色淹没,且音色紧贴情绪会形成文本捷径,多段时情绪位置离音频更远,对音频的注意力会衰减,因此需要额外加权与掩蔽。

掩蔽与加权具体算什么?

先讲符号与输入。设第 k 段情绪首词元位置为情绪查询点,掩蔽矩阵决定情绪预测时能否看到前文的语音与音色词元,被遮挡的词元仍留在序列中,只是不允许注意力指向它们。掩蔽以一定概率采样两种策略之一:只遮音色,或同时遮语音与音色,目的是让模型在不同上下文中都必须利用更远的音频与历史时间信息。

情绪辅助损失只取每个情绪标签的第一个词元,因为该首词元在词表中唯一且后续词元交叉熵常很小,平均到整个标签会稀释多词元情绪的监督。时间辅助损失监督每段起止时间戳词元,并复用同一第二条通路的掩蔽以避免再做 1 次昂贵前向。时间权重按预测边界与真值边界的绝对误差除以枢轴再截断到上下界得到,误差越大权重越大,使分类损失能区分小误差与远距离错误。

以下公式先定义时间误差与权重,其中帽子符号为预测时间,无帽为真值,截断防止权重过大或过小。

\[d_{k}^{b}=\left|\hat{\tau}_{k}^{b}-\tau_{k}^{b}\right|,\qquad w_{k}^{b}=\operatorname{clip}\left(\frac{d_{k}^{b}}{\delta},c_{\min},c_{\max}\right).\]

该加权交叉熵作用于起止词元位置,情绪损失与起止损失再按段求和,最后与语言建模损失加权相加,权重控制各自贡献。

\[\mathcal{L}=\mathcal{L}_{\mathrm{LM}}+\lambda_{\mathrm{emo}}\mathcal{L}_{\mathrm{emo}}+\lambda_{\mathrm{start}}\mathcal{L}_{\mathrm{start}}+\lambda_{\mathrm{end}}\mathcal{L}_{\mathrm{end}}.\]

实现细节按原文交代:骨干是 Qwen2-Audio-7B-Instruct,语言模型与音频编码器用秩 16 的低秩适配,投影层也训练,新增时间戳词元的嵌入与输出行可训练,有效批量 48,优化器为 AdamW,学习率 1e-5,余弦调度 50 轮,两轮后引入掩蔽,13 轮起引入多段,辅助权重经 3 轮 warm-up 升到情绪 1.5、起止各 0.25,多段引入后再 warm-up 两轮以减不稳定。掩蔽概率为 1.0,其中 60% 只遮音色、40% 同时遮语音与音色。时间权重取枢轴 1、上下界 0.25 与 3.0。

语言建模损失 × 掩蔽情感损失: 语言建模损失负责在全因果上下文中教会模型输出完整格式,包括转写、时间戳、音色和情绪,掩蔽情感损失负责在遮挡音色或语音文本后只对情绪首词元追加监督以迫使模型回看音频,二者搭配的原因是前者保格式完整、后者防文本捷径,组合意义是在不破坏生成能力的同时增强情绪对音频的依赖。

时间戳词元 × 距离加权: 时间戳词元负责把连续时间离散为可预测的词表符号,步长 0.25 秒且上限 30 秒,距离加权负责按预测边界与真值边界的绝对误差放大或缩小该词元交叉熵的权重,二者搭配的原因是普通分类损失不区分差 0.25 秒还是差 5 秒,组合意义是让时间误差大的预测付出更大代价从而学到更准的边界。

需要指出未报告项:原文未给出掩蔽采样是否按段独立,也未报告第二条通路中历史时间词元是否始终可见,复现时应按默认实现保留历史时间可见并记录选择。

数据如何从脏录音变成可训练的多段样本?

构造流程分 3 段,目的是让时间与情绪都有据可查。单句清洗先用语音活动检测切出语音与非语音,处理 MELD 情景喜剧中的高能量笑声只去高能量非语音而保留自然停顿叹息,再用 WhisperX 转写每段并与真值转写强制对齐,若某段无词匹配则视为无关并拼接剩余段后 2 次对齐修剪,若仍有连续插入或多处替换则丢弃样本。

音色标注先用 FlamingoNext 生成转写与音色初稿,保留与参考转写相似度至少 60% 的样本,再用 Qwen3 抽取语音与音色并检查音色与真值情绪是否一致,不一致则带真值情绪重标仍不一致则丢弃,随后把每段切五份用 openSMILE 提特征并结合说话人级音高响度语速参考,经 ChatGPT 改写为简洁规范的一句音色描述。

多段构造从清洗池无放回采样,按随机顺序拼接两段到 4 段,段间插入 0.5 到 2.0 秒的同数据集真实静音而非数字零,重叠样本则按 0.5 到 2.0 秒重叠,超长则重采样,说话人编号按出现顺序重编并按偏移更新起止时间。 下面导读图四展示了从清洗到音色再到拼接的完整管线,适合对照代码复现每一步的保留与丢弃条件。

看图路径: 1. 先沿 A 行从输入经语音活动检测到对齐过滤看单句如何变干净;2. 再沿 B 行从生成经转写校验到音色精炼看音色如何被规范;3. 最后看 C 行 validated span pool 如何拼成顺序与重叠多段样本

原论文 Figure 4:Overview of the data-processing pipeline, from speech and tone validation to the construction of…

论文图 4。原论文 Figure 4::“Overview of the data-processing pipeline, from speech and tone validation to the construction of cleaned single- and multi-span datasets.”。

从像素可见 A 区五框完成可听语音筛选,B 区从 FlamingoNext 生成经相似度校验、解析、一致性检查到低层特征精炼得到验证段,C 区从验证池无放回采样再经顺序或重叠组合得到含 1 到 4 段的时间目标。代价是过滤较激进,会丢掉不少好样本尤其是很短样本,且 MELD 中性占比约 42% 而恐惧仅约 3%,过滤后不平衡仍然保留。资源状态方面,本次收到的第三方资源中 Qwen2-Audio、Whisper-large-v3、Audio-Flamingo-Next、Qwen3-14B 与 bge-large-en-v1.5 当前可用,但这只表示链接可达,不代表论文训练代码与权重已公开,原文表述为发表后发布。

测什么,和谁比,条件是否一致?

评测围绕两个问题:情绪找对没有,情绪放对位置没有。单段用情绪段准确率,只看模型生成的第一个有效情绪是否等于真值。多段与含重叠多说话人的单段用情绪命中准确率,检查每个真值段的情绪是否出现在与该段关联的预测集合中,多段时按段独立防止跨段得分。时间定位用情绪持续时间 F1,把录音按 0.25 秒分帧,按情绪类别统计预测帧与真值帧的交集求持续精度与召回再取调和平均,时间对但情绪错不计入交集。指标方向都是越高越好。

基线包括 FlamingoNext、Audio-Reasoner 和 AffectGPT,另有 Qwen2-Audio-Instruct 作为参考,其中前两者可生成带时间描述,AffectGPT 只评情绪识别。由于基线不原生遵循本文格式,论文保留其默认提示并要求输出时间与限定标签,再用 Qwen3 抽取为统一格式,抽取提示被刻意放宽以不惩罚风格差异。条件不一致处需记牢:部分基线同时收到音频与转写文本,而 EMO-TAG 只用音频;MME-Emotion 部分基线数取自前人报告并标注,FlamingoNext 数为本文实测。 以下公式给出命中率的聚合方式,分母是所有样本真值段总数,分子是命中段数。

\[\mathrm{Hit}_{\mathrm{emo}}=\frac{1}{\sum_{i=1}^{N}K_{i}}\sum_{i=1}^{N}\sum_{k=1}^{K_{i}}\mathbf{1}\left[z_{i,k}\in\widehat{\mathcal{Z}}_{i,k}\right],\]

情绪命中准确率 × 情绪持续时间 F1: 情绪命中准确率负责检查真值情绪是否出现在对应段的预测集合中而不苛求边界,情绪持续时间 F1 负责按 0.25 秒帧检查情绪与时间同时正确的重叠比例,分工是前者衡量找到没有,后者衡量放对位置没有,搭配原因是多段场景中找对情绪不等于放对位置,组合意义是共同揭示识别与定位之间的差距。

数据集划分按原文交代为原始、精炼、噪声与多段 4 种提法,训练与评测覆盖 MELD、IEMOCAP、EmoV-DB 及 DEFW 与 MAFW 的扩展实验,硬件为 8 卡 AMD MI250X 单轮约 46 小时,总计约 30000 GPU 小时含消融与失败尝试。

主结果:识别与定位各赢多少?

比较问题是同协议下情绪识别与时间定位是否同时提升,公平条件是统一标签集与统一抽取格式,指标方向均为越高越好。下表先看上下文消融的逐数据集分解,它是理解全文权衡的关键,包含部分上下文、完整上下文与掩蔽目标的对比,并给出多段的持续时间 F1、情绪 F1、容差 0.25 秒的段 F1 与平均交并比。

Partial Context SFTPartial Context SFTPartial Context SFTPartial Context SFTPartial Context SFT
Emotion only54.4466.3652.2362.85
Speech + Emotion52.9866.0049.0963.25
SFT53.9161.0950.7857.76
SFT+TAG53.7261.0952.0159.83
SFT+M-TAG (EMO-TAG)56.1366.9756.6065.65

该表显示仅情绪监督已很强,完整上下文普通微调反而偏弱,加入无掩蔽辅助损失提升不大且不一致,引入掩蔽后才明显改善,去掉情绪损失主要伤识别,去掉时间损失主要伤定位。接着看主识别与定位数字,论文报告 EMO-TAG 在 IEMOCAP 原始精炼噪声三集的段准确率均值较高,在 MELD 原始与精炼上超过最强基线,在 MELD 噪声集的段准确率与命中率也占优,多段持续时间 F1 在 MELD 领先约 23 个百分点、在 IEMOCAP 领先约 35 个百分点,MME 3 个子集也领先。

条件指标基线本方法比较对象
MELD 多段持续时间 F131.43%54.55%Audio-Reasoner 对 EMO-TAG
IEMOCAP 多段持续时间 F128.55%63.72%Audio-Reasoner 对 EMO-TAG
IEMOCAP 原始精炼噪声段准确率均值待基线对照65.62% 65.32% 63.51%EMO-TAG 三集
MELD 原始精炼段准确率均值44.52% 48.91%54.65% 57.91%FlamingoNext 对 EMO-TAG

上表数字来自原文连续句的逐字证据,百分号与精度保持原写法,未做四舍五入或差值计算,差值描述放在表后文字中。表后解释主要收益与代价:收益是定位差距大幅缩小且识别未受损,并在只用音频条件下超过同时用音频加文本的基线。

代价是多段拼接与双前向带来构造与计算负担,且 MELD 噪声集的段准确率与命中率之间仍有落差,说明噪声子集本身标注含糊。未胜出项也需说明:个别基线在噪声集的命中率并不低,MELD 噪声的绝对准确率仍远低于干净集,表明难样本尚未解决。

条件指标基线本方法比较对象
MME 噪声荒野实验室段准确率均值待基线对照58.20% 33.56% 45.27%EMO-TAG 三子集
MME 三子集领先百分点待对照7.43 1.06 7.64 百分点FlamingoNext 对 EMO-TAG

该表同样只搬运原文报告的均值与百分点差,未把自动指标当人评,未把不同指标的差值混入模型列。

总体判断用报告口径:论文显示所提目标在所测协议上同时改善识别与定位,但这不等于每组每步都成立,也不承诺延迟与误判率同步改善。

加上下文为何反而变差,掩蔽补回多少?

该节的教学任务是解释反直觉现象并给出可复述的操作。部分上下文实验显示仅情绪训练在 MELD 与 IEMOCAP 平均的命中率与持续时间 F1 已达较高水平,加语音略降,加原始音色大降,加精炼音色可追回部分损失,完整上下文普通微调在使用原始音色时最差,换精炼音色可提升约 6 个百分点并略超精炼音色单用。

引入辅助损失后原始音色提升明显,精炼音色提升较小但仍不及仅情绪,直到完整掩蔽目标才在两类音色上全面超过仅情绪约 1 到 2 个百分点,成为唯一超过仅情绪的设置。机制解释按原文有限表述:原始音色细节多但样本间不一致,在语言建模目标下更难学,精炼音色更一致具体因而更好,更多细节可能需要更多数据才能可靠学到,这属于支持性解释而非因果证明。

下面导读图 2 对比了生成音色与精炼音色在 3 种训练下的平均命中率与持续时间 F1,虚线为部分上下文基线。

看图路径: 1. 先对比每组蓝色生成音色柱与橙色精炼音色柱的高低;2. 再看虚线表示的仅情绪等部分上下文基线所处高度;3. 最后看从普通微调到无掩蔽再到有掩蔽三组的变化趋势

原论文 Figure 2:Average performance across context settings.

论文图 2。原论文 Figure 2::“Average performance across context settings.”。

从像素可见左侧命中率与右侧持续时间 F1 中橙色精炼柱普遍高于蓝色生成柱,普通微调组最低,掩蔽组最高且橙蓝差距缩小,虚线中仅情绪线位置最高,说明掩蔽是把全文上下文从负担变回增益的关键。掩蔽概率扫描显示从 0 到 1 效果总体一致,论文主实验取 1.0。可训练组件消融显示只调语言模型低秩已可用,再加音频编码器低秩主要改善多段与 MME,继续训练投影层在 4 组评测上最好。

失败条件方面,强化学习初步实验仅比普通微调略升且偶发中文生成与冗长续写,论文据此认为在这种简洁生成任务上不应把强化学习当默认提分手段,该判断限于本文格式与奖励设计,不推广为强化学习无用。

音色描述 × 情绪标签: 音色描述负责用人语概括音高响度语速等听感线索,情绪标签负责给出最终的情感判断,二者搭配的初衷是让中间推理帮助最终判断,但论文发现教师强制下音色文本先出现会成为情绪预测的捷径,组合意义是需要用掩蔽和规范化来控制音色细节与数据量之间的权衡,否则更多上下文反而降低泛化。

哪些边界尚未验证?

论文明确列出 3 类限制。数据不平衡在 MELD 训练与评测中都存在,中性占 40% 以上而恐惧仅百分之几,过滤保留了这种偏斜。音色描述未做人工验证与质量评估,原因是资源有限且一致的质量标准难定义。标签限于 8 类基础情绪,更细的情绪轮区分未覆盖。附录定性例子还显示 MELD 存在标注可疑样本,例如 3 模型一致判中性而真值为惊讶悲伤的拼接样本,以及模型边界正确但情绪错、合并不同情绪话语、覆盖不全、提前起始等定位错误,说明正确定位仍不等于情绪全对。

另一边界是扩展数据实验:加入 DEFW 与 MAFW 后各自测试集与 MME 荒野有所改善,但 MELD 与 IEMOCAP 略降,可能反映数据集性质差异,用仅情绪监督加新数据可保持竞争力有时甚至超全监督,这支持目标的灵活性但也提示跨域需谨慎。未测量项包括推理延迟、输出帧率与误判率成本,总体趋势不等于每组都成立,部署前需补测。

复现先做什么,需要哪些信息条件?

复现应按学习依赖先跑通数据再跑训练。先实现单句清洗管线并记录每步丢弃数,核对语音活动检测、WhisperX 对齐、笑声能量阈值与插入替换拒绝规则,再实现音色生成抽取与低层特征精炼并固定提示词版本,随后按无放回采样与真实静音拼接多段并更新偏移与说话人编号。训练按 3 阶段课程执行,核对批量、学习率、轮数、掩蔽引入时机与辅助权重 warm-up,评测时固定 0.25 秒帧与三指标实现,并用同一抽取器处理基线输出以保公平。关键超参数与信息条件已在方法段列出,可直接用于配置文件。附录目录有助于定位实现细节,下表给出附录结构以便按图索骥。

SectionContentsPage
BTraining AblationB
CAdditional ExperimentsC
DDatasetsD
EQualitative ResultsE
FLimitationsF

该表是附录导航而非结果表,不能用于证明性能,表后需明确其用途边界:它只告诉复现者去哪里找模型、预处理、标注、多段设计、消融、扩展实验、数据集统计、定性例子、局限与提示词,正文性能结论仍以结果与消融表为准。代码与权重按原文表述为发表后发布,当前只能确认第三方基座链接可达,不能写训练代码已公开。扩展实验中仅情绪数据的使用方式值得注意:对只有情绪标注的样本只在情绪首词元上施加掩蔽情感损失,其余词元零损失,这为利用无语音音色标注的情绪数据提供了可运行路径。

何时值得尝试,还需补哪项验证?

当录音含多说话人、多事件或重叠且需要知道情绪归属时,值得尝试把分类改写为带边界的结构化预测,并用掩蔽迫使模型依赖音频而非音色文本捷径。当数据量小而音色描述风格不一时,应先规范音色或从仅情绪基线起步,再逐步加语音与音色,避免一步加足上下文导致普通微调退化。复现后还需补三项验证:一是在新领域测不平衡标签下的少数情绪表现,二是人工抽查音色质量与边界容差敏感性,三是实测双前向的训练与推理开销及输出稳定性。

附加数据实验显示仅情绪监督可作为低成本扩展手段,但跨数据集的轻微回退提示需做域适配对照。 下表汇总扩展数据实验的均值对比,用于判断加数据时选全监督还是仅情绪监督。

MME-EmotionMME-EmotionMME-EmotionMME-EmotionMME-EmotionMME-EmotionMME-Emotion
Lab42.0547.6944.0644.4745.2742.05
MELD51.9155.8654.5653.6155.2352.96
IEMOCAP60.1865.8464.5364.9764.6564.40
MELD50.7856.6053.8252.6654.1753.90
IEMOCAP57.7665.6563.8663.5863.5762.68

该表覆盖 MME、单段与多段在不同监督与段数组合下的表现,表后解释是加 DEFW 与 MAFW 后各自域与荒野子集受益而 MELD 与 IEMOCAP 略损,仅情绪监督在多数情况下保持竞争力,代价是仍需权衡域差异,适用条件是目标域与新增数据分布接近时优先全监督,否则先用仅情绪监督做稳妥扩展。最终收束:论文报告在所测协议上识别与定位双升,且只用 12k 量级独特训练样本实现,但这不改变未验证项仍待补测的结论。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-29 语音/音乐/音频论文速递