英文题目:Affectron: Emotional Speech Synthesis with Affective and Contextually Aligned Nonverbal Vocalizations
会议身份:
conference:acl:2026:conference-paper-id:2026.findings-acl.1369
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据增强 #自回归模型 #零样本 #语音 #文本到语音
评分:8.0/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Deok-Hyeon Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Hyung-Seok Oh:机构信息未能从会议 PDF 纯文本可靠映射
- Seung-Bin Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Seong-Whan Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感语音合成需从文本与情感参考生成含笑声、叹息等非言语发声的高质量连贯且富有表现力的自然语音,难点在于公开NV数据稀少且缺少类型与位置监督。Affectron先以情感向量做情感驱动Top-K非言语发声匹配,为每段言语挑选情感相容候选NV。其输出候选再经球面情感距离的情感感知Top-K路由,在言语分段间采样上下文合适的插入位置。重排后的神经音频编解码器序列随后经非言语发声结构掩蔽微调,使VoiceCraft主干依双边言语情感补全NV。相对标签控制与自发风格路线,该框架训练时构造增强样本而推理时仅需含NV标签文本与情感参考,无需检测器或人工对齐。在EARS未见说话人零样本合成评测下,Affectron-330M的NV-Acc为36.90,高于Fun-CosyVoice3-0.5B的27.38。该结论适用边界受限于朗读式消声室英语、非重叠插入与预定义NV标签集合,尚未验证野外噪声与多人交互下的稳定性。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://choddeok.github.io/Affectron/ — 链接可访问(HTTP 200)
- 演示资源:https://choddeok.github.io/Affectron/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/nari-labs/dia — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/ddlBoJack/emotion2vec — 链接可访问(HTTP 200)
- 第三方资源:https://www.mturk.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,先保留哪些信息?
本文解读的对象是 ACL 2026 Findings 论文 Affectron,任务是情感语音合成中的非言语发声生成。输入是带非言语标记的文本与一段提供音色和情感条件的参考语音,目标是输出既保留有词语句自然度、又在情感与上下文合适处包含笑声、叹息、哭泣、填充词等非言语发声的语音。必须保留的信息包括数据是小规模开放且言语与非言语分开录制的解耦语料、训练时才做匹配与路由而推理时不做、主干是在纯言语上预训练的 VoiceCraft。输出是 1 篇可核对的方法复述,不评价修辞,只讲论文实际做的动作与报告的条件。
对刚入门的读者,白话先行:非言语发声,英文为 nonverbal vocalizations,缩写为 NVs,指不成词但有情感的声音事件;有词语音,英文为 verbal speech,指能转写为文字的语句部分。论文要解决的矛盾是开放场景下高质量非言语语料少、无显式对齐监督,随机插入会情感错配,依赖检测器又会引入误差传播。
非言语发声 × 韵律调制: 非言语发声指笑、叹息、哭泣、咳嗽等不成词但载有情感的发声片段,分工是直接给出离散而强烈的情感信号;韵律调制指在有词语音上通过音高、能量和时长的连续变化表达情感,分工是维持语句可懂度下的细腻变化。二者搭配的原因是仅调韵律难以复现大笑或抽泣这类事件,仅放非言语发声则会割裂语句连贯性,组合意义是让 Affectron 同时保留口语流自然度并在恰当位置插入情感一致的非言语事件。
从学习依赖看,后文先讲两条已有路线为何不够,再讲 Affectron 如何用增广加掩码补上类型多样性与位置合理性,最后讲实验如何证明非言语变好而口语未变差。教学例子仅为例子:比如同一句道歉语,在句尾放一声轻叹比在句首放一阵大笑更符合上下文,但论文并未给出该例的具体数值,例子不作为证据。
已有两条路线各卡在哪里?
第一条路线是标签控制合成,英文为 tag-controlled TTS。做法是在文本中手工放入类似 laughing 或 filler 的标记以指定类型与位置。论文指出它需要对齐标注或非言语检测器,而检测器偏差与误差传播常导致时间不一致,且已有工作多只适用于笑与哭,泛化受限。第二条路线是自发风格合成,英文为 spontaneous-style TTS。做法是从上下文线索直接预测非言语发声,无需显式对齐。论文指出它依赖私有数据集,公开语料在规模与质量上受限,公开语料多偏向呼吸与笑且常有声学瑕疵,难以建模轻笑、咯咯笑等细粒度变化。
神经编解码语言模型,英文为 neural codec language models,缩写为 NCLMs,是近年零样本合成的常用范式。做法是把音频离散为编解码器词元,用自回归预测建模序列依赖,再解码回音频。代表系统包括 VALL-E 与 VoiceCraft。论文指出这类系统主要面向音色克隆,即使提示中给出线索,也常无法可靠生成带细粒度韵律变化的非言语发声。CosyVoice 等虽能合成带非言语的语音,但需要大量高质量标注语料,且多类型并发时自然度下降。
标签控制合成 × 自发风格合成: 标签控制合成的分工是由人工在文本中写明非言语类型和位置,例如在词间插入 laughing 标记,优点是可控但依赖对齐标注或检测器;自发风格合成的分工是从上下文自动预测是否出现非言语发声,优点是无需逐处标注但依赖私有大语料。搭配讨论的原因是 Affectron 处于二者之间,训练时自动构造类型与位置、推理时只接受带标记文本加情感参考,组合意义是既避免推理时依赖检测器,又不要求大规模人工对齐。
本节的教学任务是建立对照基准:同输入指文本到语音合成,同目标指情感表达中的非言语生成,同监督指是否需要对齐标注,同运行阶段指训练构造与推理生成是否一致。后文方法全景正是为了在无对齐、小语料条件下同时解决类型选择与位置选择。
为什么位置合理性需要单独建模?
论文用情感属性变化模式来说明位置不是任意的。直觉是相邻词的情感状态变化小,间隔越远变化越大,而含非言语的语句在近距离上表现出不同的变化斜率。如果插入位置完全随机,就会破坏这种随距离变化的分布。论文因此把类型选择与位置选择拆成两个可控的采样模块,并在训练时用概率采样保留多样性。
下图比较了纯有词语料与含非言语语料在不同词间隔上的情感变化,横轴是词距离间隔,纵轴是角距离,包含均值曲线与置信带,时间范围是间隔 1 到 10。读图时先确认对象与条件,再看升降方向,不能把某一间隔的数值推广为全程结论。
看图路径: 1. 先确认横轴词间隔与纵轴角距离的含义;2. 再比较黑色与蓝色两条均值曲线在间隔 1 到 10 上的升降;3. 最后观察两条曲线周围置信带的宽窄变化
论文图 1。原论文 Figure 1:“Analysis of emotional attribute change pat- terns across temporal gaps (up to a gap of 10) for the EARS (Richter et al., 2024) dataset (verbal only) and the NonverbalTTS (Borisov…”。
该图显示两条曲线都随间隔增大而上升,但起点与斜率不同:含非言语的曲线在小间隔处起点更低、上升更陡,而纯有词曲线起点更高。这种差异支持论文的安排理由,即位置需要按周围情感上下文来路由,而不是均匀随机。像素不能精确辨别的数值不硬写,具体数值以正文报告的分布指标为准。
Affectron 的全景动作是什么?
Affectron 的训练全景可沿一个样本走完。输入是一句有词语音与其说话人标签,加上非言语候选库。第一步做情感驱动 Top-K 非言语匹配,为该句选出情感相近的候选集合并采样一个候选。第二步做情感感知 Top-K 路由,计算该候选与句中每个可插入间隙的情感距离,选出 Top-K 位置并按温度缩放的 softmax 采样最终位置。第三步把选中的非言语波形与有词波形按位置拼接,构造增广音频与重排文本,再经编码器得到重排编解码器词元序列。
第四步做非言语结构掩码与延迟堆叠,构造掩蔽跨度并把原始词元搬到序列尾部,用标准语言建模目标微调 VoiceCraft 主干。推理时不再做匹配与路由,直接从带非言语标记的重排文本与情感参考语音生成。
下图是训练框架总览,左侧是两路数据源,中部是匹配、情感属性预测与路由,右部是编码器与掩码构造,底部是解码器与重建音频。看图时沿输入到输出的主箭头走,再看语义与声学分支在何处汇合。
看图路径: 1. 先从左上两路虚线框看非言语库与有词语音库如何汇入匹配模块;2. 再看中部情感属性预测与路由如何决定插入位置;3. 最后沿底部重排文本与重排词元序列看 Transformer 解码到重建音频的主路径
论文图 2。原论文 Figure 2:“Overview of the Affectron training framework.”。
图中可见的关键分工是:上部匹配只决定用哪段非言语素材,中部路由只决定放在哪里,下部掩码迫使模型利用周围有词上下文生成过渡。符号上,图中用不同颜色区分有词与非言语编解码器词元,用掩码词元与句尾标记表示重排结构。原文明确说明匹配与路由仅在训练时用于构造增广样本,这是复现时不能搞错的信息条件。
类型如何选才能情感一致又多样?
情感驱动 Top-K 非言语匹配的输入是整句有词语音的情感嵌入与每个候选非言语片段的情感嵌入,嵌入来自 Emotion2Vec 这类情感表示模型。计算目标是余弦相似度排序,选出最相近的 Top-K 候选集合,再按相似度做概率采样而非只取第 1 名。原文明确的实现是引入同说话人约束,即候选只在同一说话人的非言语片段中选取,理由是保持音色与声学过渡稳定,而不是强制说话人特有的非言语模式。附录进一步用伪标签分布说明多数非言语类别并不只对应单一离散情感,例如笑声多映射为高兴但也出现在悲伤与惊讶下,因此匹配依据的是嵌入级情感对齐而非固定规则。
情感驱动 Top-K 匹配 × 情感感知 Top-K 路由: 情感驱动 Top-K 匹配的分工是为每句有词语音选哪一段非言语素材,在情感嵌入空间中找情感相近的候选以保证类型多样且情感一致;情感感知 Top-K 路由的分工是决定选中的素材放在词序列的哪个间隙,通过比较候选与左右词语情感属性的球面角距离选出上下文合适的位置。二者搭配的原因是只选对类型而放错位置仍会显得突兀,只放对位置而类型错配则情感冲突,组合意义是共同构造出类型与位置都与上下文相容的增广训练样本。
超参数上,匹配的 K 控制多样性与一致性的权衡。K 过小则采样近乎确定,多样性下降;K 过大则候选集扩大,多样性上升但与参考的相似度下降。论文通过网格搜索报告中间取值在非言语与有词指标上更均衡,具体操作点是匹配 K 为 10、路由 K 为 5,后续实验沿用该设置。该设置是实际可运行的策略,不是事后最优值替换。
位置如何算才能上下文合适?
情感感知 Top-K 路由的输入是词级情感属性与候选非言语的情感属性。做法是先用蒙特利尔强制对齐器做词级切分,再用情感属性预测器得到每段的效价、唤醒度与支配度,然后转换到球面坐标,用球面角距离衡量情感方向差异。对每个可插入间隙,距离由左右相邻有词段的角距离平均得到,首尾间隙只用一侧。接着取距离最小的 Top-K 位置,把负距离经温度缩放 softmax 转为选择分布并采样最终位置。详细球面变换与路由计算在附录中给出,正文给出距离定义与采样公式。
神经编解码语言模型 × 非言语结构掩码: 神经编解码语言模型分工是把音频离散为编解码器词元并做自回归预测,负责高质量重建与零样本音色延续;非言语结构掩码分工是在 VoiceCraft 因果掩码基础上围绕非言语片段构造含相邻有词词元的掩蔽跨度,迫使模型依据周围情感上下文做填充。搭配原因是直接在纯言语预训练主干上微调容易破坏过渡自然度,组合意义是让模型学会非言语与前后词语在声学与情感上的平滑衔接。
非言语结构掩码的输入是已按插入位置重排的词元序列。举例说明:若有词跨度为 6 个词元、两个非言语跨度各 2 个词元,重排后为有词前半加第一段非言语加有词后半加第二段非言语。训练时随机选一段非言语为中心,采样长度为均匀分布的掩蔽跨度,允许包含相邻有词词元,例如同时盖住前一个有词词元与后一个有词词元。被盖住的原始词元被搬到序列尾部,并在其前插入掩码词元,最后做延迟堆叠以高效建模多码本并行流。重排文本同步在对应位置插入非言语标记,模型以交叉熵对所有词元优化。
训练与推理在信息条件上有何不同?
训练阶段的真实计算过程是构造增广样本再微调。数据集采用 EARS,约 100 小时、在消声条件下录制、共 107 位说话人,有词语音与非言语分开录制。论文基于该解耦设置,对有词语音与候选非言语片段应用匹配与路由,得到增广音频与重排文本,然后微调 VoiceCraft 主干。优化目标是标准的自回归编解码器语言建模目标,对所有词元计算交叉熵。原文未报告逐层冻结、梯度是否截断到情感编码器、学习率与步数的完整清单,缺项如实指出,不从模型名称推定实现。附录消融中提到相同训练设置下训练 10000 步用于比较同与跨说话人混合,这是可复现的预算线索之一。
推理阶段不做匹配与路由。输入是带非言语标记的文本与提供目标说话人与情感条件的参考语音,模型直接自回归生成重排词元序列,再经编解码器解码为音频。信息条件差异是复现关键:训练需要情感嵌入模型、强制对齐器与情感属性预测器来构造样本,推理只需要文本标记与参考语音。论文声明音频样本与实现代码在项目页公开,资源状态显示代码与演示链接当前可用,第三方库与众包平台链接也显示可用,但本次解读不继承外部页面的具体内容。
用什么数据、与谁比、如何打分?
数据与划分按原文交代。微调用 EARS,评估区分已见说话人与未见说话人零样本设置,主观评估从测试集随机抽 150 句,其中已见 100 句、未见 50 句。客观指标分为言语与非言语两类条件:言语指标用纯言语合成样本计算,非言语指标用带非言语合成样本计算。
说话人相似度用 WavLM 做言语与非言语说话人嵌入余弦相似度,情感表达用 Emotion2Vec 做言语与非言语情感嵌入余弦相似度,非言语分类准确率用在 EARS 上内部训练的分类器,非言语相似度用生成与经匹配选出的真值之间的情感嵌入余弦相似度,语言一致性用 Whisper 大模型算词错误率。类型与位置预测另用 Top-K 准确率与分布距离评估,分布距离用 Jensen-Shannon 散度与 Hellinger 距离,值越小表示预测分布越接近真实分布。
主观评估包括 AB 偏好测试与平均意见分,分为非言语自然度与情感上下文连贯性两项,英文缩写为 NTN-MOS 与 NEC-MOS,采用 5 分制并报告 95% 置信区间。众包经由亚马逊土耳其机器人平台,每项评估 20 位美国本土英语母语者参与,AB 测试与 MOS 评估分别花费 60 美元与 180 美元,只允许高通过率工人参与,并用伪样本与停留时长过滤注意力不集中者。硬件与完整训练预算原文未系统报告,这是复现时需补的缺项。比较条件上,基线包括未在 EARS 上训练的预训练模型与在 EARS 上微调的模型,标记区分,未见说话人设置用于检验泛化。
主结果支持什么,又没赢在哪里?
要回答的核心问题是:在相同文本与参考条件下,Affectron 是否在非言语相关指标上超过实际可运行的基线,同时不明显损害言语质量。公平条件是所有生成音频重采样到 16 千赫后再评估,语义不兼容的非言语标签做映射,分类集按各模型支持的清单适配。指标方向是分类准确率、相似度、情感与说话人相似度越高越好,词错误率越低越好。
下图是 AB 偏好测试,三行分别对照随机类型、随机位置与两者都随机,蓝色为偏好 Affectron,橙色为偏好随机,白色为无差别。读图时比较每行蓝橙长度,再看白色占比。
看图路径: 1. 先确认三行分别对应随机类型、随机位置与两者都随机三种对照;2. 再比较每行中蓝色 Affectron 段与橙色随机段的长度占比;3. 最后看中间白色无差别段的占比是否改变结论方向
论文图 3。原论文 Figure 3:“AB preference test comparing the proposed NV augmentation with rule-guided randomized strate- gies following CapSpeech (Wang et al., 2025a).”。
该图显示三行中蓝色段都长于橙色段,白色段约占 1/4,支持情感驱动选择与位置路由都带来可感知的偏好增益,而非仅由其中一路带来。像素可辨的百分比约为 47.5% 对 23.5%、50.8% 对 24.9%、46.8% 对 25.8%,精确值以原图为准,不硬写超出像素的精度。
下表整理嵌入选择对非言语类型预测的影响,比较问题是情感表示是否比通用语音或跨模态表示更适合匹配,指标方向是准确率越高越好、分布距离越低越好。表后解释主要收益与代价,并指出未胜出项。
| 条件 | 指标 | 通用语音表示 | 情感表示 | 跨模态表示 |
|---|---|---|---|---|
| 类型预测 | 准确率 1 与分布距离 | 75.10 与 0.0071 | 75.77 与 0.0051 | 40.93 与 0.1288 |
| 类型预测 | 准确率 3 与准确率 5 | 85.27 与 87.29 | 85.99 与 91.69 | 58.84 与 73.43 |
| 类型预测 | 距离互补项 | 0.0869 | 0.0723 | 0.3870 |
该表显示情感表示在三档准确率上最高且两项分布距离最低,支持用情感导向嵌入做匹配;通用语音表示也有竞争力,说明韵律与内容特征确有帮助;跨模态模型明显偏低,论文解释为其空间面向跨模态检索而非细粒度情感对齐。代价是该结论依赖伪标签与特定嵌入,换嵌入需重做匹配。
下表比较未见说话人下可运行的非言语 capable 系统,保留必要基线与本方法,指标方向同上。表后说明收益与未胜出项。
| 条件 | 指标 | 预训练基线 | 本方法 | 大规模监督模型 |
|---|---|---|---|---|
| 未见说话人 | 非言语准确率与相似度 | 11.90 与 0.4766 | 36.90 与 0.5427 | 25.00 与 0.4097 |
| 未见说话人 | 非言语情感与说话人相似度 | 0.5479 与 0.8755 | 0.5506 与 0.8686 | 0.4991 与 0.8751 |
| 未见说话人 | 词错误率与言语情感相似度 | 10.5 与 0.5582 | 8.31 与 0.5591 | 1.97 与 0.4876 |
该表显示本方法在非言语准确率与相似度上高于所列基线与大规模监督模型,而言语词错误率低于 VoiceCraft 微调基线但高于大规模模型,言语说话人相似度略低于基线。这意味着增益主要在非言语表达,语言建模与音色保持并非全面最优,不能把自动指标当成人评,也不能把一组最优推广为全程最优。
拿掉哪一块会发生什么变化?
消融要回答各组件是否必要,条件是其余设置相同。论文报告逐步加入数据增广、匹配、路由与结构掩码后,非言语指标总体上升,而言语指标基本保持。主观柱状图显示完整模型在已见与未见说话人上都高于去掉掩码、路由或匹配的变体,增广真值作为上限参考。失败条件也一并报告:K 过小使采样近乎确定,多样性与自然度下降;K 过大则扩大候选集,多样性上升但相似度下降,路由过大则削弱位置的情感连贯性。操作点取匹配 10 与路由 5,是权衡后的实际选择。
下图比较细粒度填充词多样性,横轴是生成填充词类型数,纵轴从基线到完整模型排列。读图时先确认计数含义,再比较条形长度与末端数字。
看图路径: 1. 先确认横轴填充词类型数的计数含义;2. 再从上到下比较完整模型与三个消融变体及基线的条形长度;3. 最后核对条形末端标注的具体数字差异
论文图 5。原论文 Figure 5:“Comparison of the diversity of generated fine- grained filler variations across models.”。
该图显示完整模型条形最长,末端标注为 32,去掉结构掩码后为 28,再去掉路由与匹配后为 25,基线为 20。这支持结构掩码与情感对齐都贡献了多样性,但也表明多样性计数不等于情感正确性,需结合分布距离与主观连贯性一起看。
下表比较同与跨说话人混合,比较问题是放宽同说话人约束是否提升泛化,指标方向同前。表后解释代价与反例。
| 条件 | 指标 | 跨说话人混合 | 同说话人混合 |
|---|---|---|---|
| 未见说话人 | 非言语准确率与相似度 | 14.29 与 0.4939 | 16.67 与 0.4819 |
| 未见说话人 | 非言语情感与说话人相似度 | 0.4731 与 0.8571 | 0.4979 与 0.8675 |
| 未见说话人 | 词错误率与言语情感相似度 | 9.40 与 0.5520 | 8.89 与 0.5518 |
该表显示跨说话人混合仅在相似度一项略高,准确率、情感一致性与说话人相似度都更低,支持同说话人约束主要起声学稳定作用。未评测边界是重叠言语与非言语片段,论文明确列为局限,消融未覆盖该情形。
同说话人混合 × 跨说话人混合: 同说话人混合指增广时只用同一说话人的有词语音和非言语片段拼接,分工是保持音色与通道一致以稳定过渡;跨说话人混合指允许不同说话人的素材拼接,分工是扩大声学多样性。搭配比较的原因是要检验情感泛化是否被说话人身份纠缠,组合意义是论文报告同说话人约束主要起声学稳定作用,而情感对齐仍由共享嵌入空间完成,因此默认采用同说话人混合。
哪些结论还不能下?
论文明确报告三项局限。第一,语料是小规模开放解耦语料,有词与非言语分开录制,难以与大规模或私有野外语料训练的模型直接比较。第二,训练的分离设置限制了对重叠言语与非言语片段的建模,而重叠建模本身仍是开放挑战,人工标注在边界与时间上常不一致。第三,增广依赖情感嵌入与伪标签,附录显示多数类别呈宽情感分布,类别级直觉可能与嵌入级对齐不一致,因此不能把相关性当因果,也不能承诺未测量的误判率、延迟或成本得到改善。
训练资源、推理开销、输出帧率与实际延迟需分别讨论,原文未给出完整硬件预算,总体趋势不等于每组都成立。潜在风险是高度逼真合成可能被用于伪造与冒充,需要检测与水印等配套保障,但这部分在论文中仅为声明,未做实验验证。
要复现先做什么,还需补哪项验证?
何时值得尝试:如果只有小规模开放解耦语料、无对齐标注,但需要让笑声叹息等出现在情感一致的位置,Affectron 的增广加掩码路线值得尝试。如果已有大规模带标注非言语语料,直接监督可能更简单。复现先做什么:准备 EARS 式解耦数据并划分已见与未见说话人;用情感嵌入模型计算整句与候选相似度并做同说话人 Top-K 采样;用强制对齐器切词并预测词级情感属性,转球面坐标算角距离做 Top-K 路由采样。
按位置拼接构造重排文本与词元序列,再做结构掩码与延迟堆叠;微调 VoiceCraft 并在 16 千赫下用说话人相似度、情感相似度、分类准确率、相似度与词错误率评估,同时做 AB 偏好与两项 MOS。关键超参数是匹配 K 为 10、路由 K 为 5、掩蔽长度均匀采样,推理只用带标记文本加情感参考。还需补的验证包括完整训练预算与推理延迟、重叠语音处理、伪标签误差对匹配的影响,以及在野外噪声语料上的分布对齐。代码与演示链接当前可用,但权重下载与系统可运行需以官方页实际状态为准。
一句话收束与下一步怎么看?
综合来看,Affectron 把无监督难题拆成选哪段与放哪里两步,用情感相似度与球面角距离在训练时构造可学习的增广样本,再用结构掩码让主干学会利用上下文过渡。报告的证据支持非言语真实感与多样性提升且口语自然度未明显受损,但证据边界同样清晰:小规模干净语料、同说话人约束、伪标签依赖与未建模重叠语音。下一步应先补齐预算与延迟测量,再检验跨语料与跨说话人泛化,最后才谈部署收益。重提结果时新增的对照是跨模态与通用表示的比较、跨说话人混合的反例以及填充词多样性计数,这些共同说明增益来自显式的情感对齐建模,而非仅仅接触到声学线索。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



