英文题目:Emo-BPO: Emotion Bidirectional Preference Optimization for Diffusion-based Emotional TTS
会议身份:
conference:interspeech:2026:conference-paper-id:shi26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#扩散模型 #偏好优化 #语音 #文本到语音
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jiacheng Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Hongfei Du:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyuan Song:机构信息未能从会议 PDF 纯文本可靠映射
- Y. Alicia Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Yanfu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Ye Gao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
情感文本到语音需由文本生成可懂且情绪可控的语音,难点在于重音、语调与节奏在连续情绪空间中交织且多情绪轨迹易混淆。情感双向偏好优化先对同文本不同情绪语音构造顺序相反的偏好对子,分别监督目标情绪与竞争情绪。接着以两个独立扩散去噪分支分别学习情绪对齐与情绪对比得分场,前者拉向目标情绪,后者建模远离方向。推理时两分支按对比引导公式融合,并随去噪进程由弱到强施加晚期调度以保护早期声学结构。与仅增强目标条件的Emo-DPO等方法不同,该方法把参考条件由无条件替换为竞争情绪,显式放大情绪间间隔。在ESD英语子集与EmoVoiceDB混合评测下,Emo-BPO的指标Emo SIM为99.23,高于EmoVoice的指标Emo SIM 98.59。该结论限于英语5类离散情绪与Grad-TTS加HiFi-GAN链路,未验证零样本说话人、开放情绪描述与真实对话场景。原文未披露训练、推理或部署成本,仅提供在线试听页面。
🔗 开源与复现资源
- 演示资源:https://jiachengqaq.github.io/emo-bpo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文输入是论文原文提供的文字证据与 3 张官方原图像素,目标是让刚进入语音合成领域的读者能复述 Emo-BPO 的做法与实验条件。解读必须保留的关键信息包括任务定义、双分支构造、训练冻结范围、推理组合方式、数据集划分、基线名单、指标方向与主要数字,输出是 1 篇按学习依赖展开的中文技术讲解。
情感文本转语音要生成的不是可懂就行的一句话,而是带着目标情感说出的同一句话。白话说,同样写着明天见,高兴与难过在基频起伏、能量、语速与停顿上完全不同。研究把文本、说话人与情感统称为条件,把声学梅尔谱的加噪版本记为带时间步的噪声表示,模型要学会在去噪过程中沿着条件分数场把噪声搬回高概率的语音区。
初学者容易把情感控制理解为加一个情感标签嵌入。早期做法确实如此,给 FastSpeech2 加情感嵌入或给扩散模型加条件即可发声,但这类做法不直接优化人听到的偏好,也不处理多个情感轨迹同时存在时的混淆。当高兴与惊讶在韵律上接近时,只增强高兴而不抑制惊讶,合成结果仍可能被听成另一种情感。这正是后文要解决的结构问题。
已有路线各解决了什么,还缺哪一块?
按同输入同目标来对照,情感可控合成路线先解决有声与可控。举例说,EmoSpeech 在 FastSpeech2 上加情感嵌入与条件注意力做词级强度,EmoSphere++ 用效价唤醒支配度的球面情感向量做零样本风格调节,EmoVoice 用大语言模型框架做自然语言情感提示。它们输入都是文本加情感描述,目标都是可懂且带情感的语音,但在偏好对齐层面没有用人判来优化。
偏好路线把对齐写成由人类判断定义的学习问题。Emo-DPO 在成对样本上做直接偏好优化而不用奖励模型,EMORL-TTS 写成带复合奖励的强化学习,EASPO 引入逐步偏好信号引导扩散去噪。原文指出这些方法只优化情感对齐方向,即提高目标情感下的似然,而没有显式建模与竞争情感的分离。在扩散模型常用的分类器无关引导中,生成本来就靠条件与参考的对比来塑形,只优化一侧等于浪费了对比机制,这是本文要补的缺块。
另一条背景是大模型语音路线。CosyVoice 与 CosyVoice2 用指令条件与大规模指令微调统一可控与泛化,自回归结构天然重视语言保真度。后文实验显示这类系统在词错误率上占优,但情感区分仍有提升空间。理解这一点有助于正确看待可懂度与表现力的权衡,而不是把所有指标都当成同一个能力。
为什么只推目标情感会在引导中吃亏?
问题可以沿着一个样本走一遍。假设文本是同一句问候,音频 1 是生气朗读,音频 2 是难过朗读。理想系统在给定生气条件时,既要靠近生气的韵律分布,又要远离难过的韵律分布。如果训练只告诉模型生气样本更好,模型学会了往生气方向走,但没有被告知难过方向需要压制,两个情感在声学空间仍可能靠得很近。
分类器无关引导的对数比视角把这个问题放大。白话说,引导不是只看条件预测,而是看条件预测减去参考预测,英文名叫 classifier-free guidance,缩写 CFG。常规做法的参考是无条件,相当于拿目标情感与平均语音比。本文认为情感合成需要更强的类间分离,应该拿目标情感与竞争情感比。若训练阶段从未学习竞争情感的分数场,推理阶段就没有可用的排斥项,只能用无条件代替,情感边界自然变弱。
于是中心问题是扩散情感语音能否从显式建模偏好对齐与偏好对比两条轨迹中受益。约束是不能依赖辅助奖励模型或额外标注,只能用已有情感标注语料重排得到监督,并且要能无缝接入现有扩散语音系统。
Emo-BPO 的全景:训练学两条路,推理做一次加减
Emo-BPO 的全称是情感双向偏好优化,英文名 Emotion Bidirectional Preference Optimization,缩写 Emo-BPO。做法全景分两段。训练段用倒序的同文本情感对同时学习情感对齐分支与情感对比分支,英文分别叫 emotion-aligned branch 与 emotion-contrastive branch,缩写 EA 与 EC。推理段把两个分支的噪声预测按对比引导公式组合,既放大目标情感又减去竞争情感。
分类器无关引导 × 对数似然比: 分类器无关引导负责在每一步把条件预测和参考预测加权相减以搬移去噪轨迹,对数似然比负责给出这种相减的概率含义,即同时抬高目标条件概率并压低参考条件概率,二者搭配让本文可以把无条件参考替换为竞争情感条件,从而把通用引导变成情感间的定向推拉。
下图是全文总览,上半是训练如何从预训练骨干分出两条微调路径,下半是推理如何把两路预测合并为最终噪声估计,底部标出输入为噪声声学隐变量与文本提示,输出为情感对齐语音。读图时注意火焰与雪花图标分别表示可调与冻结参数,以及中间倒序音频对的箭头含义。
看图路径: 1. 先沿顶部预训练扩散模型向下分叉的两条训练路径,确认左右分支分别接收哪一组倒序对;2. 再看虚线下方推理部分两个分支如何汇入同一个加权相减公式;3. 最后确认底部输入是噪声声学隐变量加文本提示,输出是情感对齐语音
论文图 1。原论文 Figure 1:“Overview of Emo-BPO. Training constructs inverted same-text emotional pairs to jointly learn emotion-aligned (EA) and emotion-contrastive (EC) diffusion branches while par-…”。
从像素看,顶部是预训练扩散模型框,向下分叉到左右两个扩散模型框,中间夹着两组括号标注的提示加音频 1 加音频 2 及其倒序,箭头表明同一对样本以相反顺序送入不同分支。虚线以下是推理,左右分支分别标注为情感对齐与情感对比扩散模型,再汇入底部的大公式框,公式为加权对齐项减去加权对比项。左侧下方接入噪声声学隐变量与提示,右侧下方引出情感对齐语音与波形示意。该图把部分微调与双向组合的结构 1 次讲清,后文逐段展开其计算细节。
两个分支各自算什么,为什么要分开参数?
先讲清术语。情感对齐分支指在目标情感条件下预测噪声的分数网络,情感对比分支指在竞争情感条件下预测噪声的分数网络。白话说,前者回答给定生气时噪声该往哪走,后者回答给定难过时噪声会往哪走。两者共享扩散网络结构,但对应不同的优化目标,前者提高目标情感似然,后者刻画需要分离的情感模式。
情感对齐分支 × 情感对比分支: 情感对齐分支分工是建模目标情感下的条件分数场,把噪声样本拉向目标情感的高概率区,情感对比分支分工是建模竞争情感的分数方向,提供需要避开的排斥梯度,搭配理由是单套参数难以同时满足吸引与排斥,组合意义是在推理相减时形成吸引盆地加排斥梯度的双向间隔。
原文明确指出,用同一套参数同时满足两个相反方向可能得到折中更新,削弱情感可控性,因此维持两套独立参数化,以便在推理时得到更清晰的情感间梯度。打比方就像同时学往东走与识别往西走的路标,若只用一张地图硬记 2 个方向,路口容易混淆,分开两张图再按减法叠加,反而能得到明确的向东推力。比喻之后回到真实组件,所谓推力就是噪声预测的加权差,所谓路标就是不同情感条件下的分数场。
推理组合的具体形式是最终噪声估计等于一加引导系数乘以对齐分支预测,再减去引导系数乘以对比分支预测。减法项压制竞争情感特征,放大项增强目标情感,形成双向情感转向。引导系数不是常量,而是随去噪进程变化的调度函数,后文消融专门比较不同调度的影响。
不加标注如何得到双向监督?冻结了什么,更新了什么?
训练的关键动作是构造倒序同文本情感对。操作是对于同一文本条件,取两段文本相同但情感标签不同的语音,不失一般性记音频 1 为目标情感,音频 2 为另一情感。有序三元组记为文本加音频 1 加音频 2,定义情感对齐方向,把顺序倒为文本加音频 2 加音频 1,就得到互补的对比方向。这种重排在语言内容匹配的条件下同时提供情感吸引与情感分离的监督。
同文本情感对 × 顺序调换: 同文本情感对负责固定语言内容只让情感标签不同,从而隔离出纯粹的情感差异信号,顺序调换负责把同一对音频的先后顺序倒置,1 次得到对齐方向监督 1 次得到对比方向监督,组合意义是不引入额外标注或奖励模型就同时获得吸引与分离两类训练目标。
两个分支都用标准去噪目标训练。对齐分支对目标情感的干净音频做前向加噪得到带噪版本,最小化真实高斯噪声与对齐分支预测之间的平方误差,对比分支对另一情感样本做同样操作,最小化真实噪声与对比分支预测之间的平方误差。符号上,时间步、噪声、目标情感条件与对比情感条件分别参与各自损失,预测器分别记为对齐与对比分支。原文未给出超出该平方误差的额外奖励或偏好损失形式,监督来源就是重排后的情感标签,不引入辅助奖励模型。
参数层面,骨干是 Grad-TTS,工作在 80 维梅尔谱上。原文报告冻结文本编码器与时长预测器,只更新扩散解码器即分数网络,模型从 Grad-TTS 预训练配置初始化,用 Adam 优化,学习率为 1 乘 10 的负 4 次方,批量为 16,在随机裁剪的 2 秒梅尔片段上训练,波形由预训练 HiFi-GAN 声码器合成。推理采用后段增强调度,引导系数定义为 1 减去当前步除以总步数,早期弱后期强。未报告的内容是两个分支是完全独立网络还是共享底层加情感条件区分,解读时不从名称推定实现,只按已报告的独立参数化与冻结范围复述。
在什么数据与流程上测,与谁比,怎么算分?
训练与评测用两个英语情感语料。一是 EmoVoiceDB,约 22100 条情感标注,约 40 小时多人语音,覆盖多样表现模式,采用数据集官方训练测试划分。二是 ESD 英语子集,10 个说话人表达生气、高兴、难过、惊讶与中性 5 种情感,每说话人每情感 350 条,共 17500 条约 12 小时,按每说话人情感 8 比 1 比 1 做训练验证测试划分。偏好对按 Emo-DPO 的文本匹配策略构造,同文本下目标情感为偏好,其他情感为非偏好。
基线覆盖代表性情感系统,包括 emospeech、cosyvoice 即 CosyVoice、cosyvoice2 即 CosyVoice2、Emosphere++ 与 EmoVoice。主干对比保持同一评测集,客观与主观并行。客观方面,可懂度用 Whisper-Large-v3 转写生成音频再算词错误率,英文缩写 WER,越低越好。韵律相似度用 AutoPCP 估计生成与真值的整句相似度并在测试集平均,越高越好。情感相似度用 emotion2vec-base 提嵌入算余弦并报告均值,越高越好。自动情感识别用预训练语音情感分类器预测标签再算准确率,自然度用 UTMOS 自动平均意见分估计器,越高越好。
主观方面,30 名参与者完成平均意见分、情感平均意见分、情感文本一致性、AB 偏好与情感准确率测试。平均意见分评整体自然度,情感平均意见分评生成与目标情感的感知相似度,一致性评生成音频与指令的符合度,均为 5 分制。AB 测试在质量与情感表现力上二选一,情感准确率测试要求听出每条样本的感知情感再与目标标签比对。所有主观评测使用情感均衡样本,结果在 3 次独立运行上平均。演示页当前可用,地址为官方页面,音频样例可在线收听。
客观指标测了什么,谁在情感上更准,代价在哪?
客观比较要回答 3 个问题。测什么,情感相似度、韵律相似度、可懂度、自然度与分情感自动识别准确率。与谁比,5 个可运行基线加本方法,条件是同一测试集与同一指标流程。方向是除词错误率越低越好,其余越高越好。关键数字见下表,表头保留原文指标名,数值为原文裸值,不擅自追加百分号。
比较的问题是双向建模是否在保持可懂的同时提高情感命中与韵律一致性,公平条件是同文本偏好对训练与相同客观流程,指标方向如上所述,Emo-BPO 在情感与韵律及自然度上占优但可懂度并非最低。
| 系统 | 情感相似度 | 韵律相似度 | 可懂度词错误率 | 自然度 UTMOS | 平均情感识别准确率 |
|---|---|---|---|---|---|
| emospeech | 96.35 | 3.39 | 7.13 | 4.24 | 0.61 |
| cosyvoice2 | 98.47 | 3.78 | 3.77 | 4.43 | 0.82 |
| Emo-BPO | 99.23 | 3.85 | 3.84 | 4.52 | 0.87 |
上表显示 Emo-BPO 在情感相似度 99.23、韵律相似度 3.85、自然度 4.52 与平均识别准确率(%)0.87 上为最好,同时可懂度 3.84 略高于 CosyVoice2 的 3.77。分情感看,原文报告本方法在中性 0.91、生气 0.89、高兴 0.82、难过 0.87、惊讶 0.84 上均领先,但高兴相对仍是各系统共同偏低的类别。判断是双向分数塑形通过互补的吸引与排斥梯度拉大了情感间隔且保留了自然度,限制是自回归大模型在语言保真上仍有优势,总体趋势不等于每句都成立。
情感相似度 × 韵律相似度: 情感相似度分工是用 emotion2vec-base 嵌入余弦衡量生成语音与参考在情感空间的接近程度,韵律相似度分工是用 AutoPCP 衡量整句韵律包络的一致性,搭配理由是情感正确不等于节奏语调自然,组合意义是同时检查情感命中与表达方式是否保持连贯。
人听起来如何:自然度、情感像不像、偏好选谁?
主观比较的问题是人耳感知的自然度与情感相似度是否与客观一致,公平条件是 30 人、5 分制与情感均衡样本,方向是分数越高越好,准确率越高越好。下表整理主观平均意见分与人听情感准确率,数值保留原文精度。
本表要检验的未胜出风险是客观好的系统是否只是指标拟合,条件是相同主观流程与均衡情感类别,方向是主观分与人听准确率越高越好,Emo-BPO 若同时领先则支持感知层面的增益。
| 系统 | 平均意见分 | 情感平均意见分 | 情感一致性 | 平均人听情感准确率 |
|---|---|---|---|---|
| emospeech | 2.55 | 2.79 | 2.83 | 0.47 |
| cosyvoice2 | 3.61 | 3.93 | 3.75 | 0.68 |
| Emosphere++ | 3.46 | 3.47 | 3.28 | 0.66 |
| EmoVoice | 3.39 | 3.64 | 3.42 | 0.61 |
| Emo-BPO | 3.93 | 4.25 | 3.92 | 0.79 |
表后解释需要同时讲收益与代价。收益是 Emo-BPO 在平均意见分 3.93、情感平均意见分 4.25、一致性 3.92 与平均人听准确率(%)0.79 上领先,支持情感对齐与感知质量的联合提升。代价与反例是分情感人听准确率并非全线碾压,原文显示惊讶 0.85 领先明显,但生气 0.78 与难过 0.78 与基线差距收窄,且 EmoSpeech 在个别情感上仍有 0.66 与 0.57 的可辨性,说明难区分情感对仍是边界。未评测边界是长文本与强口音下的稳定性,原文未报告。
AB 偏好进一步验证感知选择。导读如下,两张饼图分别对应与较弱基线和较强基线的成对比较,颜色图例区分本方法、基线与无偏好,阅读时先看图例再比扇区大小,不要把颜色深浅当成好坏。
看图路径: 1. 先确认左右两张饼图分别对应哪一组基线与本方法的对比;2. 再比较每张图中本方法扇区与基线扇区及无偏好扇区的占比大小;3. 最后观察右侧面对更强基线时本方法占比的变化幅度
论文图 2。原论文 Figure 2:“Comparison of subjective evaluation results from AB preference tests: 1) left: Emospeech vs. Emo-BPO and 2) right: CosyVoice2 vs. Emo-BPO”。
从像素看,左侧本方法扇区标注为 84.9%,基线 Emospeech 为 13.5%,无偏好为 1.6%,右侧本方法为 72.3%,基线 CosyVoice2 为 23.8%,无偏好为 3.9%。这表明听者明显偏好本方法,且面对更强的 CosyVoice2 时领先幅度收窄但仍占约四分之三。结合主观表,可以说增益来自双向引导放大的情感轨迹与压制的竞争模式,而非单纯响度或清晰度变化,但具体数值只在本次主观样本范围内成立。
拿掉对比分支或调度会发生什么?引导时机怎么选?
消融要回答两个机制问题。拿掉对比分支是否削弱情感区分,拿掉后段调度是否破坏韵律与可懂。原文报告,移除对比分支后情感相似度从 99.23 降至 97.41,韵律相似度从 3.85 降至 3.67,词错误率(%)从 3.84 升至 4.48,自然度从 4.52 降至 4.32。移除后段调度后情感相似度为 98.76,韵律 3.82,词错误率 4.29,自然度 4.45。完整版在四项上均为最好,支持 2 个组件都是必要的,但这只是单次消融的报告值,不做因果外推。
后段增强调度 × 早期强引导: 后段增强调度分工是在去噪后期逐步增大对比引导系数以精修基频与韵律细节,早期强引导分工是在高噪声阶段就施加强推力以快速拉高情感强度,搭配比较说明为何前者更稳,组合意义是揭示引导时机决定了情感表达力与声学结构稳定性的折中。
调度对比的导读如下,图中有 3 条曲线,图例分别为常数、早期调度与后段调度,纵轴自上而下为基频方差、韵律相似度与词错误率,横轴为训练步数。读图先确认图例与纵轴含义,再看收敛端高低,最后看早期调度在中段是否有异常尖峰,不要把某一步的高低推广为全程。
看图路径: 1. 先看顶部 F0V 子图三条调度曲线随训练步数的收敛高低;2. 再看中部韵律相似度子图后期哪条曲线保持得更高;3. 最后看底部 WER 子图早期调度曲线在中间段是否出现尖峰
论文图 3。原论文 Figure 3:“Ablation on guidance scheduling. Late scheduling yields higher F0V, better prosody similarity, and lower WER, while early scheduling causes prosody degradation and tran- sient…”。
从像素看,顶部 F0V 在 1000 步附近后段调度最高,早期调度次之,常数最低,说明后段增强在收敛端情感强度更大。中部韵律相似度随训练缓慢下降,但后段调度始终保持在最上方,早期调度跌至约 3.80 最低,表明早期强引导损伤韵律。底部词错误率中早期调度在 500 步附近出现明显尖峰超过 5.5,而后段调度最终降至约 3.8 最低。原文解释是早期在高噪声阶段施加强引导会破坏粗粒度声学结构,后段增强先保结构再精修细粒度韵律,因而更稳。限制是该结论基于当前步数与指标,未测量延迟与算力,调度最优值可能随总步数变化。
哪些结论有边界,哪些量根本没测?
先划清直接报告与有限解释。直接报告的是在给定数据与流程下,本方法在情感相似度、韵律相似度、自然度与平均识别准确率上领先,且 AB 偏好明显。有限解释是双向梯度拉大情感间隔的机制说明,它与消融方向一致,但不等于证明每一步排斥梯度都有效。未验证推测是把该增益推广到其他语言、零样本说话人与长篇叙述,原文未提供证据,应表述为可能与待验证。
缺失证据不是技术错误,但要明确点名。原文未报告误判率的统计显著性方法,未报告训练总时长与硬件预算,未报告推理开销、输出帧率与实际延迟,也未系统评估噪声提示或错误情感标签下的鲁棒性。因此不能承诺延迟降低或成本下降,训练资源与推理延迟需分别讨论。总体趋势不等于每组每步成立,例如高兴类别的识别率与个别主观分项差距较小,早期调度在个别步数也曾短暂占优。
另一个边界是指标冲突。原文表头与正文在可懂度表述上存在词错误率与 Intelligibility 混用,数值越大越差还是越小越好需按词错误率方向理解。不同指标的差值不能混入同一模型列比较,也不能把自动识别准确率当成人听准确率。复述时保留原表裸值与原表头单位说明,不自行换算百分点与相对百分比。
要复现先做什么,需要哪些配置与检查点?
复现的第一步是准备数据与划分。下载 EmoVoiceDB 并采用官方训练测试划分,准备 ESD 英语子集并按每说话人情感 8 比 1 比 1 划分,确认 5 种情感标签一致,再按同文本匹配构造偏好对,目标情感为偏好,其他情感为非偏好。采样检查要听辨同文本不同情感是否确为同一句话,避免文本不匹配引入语言泄漏。
第二步是搭建骨干与冻结范围。用 Grad-TTS 处理 80 维梅尔谱,冻结文本编码器与时长预测器,只训练扩散解码器,从预训练配置初始化,优化器用 Adam,学习率 1 乘 10 的负 4 次方,批量 16,在随机裁剪的 2 秒梅尔片段上训练,声码器用预训练 HiFi-GAN。训练时同时维护对齐与对比两个预测器,分别用各自情感样本的去噪平方误差优化,倒序对要成对出现以保证双向监督。
第三步是推理与评测。推理用引导系数为 1 减当前步除以总步数的后段调度,早期弱后期强,输出梅尔谱后经声码器成波。评测按原文流程跑 Whisper-Large-v3 词错误率、AutoPCP 韵律相似度、emotion2vec-base 情感相似度、预训练情感分类器准确率与 UTMOS,再组织情感均衡的主观听测。代码与权重方面,原文只给出演示页当前可用,未在证据中给出训练代码库状态,复现时应区分演示可听、代码开源与权重可下载三件事,不把页面可用当成系统可一键运行。
何时值得尝试,还需补哪项验证?
当任务是扩散语音的细粒度情感可控,且已有同文本多情感语料时,值得尝试本文的倒序对加双分支减法。它的吸引在于不需奖励模型与额外标注即可接入现有扩散系统,通过把无条件参考换成竞争情感参考,直接利用分类器无关引导的对比本性。若只有单情感语料或文本完全不重叠,则无法构造匹配的倒序对,此时应先补数据或改用其他偏好构造。
实践中先做小规模复现,验证拿掉对比分支后情感相似度是否下降,再比较后段、常数与早期 3 种调度在基频方差、韵律相似度与词错误率上的曲线形态。若后段调度在你的总步数下依然保持韵律最高且词错误率最低,再扩大到全量训练。注意保留关键超参数与信息条件,包括冻结范围、学习率、批量、2 秒裁剪与调度公式,以便他人对齐。
还需补的验证包括显著性检验、推理延迟与显存开销、分说话人与分情感的细化报表,以及长文本与跨域情感的泛化测试。常见误解是把情感相似度高当成自然度必然高,或把词错误率最低当成情感最好,本文恰好显示两者可以分离。正确读法是情感、韵律、可懂与自然度四者分别看,增益只在已测条件下成立,未测的成本与鲁棒性仍待补充。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


