英文题目:Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces

会议身份:conference:interspeech:2026:conference-paper-id:zhou26e_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#偏好优化 #主观评测 #言语感知 #语音 #文本到语音

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Wangzixi Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Bagus Tris Atmaja:机构信息未能从会议 PDF 纯文本可靠映射
  • Sakriani Sakti:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理文本到语音(Text-to-Speech, TTS)中情绪表达与听者感知错位的问题,输入为文本与目标情绪类别,输出为携带个性化情感韵律的语音,难点在于情绪感知具主观性与文化依赖性而平均标注隐含通用映射假设。方法链分两部分推进:先以Grad-TTS为骨干并引入情绪控制器(Emotion Controller)将二维唤醒度-效价(Arousal-Valence, A-V)坐标映射为高维情绪特征再联合音高与能量预测器调节韵律,接着冻结声学模型并以交互式遗传算法(Interactive Genetic Algorithm, IGA)在A-V空间内生成候选语音群体,最后由听者多轮挑选偏好样本并经加权交叉与退火变异迭代重塑个人情绪空间。与依赖大规模偏好数据重训模型的强化学习人类反馈(Reinforcement Learning with Human Feedback, RLHF)范式不同,该设计将适配限制在低维控制空间并免除奖励模型与梯度更新。对照以美国数据平均A-V为基线的盲测显示个性化语音偏好率达到76%,情绪控制器亦将平均意见分(Mean Opinion Score, MOS)从3.37提升至3.75。结论目前仅在美式英语女声与中日印尼共30名听者及7类情绪上验证,跨语言与实时交互外推尚未证明。原文未披露推理延迟与部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么?要解决的错位在哪里?

这篇论文的输入是文本加目标情感,输出是带有该情感的英语语音。目标读者是刚进入语音合成或情感计算的研究生,需要先分清两个事实:合成器能否发出清晰自然的声音,与听者是否觉得情感对味,是两件不同的事。传统做法给合成器一个离散标签,例如高兴、悲伤、愤怒,让模型学一类一种风格。这种做法实现简单,但同一标签内部的强弱、冷热、真假变化表达不出来,听起来容易夸张或僵硬。

于是研究者引入连续维度控制,最常用的是罗素环形模型中的唤醒度和效价。用白话说,唤醒度表示激活程度,是平静还是激动;效价表示好坏方向,是消极还是积极。英文名是 arousal-valence,缩写为 A-V。后文统一用唤醒度-效价指代该 2 维控制空间。

论文要解决的错位是:即使有了唤醒度-效价旋钮,固定的一套坐标对所有人并不通用。因为情感感知受个体和文化影响,用美国人群平均标注训练出的声学线索到情感的映射,拿到日本、中国、印尼听者耳朵里可能就不对。作者因此把问题定义为低维感知优化问题:在不改动声学主干的前提下,为每个听者找到他自己觉得最像目标情感的唤醒度-效价坐标。

演示页当前可用,官方资源状态显示可用,地址已在原文脚注给出,初学者可以先听个性化前后差异,再回来看方法,这样对错位会有直观感受。

已有路线各管什么?为什么还缺个性化?

第一条路线是可控情感合成,从分类标签走向维度表示。分类路线把情感当作几个离散档位,训练时按标签查表取风格向量;维度路线把情感当作连续空间中的点,允许在高兴和悲伤之间平滑过渡,也允许调节强度。两类方法在原文回顾中都依赖群体平均标注,隐含假设声学线索到感知情感的映射是普适的。这正是本文要打破的假设。

第二条路线是个性化语音合成,但过去主要做说话人身份、音色克隆和韵律风格,没有显式处理情感感知差异。也就是说,以往个性化回答的是像谁的声音,本文回答的是在谁听来像哪种情感。第 3 条路线是偏好引导的交互优化。大规模路线如基于人类反馈的强化学习,用大量偏好数据加梯度重训做全局对齐;轻量路线如交互式遗传算法,不需要显式目标函数和奖励模型,靠用户每轮挑选、算法做交叉变异来演化候选解。

本文明确选择后者,理由是交互预算极小且不允许重训主干。理解这 3 条分工,就能明白本文不是再做一个更自然的合成器,而是在已有合成器上加一个只动 2 维坐标的人机适配层。

任务形式化:固定什么?优化什么?

把 1 次个性化任务讲具体:给定目标情感,例如悲伤,给定生成器,给定种群大小,系统先初始化一组候选唤醒度-效价坐标,为每个坐标合成一句相同文本的语音,把这批样本呈现给用户,用户选出最符合他心中悲伤的样本,系统保留被选中的父代集合,再用多父代算术交叉加均匀变异生成其余新候选,进入下一轮,直到用户满意为止。整个过程中,高维声学表示是固定的,语音情感识别模型提供的特征空间在交互开始前已训练好并冻结;唯一被优化的是 2 维坐标。

这是一个关键约束,也是初学者容易误解的地方:个性化不是为每个人重训一个声学模型,而是为每个人重塑罗素环形模型中各情感的位置。优化停止条件是用户主观满意,原文报告通常几轮内收敛。输出是该用户对该情感的个性化坐标,可用于之后直接合成,无需每次都搜索。

方法全景:一个人机循环加一个条件生成器

整体框架分为左右两部分。左侧是情感偏好学习循环,负责找坐标;右侧是情感可控语音生成器,负责把坐标变成声音。工作流程沿一个样本走一遍:用户指定悲伤,系统给出 3 个不同坐标的候选语音,例如唤醒度-效价取不同组合,用户戴耳机试听后选出最像悲伤的一个,系统保留该父代并在其附近变异产生新候选,下一轮再听再选,直到满意。满意后得到的个性化坐标会被保存,后续合成同一情感时直接使用。

右侧生成器以 Grad-TTS 为主干,文本从文本编码器进入,唤醒度-效价从情感控制器进入,二者在情感控制器处汇合,再送入扩散解码器生成梅尔谱,最后经声码器变成波形。评估部分另设两组盲测:第一组是做过个性化的人比较自己的坐标与美国数据集平均坐标;第二组是没做过个性化的新人比较本文化平均坐标与美国基线。下段先看总览图,再拆每个组件的计算细节。

为建立全局对应,先用一段话说明左右两路如何衔接:左路只输出 2 维数值,不输出音频模型参数;右路只接受 2 维数值,不接受用户文字评价。两路的接口就是唤醒度-效价坐标,这使得交互搜索与声学建模解耦。

看图路径: 1. 先看左半人机循环:从 Start 经初始化 A-V 值到生成多个语音样本再到用户试听判断是否满意;2. 再看不满意分支如何经获得偏好样本与 IGA 变异回到生成器形成闭环;3. 再看右半生成器:文本从下方文本编码器进入,唤醒度-效价从上方进入情感控制器再进扩散解码器;4. 最后对照右上小框的两组 A/B 评测分组,区分个性化评测与文化适配评测的人员构成

原论文 Figure 1:Overview of the proposed framework: (a) human-in-the-loop personalization using an Interactive…

论文图 1。原论文 Figure 1:“Overview of the proposed framework: (a) human-in-the-loop personalization using an Interactive Genetic Algorithm (IGA); (b) architecture of the emotional TTS generator with the…”。

上图左侧展示了从开始、初始化、生成、多样本试听、满意判断到交互遗传变异的闭环,右侧展示了情感特征预测器、能量预测器、音高预测器如何与文本编码器、情感控制器、扩散解码器连接。看图时要注意左下角示例 1 次给出 3 个样本及其坐标,说明每轮不是只听一句,而是并行比较;右图中真实情感特征只在训练时用于计算损失,推理时仅用预测的情感特征,这对应了后文训练与推理条件不同的细节。

搜索如何做?交叉变异的具体操作是什么?

交互式遗传算法在这里的角色是无梯度优化器。先解释名词:遗传算法是一类靠选择、交叉、变异演化候选解的搜索方法;交互式遗传算法把适应度函数换成人,每轮由人选出好的父代,算法不再需要可微目标。英文为 Interactive Genetic Algorithm,缩写为 IGA,后文统一用交互式遗传算法。

唤醒度-效价 × 离散情感标签: 离散情感标签负责指明目标是哪一类情感,例如悲伤或高兴,分工是给出优化方向;唤醒度-效价负责把同一类情感内部的强弱和好坏展开成连续 2 维坐标,分工是提供可微调的控制旋钮。二者搭配的原因是只用标签无法表达微妙差异,只用连续坐标又缺少任务锚点,组合后系统可以先固定目标情感,再在该情感附近搜索最对味的坐标,从而实现细粒度且可感知的情感表达。

具体到本文,新子代坐标由所有被选父代的随机加权组合再加均匀扰动得到,权重非负且和为一,扰动在正负变异强度内独立作用于唤醒度和效价两个维度。变异强度随代数乘性衰减,初始为 0.20,衰减率为 0.90,下界为 0.05。这种设计的意图是早期大范围探索,后期小范围收敛。原文没有给出显式奖励模型,也没有梯度回传到声学主干,监督来源完全是用户每轮的选择动作。

需要指出的缺项是:原文未报告种群大小的具体取值、每轮并行样本数是否固定、交叉权重是均匀随机还是按偏好加权,这些都会影响复现时的交互轮数和收敛稳定性,复现时应先固定一个可操作的配置并记录。

交互式遗传算法 × 强化学习人类反馈: 强化学习人类反馈的分工是用大规模偏好数据加梯度重训来做全局对齐,适合数据充足的通用模型;交互式遗传算法的分工是在没有显式目标函数时靠用户每轮挑选保留父代,再经交叉变异产生下一代,适合极少反馈的局部快速适配。本文选择后者的原因是目标是在不改声学主干、不学奖励模型的前提下几轮收敛,二者组合意义在于把偏好学习从重型重训降为轻量后训练个性化层。

与大规模人类反馈方法相比,该方法的代价从算力和数据转向了人的时间:每种情感、每句话都要试听比较。若用户标准漂移或疲劳,搜索可能早停或偏向最近听到的样本,这是主观优化固有的限制。

坐标如何变成声音?情感控制器做了什么?

生成器要解决的是维度失配:输入只有两个数,输出却需要高维韵律和音色条件。情感控制器的作用就是把 2 维坐标映射为高维情感特征,再与文本编码联合控制音高和能量。先解释名词:语音情感识别模型负责从真实语音中抽取高层情感声学特征,英文为 Speech Emotion Recognition,缩写为 SER;情感特征预测器负责学习从坐标到该特征的映射。

训练时,目标特征来自预训练语音情感识别模型对真实语音的编码,输入坐标对应的真实值由同一模型估计得到,预测器先对 2 维坐标做高斯傅里叶特征映射以增强低维输入的表达能力,再经 4 层多层感知机加激活和丢弃,最后线性投影到目标维度,用预测特征与目标特征之间的绝对误差训练。

音高预测器和能量预测器在训练时以真实情感特征为条件,在推理时只用预测的情感特征,这是训练与推理条件不一致但有意为之的地方,目的是让推理时仅靠坐标就能驱动韵律。整个声学特征空间在交互开始前已固定,个性化阶段不再更新,这保证了模型稳定性,也意味着若底层合成器本身对某种情感建模很差,仅调坐标难以完全弥补。

情感控制器 × 语音情感识别特征: 语音情感识别特征的分工是提供已经编码了高层情感声学结构的高维目标向量,避免人工再标注连续情感值;情感控制器的分工是学习从 2 维唤醒度-效价坐标到该高维特征的映射,起到桥梁作用。二者搭配的原因是低维输入表达能力不足,直接条件生成器会丢失情感细节,组合后用户只需动两个数值,生成器仍能得到丰富的韵律和音色条件,实现稳定且可个性化的控制。

沿样本再走一遍推理路径:文本进入文本编码器得到语言表示,个性化坐标进入情感特征预测器得到情感表示,二者经情感控制器融合后同时约束音高、能量和扩散解码器,最终输出梅尔谱并经声码器合成波形。

扩散解码器 × 情感控制器: 情感控制器的分工是把文本编码和情感条件融合成带有韵律线索的中间表示,决定情感听起来像什么;扩散解码器的分工是把该中间表示逐步去噪还原为梅尔谱等声学特征,决定声音是否清晰自然。二者搭配的原因是情感控制只改条件不改声学建模机制,组合后个性化搜索只动 2 维坐标,声学稳定性由冻结的生成通路保持。

初学者常问为什么不用简单的嵌入查表:查表只能给出平均情感,而该控制器允许连续插值和个体偏移,是实现细粒度感知对齐的关键。

训练了什么?冻结了什么?

本节按原文交代区分训练与冻结。需要训练的是情感可控生成器部分,包括情感特征预测器、音高能量预测器和基于 Grad-TTS 的声学建模通路。声码器采用 HiFi-GAN,声学特征为 80 维梅尔谱。训练数据是将 3 个美国英语女性情感语音库合并得到的约 9 小时数据,采样率为 22.05 kHz,原始库不带连续唤醒度-效价标注,标注由预训练语音情感识别模型估计得到。优化器用 Adam,在 1 张显卡上训练 2000 轮,Grad-TTS 超参数沿用默认。

需要冻结的是交互阶段的声学模型和语音情感识别特征空间,个性化只更新 2 维坐标,不做梯度重训。基线是带简单唤醒度-效价情感嵌入层的 Grad-TTS,用于对照说明所提情感控制器的作用。下表把构造与训练条件集中呈现,表中条件、模型、数据时长、特征、优化配置各占一列,便于复现时逐项核对。

下表整理训练与数据构造的关键配置,比较对象是同一声学主干下的不同情感条件方式,公平条件是同一合并数据集与同一声码器,指标方向在结果节再展开。

条件数据与特征模型配置训练预算交互搜索配置
美国英语女性情感语音合并集约 9 小时,22.05 kHz,80 维梅尔谱Grad-TTS 主干加情感控制器,HiFi-GAN 声码器Adam 训练 2000 轮,单卡 RTX A6000初始变异强度 0.20,衰减率 0.90,下界 0.05
预训练语音情感识别估计 A-V无人工连续标注基线为简单 A-V 嵌入层默认 Grad-TTS 超参数冻结声学模型只优化 2 维坐标

上表说明训练成本主要在 1 次性声学建模,交互成本主要在人的试听轮数。代价是连续标注依赖预训练识别模型估计,若该估计有系统偏差,基线坐标和控制器目标都会继承该偏差;反例是若直接用人工标注重训,可能改变基线位置,但原文未做该对照,因此不能断言当前提升中有多少来自控制器结构、有多少来自估计标注的分布特性。

实验如何组织?谁来听?听什么?

个性化实验招募 30 人,来自中国、印尼、日本 3 个文化组,每组 10 人且性别平衡。情感覆盖 7 类:愤怒、困惑、悲伤、高兴、厌恶、困倦和中性。每人对每种情感用 3 个句子做交互个性化,每轮选出最符合目标情感的样本,通常 3 轮内收敛,得到每人每情感的个性化坐标,再按文化组计算文化平均坐标。客观评测在交互前先验证生成器本身:用一百句合成语音测可懂度和情感相似度,用二十句做自然度平均意见分。

主观评测分两组盲测:第一组 15 名做过个性化的人比较个性化坐标与美国数据集平均坐标;第二组 15 名新人比较本文化平均坐标与同一美国基线。所有比较均不告知样本来源。客观指标方向是:词错误率越低越好,自然度平均意见分越高越好,一致性相关系数越高表示合成与参考在唤醒度、效价上越一致。

需要提醒的是,一致性相关系数比较的是识别模型预测值之间的相似,不是人直接打的情感分,因此它只能作为声学层面接近参考的证据,不能替代人评。下表把人员、材料与指标的对应关系集中呈现,复现时应先按此表搭好分组再跑合成。

生成器本身变好了吗?自然度与相似度证据

在进入个性化之前,论文先报告生成器加情感控制器是否比简单嵌入基线更好。这一步很重要,因为若基线本身不可懂或不自然,后续偏好差异可能只是清晰度差异,而非情感对齐。下表比较基线与所提方法,公平条件是同一数据、同一主干与同一声码器,指标方向为自然度越高越好、词错误率越低越好、一致性相关系数越高越好。

条件指标真值参考简单嵌入基线所提情感控制器
自然度平均意见分MOS 越高越好4.04 ± 0.093.37 ± 0.103.75 ± 0.09
可懂度WER 越低越好未报告2117
唤醒度相似度CCC 越高越好未报告0.600.84
效价相似度CCC 越高越好未报告0.640.77

上表显示所提方法把自然度从 3.37 提高到 3.75,词错误率从二十一降到十七,相对下降约 23.5%;唤醒度一致性从 0.60 升到 0.84,效价从 0.64 升到 0.77。支持的判断是情感控制器在可懂度和情感相似度上同时优于简单嵌入。但限制也要讲清:真值自然度为 4.04,仍高于合成,说明仍有差距;未胜出项是该表没有报告个性化后的客观指标变化,因此不能把该表的提升直接说成个性化的功劳,它只是证明用于搜索的生成器底座是合格的。

为观察个性化是否改变了坐标分布,下段结合散点图看 3 个文化组的偏移模式。

本段导读图二的目的是确认个性化坐标是否系统性偏离美国平均,以及不同文化是否有不同偏移方向。图中每个面板对应一个文化组,横轴为效价,纵轴为唤醒度,阅读时先分清圆点与叉号再看颜色对应的情感。

看图路径: 1. 先按图例确认圆点是个人选择值、叉号是参考数据集平均值,再确认横轴为效价纵轴为唤醒度;2. 对比左中右三个面板中同色点团相对叉号的偏移方向和分散程度;3. 重点观察负效价区低唤醒点团与正效价区高唤醒点团的分离是否保持;4. 再比较中国组效价方向拉长、印尼组聚拢、日本组负情感偏低唤醒的文字描述是否在点分布中可见

原论文 Figure 2:A–V distributions from the personalization process for (a) Chinese, (b) Indonesian, and (c)…

论文图 2。原论文 Figure 2:“A–V distributions from the personalization process for (a) Chinese, (b) Indonesian, and (c) Japanese participants.”。

从像素可见,多数圆点偏离叉号,说明平均坐标与个人感知确有差距。中国组在唤醒度方向较窄而效价方向拉得较开;印尼组围绕情感中心更聚拢,组内一致性看起来更高;日本组负情感偏向更低唤醒,正情感则需要更强表达,这与原文描述的克制表达倾向一致。需要注意像素不能精确读出每个点的数值,不应硬报坐标;该图支持的是分布层面的定性判断,而非某个人某情感的具体偏移量。

个性化与文化适配各带来多少偏好收益?

主观偏好是本文最强的证据,也是最需要讲清条件的部分。第一组盲测中,做过交互的人在不知道来源时仍以 76% 选择自己的个性化语音,说明搜索找到的坐标确与其内部标准对齐,而非随机偏好。第二组中,没做过交互的新人听本文化平均语音对比美国基线,中国、印尼、日本方向的偏好率分别为 64.8%、69.8% 和 65.6%,均高于 50%,说明即使不做个人搜索,仅换文化平均也有收益。

此外,跨文化排序中,中国人选中国样本占 65%,日本人选日本样本占 67%,印尼人选印尼样本占 70%,显示群体层面存在可区分的偏好。

个性化唤醒度-效价 × 文化平均唤醒度-效价: 个性化唤醒度-效价的分工是记录每个人经交互搜索后最满意的坐标,反映个体内部标准;文化平均唤醒度-效价的分工是把同一文化组内多个人的个性化坐标取平均,反映群体层面的感知偏移。二者搭配的原因是前者验证个体适配是否有效,后者验证不做个人交互时仅换文化平均是否仍优于美国数据集基线,组合后可以区分个体收益和群体可迁移收益。

下表把可部署策略与基线的盲测条件集中对比,表中策略、听者、对照、偏好率各占一列,便于区分个体收益与群体收益。

评测问题听者条件对照基线可部署策略偏好率
个性化是否有效15 名做过交互者盲测美国平均 A-V个人交互后 A-V76%
文化平均是否有效15 名新人盲测中国方向美国平均 A-V中国平均 A-V64.8%
文化平均是否有效15 名新人盲测印尼方向美国平均 A-V印尼平均 A-V69.8%
文化平均是否有效15 名新人盲测日本方向美国平均 A-V日本平均 A-V65.6%
跨文化是否可区分3 组各自排序他文化平均 A-V本文化平均 A-V65%,67%,70%

上表的主要收益是个性化偏好率高于文化平均,代价是需要每人每情感多轮试听;文化平均虽收益较小但可直接复用,无需新用户交互。未胜出项与边界是:原文未报告统计显著性方法和置信区间,也未报告中性等个别情感是否同样获益,因此总体趋势不等于每种情感都成立;跨文化排序样本量小,原文 selbst 表述为初步结果,应视为待验证而非定论。

哪些结论还站不稳?缺了什么验证?

首先是样本与语言边界。个性化仅覆盖 30 名亚洲参与者,合成语音为美国英语女性音,文本也是固定句子,因此结论不能推广到其他语言、男声或自发对话场景。文化差异的解释目前停留在分布描述层面,没有控制年龄、语言水平、音乐训练等混杂因素,相关性不等于因果。其次是指标边界。一致性相关系数依赖同一识别模型,既做标注又做评价,存在循环评价风险。

主观偏好只报告比例,未报告误判率、重测一致性、每轮耗时和疲劳效应,也未测量延迟与实时交互成本,因此不能承诺该方法改善了效率或降低了成本。再次是方法边界。声学模型冻结意味着底座缺陷无法通过调坐标修复;变异初值、种群大小、停止标准等超参数只报告部分,未做消融说明拿掉某项会怎样,复现时需补做敏感性测试。最后是可运行性边界。

论文给出演示页且当前可用,但正文未说明代码与权重是否公开,复现者应把演示可听、代码可跑、权重可下载区分开,不因能听演示就认为能一键复现。

要复现,先固定哪些步骤与参数?

第一步复现底座:按合并数据集思路准备情感语音,若无连续标注则用同一预训练语音情感识别模型统一估计,避免混用不同标注源;声学特征固定为 80 维梅尔谱,声码器固定为 HiFi-GAN,主干用 Grad-TTS 默认超参数训练到原文量级轮数,并先用自然度、可懂度和一致性相关系数确认底座达到可用水平。第二步实现情感控制器:2 维坐标先做高斯傅里叶映射再进 4 层多层感知机,用绝对误差拟合识别特征。

训练时音高能量以真实特征为条件,推理时只用预测特征,这一点必须严格复现,否则推理条件会错。第三步实现交互循环:固定种群大小和每轮并行样本数,固定初始变异强度 0.20、衰减率 0.90、下界 0.05,按选择保留父代、加权组合加均匀扰动生成新候选,直到用户满意;记录每种情感、每个句子的轮数、候选坐标和选择轨迹,以便计算文化平均。

第四步组织盲测:个性化组与文化组分开招募,随机化播放顺序并隐藏来源,分别统计个人对美国基线、文化平均对美国基线、本文化对他文化的偏好率。缺项补验证建议:补报置信区间与显著性,补测不同情感的分项偏好,补记交互耗时与重测稳定性,补做跨性别和跨语言的泛化测试。

何时值得尝试这种个性化?一句话收束

当你的应用已经有可懂自然的情感合成器,但用户总觉得情感差一点、对不同地区用户众口难调时,值得尝试这种只动 2 维坐标的轻量个性化:它不需要重训声学模型,几轮试听就能得到个人或文化平均坐标,且本文在 30 人七情感上的盲测显示个人偏好率达 76%,文化平均也有约六成半的偏好优势。但要清醒:该收益来自小样本主观评测,依赖预训练识别模型的估计标注,且每种情感都要交互。

若底座本身不可懂,或需要实时零交互部署,就应先补底座质量和效率验证,再谈个性化。本文的价值在于把情感合成从一套平均坐标转向每人可调的感知空间,为后续跨语言、实时个性化留出了明确接口。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总