英文题目:Enriching Speech Emotion Representations with Conversational Context

标签:#语音情感识别 | #SFT | #语音 | #自监督学习 | #基准测试

评分:7.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

👥 作者与机构

  • Arthur Peuvot:机构信息未在 arXiv HTML 中可靠披露
  • Romaric Besançon:机构信息未在 arXiv HTML 中可靠披露
  • Gaël de Chalendar:机构信息未在 arXiv HTML 中可靠披露
  • Bianca Vieru:机构信息未在 arXiv HTML 中可靠披露
  • Ioana Vasilescu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音情感识别需从语音声学信号预测离散情绪类别,难点在于孤立语句丢失对话中情绪演化与说话人间相互影响,制约实时单音频判断。ACERT先将目标语句与固定时长前文拼接送入HuBERT-large编码器与线性映射得到帧级特征,并切分为目标帧与上下文帧。接着对上下文帧做时域均值池化得到单一向量,将其加到每个目标帧并经残差前馈网络与层归一化融合,输出进入下一步。最后对增强后目标帧再池化并经分类头输出情绪类别,完成从上下文增强到判决的链路。与仅用相邻单句或在预测序列上建模转移的方法不同,ACERT直接在音频表征层融合任意时长前文且不依赖说话人标签与未来信息,更适配实时单音频场景。在IEMOCAP五折说话人无关评测下,25 s上下文的非加权准确率(Unweighted Accuracy, UA)达到79.08%,相对同骨干无上下文基线68.38%提升10.70个百分点并超越最强上下文基线CHAN的75.90%。在IEMOCAP五折说话人无关评测下,ACERT的非加权准确率为79.08%,高于CHAN的非加权准确率75.9%。其结论适用边界受限于情绪平稳的双人对话,失败条件是情绪快速切换的多人对话中上下文增益消失,且跨语料泛化能力尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这篇解读要保留什么?

这篇解读的输入是论文原文证据给出的 ACERT 方法、3 个数据集上的实验和消融结论,目标是让刚进入语音或音乐音频方向的研究生能复述做法并核对条件。必须保留的信息包括上下文窗口的定义与取值、特征提取器型号与训练超参数、数据集划分与指标口径、主结果的具体数值与基线、以及证明增益来自情绪连续性而非说话人身份的 3 组消融。输出不做引申评价,只讲论文实际做了什么、在什么条件下成立。

全文按学习依赖展开,先讲任务与相关路线,再讲方法全景与计算细节,然后讲训练与实验条件,最后讲结果、反证与复现要点。论文研究的是纯音频的会话语音情绪识别,输入是按时间排序的对话音频序列,输出是每句语音的情绪类别。教学例子在下文会明确标为例子,例如把连续剧中的争吵片段类比为情绪稳定的长对话,仅用于帮助理解连续性概念,不代表论文的数值结论。

论文要解决的矛盾是常用做法把每一句单独切出来分类,而真实对话中情绪是连续演变的,前一句的愤怒或悲伤会影响下一句的判断。作者因此提出在分类前把固定时长的历史语音信息折叠进当前句的表示。白话说,会话情绪识别就是看连续剧猜人物此刻心情,单句语音情绪识别就是只看一张截图猜心情。前者多用了上下文,后者只用本句。

会话情绪识别 × 单句语音情绪识别: 单句语音情绪识别只看目标语句自身的声学特征做分类,会话情绪识别则把目标语句放在前后对话流中判断。ACERT 属于后者,它的分工是保留单句分类头不变,新增一个前文汇总分支提供情绪走向;搭配理由是人类会结合前文语气和话题判断当前情绪,组合意义是让表示同时携带本句特征和对话历史的平均情绪背景。

本节的教学任务是建立问题意识:为什么加上下文可能有用,以及为什么不能无条件相信加上下文一定有用。后文会看到,在情绪稳定、说话人少的双人对话上加上下文增益很大,在情绪每几秒就翻转的多人情景喜剧上增益消失,这说明上下文的价值依赖情绪稳定性和对话结构,而不是单纯的数据量增加。

已有路线在用什么输入、什么监督、什么运行阶段?

按同输入、同目标、同监督和同运行阶段对照,相关工作可分为 3 条线。第一条是无上下文的单句路线,输入是孤立语句波形,目标是本句情绪标签,监督是交叉熵,运行阶段只需本句。代表做法包括基于自监督表示微调,以及在帧、音素、词层次上建模的 SpeechFormer++ 和 MSTR,还有用动态窗口或微分方程建模句内时序的 DWFormer 等。这类方法在 IEMOCAP 上已做到 74% 左右的未加权准确率,但结构上看不到历史。第二条是音频上下文路线,与 ACERT 输入和目标最接近。

CHAN 只用紧邻的前一句以及对话对方的前一句,在双人场景下有效但窗口固定为一句;ESA CRF 建模连续语句预测标签之间的转移,但操作对象是标签序列而非底层音频表示。第 3 条是多模态对话情绪路线,同时用音频、文本甚至说话人信息建模 intra 和 inter 说话人影响,输入条件更丰富,但在只有音频或缺少说话人标注时不可用。ACERT 的定位是第二条线上的极简方案:只用音频、只用过去、不区分说话人,用可变时长窗口加均值池化实现。

这种对照的意义是避免把类别差异当成同条件胜负。多模态方法用了文本信息,不能与纯音频方法直接比高低;用未来上下文的方法在离线评测可能占优,但在需要低延迟的实时交互中不可部署。论文的预实验因此专门比较了加未来上下文与只用过去上下文,结果相当,才选择只用过去以避免等待未来语句的延迟。

对话被形式化成什么,分类器要学什么映射?

论文把 1 次对话定义为按时间排序的语句序列,记为从第一句到第 N 句的集合。每一句对应一段波形和一个情绪类别标签,类别数取决于数据集,例如 IEMOCAP 取 4 类,MELD 取 7 类。任务是学习一个从波形到类别的映射,对每段语音输出一个情绪标签。这是标准的监督分类设定,监督来源是人工标注的语句级情绪标签,损失是交叉熵。 关键的形式化选择是上下文窗口的定义。

设 t 为超参数,表示除目标语句之外向前取多少秒的历史音频。对第 i 句,系统把目标语句波形与恰好能填满 t 秒历史的前文语句拼接起来,构成总时长等于本句时长加 t 的输入段。如果历史超过 t 秒,则把最早的那句历史截断以适配窗口。这个定义决定了复现时必须按对话顺序拼接、按秒截断,而不是按固定句数截取。论文评估的 t 取 5 秒的倍数,从 5 秒到 40 秒。

理解这个定义才能理解后文的曲线横轴。横轴不是句数而是秒数,纵轴是未加权准确率等指标。目标语句平均只有 3 到 4 秒多,因此即使 t 等于 5 秒,历史信息量也已经超过本句本身,这解释了为什么加很短的上下文就有明显提升。

ACERT 把一段带历史的音频变成什么,再送去哪里?

沿一个样本走完流程有助于复述。输入是目标语句加 t 秒前文拼接成的波形段。先经过特征提取器得到帧级特征,再过一个可学习的线性层加激活函数得到表示矩阵。然后按时间切分为目标帧和上下文帧两部分,上下文帧被压缩成一个向量,加到每个目标帧上,再经过带残差和层归一化的前馈网络。最后对增强后的目标帧做时间平均池化,得到语句级向量,送入分类头预测情绪类别。

分类头是激活函数加线性层的结构。整个模块可以加在任何特征提取器之上,论文实例化为 HuBERT-large 之上。 白话解释自监督语音表示,它是在大量无标注语音上预训练的编码器,能从波形中抽取内容和韵律特征;上下文情绪表示则是把历史帧平均后形成的情绪背景向量。

自监督语音表示 × 上下文情绪表示: 自监督语音表示负责把原始波形变成携带内容和韵律的帧特征,上下文情绪表示负责把前文帧压缩成一个向量并加回本句。两者搭配的原因是前者提供高质量但孤立的声学基础,后者提供对话连续性;组合后分类器看到的不再是孤立语句,而是被历史平均情绪偏置过的语句表示。

原文给出的方法安排理由有两点。第一,只用过去不用未来,因为两者性能相当而只用过去避免实时等待。第二,不区分说话人,因为用真实说话人标签或聚类 diarization 取说话人相关上下文,与不区分说话人的做法相比没有统计显著差异,且不区分可避免 diarization 错误传播,也保证在缺少说话人信息的数据集上一致评测。这两点都是已验证对照,不是事后假设。

均值池化与残差融合具体算什么,符号是什么?

先解释符号与输入。记 H 为输入段经编码器和线性层后的帧表示矩阵,切分后 Ht 为目标语句对应的帧,Hc 为前文对应的帧。c 为压缩后的上下文向量,FFN 为两层前馈网络,LN 为层归一化。计算目标是把可变长历史压缩为固定维偏置,并以不淹没本句的方式注入。 第一步是时间均值池化,把 Hc 中所有帧向量求平均得到 c。独占公式如下:

\[\mathbf{c}=\frac{1}{|\mathbf{H}_{c}|}\sum_{h\in\mathbf{H}_{c}}h\]

该式对历史帧一视同仁求平均,不加权、不排序、不学习注意力权重,这是方法极简的关键,也是后文在快速翻转数据上失效的原因,因为不同情绪的历史被同等平均了。 第二步是融合。把 c 加到 Ht 的每 1 帧上得到 Ht 撇,再经过前馈加残差和归一化得到 Ht 两撇。独占公式如下:

\[\mathbf{H}_{t}^{\prime}=\text{LN}(\mathbf{H}_{t}+\mathbf{c}),\quad\mathbf{H}_{t}^{\prime\prime}=\text{LN}\big(\mathbf{H}_{t}^{\prime}+\text{FFN}(\mathbf{H}_{t}^{\prime})\big)\]

其中加法是广播加法,前馈网络用激活函数,残差连接保留原始信息。最后对 Ht 两撇再做 1 次时间平均池化得到语句向量。白话说,时间均值池化负责把历史压成一句话的平均口气,前馈残差融合负责把平均口气拌进本句每 1 帧但不丢掉本句原味。

时间均值池化 × 前馈残差融合: 时间均值池化分工是把长度可变的前文帧集合压缩为一个固定维向量,前馈残差融合分工是把该向量加到每个目标帧后再做非线性变换和归一化。搭配理由是均值操作对时长鲁棒且不引入额外对齐参数,残差结构保留原始本句信息不被淹没;组合意义是用极简运算实现历史向当前的单向注入。

关于说话人设计的补充对照如下。白话说,说话人相关上下文是只听这个人之前怎么说,说话人无关上下文是不管谁说都按时间听。

说话人相关上下文 × 说话人无关上下文: 说话人相关上下文只取目标说话人自己的历史语句,说话人无关上下文不区分说话人而按时间取全部前文。ACERT 选择后者,分工上省去说话人标签和 diarization 步骤;搭配理由是预实验显示两者性能无显著差异,而无关设计避免误差传播并保证在缺少说话人标注的数据集上仍可一致评测;组合意义是简化部署条件。

论文报告在 25 秒窗口下两者无显著差异,因此选择更简单的无关设计。未报告的内容是梯度是否截断、编码器哪些层冻结,这些在原文证据中没有具体说明,复现时不能从模型名称推定,应按开源代码核对,本文不猜实现。

训练阶段更新什么,用什么损失和超参数?

训练是监督微调,不是无训练的检索或规则系统。特征编码器选用 HuBERT-large,对应公开权重为 facebook 的 hubert-large-ll60k,代码库公开可用。当前证据显示代码链接可用,权重链接可用,意味着复现可以下载到起点,但不等于整个系统开箱可运行,还需按论文的拼接与划分逻辑构造输入。损失函数是交叉熵,批大小为 16,学习率为 1.3 乘以 10 的负 4 次方。每个实验重复运行 5 次并报告均值与标准差,这对判断小幅增益是否稳定很重要。

原文未明确报告编码器是否全量微调、线性层与 ACERT 块的学习率是否区分、梯度路径与早停策略,这些属于缺项。教学上应指出具体缺项:冻结与更新范围不明,优化器类型与训练轮数不明。复现时应先跑通代码默认配置,再对照论文的窗口取值与划分,而不是自行假设全参数微调。推理阶段是按对话顺序逐句构造带前文的输入段,因此需要缓存历史音频或历史帧特征,窗口越大,输入越长,计算与显存开销越大,但原文未量化延迟与显存,本文不承诺延迟改善。

在哪些数据、什么划分、什么指标下比较?

实验按问题组织:测上下文是否有增益、与谁比、条件是否一致。数据选择覆盖 3 种交互风格。IEMOCAP 是 10 名演员的双人 scripted 与即兴对话,约 12 小时,标签取幸福合并兴奋、愤怒、悲伤、中性。MELD 是情景喜剧老友记的多人对话,约 13.7 小时,情绪密集且翻转快,标签为愤怒、厌恶、恐惧、喜悦、中性、悲伤、惊讶 7 类。SAFE 是从 30 部电影 400 个场景中抽取的强情绪片段,约 7 小时,400 个不同说话人,标签为恐惧、其他负情绪、正情绪、中性。

三者几乎没有缺失语句,保证上下文流连续,且 ACERT 只用音频模态。 划分与协议方面,IEMOCAP 和 SAFE 采用说话人无关的五折交叉验证,IEMOCAP 每折测一个会话,SAFE 每折测 6 部电影的场景;MELD 用官方训练验证测试划分。指标同时报告未加权准确率、加权准确率、宏平均 F1 和加权 F1 及其标准差。白话说,未加权准确率是每类先算准再平均,加权准确率是按样本数算总账。

未加权准确率 × 加权准确率: 未加权准确率先算每个情绪类别的召回再平均,对小类更敏感,加权准确率按样本数加权更接近总体正确率。论文同时报告两者,分工是分别回答类别均衡下的能力和实际分布下的能力;搭配理由是情绪数据常不均衡,单看加权准确率会掩盖小类失败;组合使用才能判断增益是全面还是只来自大类。

下表提出第一个比较问题:在语句和对话时长与情绪稳定性上,三者是否可比,指标方向是否一致。公平条件是同一音频输入、无额外文本,指标越大越好。该表为理解后文为何 IEMOCAP 增益大而 MELD 增益小提供背景,表后解释其代价与反例。

Utterance levelUtterance levelUtterance levelUtterance level
Total files5531563813706
Mean duration (s)4.554.283.19
Median duration (s)3.582.722.49

该表显示 IEMOCAP 对话平均长达 166.63 秒且情绪稳定,连续相同情绪平均持续 33.6 秒;SAFE 居中;MELD 对话平均仅 30.52 秒且连续相同情绪仅持续 5.5 秒,平均连续相同情绪语句仅 1.71 句。主要收益是长而稳的对话给平均池化提供了同情绪历史,而代价是短而跳的对话让平均后的历史变成混合情绪噪声。这预示了后文 MELD 的负结果,不是方法实现错误,而是适用条件不满足。

加多少秒历史最好,比基线和已有方法强多少?

主结果测不同窗口长度下的性能,比较对象包括无上下文的 HuBERT-large 微调基线、无上下文的已有最佳方法、有上下文的已有方法。条件一致性方面,基线与 ACERT 共享同一编码器起点,区别仅在于是否拼接历史并经过 ACERT 块;已有方法数值取自原论文,不是复跑,因此跨论文比较需留出实现与划分差异的谨慎。指标方向均为越高越好,重点看对小类公平的未加权准确率和宏平均 F1。 在 IEMOCAP 上,加 5 秒上下文已将未加权准确率从 68.38% 提高到 76.40%,提升 8.02 个百分点,25 秒时达到峰值 79.08%,比基线高 10.70 个百分点。

百分点与相对百分比不同,这里说的是百分点差值。在 SAFE 上,25 秒时从 41.20% 提高到 45.19%,提升 3.99 个百分点,之后继续加长窗口性能下降。在 MELD 上,短窗口没有统计显著改善,ACERT 在 10 秒窗口取得 28.03% 的未加权准确率和 28.62% 的宏平均 F1,接近基线的 27.60% 和 28.49%,加权指标反而低于基线。 下表提出第二个比较问题:在 IEMOCAP 上,可部署的 ACERT 是否同时超过可运行的基线与最强的上下文基线,公平条件是同数据集同类别划分,指标越大越好。表后解释收益与未胜出项。

IEMOCAPACERT’s preliminary design experiments (t = 25 s)ACERT’s preliminary design experiments (t = 25 s)ACERT’s preliminary design experiments (t = 25 s)ACERT’s preliminary design experiments (t = 25 s)ACERT’s preliminary design experiments (t = 25 s)ACERT’s preliminary design experiments (t = 25 s)
IEMOCAPHuBERT-large fine-tuning (baseline)✗68.38 ± 0.8567.03 ± 0.8067.30 ± 0.8766.41 ± 0.88
IEMOCAPCHAN (2024) [24]✓75.975--
IEMOCAPACERT (ours), t = 25 s✓79.08 ± 1.3477.83 ± 0.8878.22 ± 1.0177.64 ± 0.91

该表显示 ACERT 在 25 秒窗口取得 79.08% 的未加权准确率和 77.83% 的加权准确率,超过无上下文基线的 68.38% 和 67.03%,也超过有上下文的最强基线 CHAN 的 75.9% 和 75%,领先 3.18 个百分点和 2.83 个百分点。主要收益来自情绪连续性,代价是需要缓存 25 秒历史音频并编码更长的输入,推理开销随窗口增大。未胜出项在 MELD 上:ACERT 的加权准确率 47.19% 低于基线的 49.83%,说明在类别不均衡且情绪翻转快的数据上,平均池化不能改善大类主导的总体正确率,这是明确的边界。

增益来自情绪连续性,还是说话人身份与录音条件?

消融要回答反证问题:如果把历史换成同会话但无关对话的语音,增益是否还在。如果还在,说明模型只是利用了说话人音色或录音环境;如果消失,说明利用的是与目标相关的情绪流。论文在 IEMOCAP 最优窗口 25 秒下设计 3 组替换。第一组是同会话连续上下文,用同一会话中另一段对话的连续片段替换真前文,保留轮转但与目标无关。

第二组是同会话随机上下文,用同一会话其他对话的随机语句混合替换,完全打乱连续性;第 3 组是同对话打乱顺序,保留真前文语句但随机打乱顺序,只破坏时序。 3 组都控制了说话人与录音条件,因此性能下降只能归因于连续性或相关性的丢失。结果是连续替换得 69.82%,随机替换得 70.09%,打乱顺序得 75.87%,均明显低于真上下文的 79.08%,且前两者接近无上下文基线的 68.38%。连续与随机两者相差在 1 个标准差内,说明一旦无关,是否有连续性影响很小。

打乱顺序居中,说明时序本身也有贡献,但相关性贡献更大。 下表提出第三个比较问题:在控制说话人与录音条件后,无关历史与打乱历史是否仍能保持增益,指标越大越好。表后解释支持的判断与限制。

IEMOCAPSame session, continuous context✓69.82 ± 1.1168.54 ± 1.2868.63 ± 1.3468.12 ± 1.33
IEMOCAPSame session, random context✓70.09 ± 0.5168.98 ± 0.4969.22 ± 0.568.69 ± 0.46
IEMOCAPSame conversation, shuffled order✓75.87 ± 1.1075.02 ± 0.8075.15 ± 0.8774.77 ± 0.79
SAFEHuBERT-large fine-tuning (baseline)✗41.20 ± 1.0648.54 ± 0.4840.39 ± 0.9448.09 ± 0.37

该表支持的判断是增益 specifically 来自对话与情绪连续性,而非额外语音量或音色匹配。限制是该结论仅在 IEMOCAP 上验证,SAFE 与 MELD 未做同等消融;且打乱顺序仍有 75.87%,高于基线,说明即使时序错乱,相关语句的集合平均仍有一定帮助。因此不能把时序说成唯一因素,相关性与时序是叠加作用。

什么情况下上下文失效,原文给出什么解释?

论文明确报告的失效条件是 MELD。原文用两个因素解释。第一,每段对话平均 3.4 个说话人,而 IEMOCAP 是容易区分的 1 男 1 女双人对话,多人使历史来源更杂。第二,情绪稳定性极低,平均相同情绪只持续 5.5 秒,而 IEMOCAP 为 33.6 秒,SAFE 为 27.5 秒。结合消融结论,即与目标情绪不同的历史几乎不比无历史好,可以解释为何拉长窗口在 MELD 上不提升:更长的窗口引入更多异情绪语句,平均后变成噪声。

这是论文直接报告加有限解释的部分,应表述为支持而非因果证明。可能但待验证的推测是多人与不稳定各自贡献多少,原文未做正交分解,SAFE 也缺少足够的说话人数据做可靠比较,因此不能断言说话人数是主因。另一个限制是 SAFE 上窗口过长后性能下降,说明即使在稳定数据上,无限加长也不单调有益,存在最优窗口。 未测量的边界包括误判率分布、延迟、显存与跨语料泛化。

原文未报告训练资源、推理开销、输出帧率与实际延迟的量化数字,因此不能承诺 ACERT 在保持精度的同时降低成本。未来工作提出自动判断何时历史与目标情绪相关、以及跨语料训练测试,这些在本文只是方向,不是已验证结论。

要复现应先做什么,需要哪些信息条件?

复现先做三件事。第一,按资源状态核对可达性。本次收到的资源状态显示代码链接当前可用,权重链接当前可用,因此可以写代码与权重已公开可下载,但仍需在复现时确认版本与提交哈希,因为论文结果依赖特定窗口构造与划分。第二,按对话顺序重建输入。不能随机打乱语句,必须保留对话内的时间顺序,按秒拼接前文,超长时截断最早的历史,目标语句本身不截断。

第三,对齐划分与重复次数。IEMOCAP 按会话五折,SAFE 按电影分组五折,MELD 用官方划分,每个实验重复 5 次取均值与标准差,只跑 1 次无法判断方差范围内的差异。 关键超参数与信息条件包括编码器为 HuBERT-large,损失为交叉熵,批大小 16,学习率 1.3 乘以 10 的负 4 次方,窗口取 5 秒步进到 40 秒并以未加权准确率选优。注意选优窗口是事后最优值,部署时不能假设最优窗口已知,应报告固定窗口或在验证集上选窗的结果,原文最高值不能直接当作可部署收益。

缺失的信息包括冻结策略、优化器细节、早停与数据增强,复现时应以开源代码为准并记录实际选择。 常见误解是把平均池化当成注意力机制。ACERT 的历史压缩没有学习权重,对每帧一视同仁,因此实现简单但无法自动忽略异情绪历史;另一个误解是把说话人无关当成说话人不变性证明,论文只显示在 IEMOCAP 上两者性能相当,不代表模型真正剥离了音色,DTNet 那类解耦工作仍是互补方向。

何时值得尝试 ACERT,还需补哪项验证?

综合直接报告与有限解释,何时值得尝试的条件比较清晰。如果你的数据是双人或少人长对话、情绪在十几秒到几十秒内保持稳定、有完整对话顺序且只有音频可用,ACERT 是低成本的首选增强,因为它只加一个均值加残差块,不需要文本、说话人标签或未来语句。如果你的数据是多人快节奏、情绪几秒一变、单句平均很短,那么按原文证据不应期待同样增益,此时应先测情绪稳定性和窗口曲线,而不是直接加大窗口。 还需补的验证包括两类论文特有细节。

第一,相关性感知的加权历史,例如先判断历史与目标是否同情绪再加权平均,这正是原文未来工作指向,也是解决 MELD 失效的直接思路。第二,跨语料泛化,例如在 IEMOCAP 上训练、在 SAFE 或 MELD 上测试,看上下文增益是否跨交互风格迁移,原文未做此实验。成本方面,需补不同窗口下的训练时长、显存占用与流式推理延迟,才能回答 25 秒窗口在实际系统中的代价。

回到中心判断:ACERT 用极简的过去平均证明了对话连续性对语音情绪的价值,在稳定对话上大幅超过已有上下文方法,在不稳定对话上暴露了平均操作的边界。复述方法时记住一句话流程:按秒取前文拼接,编码后切分目标与历史,历史平均成一个向量加回每一目标帧,再平均分类。

📎 论文与评分元数据

排名:前25% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-24 语音/音乐/音频论文速递