英文题目:Towards Authentic Movie Dubbing with Retrieve-Augmented Director-Actor Interaction Learning
会议身份:
conference:aaai:2026:conference-paper-id:40483
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#图神经网络 #检索增强 #音视频 #语音 #语音配音
评分:7.6/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Rui Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhenqi Jia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向视觉语音克隆的电影配音需以剧本、静音视频与短时音色提示为输入生成兼顾音色复刻、唇同步与情感表现力的语音,难点在于仅依赖目标话语内跨模态建模难以获得充分情感上下文。该工作提出模拟导演-演员交互的Authentic-Dubber,先用大语言模型理解场景、表情与文本情感并联合直接情感音频构建多模态参考片段库以提供导演式学习素材。接着以目标基础情感为查询做情感相似度检索增强,从库中召回与目标静音视频最相关的间接多模态信息与直接情感音频。然后经渐进式图按基础情感图、间接情感扩展图、直接情感扩展图逐步累积三级情感知识,并由情感知识语音合成器结合跨模态对齐结果生成梅尔频谱图。相对以往演员直接配音的简化流程,该链以可解释检索引入外部情感证据并渐进融合,强化了情感建模的充分性与针对性。在V2C-Animation基准下,Authentic-Dubber的EMO-ACC为47.21%,高于StyleDubber的45.73%。该结论适用边界限于动画配音的说话人无关封闭检索设定,对真人影视与跨数据集泛化的失效模式尚未验证。原文披露训练与推理硬件为A800 GPU实现,其具体训练成本与推理开销的量化细节受限。
🔗 开源与复现资源
- 代码相关资源:https://github.com/AI-S2-Lab/Authentic-Dubber — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/svjack/comet-atomic-en — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,哪些信息不能丢?
这篇论文研究的任务叫电影配音,也叫视觉语音克隆。输入有三样:要配的剧本文字、一段无声视频、一小段提供目标音色的音色提示。输出是一段语音,要求听起来像提示音色的人说的,口型与无声视频对齐,情感与画面和剧情相符。初学者容易只盯着把字念对和把口型对上,论文提醒第 3 个要求同样关键:情感表达是否生动。必须保留的信息包括说话内容、说话节奏与唇动同步关系、说话人音色,以及场景氛围、人物表情变化、文本语义中蕴含的情感线索。
输出不只是可懂的语音,而是在这 3 类条件都满足下带有可感知情感的配音。如果丢掉情感线索,模型仍能出声,但听感会平,特别是在愤怒、开心这类起伏大的情绪上露馅。论文把目标明确为在保证发音与同步的前提下提升情感表现力,后续所有设计都围绕如何给模型补情感功课展开。
已有路线在补哪块短板,为什么还缺导演这一环?
按同输入、同目标、同运行阶段对照,已有配音工作大致分 3 条线。第一条补发音质量,例如用多任务预训练先学发音知识再用配音数据微调;第二条补音画同步,例如在唇动序列与音素序列之间做双重对比学习;第 3 条补表现力,例如分 2 阶段先做韵律增强的声学预训练再做解耦的韵律适配。这些工作都默认演员拿到剧本和默片就直接开配,建模范围限于当前待配语句内部的多模态交互。
论文指出这相当于简化的工作流,缺少真实剧组中导演与演员的互动环节。真实流程是导演先让演员熟悉情感参考片段,演员把上下文线索尤其是情感内化后再表演。检索增强生成和图神经网络在相关任务中已有应用,前者从外部记忆库找先验知识,后者建模语句内多模态关系,但此前都没有把导演给素材、按情感相似检索、再分层累积情感知识这套互动搬进配音。因此论文不是再调大单模型,而是把缺失的准备阶段补成可计算的检索与融合流程。
简化流程错在哪里,论文把矛盾具体化成什么?
简化流程的错误在于把情感当成可从当前语句直接推出来的属性。无声视频加剧本确实有情感信号,但单条样本的信息量有限,演员没有见过足够多同类情绪的表达方式,容易在表演时犹豫。论文把矛盾具体化为:目标语句的基础情感需要外部情感知识来校准和放大,而外部知识必须与目标高度相关且分清间接与直接。间接指场景氛围、脸部表情变化、文本语义等告诉你该有什么情绪,直接指真实语音示范告诉你这种情绪听起来什么样。
只有先理解间接再听直接,演员才能把知识转成自己的表演。下面示意图把两条路线并排画出,上路只有跨模态建模加语音生成,下路多了相关片段、检索增强与渐进图生成,差异一目了然。
看图路径: 1. 先看上半分支从视觉信号与待配文本到跨模态建模再到语音生成的单路径;2. 再看下半分支新增的相关片段库如何接入检索增强与渐进图生成;3. 对照左右两端波形颜色差异理解论文想补的情感表达缺口
论文图 1。原论文 Figure 1:“(a) Previous models rely solely on cross-modal modeling of the target utterance to generate speech, which results in limited emotional expressiveness.”。
上路输入只有当前视觉信号与待配文本,模型被迫 1 次成型;下路允许从相关片段库中按情感相似挑出最像的几段,先看间接线索再听配对音频,最后才生成。图底标注点明缩写含义,红色块强调新增的两个环节。理解这张图就抓住了全文动机:不是换更大的声学模型,而是给模型加一个准备阶段。
三段式总览如何对应导演给素材到演员登台?
论文把真实互动拆成 3 个可执行的阶段。第 1 阶段是多模态参考片段库构建,对应导演整理学习素材。基于配音数据集,对每条样本用 4 个情感抽取器分别得到场景向量、脸向量、文本向量和音频向量,存成可检索的库。第二阶段是基于情感相似的检索增强,对应演员高效找重点。用目标语句的场景、脸、文本基础情感各做 1 次查询,分别找回最相似的间接情感信息,再经索引找到与之配对的直接情感音频。
第 3 阶段是渐进图语音生成,对应演员学习并表演。按基础情感图、间接情感扩展图、直接情感扩展图的顺序逐步建图与编码,最后由情感知识语音合成器把 3 阶段知识与跨模态对齐结果融合,送梅尔解码器和声码器出声。全流程大图把 3 段纵向排布,右侧用导演与演员小人标出构建库、提供相关片段、学习并表演的对应关系。
看图路径: 1. 沿 Stage1 到 Stage3 自上而下追踪 S、F、T、A 四类向量的产生与流向;2. 看 Stage2 中三个查询如何分别检索再经索引找到配对音频;3. 看 Stage3 中三张图如何经图注意力编码器逐级初始化与汇入合成器
论文图 2。原论文 Figure 2:“The proposed Authentic-Dubber consists of Multimodal Reference Footage Construction, Emotion-Similarity-based Retrieval-Augmentation, and Progressive Graph-based Speech Generation.”。
从像素看,顶层把每条素材的文字与波形送入 4 个抽取器得到 4 组向量;中层目标侧同样抽出 3 个查询向量,经检索库与索引查出两路候选;底层 3 张图从左到右节点越来越多,边颜色区分基础边、间接边与直接边,3 次图注意力编码的结果都向下汇入合成器。先沿一个样本走一遍:无声片段与文字进来,一边做跨模态对齐准备发音与同步,一边抽情感向量去库里找参照,再把自身与参照一起建成图去指导合成,这样就把导演给素材、演员做功课、最终登台串成了闭环。
四种情感向量是怎么抽出来的?
抽取器的设计目标是把不同模态的情感表示投影到可比的向量空间。场景情感抽取器先用视频理解模型生成场景情感描述,提示中还加入影响情绪感知的全局低层视觉特征如色调、亮度与饱和度,再把描述送入基于 RoBERTa 的文本情感识别模型得到场景向量。脸部情感抽取器同样先生成描述面部表情变化的文本,再经同一识别模型得到脸向量。
文本情感抽取器分两路,一路对输入文本直接抽取自我情感向量,另一路先用常识模型生成反应描述再抽取反应情感向量,最后把两者拼接成最终文本向量。音频情感抽取器直接用通用情感表示模型从语音中抽音频向量。4 个抽取器的输出维度都设为 256,为后续按余弦相似检索和图建模打下统一基础。
这里的关键教学点是大语言模型不是用来直接生成语音,而是用来把难量化的画面情绪转写成可理解的情感描述,再转成向量,这样跨模态的情绪才能放在同一尺度下比较。
多模态参考片段库 × 情感相似检索增强: 多模态参考片段库负责把导演给的学习素材沉淀为可查的知识,分别存场景氛围、面部表情变化、文本情感语义和与之配对的直接情感音频向量;情感相似检索增强负责在配音时以目标语句的基础情感为查询,按余弦相似找出最相关的间接情感信息并用索引找到配对音频,二者搭配的理由是库只管存全、检索只管选准,组合后演员才不是从零猜情感而是有参照地学。
库建成后每条样本都有 4 类向量与原始素材的对应关系,检索时按模态分别比相似度,文本检索还把自我与反应两路相似度取平均作为标准,这种分模态处理保留了不同线索各自的判断依据。
检索时查什么,拿回什么,为什么不直接用目标语音查?
真实配音时目标语音根本不存在,所以不能拿它当查询。论文用目标语句的基础情感做查询,这符合演员只能看到默片和剧本的条件。具体做法是场景向量去比库中场景向量,脸向量去比脸向量,文本拼接向量分两路比再平均,每路取前 K 个最相似的间接信息,同时经索引把这些片段各自配对的直接情感音频一起拿回。这样 1 次配音会拿到 3 组间接节点与 3 组音频节点,它们都是与目标情绪最像的外部示范。
论文还强调采用说话人无关检索,因为动画角色是虚拟的,同一说话人的参考素材往往很少,跨人找情感相似片段能获得更多样、更相关的示范。这个选择不是为了省事,而是针对动画场景中先验少的特点,用情感相似代替身份一致。检索数量与相似度函数的选择留到实验部分验证,方法部分先把机制定为按模态独立检索再配对音频,确保拿回的知识既相关又完整。
基础情感图 × 间接情感扩展图: 基础情感图负责先学目标自身最相关的场景、脸、文本 3 个节点的两两关系,间接情感扩展图负责把检索回来的同模态间接节点挂到对应基础节点上继续编码,搭配原因是先立住目标再向外扩展可避免被检索噪声带偏,组合意义是实现从自身理解到借助外部间接知识的第 1 次累积。
拿回的节点在下 1 阶段不会被直接拼进声学特征,而是作为图节点参与渐进编码,这避免了把检索特征生硬灌入下游,保留了关系建模的空间。
三张图如何一步步把情感知识攒起来?
渐进图的核心是先学自身再学间接最后学直接,每一步都经历建图与图注意力编码。基础情感图节点只有目标的场景、脸、文本 3 个向量,边把三者两两相连,编码后得到对目标基础情感的理解。间接情感扩展图在上一步编码结果上初始化,把检索回来的同模态间接节点挂到对应基础节点上,例如场景检索节点连场景基础节点,再编码 1 次,累积间接知识。
直接情感扩展图继续在前一步基础上初始化,把配对音频节点作为新节点,连到发出对应查询的基础情感源上,再编码 1 次,累积直接知识。3 类边分别命名为基础情感边、间接情感边与直接情感边,用来区分知识来源。合成器部分把跨模态对齐器的输出与 3 张图的节点表示做层次交叉注意力聚合,先后融入基础、间接、直接知识,再经 1 维卷积与梅尔解码器生成梅尔谱,最后用声码器转波形。
符号上可用目标对齐表示与 3 组图节点表示理解为逐步精化的情感条件,计算目标是让每 1 阶段的表示都比上 1 阶段多一层外部参照。原文未给出完整的损失与梯度路径细节,本解读不猜测参数冻结或监督来源,仅按报告的流程讲清数据流向。
直接情感扩展图 × 情感知识语音合成器: 直接情感扩展图负责把与检索片段配对的情感音频节点接到发出查询的基础情感源上,做最后 1 次图注意力编码,直接听到情感该怎么响;情感知识语音合成器负责把 3 个阶段学到的图节点表示与跨模态对齐结果做层次交叉注意力聚合再送梅尔解码器,搭配原因是图只管攒情感知识、合成器只管把知识与唇同步和音色条件拼好,组合后才输出既对口型又有情感的波形。
跨模态对齐器 × 音色提示: 跨模态对齐器负责按论文沿用的 StyleDubber 结构,把输入剧本、视觉帧和音色提示对齐为带时长和同步信息的表示,音色提示负责提供要模仿的说话人音色,分工是前者管说什么与何时说、后者管听起来像谁,搭配后情感知识只需做加法增强而不必重学发音与同步。
这样设计的好处是每类知识何时进入、连到哪里都有明确规则,消融时可以单独去掉间接信息或直接音频来验证贡献。
库如何建成,模型如何训练与推理?
该节没有独立的神经网络训练新理论,实际计算过程是库构建加模型训练加检索推理 3 段。库构建基于配音数据集逐条抽 4 类向量,场景与脸依赖视频理解模型加情感识别模型,文本依赖识别模型加常识反应模型,音频依赖情感表示模型,建成后即为检索用记忆库。
模型训练按论文实现细节交代:视频帧按每秒 25 帧采样,音频重采样到 22.05 千赫,短时傅里叶变换窗长与帧长为 1024、跳长 256,所有情感特征与图注意力编码器维度为 256,合成器中 1 维卷积输出维度为 256,优化器用 Adam 且参数设为对应值,学习率 0.00625,在 A800 上用 PyTorch 实现训练与推理。推理时对每条待配语句先抽 3 个基础情感向量做查询,检索前 K 个间接信息与配对音频,再走 3 张图的建图编码与合成,最后经声码器出声。
原文未报告哪些抽取器参数冻结、梯度是否截断、声码器是否微调等细节,这些缺项在复现时需以公开代码为准,不从模型名称推定实现。
在什么数据与指标下比较,条件是否一致?
实验用 V2C-Animation 动画电影配音数据集,论文称其为当前唯一公开带情感标注的电影配音数据集。数据来自 26 部迪士尼动画电影,含 153 个角色,共 10217 条带音频与剧本的视频片段,按 60% 训练、10% 验证、30% 测试划分。客观指标有 4 个:情感准确率用预训练语音情感识别模型预测合成语音的情绪类别并算与真值一致的比例,越高越好;词错率用大语音识别模型衡量发音准确性,越低越好;说话人编码器余弦相似度衡量合成语音与音色提示的音色相似,越高越好。
梅尔倒谱失真经时长加权的动态时间规整衡量生成语音与真值在长度与对齐质量上的差异,越低越好。主观指标是对 20 名受训评分者、12 段生成视频与语音的平均意见分,包括配音情感相似度与语音情感相似度两项,1 到 5 分,越高越好。比较对象包括经典合成与多个配音基线,论文称基线语音均用官方实现生成,这保证了运行条件基本一致。
实现上情感特征与编码维度、优化器设置已在上一节交代,检索默认采用说话人无关、余弦相似、前 K 个的设置,具体 K 值与相似度函数的敏感性另做分析。
主结果测了什么,谁赢了,代价是什么?
主结果要回答在同数据同协议下,新流程是否真正提升情感表达,以及是否牺牲发音、音色与同步。比较问题是:在保证可懂与像本人、且对上口型的前提下,哪种方法的情感最接近真值。公平条件是同一测试划分、同一客观模型打分、同一批主观评分者,指标方向为情感准确率与主观分越高越好,词错率与失真越低越好。下表把论文报告的关键数字整理为五列,基线列保留实际可运行的方法名,数值列保留原文写法,方向在表头说明。
| 评价维度 | 指标与方向 | Authentic-Dubber 报告值 | 对照基线与策略 | 比较含义 |
|---|---|---|---|---|
| 情感类别一致 | 情感准确率越高越好 | 47.21% | FastSpeech2、V2C-Net、HPMDubbing、StyleDubber、Speaker2Dubber 等官方实现 | 本方法最高,更接近真值情绪 |
| 配音整体情感 | 主观配音情感分越高越好 | 3.792 | 同上基线组,主观 12 段 20 人打分 | 本方法最高,视频观感情感更像 |
| 语音自身情感 | 主观语音情感分越高越好 | 3.889 | 同上基线组,主观 12 段 20 人打分 | 本方法最高,单听语音情感更像 |
表后解释需要同时讲收益与代价。论文报告本方法在三项情感相关指标上均为最好,客观情感准确率 47.21%,主观两项分别为 3.792 与 3.889,支持新流程有效模拟了导演与演员互动从而补强情感的判断。但代价并未消失:情感准确率绝对值仍不足一半,说明任务本身很难;检索与 3 阶段图编码增加了系统复杂度与推理依赖;原文还报告了发音、音色与同步指标,本方法并非在所有非情感指标上都最优,初学者不应把情感提升误读为全面碾压。未胜出项方面,至少有一个基线在词错率或失真上更低,复现时应同表核对全部四项客观指标而非只看情感。
说话人无关检索 × 说话人相关检索: 说话人无关检索允许跨说话人找情感相似片段,说话人相关检索只在同一说话人内找,前者分工是扩大动画角色虚拟、单人素材少时的情感多样性,后者分工是保音色一致,论文搭配对比的理由是验证动画配音中情感多样性比死守同一人更重要,组合比较支持了默认采用无关检索的选择。
下图是检索设置对情感准确率的影响,横轴为选取的前 K 个素材数,纵轴为情感准确率,两条线分别代表无关与相关检索。
看图路径: 1. 先确认横轴为 Top-K 数量、纵轴为情感准确率;2. 比较蓝色无关检索与橙色相关检索在 K 等于 3 附近的峰值高低;3. 观察 K 继续增大后两条曲线是否都下滑以判断冗余效应
论文图 4。原论文 Figure 4:“EMO-ACC of speech generated by Authentic- Dubber under Speaker-Agnostic and Speaker-Specific re- trieval settings with varying Top-K values.”。
从像素看,蓝色无关检索在 K 等于 3 处冲到最高点后缓慢回落,橙色相关检索整体更低且波动更大,K 过大后两条线都下降。解释是少量高质量参照最有帮助,过多检索会引入冗余信息,无论是否限定同一说话人都如此。这支持默认用无关检索加较小的 K,也说明检索数量不是越多越好。
哪些部件真的在起作用,拿掉会发生什么?
消融要回答 3 组部件各自的贡献:大语言模型参与的描述生成、按模态分的检索增强、渐进图中的知识来源与融合方式。论文报告去掉场景描述、脸部描述或两者同时去掉后,情感准确率与主观分一致下降,支持深度理解跨模态情感表示确有帮助;分别去掉场景、脸、文本检索或全部检索后指标也下降,其中去掉全部检索下降最明显,支持 3 路检索共同提供情感线索;去掉间接信息、直接音频、图建模、建图编码范式或层次聚合后指标同样下降,支持从基础到间接再到直接的渐进累积不可随意跳步。下表把检索规模与相似度分析的趋势整理为五列,便于复述何时该扩库、何时该停。
| 分析维度 | 取值条件 | 情感准确率报告趋势 | 对比设置 | 趋势判断 |
|---|---|---|---|---|
| 检索范围 | 前 K 为 3 时最高 | 47.21% | 说话人无关对比说话人相关 | 无关检索峰值更高 |
| 库规模 | 从 10% 扩到 100% | 47.21% 为峰值 | 80% 到 100% 趋于平坦 | 扩库有收益但边际递减 |
| 相似度函数 | 余弦对比点积与欧氏距离 | 余弦整体最好 | 不同 Top-K 下比较 | 少而准比多而杂更有效 |
表后补充反证与边界。论文还报告检索库从小到大情感准确率稳步上升,在 80% 到 100% 之间趋平并在全量达到峰值,说明扩大情感片段集确实增强表达,但不是无限线性增长;相似度函数比较中余弦总体最好,点积波动大,欧氏距离稳定但上限略低,说明模型对相似度选择敏感。定性方面,梅尔谱可视化比较了愤怒与开心两类,橙色框标出的高波动与韵律变化在本方法中更接近真值,而基线相对平淡,这与客观主观数字相互印证。下面是该可视化的原图,左侧给出情绪与文本,右侧四列为真值与 3 种方法。
看图路径: 1. 先看左侧愤怒与开心两行对应的示例文本与视频帧;2. 再横向比较真值与三种方法梅尔谱的纹理起伏;3. 聚焦橙色框放大部分观察高频波动与韵律变化的还原程度
论文图 3。原论文 Figure 3:“The visualization of the mel-spectrograms of ground truth (GT) and synthesized speech obtained by different dubbing baselines, and orange bounding boxes are used to highlight the…”。
从像素看,上行愤怒的真值有多处陡峭起伏,本方法保留了类似的亮带走向,基线则更碎或更弱;下行开心的真值有平滑上扬的韵律线,本方法的延续性更好。注意这只是两条样本的展示,不能推广为所有情绪都如此,论文用它作机制可解释性的辅助证据,而非替代统计指标。未评测边界包括未测量检索延迟与显存开销,未报告误判率分布,初学者在引用时应明确这些限制。
证据能说什么,不能说什么?
论文直接报告的是在 V2C-Animation 划分与所用客观打分模型下,情感三指标最好且检索与渐进图各部件消融后下降,这些属于报告与显示。有限解释是无关检索更适合动画、余弦相似更适合情感向量比较、库越大越好但趋平,这些得到曲线支持但仍受数据集与打分模型选择影响。未验证推测包括该流程是否同样适用于真人电影、其他语言或更长对白,以及检索库存在域偏移时是否依然有效,原文没有给出证据,只能表述为可能或待验证。
缺失证据不是技术错误,例如训练资源只给了 GPU 型号与优化器设置而无总时长,推理延迟、输出帧率、实际部署成本均未测量,因此不能承诺这些量得到改善。相关性也不是因果,情感准确率提升与主观分提升同时出现,但不能断言某一类边或某一路检索单独决定了全部收益。总体趋势不等于每组都成立,例如 K 增大整体下降但中间个别点有回升,引用时应讲清条件。
要复现先做什么,代码与资源当前状态如何?
复现先做三件事。第一,按论文划分与采样准备数据:视频 25 帧每秒,音频 22.05 千赫,短时傅里叶参数与 256 维设置保持一致,避免因预处理不一致导致同步指标不可比。第二,先跑通库构建:依次实现场景、脸、文本、音频 4 路抽取,注意场景提示需加入色调亮度饱和度等低层特征,文本需拼接自我与常识反应两路,再统一存为 256 维向量。第三,固定检索与图流程:默认说话人无关、余弦相似、前 K 取 3,3 张图按基础到间接再到直接的顺序建图编码,最后做层次聚合与声码器转换。
资源状态以本次收到的官方像素与可用性声明为准:代码仓库链接当前可用,已公开;第三方常识模型链接本次未能确认可达,复现文本反应分支时需另寻可用版本或记录替代方案。关键超参数保留学习率 0.00625 与 Adam 对应设置,信息条件保留无目标语音、仅用基础情感查询的前提。区分代码开源与系统可运行:有代码不等于一键可跑,还需补全模型权重、检索库与声码器版本,论文未交代的冻结与梯度细节以代码为准。
何时值得尝试这个思路,如何一句话复述方法?
当你的配音或有声内容任务出现念得对但情绪平、且手头有大量带情感的同域片段可用时,这个思路值得尝试。复述方法是:先把外部片段转成场景、脸、文本、音频 4 类情感向量建成库,配音时用目标的基础情感分 3 路按相似找回最像的间接线索与配对音频,再按自身、间接、直接的顺序用 3 张图逐步编码并与对齐表示融合后生成。适用条件是动画或角色先验少、情感多样性比身份一致更重要的场景,默认用无关检索、余弦相似、较小的 K 与较大的库。
还需补的验证是跨域泛化、长时一致性、检索开销与真实听众偏好,补完这些才能从 benchmark 有效走向实际可用。记住论文的中心矛盾不是模型不够大,而是准备阶段缺失,补上导演给素材与演员逐步内化这一环,情感才有地方学。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



