英文题目:Not Quite My Tempo: Voice Activity-aware Speech Synthesis for Lip-Synchronous Dubbing

标签:#语音配音 | #流匹配 | #语音 | #跨语言

评分:6.8/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Alejandro Pérez-González-de-Martos:机构信息未在 arXiv HTML 中可靠披露
  • Florian Lux:机构信息未在 arXiv HTML 中可靠披露
  • Angelina Elizarova:机构信息未在 arXiv HTML 中可靠披露
  • Milana Shkhanukova:机构信息未在 arXiv HTML 中可靠披露
  • Andreas Kellner:机构信息未在 arXiv HTML 中可靠披露
  • Mattia Antonino Di Gangi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

自动唇同步配音要求目标语言语音的有声与静音交替模式在时间轴上精确复刻源语言片段,以保证视听一致,而跨语言文本长度天然不一致使任务兼具翻译适配与韵律规划难度。方法链分三步:先以Silero模型从音频提取帧级有声无声二值掩码,再将音素经ConvNeXt编码并经平均上采样对齐至目标帧长后把VAD嵌入相加注入编码表示。接着含说话人编码与全局风格标记的扩散Transformer流匹配解码器在固定时长画布上做修复式合成,仅约束静音起止而由模型端到端分配有声区内容,训练时对VAD嵌入随机掩码使推理时源语言掩码可全局关闭或局部放宽。与依赖唇动视频编码的路线相比,该路线训练仅需音频文本数据,无需配对视频、人脸跟踪与专用视觉编码器,对动画与多人场景更鲁棒并适配仅约12%需严格同步的工业现实。在291条多语言TEDx英译评测集上,LibriTTS-R模型的帧级Silero对齐准确率从无约束约72.69%提升至有约束约96.21%,静音边界偏差紧缩于0附近。40名英语母语者的主观评测显示位置与韵律MOS下降约0.06至0.13且Mann-Whitney U检验p大于0.05,但内部ASR词错率从8.5%升至13.9%,定性归因为极端时长失配下的删词、重复与重排序,结论仅适用于等时性较好的翻译输入。该方法的适用边界受限于等时性较好的翻译输入,极端失配下存在删词与重复的失败条件;训练成本为在四块NVIDIA A100硬件上以全局批量128训练至80万步。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文输入是三样东西:目标语言译文文本、源语言参考音频的时间结构、参考音频的音色与风格。目标是在目标语言波形中复刻源语言哪里说话、哪里静音的时间骨架,使译制语音的停顿起点与终点落在与源音频相同的时刻上。必须保留的信息是约束只做到有声与无声的二值级别,不规定具体发哪个音素、不搬运唇形细节、不要求源与目标文本相同。

读完应能复述方法链条:用语音活动检测器从源音频得到帧级二值掩码,把掩码嵌入加到文本编码表示上,再用固定长度补画式流匹配解码器生成声学特征,最后经声码器输出波形。训练时随机遮掉掩码使该条件在推理时可选,评估时同时检查时间对齐精度、主观自然度与鲁棒性。论文提供的演示页当前可用,已公开示例音频,训练用语音活动提取依赖的外部检测器链接当前可用。

初学者可以把任务理解为给定一段英文译文与一段法语音频的静音时刻表,要求英文语音在相同秒数处静音,其余有声段内由模型自行安排英文单词的快慢与停顿细分,这就是后文所有实验的共同任务定义。

同目标的已有路线为何在这里不直接用?

配音对齐的已有路线主要有 3 条。第一条是视觉唇动条件路线,从视频中编码唇部运动来约束合成。原文指出该路线需要成对视频训练数据,并依赖主讲人脸检测与唇动力学建模,在动画片、多人同框或域外场景下可能脆弱。本文选择只用音频与文本数据训练,避开对视频的依赖,这是一个运行条件上的取舍,不是同条件下的性能宣称。第二条是等时机器翻译与显式停顿标记翻译路线,通过控制目标文本音节数、音素数或停顿标记来适配时长。

原文明确将其视为互补工作,本文假设给定译文已具备大致匹配的时间结构,但不要求额外的韵律标注,合成器只负责把给定译文按时间结构读出来。第 3 条是音色与风格迁移路线,已有较多工作处理身份与情感,但较少处理跨不同文本的精确时间对齐。原文还提到在语音隐私、伪造检测与文学研究中存在精确韵律匹配,但那些设定假设源与目标文本相同,与配音中文本必然不同的前提不一致。

因此本文的对照关系是输入相同为音频加文本、目标相同为时间可懂的跨语言配音、监督不同为二值语音活动而非唇嵌入、运行阶段不同为训练不需要视频而推理用源音频的语音活动。这种划分有助于理解后文为何用语音活动检测器替代视频编码器,以及为何仍需要等时翻译或人工干预来处理极端失配。

时间对齐到底要对齐到多细?

需要对齐的不是整句时长相等,而是句内多次起止的交替模式。举例说明,假设源音频在第 2 秒到第 4 秒静音、在第 7 秒到第 8 秒静音,目标英文合成也必须在同一画布的相同秒数处静音,否则观众会看到人物闭嘴时仍有声音或张嘴时无声。评价因此细到帧级有声无声是否一致,以及每个静音段起点与终点的秒级偏差。难点在于跨语言文本长度天然不同,英文译文可能比源语言长或短,模型必须通过语速伸缩消化差异。

语速调节存在上下界,超过界限后若仍硬保时间边界,就会出现删词、重复或重排等可观察的失败模式。另一个难点是停顿的语言学合理性,模型没有被显式告知应在逗号或句号处停顿,但被期望把必需的静音放在语义边界附近,而不是把句子从中间切断。原文报告模型在只有二值掩码监督的情况下仍倾向于把停顿放在合理边界,这一点需要用主观的位置自然度评分来检验,而不能只看帧准确率。

理解这一问题定义后,才能明白后文为何同时报告对齐准确率、主观韵律分与可懂度指标,三者分别回答对得准吗、听着自然吗、内容保住了吗。

整个系统如何走完一个样本?

沿一个样本走一遍有助于建立依赖顺序。假设输入英文译文与一段法语参考音频,参考音频时长固定,例如 10 秒。第一步用语音活动检测器对参考音频逐帧判有声或无声,得到与输出画布等长的 0 与 1 序列。第二步把英文译文转成音素序列,经嵌入与卷积编码器得到文本表示,再上采样到同样的 10 秒帧数。第三步把语音活动嵌入加到上采样后的编码表示上,同时把从参考音频提取的说话人嵌入与全局风格标记通过自适应层归一化送入解码器。

第四步扩散变换器解码器在该固定画布上做流匹配生成声学隐表示,目标是在标 1 的蓝色区生成语音、在标 0 的灰色区生成静音。第五步声码器把隐表示转成波形。训练时掩码来自目标音频自身的语音活动,推理时掩码来自源语言参考音频,由于画布长度相同,二值模式可以直接跨语言搬运。下面先看该思想的直观效果,再展开组件细节。

语音活动检测 × 补画式合成: 语音活动检测负责输出每帧有声或无声的二值时间结构,只限定哪里能出声、哪里必须静音;补画式合成负责在固定长度画布上填充目标语言声学内容。两者搭配的理由是配音只需要时间骨架跨语言搬运,不需要搬运音素细节,组合后模型在蓝色有声区内自由安排语言内容,在灰色静音区强制留白,从而实现时间对齐与内容生成的解耦。

以下导读帮助建立时间画布的概念。图中三行共享同一时间轴,第一行是法语参考,第二行是有语音活动约束的英文合成,第三行是无约束的英文合成,重点是灰色静音段是否纵向对齐。

看图路径: 1. 先看三行波形的左右起止是否纵向对齐,确认时间轴是同一画布;2. 再看第一行与第二行灰色静音段的位置是否一致;3. 最后看第三行无约束合成中红色错位语音落在了哪段灰色静音区

原论文 Figure 1:Example of our proposed technique in action: The VAD condition encourages the model to use only…

论文图 1。原论文 Figure 1::“Example of our proposed technique in action: The VAD condition encourages the model to use only the blue area as canvas for inpainting-TTS.”。

图中可见第一行与第二行的深色有声波形与浅灰静音段在左右边界上基本对齐,说明有约束合成把英文内容压缩进了蓝色可用区。第三行无约束合成的有声波形延续到了本应静音的位置,并用不同底色标出错位,说明若无时间约束,模型会按自身偏好的语速与停顿读完译文,但不再满足配音的视觉一致要求。该图只展示单个例子,不能推广为平均精度,平均精度需看后文多样本统计。

编码器、上采样与解码器各自算什么?

组件按计算顺序可分为文本侧、条件侧与生成侧。文本侧先把音素序列映射为 1024 维嵌入,再用 8 层卷积编码器做上下文建模,输出再经平均上采样拉长到目标帧数。原文强调该上采样替代了填充符上采样,目的是提供更强的近对角对齐偏置,即文本顺序与时间顺序大致单调对应,减少跳词或回绕。

条件侧有两类,一类是全局参考表示,包括说话人编码器栈与全局风格标记编码器输出,负责音色与韵律风格的跨语言迁移,训练时还对风格编码器输入做数据增强以抵抗噪声参考。另一类是帧级语音活动嵌入,逐帧加到编码器表示上,为解码器提供显式时间线索。生成侧是 18 层扩散变换器参数化的向量场,用最优传输条件流匹配目标优化,经预训练的声码器从 16 千赫波形映射的标量量化隐码生成 48 千赫输出。

推理时还可使用无分类器引导,其训练基础是在训练中以 20% 概率丢弃条件输入。

平均上采样 × 扩散变换器: 平均上采样负责把音素编码器输出拉长到目标声学帧长度,提供接近对角线的时长先验;扩散变换器负责在该长度上做流匹配去噪生成。搭配原因是文本与声学长度天然不等,需要一个确定性长度桥接再做生成,组合后解码器每一步都能看到对齐后的文本表示与语音活动嵌入,避免时长自由漂移。

下图展示各分支如何汇入同一声学画布。建议按文本、参考音频、语音活动 3 条线分别追踪,再看它们在解码器处的汇合。

看图路径: 1. 沿左下输入文本经音素化、编码器、上采样的主路径看到声学画布;2. 找到参考音频分出的全局表示分支与语音活动检测分支的汇合点;3. 观察底部 1 与 0 序列与音素行的对应关系,确认静音帧的标记位置

原论文 Figure 2:Overview of the proposed architecture with VAD conditioning.

论文图 2。原论文 Figure 2::“Overview of the proposed architecture with VAD conditioning. During training, VAD labels are randomly masked, enabling optional use of this feature at inference time.”。

图中左下输入文本经音素化得到彩色音素行,再经卷积编码器与平均上采样拉长到底部与顶部声学图对齐的长度。左侧参考音频分出两路,一路经声码器编码器得到顶部声学特征示意,一路经全局参考表示送入中间的扩散变换器。另一路经语音活动检测得到中部紫灰相间的 1 与 0 序列,与拉长后的音素行逐列对应,共同作为解码器的条件。该图说明时间约束发生在帧级别,而不是句子级别,解码器每一步都能看到当前位置是否允许出声。

说话人嵌入 × 全局风格标记: 说话人嵌入负责携带音色身份,来自预训练说话人编码器;全局风格标记负责携带韵律与情感等整体风格。搭配原因是零样本跨语言迁移需要把谁在说和怎么说分开,组合后两者通过自适应层归一化加入扩散变换器块,与语音活动的时间约束正交,使音色风格迁移不受静音位置改变的干扰。

需要提醒的是音色与风格分支不携带时间信息,时间信息只由语音活动分支携带,这种正交设计使关闭语音活动条件时仍能做普通的零样本风格迁移。

训练时监督从哪来,何时掩掉条件?

训练的监督来源是目标音频自身。同一句话的波形既提供声学重建目标,也经语音活动检测器提供帧级二值标签,模型在已知哪里该静音的条件下学习把文本内容填入有声区。关键操作是训练中对语音活动嵌入做随机掩码,包括遮掉过渡区附近帧与完全遮掉整个信号两种情形。完全遮掉等价于去掉该条件,使模型同时学会无约束合成。原文的动机是严格唇同步只在约 12% 的电影时间中出现,且非适配译文难以施加强约束,因此需要推理时可选。

优化方面原文报告全局批量、硬件、学习率与步数等条件,编码器与解码器的参数更新未单独说明冻结,梯度路径未逐层交代,复现时应按全部可训练处理,缺项如实记录为未报告,不从模型名称推定冻结。以下先整理可直接照抄的训练与模型规模条件,表中数字与单位与原文写法一致,裸值不擅自添单位,表头单位按原文保留。 比较问题是复现需要多大的批量与多大的模型宽度深度,以及无分类器引导的训练条件是否一致。

指标方向不适用,此表只用于核对实验条件是否与原文一致。

条件全局批量硬件文本嵌入维度编码器深度条件丢弃概率
原文训练配置128four NVIDIA A100 GPUs1024-dimensional embeddings8-layer ConvNeXt encoder20%

该表说明训练规模与条件丢弃设置,批量与硬件决定梯度噪声与吞吐,嵌入维度与编码器深度决定文本建模容量,20% 丢弃是推理时使用无分类器引导的前提。代价是原文未报告训练时长、显存占用与收敛曲线,不能从批量推定实际耗时,复现时需自行记录。未胜出项在此不适用,但需注意该表未包含解码器层数与注意力头数等细节,完整复现还需结合正文的 18 层与 8 头描述。

语音活动掩码 × 随机掩码训练: 语音活动掩码是训练时的真值时间监督,随机掩码训练是在训练中随机遮掉部分或全部掩码嵌入。搭配原因是严格唇同步并非所有场景都需要,组合后模型同时见过有约束与无约束两种工作状态,推理时可全给掩码强制对齐,也可全掩码关闭该功能,还可只掩码过渡区附近帧以支持后期微调。

补充一个可操作细节,推理时若只想微调边界,可只掩码语音与静音交界附近帧,保留其余帧的强约束,这对剪辑师在后期工作流中放宽或收紧唇同步是有用的。

数据、模型与测量各是什么条件?

实验设置 2 个模型,一是为可复现而在公开语料上训练的核心英文模型,二是在更大公有加私有混合数据上训练的多语言模型。评估用多语言 TEDx 语料的子集,源语言到英语,特点是半自发演讲、停顿频繁且不规则,比朗读语料更能考验时间约束。测试集经过筛选,时长与暂停均有下限,语言覆盖希腊语、法语、葡萄牙语与俄语。语音活动训练与主对齐评估用同一检测器,另用两种外部检测器做交叉验证,以排除单一检测器偏置。

主观评估招募 40 名英语母语者,每人评 12 个随机参考乘以配置,量表为 5 点李克特量表,分别评停顿位置自然度与整体韵律自然度。鲁棒性用内部语音识别算词错率,并用基准套件报可懂度与韵律分。以下整理测试集规模条件,便于核对数据口径。 比较问题是评估是否聚焦长句与大停顿,以及主观评估规模是否足以支撑自然度结论。公平条件是所有语言与所有配置共享同一筛选标准,指标方向是规模越大检验越严。

时长筛选暂停筛选评估总数语言组成主观子集
durations between 7 and 15 secondspause exceeding 500 ms291 samplesfour source languages: Greek, French, Portuguese and Russian25 samples

该表的主要收益是明确了挑战性来源,长句加大停顿迫使模型处理多次起止,而非常见的单句短语音。多语言平衡有助于观察不同源语言特征下的稳定性。代价是主观只用了 25 个样本的子集,且每人只听其中 12 个参考,结论外推到全部 291 句时需谨慎。未评测边界包括卡通、多人场景等原文动机中提到的难例并未在该表中量化,相关讨论只停留在方法动机层面。

对得准吗,自然度保住了吗?

对齐一致性用参考与合成音频之间的帧级语音活动准确率衡量。原文报告无论源语言特征如何,有约束都显著高于无约束,英文模型从约 73% 的偶然重叠提升到约 96%,多语言模型也有类似提升,多语言略低的原因原文假设为多语言数据中犹豫、笑声、喊叫与耳语等非典型发声增加了检测难度,这属于有限解释而非因果证明。为排除单一检测器影响,原文再用另外两种检测器计分,分布均显示有约束高于无约束。

静音起点与终点偏差进一步显示有约束的偏差紧紧集中在零附近,无约束则向正负两侧铺开,说明起止时刻精度确实受掩码控制。 以下导读用于确认跨检测器的一致性。上排为有约束,下排为无约束,横轴为准确率,纵轴为密度。

看图路径: 1. 先对比上下两排密度峰的位置,确认有约束峰更靠近 1;2. 再看三种颜色曲线在上排是否都集中在高准确率区;3. 最后看下排分布宽度,确认无约束时样本间差异更大

原论文 Figure 3:Comparison of the distribution density of the accuracies per sample, measured by different VAD…

论文图 3。原论文 Figure 3::“Comparison of the distribution density of the accuracies per sample, measured by different VAD models.”。

图中上排 3 种颜色的密度峰均靠近右侧高准确率区,下排峰则位于中部且分布更宽。即使检测器灵敏度不同,有约束始终更集中,这支持对齐收益不是某个检测器的自证偏置。但像素无法读出每条曲线的精确峰值,不应硬写具体数值,定量对比以表格为准。 以下导读用于确认起止时刻的精度。下分图分别显示起点与终点偏差,黄色为有约束,蓝色为无约束。

看图路径: 1. 先看左图静音起点偏差与右图静音终点偏差的横轴单位;2. 对比黄色有约束分布与蓝色无约束分布在零点附近的尖锐程度;3. 观察无约束分布向正负两侧拖尾的范围差异

原论文 Figure 4:Visualizing the deviation on the time axis of silence starts and silence ends, averaged across…

论文图 4。原论文 Figure 4::“Visualizing the deviation on the time axis of silence starts and silence ends, averaged across each sample.”。

图中黄色分布在零秒处尖锐耸立,蓝色分布则宽而扁平,并向两侧拖尾。这表明有约束把静音边界误差压到接近零,无约束的边界误差可达数秒量级。纵轴为密度而非原始误差,曲线向下不代表性能变差,需结合横轴偏离零的距离判断好坏。 主观自然度方面,位置分与韵律分在开约束后略有下降,但成对曼惠特尼检验均不显著,原文据此认为时间约束未损害感知自然度,且模型能在无显式标点约束下把停顿放在语义合理处。

以下用客观鲁棒性表核对代价,该表是原文明确的定量结果表,包含必要基线与实际可运行策略。 比较问题是有约束是否在保持可懂度与韵律的同时只付出可接受的词错率代价。公平条件是同一模型分别开关语音活动条件,指标方向是词错率越低越好,可懂度与韵律分越高越好。

ModelWERIntelligibilityProsody
LibriTTS No VAD8.5%76.8285.00
LibriTTS VAD13.9%80.5986.98
Multilingual No VAD6.3%78.9082.96
Multilingual VAD8.3%79.7286.32

表中可见英文模型词错率从无约束到有约束上升,多语言模型也有上升,但两者的可懂度与韵律基准分反而略有上升或基本持平。这说明词错率上升主要来自极端失配下的删词与重复,而非整体发音含糊。未胜出项是有约束的词错率在 2 个模型上均高于无约束,这是一个明确代价,不能只强调对齐收益。限制是词错率来自内部私有识别系统,外部无法逐字复算,只能复现趋势与相对关系。

关掉条件与换检测器会发生什么?

关掉条件的对照贯穿全文,无约束即训练中完全掩码语音活动信号的推理状态。对齐准确率回落到偶然重叠水平,静音边界偏差重新铺开,主观自然度略高但差异不显著,词错率略低。这组对照说明时间约束确实由掩码带来,而不是模型偶然学会了源语言的停顿习惯。换检测器计分的对照说明评估未被单一系统绑架,3 种检测器下有约束的密度峰均在高位。

过渡区掩码的灵活性在正文中只作为功能描述,没有单独的定量消融曲线,因此不能宣称部分掩码的最优比例,只能说该机制在训练中存在且推理时可用。另一个隐式消融是英文模型与多语言模型的对比,前者在干净朗读数据上对齐更高,后者在复杂多语言数据上略低,这支持数据复杂度影响时间精度的判断,但两者训练数据不同,不能视为同条件下的模型结构胜负。

若要补做消融,应固定数据与文本,只扫掩码比例与过渡区宽度,并同时报告帧准确率、边界偏差与词错率三者的权衡曲线。

什么情况下会删词、重复或重排?

原文用最差样本与构造例子定位了 3 种误差的触发条件。删词通常发生在译文显著超出可用时间预算时,模型优先保住停顿结构而非逐字读完,当语速超过训练分布仍不够时,会在临界阈值后省略部分句子以保住时间轴对齐。重复发生在文本内容不足以填满目标时长时,模型先降速填充,到达下界后转而重复词语来占据剩余时长,而不是继续放慢或插入错位停顿。

重排与标点显著相关,模型学到了停顿与逗号句号的强相关,当标点靠近语音活动静音区时会加速或减速相邻段去对齐,若语速调节过于极端,则通过重排文本保住边界而非移动停顿。这些分析表明精度高的前提是输入为等时适配文本,无论来自等时机器翻译还是人工润色。用未适配的标准机器翻译输出加硬约束会诱发稳定性问题,手动精修文本后可缓解。

等时机器翻译 × 语音合成渲染: 等时机器翻译负责产出时长与停顿结构适配源语言的译文文本,语音合成渲染负责把给定译文按语音活动掩码发声。分工不同但相互依赖,搭配原因是合成器只能在给定文本与给定时间预算内做语速伸缩,组合意义在于当译文过长或过短超出语速调节上下界时,合成端会以删词、重复或重排保住时间边界,此时应回头修正译文而非放宽声学模型。

因此复现失败时应先检查译文长度与标点位置,而非直接调大引导强度或解码步数。原文未来工作也指向构造专门训练数据以降低对等时翻译与人工干预的依赖,并考虑从源音频提取更细的发音与构音信息,这是未验证的改进方向,不应视为已有收益。

要复现应先准备什么,再跑哪组对照?

先准备数据与工具。训练复现可用公开语料复刻英文模型,多语言模型因含私有数据只能部分复现。评估需复刻 291 句的多语言测试集筛选逻辑,包括 7 到 15 秒时长与超过 500 毫秒停顿的阈值,以及 4 种源语言平衡。语音活动提取默认用公开检测器,其链接当前可用,另两种检测器链接中一个当前可用,评估时应保留三者交叉验证。主观评估需 40 名英语母语者、25 句主观子集、每人 48 条、5 点量表的位置与韵律双分,并用非参数检验判断显著性,原文报告 3840 条评分均分到各系统与条件。

客观需同时跑帧准确率、静音起止偏差、词错率与基准可懂度韵律分,避免只看准确率。先跑的对照应是同一模型开关语音活动条件,确认帧准确率从约 73% 到约 96% 的量级跃升与边界偏差收窄,再检查主观差异是否不显著与词错率是否上升。若对齐未提升,应检查掩码是否与声学画布等长、嵌入相加位置是否在上采样之后、推理掩码是否来自源音频而非目标文本的默认预测。若自然度明显下降,应检查译文是否等时适配,必要时先人工改写译文再评。

训练资源按原文为 4 卡与 128 全局批量,峰值学习率与衰减步数按原文记录,推理开销、输出帧率与实际延迟原文未测量,不承诺延迟改善。

何时值得尝试,还需补哪项验证?

当任务要求保留源视频的静音节奏、但不需要精确唇形对应时,该方法值得尝试,例如访谈、纪录片与演讲配音,或卡通与多人场景等唇动力学建模脆弱的场合。当译文已做等时适配或允许人工微调时收益最稳,因为模型在合理预算内能同时保住对齐与自然度。当译文完全未适配且不允许改写时应谨慎,强约束可能以删词或重复为代价保时间,此时可关闭条件做普通合成,或放宽过渡区约束。

还需补的验证包括真实配音译文下的端到端测试、不同语速上下界的定量曲线、部分掩码宽度的扫参,以及在噪声参考与非典型发声下的检测鲁棒性。代码与权重层面原文未给出可运行声明,不能写为已开源,只能依据正文的模型描述与公开语料复现核心英文模型。总体判断是二值时间骨架足以驱动高精度配音对齐,且不显著损害停顿合理性,但文本适配仍是不可绕过的前置条件。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-24 语音/音乐/音频论文速递