英文题目:YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance

会议身份:conference:interspeech:2026:conference-paper-id:hao26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #课程学习 #扩散模型 #强化学习 #歌唱生成

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Chunbo Hao:机构信息未能从会议 PDF 纯文本可靠映射
  • Junjie Zheng:机构信息未能从会议 PDF 纯文本可靠映射
  • Guobin Ma:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuepeng Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Huakang Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenjie Tian:机构信息未能从会议 PDF 纯文本可靠映射
  • Gongyu Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zihao Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

歌唱语音编辑需在保留原曲旋律与节奏的同时按改写歌词重新合成人声,难点在于歌唱数据稀少且咬字变异大,旋律忠实与歌词忠实常互相冲突,传统方案依赖人工音素级对齐而难以扩展。YingMusic-Singer 以音色参考、旋律参考歌声与改写歌词为输入,先经变分自编码器与旋律提取器得到可比帧率的声学隐变量与旋律表征,再与句子级对齐的国际音标嵌入拼接送入基于流匹配的 Transformer 去噪主干做条件补全,最后用群组相对策略优化对多奖励联合微调以兼顾两类忠实度。相比 Vevo2 的自回归加解耦表征路线,该模型用插值后的连续旋律隐变量加中心核对齐损失实现更紧的旋律约束,并用统一音标与扰动防止语义泄漏。在 LyricEditBench 中文部分替换任务的旋律控制设置下,模型音素错误率为 0.0192,显著低于 Vevo2 的 0.1378,F0 相关系数达 0.9364,验证了双重忠实度的同步提升。该结论限于 2秒至15秒的中短片段与中英文歌曲改写,对长曲结构、极端戏腔及跨语种翻译的鲁棒性尚未充分验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

要解决的编辑任务是什么?输入输出与必须保留的信息有哪些?

这篇论文研究的不是从乐谱从零作曲,而是歌声编辑。输入固定为三样:一段可选的音色参考,一段提供目标旋律的歌唱片段,以及改写后的歌词。输出是一段新的歌声,要求唱出新词,但旋律与节奏结构与旋律提供片段保持一致。必须保留的信息因此有两层,一是旋律轮廓与节奏位置,二是新歌词的音素序列。初学者容易把这个任务误解为语音转换或翻唱,关键区别在于歌词变了而旋律不能变,且用户不提供逐字时间戳。论文把是否需要手工对齐作为可扩展性的分水岭,凡是要求用户逐词标注音符时长或编辑边界的方法,在跨语种翻译与整首改写时会迅速变得不可用。

沿一个样本走一遍更直观。假设有一段中文原唱及其旋律,用户想把其中一句替换为英文翻译,同时换一个音色来唱。传统做法要先把原唱转写为音符,再把英文单词逐个贴到音符上并调时长,最后送入商业合成器。YingMusic-Singer 的做法是把原唱波形直接作为旋律条件,把英文新词作为音素条件,把另 1 人的清唱作为音色上下文,1 次生成目标音频。学习依赖是先理解这种三输入范式,再理解模型如何把 3 种异构信号对齐到同一隐变量帧率,最后才看训练如何平衡唱对词与跟准调。

已有两类编辑路线为何不够用?可比基线如何选定?

论文把现有编辑归为两类。第一类是上下文学习式修复,遮住要改的区域,用周围音频加目标歌词重新生成。这类方法使用方便,但只能改局部,且旋律控制有限,因为旋律信息主要靠上下文推断,整首替换或跨语种时上下文本身就不再可靠。第二类是实践中常用的商业合成器流程,先把原唱转成音符,再分配新词与时长后重合成。控制力强,但需要大量手工,论文明确指出其复杂度在跨语种翻译等任务中进一步上升。

近期工作试图折中。论文点名了两个系统。Vevo2 实现了无手工对齐的旋律可控生成,但报告显示其可懂度下降且旋律跟随不稳。SoulX-Singer 支持用已有歌声作旋律输入,但仍要求单词级时间戳对齐,核心负担没有解除。因此论文选择 Vevo2 作为最直接的可比基线,理由是输入条件相当且同样支持无手工对齐下的旋律控制。其他系统如需周围音频上下文加手工编辑边界,或需精确字级时间戳,则被判定为范式不同,不放在同一公平条件下比较。

上下文修复 × 人工对齐合成: 上下文修复分工是遮住待改片段并依靠前后音频推断旋律与节奏,搭配理由是无需外部乐谱即可补全局部,人工对齐合成分工是先转写为音符再逐字指定音高与时长,搭配理由是获得全曲可控性,二者组合意义在于说明现有编辑要么只改局部、要么靠手工标注,YingMusic-Singer 正是要同时摆脱局部限制与手工时间戳。

这个对照决定了后文实验的组织方式。凡是讨论优劣,都要回到输入是否相同、是否需要额外标注、是局部还是全曲编辑这 3 个条件上,而不是只看某个分数高低。

形式化一下:什么算改对,什么算跟住?

改对指生成音频经识别后能还原目标改写歌词的音素序列,论文用音素错误率来度量。选择音素而非词错误率的理由在原文有交代,歌唱相比说话语义密度低、上下文线索少、发音变异大,逐词判定过于严格且受语言模型影响,音素级更贴近发音是否准确。跟住指生成音频的基频曲线与旋律参考在帧级别相关,论文用基频皮尔逊相关系数来度量,并用声乐评分与主观旋律分作补充。

任务难点在于两者存在权衡。监督微调阶段同时优化整体隐变量重构时,引入旋律约束会提升旋律相关,但音素错误率回升。直观理解是模型容量与数据噪声有限时,保旋律的梯度与保发音的梯度会互相牵制。另一个难点是歌唱数据规模小且演唱技巧复杂,音素泛化不足,大规模数据中伴唱与质量瑕疵又会封顶模型上限。教学例子仅为帮助理解,不代表论文数值:比如把一句中文换成音节数差异很大的英文,若硬贴原节奏,模型可能吞音或拖音,这正是需要联合优化的原因。

总览:三输入如何变成一段 44.1 千赫的歌声?

在进入组件细节前,先沿主路径看清数据流向。模型在 44.1 千赫立体声下工作。左侧有 3 条支路,歌词走国际音标分词与句子对齐,歌唱波形同时走变分自编码器编码与旋律提取器,未被掩码的隐变量帧作为音色上下文。3 路表示经插值对齐到同一帧率后,与随机噪声拼接送入基于扩散变换器的条件流匹配主干,预测目标隐变量的速度场,再经由常微分方程求解器与变分自编码器解码器还原波形。右侧是强化学习分支,对同一输入采样一组候选,用多个奖励模型打分并做组内归一化得到优势,再以裁剪目标加散度约束更新策略。 下图是理解该流程的关键,建议按导读顺序观察左右两半的分工。

看图路径: 1. 先沿左侧从歌词与歌唱波形出发的三条支路看到拼接点,再跟随箭头到扩散变换器与声码器解码;2. 观察旋律支路上的插值与扰动模块与歌词支路上的句子对齐模块在何处汇合;3. 再看右侧强化学习分支中参考模型、采样组、奖励模型与优势计算的回路关系;4. 对照图例中冻结与训练中、提示歌声与生成歌声的颜色,确认哪些模块参与梯度更新

原论文 Figure 1:Overall architecture of YingMusic-Singer.

论文图 1。原论文 Figure 1:“Overall architecture of YingMusic-Singer.”。

左半是训练与推理共用的生成路径,蓝色模块中变分自编码器与旋律提取器处于冻结状态,黄色模块负责分词、对齐、掩码与扰动,深色模块是噪声与填充,红色输出是预测流。右半是组相对策略优化回路,提示歌声与生成歌声用颜色区分,奖励与优势经分组计算后以加权平均回传,虚线表示裁剪损失路径。看懂这张图,就能明白为何推理时用户只需给出三输入而无需时间戳:对齐与掩码逻辑已内化为帧级序列构造,旋律约束由提取器表示承担,歌词约束由音素序列承担。

表示与主干:编码器、旋律表示与音素序列如何对齐?

变分自编码器沿用稳定音频方案,编码器把立体声波形下采样 2048 倍得到隐变量,解码器在推理时重建高保真音频。原文给出隐变量维度为 64,旋律维度为 128,扩散变换器为 22 层 16 头、隐藏维度 1024,音素嵌入维度 512。训练时按比例随机掩码隐变量帧,被掩码部分为合成目标,未掩码部分清零填充后作为音色上下文。这种设计让自音色编辑与跨音色旋律控制共用同一机制,区别仅在于音色提示与旋律参考是否来自同一片段。

旋律提取器建立在预训练音符提取模型编码器之上,取其中间表示以获得与内容解耦的旋律信息,再时间插值到隐变量帧率。关键操作是时间丢弃扰动,训练时以 0.1 的概率对旋律隐变量做扰动,防止模型利用其中残留的语义信息走捷径。若不做扰动,模型会直接从旋律表示中推断原词而忽略新歌词,导致可懂度崩塌。歌词侧把中英文统一为国际音标离散音素序列,每个句子转为子序列并放在对应起始帧的填充帧级序列中,经可学习嵌入得到帧级表示。

推理时提示歌词放在序列开头,目标歌词放在掩码区起点,无需用户标注时间戳。条件拼接后送入条件流匹配,学习从噪声到目标隐变量的速度场。

旋律提取器 × 国际音标分词器: 旋律提取器分工是从旋律提供片段中抽取与内容解耦的旋律表示并插值到隐变量帧率,国际音标分词器分工是把中英文歌词统一为离散音素序列并做句子级对齐,搭配理由是旋律与歌词来自不同输入必须在同一时间网格上拼接,组合意义是让模型被迫用抽象轮廓保旋律、用音素序列定发音,避免直接拷贝参考音频中的原词。

条件流匹配的训练目标是预测速度与真实位移的均方误差,旋律 adherence 另由中心核对齐损失约束预测流与旋律表示的格拉姆矩阵对齐。原文明确第二阶段总损失为均方误差加权重后的中心核对齐损失,权重从 0.3 衰减到 0.01。初学者应先记住分工:均方误差管整体重构像不像,中心核对齐管旋律方向一致不一致。

单阶段联合建模与多阶段分工有何取舍?

论文采用单阶段条件流匹配同时建模音色、旋律与内容,作者强调这是为实际部署的架构简洁性。对比基线 Vevo2 采用多阶段架构,自回归语言模型负责旋律与内容生成,专用流匹配负责音色重建,分工缓解了说话人建模压力,因此在说话人相似度上占优。但代价是可懂度与旋律相关下降,且主观听感出现歌词不忠实与旋律错位。

条件流匹配 × 变分自编码器: 变分自编码器分工是把 44.1 千赫立体声波形压缩为低帧率隐变量并在推理时解码回音频,条件流匹配分工是在噪声隐变量上学习速度场并以拼接条件去噪出目标片段,搭配理由是前者提供紧凑可掩码的声学空间、后者提供条件生成机制,组合意义是掩码区域重唱、未掩码区域作音色上下文的编辑范式得以在隐变量层面实现。

这个取舍需要在复述时讲清因果方向。单阶段不是在所有指标上都赢,而是在编辑任务首要关心的改对词与跟住调上赢,在音色相似度上让步。评价时不能把音色相似度单独拿出来判定胜负,而要回到任务定义:歌词编辑的首要矛盾是新词与旧调的兼容,其次才是像谁唱。

课程学习三步与强化学习一步各解决什么?冻结与更新如何安排?

训练分为语音预训练、歌唱监督微调 2 阶段加一组相对策略优化。语音预训练不用旋律条件,在中英文语音数据上建立发音先验。监督微调第一阶段在歌唱数据上启用句子级对齐但关闭旋律条件,让模型适应歌唱域并自由从上下文生成旋律。第二阶段开启旋律提取器并引入中心核对齐损失,显式要求旋律跟随。原文报告第一阶段音素错误率最低,第二阶段旋律相关升至 0.92 以上但音素错误率回升,这正是后文需要强化学习的原因。

组相对策略优化把确定性常微分方程轨迹转为受限随机微分方程,只在有界窗口内引入随机步以保证优势归因准确。组大小为 8,每个样本由 4 个等权重奖励模型打分,优势为各奖励的组内标准化加权和,损失为裁剪代理目标加散度正则。优化步数短、学习率小,且推理时不用无分类器引导的强化配置,推理用 32 步常微分方程步数与 3 倍引导尺度。原文未逐层列出哪些参数冻结,仅从架构图例可知变分自编码器与旋律提取器冻结、扩散变换器训练,未报告梯度是否回传提取器或分词器,复述时不应自行推定。

课程学习 × 组相对策略优化: 课程学习分工是先做无旋律语音预训练建立发音先验,再做 2 阶段歌唱微调逐步引入旋律约束,组相对策略优化分工是在线采样一组候选并用组内奖励统计算优势做强化学习,搭配理由是监督微调只能整体重构、难以定向补齐歌词与旋律短板,组合意义是用监督打底解决领域适配,再用多奖励强化学习同时拉回歌词准确率并推高旋律 adherence。

下表把训练配置按阶段整理,便于对照步数、批量时长与学习率,旋律条件列标明何时引入约束。

阶段步数批量时长学习率旋律条件
语音预训练1M 步1.268 小时1e-4关闭
歌唱微调第一阶段240K 步1.69 小时2.5e-5关闭
歌唱微调第二阶段170K 步1.69 小时2.5e-5开启并加对齐权重
组相对策略优化1.2K 步批量大小 67e-6保持开启
推理32 步不适用不适用开启

该表显示课程从易到难,先解决唱清楚,再解决跟住调,最后用强化学习同时保住两者。注意第二阶段对齐权重在前 21,000 步内从 0.3 衰减到 0.01,说明强约束只用于早期引导,避免后期过度压制发音。硬件条件为 8 卡 80 吉显存并行加半精度,掩码比例在全阶段为 70% 至 100% 随机。

数据、基准构造与评价指标如何保证可比?

语音预训练用 Emilia 数据集的中英文子集。歌唱监督微调数据来自内部授权音乐,经结构切分剔除非人声,再经人声分离保留 2 至 30 秒片段,较长者按句切分,最终约 33562.6 小时。强化学习数据经三重过滤,只保留词错误率低于 5%、单说话人、质量分高于 3.5 的约 20240 条,且中英文均衡,测试集严格排除在训练之外。初学者应注意内部歌唱数据的可获得性是复现门槛,论文未声称该部分已公开。

评价基准 LyricEditBench 基于 GTSinger 构建,移除配对语音组内容,按哈希去重并剔除超 15 秒片段,再用大语言模型按 6 种改写类型生成新词,丢弃不合规输出后得 11535 条有效样本。每种组合按演唱技巧与无技巧类别采样,每类每改写类型 300 条,共 7200 条测试。每条含旋律参考、至多 15 秒音色提示与改写歌词。6 种类型为部分替换、全文替换、删除、插入、翻译与语码混合,覆盖从小改到跨语种的难度谱系。

客观指标有 4 个,音素错误率越低越好,说话人相似度越高越好,基频相关越高越好,声乐评分越高越好。主观指标为自然度与旋律忠实度,均 5 分制,由 30 位听众对 120 条跨类型跨语言样本打分。转写用歌唱训练的识别模型并去声调转音素,说话人嵌入用大模型验证模型余弦相似,基频用鲁棒估计算法提取。

下表整理基准规模与听测条件,便于核对聚合对象与采样口径。

对象规模采样规则语言与性别评价方式
有效改写池11535 条模型生成后过滤中英文男女 4 类不适用
正式测试集7200 条每类型每类 300 条中英文男女 4 类客观四指标
技巧分层每技巧 30 条加无技巧 120 条按歌手技巧分层覆盖 6 种技巧保证多样
主观听测集120 条跨类型语言均匀抽样中英文30 人打分
音色提示至多 15 秒从剩余池随机抽取与测试不重叠自与跨音色两任务

该基准的价值在于旋律条件相同而歌词不同,迫使模型证明其在同一旋律下重唱不同词的能力。复述时要强调自音色编辑与跨音色旋律控制是两种任务,前者音色与旋律同源,后者替换音色参考,条件不一致时分数不可直接比较。

主结果:在改对词与跟住调上是否同时超过可比基线?

论文报告在 6 种改写类型、中英文、自与跨音色两种任务下,新方法在音素错误率、基频相关与声乐评分上一致优于 Vevo2。差距在翻译与语码混合上最显著,说明当音素序列大幅变化而旋律不变时,联合音素建模加强化优化的鲁棒性优势被放大。基频相关方面,新方法跨任务保持高位稳定,基线波动较大,支持旋律控制更稳的判断。说话人相似度是唯一未胜出的维度,基线因多阶段分工在该项占优,但以牺牲前两项为代价。主观上新方法在自然度与旋律分上均更高,且方差更小,基线被听出歌词不忠实与旋律错位,说明强化学习未过拟合到奖励模型而是泛化到人耳。

音素错误率 × 基频相关性: 音素错误率分工是经歌唱语音识别转写后度量改写歌词是否被唱对,基频相关性分工是比较生成与参考基频曲线的帧级皮尔逊相关以度量旋律是否跟住,搭配理由是歌词编辑必须同时考核内容与旋律两个正交维度,组合意义是只看其一会掩盖另 1 维的退化,论文因此坚持两个指标同升才算解决权衡。

需要提醒的是语码混合的音素错误率可能被识别模型在中英文混排上的幻觉推高,因此跨类型绝对值不宜直接排名,而应看同类型下与基线的相对差距。总体趋势不等于每组都同等提升,翻译任务的绝对错误率仍高于替换与删除,表明大幅改写仍是困难模式。

下表用原文明确报告的训练与推理超参数及阶段性效果锚点,说明结果是在何种可运行配置下取得,避免把搜索最优当作部署收益。

环节关键配置优化目标报告效果可运行性
监督微调前语音先验无旋律发音先验基频相关接近零可运行
监督微调后旋律约束开启旋律跟随基频相关高于 0.92可运行
强化学习8 候选 4 奖励多维联合错误率回落且旋律再升可运行
推理32 步 3 倍引导稳定解码主客观同升可运行
基线对照同输入无手工对齐同任务未胜出音色项但输内容旋律可运行

该表不支持逐格精确分数对照,精确到小数点后 4 位的完整对照表在原文以宽表形式呈现,但本次证据未提供可绑定的结构化矩阵,因此此处只用连续原句可验证的阈值与配置作条件核对,详细数值差异以原文表格为准,不在此转抄未经逐字验证的小数。

消融:哪一步带来哪部分增益?拿掉扰动与对齐会怎样?

课程消融显示阶段分工清晰。语音预训练只建立发音先验而无歌唱能力,基频相关接近零,且以歌唱片段作上下文提示时错误率显著恶化,说明领域失配。微调第一阶段各项大幅改善并取得最低音素错误率,自音色下基频相关略升,表明仅靠上下文能部分捕捉旋律但不足以忠实再现。第二阶段开启旋律提取器后基频相关升至 0.92 以上,代价是错误率上升,证实权衡存在。强化学习阶段在说话人相似度不变下同时恢复错误率并进一步提升基频相关与声乐评分,支持多奖励联合优化缓解了权衡。

两个关键模块消融进一步定位机制。去掉中心核对齐,基频相关回落,说明该损失确在推旋律对齐。去掉旋律隐变量的时间丢弃扰动,可懂度严重退化,原文解释是未扰动表示残留语义信息,模型学会走捷径而不再真正依据新歌词生成。扰动迫使模型依赖抽象轮廓而保留韵律结构,同时允许自由生成改写词。这个反证比正向增益更重要,它说明旋律解耦不是靠模型结构自动获得,而是靠扰动切断语义泄漏实现的。

复述时不要把消融理解为拿掉后必然在所有语言上同等退化,原文分中英文报告,中英文基线水平与提升幅度不同,但方向一致。未报告的缺项是各奖励模型的权重敏感性与裁剪阈值的扫描,论文只给出等权重与固定窗口,复现时若改动需重新验证。

边界与代价:哪些情况仍难,哪些量没有被测量?

首先是任务边界。翻译与语码混合仍是错误率最高的两种类型,即使相对基线大幅领先,其绝对难度依然显著。删除与插入涉及音节数变化,需要模型在固定旋律时长内压缩或延展,极端时长失配下的稳定性未单独量化。其次是音色相似度的让步,单阶段联合建模为简洁性付出了说话人建模压力,应用若以音色克隆为首要目标,则需权衡是否采用多阶段方案。

其次是未测量量。论文未报告推理延迟、实时率、显存占用随音频长度的变化,也未报告误判率或安全水印。训练资源只给出卡数与步数,未给出总时长与能耗,部署成本不能从参数量直接推定。数据侧内部歌唱数据的授权与清洗流水线难以完全复刻,强化学习过滤依赖识别、说话人日志与质量分的阈值,阈值外的数据行为待验证。最后是资源可用性声明,原文称代码权重基准与演示在指定链接公开,但本次收到的资源状态中没有完成超文本传输协议状态验证的绑定资源,因此不能在此断言当前可用或已公开,复现前需自行确认链接可达性。

若要复现,先做什么、用什么超参数与信息条件?

先准备三输入管线。收集一段旋律参考歌声、一段至多 15 秒音色提示与改写后歌词,把中英文歌词转为国际音标序列并按句对齐到帧级,旋律波形经冻结提取器加插值到隐变量帧率,隐变量按 70% 至 100% 随机掩码。主干按 22 层 16 头隐藏 1024 配置搭建,隐变量 64 维、旋律 128 维、音素嵌入 512 维。优化按语音预训练 1,000,000 步批量 1.268 小时学习率 1e-4,歌唱微调第一阶段 240,000 步关闭旋律,第二阶段 170,000 步开启旋律且对齐权重前 21,000 步从 0.3 衰减到 0.01、批量 1.69 小时学习率 2.5e-5 的顺序推进。强化学习用组大小 8、4 奖励等权、噪声 0.8、窗口下限 1 上限 8、上下截断 0.01 与 0.002、散度系数 1,优化 1200 步批量 6 学习率 7e-6,推理用 32 步与 3 倍引导。

验证先做两件事。一是检查无扰动时是否出现可懂度崩塌,以确认语义泄漏路径已被切断。二是检查第二阶段后基频相关是否过 0.92 而错误率是否回升,以确认进入需要强化学习的权衡点。再补一项验证是跨语种长句的时长适配,观察是否出现吞音或拖音。常见误解是把冻结提取器当作输出确定,实际上冻结只意味着参数不更新,生成仍受采样随机性与引导尺度影响。另一个误解是把音色相似度低当作模型失败,在编辑任务中应优先看改对词与跟住调,再看音色。

何时值得尝试这种方法?一句话收束

当任务要求在保留原旋律下整首改词、尤其是跨语种本地化与个性化翻唱,且不能承担逐词时间戳标注时,这种三输入加解耦旋律表示的方案值得尝试。它的适用条件是能提供干净的旋律参考与足够的歌唱数据做课程适配,并接受单阶段模型在音色相似度上的让步。若只有局部 sửa vài chữ 且有精确边界,上下文修复类方法更轻。若追求极致音色克隆且不在意标注成本,人工对齐的商业流程仍有优势。

收束为可复述的方法句。输入为可选音色、旋律歌声与改写歌词,经统一音素与解耦旋律对齐到同一帧率,由掩码条件流匹配生成目标隐变量并解码,先经语音到歌唱的课程建立发音与旋律能力,再经组内归一的多奖励强化学习同时保住歌词与旋律,最终在无手工对齐条件下实现可控重唱。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总