英文题目:Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

标签:#语音合成 | #流匹配 | #语音克隆 | #多语言

评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5

👥 作者与机构

  • Sanyuan Chen:FAIR at Meta
  • Min-Jae Hwang:FAIR at Meta
  • Sho Inoue:FAIR at Meta
  • Anna Sun:FAIR at Meta
  • Bokai Yu:FAIR at Meta
  • David Kant:FAIR at Meta
  • Dongmin Hyun:FAIR at Meta
  • Dorian Desblancs:FAIR at Meta
  • Gregory Antonovsky:FAIR at Meta
  • Oleg Repin:FAIR at Meta
  • Peng-Jen Chen:FAIR at Meta
  • Xutai Ma:FAIR at Meta
  • Zehai Tu:FAIR at Meta
  • Juan Pino:FAIR at Meta
  • Wei-Ning Hsu:FAIR at Meta

📌 核心摘要

针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入什么、改变什么、保留什么、输出什么?

这篇论文要解决两类语音生成任务。第一类是跨语言配音:输入是一段源语言语音和一句目标语言文本,要求输出目标语言语音,同时保留源说话人的音色、韵律和情感。第二类是全双工对话合成:输入是按时间排好的双人文本,要求输出双声道对话音频,两个声道各对应一个说话人,能自然出现抢话、重叠、语气词和停顿。

教学示例可以帮助定位难度。假设有一段 30 秒的西班牙语采访,要生成英语配音。系统不能只把英文读正确,还要让听众觉得还是同一个人、情绪衔接得上。另 1 例是给定一段 1-2 分钟的双人剧本,系统要用多扩散生成左右声道各一路的对话,而不是先逐句合成再拼接。这两个例子都标为教学示例,不是论文的实验脚本。

论文把配音看作跨语言零样本合成:训练数据大多是单语独白,推理时却要用源语音做提示去讲另一种语言,训练与推理存在语言错配。对话合成的难点在于联合建模上下文与轮次动态,逐句拼接难以学到自然的接话与伴随性反馈。Text-AB 的目标就是用同一套无对齐潜扩散框架同时覆盖这两类任务。

已有路线卡在哪里,Text-AB 站在哪条线上?

零样本语音合成近年有 3 条主线。基于离散编码的语言模型把语音变成编码器词元再做条件语言建模,能吃大规模数据并做提示泛化;基于扩散或流匹配的非自回归模型直接预测连续潜变量,推理更稳定快速;Audiobox 一类工作用流匹配做语音填充,在零样本与修复任务上表现强。Text-AB 明确延续 Audiobox 这条线,但换了表示、去掉了对齐器、放大了规模。

配音的工业常见做法是级联管线:语音识别转写源语音,机器翻译得到目标文本,再由语音合成生成目标语音。在识别与翻译都很强之后,合成成为瓶颈。早期做法是为每个说话人单独训练,或显式抽取音色风格再条件生成;近期做法是直接以源语音为提示做隐式保留。论文属于后者,把配音建模为跨语言零样本问题。

对话合成常见做法是每轮独立合成再拼接,单轮质量高但轮次衔接生硬。近期有自回归双塔或单通道整体生成,也有非自回归流匹配做立体声的尝试,但要么缺零样本提示能力,要么数据与规模偏小。Text-AB 的定位是用 3B 参数与数万小时双声道数据,同时支持零样本提示与双声道全双工生成,并用显式情感嵌入扩展到情感对话。

为什么时长预测与强制对齐会成为瓶颈?

传统做法需要先知道每个字发多长。训练时长预测器要靠强制对齐器给出伪标签,推理时先预测时长再把文本按帧展开。如果对齐器在噪声大、口语化强的语音上出错,误差会直接进入声学模型。回归式时长预测器还容易欠拟合,把韵律压平,表达力受限。

跨语言配音把这个问题放大。预训练是英语与西班牙语各自的独白,推理却是用西班牙语提示讲英语,或反过来。模型必须在没见过该说话人讲目标语言的情况下迁移音色。如果训练时掩码方式与推理时的整句掩码不一致,模型也难以泛化。

长对话还有长度与身份两重约束。训练样本多为 1 分钟以内,1 次生成超过约 1 分钟后质量明显下降,直接拼接多个 1 分钟片段会在边界出现可闻断裂;若提示只固定一个声道,多块之间另一声道的身份会漂移。这些约束决定了后文的掩码设计、上下文置零与多扩散策略。

Text-AB 整体做了什么:从文本与提示到双声道潜变量

Text-AB 有两个变体。Text-AB-Mono 生成单声道,用于配音与预训练;Text-AB-Stereo 生成双声道,用于全双工对话。后者可看作前者在输入输出投影上扩展为 2 通道,文本侧把双人转写按时间排序并插入说话人标记后统一编码。

为理解数据流,现在看架构总览图。它把文本、音频上下文、加噪潜变量与语言标识放在同一帧序列上拼接,再经 DiT 主干预测速度场,最后用常微分方程求解器得到潜变量并解码为波形。单声道与双声道的区别主要在拼接宽度与输出投影数。

看图路径: 1. 先沿底部三行输入到顶部预测速度的主路径,区分单声道与双声道的拼接位置;2. 再看左侧文本分支如何经交叉注意力进入中间 DiT,而不是先展开时长;3. 对照左右两图,确认双声道如何把两路音频按通道拼接、两路文本按时间排序拼接

原论文 Figure 1:The architectures of Text-AB: (a) Text-AB-Mono and (b) Text-AB-Stereo.

论文图 1。原论文 Figure 1::“The architectures of Text-AB: (a) Text-AB-Mono and (b) Text-AB-Stereo.”。

左图单声道分支底部有三行:音频上下文、加噪潜特征与语言标识嵌入,分为左侧上下文区与右侧掩码区,经通道拼接与输入投影进入中间绿色 DiT 模块,文本经交叉注意力侧向进入,右侧给出流时间,顶部输出预测速度。右图双声道分支把两路音频按通道拼宽,文本侧先把两句话按时间排序拼成带说话人标记的统一转写,再进入同一 DiT 结构,顶部输出两路速度。这种画法改变了判断:对齐不再是预处理步骤,而是生成过程中每帧主动检索文本的结果;双声道不是两个独立模型,而是同一模型在通道维联合预测。

表示与主干:DAC-VAE 潜变量、mT5 文本与 DiT 如何分工?

音频表示用 DAC-VAE 把 48 kHz 波形压成 25 Hz、128 维潜序列。白话说,它是先压缩再生成的压缩器:压缩器负责降采样与保真,生成器只在短潜序列上工作。论文报告其压缩比高于此前 EnCodec 表示,同时支持更高采样率与更好的重建质量,这为长音频生成省了序列长度。

文本侧直接消费原始文本。mT5 文本编码器(一种多语言文本编码器)输出高层文本嵌入,经交叉注意力注入 DiT 各层。语言控制另用帧级语言标识嵌入,与音频上下文和加噪特征按通道拼接。训练与推理都把上下文区的语言标识置零,避免单语训练时上下文与目标语言恒一致、而跨语言推理时不一致带来的错配。

强制对齐 × 交叉注意力: 强制对齐负责先用外部对齐器给出每个文本 token 对应多少帧语音,再按时长展开文本去指导声学模型,分工是提供显式时长;交叉注意力负责让声学帧在每层以查询方式加权全部文本嵌入,自己学出该看哪个字。搭配原因是强制对齐误差会向后传递,尤其在噪声大、口语化强的会话语音上 hurt 性能,组合后新增的含义是去掉强制对齐与时长预测器,只保留交叉注意力承担对齐,把时长不确定性交还给生成过程。

DAC-VAE × 潜扩散: DAC-VAE 负责把 48 kHz 波形压成 25 Hz、128 维连续潜序列,分工是保真压缩与降采样;潜扩散负责在这组短序列上做流匹配生成,分工是建模分布与去噪。搭配原因是直接在高采样率波形或高帧率特征上做扩散序列太长,组合后新增的含义是生成器只在低帧率潜空间预测速度场,再由解码器恢复高采样率音频,兼顾压缩率与重建质量。

DiT 主干的每块用流时间嵌入做调制:归一化层的缩放与偏置、自注意力与前馈输出的缩放,共 6 个调制参数由共享多层感知机预测,仅加层相关偏置以省参数。输入侧把音频上下文、加噪潜变量、语言标识按帧拼接;输出侧经投影预测掩码区的速度。这种设计把可学习参数集中在生成器,文本编码器作为现成编码器提供语义条件。

训练目标到底在学什么速度?

流匹配的直觉是学一条从噪声到数据的运动方向。训练时对每个真实潜变量采样一个时间步与高斯噪声,按线性插值构造中间带噪样本,模型预测该点的速度向量,目标是最小化预测速度与真实速度的均方误差。推理时从纯噪声出发,按预测速度走固定步数即得目标潜变量。时间步 t 在[0,1] 内从 logit-normal 分布采样,最小噪声系数取极小值以保证路径稳定。

\[\mathcal{L}_{\text{FM}}(\theta)=\mathbb{E}_{t,\mathbf{X}_{0},\mathbf{X}_{1},\mathbf{C}}\left[\left\|u(\mathbf{X}_{t},\mathbf{C},t;\theta)-\mathbf{V}_{t}\right\|_{2}^{2}\right].\]

上式中 X1 是真实潜变量,X0 是高斯噪声,Xt 是插值后的带噪样本,Vt 是真实速度,u 是模型在条件 C 与时间 t 下的预测速度。损失只在掩码区计算速度误差,上下文区不提供优化信号。一个细节是上下文置零:训练时上下文区的带噪特征由真实语音插值得到,推理时却来自前一步模型预测,若模型从未被优化去预测该区速度,误差会逐步累积。做法是在训练与推理都把带噪特征的上下文区置零,所需上下文只由辅助音频上下文提供。语言标识的上下文区同样置零,以应对跨语言推理时的语言切换。

流匹配 × 常微分方程求解: 流匹配负责训练阶段给出学习目标,从高斯噪声到真实潜变量构造线性插值路径并让模型预测该路径速度;常微分方程求解负责推理阶段执行,从随机噪声出发按预测速度用欧拉法走固定步数得到目标潜变量。搭配是因为训练只学局部速度而不学一步映射,组合后新增的含义是训练与推理通过同一速度场衔接,步数成为质量与速度的显式旋钮。

多扩散 × 立体声提示: 多扩散负责把长目标切成有重叠的短块独立生成,再在每个常微分方程步骤对重叠帧速度做加权平均,分工是消除块边界不连续;立体声提示负责在每个块里固定两个声道的说话人身份,分工是提供身份锚点。搭配原因是空提示或单声道提示下多块之间未固定声道的身份会漂移,组合后新增的含义是先生成一段双人都出现的初始块作为立体声提示再做多扩散,才能同时保证长时连贯与身份稳定。

三段训练与两种推理如何真实跑起来?

训练分 3 段。先在大规模单语独白上做语音填充预训练,随机掩码潜特征并预测掩码区速度;再做配音监督微调,改用句子级掩码并混入跨语言合成数据;最后分支为对话微调与情感对话微调,分别在双声道数据与带情感标注数据上训练。配音微调与对话微调都是从预训练 Mono 模型分支微调得到,并非必须先配音再对话的串行链条。

对话分支初始化只改输入输出投影,把投影矩阵复制为 2 通道并把输入投影权重除以 2,以保持投影后特征分布与预训练一致。情感分支另把 turn 级效价唤醒支配度向量经线性层映射后与文本编码输出拼接送入交叉注意力。

推理分 1 次生成与长时生成。1 次生成最多约 1 分钟,超过后质量明显下降。2 分钟剧本属于长时多扩散范畴,不是 1 分钟外仍用 1 次生成。长时生成用多扩散:把长目标切成有重叠的块,每块独立跑模型,在每个求解步骤对重叠帧的速度做加权平均,从而消除边界伪影。该机制只在立体声提示下有效,否则未被提示固定的声道会在块间漂移,补救是先生成一段双人都说话的初始块再作为立体声提示。

为确认提示与分块的执行顺序,现在看两张推理示意图。第一张区分空提示、单声道提示与立体声提示的身份继承关系,第二张展示重叠分块与每步合并的位置。

看图路径: 1. 从下往上看目标音频与音频提示的输入位置,区分空提示、单声道与立体声三列;2. 观察顶部输出的双圆点颜色,判断哪个声道继承了提示音色、哪个是随机音色;3. 结合中间绿色模块标注的 ode_steps,确认三种设置共用同一求解循环

原论文 Figure 2:One-Shot inference with different audio prompts.

论文图 2。原论文 Figure 2::“One-Shot inference with different audio prompts.”。

上图左列空提示从全空目标出发,顶部两路输出均为随机音色;中列单声道提示左侧有蓝色单通道提示,顶部一路继承蓝色、另一路随机;右列立体声提示左侧双色提示对应顶部双色输出,身份分别保持。中间绿色模块标注对时间步循环执行固定步数,说明三者共用同一求解器,只是提示提供的身份约束不同。默认推理都用 32 步求解器,配音用 32 候选,对话用 4 候选,情感用 64 候选,长时默认 30 秒块加 20 秒重叠。

看图路径: 1. 先看底部目标音频被切成的三个重叠框,数出重叠帧的位置;2. 再看中间三个并行模块如何在每个求解步骤输出各自块的速度;3. 最后看顶部经 Merge 后的黄色背景重叠帧,理解加权平均发生在速度层面

原论文 Figure 3:Illustration of multi-diffusion.

论文图 3。原论文 Figure 3::“Illustration of multi-diffusion. A target audio of 13 frames is split into 6, 7, 5 frames, with 2 and 3 frames overlapping.”。

上图底部是音频提示与被切成重叠框的目标音频,中间 3 个并行模块各自处理一块,顶部经 Merge 得到完整序列,黄色背景的重叠帧由多块贡献加权平均。关键是合并发生在每个求解步骤的速度层面,而不是最后对波形做交叉淡化,因此边界处的时间一致性更好。这两张图共同说明复现时应先固定提示类型,再决定是否启用多扩散。

数据、划分、指标与推理配置如何统一?

数据规模是理解结论的前提。下面第一张表把 3 段训练的数据构成放在一起,便于核对预训练与微调的数据量级差异。表前的问题是:预训练吃多少单语独白,配音微调与对话微调各加了什么数据,训练预算如何分配。

阶段初始化数据构成总量训练预算
预训练从零开始380k hours 英语独白加 100k hours 西班牙语独白480k hours800k steps,256 A100
配音微调预训练 Mono 分支多句单语加 50 hours 跨语言合成2.1k hours200k steps,256 A100
对话微调预训练 Mono 分支英语双声道全双工实录28k hours1M steps,256 A100
情感对话微调预训练 Mono 分支双声道加 turn 级 VAD 标注沿用对话配置沿用对话配置

上表总量与构成的依据是原文连续表述,预训练总量与英西拆分、配音混合后总量、对话双声道总量均有明确句子支撑。需要补充的是配音微调包含约 2k 小时多句单语与 50 小时英西双向跨语言数据,对话微调为两说话人分通道实录。情感对话微调沿用对话配置,另加 turn 级效价唤醒支配度标注。

评估协议分三块。配音用内部真实基准,含 100 条英译西与 100 条西译英;对话用短集约 30 秒的训练 held-out 对比真值,加 1-2 分钟长文本对比内部系统;情感对话用内部大语言模型生成 200 段带 turn 级情感标签的多轮文本。客观指标为词错率越低越好、说话人相似度越高越好、音频美学分越高越好。

情感另看轮次对齐、情感准确率与大模型自然度打分。主观配音用负 3 到 3 的偏好分,对话用人似度 1 到 5 分。

推理配置的统一条件如下表,回答不同任务默认用多少求解步数、多少重排候选以及长时分块尺寸。表前的问题是:配音、对话与情感对话的默认步数与候选数有何不同,长时多扩散何时启用。

任务求解步数重排候选数长时分块重叠
配音评估32 ODE steps32不启用 1 次生成约 1 分钟不启用
对话评估32 ODE steps430 s chunk size20 s chunk overlap
情感对话评估32 ODE steps64不启用不启用
长时多扩散默认32 ODE steps430 s chunk size20 s chunk overlap

上表说明默认推理都用 32 步求解器,区别在重排候选数与是否启用多扩散。配音重排数大,对话默认只用 4 候选以控成本,长时默认 30 秒块加 20 秒重叠。说话人相似度筛选保留至少为当前候选最大相似度 75% 的样本,再在其中选词错率最低者,情感任务另加轮次对齐与情感准确率加权,阈值是相对最大值的比例而非绝对 0.75。

主结果:配音与对话各赢在哪里、没赢在哪里?

配音与对话的主张需要分开检验。下面这张表把可由正文连续句子直接支撑的关键增益放在一起,统一比较对象、量表方向与运行阶段。表前的问题是:在各自公平基线下,Text-AB 的净收益与未胜出项是什么,端点值是否同时给出。

任务比较对象指标方向关键数字单位
配音可分享性西译英最新内部配音模型偏好分越高越好+0.40[-3,3]
配音可分享性英译西最新内部配音模型偏好分越高越好+0.38[-3,3]
短对话人似度差距真实录音差距越小越好-0.09[1,5]
长对话人似度增益内部对话系统增益越高越好+0.86[1,5]

上表显示配音在可分享性上相对内部模型有约 0.4 量级的偏好增益,短对话与真值的整体人似度差距仅约 0.09,长对话相对内部系统增益约 0.86。必须同时看真实端点而非只有差值:短对话人似度 Text-AB 为 4.53,真值为 4.62;长对话 Text-AB 为 3.86,内部系统为 3.00。这些数字支持论文关于配音阶跃提升与短对话接近真值的表述,但不能推出翻译准确率同样大胜。原文细粒度配音表中翻译准确率增益仅 0.02-0.03,说明内容传达改进有限,主要赢在韵律相似、音色相似与自然度。

未胜出项同样重要。长对话细粒度中非语音发声与填充词一项,Text-AB 为 4.12,落后于内部模型的 4.57,论文归因于训练会话与评估脚本的内容域错配。这提示人似度总分领先不等于所有维度领先,复现时若只看总分会掩盖填充词建模的短板。情感对话上,带情感条件的模型在情感一致性上优于无条件版本,愤怒、快乐、悲伤的语音情感识别准确率分别为 0.814、0.428、0.479,快乐与悲伤绝对值仍低于愤怒。自然度方面要分开评估器:合成情感文本下大模型打分带情感条件为 3.653,略低于无情感条件的 3.680,而人工 MOS 为 3.866,高于无条件的 3.090,不能说全面变好。

消融:规模、数据与重排候选各自贡献多少?

重排策略是可部署收益的关键。下面这张表对比无重排基线与 32 候选重排的客观分数,回答花更多推理计算换多少词错率与音色相似度。表前的问题是:多阶段重排的筛选规则是什么,候选数增加带来多少可运行收益。

策略词错率说话人相似度筛选规则候选数
1 候选无重排基线4.05%0.66直接输出1
32 候选多阶段重排2.20%0.74先留高相似再选低词错32
对话默认重排未报告未报告75% 最大相似度阈值4
情感对话重排未报告未报告加轮次与情感加权64

上表最公平的净收益是配音在 32 候选下词错率从 4.05% 降到 2.20%,说话人相似度从 0.66 升到 0.74,说明多样性采样加客观重排同时改善内容与音色。筛选规则是先保留说话人相似度至少为当前候选最大值 75% 的样本,再选词错率最低者。代价是推理成本随候选数线性增长,对话默认只用 4 候选正是成本折中。不能由这张表推出候选数越大无限越好,原文曲线显示超过 8 候选后增益趋缓。

规模与初始化的证据来自对话消融图与配音规模表。配音从 300M 到 3B 内容与音色持续提升;对话中 3B 显著优于 300M,从预训练初始化远优于从零训练,训练步数增加持续改善,3B 加预训练在 500k updates 已接近真值的内容、音色与质量。多扩散配置上 30 秒块加 20 秒重叠在四指标间取得最好折中,增加求解步数与候选数改善词错率与美学分但推高实时系数,音色相似度相对不敏感。跨语言数据的权衡必须保留:单语微调后加入跨语言合成数据,词错率从 3.16% 降到 2.72%,但说话人相似度从 0.73 降到 0.60,内容与音色存在负向权衡。

边界:哪些结论不能从现有对照推出?

首先是语言覆盖。预训练与配音评估只涉及英语与西班牙语,对话微调为英语双声道,不能推出该方法在更多语言或远距离语言对上同样有效。跨语言微调仅 50 小时合成数据,论文报告加入后内容与质量提升但说话人相似度下降,说明跨语言保真存在权衡,未给出该权衡随数据量变化的曲线。

其次是长度与评估方式。1 次生成约 1 分钟以上质量明显下降,长时依赖多扩散与立体声提示;长对话人工评估为防疲劳只随机裁一段 1 分钟片段标注,单片段是否代表整段一致性尚不能判断。客观词错率依赖大模型转写,在重口音、低质量或噪声下本身会出错,不能等同于真实可懂度。

最后是情感与填充词。情感准确率用语音情感识别模型与大模型打分自动评估,再辅以人工对齐分,不同评估器之间的一致性未充分报告,大模型自然度与人工 MOS 在情感条件下方向并不完全一致。长对话填充词落后提示内容域敏感,换域后结论可能变化。这些边界意味着复现时应先固定语言、时长与评估器,再谈增益。

复现先做什么:可运行的最小步骤与待核对变量

若要复现,建议按依赖顺序先跑通单声道配音,再扩展到双声道对话。第一步准备 DAC-VAE 潜特征与 mT5 文本嵌入,确认 25 Hz 帧率与 128 维、文本未经强制对齐展开;第二步实现流匹配训练循环,时间步从 logit-normal 采样,损失只在掩码区计算速度误差,上下文区带噪特征与语言标识置零;第三步先做句子级掩码微调,再混入少量跨语言合成数据,观察词错率下降与音色相似度回落的权衡点。

对话分支需先改输入输出投影为双通道并将输入投影除以 2,再把双人转写按时间排序加说话人标记后统一编码。推理先用空提示、单声道提示、立体声提示三档验证身份继承是否符合预期,再启用 30 秒块 20 秒重叠的多扩散,并在每个求解步骤合并重叠帧速度。重排实现为多随机种子生成,先按当前候选最大相似度的 75% 过滤,再选词错率最低者,对话默认 4 候选、配音 32 候选、情感 64 候选。

常见误解有三。其一以为去掉对齐器就是去掉文本控制,实际控制仍在,只是从显式时长展开变为交叉注意力检索。其二以为损失只在掩码区计算就等于上下文路径无梯度,实际上下文仍经音频上下文进入模型,只是带噪特征的上下文区被置零。其三以为候选数越多总分越高,实际超过一定数量后增益趋平而成本继续上升。若复现偏离预期,优先核对掩码方式、上下文置零、提示声道数与评估器版本,而非先调大模型。

何时值得尝试:收束判断与下一步验证

当任务是英西双向配音且有源语音提示,或需要双声道全双工对话数据且能接受 32 步求解加多候选重排的成本时,Text-AB 的路线值得尝试。它的核心判断是把对齐不确定性与时长建模交还给潜扩散生成过程,用数据规模与重排换质量,用多扩散换长度。短对话接近真值、配音可分享性领先的证据支持这一判断,但翻译准确率小幅提升与填充词落后提醒收益并不均匀。

下一步最需要补的验证是跨语言数据量与音色保持的权衡曲线、多语言扩展后的对齐稳定性,以及长对话整段一致性而非单片段的评估。若资源有限,可先验证 32 候选重排在自有配音集上的词错率与相似度变化,再决定是否投入 3B 规模与 28k 小时级对话微调。开源代码、可下载权重与可运行系统是 3 种不同状态,论文未给出明确开源承诺,复现应按自有数据与算力规划。

📎 论文与评分元数据

排名:前50% | 文档类型:模型报告 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-04 语音/音乐/音频论文速递