英文题目:Morpho-VITS: Variational Inference with Morphological Modeling for End-to-End Speech Synthesis of a Tonal Bantu Language

标签:#文本到语音 | #变分自编码器 | #注意力机制 | #语音 | #韵律

评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Antoine Nzeyimana:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为无调号正字法的卢旺达语(Kinyarwanda)文本,输出为波形,要求在缺失声调与音节时长标注下恢复词汇调与语法调,难点在于声调由词干词缀的词汇属性与句法语境共同决定且具有自切分(autosegmental)特性。方法链分三步:先用音节切分器得到音素序列并用形态分析器得到语素序列,前者承载发音时序而后者承载形态句法身份;再用语素Transformer编码器学习高维形态表征,用双向音素到语素交叉编码器让每个音素在同词范围内关注对应语素并融合形态信息;最后将融合后的文本先验经单调对齐搜索(MAS)与流模型接入条件变分自编码器(CVAE)与波形解码器,训练时联合学习时长与声学潜变量。与拼接语言模型嵌入或句法图增强相比,关键差异是把声调先验显式定位到语素槽位而非泛化语义上下文。在10000句新闻域合成语音的自动语音识别(ASR)评测中,Morpho-VITS词错率(WER)相对VITS基线由13.4%降至9.4%。结论仅在训练语素覆盖充分时成立,含未登录语素时性能明显退化,外推到其他班图语与跨说话人克隆尚未验证。训练成本上双模型均用4卡分布式训练,Morpho-VITS耗时149小时显著高于基线的96小时。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么班图声调合成不只是读准音素?

这篇工作研究的是卢旺达语的端到端文本到语音合成,输入是无调标记的标准正字法文本,输出是语音波形。目标读者是刚进入语音合成的研究生,需要先建立的学习依赖是:声调不是音素的附属装饰,而是决定词义与语法功能的信号。对于卢旺达语这类班图语言,论文指出约 15,000,000 人使用的该语言同时具有词库声调与语法声调,且声调具有自切分性质,标准书写既不标调也不标音节时长,读者必须结合上下文消解。

这意味着合成器不能只把字母转成音再拼接能量包络。如果把 bazaririmba(他们将歌唱)与 uwaririmbye(唱歌的那个人)只看成音节串,二者在音段上高度相似,但动词词缀槽位不同,过去时词素与词干携带高调而将来时词素在默认语境下不带高调,在特定句法如 Ni bo bazaririmba 中又会出现 bázáaríriimba 的调型。非母语者与普通端到端模型在这里都会像外地口音一样读错语调。论文因此把问题定义为如何在文本先验中补上形态句法信息,而不是加大声学模型。

词库声调 × 语法声调: 词库声调指词干与词缀本身携带的高低调区别,语法声调指句法环境与时态等形态组合触发的变调,二者分工是分别解释 bazaririmba 与 uwaririmbye 这类动词变位为何写法相近但调型不同,搭配理由是标准正字法都不标调,组合意义是只建模音素无法区分而必须显式建模词素序列。

需要保留的关键信息是:挑战来自书写欠标定与声调的双重来源,解决思路是显式形态建模,后续所有结构与实验都围绕这一判断展开。

同输入同目标的已有增强路线差在哪里?

在相同的输入输出约束下,即输入为常规正字法文本、目标为自然且调型正确的语音、监督为配对语音文本、运行阶段为端到端训练与推理,已有工作尝试过给文本编码器加语言学上下文。论文列举了 3 条路线:蒙古语工作中拼接预训练语言模型嵌入以增强文本编码器隐表示;中文 FastSpeech 2 工作中加入语义依存分析与强制声调序列;英文 GraphSpeech 用图神经网络表示句法并做图到序列建模。

这些工作的共同点是承认纯音素编码上下文不足,需要外部语言结构。但论文明确指出它们没有处理班图声调问题。中文声调更多附着于音节,英文语调更多由句法短语决定,而班图声调同时扎根于词素库存与形态句法规则,且存在动词槽位系统与跨词变调。直接搬运中文的强制声调序列或英文的句法图,都不能表达 V:2:ba、V:4:zaa、V:10:rírimb 这类槽位身份及其与句法的交互。

因此本文的对照不是在同条件胜负意义上否定上述方法,而是指出监督与表示粒度不同:本文选择用形态分析器输出的词素序列作为先验,而不是通用语义嵌入或句法图。这个选择的学习依赖是班图语音学描述,后文的交叉编码器与评测都只为验证该表示是否带来可测的语调与可懂度收益。

要验证的具体问题是什么?

论文把大问题收敛为一个可实验的问题:在 VITS2 框架内,把标准音素编码器替换为词素序列编码器加音素到词素交叉编码器,能否捕捉产生正确声调所需的词库与形态句法模式。输入仍是普通文本,输出仍是波形,改变的只是文本先验的构造方式。

操作定义很具体。一路用音节切分器把文本切成元音与辅音簇作为音素嵌入,论文称此前工作发现这种切分对语音识别更有效;另一路用基于两层形态学原理、以 Rust 实现的班图形态分析器把词切成词素序列,动词形式用词干数据消解,并用双向解码隐马尔可夫模型做词性标注,该分析器在 AfriSUD 词性标注基准上报告达到 85% 准确率。两路分别编码后再让每个音素关注同词内词素的隐表示。

判断标准在摘要与结论中事先说明:自然度、语调与可懂度是否实质提升,以及对未见词素是否退化。论文没有承诺延迟或通用语言能力改善,未测量的量不能从可懂度推定。这是后续读结果时必须守住的边界。

整体模型如何从文字走到波形?

整体沿用条件变分自编码器加对抗训练的 VITS 框架。给定文本 c,模型要学习语音波形 x 的生成分布,优化的是边缘对数似然的证据下界。训练时后验编码器从线形频谱推断声学隐变量 z,先验编码器从文本预测先验分布参数,再经单调对齐展开到帧级,经可逆流模型匹配隐特征,最后由波形解码器合成波形。论文使用的解码器是轻量高保真多带频谱生成加逆短时傅里叶变换的结构,来自引用文献。

与基线不同的是先验一侧的文本编码被换成形态增强结构。底部文本同时进入音节切分器与形态分析器,分别得到音素序列与词素序列,再进入音素交叉编码器与词素编码器,输出的编码文本经投影得到先验参数。多说话人条件通过说话人编码加入,时长预测器与单调对齐搜索负责训练与推理的不同展开路径。

先验编码器 × 后验编码器: 先验编码器只从文本与说话人条件预测声学隐变量的分布参数,后验编码器从真实语音频谱推断隐变量的分布,二者分工是训练时用 KL 散度把先验拉向后验,搭配理由是推理时没有语音可用只能靠先验生成,组合意义是形态增强只改造先验一侧而不改变后验与声码器。

下面先看总体连接,再进入每层的计算,这是理解形态信息何时注入的关键顺序。

总体结构基于 VITS 框架并在文本先验处加入词素编码器与音素到词素交叉编码器,用以捕捉消解语调所需的形态句法模式,图前导读需要先建立主路径与分支汇合的概念。

看图路径: 1. 从底部 Text 出发,沿左右两路分别找到音节切分器与形态分析器;2. 确认音素交叉编码器与词素编码器在 Encoded text 之前汇合;3. 区分红色训练专用箭头与蓝色推理专用箭头在时长与对齐处的走向;4. 核对绿色可训练模块与灰色固定模块的图例分工

原论文 Figure 1:The overall architecture is based on he VITS framework \\[9, 11\\].

论文图 1。原论文 Figure 1::“The overall architecture is based on he VITS framework [9, 11].”。

该图显示底部文本分叉为左右两路,左侧经音节切分进入音素交叉编码器,右侧经形态分析进入词素编码器,二者在编码文本处汇合后再经投影到先验参数。红色箭头标示训练专用路径,包括从频谱经后验到隐变量以及对齐搜索回传时长的回路;蓝色箭头标示推理专用路径,主要由时长预测器直接给出音素时长。绿色为可训练模块,灰色为固定模块,说话人编码同时影响后验、流模型与时长预测。这种布局说明形态增强不改动声学后验与声码器,只改变先验的文本表示来源。

词素编码器与交叉层各自做什么?

词素编码器采用标准 Transformer 编码器结构,使用缩放点积注意力加相对位置偏置,负责把形态分析器输出的词素序列编码为隐状态。音素侧则经过一个双向的类解码器交叉编码器层,每层包含两个注意力模块:下层的音素到音素自注意力与上层的音素到词素交叉注意力,外加层归一化、残差相加与前馈网络,堆叠多层。相对位置嵌入作为偏置加入注意力 logits。

以 bazaririmba 为例,音节切分给出 b-a-z-a-r-i-r-i-mb-a 的音素串,形态切分给出 V:2:ba-V:4:zaa-V:10:rírimb-V:18:a 的词素串,其中 V 表示动词,数字表示词素槽位;uwaririmbye 则对应 u-w-a-r-i-r-i-mby-e 与 V:0:u-V:2:u-V:4:á-V:10:ríriimb-V:18:ye。例子显示高调实际由过去时词素 V:4:á与词干 V:10:ríriimb 携带,而将来时 V:4:zaa 默认无高调,但在特定句法下也可带高调。这正是需要同词约束交叉注意力的语言学动机。

音素序列 × 词素序列: 音素序列负责给出可发音的音节切分与时长对齐单位,词素序列负责给出词的语法槽位与声调承载信息,二者搭配是因为卢旺达语声调同时受词库与形态句法控制,组合意义是让每个音素在编码时能定向查询同词内词素的隐表示,从而获得消解语调所需的先验。

该层的像素结构需要逐路确认 QKV 来源与偏置加入点,避免把自注意与交叉注意混为一谈。

看图路径: 1. 自下而上跟踪 H_t 输入经过 MHA1 再到 MHA2 再到前馈的残差路径;2. 确认 MHA1 的 QKV 均来自音素侧而 MHA2 的 KV 来自词素 H_s 侧;3. 观察右侧 X-POS 与 POS 作为偏置进入两层注意力的位置差异

原论文 Figure 2:Our phoneme-to-morpheme cross-encoder layer uses two attention layers, one for phoneme…

论文图 2。原论文 Figure 2::“Our phoneme-to-morpheme cross-encoder layer uses two attention layers, one for phoneme self-attention and the other for phoneme-to-morpheme cross-attention.”。

该图为单层交叉编码器的纵向堆叠,底部输入上一层音素隐状态,先经层归一化进入 MHA1 完成音素到音素自注意,其 QKV 均来自音素侧并叠加 POS 相对位置偏置;再经层归一化进入 MHA2 完成音素到词素交叉注意,其查询来自音素侧而键值来自右侧输入的词素隐状态并叠加 X-POS 交叉位置偏置;顶部经层归一化与前馈输出本层音素隐状态。多处 Add 表示残差连接,Lx 表示此类层重复堆叠。可见形态信息只在 MHA2 处以键值形式进入,不直接改写音素切分。

交叉注意力的计算目标与同词约束是什么?

给定目标音素隐状态序列与源词素隐状态序列,交叉注意力要计算每个音素位置 i 对每个词素位置 j 的权重,再用权重对词素值向量加权,得到注入形态后的音素表示。关键约束是 stk 函数:只有属于同一词的音素与词素对才计算有效 logit,否则置为负无穷,从而在 softmax 后屏蔽跨词干扰。相对交叉位置嵌入 r 作为偏置加入,保留词内顺序信息。

先看变分目标的符号与优化含义,再看交叉权重的具体公式,顺序不能颠倒,因为前者决定整个模型的训练信号,后者只是先验内部的一步变换。

\[\displaystyle\log p_{\theta}(x|c)=\log\int p_{\theta}(x,z|c)dz\]

该式定义条件变分自编码器的起点:语音波形 x 给定文本 c 的边缘对数似然写成对隐变量 z 的积分。直接优化不可行,后文将其放宽为证据下界,分解为给定 z 的重构期望减去后验与先验之间的 KL 散度。符号中 theta 为生成参数,phi 为后验参数,z 为学习到的声学特征。形态建模的作用是让先验 p 更准确,从而减小该散度压力。

\[\displaystyle\alpha_{ij}=\begin{cases}\frac{1}{\sqrt{d_{k}}}(t_{i}W_{Q})(s_{j}W_{K})^{T}+r_{j-i},&\text{if }stk(i,j)\\ -\infty,&\text{otherwise}\end{cases}\]

该式给出交叉注意力 logit 的计算:归一化因子为键维度开方,查询与键经可学习投影后点乘再加相对位置偏置,仅当同词条件成立时有效,否则为负无穷。WQ 与 WK 为可学习投影矩阵,r 为交叉位置嵌入。这里未报告梯度截断或额外监督,监督来源仍是整体的声学重构与 KL 加对抗损失经先验反传而来。

\[t^{{}^{\prime}}_{i}=\sum_{j=1}^{n}\frac{\exp(\alpha_{ij})}{\sum_{j^{\prime}=1}^{n}\exp(\alpha_{ij^{\prime}})}(s_{j}W_{V}),\\\]

该式给出交叉层的输出:对 logit 做 softmax 归一化后对词素值向量加权求和,WV 为值投影矩阵。输出的 t 即为融合形态后的音素隐状态,再与自注意力分支的残差与前馈结合。自注意力本身使用带相对位置偏置的标准缩放点积,词素编码器亦同。论文未给出注意力头数与前馈维度等细节,这是复现时需要补看代码的具体缺项。

单调对齐搜索 × 时长预测器: 单调对齐搜索在训练时从先验参数与后验隐变量之间求出音素到声学帧的单调对应,时长预测器学习把这种对应转化为每个音素的时长倍率,二者搭配是因为训练有对齐可用而推理没有,组合意义是推理时用预测时长把形态增强后的先验展开到帧级再送入流模型与波形解码器。

自注意力 × 交叉注意力: 自注意力让音素序列内部互相比较以建立上下文,交叉注意力让每个音素位置去查询同词词素的隐表示,二者分工是前者维持发音连续性后者注入形态句法,搭配理由是声调既依赖相邻音节也依赖词素槽位,组合意义是同一层内先做音素间平滑再做词素条件修正。

训练如何组织,哪些参数在更新?

训练沿用 VITS2 的变分加对抗流程。论文明确实现基于 PyTorch 2.7.1,基线与 Morpho-VITS 用同一数据集训练。两者音素隐维度均为 192,音素编码器或交叉编码器均为 8 层,说话人条件加在第三层。Morpho-VITS 额外有 8 层词素编码器,词素隐维度 768。参数量上基线 97,000,000,Morpho-VITS 2.68 亿,其中 1.69 亿属于词素编码器。优化设置为 1,000,000 次梯度更新,批量 32,峰值学习率 1e-4,使用 4 块 Nvidia RTX 5090 做分布式数据并行,基线耗时 96 小时,Morpho-VITS 耗时 149 小时。

关于冻结与更新,论文未报告冻结任何预训练部分,形态分析器作为固定前端提供词素切分,词素编码器与交叉编码器均为可训练模块,与后验、流模型、时长预测器、波形解码器联合优化。梯度路径按 VITS 常规理解经由先验参数与对齐展开回传,但原文未单独给出各模块学习率分组或梯度裁剪,不能从模型名推定。监督来源是配对语音文本的声学重构、KL 与对抗判别,没有额外的声调标签监督。

推理时文本同样经两路切分编码,时长预测器直接给出音素时长,先验参数经扩展到帧级再经流模型与解码器生成波形,不再需要后验与对齐搜索。这是训练与推理分支在图中用红蓝箭头区分的原因。

数据、切分与评测条件如何设置?

训练数据为多说话人卢旺达语语料,来自 3 个来源的合并:Mbaza NLP 项目的 6 小时单说话人新闻朗读,农业 TTS 数据集的 20 小时 4 说话人数据,以及此前语音文本对齐项目的 38.5 小时数据。论文给出两个 HuggingFace 数据集链接,但本次资源状态为暂时不可达,因此当前不能断言链接可公开访问,只能按正文记录的时长与说话人数复述。划分、采样率与预处理细节原文未完整报告,这是复现时需要核对代码的缺项。

可懂度评测收集 10,000 句新闻语料句子,每句 6 到 12 词,排除含人名句子以避免外语人名与非标准拼写需要发音词典的问题。用已有卢旺达语识别模型转写合成语音,报告字符错误率与词错误率,指标越低越好。主观评测招募 21 名母语者且至少高中学历,培训后按 1 到 5 打自然度与语调分,并按是否可懂做二分类。每人评 100 对随机配对音频,每对由 2 人评分,共 2100 对评分,报告平均意见分及 95% 置信区间与可懂片段百分比。

为考察形态泛化,论文把评测集按是否含训练未见词素分为 900 句含未见词素与 9100 句全见词素两组。该分组只改变聚合对象,不改变模型与解码条件,是理解退化的关键对照。下表整理模型配置与数据评测条件,便于复现时逐项核对。

条件指标基线本方法比较对象
音素编码配置隐维度192192同数据集 2 个模型
编码层数层数88音素编码器与交叉编码器
词素编码隐维度无768仅 Morpho-VITS
参数量总参数97 million268 million其中 169 million 为词素编码器
训练预算更新步数与耗时1 million 步,96 hours1 million 步,149 hours4 卡 RTX 5090,批量 32,峰值 1e-4

上述宽表用正文连续原句逐字覆盖数字与单位,表前已说明比较问题为配置与成本是否可比,表后需结合效果判断代价是否值得。基线与本方法在数据与优化步数上一致,差异主要来自词素编码器的参数与耗时,这是后文谈代价的依据。

条件指标基线本方法比较对象
训练语音总时长6 hours 单人新闻20 hours 4 人农业加 38.5 hours 对齐同一合并训练集
可懂度文本句数与句长10,000 句10,000 句每句 6 到 12 词,去人名
主观评测人数与量21 人21 人每人 100 对,共 2,100 对,2 人 1 对
评分标尺自然度与语调1 到 51 到 5另有 Yes/No 可懂标签
分组未见词素900 句900 句余下 9.1K 为全见组

该表同样基于正文原句整理,单位保留 hours 与句数写法。公平条件是 2 模型共享同一训练合并集与同一评测文本切分,主观配对随机化使评测者无法预判系统归属。限制是未报告划分随机种子与音频采样细节,复现时需以代码为准。

可懂度提升了多少,条件公平吗?

可懂度问题是合成语音经识别模型转写后的错误率是否更低。与谁比是标准音素编码器的 VITS 基线与形态增强的 Morpho-VITS,条件一致体现在同数据集、同训练步数与同一万句评测文本。指标方向为字符错误率与词错误率越低越好。

Model# samplesCER [%]WER [%]
VITS Baseline10K3.013.4
Morpho-VITS (Ours)10K1.79.4
w/ unseen morphemes9002.919.3
w/o unseen morphemes9.1K1.58.3

该表报告基线字符错误率 3.0% 与词错误率 13.4%,本方法降至 1.7% 与 9.4%。论文同时指出两者均低于 Mozilla Common Voice 这类噪声基准,但本方法仍更可懂。支持的判断是形态建模改善了整体可懂度。限制是识别错误不等于人耳可懂度,且 900 句含未见词素组的词错误率升至 19.3%,显著差于全见组的 8.3%,说明平均收益被未见词素拉低。未胜出项正是含未见词素子组,其字符错误率 2.9% 接近基线水平,这是后文强调形态词表覆盖的原因。

重提数字时需增加适用条件:若部署文本形态多样且多为训练未见词素,不能直接期待 9.4% 的词错误率,需要先扩充形态多样的训练数据或改进分析器泛化。

主观自然度与语调是否同步变好?

主观问题是母语者感知的自然度、语调与可懂片段比例是否提升。与谁比仍是同一基线与本方法,条件一致体现在随机配对盲评与每对双人评分。指标方向为平均意见分越高越好,可懂百分比越高越好。

ModelNaturalnessIntonation%Intelligible
VITS Baseline3.33 (±0.05)2.95 (±0.05)92.1
Morpho-VITS (Ours)3.55 (±0.05)3.12 (±0.05)96.7
w/ unseen morphemes3.44 (±0.18)3.00 (±0.16)93.8
w/o unseen morphemes3.56 (±0.06)3.13 (±0.05)97.0

该表报告基线自然度 3.33 分、语调 2.95 分、可懂 92.1%,本方法为 3.55 分、3.12 分、96.7%,置信区间均为正负 0.05 左右。含未见词素组降至 3.44 分、3.00 分、93.8%,全见组为 3.56 分、3.13 分、97.0%。主要收益是三项同步提升且全见组更高,代价是未见组回落接近基线,置信区间也放宽到 0.18 与 0.16,说明样本少且不稳定。

就近的负结果是未见词素条件下的退化,它不是偶发噪声而是在自动指标与主观指标上同时出现,支持形态词表覆盖不足会导致收益缩水的解释。未评测边界包括跨说话人稳定性与长句韵律,原文未分组报告,不能从总体均值推广到每组每句都成立。

哪些边界没有被验证?

论文直接报告的是卢旺达语上的提升,有限解释是显式形态有助于班图声调,待验证的是能否推广到其他班图语言。原文未给出跨语言实验,也未报告在噪声、电话信道或少数据下的表现,因此不能把相关性当因果承诺为所有场景改善。

缺失证据不是技术错误,但需要明确点出。形态分析器准确率、词素未登录率与声调错误率之间的定量关系未测量;推理延迟、实时率与内存占用未报告,不能从训练耗时推定推理开销;总体趋势不等于每步都成立,未见词素已是反例。百分点与相对百分比也需区分,例如可懂片段从 92.1% 到 96.7% 是 4.6 个百分点,不能表述为提升 4.6%。

资源方面,两个 HuggingFace 数据集链接在本次核验中暂时不可达,必须写本次未能确认可达,不能写已公开可用。致谢显示工作受 KINLP R&D Ltd 支持,分析器细节与权重是否开源原文未承诺,复现前需先确认代码与模型可运行状态。

复现先做什么,需要哪些信息条件?

复现的第一步是重建文本双路输入。按原文动作依次执行:用音节切分器把正字法文本切成元音与辅音簇,用 Rust 两层形态分析器输出带槽位标记的词素序列,核对 bazaririmba 与 uwaririmbye 的切分是否与论文示例一致,再检查同词约束是否只允许同词内音素查询词素。若切分不一致,后续注意力权重无从比较。

第二步是按配置搭建模型。音素隐维度 192、8 层编码、第三层加说话人条件、词素编码 8 层 768 维是必须保留的超参数;训练用批量 32、峰值学习率 1e-4、1,000,000 步、4 卡分布式是预算基线。先跑通基线 VITS 再加入词素分支,有助于定位是数据问题还是结构问题。评测时保留 10,000 句去人名新闻集的构造规则与 6 到 12 词长度,以及 21 人双评的盲测流程,自动指标用同一识别模型才能对比字符与词错误率。

还需补的验证是形态覆盖统计。统计训练与测试的词素词表交集,复现 900 对 9100 的分组错误率差异,并报告未见词素句的分布,才能判断是否需要更大形态多样的语料。论文未来工作提到自监督预训练文本编码器,这正是针对未见词素的可能方向,但尚未验证,不能当作已有收益。

何时值得尝试这种形态增强?

当目标语言的书写省略声调且声调同时受词缀槽位与句法影响时,值得尝试把形态分析显式接入先验。卢旺达语的证据显示,在训练词素覆盖充分的新闻文本上,自然度、语调与可懂度同步改善,且自动与主观指标方向一致,这是支持尝试的直接报告。

不值得盲目尝试的情况是形态分析器质量低或部署文本形态发散。若未见词素占比接近 10%,论文数据显示词错误率与主观分都会明显回落,此时更大的模型反而可能放大对词素编码器的依赖。先补词表覆盖与分析器泛化,比直接增大词素编码器更符合证据。

对初学者的特有误解需要澄清:交叉注意力不是发音词典,它不输出固定调型,而是让音素在同词范围内动态加权词素隐表示;变分下界不是音质分数,它只是让先验逼近后验的训练目标,最终好坏仍由听感与可懂度决定。带着词素覆盖率与分条件评测去读表,才能把这篇工作的结论用对地方。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-23 语音/音乐/音频论文速递