英文题目:Learning to Rescale: On-the-Fly Sequence Length Adaptation in Non-Autoregressive Speech Synthesis

会议身份:conference:interspeech:2026:conference-paper-id:jin26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #多语言 #语音 #文本到语音

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jiawei Jin:机构信息未能从会议 PDF 纯文本可靠映射
  • Ren Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhiyu Cui:机构信息未能从会议 PDF 纯文本可靠映射
  • Shun Lei:机构信息未能从会议 PDF 纯文本可靠映射
  • Yixuan Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

非自回归文本到语音合成需将音素文本与音色提示映射为高分辨率语义Token序列再还原波形,难点在于并行解码缺乏显式对齐且对字符级或全局时长预测高度敏感,时长偏差易导致语速异常与韵律断裂。所提弹性长度扩散语言模型ElasticDLM先以掩码扩散将音素与音色提示展开为初始掩码序列,再由弹性语义扩散语言模型联合预测内容与两种功能Token,最后经声学建模阶段与声码器还原波形。训练侧差异化长度缩放方案以[EXPAND]与[DELETE]分别学习块级插入与删除并按扩散时刻分层调度,推理侧分层置信度引导策略在去噪早期优先执行高置信长度操作并重算长度与掩码。与固定长度掩码生成相比,该方法将长度调整内化为块级合并与插入的可学习操作,并以分层置信度在去噪早期完成结构修正。与MaskGCT在Seed-TTS中文集上的对照显示,本方法自然度主观评分自然度平均意见分达到4.20,优于基线3.84且长度误差更小。在seed-test-zh基准下,Ours-Normal的N-MOS为4.20 ± 0.13,高于MaskGCT-Normal的N-MOS 3.84 ± 0.18。该结论目前仅在中英文朗读与单说话人表情数据上验证,极端韵律与长时篇章外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 演示资源:https://thuhcsi.github.io/ElasticDLM/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么时长是关键卡点?

这篇论文研究的输入是文本加一段音色提示语音,目标是合成与提示音色一致、内容与文本一致、语速韵律自然的语音。输出不是直接的波形采样点,而是先产生语义标记序列,再经声学模块转为波形。对于刚入门的读者,可以把语义标记理解为对语音内容与节奏的离散抽象,把声学标记理解为更接近音质细节的离散表示。论文要解决的矛盾是,非自回归模型为了并行生成,必须在开始生成前就决定输出序列有多长。

传统做法依赖字符级时长或全局总时长预测,先定长度再填内容。一旦时长预测不准,就会出现语速异常、韵律断裂,而且模型没有机会在生成中途修正长度。学习依赖上,先要理解文本到语音的对齐难题,再理解自回归逐个生成与非自回归 1 次给长并行填空的区别,才能理解本文为什么要在掩码生成框架内加入可学的长度伸缩。本文的输出承诺是支持任意长度输入的高保真自然合成,演示页当前可用,地址为官方资源中给出的演示链接。

复述时必须保留的关键信息是模型名称、两个功能标记、训练与推理两个配套策略、实验数据与基线条件。

附带说明:阅读时易混的概念如何区分?

初学者容易混淆 3 组概念。第一,字符级时长与全局总长,前者决定每个字占多少帧,后者只决定整句有多少帧,本文要摆脱的是对二者准确预测的强依赖,而不是不要时长信息。第二,内容掩码与功能标记,前者是被遮住待填的内容槽,后者是告诉模型加长或缩短的指令,二者在训练中都会被重掩码,但在推理中只有高置信的功能标记被优先执行。第三,训练中的合并与推理中的展开,前者是人为压缩以制造学习样本,后者是模型预测扩展标记后真正插入掩码,二者方向相反、块大小一致。

扩展标记 × 删除标记: 扩展标记的分工是触发插入新的掩码标记以加长序列,删除标记的分工是触发移除已有片段以缩短序列,二者搭配的理由是把变长操作统一为同一词表内的可预测符号,使长度调整与内容生成在同一次前向中完成,组合意义是模型不再依赖外部时长预测器给定的固定总长,而是在去噪过程中自主决定哪里加长、哪里缩短。

另一易混点是声学冗余,意思是相邻语音帧携带大量重复信息,单点插入删除难以给出显著梯度,这正是论文用块级操作的原因。

已有路线如何定长度,各自留下什么未解问题?

论文把相关工作按输入、目标和定长方式分成 3 类。第一类是早期非自回归合成,依赖从自回归教师蒸馏、单调对齐搜索或蒙特利尔强制对齐器得到的字符级时长。这类方法在噪声或开放场景下对齐耗时且不准,而且细粒度的刚性对齐限制了自然度和风格多样性。第二类是以掩码生成式建模为代表的固定总长方法,例如文中提到的掩码生成编解码器结构及相关连续表示模型。

它们可以根据总长自适应分配词或音素时长,但仍需要先预测一个准确的全局时长作为初始长度。一旦初始长度偏了,最终输出的整体或局部自然度都会受损。第 3 类是文本生成中的变长扩散语言模型,例如文中引用的相关工作。

它们用单个标记的插入与删除实现变长,但论文指出直接搬到语音有两处困难,一是语音时间分辨率高、一个音素对应多个语义标记且声学冗余大,单点操作给不出显著可学的梯度信号,二是语音序列很长而推理步数预算有限,大范围变长与高保真难以兼顾。因此本文不是简单引入插入删除,而要针对语音特点重新设计块级操作与推理调度。

论文把失败归因到哪里,期望模型学会什么能力?

论文把固定长度范式的失败归纳为两点。第一,不准确的时长预测直接带来可听的缺陷,包括不自然的语速与碎片化的韵律。第二,刚性时长范式使模型无法根据不同语义信息与声学特性自适应调整生成长度,限制了实际应用。举例来说,同样一句话用兴奋语气说得快、用悲伤语气说得慢,如果总长在生成前就被锁死,模型只能在固定格子里挤内容。论文期望模型学会的能力是在推理过程中按需伸缩序列长度。

具体动作是,模型在每一步去噪中既能判断当前位置的内容是什么,又能判断这里应该展开为更长、删除以缩短,还是保持不变。这种能力需要在训练中显式构造伸缩样本并给出长度监督,在推理中用置信度控制何时改长度、何时固化内容。

系统全景:一个样本如何从文本走向量化再到波形?

系统的输入包括三部分,文本经字音转换得到的音素标记、用于确定说话人音色的音色提示语义标记、以及初始的被掩码语义标记序列。弹性语义扩散语言模型负责把这三部分条件拼接后迭代精炼为完整的语义标记序列,随后的声学扩散语言模型、声学解码器与声码器沿用已有架构把语义标记转为语音。沿一个样本走一遍,文本先变为音素,音色提示语音先变为提示语义标记,目标语义位置初始全为掩码。

模型在每一步输出对每个掩码位置的预测分布,其中包含普通语义词表,也包含扩展标记与删除标记。扩展标记被替换为多个掩码,删除标记被直接移除,于是序列长度在下一步发生变化。如此迭代,长度与内容同时被修正。下图展示了整体级联结构与训练侧的加噪细节,左侧为推理与合成主路径,右侧为训练时的掩码与长度缩放过程,阅读时先看主路径再看右侧四行序列如何演变。

看图路径: 1. 沿左上文本经转换再经弹性语义模块到声学模块最后到波形的箭头走一遍主路径;2. 观察下方弹性语义模块中音素、音色提示与被掩码语义三段输入如何进入同一变换器;3. 对照右图从原始序列到掩码再到长度缩放最后到重掩码的纵向四行变化;4. 注意右图中合并操作压缩连续掩码块与在尾部追加删除标记两个分支的位置差异

原论文 Figure 1:Overall architecture of the proposed method (a) and design details of the Differentiated…

论文图 1。原论文 Figure 1:“Overall architecture of the proposed method (a) and design details of the Differentiated Length-Scaling Training Scheme (b).”。

从像素看,左图上方文本经转换进入蓝色弹性语义模块,输出黄色语义标记后再经绿色声学模块与灰色解码声码器变为波形,下方大框给出弹性语义模块内部在相邻两步之间如何做扩展与删除。右图纵向给出原始序列、掩码后序列、长度缩放后序列、重掩码后序列,最后进入同一蓝色模块预测并计算损失,其中合并分支把一段连续掩码压缩,插入删除分支在尾部附近追加删除标记。这种左右对照说明,推理侧强调长度可变的迭代精炼,训练侧强调人为制造需要伸缩的样本。

两个功能标记如何分工,推理时如何执行?

术语首次出现先做白话解释。扩展标记可以理解为加长指令,模型在该位置输出它,就表示这里需要更多帧来表达。删除标记可以理解为缩短指令,模型在该位置输出它,就表示这里多余应去掉。扩散语言模型是指在掩码加噪与去噪中学习预测被遮住符号的非自回归生成模型。

分层置信引导推理 × 正弦掩码调度: 正弦掩码调度的分工是按去噪进度决定每步重新掩码多少个低置信标记,分层置信引导推理的分工是在此基础上先立即执行高置信的功能标记再做内容采样,二者搭配的原因是传统调度早期预测太少、后期大幅改长会破坏声学结构,组合意义是在由粗到细的过程中同时完成长度修正与内容固化,兼顾灵活性与保真度。

在推理的分层置信引导策略中,每一步先对当前序列与掩码做 1 次统一预测得到分布,再取出扩展与删除两个符号的置信度。只要其中之一超过阈值,就立即保留并执行,扩展被替换为多个掩码,删除被移除。分工上,分层置信引导推理负责何时何处做伸缩的结构决策,正弦掩码调度负责每步重掩码多少的内容精炼量,二者组合的原因是早期需要大幅结构调整而后期需要细粒度声学修正,只有决策与调度解耦才能同时保证长度灵活性与高保真。

剩下的内容分布在屏蔽掉已采样的功能标记后做常规采样,再按调度函数把置信度最低的一批重新掩码,进入下一步。原文给出的默认推理步数为 50 步,阈值为 0.8,采样用前 20 采样且温度从 1.5 线性退火到 0。调度中的掩码数由正弦调度函数与当前有效长度共同决定,早期做大幅结构调整,后期做细粒度声学修正。论文强调该策略只是采样阶段改动,相对主干前向的额外延迟可忽略,但原文没有报告实测延迟数字,因此不能承诺延迟改善。

算法单步究竟做了哪几件操作,顺序是什么?

把单步推理按顺序复述一遍有助于实现。输入是上一步序列、上一步掩码、当前步数、当前有效长度与阈值。第一步用模型做 1 次统一预测得到分布并做归一化。第二步取出扩展与删除的置信度,超过阈值的位置记为待执行操作。第三步把内容分布中对应功能标记的位置屏蔽,做常规采样得到内容序列并按调度重掩码最低置信的一批。

第四步执行长度操作,删除对应位置,扩展替换为多个掩码。第五步根据改变后的维度重新计算新长度与新掩码,返回给下一步。这种先功能后内容再重掩码的顺序保证了长度调整发生在内容固化之前,早期大改、后期细化。

训练如何构造伸缩样本并给出长度监督?

训练的输入是初始标记序列与扩散步数。第一步做常规内容掩码,得到部分掩码序列。第二步做差异化长度缩放,包含 2 个方向相反的操作。合并操作把每个不重叠的连续掩码块以一定概率压缩为单个表示,用块级压缩克服语音冗余带来的弱信号问题。插入删除操作是在序列尾部显式追加一定数量的删除标记,教模型用删除标记实现缩短。

插入数量从与序列长度和时间相关缩放因子有关的均匀分布中采样,两个操作在训练中独立或同时施加,且与扩散步数耦合,鼓励早期大学习结构调整、后期学细节。所有功能标记在送入模型前被重掩码为掩码状态,模型以最终加噪序列与音素加音色提示为条件预测干净的缩放后序列。

分段合并加噪 × 长度缩放损失: 分段合并加噪的分工是把连续多个掩码块压缩为一个表示,人为制造需要展开的训练样本,长度缩放损失的分工是约束模型预测的总长度变化量与真实变化量一致,二者搭配的原因是语音序列信息稀疏、单点插入删除信号太弱,组合意义是既给出显著可学的伸缩样本,又用显式长度误差迫使模型学会结构级长度控制。

损失由两项组成,第一项是所有被掩码位置上的负对数似然,第二项是长度损失,用超参数加权。长度损失比较真实长度变化量与模型预测的期望长度变化量,期望变化由每个位置预测为扩展的概率乘以展开数减一再减去预测为删除的概率得到。

原文报告训练使用扩展块大小为 5,两个操作以 0.5 概率独立施加,模型为 16 层变换器,隐藏维度 1536,16 个注意力头,初始化自已有文本到语义模型的变换器权重,在 100,000 小时英文与中文数据上用 24 张显卡训练,优化器与学习率等条件在实验配置节复述。需要指出的缺项是,合并概率与长度损失权重的具体数值在给定证据中没有完整交代,复现时需以原文代码或附录为准,不从模型名称推定。

训练目标的符号与输入如何对应,优化什么?

再从符号层面讲清监督来源,避免从模型名称推定实现。模型的条件输入包括音素标记与音色提示语义标记,噪声输入是经过掩码、长度缩放与重掩码后的最终序列,目标是干净的缩放后序列。优化的是复合损失,第一项是对所有被掩码位置的负对数似然,第二项是长度绝对误差。期望长度变化由模型对扩展与删除的预测概率算出,训练迫使它既猜对符号身份又猜对整体结构变化。原文明确的是参数通过最小化该复合目标更新,但梯度是否截断、功能标记与内容标记是否分开加权等细节在给定证据中没有展开,不猜测。

语义扩散语言模型 × 声学建模阶段: 语义扩散语言模型的分工是把音素与音色提示映射为可变长的语义标记序列,声学建模阶段的分工是把语义标记转为声学标记再经解码器和声码器变为波形,二者搭配的原因是把难学的文本到波形全局映射分解为先定内容与时长结构、后补声学细节,组合意义是长度自适应只需要在语义层解决,后续声学模块可沿用掩码生成式编解码器结构。

实验在什么数据与基线上测什么,指标方向是什么?

实验配置承担公平比较的职责。训练数据为大规模英文与中文子集共 100,000 小时,评估在种子语音评测的中文与英文测试集上进行。基线以掩码生成式模型为主,并设置 3 种条件以分离时长预测的影响。常规条件使用基线自带时长模型,固定条件模拟很差的时长估计,中文固定为 4 秒、英文固定为 4.5 秒,真值条件用真实音频长度作为性能上界。

客观指标包括词错误率衡量准确性越低越好,序列长度平均绝对误差衡量变长能力越低越好,基于说话人表示余弦相似度衡量音色相似越高越好。主观指标为自然度平均意见分,评价韵律与语速,越高越好,由 15 名专业听者对每个测试集随机 10 条样本打分,结果带 95 置信区间。推理默认 50 步与阈值 0.8。理解这些条件后,才能判断后文数字是在常规估计下还是在固定错误初始长度下取得的,二者支持的结论强度不同。

常规与固定初始长度下谁更稳,情感场景表现如何?

比较问题是,在常规初始长度与固定错误初始长度下,本方法与基线的内容准确性、时长误差、自然度与音色相似度如何变化,条件是否一致,指标方向是否如上节所述。下表整理中文与英文两套测试集上的主要数字,模型条件包括基线真值、基线固定、基线常规、本方法固定、本方法常规,指标方向为词错误率越低越好、时长误差越低越好、自然度越高越好、音色相似度越高越好。

模型条件词错误率时长误差自然度音色相似度
基线常规中文2.330%0.8555s3.84 ± 0.180.773
基线固定中文4.182%1.6993s3.72 ± 0.160.771
本方法常规中文2.387%0.7091s4.20 ± 0.130.772
本方法固定中文2.582%0.8752s4.17 ± 0.150.771
基线常规英文3.936%0.5429s3.96 ± 0.140.715
基线固定英文13.341%1.0156s3.58 ± 0.190.718
本方法常规英文3.534%0.5283s4.44 ± 0.120.715
本方法固定英文4.349%0.6956s4.29 ± 0.120.718

表后解释是,本方法常规条件下的词错误率与基线常规及真值条件接近,英文常规甚至更低,音色相似度基本持平,说明变长能力没有牺牲基本合成质量。更重要的是时长误差与自然度均为两套测试集最优,支持模型能纠正有偏的初始长度从而改善语速韵律的判断。代价与反例是,中文常规词错误率略高于基线真值,且固定条件下英文词错误率仍高于常规,说明纠正不是无损的。未胜出项是音色相似度没有拉开差距,因此不能把本方法说成提升了音色克隆。

不同初始长度的鲁棒性用第二张表检验,问题是当初始长度从 1 秒拉到 16 秒时各模型词错误率(%)如何变化。下表为中文测试集上六档初始长度的词错误率,越低越好。

模型1s4s7s10s13s16s
对比模型一95.91%3.441%2.873%3.215%6.236%23.631%
对比模型二73.82%2.586%1.804%2.676%5.991%19.734%
基线94.13%4.182%2.983%16.245%53.26%107.764%
本方法3.477%2.582%2.576%2.447%2.613%2.459%

表后解释是,本方法在全谱上保持低词错误率,而基线在极端长度下完全失效,对比的连续表示模型在中间长度更好但两端仍快速恶化。这支持动态长度调整在无预测器条件下的可靠性,但限制是该表只报告词错误率,没有同时给出主观自然度,因此不能把极端长度下的韵律质量也视为已验证。 高表现力单说话人微调后的偏好测试进一步看情感适应性,4 个情感行为恐惧、悲伤、撒娇、兴奋,本方法占比分别为 63.1%、64.6%、56.9%、52.3%,均高于基线与无偏好。阅读下图时先看图例再逐行比较 3 段占比。

看图路径: 1. 先对照图例确认蓝色为本方法、灰色为无偏好、绿色为基线;2. 逐行比较四种情感下蓝色段长度与绿色段长度的相对占比;3. 注意兴奋情感下绿色段占比明显高于其他情感行的现象

原论文 Figure 3:AB-Test on Highly Expressive Single-speaker Dataset

论文图 3。原论文 Figure 3:“AB-Test on Highly Expressive Single-speaker Dataset”。

从像素看,4 条横向堆叠条中蓝色段在每行都超过一半,灰色无偏好段最窄,绿色基线段在兴奋行达到 35.4% 为四行最高。这支持论文的解释,即基线受外部时长预测器约束节奏僵硬,而本方法能用动态语速渲染情绪,但这属于有限解释,因为偏好测试只在单说话人微调后进行,不能推广到零样本多说话人。

拿掉长度损失与推理策略会怎样,块大小为何选 5?

消融问题是,在挑战性的固定初始长度下,长度损失与分层置信引导推理各自是否不可或缺,扩展块大小如何影响性能。下表整理固定条件下去掉任一组件后的变化,指标方向与主结果一致。

条件中文词错误率中文时长误差中文自然度英文词错误率
本方法固定中文英文2.582%0.8752s4.17 ± 0.154.349%
去掉长度损失固定2.798%1.1129s3.73 ± 0.154.530%
去掉推理策略固定4.005%1.5564s3.47 ± 0.155.652%

表后解释是,去掉长度损失后中文时长误差从 0.8752 秒升至 1.1129 秒且词错误率(%)与自然度同步变差,支持长度损失对学习韵律控制语义的作用。去掉推理策略后崩溃更严重,中文词错误率升至 4.005%,英文升至 5.652%,中文自然度降至 3.47 附近。这支持 2 个组件都重要,尤其在无预测器场景下,但不能反推拿掉后必然在所有数据上同等崩溃,因为证据只来自固定条件的两套测试集。 块大小的敏感性由下图检验,问题是控制合并与展开比例的块大小取何值时词错误率最低,需结合横轴与纵轴逐点读取最低点与两侧回升。

看图路径: 1. 先确认横轴为扩展块大小从 2 到 9,纵轴为词错误率;2. 沿蓝色折线从左到右逐点读出标注数值,定位最低点所在的横轴位置

原论文 Figure 2:The WER with Different Expansion Block Size n

论文图 2。原论文 Figure 2:“The WER with Different Expansion Block Size n”。

从像素看,横轴 2 至 9 的折线呈 U 形,2 处为 2.579,3 处为 2.526,4 处为 2.441,5 处最低为 2.387,6 处回升至 2.514,7 处 2.549,8 处 2.537,9 处升至 2.591。论文解释是,过小提供不了显著压缩信号而被当作噪声,过大则推理展开僵硬不灵活,5 接近平均音素时长因而在准确性与灵活性间平衡最好。该结论在英文数据上结果类似,但原文只以图示中文曲线,复现时应同时报告英文曲线以确认一致性。

词错误率 × 长度平均绝对误差: 词错误率的分工是衡量合成语音被识别后的内容准确性,长度平均绝对误差的分工是衡量输出时长与真实时长偏离多少秒,二者搭配的原因是只看内容正确会掩盖语速过快或过慢,只看时长正确会掩盖发音错误,组合意义是同时检验模型是否在纠正长度的同时没有牺牲可懂度。

哪些边界没有测,哪些改善不能承诺?

论文直接报告的是内容准确性、时长误差、音色相似度与自然度在给定测试集上的表现,有限解释是长度纠正带来了更自然的语速韵律,未验证推测是该机制在所有情感与噪声条件下同样有效。明确缺项包括,训练与推理的实际耗时、内存占用、输出帧率与端到端延迟没有系统报告,因此不能承诺更快或更便宜。主观评测每集仅 10 条随机样本且听者 15 人,样本量有限。极端初始长度实验只报告词错误率,没有主观分。

情感偏好实验经过高表现力单说话人微调,不能等同于零样本通用能力。相关性不等于因果,时长误差降低与自然度提升同时出现,但没有测量误判率或单独控制内容质量,因此不能断言时长是自然度提升的唯一原因。

复现先做什么,需要哪些配置与检查点?

复现先做三件事。第一,准备数据与基线条件,训练侧需要英文与中文大规模数据,评估侧需要种子语音评测的中英文测试集,并复现基线的常规、固定与真值 3 种初始长度设置,固定长度按中文 4 秒、英文 4.5 秒执行。第二,搭建弹性语义模块,结构为 16 层变换器,隐藏维度 1536,注意力头 16,加载已有文本到语义变换器权重后继续训练,训练中以 0.5 概率独立施加合并与删除操作,扩展块大小取 5,推理默认 50 步、阈值 0.8、前 20 采样、温度从 1.5 线性退火到 0。

第三,核对指标实现,词错误率、时长平均绝对误差、余弦音色相似度与自然度打分流程需与原文一致,百分比为相对错误率而非百分点变化,不同指标差值不得混放。演示页当前可用,可先听效果再跑代码。论文未交代合并概率与长度损失权重的完整取值,复现时需查代码。硬件预算原文为 24 张大显存显卡,个人复现时应先在小子集验证伸缩行为,再扩大训练。

何时值得尝试这种可伸缩合成,还需补哪项验证?

当你的非自回归合成被时长预测卡住,表现为固定总长下语速不自然、换情感就僵硬,且你能接受增加块大小与置信阈值等超参数时,值得尝试这种把长度调整内化为符号预测的思路。它的适用条件是掩码生成式语义层,因为块级合并与长度损失都依赖离散掩码位置。如果你的系统是连续回归时长或自回归逐帧生成,直接照搬并不匹配。

还需补的验证包括,在你的数据上扫描块大小与阈值并同时报告词错误率与主观分,测量首包延迟与实时率以确认采样改动的真实开销,以及在不做情感微调的零样本下检验变长是否仍带来偏好提升。记住总体趋势不等于每组都成立,极端初始长度下的低词错误率不代表极端长度下的韵律同样自然。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总