英文题目:BatonVoice: An Operationalist Framework for Enhancing Controllable Speech Synthesis with Linguistic Intelligence from LLMs

会议身份:conference:acl:2026:conference-paper-id:2026.acl-long.2165

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#偏好优化 #大语言模型 #跨语言 #零样本 #文本到语音

评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Yue Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Ruotian Ma:机构信息未能从会议 PDF 纯文本可靠映射
  • Xingyu Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhengliang Shi:机构信息未能从会议 PDF 纯文本可靠映射
  • Morunliu Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Wanshun Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Huang Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiadi Yao:机构信息未能从会议 PDF 纯文本可靠映射
  • Xin He:机构信息未能从会议 PDF 纯文本可靠映射
  • Qu Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Qingxuan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Fanghua Ye:机构信息未能从会议 PDF 纯文本可靠映射
  • Juntao Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhaopeng Tu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaolong Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Liefeng Bo:机构信息未能从会议 PDF 纯文本可靠映射
  • Min Zhang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

可控语音合成以文本与自由指令为输入,输出语义准确且韵律符合意图的语音,难点在于指令理解依赖语言智能而传统端到端微调绕过该能力且依赖昂贵低一致标注。先由指挥者大语言模型以文本、自由指令和说话人中性基线为输入,负责推理分段韵律计划并输出JSON声学特征,明确量化音高与能量等可解释特征。再将该JSON计划与文本拼接为前缀输入乐团模型BatonTTS,负责自回归生成受计划约束的离散语音Token,使前一步的显式计划直接进入条件前缀以约束声学实现。最后以冻结的流匹配与HiFi-GAN解码器以上述Token为输入,负责将离散表征还原为波形并输出最终语音,完成从理解到合成的衔接。与紧耦合指令微调将理解与声学实现固化于单一模型不同,该解耦使计划可解释可替换且无需人工指令语音对,升级指挥者即可提升控制而不重训合成器。在英文情感基准下,BATONVOICE-1.7B的情感准确率为57.6%,高于Minimax-2.5-HD的48.6%。该结论适用边界受限于短句朗读与五类情感评测,尚未验证长篇章细粒度重音与非言语声外推,而指挥者计划生成的推理开销带来约20秒延迟,不适合实时场景。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文的输入是两行文本,一行是待合成的内容,例如英文句子,另一行是用自然语言写成的风格要求,例如请用讽刺语气说。目标是生成一段语音,既要把内容说清楚,又要让听感符合风格要求。初学者容易把这个任务理解为给语音模型更多数据就能解决,但原文指出的数据瓶颈是可控标签需要人工标注,既昂贵又一致性低。读完本解读,你应当能复述三件事。第一,系统把任务拆成两步,先由大语言模型输出分段的数值化发声计划,再由专用合成模型按计划发声。

第二,计划的每一项都是可测量的声学量,包括音高均值与斜率、能量均值与斜率、频谱质心。第三,训练分 3 段完成,先学基本合成,再学按计划合成,最后用偏好对比压低词错与慢速问题。输出是一段波形,其可懂度用词错率衡量,情感符合度用情感分类准确率衡量。资源状态方面,代码资源当前可用,地址指向腾讯数字人仓库下的 BatonVoice 目录,第三方特征提取工具 Parselmouth 当前可用,这些是唯一可写的可达性结论。

同类路线有哪些,本文与它们在监督和运行阶段有何不同?

原文把可控语音合成归纳为 3 条路线。第一条是风格标签路线,用离散标签如情感或性别控制合成,优点是简单,缺点是只能表达预先定义的有限集合,遇到讽刺、犹豫、坚定等复合语义就难以覆盖。第二条是参考语音路线,从一段示例语音提取说话人或风格表示再条件生成,适合音色克隆与风格迁移,但需要合适的参考音频,且难以精确表达文字指令中的细粒度意图。

第 3 条是指令控制路线,直接理解自然语言指令,代表工作包括提示控制与指令语音编辑等,这条路线最灵活,但通常把理解与生成放在同一个模型内 joint 训练,因此指令跟随能力在训练时就固定,且依赖大量指令与语音配对数据。 本文的不同在于运行阶段与监督来源。运行阶段被切成指挥家与乐团两段,指挥家是外部文本大语言模型,负责把任意指令翻译成数值计划,乐团是 BatonTTS,负责把计划渲染为语音。

监督来源不再是人工写的指令标签,而是从语音本身自动提取的声学特征,再把特征写成文本形式作为条件。这样做的好处是训练时不需要人工标注讽刺对应多高的音高,只需要让模型学会数值与声音的对应,语义到数值的映射留给推理时的大语言模型完成。代价是推理链条变长,且计划质量依赖外部模型的语言理解能力。

为什么直接微调大语言模型做语音不等于用好了语言智能?

一个常见的误解是把预训练大语言模型当作主干,再把语音离散化为词元一起训练,就自然继承了指令跟随能力。原文的判断是这种做法绕过了语言智能。原因是训练目标主要是下一语音词元预测,模型看到的大多是文本与语音的对应,而很少看到指令语义如何映射到韵律细节。举例来说,同样是生气,第一句可能是音高快速上升,第二句可能是高位后的果断下降,如果训练数据没有标注这种结构,模型很难从纯声学模仿中归纳出通用规则。

本文把问题重新定义为操作化。操作主义的白话含义是对于难以直接描述的概念,用一组可测量可执行的操作来定义它。对应到语音,就是不直接争论什么是讽刺,而是规定讽刺在当前说话人基线之上表现为哪些分段的音高、能量、音色数值。于是大语言模型的任务从生成波形退回到生成数字,这正是它擅长的文本推理。合成模型的任务从理解讽刺退回到执行数字,这正是它可以通过声学数据学会的映射。

问题难度被分解,而不是被掩盖。

两段式框架如何走完一个样本的全过程?

先沿一个具体样本走完全程。假设待合成文本是英文句子,指令是请用讽刺语气说。第一步,指挥家同时读入文本、指令和说话人基线,基线包括平均音高、平均能量、平均频谱质心,用于表示该说话人中性状态的参考点。指挥家先做语义切分,例如判断哪几个词应连成一个韵律段以保证每段约 1 秒以上,避免过短片段导致特征不稳定,然后为每个段输出词串与 5 个特征数值。

输出格式是 JSON 列表,每个字典对应一段,数值精度有规定,例如音高均值取整数,能量取 3 位小数。第二步,乐团读入原文文本与该 JSON 计划,自回归生成离散语音单元,再经条件流匹配模型生成梅尔谱,最后经 HiFi-GAN 声码器生成波形。 下段导读图一的阅读方法,该图展示了从左到右的主路径与中间的特征接口,是理解分工的关键,像素细节包括左侧输入框、中间机器人与特征框、右侧指挥棒与波形。

看图路径: 1. 先从左侧虚线框找到指令与待合成文本两路输入;2. 再看中间机器人输出的特征虚线框中词与数值如何一一对应;3. 最后沿右侧箭头看特征框如何进入 BatonTTS 并变为波形输出

原论文 Figure 1:Illustration of BATONVOICE: (1) An LLM, acting as a conductor, interprets the user’s instructions…

论文图 1。原论文 Figure 1:“Illustration of BATONVOICE: (1) An LLM, acting as a conductor, interprets the user’s instructions and generates explicit vocal features.”。

该图显示左侧虚线框同时给出指令与文本,中间机器人即大语言模型输出包含词与音高斜率、能量、频谱质心的特征框,右侧 BatonTTS 把特征框转为波形。教学要点是接口完全是文本数字,左右两段可以用不同模型实现,升级指挥家不需要重训乐团。

操作主义 × 声学特征计划: 操作主义分工是把抽象的风格指令转化为可测量可解释的操作量,声学特征计划分工是承载这些操作量的文本载体,包括分段的音高均值与斜率、能量均值与斜率、频谱质心以及分段词串,搭配理由是纯文本大语言模型不能直接输出波形但能读写数字,只有把声音对象化为数字文本才能让其语言理解能力直接作用于合成,组合意义是形成指挥家输出计划、乐团执行计划的可检查接口。

指挥家 × 乐团: 指挥家指负责理解文本与指令并生成声学特征计划的外部大语言模型,乐团指负责把文本加特征计划转为离散语音单元再经声码器还原波形的 BatonTTS,搭配理由是把开放式语义推理与声学保真解耦,使推理能力可随外部模型升级而升级而无需重训合成器,组合意义是推理错误与合成错误可以分别定位到计划数值或声学渲染。

BatonTTS 内部有哪些组件,哪些更新哪些冻结?

BatonTTS 由两大部件组成。第一是语言模型主干,原文使用开源的 Qwen3-1.7B 与 Qwen2.5-0.5B 两个规模,负责自回归生成包含文本、特征计划、语音单元的序列。白话解释是主干像一个读者,先读文本与计划,再逐个写出声音单元。第二是语音解码器,直接复用公开的 CosyVoice2 解码器,包括语音单元编码器、条件流匹配模型与 HiFi-GAN 声码器,负责把离散单元变为梅尔谱再变为波形。原文明确该解码器在整个训练过程中保持冻结,训练只更新语言模型主干,使其学会按语言条件控制特征。 下段导读图二的阅读方法,该图展示了有监督微调阶段的数据流向与三色词元划分,需要区分文本分词器与语音分词器的输入来源。

看图路径: 1. 先看底部文本特征语音三路输入分别进入哪种分词器;2. 再看中间灰色长条上方与下方的词元色块如何对齐;3. 最后确认语音经提取器分叉为特征与语音词元的两条路径

原论文 Figure 2:Overview of the SFT stage of the BATONTTS framework.

论文图 2。原论文 Figure 2:“Overview of the SFT stage of the BATONTTS framework. We extract vocal features from speech and verbalize them into a textual format.”。

该图底部显示文本进入文本分词器,语音同时进入语音分词器与特征提取器,提取出的特征再进入文本分词器,上方灰色长条表示统一的下一词元预测。黄色对应文本词元,橙色对应特征词元,紫色对应语音词元,灰色为特殊起止词元。关键动作是训练序列把文本、特征、语音拼接为一个序列,推理时特征段改由外部大语言模型提供。

文本分词器 × 语音分词器: 文本分词器分工是把待合成文本与文本化的声学特征计划切成文本侧词元,语音分词器分工是把波形切成离散语音单元并在训练时提供监督目标,搭配理由是让语言模型在统一的下一词元预测框架下同时看到语义条件与声学目标,组合意义是模型学会在同一序列中先读计划再写出服从计划的声音。

特征提取的具体操作是先用预训练语音识别模型获得词级时间戳,再把相邻词合并直到每段超过 1 秒阈值,最后用 Parselmouth 库提取每段的音高、能量、频谱质心。分段词数隐含语速信息,词典边界隐含停顿位置,这是原文明确写出的两个隐含含义。重建一致性处理也很重要,由于解码器不能完美重建原始波形,原文从解码器重建后的波形中提取特征,保证训练时看到的特征分布是乐团能够渲染的分布。

三阶段训练每一步吃什么数据、算什么损失、解决什么问题?

第一阶段是预训练,目标是建立基础的文本到语音能力。数据是约 103K 小时的大规模多说话人英文语音文本对,语音经 CosyVoice2 分词器变为离散单元,文本与语音单元拼接为长序列,用因果语言建模目标做下一词元预测。实现上把序列打包为 4096 长度块以减少填充,在 80 卡上训练 3 轮,优化器为 AdamW,学习率为 1e-4,含 500 步热身,全局批量 640,使用 DeepSpeed ZeRO-2 节省显存。 第二阶段是有监督微调,目标是建立特征条件生成能力。

数据由两部分组成,一是多来源的表现力语音经解码器重建后再提取特征,二是口语化对话文本经基线合成后再提取特征,合计 377619 条、超 500 小时。训练前过滤掉高词错率与异常慢语速样本,阈值分别为词错率 0.1 与语速每秒 1.5 词。输入序列拼接为文本、文本化特征、语音单元,损失仍是拼接序列上的自回归交叉熵,教会模型按计划生成声音。 第 3 阶段是偏好优化,目标是压低高词错与慢语速等失败模式。

构造方法是先用第一阶段模型为文本生成基线语音,若词错率高或语速慢则记为拒收样本,再用第二阶段模型为同一文本生成候选,若词错低且语速达标则记为优选样本,并保留其对应的特征计划,形成三元组。优化采用锚定偏好优化的下降变体,以微调模型为参考策略,在同一计划前缀下增大优选与拒收的奖励间隔,同时约束不偏离参考过多。训练量为微调 3 轮加偏好优化 1 轮,偏好样本 9823 条。

有监督微调 × 偏好优化: 有监督微调分工是教会模型在给定文本与声学特征计划条件下自回归生成对应语音单元,建立特征数值到声学实现的映射,偏好优化分工是在此基础上用成对的优选与拒收样本压低高词错率与过慢语速等失败模式并强化对计划的服从,搭配理由是仅靠模仿会保留数据中的低质量模式,需要第二阶段用质量对比信号做校正,组合意义是先获得可控性再获得可用性。

用什么数据、什么指标、与谁比较,条件是否可比?

可懂度评测使用 Seed-TTS 测试集,指标为词错率,用预训练自动语音识别模型计算,越低越好。情感控制评测使用 Emotion 数据集的精选子集,每种情感 100 条,覆盖喜悦、悲伤、愤怒、惊讶、恐惧,指标为情感分类准确率,用 Gemini-2.5-Pro 只根据说话风格而非语义内容分类,越高越好。为缓解单一评测器的偏差,附录还用基于 Whisper 与 Wav2vec2 的两个语音情感识别模型复核。自由指令跟随因缺乏自动指标而采用人工评测,从 Social IQa 取 50 个社交情境,再生成角色扮演式详细指令与待合成句,由 3 名标注者评价,3 人一致性为 0.61。

比较对象包括闭源的 Minimax 系列与开源的 Spark-TTS、CosyVoice、CosyVoice2、Higgs Speech V2。需要强调的公平条件是 BatonVoice 的特征控制后训练只用英文数据,且指令数据为 0 小时,而 CosyVoice 与 CosyVoice2 分别使用 556 与 1500 小时指令数据。中文评测的文本与指令由 Gemini-2.5-Pro 翻译,BatonTTS 后训练未见中文,因此属于零样本跨语言测试。推理时指挥家固定使用 Gemini-2.5-Pro 生成计划,除非在分析指挥家能力时替换为其他模型。

词错率 × 情感分类准确率: 词错率分工是衡量合成语音可懂度的自动语音识别指标,数值越低表示转写与原文越一致,情感分类准确率分工是衡量合成语音是否听起来符合目标情感的感知指标,数值越高表示越符合,搭配理由是可控合成必须同时守住可懂底线与表达上限,组合意义是防止用牺牲清晰度换取夸张情感的片面优化。

主结果显示了什么收益,代价与未胜出项在哪里?

比较问题是在同等可懂度约束下,谁的情感表达更准,公平条件是同一英文情感集与同一 Seed-TTS 可懂集,指标方向是情感准确率越高越好、词错率越低越好。下表整理英文主结果的必要基线与可运行策略,覆盖闭源最强项与开源对照。

模型条件评测语言可懂度词错率情感准确率指令标注数据
Minimax-2.5-HD 闭源基线英文1.548.6%未报告
CosyVoice 开源基线英文3.443.8%556 小时
CosyVoice2 开源基线英文2.137.8%1500 小时
BatonVoice-1.7B 本方法英文2.557.6%0 小时

表后解释是收益与代价并存。

收益是 1.7B 模型以 0 小时人工指令数据达到 57.6%,超过闭源最强的 48.6% 约 9.0 个百分点,也超过开源 CosyVoice 的 43.8%。代价是可懂度 2.5 虽优于 CosyVoice 的 3.4,但弱于 CosyVoice2 的 2.1、Spark-TTS 的 1.9 与 Minimax 系列的 1.5,说明表达增强并未完全免费。未胜出项必须正视,即纯可懂度榜首仍是闭源模型,0.5B 规模的 BatonVoice 词错 2.9 与情感 52.8% 也弱于 1.7B 规模,表明规模仍有影响。附录的另两个情感识别器给出 33.8% 与 36.2%,虽绝对值低于大语言模型评测,但仍领先同期开源基线,报告显示结论不是单一评测工具的假象。

下段导读图四的阅读方法,该图用愤怒案例展示从定性推理到定量 JSON 的映射,需要把增量数值与基线对应起来看。

看图路径: 1. 先看顶部说话人基线三行数值作为比较起点;2. 再看中间两段英文分段各自对应的音高能量数值变化方向;3. 最后看底部预测特征平均值括号内增量与情感识别结果

原论文 Figure 4:Illustration of the LLM’s reasoning process for generating vocal features.

论文图 4。原论文 Figure 4:“Illustration of the LLM’s reasoning process for generating vocal features.”。

该图顶部给出说话人基线平均音高 226、平均能量 0.008、平均频谱质心 1885,中间把句子切为两段并分别规定音高均值 350 与 325、能量与斜率等数值,底部显示预测平均值相对基线分别增加 111.5、0.0945、1290,最终情感识别为愤怒。教学动作是先核对每段数值的增减方向是否符合文本描述的上升挫折与坚定决心,再确认最终增量不是幻觉而是可被识别器感知的变化。 该案例支持计划的可解释性,但它只是单样本展示,不能推广为所有情感都如此精确,原文也未报告该映射的误判率。

分阶段与换指挥家能否证明能力来源?

比较问题是情感能力的提升究竟来自特征条件训练还是来自更大的指挥家,公平条件是固定被测的 BatonTTS 模型,只改变训练阶段或只改变推理时生成计划的大语言模型,指标方向仍是情感准确率越高越好。下表整理阶段消融、指挥家替换与中文零样本迁移的关键数字,均为原文实际可运行的配置。

对比维度具体条件英文情感准确率中文情感准确率关键代价或边界
训练阶段 1.7B仅基础合成23.2%未评测无指令跟随
训练阶段 1.7B加有监督微调52.2%未评测提升 29.0 个百分点
训练阶段 1.7B再加偏好优化57.6%56.2%需 9823 条偏好对
指挥家替换Qwen3-1.7B 生成计划29.8%未评测小模型推理弱
指挥家替换Gemini-2.5-Pro 生成计划57.6%未评测依赖外部大模型

表后解释需区分直接报告与有限解释。报告显示阶段贡献明确,1.7B 从 23.2% 经微调到 52.2%,再经偏好优化到 57.6%,0.5B 也有 25.8% 到 51.6% 再到 52.8% 的单调提升,支持特征条件训练是关键。

指挥家替换显示固定乐团下,计划生成器从 Qwen3-1.7B 的 29.8% 经 Qwen3-80B 的 39.8%、Qwen3-Max 的 47.8% 一路升至 Gemini-2.5-Pro 的 57.6%,支持语言智能越强合成越好的判断。中文零样本 56.2% 超过 CosyVoice 的 52.0% 与 Minimax-2.5-Turbo 的 50.6%,且后训练未见中文,支持跨语言迁移。但相关性不是因果,原文未测量计划数值误差与最终情感误判的对应率,也未报告中文可懂度细节,因此不能承诺每种语言都同等有效。 下段导读图三的阅读方法,左图看阶段消融,右图看指挥家能力曲线,纵轴均为准确率,越高越好。

看图路径: 1. 先看左图 0.5B 与 1.7B 两组中绿色蓝色红色三根柱子的高度排序;2. 再看右图横轴从小模型到大模型柱子是否单调升高;3. 最后对比左右两图最高柱标注的 57.6 是否为同一量级

原论文 Figure 3:Impacts of different stages and LLMs.

论文图 3。原论文 Figure 3:“Impacts of different stages and LLMs.”。

该图左半显示 0.5B 与 1.7B 两组中绿色基线最低,蓝色加微调大幅升高,红色再加偏好优化最高,1.7B 红色柱标注 57.6。右半显示横轴模型能力增强时柱子单调升高,从 29.8 经 39.8、43.8、47.8、49.6、56.2 升至最高。像素可辨的数值不要硬读未标注的中间刻度,结论应限定为趋势成立而非每一步差值精确。

哪些边界未被评测,哪些成本必须单独计算?

原文明确的局限包括语言范围、潜在风险、训练成本与推理效率。语言上训练与评测以英文为主,形态丰富或声调语言未充分测试,中文情感迁移虽强但只是情感子集,不能推广到所有任务。风险上大规模数据可能含未过滤有害内容,模型仅供研究,不建议无安全过滤直接上线。训练上预训练需 80 卡约 1 天,加上重建、过滤与 3 阶段流程,对复现者是真实门槛。

推理上乐团本身与 CosyVoice 接近,首词元时间 0.04 秒对 0.07 秒、实时率 0.73 对 0.76 基本相当,但指挥家经开放接口生成 JSON 计划约需 20 秒,受服务商与网络影响,这是当前主要延迟瓶颈。总体趋势不等于每步都成立,例如偏好优化虽平均提升,但在个别样本上可能改变语速与停顿,需要听感复核。未测量的量包括计划生成失败率、数值越界处理、长文本稳定性与实际部署延迟分布,在宣称改善前必须补测。

复现先做什么,需要哪些数据与配置?

比较问题是复现最小闭环需要准备什么,公平条件是按原文的 3 段流水线而非端到端 1 次训练。下表整理原文报告的数据规模与过滤阈值,是复现前必须固定的信息条件。

流水线阶段数据来源与规模关键阈值输出物
预训练VoxBox 约 103K 小时英文打包 4096 词元基础合成主干
有监督微调377619 条超 500 小时词错率 0.1 语速每秒 1.5 词特征条件模型
偏好优化9823 条偏好对同上质量标准最终 BatonTTS

表后解释是具体动作与代价。

先跑通特征提取,包括词级对齐、按 1 秒阈值合并、Parselmouth 提取五项特征,并确认从解码器重建波形中提取而非直接从原始波形提取,否则训练与推理分布不一致。再按过滤阈值剔除高词错与慢速样本,否则偏好构造的正负例会混入噪声。代码当前可用,但复现仍需自行准备 VoxBox 与附录所列的表现力语料及对话文本,权重与数据并非一键可运行。特征数值精度需与模板一致,否则外部大语言模型生成的计划可能被解析失败。

推理时先缓存常用指令的计划以摊薄指挥家延迟,再调用乐团合成,这是原文建议的实用折中。

何时值得尝试这种解耦,还需补哪项验证?

当你的任务有大量无标注语音但缺乏指令标注,且你能调用较强的大语言模型做推理时,这种解耦值得尝试。它的核心收益是把语义理解外包给持续进步的文本模型,合成器只需专注执行数字计划,因此在新情感、新指令、甚至未见语言上更易迁移。当你的场景要求极低延迟或端到端可微调时,则需谨慎,因为 2 阶段引入计划延迟与误差传递,计划错了合成很难纠正。 复现后还需补三项验证。

第一,测量计划数值误差与最终感知误差的对应关系,确认改进指挥家确实通过更准的数值起作用,而非通过更长的文本提示偶然起作用。第二,在目标语言上同时报告词错率与情感准确率,避免只看情感而忽视可懂度。第三,报告指挥家失败率与延迟分布,包括 JSON 解析失败、数值越界、分段过碎等情况,并给出回退策略。只有补齐这些,才能把论文报告的 57.6% 与 56.2% 从特定评测条件下的结果,转化为可部署的收益判断。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总