英文题目:CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents

会议身份:conference:interspeech:2026:conference-paper-id:huang26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #众包评测 #语音编码 #语音质量评估 #语音克隆

评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Wen-Chin Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Nicholas Sanders:机构信息未能从会议 PDF 纯文本可靠映射
  • Erica Cooper:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文任务是以待测语音与同说话人异语句参考语音为输入,输出自然度、说话人相似度与口音相似度三维平均意见得分,难点在于口音相似缺乏统一主观协议且易与音质和音色混淆。作者先从VCTK筛选32位说话人覆盖10种口音、每人5句共160句真值,再用9个神经编解码器重合成与15个大语言模型克隆开源系统生成4000个样本以覆盖宽质量谱。前一步样本进入众包听音环节,由25名听音人完成19600条三维标注使每样本约获4.9次评分,最后叠加词错误率、说话人余弦相似度、口音余弦相似度与UTMOS预测分做系统级关联与偏差分析。相对已有方法关键差异在于同时评估重合成与语音克隆并分离说话人与口音相似度量,使口音泛化与音色保持能力可被独立检验而非混为音质好坏。在包含9个重合成与15个克隆系统的基准下,NanoCodec的S-NAT得分为4.073,高于Ground Truth的S-NAT得分4.045。结论适用边界是朗读式英语多口音、开集开源系统与众包听音场景,尚未验证自发对话、强噪声、非英语口音及商用闭源系统的外推有效性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://github.com/Plachtaa/VALL-E-X — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么要在口音语音上重测编解码与合成?

输入是这篇论文的原文证据与官方图像素情况,目标是为刚进入语音音频领域的研究生还原可核对的方法与结论,必须保留的信息包括数据来源、系统划分、听音维度、客观指标定义与关键对照,输出是 1 篇按学习依赖展开的中文技术解读。

神经音频编解码这个术语初学者可以先理解为把语音波形压缩成紧凑离散符号再解压回波形的工具,英文是 neural audio codec,后文简称编解码。它的兴起与大语言模型语音合成密切相关,因为离散符号可以直接被语言模型建模,从而把语音生成变成类似文本生成的序列预测问题。论文要解决的矛盾是已有编解码基准多关注标准语音的重建质量与判别式下游任务的客观指标,很少在语音合成语境下做主观评价,更少覆盖口音这类非标准语音。

平均意见分这个术语先白话解释为请多位听音人打分后取平均的质量度量,英文是 mean opinion score,后文简称 MOS。自然度、说话人相似度与口音相似度是本研究的 3 个人评维度,分别回答好不好听、像不像同一人、像不像同一口音。初学者容易把三者混为一谈,但论文刻意分开,因为一个系统可以音质受损却仍保留可辨认的说话人与口音特征。

从学习路径看,需要先理解编解码重合成与语音克隆是两类不同任务,再理解为什么选择带口音的语料与多口音听音人,最后才能读懂客观指标预测力与同口音偏置的分析。本文只讲论文实际研究的跨英语口音的重合成与克隆评价,不扩展到情感或音乐等无源任务,教学中举的例子会明确标为例子。

已有编解码基准与口音合成评价缺了哪一块?

已有路线大致可分为编解码基准、基于编解码的大语言模型语音合成,以及口音相似度评价三支。编解码基准如 DASB 与 Codec-SUPERB 侧重重建质量与下游判别任务,输入是标准语音,目标是比较不同压缩结构,监督多来自客观损失与分类准确率,运行阶段多在离线重建。语音合成路线如 VALL-E 展示的上下文学习能力,输入是文本加参考音频,目标是复制说话人甚至录音环境,评价多围绕说话人身份。口音合成评价则刚起步,有工作尝试用口音分类结果与嵌入余弦相似度反映感知相似度,但口音种类、系统数量与听音人数都有限。

同输入同目标对照下,本文与 DASB 类工作的输入都是语音波形,但目标从客观重建转向合成语境下的主观 3 维度感受。同监督对照下,本文不只依赖词错误率或说话人嵌入余弦,还收集人评标签作为金标准。同运行阶段对照下,重合成是编解码自身的编码解码闭环,语音克隆是调用编解码表征的生成任务,二者不能互相替代。

缺口正在于此:没有一个同时包含当代重合成系统与克隆系统、覆盖多种英语口音、并在自然度之外分离说话人与口音相似度的公开 MOS 基准。论文因此提出 CodecMOS-Accent,定位是补齐跨口音主观评价,而非提出新的编解码结构或合成模型。

论文把什么定义为待测任务与待答问题?

论文定义了两个待测任务。第一个是重合成,输入是一段真实语音,编解码模型先编码为压缩表征再解码回波形,输出是同一内容同一说话人的重建语音,目标是检验压缩本身丢失了什么。第二个是语音克隆,可视为语音合成的特例,输入是目标文本加一段同说话人的参考音频,输出是用参考人的音色与口音读出目标文本的语音,目标是同时保住内容可懂度、说话人身份与口音。

待答的研究问题有 3 组。第一组是系统层面表现:当代编解码与克隆系统在口音语音上的自然度、说话人与口音相似度如何排序,重合成是否以上限为真值而克隆是否可能超越真值。第二组是客观指标预测力:词错误率、说话人嵌入相似度、口音嵌入相似度与 UTMOS 预测分能在多大程度上预测 3 个人评维度。第 3 组是听音人偏置:与说话人同口音的听音人是否打分更高,不同口音听音人群体对同一批系统的排序是否一致。

初学者常误以为词错误率低就等于整体好,这正是论文要纠正的误解之一。论文把可懂度只当作质量的一个侧面,而把感知到的身份与口音保留作为独立维度来测量。

从一条样本看全流程做了什么?

沿一个样本走完流程有助于建立全局图。假设选中 1 位苏格兰口音女性说话人的一条 3 到 7 秒语音,先经下采样到 16 千赫兹并用强制对齐标签切除首尾静音,得到干净的真值样本。若测重合成,该样本直接送入某个编解码模型编码再解码,得到重建样本。若测语音克隆,则另选同一说话人的另一条不同样本作参考,连同目标文本一起送入克隆模型,生成读出目标文本但模仿参考人口音与音色的样本。

每个待评样本与一条参考样本配对形成一个标注单元,听音人给出 3 个 5 分制分数:自然度只看测试样本本身的发音韵律与噪声,说话人相似度比较测试与参考是否像同一人,口音相似度比较二者是否同口音而不要求同人。客观侧同时计算 4 类指标:用 Whisper 算词错误率,用开源 ECAPA-TDNN 算测试与参考的说话人嵌入余弦,用在 CommonAccent 上训练的 ECAPA-TDNN 算口音嵌入余弦,用 UTMOS 预测整体质量。

全库包含 4000 个编解码重合成与合成样本,覆盖 24 个系统与 32 位说话人的 10 种口音,大规模主观测试收集 19600 条标注。这种安排的理由在原文中是保持口音分布相对均衡并制造宽广的质量谱系,既有高保真配置也有低码率配置,从而支撑后续相关性与偏置分析。

重合成分支如何制造从高保真到低码率的谱系?

重合成组件的输入是 VCTK 来源的真值语音,论文选择 VCTK 的理由是质量、数量与多样性优于同期口音库。处理动作包括统一降采样到 16 千赫兹、切除首尾静音、每位说话人选 5 条 3 到 7 秒样本,共得到 160 条真值样本,覆盖 20 位女性与 12 位男性说话人。这种构造保证了后续每个系统都在相同内容分布上被比较。

模型侧选择 9 个开源重合成系统,包括 Encodec、DAC、SpeechTokenizer、FACodec、Mimi、SNAC、WavTokenizer、NanoCodec 与 NeuCodec。多数采用残差向量量化结构,允许只用前几层码本实现灵活码率调节。论文刻意纳入某些模型的低码率配置,例如 Mimi 的 4.4 千比特配置、DAC 的 6 千比特配置、Encodec 的 1.5 千比特配置、SpeechTokenizer 只用前两层、WavTokenizer 的 40 赫兹配置,目的是让数据集中同时存在接近透明的重建与严重退化的重建。

神经音频编解码 × 残差向量量化: 神经音频编解码负责把输入语音压缩为离散表征再解回波形,残差向量量化则提供分层码本使研究者可以用前几层或低码率刻意制造质量谱系,两者搭配的理由是只有先固定说话内容与说话人再改变压缩程度,才能把音质退化与说话人及口音保留能力分开观察。

教学例子明确标为例子:好比把同一张照片分别存成高质量与极低质量压缩图,前者几乎看不出差别,后者虽模糊但仍能认出是谁以及大致风格,论文正是用这种谱系来检验语音中身份与口音是否比精细音质更鲁棒。

语音克隆分支如何固定参考信息与生成目标?

语音克隆组件的输入是目标文本加同说话人的另一条参考样本,输出是读出目标文本的克隆语音。关键动作是参考样本必须与测试样本来自同一说话人但内容不同,这样说话人与口音相似度评价才有明确锚点。若参考与测试内容相同,听音人可能被内容熟悉度干扰,若说话人不同则相似度无从谈起。

模型侧选择 15 个开源克隆系统,包括 VALL-E-X、TorToiSe、XTTS、FireRedTTS、MaskGCT、OpenAudio s1 mini、VevoTTS、CosyVoice 2、Llasa-1B、MetaVoice、Orpheus-TTS、VoiceStar、IndexTTS2、Chatterbox 与 NeuTTS Air,明确排除商业黑盒模型。这种全开源选择保证他人可复现调用,但也意味着结论只适用于所列开源生态,不能推广到未测的闭源系统。

上下文学习 × 语音克隆: 上下文学习指大语言模型语音合成根据一段参考音频推断应复制的属性,语音克隆是它的具体任务形态即给定目标文本与参考音频同时保持发音内容、说话人身份与口音,二者搭配的理由是编解码只解决信号重建而克隆还要解决从文本到带特定口音声音的生成,组合后才能检验编解码表征是否足以支撑跨口音泛化。

资源状态方面,证据中唯一给出第三方链接的是 VALL-E-X 的仓库,其可用性标注为 available 且状态码为 200,因此可写该仓库当前可用已公开,其余系统虽在正文中具名但本次证据未给出可达性声明,不做可用性断言。

本研究训练了什么,没有训练什么?

本研究没有训练新的编解码或合成模型,也没有微调 Whisper、ECAPA 说话人模型、口音识别模型或 UTMOS,训练节在此等价于数据构造与标注流程的说明。真实计算过程分为语料准备、系统推理生成、众包听音与客观指标计算 4 步,每步的输入输出与监督来源都按原文交代。

语料准备的计算是重采样、强制对齐切静音与按口音均衡抽样,不涉及梯度更新。系统推理是直接调用开源模型的已有权重生成波形,论文未报告任何参数冻结或更新细节,因此不能从模型名称推定其内部实现,也不能把无训练等同于确定性求解,同一模型在不同采样种子下仍可能有波动。客观指标计算是调用已有识别与评价模型做前向推理,词错误率来自 Whisper large-v3 转写,说话人与口音相似度来自嵌入余弦,UTMOS 来自东京大学系统。

缺项需要明确指出:原文未给出各克隆系统的采样超参数、解码温度或是否多次采样取平均,也未说明众包平台的播放校准与听音环境控制细节。复现时只能按默认推理配置调用,并保留这些未报告项作为不确定性来源。

数据划分、听音协议与客观指标如何对齐?

数据层面,源材料为 VCTK,按 VCTK 自带口音标签选出 32 位说话人跨 10 种口音,每人 5 条得到 160 条真值。加上 9 个重合成与 15 个克隆系统的生成样本以及真值参评,总计 4000 样本。听音层面,通过众包公司 Intergroup 招募 25 位听音人,每人评价 784 样本,共 19600 条标注,平均每样本 4.9 条标注,3 个分数均为 5 分制,并可选填写文字评论。听音人构成是 19 位美国、2 位加拿大、3 位英格兰与 1 位苏格兰自报口音,未收集除年龄、耳机信息与自报口音外的个人信息。

质量控制动作是检查评论并剔除 55 个仅含静音或质量过低无法公平评价的样本及其对应的 275 条标注。客观指标聚合在系统层面取均值,主观分数报告均值加 95 置信区间,相关性分析同时报告话语级与系统级 Pearson 系数,偏置分析用 Welch t 检验比较同口音与不同口音听音人的均值,并用 Spearman 秩相关比较不同听音人群体对同一口音子集的系统排序。

下面这张表回答数据集规模是否如所述那样覆盖系统、说话人与口音,比较条件是同一 VCTK 抽样流程下的全库与真值子集,指标方向是数量越大覆盖越广,但数量本身不代表质量高低。

划分样本量系统数说话人数口音数
全库4,0002432ten accents
真值子集160 ground truth samples1 类真值32ten accents
任务划分4,000 codec resynthesis and TTS samples9 resynthesis and 15 TTS systems32ten accents

该表显示全库以 4000 样本支撑 24 系统与 32 人 10 口音的比较,真值子集以 160 样本提供上限锚点,任务划分为 9 重合成加 15 克隆。代价是 VCTK 本身含录音伪影,真值自然度并非天花板,后文结果中多套克隆系统在自然度上超过真值,未胜出项是部分低码率重合成系统在自然度上远低于真值,这正是刻意纳入低码率以拉开谱系的结果,未评测边界是 10 种口音之外的口音与情感等非标准语音。

系统级主观排序支持什么判断,又有何反例?

测的是 3 个人评维度的系统均值,与谁比是真值与同类系统互比,条件一致性来自相同 160 条源内容的派生样本与相同听音池,指标方向是三项主观分数越高越好,词错误率越低越好,其余客观相似度与 UTMOS 越高越好。

论文报告真值在自然度排第 9,说明 VCTK 录音伪影使现代高保真克隆系统可在纯听感上超越真值,但在说话人与口音相似度上真值仍居首,支持听音人能把身份与口音判断与整体音质分开。重合成侧 NanoCodec 与 FACodec 自然度接近 4.07 并列前列,而 Encodec 1.5 千比特、SpeechTokenizer 两层与 DAC 6 千比特自然度仅 1.3 到 1.4 区间,但三者的说话人与口音相似度仍保持在 2.8 到 3.5 以上,支持全局属性先被捕获、精细无伪影质量后习得的层级假说,其中 SpeechTokenizer 仅用前两层仍保留可感知身份与口音,直接与认为前几层只编码语言学内容的 prevailing 假设相矛盾。克隆侧 CosyVoice 2、OpenAudio s1 mini、Llasa-1B 与 Chatterbox 自然度超过 4.2 并超越真值,但 Orpheus-TTS 与 VALL-E-X 等在自然度与相似度上偏低,说明架构新颖不等于绝对质量更高。

说话人相似度 × 口音相似度: 说话人相似度要求判断测试样本与参考样本是否像同一人说话,口音相似度要求判断二者是否属于同一口音而不要求是同一人,前者关注个体音色与习惯后者关注群体发音模式,搭配评价的理由是二者在听感上容易互相牵连,组合后才能发现模型先抓住全局身份与口音再提升无伪影高保真度的层级现象。

下面这张表回答听音协议的标注密度是否足以支撑系统级排序,比较对象是全体听音任务的人力分配,指标方向是每样本标注数越多系统均值越稳,但人力多不直接代表口音覆盖均衡。

听音人总数每人评测数标注总数每样本标注数量表
25 listeners784 samples19,600 annotations4.9 annotations per samplefive-point scale
25 listeners784 samples19,600 anotations4.9 annotations per samplefive-point scale
19 US 等分组784 samples19,600 annotations4.9 annotations per samplefive-point scale

该表的主要收益是每样本约 5 条标注使系统均值置信区间可用,代价是听音人高度偏向美国口音,19 位美国听音人主导了自然度判断,未胜出项是非美国口音组样本量过小,苏格兰仅 1 人,导致跨组秩相关的最小值在部分口音上低至 0.4 左右,未评测边界是耳机类型与播放环境对低质量样本的影响未量化。

客观指标在多大程度上能预测主观感受?

测的是主客观之间的 Pearson 相关,话语级看单条样本的对应关系,系统级看 24 加真值系统的均值排序是否一致。条件是同一批 4000 样本的配对计算,指标方向是相关系数越接近 1 预测力越强。

论文报告话语级说话人与口音相似度相关为 0.75,系统级高达 0.97,支持二者紧密耦合,即能抓住说话人的模型往往也抓住了口音。系统级自然度与说话人相似度相关 0.66,与口音相似度相关 0.59,为中等相关。客观侧系统级说话人嵌入余弦与主观说话人相似度相关 0.86,与主观口音相似度相关 0.90,甚至高于口音嵌入余弦对主观口音相似度的 0.81,支持用说话人判别能力蕴含口音判别能力的判断,但这只是相关性不是因果。

词错误率与所有主观分数相关都很低,话语级接近零,系统级对自然度仅负 0.40,因此论文主张不应把词错误率当作整体质量的单一代理,它仍是可懂度的可靠度量。最意外的是 UTMOS 与自然度的系统级相关达 0.96,尽管 UTMOS 训练于 2022 年的 BVCC 且仅见过 2020 年前系统,论文的有限解释是 BVCC 多为高质量单说话人合成,而当前多说话人克隆仍处类似早年瓶颈,架构新颖不保证绝对质量超越。

主观自然度 × 客观语音质量预测: 主观自然度由听音人综合发音、韵律与噪声给出 5 分制评分,客观语音质量预测如 UTMOS 由模型直接从波形预测分数,二者搭配的理由是主观测试成本高而客观指标可快速迭代,组合意义在于检验 2022 年在旧系统上训练的预测器是否仍能预测 2020 年后新架构的自然度排序。

反证是话语级所有客观指标与主观的相关都明显低于系统级,例如 UTMOS 对话语级自然度仅 0.65,说明单条预测噪声大,只能用于系统排序而不能替代单条人评。适用条件是系统数量较多且质量谱系够宽时相关才稳健,若只比较头部高保真系统,相关可能下降,复现时应同时报告话语级与系统级。

把听音人口音换掉,评分与排序会变吗?

这节按论文特有的偏置分析展开,可视为对主结果的消融式对照:把听音人按是否与测试样本同口音分组,观察均值差异与排序一致性。测的是同口音组与不同口音组的均值差与 p 值,以及不同口音听音人群体对同一测试口音子集的系统排序 Spearman 相关。

论文报告仅看真值时,同口音组在说话人相似度与口音相似度上显著更高,p 值分别为 0.011 与小于 0.001,而自然度差异不显著 p 为 0.160,支持听音人对熟悉口音更宽容但对真实人声的自然度判断相对稳健。扩展到全部样本时,3 维度都出现显著同口音偏置,自然度也显著,论文假设这是因为多数听音人为美国口音而多数模型训练数据偏向美式英语,合成输出更符合美国听音人对自然度的期待,但这属于可能待验证的解释而非直接报告的因果。

同口音偏置 × 听音人分组: 同口音偏置指与测试样本口音相同的听音人打出更高分的现象,听音人分组指按自报口音把美国、加拿大、英格兰与苏格兰听音人划分并比较同一批系统的排序,分工上前者是待检验的效应后者是检验手段,搭配理由是只有让不同口音组评价相同口音子集并做秩相关与均值检验,才能区分熟悉度带来的宽容与真实系统差异。

按测试样本口音拆分的群体间排序一致性显示,多数口音下平均秩相关在 0.7 以上,南非、澳大利亚与英格兰等子集一致性较高,而威尔士等子集平均仅 0.52 且最小值更低,但论文明确表示当前数据不足以支持越是小众口音分歧越大的先验假设。限制是每组人数不均衡,加拿大 2 人、苏格兰 1 人,某些配对的相关基于极少听音人,推广时需谨慎。

哪些边界会限制结论的推广?

数据边界上,源材料仅来自 VCTK 的 10 种英语口音与 32 位说话人,未覆盖 CommonVoice 或 AccentDB 中的更广泛口音,也未涉及情感、年龄或录音环境多样性。VCTK 本身的声学伪影使真值自然度不是上限,这虽是重要发现,但也意味着重合成上限被数据集质量压低,不能直接推广到高保真录音室语料。

系统边界上,仅纳入开源模型,排除了商业黑盒,结论不能代表未测闭源系统的口音能力。听音人边界上,25 人中 19 人为美国口音,英格兰 3 人、加拿大 2 人、苏格兰 1 人,文化与口音多样性不足,同口音偏置的估计主要由美国组驱动。指标边界上,口音客观相似度依赖在 CommonAccent 上训练的 ECAPA 模型,其分类偏置可能传导到评价中,直接用其做优化目标可能放大偏置。

统计边界上,话语级相关远低于系统级,说明单样本预测仍不可靠。UTMOS 的高相关建立在包含低质量低码率系统的宽谱系上,若只在头部系统间比较,预测力可能下降。缺失证据不是技术错误,但未测量延迟、推理成本与误判率时,不能承诺这些量得到改善。

要复现与复用该基准,先做什么?

复现先做三件事。第一是按原文重建语料抽样:将 VCTK 降采样到 16 千赫兹,用公开强制对齐标签切除首尾静音,按口音标签选 32 位说话人每人 5 条 3 到 7 秒样本得到 160 条真值,并为每条克隆测试样本随机配同一说话人的另一条不同样本作参考。第二是调用所列 9 个重合成与 15 个克隆开源模型的默认推理流程生成对应样本,保留低码率配置以复现宽谱系,并记录采样种子与超参数以弥补原文未报告项。第三是复刻听音协议:每样本约 5 条标注、3 维度 5 分制、同时呈现测试与参考,收集年龄、耳机与自报口音,并剔除静音或无法公平评价样本。

客观复算需用 Whisper large-v3 算词错误率,用 speechbrain 的 ECAPA 说话人模型算说话人余弦,用 Jzuluaga 的 CommonAccent 口音模型算口音余弦,用 UTMOS 算预测质量,并在系统层面取均值后计算 Pearson 与 Spearman 相关,用 Welch t 检验比较同与不同口音组。代码开源、权重下载与系统可运行要区分:论文承诺数据集将在近期公开,但本次证据未给出数据集链接,不能写已公开;第三方仓库中仅 VALL-E-X 有本次确认可达的链接,其余模型需自行核对原始仓库。

还需补的验证包括均衡招募更多非美国听音人、补充高保真语料上的真值上限、以及在头部系统子集上重测客观指标预测力,避免把全谱系上的高相关误读为细粒度排序能力。

何时值得尝试该思路,还需回答什么?

当研究目标是让人评指导编解码选型或口音克隆优化时,该基准值得尝试,因为它同时给出自然度与身份口音保留的分离视角,并证明低码率下身份口音仍可能保留而音质先崩。当目标只是提升可懂度时,不必照搬全套 3 维度,词错误率已足够。当目标是细粒度口音风格控制时,该基准只能作为起点,还需补充更细的韵律与音段标注。

论文特有的误解需要澄清。其一,真值自然度第 9 不是标注错误,而是 VCTK 伪影与现代去噪生成共同作用的结果,重合成受真值上限约束而克隆可通过丢弃环境噪声超越真值。其二,前两层码本仍保留说话人与口音不是证明前几层只做语言学编码的旧假设错误,而是说明旧假设在新模型上不成立,需重新审视分层语义。其三,UTMOS 高相关不是证明旧模型已解决新问题,而是宽谱系与任务难度错位下的现象,纳入新数据训练仍有必要。

最终收束是可核对的事实:4000 样本、24 个系统、32 人 10 口音、19600 标注、25 听音人、3 维度 5 分制、话语级 0.75 与系统级 0.97 的说话人口音耦合、系统级 0.96 的 UTMOS 自然度预测、以及显著的同口音偏置,这些共同支持以更多元听音人与人评训练的评价模型推进更以人为中心的编解码与口音合成研究。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总