英文题目:Unified Neural Speech Coding for Multiple Sampling Rates

会议身份:conference:interspeech:2026:conference-paper-id:huang26l_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#Adapter #向量量化 #流式处理 #语音 #语音编码

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jiankai Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Junteng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Lizhong Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Liang Wen:机构信息未能从会议 PDF 纯文本可靠映射
  • Ming Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhan Ma:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为16 kHz、24 kHz与48 kHz语音波形,输出为同采样率重建波形与离散编码,难点在于相同卷积感受野对应不同物理时长,且带宽差异导致频谱统计与中间特征分布偏移,难以共享量化器。先由输入端采样率适配器将各采样率波形映射到统一内部时间网格,输出时间对齐后的内部波形以消除物理时长错位;再将该对齐波形送入共享编码器与残差向量量化提取并离散化隐表示,输出跨采样率共用的码本索引并送入解码侧重建内部波形;最后经块内采样率调制器按采样率做通道级仿射校准后,由输出适配器将重建的内部波形恢复为目标采样率。与外部重采样或多分支、变步长方案不同,该设计把采样率感知压缩到接口转换与特征校准两个轻量环节,主干与码本完全共享。在LibriTTS 24 kHz评测设置下,统一模型的ViSQOL为4.224,高于专用模型Ours@24kHz的ViSQOL 4.168。结论仅在英语朗读、固定三档采样率和固定1.5 kbps下验证,未覆盖任意采样率、噪声混响与可变码率。单模型参数量19.65M,三档计算量为2.14/2.58/2.34 G MACs,原文未披露推理时延实测。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,哪些信息必须先记牢?

这篇解读面向刚进入语音与音频编码的研究生,目标是把 1 篇统一多采样率神经语音编码器讲到可核对、可复述。输入是原始语音波形,采样率覆盖日常部署最常见的 3 种情况:宽带 16 kHz、超宽带 24 kHz 和全频带 48 kHz。输出同样是波形,但中间要经过压缩:编码器把波形变成连续隐特征,残差向量量化器把隐特征变成离散码本索引,解码器再从索引恢复波形。评价看重建质量与传输码率的折中,论文用听感与可懂度类客观指标报告效果,同时报告计算量与参数量。

必须先记牢的信息是采样率决定每秒样本数与可保留带宽,同一段语音在不同采样率下样本数不同、高频内容不同;若用同一套卷积直接处理,相同样本数的感受野对应不同物理秒长,特征统计也会漂移。输出是 1 篇按学习依赖展开的技术解读:先讲任务与已有路线,再走完一个样本的全流程,然后拆两个轻量组件与 3 阶段训练,最后讲实验条件、主结果、消融与复现要点。凡是教学举例会明确标为例子,不引入无来源的数值。

已有路线在多采样率上卡在哪里?

神经语音编码近年的主线是用深度生成建模加学习型量化改善率失真折中,但多数模型绑定固定采样率。论文把部署困难归纳为两类做法的代价:一是靠外部重采样把非匹配速率先转到模型原生速率,二是为每种速率各存各训一个专属模型,前者增加计算并可能损伤质量,后者增加部署与维护负担。

已有探索多采样率的工作被逐 1 对照:有用时频带切分但仍需固定速率转换的生成式多功能编码器,有用多速率专属重建分支做软解耦的方法,有按采样率改步长等结构配置的方法。论文的判断是这些做法没有做到完全共享骨干加单个残差向量量化模块且免外部重采样。初学者容易误以为重采样只是无损的前处理,实际上重采样滤波与编解码器的分析合成滤波是两套标准,串联会引入额外失真与计算。

另一误解是以为换个采样率只需改数据加载,实际上卷积核是以样本点为单位学习的,物理时长语义变了,学到的滤波器迁移性会下降。相关工作的对照维度因此固定为同输入波形、同重建目标、同监督来源与同推理阶段,避免把类别差异当成同条件胜负。

为什么混用采样率训练一个模型会不稳定?

把 16、24、48 kHz 混在一起训练一个编解码器,困难来自时间与频谱两方面。时间方面,同样 1 秒语音的样本数成比例变化,共享编码器若直接吃原始波形,离散时间步对不齐,感受野的秒长语义混乱。频谱方面,采样率决定带宽,高采样率保留更多高频,中间特征的均值方差等统计随速率漂移,单套量化码本要同时覆盖差异较大的隐分布,承诺损失与重建损失的优化方向会被拉扯。

对比例子:比如一段同样朗读内容分别存成 16 kHz 与 48 kHz,前者高频缺失、后者高频丰富,若强行共用码本而不校准,量化器可能偏向某一种带宽。此节配图比较传统范式与统一范式,传统路径在编解码器外加了重采样方块,统一路径把速率感知做进编解码器内部。

传统做法需外部重采样而统一做法把速率感知内建,下图左右对比能直接看出部署差异,阅读时先看输入输出箭头再看中间是否共享。

看图路径: 1. 先看上半传统路径中 24 与 48 kHz 支路的外部重采样方块与输出端表情符号差异;2. 再看下半统一路径中三条输入箭头是否直接进入采样率感知编码器而无外部重采样;3. 对比中间残差向量量化模块在两条路径中是否为单个共享方块;4. 确认输出端三条箭头颜色与对应输入采样率是否保持一致

原论文 Figure 1:Comparison of neural speech codec paradigms.

论文图 1。原论文 Figure 1:“Comparison of neural speech codec paradigms.”。

上图上半显示传统编码器与解码器固定在 16 kHz,24 与 48 kHz 支路在进出时都经过外部重采样方块,输出端用表情符号提示非匹配速率质量受损;下半显示采样率感知编码器与解码器直接接受 3 种速率输入并直出对应速率,中间仍是单个残差向量量化模块,输出端 3 路均为肯定评价。该图支持后文设计:时间对齐与特征校准必须内建,而不是靠前后处理补救。论文因此提出两个轻量组件分别处理时间网格与特征统计,并用渐进训练先稳定码本再引入多样性。

单套权重走完三种速率的全流程是什么?

沿一个样本走完全流程最利于建立整体感。假设输入是一段 24 kHz 语音与它的采样率标签,编码器先调用输入端采样率适配器把它变到内部统一网格,论文实现取 16 kHz 为内部网格。对齐后的信号进入堆叠 5 次的编码块,每块包含语音增强网络风格的卷积模块、采样率调制器与时间下采样,随后经长短期记忆网络建模长时依赖,再由共享残差向量量化器产生离散码。

解码端镜像操作:由码索引恢复隐序列,经长短期记忆网络与 5 次上采样块恢复内部波形,最后由输出端采样率适配器变回目标采样率,例如 24 kHz,得到重建波形。整个结构是全因果的,可做低时延流式推理。除两个轻量组件外,骨干与码本参数跨速率共享。

共享编解码骨干 × 通用残差向量量化: 共享编解码骨干负责把对齐到内部时间网格的波形变成连续隐特征并再变回波形,通用残差向量量化负责把该隐特征变成离散码字;二者搭配的理由是不同采样率经接口对齐后可用同一套滤波器和同一套码本,组合意义是用一套权重同时服务 3 种带宽而不为每种速率存专属模型。

下图给出编码器、量化器与解码器的完整排布,阅读时先沿主路径走一遍,再数重复块的内部顺序。

看图路径: 1. 从左侧三种采样率语音波形出发,沿输入采样率适配器向右追踪主路径;2. 数编码器虚线框内重复五次的三个子块顺序与解码器镜像顺序;3. 确认中间残差向量量化两侧各有一个长短期记忆模块的位置;4. 查看输出端采样率适配器如何分三路恢复到对应采样率

原论文 Figure 2:Unified multi-sampling-rate neural speech codec.

论文图 2。原论文 Figure 2:“Unified multi-sampling-rate neural speech codec.”。

上图左侧 3 路波形示意随采样率变密,经输入采样率适配器汇入同一编码器,编码器虚线框标注重复 5 次,每次含语音增强网络块、采样率调制器与下采样,其后是长短期记忆模块与残差向量量化模块;右侧解码器镜像放置上采样块与采样率调制器,最后经输出采样率适配器分 3 路恢复。该图把后文要拆的 2 个组件定位清楚:适配器只在波形接口处出现,调制器在每个重复块内出现。

采样率调制器如何按速率校准中间特征?

白话说,采样率调制器是一个按采样率查表的通道仿射层,英文为 Sampling-Rate Modulator,缩写为 SRMT。它不改变时间长度,只改变每个通道的数值分布。输入是某编码块的特征图,记为通道数乘时间步的矩阵;模块按输入采样率取出对应的一组缩放向量与偏置向量,对每个通道先乘缩放再加偏置,并沿时间维广播。设计灵感来自按条件做特征仿射的通用条件层,论文把它扩展到采样率条件,目的是显式校准跨速率特征统计,让共享量化器看到更一致的隐分布。

该层引入的速率专属参数量很小,但提供了明确的校准机制。下图展示其极简结构,理解时抓住两条线:主路特征直通,支路采样率经嵌入产生两组参数。

为避免把缩放与偏置的作用混淆,阅读下图时先分清主路与支路,再确认两个参数分别进入哪个运算圈。

看图路径: 1. 先看上方特征主路从输入到乘法圈再到加法圈的直线走向;2. 再看下方采样率经嵌入块分出两路参数的分支走向;3. 确认缩放参数指向乘法圈、偏置参数指向加法圈的对应关系

原论文 Figure 3:Architecture of the SRMT.

论文图 3。原论文 Figure 3:“Architecture of the SRMT.”。

上图显示上方特征主线进入乘法圈再进入加法圈,下方采样率先进入嵌入块,随后分出缩放参数指向乘法圈、偏置参数指向加法圈,背景浅色框标出条件分支范围。该结构说明调制器只做通道级仿射,不做上下采样,计算开销小且可插入每个编解码块。论文消融显示去掉它后感知敏感指标下降更明显,尤其在 24 kHz 上,这支持特征偏移是共享量化的一大障碍。

采样率适配器 × 采样率调制器: 采样率适配器分工在波形出入口做可学习速率转换以统一物理时长对应的样本网格,采样率调制器分工在每个编解码块内按采样率做通道仿射以校准中间特征统计;搭配理由是前者只解决时间轴不对齐、后者解决带宽不同带来的分布偏移,组合后共享骨干与单套量化器才能在异构输入下保持一致隐空间。

采样率调制器 × 特征线性调制: 采样率调制器是按采样率查表得到缩放与偏置的通道仿射层,特征线性调制是其借鉴的条件仿射思想;分工是前者把采样率标识变成每通道的伽马与贝塔,后者提供按上下文调整特征的通用形式,搭配理由是只用极少量速率专属参数即可缓解跨速率特征偏移,组合后单套残差向量量化器更易共享。

采样率适配器如何做可学习的速率转换?

白话说,采样率适配器是在波形出入口做速率转换的可学习卷积层,英文为 Sampling-Rate Adapter,缩写为 SRAT。它的目标是把不同采样率的波形变到统一内部时间网格,论文取 16 kHz 网格,骨干只在该网格上运行。对于整数比,可用带步长的卷积同时学习滤波与抽取,并在编解码目标下联合优化;对于非整数比,为避免分数步长与数值不稳定,采用级联的简单上采样与下采样实现有理数倍转换。论文明确给出 24 kHz 到 16 kHz 经可学习的 2 倍上采样再 3 倍下采样实现。

输出端适配器用转置卷积做逆变换,恢复目标速率与时间分辨率。因为只在接口处使用,骨干可全共享,重建的速率相关细节只由轻量接口层承担。初学者易把该模块等同于固定重采样,区别在于它的滤波参数随编解码损失学习,且与后文调制器分工不同:前者管时间轴对齐,后者管特征分布校准。去掉适配器后,离散步对应的物理时长不一致,有效感受野的秒长变化,分析合成算子的迁移性下降,论文报告三档速率均出现一致退化。

采样率适配器 × 内部时间网格: 采样率适配器是执行转换的可学习卷积层,内部时间网格是转换要对齐的目标时间轴,论文取 16 kHz 为内部网格;搭配理由是卷积感受野按样本点定义,直接混用会对应不同秒长,组合意义是骨干只看到统一网格,从而实现全参数共享而重建仍由轻量接口层恢复到目标速率。

三阶段训练每一步冻结什么、优化什么?

训练目标按前人做法加权组合四项:重建损失、对抗损失、特征匹配损失与残差向量量化承诺损失。论文采用 3 阶段渐进策略以稳定优化。第一阶段只在 48 kHz 数据上用重建加承诺损失预训练,目的是用高分辨率信号初始化共享骨干与码本。第二阶段混入 16、24、48 kHz 数据联合训练,并启用适配器与调制器以对齐时间结构、校准中间分布,改善骨干与量化共享的稳定性。

第 3 阶段在重建与量化稳定后再启用对抗与特征匹配做感知精修,并使用跨所有采样率共享的多尺度短时傅里叶判别器,使感知准则跨条件一致、减少偏向某速率。关于参数冻结与梯度路径,原文只明确各阶段启用哪些损失与组件,未报告分层冻结、停止梯度位置或判别器重置时机等细节,此处记为缺项,不从模型名推定实现。该课程的直觉是先锚定重建,再引入速率多样性,最后加感知目标,以减少早期跨速率条件干扰。

消融显示去掉渐进策略后三档速率质量一致下降,支持该排序的必要性,但未测量收敛步数或训练时长的定量节省。

3 阶段渐进训练 × 多尺度短时傅里叶判别器: 3 阶段渐进训练分工是先在 48 kHz 上稳定重建与码本、再混入 3 种速率启用对齐与校准、最后才加入对抗与特征匹配做听感精修,多尺度短时傅里叶判别器分工是在最后阶段提供跨采样率 1 致的感知准则;搭配理由是过早联合优化异构分布与对抗目标易干扰码本,组合意义是按课程先锚定重建再引入多样性与感知目标。

数据、划分、指标与硬件条件是否可复现?

实验覆盖 16、24 与 48 kHz 三档。16 与 24 kHz 用 LibriTTS,训练用 train-clean-100 与 train-clean-360,评测用 test-clean;其中 16 kHz 集由 24 kHz 音频下采样得到,以保持语言内容跨速率匹配。48 kHz 用 VCTK,随机选 1000 条作测试,其余作训练。实现基于 PyTorch 并用 AdamW 优化,在一台配英特尔至强铂金 8470Q 中央处理器与英伟达 GeForce RTX 3090 图形处理器的机器上训练 2,000,000 步,批量为 8,学习率从 1e-4 线性衰减到 1e-5。

报告指标为 ViSQOL、STOI、PESQ 与乘加运算次数,数值越高前三者越好,运算量越低越好。当指标要求特定采样率时,仅为计算指标才对参考与重建信号重采样,不用于编解码推理。基线含 EnCodec、DAC、SpeechTokenizer、FunCodec、StreamCodec 与 FlowDec 等,官方实现可用时采用官方实现,只报告其支持的配置。论文未报告主观听音、统计显著性方法与聚合口径细节,也未给出代码与模型权重可达性声明,按本次收到的资源状态不得声称已公开。

复现时需先对齐数据集划分与下采样做法,再固定码率与指标计算中的重采样环节,否则跨文数字不可比。

统一模型在可比码率下达到什么质量与开销?

要回答的核心问题是单套权重能否在三档速率上匹配速率专属模型,同时省掉多实例部署。比较条件是相同采样率与相近码率,指标方向为 ViSQOL、STOI 与 PESQ 越高越好,计算量与参数量越低越好。论文在 LibriTTS 的 16 与 24 kHz 以及 VCTK 的 48 kHz 上报告:统一模型在各档与专属基线竞争,且推理无需外部重采样流水线。关键定量证据集中在两处可逐字核对的句子,整理成下表以便对照采样率、码率与指标。下表提出的问题是统一模型在 24 与 48 kHz 的代表性工作点是否达到可用质量,公平条件是同为 1.5 kbps 附近的低码率,指标方向已如前述。

条件指标名码率本方法取值对照说明
24 kHz 语音ViSQOL 越高越好1.5 kbps4.22统一单模型直出对应速率
48 kHz 语音PESQ 越高越好1.5 kbps2.750统一单模型直出对应速率

上表两行分别对应 24 kHz 下 ViSQOL 为 4.22 与 48 kHz 下 PESQ 为 2.750,支持统一模型在低码率下仍保持有竞争力的重建质量,且避免为不同速率维护多个模型。代价与限制是该表只展示两个代表性工作点,未在此句中给出同码率下各基线的并排数字,完整基线对比需结合原文大表与官方实现的支持范围理解;不同指标不可互比,ViSQOL 与 PESQ 的差值也不代表同一维度的提升幅度。另一未胜出边界是高频丰富的 48 kHz 天然更难压缩,低码率下的绝对听感仍需结合主观评测验证,原文未提供该验证。

去掉哪个组件损失更大,单速率专家强在哪里?

消融按问题组织:时间对齐与特征校准各自贡献多少,统一是否以明显质量为代价。与单速率专家的对比中,3 个专家与统一模型用相同骨干与量化配置,专家去掉适配器与调制器且只在单一速率训练;结果是统一模型与对应专家在 ViSQOL 与 PESQ 上的差距很小,支持单模型替代多专属模型的说法,但原文未给出每档的统计显著性。组件消融显示去掉适配器导致三档一致退化,原因是接口不对齐使感受野秒长语义混乱。

去掉调制器在感知敏感指标上下降更大,24 kHz 的例子最典型。计算开销方面,统一模型以固定参数量服务全部速率,三档乘加运算量略有差异,其中 24 kHz 因有理数转换多出卷积操作而稍高。下表整理开销的可核对数字,比较问题是单套权重是否同时做到低参数与低计算,公平条件是同一模型分别跑三档速率。

模型形态支持速率参数量三档计算量备注
统一单模型16/24/48 kHz19.65M2.14/2.58/2.34 G MACs 按 16/24/48 kHz 顺序24 kHz 因额外转换稍高
速率专属多模型每次仅一种速率随实例数增长依各专属模型而定需维护多套权重

上表显示统一模型用 19.65M 固定参数覆盖三档,计算量分别为 2.14、2.58 与 2.34 G 乘加运算,支持低参数与持续低计算的判断,但也点出具体代价是 24 kHz 路径的额外卷积。反例是若只看单档质量,专属模型在个别指标上仍略占优,统一并未在所有格点全面胜出。隐空间一致性用最大均值差异衡量,差异越低表示跨速率隐分布越接近,下图比较完整模型、去双组件模型与仅 16 kHz 模型的差异。

完整模型在 3 组跨速率对上差异最小,去双组件次之,单速率模型最大,下图可按颜色逐组核对该排序。

看图路径: 1. 先按图例区分蓝色单速率模型、绿色去双组件模型与粉色完整模型的柱色;2. 再在三组采样率对下比较三根柱子的高度排序是否一致;3. 重点观察中间 16 kHz 对 48 kHz 组中蓝色柱明显最高的差异幅度;4. 确认纵轴为最大均值差异且越低表示隐分布越接近

原论文 Figure 4:Latent consistency analysis using Maximum Mean Discrepancy (MMD) across sampling-rate pairs.

论文图 4。原论文 Figure 4:“Latent consistency analysis using Maximum Mean Discrepancy (MMD) across sampling-rate pairs. Lower MMD indicates closer latent distributions.”。

上图横轴为 16 kHz 对 24 kHz、16 kHz 对 48 kHz、24 kHz 对 48 kHz 3 组,纵轴为最大均值差异,蓝色单速率模型柱最高尤其在 16 对 48 组,绿色去双组件模型居中,粉色完整模型在 3 组均为最低。该结果支持时间网格对齐与特征统计校准共同促成共享隐空间,但需注意该指标只反映分布接近程度,不直接等同于听感优劣,且像素不能精确读出小数后 2 位时不硬写具体数值。

哪些退化与边界尚未解决?

此节只讲论文实际给出或可直接看出的限制,不做无源推测。组件消融中最具教学价值的负结果是去掉调制器后 24 kHz 感知质量的明显下滑,整理成下表以明确收益与代价。下表比较问题是特征校准对共享量化的真实价值,公平条件是同骨干同量化配置下仅开关调制器,指标方向为 PESQ 越高越好。

条件指标完整模型去掉调制器后变化方向
24 kHz 重建PESQ 越高越好2.3531.979下降
16 kHz 重建PESQ 越高越好未在此句报告未在此句报告需查原文大表
48 kHz 重建PESQ 越高越好未在此句报告未在此句报告需查原文大表

上表显示 24 kHz 下 PESQ 从 2.353 降到 1.979,降幅达到可感知的量级,支持调制器缓解速率相关特征偏移、维持一致隐表示的解释;同时去掉适配器与双组件的更低分表明两者互补,任一缺失都会损伤跨速率共享。未评测边界包括更广采样率覆盖如 8 kHz 或 44.1 kHz、可变码率操作、噪声与混响条件以及主观听音,论文在结论中把前两项列为未来工作。训练层面 3 阶段虽提升稳定性,但未报告各阶段步数分配、判别器细节与训练时长,复现时需自行探索。部署层面全因果与流式推理是设计目标,但原文未测量实际延迟与内存占用,不能承诺延迟得到改善。总体趋势是统一逼近专属模型,不等于每组每步都成立。

复现先做什么,需要补哪项验证?

复现的第一步是重建数据管线:按原文用 LibriTTS 的训练与测试划分准备 24 kHz,再下采样得到内容匹配的 16 kHz,用 VCTK 准备 48 kHz 并固定随机选出的 1000 条测试集种子,否则跨速率对比会被内容差异污染。第二步是按图搭建模型:输入输出接口放可学习速率转换,内部取 16 kHz 网格,堆叠 5 次编码块并在每块插入按速率查表的通道仿射,骨干后接长短期记忆网络与共享残差向量量化器,解码镜像搭建并用转置卷积恢复目标速率。

第三步是按课程训练:先在 48 kHz 上用重建加承诺损失稳定码本,再混入三档速率联合训练并启用两组件,最后加共享多尺度短时傅里叶判别器做感知精修,优化器用 AdamW 并按原文设置总步数、批量与学习率区间。验证时先复现 24 kHz 下 ViSQOL 4.22 与 48 kHz 下 PESQ 2.750 两个可核对点,再检查固定参数量 19.65M 与三档计算量 2.14、2.58、2.34 G 乘加运算是否量级一致。还需补的验证是统计显著性、主观听音与实际流式延迟,以及去掉渐进策略后的完整三档对照,避免把单点提升推广为全程最优。

资源方面本次未确认代码与权重可达,不应写已公开,复现应以原文描述为准记录缺项如判别器结构与阶段步数。

何时值得尝试这种统一思路?

当部署环境必须同时处理 16、24 与 48 kHz 且不愿维护多套模型或外部重采样时,该思路值得尝试:用接口转换统一时间网格,用块内仿射校准特征统计,用单套量化器承接一致隐空间,再用先重建后感知的课程稳定训练。它的适用条件是目标速率集有限且可枚举,因为调制器按速率查表,新增速率需新增参数与训练覆盖;若需任意速率或可变码率,原文未验证,需要额外设计。

理解上的关键是分工不可混淆:适配器解决离散步与物理秒长的对应,调制器解决带宽差异带来的分布偏移,骨干与码本只在两者保障下才可共享。对初学者的建议是先手写 1 次单样本流程,再对照消融理解为何 24 kHz 对调制器更敏感,最后用最大均值差异的排序检验隐空间一致性,而不把该分布指标直接当听感证明。

论文直接报告的是客观指标与开销数字,有限解释是两组件互补促成共享,未验证的推测是更广速率与可变码率的泛化,这些在尝试前应有清醒预期。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总