英文题目:JASPER: Joint Audio and Speech Pre-trained Encoder Representations

标签:#音频理解 | #自监督学习 | #语音 | #环境声 | #音乐

评分:6.7/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Geeth George:机构信息未在 arXiv HTML 中可靠披露
  • Ameenudeen P E:机构信息未在 arXiv HTML 中可靠披露
  • Hrishikesh H Pillai:机构信息未在 arXiv HTML 中可靠披露
  • Sriram Ganapathy:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作针对语音时域预测与音频时频建模分轨导致的跨域不兼容,输入为截断或补零至8秒的16kHz原始波形,输出为可冻结复用的768维上下文表示序列,难点在于同一波形编码器需同时保留音素级时序精度与环境声谱结构。第一步由卷积前端将波形降采样至50Hz潜序列并按0.16秒切窗得到非重叠窗口,该窗口化潜序列直接作为掩码操作对象。第二步以0.6概率独立选中窗口并以0.2概率延续遮蔽后窗形成长上下文掩码序列,叠加卷积位置编码后送入12层Transformer建模长时依赖得到上下文表示。第三步由双头分别预测帧级时域伪标签与段级8频带谱量化标签并以加权损失联合优化,时域分支保留序列信息而频域分支注入频率局部监督,推理时仅用波形分支抽取表示。与纯时域HuBERT类方法和纯频谱重建方法不同,JASPER在波形编码器内注入频率局部监督,兼顾音素序列精度与时频结构。在 2000 小时同数据同步数对照中 9 任务多数领先,在公开大算力比较中以 2k 小时数据取得 81.74% 平均准确率居首,尤其 VoxCeleb1 达 91.18%。在ESC-50评测任务下,JASPER的准确率为88.05%,高于HuBERT的准确率80.55%。XARES-LLM Track A 平均 0.66、Track B 平均 0.50 亦居首。但结论依赖英文语音与常见音频音乐分类加轻量解码器,低资源语言、强噪声与长时流式外推未经验证,训练与推理成本未披露。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,哪些信息必须保留?

这篇论文的输入是一段原始语音或通用音频波形,论文记为持续时间为 T 秒、以 16 kHz 采样的记录。目标是学出一个编码器表示,既能支持语音任务的先后顺序判断,也能支持环境音与音乐任务的频率结构判断。输出不是直接的类别或文本,而是一组可被冻结后复用的上下文表示,后续只加轻量头即可做分类、音素识别或送入音频大语言模型。

必须保留的信息有两类。第一类是时间方向的先后关系,例如音素如何衔接、指令词如何随时间展开,丢掉它语音识别与关键词检测就会退化。第二类是频率方向的局部结构,例如同一时刻不同频带同时出现了什么能量,丢掉它环境音与乐器音色就难以区分。论文的起点正是已有路线各保一侧:波形路线擅长时间预测,频谱路线擅长时频模式,两者的分词与注意力设计互不兼容。

作为例子可以帮助理解,但它不是论文的实验结论:一段 0.16 秒的音节长度片段,既可以看成连续若干帧的先后序列,也可以看成一张小频谱图上垂直切出的频率块。JASPER 要求模型在同一段音频上同时回答这两类问题。推理阶段论文明确只用波形输入,不要求调用时再算频谱前端,频谱只在训练时用来构造监督目标。

同输入同目标的已有路线差在哪里?

按同输入、同目标、同监督来对照,已有工作可分成波形编码器与频谱编码器两条路线。波形路线直接处理时域采样点,代表做法包括对比预测的 wav2vec 2.0、聚类掩码预测的 HuBERT 与 WavLM,以及掩码自编码思路的 Dasheng 和弱监督的 Whisper。它们在自动语音识别、说话人验证与语音翻译等语音任务上很强,但原文指出它们难以泛化到多样化非语音音频任务。

频谱路线处理对数梅尔谱等时频表示,代表做法是音频频谱 Transformer 与自监督版本,采用按块切分与全局自注意力建模时间与频率的长程依赖。它们在通用音频任务上表现强,但按块切分的模型常常在依赖精细时序的语音任务上不足。帧级分词对复杂环境音表达不足,块级模型对语音序列又不够精细,这就是论文所说的兼容性缺口。

已有的一侧改进是把时间学习加入频谱 Transformer 以提升语音性能,论文引用 ULTRAS 作为该方向的例子。JASPER 走的是互补但此前探索较少的方向:给波形编码器加入频谱预测,而不是给频谱模型加时间建模。理解这一点很重要,后文所有掩码与损失设计都是为了在不改变推理输入模态的前提下,把频率监督塞进波形编码器。

要解决的兼容性问题如何界定?

论文把问题界定为统一的谱时间建模,而不是简单把 2 个模型拼接。输入是长音频段,模型需要对被遮挡的时间窗推断缺失声学内容,同时对同一时段的频率块做出预测。两个目标共享同一个 Transformer 编码器,时间目标守住序列信息,频谱目标补上频率定位信息。

评估也要能同时检验两侧。论文因此设计多层评估:先用冻结表示做 SUPERB 式的线性评估,直接检验声学与音素属性;再用 X-ARES 做编码器中心评估,包括参数化的感知机探测与非参数的近邻评估;最后把编码器作为统一前端接入 XARES-LLM 框架,用轻量语言模型做开放式分类与描述。只有 3 层都覆盖,才能说表示同时具有判别性与生成式理解所需的迁移能力。

这里的成功标准不是某 1 数据集单点最高,而是跨语音、环境音与音乐的平衡表现。论文在有限数据条件下强调可迁移性,后文实验条件会说明 200 小时与 2000 小时两种预训练规模都保持语音与音频各半,基线也用相同数据与相同预训练步数重训,以保证比较条件一致。

JASPER 让一个样本走完输入到损失的全程

先沿一个样本走完全程。左侧进入的波形同时分出 3 路。上路把波形经卷积变成时间帧序列,直接送去聚类得到时间伪标签,作为时间损失的监督来源。中路是主干:波形经卷积特征抽取器变成潜帧序列,按固定时长切成窗口,对其中一部分窗口做长上下文掩码,再经 Transformer 编码得到上下文表示,分别经前馈层预测时间标签,经均值池化加多头前馈预测频谱标签。下路把同一波形算成对数梅尔谱,切成谱段再垂直切成方形小块,展平聚类后得到频谱伪标签,作为频谱损失的监督来源。

下图是论文给出的整体框图,阅读时先看主路径再看两条监督闭环,有助于把掩码位置与损失位置对齐。

看图路径: 1. 从左侧波形 X 出发,先区分上中下三条分支的起点与终点;2. 观察中间分支中[MASK] 块在窗口序列中的位置与 Transformer 编码器前后变化;3. 对比上分支时间帧到时间损失与下分支谱块到频谱损失的监督闭环;4. 核对下分支中 10 ms 与 160 ms 标注对应的帧级与段级粒度

原论文 Fig. 1:Block schematic of the proposed JASPER framework for joint spectro-temporal modeling of audio data.

论文图 1。原论文 Fig. 1::“Block schematic of the proposed JASPER framework for joint spectro-temporal modeling of audio data. (N_t = 400, F = 800, N = 50, R = 8).”。

上图显示了 3 路分工与汇合方式。中间粉色块为被掩码的窗口,右侧粉色圆圈为两个损失。可见的细节包括时间帧标注为 20 ms 量级,谱帧标注为 10 ms 量级,谱段标注为 160 ms 量级,图注给出总数关系为时间帧 400、谱帧 800、窗口数 50、每段垂直块数 8。主干输出先分叉,一路直接做帧级时间预测,另一路先做均值池化再做段级频谱预测。上路时间帧经 K 均值通向时间损失,下路谱块经 K 均值通向频谱损失。导读动作是先沿波形到 Transformer 的主箭头确认信息流向,再分别追踪上下两条经 K 均值到损失的监督路径,最后核对掩码块与损失只在被遮位置计算的对应关系。

窗口、掩码与两类目标如何计算?

输入预处理先把波形经总体步长为 320 的卷积编码器降采样,得到 50 Hz 的潜表示序列。论文把原始波形按时长切成互不重叠的时间段,每段对应潜序列中连续 P 帧,窗口序列记为各段潜特征的集合。实现细节是每段时长取 0.16 秒,用来匹配音节长度单元,输入音频截断或补零到固定时长。

潜序列的数学形式是论文明确给出的帧序列定义,符号含义是每帧为卷积编码器输出的向量,总帧数由时长决定。

\[\mathbf{X}=[\mathbf{x}_{1},\mathbf{x}_{2},\dots,\mathbf{x}_{N_{t}}],\quad\mathbf{x}_{i}\in\mathbb{R}^{D_{t}},\]

上式中 X 为潜帧序列,每一列为 1 帧向量,维度为卷积编码器维度。它是后续分窗与掩码的操作对象,不是 Transformer 的最终输出。

时域预测 × 频域预测: 时域预测负责逐帧的先后顺序与音素级连续性,分工是保住语音的时序信息;频域预测负责同一时段内不同频率块的局部结构,分工是补上环境音与音乐需要的频率模式;搭配理由是单一目标会偏向一侧,组合后共享编码器被迫同时保留先后关系与频率布局,新增作用是推理时只输入波形也能输出兼顾两域的表示。

掩码策略是长上下文掩码。每个潜窗口以概率 p 独立被选为掩码,若某窗口被选中,其下一个窗口再以固定概率 p prime 也被掩码。原文实验取 p 为 0.6,p prime 为 0.2。被选中的窗口整体替换为可学习的掩码嵌入或同形状零掩码,未选中则保持原值。加上卷积位置嵌入后,序列送入 Transformer 得到各窗口内每帧的上下文表示。

波形编码器 × 对数梅尔谱: 波形编码器分工是把原始采样点经卷积变成 50 Hz 的潜帧序列并送入 Transformer 做上下文建模;对数梅尔谱分工是在训练时提供与时间对齐的频率监督来源;搭配理由是推理阶段不想依赖频谱前端,组合意义是训练用频谱造目标、推理只走波形,实现不用谱输入的时频监督注入。

时间目标是对每帧潜特征做 K 均值聚类,得到离散伪标签,聚类数为 500。Transformer 输出的每帧表示经可学习前馈层加 softmax 得到类别分布,只在被掩码的窗口上计算交叉熵。符号与计算目标如下式所示,类别来自对输入帧的量化,预测来自对掩码输入的上下文编码。

\[\textbf{C}_{t,k}^{(i)}=\mathcal{Q}(\mathbf{x}_{i}),\quad\textbf{C}_{t,k}^{(i)}\in\{1,2,\dots,V_{t}\}\]

上式说明时间标签的监督来源是量化器对原始帧的作用结果,取值范围为预设的簇数。训练时模型看的是掩码后的上下文,猜的是掩码前的簇编号,因此必须利用周围未被遮挡的内容。

\[\mathcal{L}_{\texttt{t}}=\frac{1}{|\mathcal{M}|}\sum_{k\in\mathcal{M}}\sum_{i=1}^{P}\text{C.E.}\left(\widehat{\mathbf{p}}_{k}^{(i)},\textbf{C}_{t,k}^{(i)}\right)\]

上式是时间损失,只对掩码窗口集合求平均,每窗内对全部 P 帧求交叉熵。它保留了逐帧的时序粒度,对应语音所需的精细顺序信息。

长上下文掩码 × K 均值伪标签: 长上下文掩码分工是按 0.16 秒窗口成块遮挡并以一定概率连带遮下一窗,迫使模型看更远上下文;K 均值伪标签分工是把连续特征离散成 500 类的可预测目标,避免直接回归波形细节;搭配原因是块掩码若无离散目标则难以定义分类损失,组合后形成被遮位置上的掩码分类任务,新增作用是同时在时间帧与频率块两个粒度上可计算交叉熵。

频谱目标的构造完全在训练侧。先对波形提取 128 维对数梅尔谱,窗长 25 ms、跳长 10 ms,再按与时间段对应的长度切成谱段,每段进一步垂直切成边长为 Q 的方形块。论文实现取总谱帧 800、块边长 16,得到 50 个非重叠窗口,每段垂直块数 8。每块展平后经另一个 K 均值量化器得到频谱簇标签,簇数同样为 500。Transformer 对同一时间段的帧表示做均值池化得到段表示,再用 R 个独立前馈头分别预测 R 个频率块的标签,频谱损失在被掩码窗口上对 R 个块平均交叉熵。

最终总损失为时间损失与频谱损失的加权和,权重为 lambda,频谱侧权重为 1 减 lambda。论文消融显示最优点偏向频谱侧,后文结果节会结合代价讨论。

预训练分哪两阶段,优化条件是什么?

论文报告了两个数据规模:200 小时与 2000 小时,每种都由 LibriSpeech 语音与 AudioSet 音频各半组成。训练先用纯时间目标初始化编码器,再用时间加频谱的联合目标继续预训练,联合阶段的步数原文写作 11M 步。优化器为 AdamW,权重衰减 0.05,恒定学习率 2 乘 10 的负 5 次方,beta 系数为 0.9 与 0.98。掩码概率固定为 0.6 与 0.2,时间与频谱聚类数各 500,Transformer 为 12 层 12 头、隐维度 768,卷积编码器维度 512。

下表整理输入与分窗的原文条件,便于复现时先对齐采样与分段粒度。表前问题的关键是确认帧率、步长与段长是否匹配,否则掩码窗口与谱段无法对齐。

条件输入处理卷积步长潜帧率输入时长时间段长
原文取值波形经卷积编码器步长 32050 Hz8 秒截断或补零0.16 秒

上表说明主干的时间粒度由步长决定,段长决定每窗帧数,输入时长决定总窗口数。代价是长音频段带来更长的序列与更大的注意力开销,论文用固定截断补零控制显存。未报告的缺项是批量大小、学习率 warmup、掩码嵌入是学习型还是零掩码的最终选择,以及 2 阶段各自的步数分配,复现时需要按原文开源配方补齐,当前资源状态下未发现可验证的代码链接,因此不得声称代码已公开。

下表整理模型与频谱目标的原文条件,重点是时间帧与谱块的数量对应。

条件卷积维度Transformer时间簇数频谱簇数谱帧与切块
原文取值512 维12 层 12 头 768 维500 类500 类总 800 帧边长 16 共 50 窗每段 8 块

上表显示时间与频谱两侧的离散化规模相同,但预测粒度不同:时间是逐帧预测,频谱是段均值加多头预测。复现时先做时间初始化再做联合训练的顺序不能颠倒,否则频谱损失可能主导早期表示。

下表整理数据与优化的原文条件,用于核对可比性。

条件数据规模数据构成联合步数优化器掩码概率
原文取值200 小时与 2000 小时语音与音频各半11M 步AdamW 衰减 0.05 恒定学习率0.6 与 0.2

上表支持后文的规模消融:架构与目标不变,只放大数据量,观察跨域任务是否同步提升。限制是原文未给出硬件预算与训练时长,无法讨论单位算力下的收益,复现时应先记录单步耗时与显存占用再谈扩展。

用什么协议测表示,指标方向如何?

评估分 3 层,每层冻结编码器,只训练轻量部件。第一层是 SUPERB 式线性评估:编码器 frozen,用可学习的加权和聚合各 Transformer 层表示,只优化聚合权重与任务头。任务覆盖环境音、语音与音乐,包括 ESC-50、UrbanSound8K、GTZAN、FMA Small、IEMOCAP、VoxCeleb1、Speech Commands V2、CREMA-D、LibriCount,以及 TIMIT 与 LibriSpeech 的音素与语音识别。分类用准确率,越高越好;音素与语音识别用错误率,越低越好。帧级序列任务用轻量线性 CTC 头,LibriSpeech-100 的识别用双向长短时记忆网络解码器并报告字错率与词错率。

第二层是 X-ARES 编码器中心评估,分感知机线性探测与 k 近邻非参数评估。前者冻结编码器与任务部件只训练单层线性层,后者完全无参数、按特征空间邻近度分类。指标为跨任务加权平均,越高越好。第 3 层是 XARES-LLM,把冻结编码器 embedding 作为声学表示引导自回归文本生成,语言核心为 SmolLM2-135M。Track A 为话语级分类,含语音、环境音与音乐,用准确率与平均精度,越高越好;Track B 为高层语义理解,含识别与描述,用逆词错率、FENSE 与 DATE,同样越高越好。

冻结编码器 × 轻量预测头: 冻结编码器分工是固定预训练参数只做特征抽取,保证测的是表示质量而非微调能力;轻量预测头分工是只训练加权求和权重与线性或 CTC 头完成下游映射;搭配理由是要隔离预训练增益与任务调参增益,组合意义是 SUPERB 式线性评估与 X-ARES 的 MLP 探测都能归因到编码器本身。

公平条件的关键是同数据同配方。论文在 200 小时与 2000 小时下把 HuBERT、SSAST 加掩码语言建模目标与 JASPER 放在相同数据与相同预训练步数下比较,其中 SSAST 为保证公平改掉了原框架的重建与位置识别损失。外部对比则列出参数量与数据量,例如 JASPER 为 95M 参数与 2k 小时,Whisper 为 74M 参数与 680k 小时,Dasheng 为 86.4M 参数与 272k 小时,WavLM 为 94.7M 参数与 60k 小时。比较时必须同时核对数据集、基线版本、实验阶段与聚合对象,数值相同也不代表同一指标。

主结果在什么条件下成立,未胜出项在哪里?

主结果的问题是:在相同数据与步数下,联合谱时间目标是否在多数音频与语音任务上同时超过纯时间与纯频谱基线,以及在更少数据下能否与大规模基线持平。论文报告在 200 小时与 2000 小时两种配置下,JASPER 在多数任务上超过同条件重训的 HuBERT 与 SSAST。跨模型的总体比较显示 JASPER 以更少预训练数据取得有竞争力的跨域平均表现。帧级评估显示加入频谱预测与音频域数据后,模型仍保留细粒度语音信息,TIMIT 与 LibriSpeech 的音素与识别指标没有出现明显坍缩。

下表用原文连续句子直接报告的关键总体数字与对照,避免从宽表中逐格抄写无法绑定的裸值。阅读时注意单位与方向:平均准确率越高越好,Track 分数越高越好。

评估指标方向JASPER 总体对照基线数据量对照
线性评估总体准确率越高越好平均准确率 81.74%高算力基线数据量更大仅 2000 小时
XARES-LLM Track A分数越高越好平均 0.66Whisper 等大规模基线2k 对 680k 小时
XARES-LLM Track B分数越高越好平均 0.50WavLM 与 HuBERT2k 小时领先
损失权重消融准确率越高越好最优在 0.01频谱权重大时更优200 小时配置

上表的主要收益是平衡性:在数据量远小于 Whisper 与 Dasheng 的条件下,JASPER 在分类轨与理解轨的平均分上领先,说明波形编码器注入频率监督后跨域更均衡。具体代价与反例必须同时说明。第一,频谱权重最优在 0.01 附近,意味着总损失几乎偏向频谱侧,只保留很小的时间贡献,时间信息的保留依赖于该小权重与初始化阶段。第二,X-ARES 的 k 近邻侧 JASPER 并非全面断层领先,论文强调的是感知机探测最优与近邻侧稳健,说明表示空间的语义聚类仍有提升余地。第三,原文表头与算术若出现冲突应以连续原句为准,本解读不自行推算差值或相对提升,百分点与相对百分比严格区分。

放缩数据与调权重分别改变了什么?

规模消融固定架构与目标,只把未标注的语音音频数据从 200 小时放大到 2000 小时。论文报告下游语音、环境音与音乐任务随数据量增加而持续提升,XARES-LLM 作为音频语言模型前端时同样从 200 小时到 2000 小时获得一致增益。这支持联合谱时间目标是可扩展的判断,但支持的是总体趋势,不等于每一组任务每一步都单调成立,具体任务的波动需要回到完整任务表核对。

权重消融研究总损失中 lambda 的敏感性。原文结论是 0.01 处最优,此时频谱分量获得更强权重,同时保留小部分时间目标。该趋势与中心假设一致:在波形编码器上加频谱预测有助于音频任务,时间损失则保住语音序列信息。但未验证的推测不应写成因果:0.01 最优不证明所有数据规模与任务下都应如此,论文只在 200 小时配置下报告该消融,2000 小时下的最优权重是否漂移属于待验证项。

失败条件与边界也要交代。SSAST 基线为公平比较改了原始损失,其结果不能直接等同于原论文的 SSAST 性能。HuBERT 存在官方版与同数据重训版两个版本,官方用 1000 小时 LibriSpeech,重训版用 2000 小时混合数据,两者的音素与识别错误率不可混为一谈。复现时若只引用官方 HuBERT 数字,会高估或低估联合目标的增益,必须注明用的是哪一个训练条件。

哪些验证还没有做,不能承诺什么?

首先是资源与成本缺项。原文给出了参数量、数据小时数、优化器与步数,但未报告训练硬件、总时长、推理延迟、输出帧率与实际部署开销。总体平均分领先不等于延迟更低或显存更小,不能承诺效率改善。训练资源、推理开销与实际延迟需要分开讨论,缺少测量就明确写未测量。

其次是统计与聚合缺项。原文多处报告平均分与准确率,但未说明随机种子、置信区间与显著性检验方法。不同指标的差值不能混入同一模型列比较,自动指标不能当作人工评价。Track B 的生成式指标如 FENSE 与 DATE 有各自的文本相似性偏好,不能直接等同于人类对描述质量的判断。

最后是适用边界。JASPER 的推理只用波形输入,适合希望统一前端、不想维护频谱分支的场景;但若下游已是强频谱流水线或超低延迟流式系统,块掩码与长上下文带来的上下文依赖是否满足实时性仍待验证。频谱目标依赖训练时的对数梅尔谱与 2 次 K 均值量化,量化器的稳定性与域外音频的适配性也是未充分展开的环节。缺失证据不是技术错误,相关性也不是因果,后续需要补上误判率、延迟与跨域鲁棒性的直接测量。

复现时先做什么,按什么顺序核对?

第一步先对齐数据与切分。按 200 小时或 2000 小时准备 LibriSpeech 与 AudioSet 各半的混合数据,输入截断或补零到固定时长,时间段长取 0.16 秒,卷积步长 320 对应 50 Hz 潜帧率,谱侧按 128 维梅尔、25 ms 窗 10 ms 跳、总 800 帧边长 16 切块,保证时间窗口数 50 与谱段数 50 对齐。每段垂直块数 8 不能改,否则频谱头的头数与标签数对不上。

第二步再搭模型与目标。卷积维度 512,Transformer12 层 12 头 768 维,时间与频谱聚类数各 500。先做纯时间目标初始化,再做联合预训练,掩码概率 0.6 与连带 0.2,总损失权重从 0.01 开始。评估时冻结编码器,只训练层加权与轻量头,分类看准确率,识别看错误率,X-ARES 看 MLP 与 k 近邻加权平均,音频大语言模型侧用相同的 SmolLM2-135M 流程。

第三步核对可运行性。当前未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开。复现前应先确认能实际运行的配方是同数据重训的基线还是官方权重,两者数据条件不同。常见误解是把频谱目标当成推理时也需要输入频谱,实际上论文明确推理只用波形,频谱只在训练时造标签;另一个误解是把平均分领先当成每个任务都赢,复现时应逐任务列出未胜出项与负结果,保留基线与实际可运行策略的完整对照。

何时值得尝试,还需补哪项验证?

当任务同时涉及语音时序与环境音乐频率,且希望只维护一个波形前端时,JASPER 的思路值得尝试。它的可复述动作很具体:按音节长度分窗、成块掩码并连带遮挡、时间逐帧分类加频谱段级多头分类、加权求和后冻结评估。已有证据支持的是跨域平均的平衡性与数据效率,而不是单任务的绝对上限。

还需补的验证包括显著性与方差、推理延迟与流式适配、量化器在域外数据上的稳定性,以及更大规模下最优 lambda 是否漂移。教学上可以这样记忆:时间目标保顺序,频谱目标补音色,长掩码逼模型看远处,冻结评估逼表示自己过硬。满足这些信息条件后再谈是否替换现有编码器,才是与原文证据一致的结论。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-24 语音/音乐/音频论文速递