标签:#语音合成 | #生成对抗网络 | #严格因果 | #高效推理 | #语音
评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5
👥 作者与机构
- Renzheng Shi:机构信息未在 arXiv HTML 中可靠披露
- Simon Welker:机构信息未在 arXiv HTML 中可靠披露
- Timo Gerkmann:机构信息未在 arXiv HTML 中可靠披露
- Tim Fingscheidt:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是从无相位谱表示重建语音波形,输入为幅度谱或 Mel 系数,输出为宽带 16 kHz 与全带 48 kHz 波形,难点是在 20 ms 因果低延迟下隐式补全相位与高频细节。方法链分为三步:先将波形按 20 ms 周期 Hann 窗、5 ms 帧移分帧并做离散傅里叶变换取幅度谱,再经 80 通道 Mel 滤波器组与对数压缩得到 Mel 系数;然后经两个因果卷积层与两个长短期记忆网络层建模局部动态与长时连贯;最后经四个转置卷积层与各自后接残差块逐级上采样至波形采样率,全带仅调整后两级步幅与核尺寸。与需要高延迟迭代的 Griffin-Lim 算法和 utterance 级生成声码器相比,差异在于全因果单遍直接合成,不做显式相位估计与迭代一致性投影。在 VCTK 测试集上宽带幅度谱与 Mel 模型 MOS 为 4.17 与 4.15,全带为 4.14 与 4.11,均领先同期低延迟基线且距真值 0.03 至 0.05 以内。结论边界限于干净英语朗读 VCTK 及其重采样设置,未验证噪声混响跨语言与长时对话外推。训练为 1M 步 BigVGAN 式对抗训练,推理在单张 NVIDIA A100 上实时因子小于 1,未披露训练耗时与端侧部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,什么信息必须保留?
这篇论文研究的是无相位语音波形重建。输入是只有幅度信息的谱表示,目标是输出连续的时域语音波形。初学者可以这样理解:短时傅里叶变换把一小段语音变成幅度加相位,幅度告诉你每个频率有多响,相位告诉你各个正弦分量在时间上如何对齐。很多语音生成与编码系统为了压缩只传输幅度,把相位扔掉,重建端必须把丢掉的对齐信息补回来,否则听起来发闷、发金属声或混响重。
必须保留的信息是随时间变化的能量包络与谐波结构。论文同时考察两种输入。第一种是幅度谱,也就是线性频率上保留共轭对称后非冗余频点的幅度值,信息最完整。第二种是 Mel 系数,也就是幅度谱再经过 Mel 滤波器组加对数压缩,维度大幅降低,更接近实际声码器与文本转语音系统的接口,但高频细节被合并,逆映射更难。输出都是直接的采样点序列,不是先估计相位再做逆变换。
幅度谱 × 相位谱: 幅度谱负责记录每个时频点能量的强弱,相位谱负责记录波形在时间轴上如何对齐叠加;EffVOC 的任务就是只保留幅度谱而丢弃相位谱,再由网络直接生成对齐好的波形,搭配理由是幅度易压缩传输而相位难建模,组合意义是用生成式映射替代显式估计相位再逆变换的两步走。
论文把延迟概念收得很窄。文中脚注明确延迟仅指算法延迟,由处理方案的帧长决定,与平台无关,模数转换与具体运算耗时另计。为此论文同时报告在特定平台上的实时因子,用处理 1 帧的时间除以帧移来衡量是否跟得上。初学者常把两者混为一谈,这里要分开:窗长决定你至少要等多久才能开口,实时因子决定你算得够不够快。
算法延迟 × 实时因子: 算法延迟指为产生 1 帧输出必须等待的未来音频长度,只由窗长决定而与机器快慢无关,实时因子指处理 1 帧耗时除以帧移,决定机器是否跟得上;两者分工是前者决定通话 mouth-to-ear 的等待,后者决定是否会堆积,搭配使用才能判断低延迟且可实时,EffVOC 同时报告 20 毫秒延迟与 A100 上的实时因子。
举一个教学例子,不代表论文数值:假设你用 20 毫秒窗、5 毫秒帧移做流式处理,那么每 5 毫秒就要吐出 80 个 16 千赫采样点,算法延迟由 20 毫秒窗决定,实时因子由你 5 毫秒内能否算完决定。论文的全部设计都围绕把算法延迟钉在 20 毫秒,同时让实时因子小于 1。
已有路线如何处理相位,代价各是什么?
传统路线以格里芬林算法为代表。它在时域与频域之间反复迭代,强制幅度与给定幅度一致。论文指出它通常需要很多次迭代才够好听,计算贵,且本质上需要整句 utterance 级重建,带来无限高算法延迟。动量加速版本收敛更快,实时迭代谱反演把迭代改成流式,但作者强调在没有额外前视时精度会下降。单遍非迭代方法利用相位幅度关系 1 次算出相位,可作为迭代方法的初值,但精度上限仍受限。
第二条路线是混合神经方法。它用网络预测相位导数再积分出相位,或用冯米塞斯分布处理相位周期性,或用网络耦合迭代过程。论文的判断是这类方法仍重度依赖传统流程,灵活性有限,且训练机制与损失函数复杂,要额外保证相位连续性。
第三条路线是生成式声码器。文中点名大模型 BigVGAN 与 Vocos,它们从 Mel 系数直接生成高保真语音,质量好且计算相对高效,但同样是整句重建,延迟高。直接把它们改成因果版本往往掉质量,近期工作用非因果到因果的知识蒸馏、频带感知网络与流式流匹配来补救。语音编解码器 SoundStream 与 Encodec 则证明低延迟低码率高效结构是可行的。论文所基于的前作声码器正是借用了 Encodec 的结构选择,在 20 毫秒延迟下超过 BigVGAN 与 Vocos 及其因果版本,但只做了 Mel 输入的宽带语音,是否能做幅度谱与全频带尚不清楚,这就是 EffVOC 要补的缺口。
论文把什么问题划为自己的研究范围?
论文把问题定义为统一框架下的低延迟波形重建。约束有 3 个。第一,算法延迟固定为 20 毫秒,不靠偷看未来来涨分。第二,同一主干要能接受幅度谱或 Mel 系数两种输入,能合成宽带 16 千赫或全频带 48 千赫两种输出。第三,系统比较输入表示与模型大小、模型深度的影响,而不是只为某一种输入调一个专用大模型。
为保证宽带与全频带可比,论文固定窗时长与帧移时长,让采样点数与采样率成比例。宽带与全频带都用 20 毫秒周期汉恩窗、5 毫秒帧移,对应 75% 重叠。这种等时长设计使帧率相同,延迟相同,但全频带每帧点数更多、频点更多,重建负担更重。论文自述这是据知首次在同一个重建模型内做这种统一比较。
需要提醒初学者:论文不研究如何从文本得到 Mel,也不研究如何在噪声下增强,它假设幅度或 Mel 已经给定,只研究从该表示到波形的映射。评价同时看客观质量、可懂度、信号保真度与主观听感,不只看某一个分数。
EffVOC 让一个样本走完全程是什么样子?
先跟着一个宽带 utterance 走一遍。原始波形按 20 毫秒窗、5 毫秒帧移分帧加窗,做离散傅里叶变换得到复谱,取幅度得到幅度谱,保留非冗余频点作为幅度输入;若走 Mel 分支,再经 80 通道 Mel 滤波加对数得到 Mel 谱。于是每 5 毫秒进来 1 帧谱向量,模型要吐出对应时间分辨率的波形采样点。
模型主干非常直白:两个卷积层先做特征变换,两层长短期记忆网络建模长时依赖,4 个转置卷积层逐级把时间分辨率放大,每个转置卷积后跟一个残差块,最后一个卷积输出波形。所有卷积都是因果的,并加权重归一化,保证不偷看未来。宽带与全频带结构大体相同,只调整后两个转置卷积的步长与核大小以匹配不同的时频分辨率。
下图就是该主干的结构图,左侧绿色为整体上采样链,右侧橙色为残差块细节,图中同时标出宽带与全频带的维度变化,读图时注意时间轴从 T 逐级放大到输出采样率的过程。
看图路径: 1. 先从顶部输入框向下追踪主链:卷积、两层循环、四个反卷积加残差块到波形输出;2. 对比蓝色宽带分支与红色全频带分支在后两层反卷积的步长与通道标注差异;3. 看右侧残差块内部主路两层卷积与旁路一层卷积再相加的结构;4. 数时间轴放大倍数从 T 到 5T 到 20T 到 40T 到 80T 再到 240T 的逐级上采样关系
论文图 1。原论文 Figure 1::“Proposed low-delay speech reconstruction model EffVOC (left side) for wideband speech (black and blue dimensions) and fullband speech (black and red dimensions).”。
从像素可见,主链顶部标注输入为 T 乘 1 乘 M 或 A,其中 M 对应 Mel 通道,A 对应幅度频点数,经过两层卷积与两层循环后保持 T 时间步。随后第一个转置卷积把时间轴放大 5 倍到 5T,通道降为 8F,第二个放大 4 倍到 20T,通道降为 4F,后两层在宽带与全频带用不同步长继续放大到 80T 与 240T,最终输出对应波形。右侧残差块可见主路两个 3 乘 1 卷积与旁路一个 3 乘 1 卷积相加,保持时间步不变,只变换通道数。这种设计把上采样倍数的乘积与帧移点数对齐,使谱帧率与波形采样率精确对应。初学者复述时抓住三句话:因果保证低延迟,转置卷积负责补采样点,循环层负责让相邻帧的基频与相位连续。
卷积、循环与残差块各自负责什么?
前两个卷积层是输入适配器。幅度谱维度高且动态范围大,Mel 维度低且已对数压缩,两者统计特性不同,先用卷积把它们映射到同一隐特征空间,后续循环与上采样才能共享。论文用符号约定说明卷积核尺寸与通道数,其中 F 是控制整体宽度的缩放因子,取 64、32、16、8 得到四档模型大小。F 越大通道越多,建模能力越强,但参数与每秒浮点运算也越大。
因果卷积 × 长短期记忆网络: 因果卷积只看当前及过去帧,负责在不引入未来视野的前提下提取局部谱动态与做上采样,长短期记忆网络负责跨越数百毫秒记住基频与共振峰走向;搭配理由是纯卷积感受野有限而纯循环上采样不便,组合后形成局部细节加长时连贯的混合建模。
两层长短期记忆网络是连贯性来源。幅度帧之间高度重叠,相邻帧共享 75% 波形,直接逐帧独立上采样容易出现帧边界不连续,听感为抖动或粗糙。循环层记住过去的谐波与包络走向,使当前帧的上采样知道上 1 帧吐到了波形的哪个相位位置。论文保留该设计正是看中它在有限延迟下对长时依赖的性价比。
4 个转置卷积加残差块是分辨率引擎。谱帧率约每秒 200 帧,宽带波形每秒 16000 点,全频带每秒 48000 点,需要把时间轴放大 80 倍或 240 倍。论文把放大拆成多步,例如 5、4 等步长的乘积,每步后用残差块精修波形细节。残差块主路两层卷积学残差修正,旁路一层卷积做通道对齐,相加后保留主信息又注入修正。全频带实验还比较了 4 层、5 层、6 层 3 种步长拆分,通道按层减半,以考察更深更渐进的上采样是否有益。
幅度谱输入 × Mel 系数输入: 幅度谱输入保留线性频率全部非冗余频点,信息完整但维度高,Mel 系数输入经 80 通道 Mel 滤波加对数压缩,维度低但丢失细频结构;两者分工是分别对应高保真重建与低码率传输场景,EffVOC 用同一主干只换输入通道数来统一比较,组合意义是验证同一低延迟结构对两种压缩程度的适应性。
输入维度差异直接影响首层参数量。幅度输入频点数由傅里叶点数决定,宽带 512 点对应 257 维,全频带 1024 点对应 513 维,而 Mel 始终 80 维,因此幅度模型的首层更大。论文在宽带用 F 缩放宽度,在全频带固定 F 为 32 而改变深度,这种正交设计让读者能分开看宽度与深度的作用。
训练如何组织,监督信号从哪里来?
论文沿用前作声码器的训练流程。优化器用 AdamW,初始学习率 1 乘 10 的负 4 次方,批量 32,训练 1,000,000 步。判别器设置、优化器超参数、学习率调度与训练损失遵循 BigVGAN 的官方实现。初学者要注意,这意味着监督不只是波形均方误差,还包含生成对抗网络的多尺度判别损失与特征匹配损失,判别器迫使生成波形在听感与频谱统计上接近真波形。
训练数据是多说话人英文 VCTK 数据集,原始 48 千赫。训练集约 35.8 小时 93 人,验证集 2.5 小时,测试集取最后 8 位说话人,与 BAPEN 完全相同以保证可比。宽带实验把三部分全部重采样到 16 千赫,全频带保留 48 千赫。输入谱在训练时由真波形按固定窗、帧移、傅里叶点数与 Mel 滤波现场算出,目标就是同一段真波形,因此是配对监督,不需要额外标注。
论文未报告梯度是否截断到循环层的具体步数,也未报告判别器更新频率与损失权重细节,只说跟随官方实现。复现时应以 BigVGAN 官方代码为准,不要从模型名猜测。若判别器不稳定,优先检查学习率调度与权重归一化是否与原文一致,而不是先调大模型。
基线方面,格里芬林类用与 EffVOC 相同的窗与帧移并迭代 100 次,MelFlow 在相同数据集上按原配置训练 1,000,000 步但用 32 毫秒窗、16 毫秒帧移,DiffPhase 与 BAPEN 结果直接引用前文。这种安排使低延迟组与高延迟组、传统组与神经组的延迟与迭代条件可被区分。
实验条件如何对齐,指标方向怎么看?
对齐的核心是窗时长一致而点数等比。论文固定 20 ms 周期汉恩窗与 5 ms 帧移,宽带对应窗长 320 帧移 80,全频带对应窗长 960 帧移 240,傅里叶点数分别为 512 与 1024,Mel 滤波器均为 80 通道。算法延迟因此都是 20 ms。MelFlow 作为对照用 32 ms 窗 16 ms 帧移,对应 50% 重叠,帧率更低,延迟更高,比较时要记住这不是同延迟对比。
宽带语音 × 全频带语音: 宽带语音指 16 千赫采样有效带宽到 8 千赫,全频带语音指 48 千赫采样有效带宽到 24 千赫;前者考验电话级可懂度,后者考验高频 fricative 与空气感,EffVOC 保持 20 毫秒窗时长而按采样率等比放大窗点数,用同一延迟约束对比两种带宽下的重建难度。
下表把时频配置整理成可核对的形式,便于复现时逐项对照采样率、窗点数、帧移、傅里叶点数与 Mel 通道数,避免把时长与点数混淆。
| 条件 | 窗时长 | 帧移 | 窗长与帧移点数 | 傅里叶点数 | Mel 通道数 |
|---|---|---|---|---|---|
| 宽带 16 kHz | 20 ms | 5 ms | (320, 80) | 512 | 80 |
| 全频带 48 kHz | 20 ms | 5 ms | (960, 240) | 1024 | 80 |
上表依据正文整理的窗与帧移配置,宽带与全频带保持相同时长而点数等比放大,Mel 通道数不变。复现时先按此表生成幅度谱与 Mel 系数,再核对帧率与算法延迟是否为 20 ms,若改动窗长则延迟结论不再成立。
指标方向需要记牢。越高越好的是宽带语音质量 PESQ-WB、客观听觉质量 POLQA、非侵入式 NISQA、手机音相似度 LPS、可懂度 ESTOI 与主观平均意见分 MOS;越低越好的是 Mel 倒谱距离 MCD、对数谱距离 LSD 与实时因子 RTF。实时因子在单张 A100 上测得,为处理 1 帧耗时除以帧移,小于等于 1 表示可实时,但 EffVOC 帧移 5 ms 而 MelFlow 帧移 16 ms,分母不同,直接比数值时要意识到帧率差异。主观 MOS 遵循 P.808 众包,在测试集的 7% 子集共 160 文件上测,每个文件 8 人评分,子集经约束伪随机选择以保持客观指标排序与全集一致。
宽带重建谁在什么指标上占优?
宽带比较要回答 3 个问题:与传统低延迟方法比是否解决质量塌陷,与同延迟神经方法比是否更省,与高延迟方法比差距多大。论文报告低延迟格里芬林与差分映射版本在所有指标上严重落后,说明 20 毫秒下传统迭代已不够用,这正是神经低延迟方法的动机。高延迟的格里芬林在 POLQA 上仍居前,DiffPhase 与 BAPEN 在 PESQ-WB 上居前,说明整句视野仍有优势。
下表聚焦论文正文明确给出数字的幅度谱宽带 PESQ-WB 对比,保留可运行的 EffVOC 策略与 BAPEN 基线,延迟条件一并列出,PESQ-WB 越高越好。
| 条件 | 输入表示 | 方法 | PESQ-WB | 算法延迟 |
|---|---|---|---|---|
| 宽带 16 千赫 | 幅度谱 | EffVOC F=64 | 4.31 | 20 ms |
| 宽带 16 千赫 | 幅度谱 | BAPEN | 4.26 | 32 ms |
| 宽带 16 千赫 | 幅度谱 | EffVOC F=32 | 4.24 | 20 ms |
上表显示 EffVOC 大模型以 20 毫秒延迟略超 32 毫秒 BAPEN 的 4.26 达到 4.31,而参数约 7M 的中模型以 4.24 打平且计算需求低得多。结合正文,EffVOC 大模型还在可懂度与信号保真度上整体最强,Mel 分支大模型同样在可懂度居首。代价是论文选择 20 毫秒帧与 75% 重叠,帧率高于 50% 重叠方案,计算量更高,但换来更低延迟与更高重建保真度。未胜出项也要看到:绝对 PESQ-WB 最高仍是高延迟 DiffPhase 与 BAPEN 高延迟版本,低延迟是以微小客观差距换延迟与主观优势。
主观听感是论文最强的证据。摘要报告宽带主观 MOS 为幅度 4.17、Mel 4.15,全频带为幅度 4.14、Mel 4.11,均接近真值。宽带大与中幅度模型并列居首,Mel 中模型紧随其后,与真值差距仅 0.05 左右。MelFlow 高性能 25 迭代版本 PESQ-WB 很好但实时因子远大于 1,5 迭代流式版本可实时但质量与保真度被 EffVOC 中模型以两数量级更少的浮点运算超越。论文还观察到大与中模型下幅度与 Mel 表现接近,只有小模型下幅度明显更好,说明小容量时完整频点信息的价值更大。
模型大小与深度改变时规律是否稳定?
宽带宽度消融取 F 为 64、32、16、8 四档。论文描述的趋势是 64 与 32 表现接近,16 开始下降,8 明显下降,且幅度输入在小模型下衰减更慢。以主观分为例,幅度分支从 4.17、4.17 到 4.08 再到 3.63,Mel 分支从 4.12、4.15、4.12 掉到 3.46,Mel 在最小档塌陷更剧烈。这支持一个判断:当容量充足时压缩过的 Mel 仍可被生成器补回细节,当容量不足时完整幅度谱的冗余更抗压缩。
全频带深度消融固定 F 为 32,比较 4 层、5 层、6 层 3 种步长拆分。论文报告三者客观与主观差异很小,幅度 MOS 为 4.14、4.12、4.11,Mel MOS 均为 4.10 左右,PESQ-WB 与 POLQA 也几乎持平。更深拆分略降浮点运算但实时因子反而上升,说明层数增加带来的调度开销抵消了单层计算下降。这是一个反证:不是越深越渐进越好,在当前上采样倍数下 4 层已够。
跨带宽看,幅度模型在全频带一致优于 Mel 模型,而宽带大模型两者接近。这与直觉一致:全频带高频细节多,Mel 合并高频后更难恢复,完整幅度谱的优势被放大。复现时若只测宽带会低估输入表示的差距,应同时测全频带。
失败条件也要记住。最小模型 Mel F 为 8 时宽带多项指标垫底,说明低延迟小模型加高压缩输入是双重困难组合。若部署端只能放 0.5M 量级参数,应优先选幅度输入或放宽延迟,而不是坚持 Mel 加极小模型。
哪些结论有边界,哪些验证还没有做?
首先是延迟口径。20 毫秒仅指算法延迟,不含模数转换与前后处理,实时因子只在单张 A100 上测得,消费级设备上的耗时与内存未报告。论文提到 MelFlow 在消费级笔记本 GPU 可实时,但 EffVOC 未给跨平台数据,因此低延迟可部署的结论目前支持在服务器 GPU 上成立,端侧待验证。
其次是数据边界。全部实验在干净英文 VCTK 上完成,无噪声、无混响、无跨语言与跨说话人风格测试,NISQA 与 LPS 虽涉及感知与音素,但未测量误判率与鲁棒性。测试集最后 8 人虽与 BAPEN 对齐,但子集主观测试仅 160 文件,众包听感的置信区间未给出,不能把 0.02 的主观差距解读为必胜。
第三是基线完整性。全频带 POLQA 上 BAPEN 未报告,DiffPhase 全频带缺失,BAPEN 全频带低延迟版本也未给出,因此全频带最强声称依赖现有可比项,未来补上同延迟强基线可能缩小差距。训练成本方面只给 1,000,000 步与批量,未给显卡小时与收敛曲线,小模型是否训练不足也未验证。
最后是方法缺项。损失权重、判别器细节、循环截断长度均跟随 BigVGAN 官方实现而未展开,权重归一化与因果填充的具体实现需看代码。论文未声称因果化无损,相反承认直接因果化常掉质量,EffVOC 的好结果应理解为特定混合结构加对抗训练在该数据上的表现,可能待验证是否泛化到其他语料。
要复现应先做什么,后验证什么?
先复现数据管线。用 VCTK 原始 48 千赫,按相同说话人划分留出最后 8 人做测试,其余分训练与验证,宽带全部分支重采样到 16 千赫。按 20 毫秒周期汉恩窗、5 毫秒帧移生成谱,宽带窗 320 帧移 80 傅里叶 512,全频带窗 960 帧移 240 傅里叶 1024,Mel 均为 80 通道加对数。先检查帧数与算法延迟:窗时长决定 20 毫秒延迟,帧移决定每秒 200 帧,错 1 位则上采样倍数对不上。
再搭模型。按图实现两卷积、两循环、四转置卷积加残差块,全卷积因果加权重归一化,用 F 控制宽度,全频带调后两层步长。训练用 AdamW 学习率 1e-4 批量 32 跟随 BigVGAN 判别器与损失训 1,000,000 步,优先跑 F 为 32 的幅度与 Mel 两个版本,因为它们是性价比中心点。评价时同时算 PESQ-WB、POLQA、ESTOI、MCD、LSD 与 A100 实时因子,主观可先用客观排序筛选再小规模听测。
验证顺序建议:先看低延迟传统基线是否如论文般塌陷,以确认管线无泄漏;再看 EffVOC 是否以 20 毫秒达到接近高延迟基线的客观分;最后看小模型幅度优于 Mel、全频带差距拉大是否复现。若全频带深度消融无差异,说明实现正确,不必强行调深。代码与权重是否开源论文未交代,应按无开源假设保留超参数与随机种子记录。
何时值得尝试 EffVOC 思路?
当系统必须在 20 毫秒内吐出波形,又不愿牺牲太多听感时值得尝试。典型场景是实时通话、助听与流式语音生成,其中输入已是幅度或 Mel 而无相位。论文的启示是不要先估计相位再逆变换,而是让因果上采样网络直接学生成波形,用循环层补帧间连续,用多步小倍数上采样补分辨率,用对抗损失补听感细节。
选择输入时看约束。若传输带宽允许传完整幅度谱,优先幅度,尤其小模型与全频带场景;若接口已定为 80 维 Mel 且模型够大,Mel 也可接近幅度,大中模型差距不大。若算力只够 F 为 8 量级,避免 Mel 加极小模型的组合。
还需补的验证是噪声鲁棒性、跨语言泛化与端侧实时因子。总体上论文报告显示低延迟高效可以做到接近真值的主观分,但这是在干净 VCTK 与服务器 GPU 上的结果,支持在同类条件下复用,跨条件部署前应补测延迟全链路与听感。
📎 论文与评分元数据
排名:前50% | 文档类型:方法研究 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses
