英文题目:Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
会议身份:
conference:interspeech:2026:conference-paper-id:niu26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#正则化 #变分自编码器 #零样本 #语音 #文本到语音
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:方法研究
👥 作者与机构
- Zhikang Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Jeongsoo Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Yushen Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Peining Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Pengcheng Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Yunting Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Bowen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Chunhui Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xie Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音合成以文本与参考提示语音为输入,生成兼顾可懂度与音色相似的新语音,实际难点在于梅尔谱冗余导致文本语音难对齐,而高维连续隐变量虽保真却陷入重建保真与可生成性难以兼顾的权衡。Semantic-VAE先以卷积编码器将16 kHz波形下采样为40 Hz、64维紧凑隐变量并施加KL约束。接着对冻结自监督语义特征插值对齐后作帧级余弦方向正则,将结构化语义注入隐空间而不压缩维度,其输出的隐变量直接送入流匹配合成模型。最后基于放大块的解码器与多周期加多频带短时傅里叶判别器协同重建波形,省去梅尔谱加声码器级联。相对已有梅尔谱与普通声学VAE,该方向对齐而非数值逼近的语义约束缓解了重建与生成的权衡并加速收敛。在LibriSpeech-PC test-clean上集成至159M F5-TTS后词错率(WER)降至2.10%,说话人相似度(SIM)提升至0.64,自然度主观平均意见分(MOS)达4.17,超越同资源梅尔谱基线2.23%和0.60以及普通声学变分自编码器(vanilla acoustic VAE)基线2.65%和0.60。该结论在英文朗读语音及SeedTTS中英文集上验证,自发对话与噪声场景外推仍存疑。原文未披露训练硬件与推理延迟吞吐成本。
🔗 开源与复现资源
- 代码相关资源:https://zhikangniu.github.io/semantic-vae/ — 链接可访问(HTTP 200)
- 演示资源:https://zhikangniu.github.io/semantic-vae/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要合成什么,为什么表示很关键?
这篇论文研究的是零样本文字转语音合成。输入是两部分:一是要读的文本,二是一段参考语音,用来指定要模仿的音色。目标是合成一段新语音,内容与文本一致,音色与参考说话人一致,自然度也要好。对于刚入门的读者,白话解释是:模型既要读对字,又要像那个人说的。英文名是 zero-shot text-to-speech,缩写常写零样本语音合成,后文简称零样本合成。
论文把中间表示当作关键变量。一种路线以梅尔谱为中间表示,再用预训练声码器转波形;另一种路线以变分自编码器为中间表示,直接学波形到紧凑隐向量再解回波形。变分自编码器英文是 Variational Autoencoder,缩写是 VAE,后文简称 VAE。梅尔谱英文是 mel-spectrogram,后文简称梅尔谱。
论文的判断是:梅尔谱维度高且冗余,还丢失相位信息和高频细节;VAE 隐表示更紧凑,能加速收敛并提升合成质量,但引入新的权衡。下游生成模型采用 F5-TTS 这类基于流匹配的非自回归模型。流匹配英文是 flow matching,它在连续表示上学习映射,避免自回归逐词元生成的慢速与误差累积,也避免离散量化带来的信息损失。
零样本语音合成 × 流匹配: 零样本语音合成负责根据文本与一段参考语音合成新语句,分工是同时满足内容正确与音色一致;流匹配负责在连续表示上学习从噪声到目标的非自回归映射,分工是提供推理更快、无量化损失的生成路径。搭配理由是论文以下游合成任务检验隐表示好坏,组合意义是把 Semantic-VAE 隐表示替换梅尔谱后直接送入 F5-TTS 这类流匹配模型训练与推理。
开场需要保留的信息是:论文只研究连续隐表示路线下的零样本合成,不研究离散词元自回归路线的新解码器;输出是可核对的方法复述与实验条件,不是效果承诺。学习依赖是先理解任务评价有 3 个方向:可懂度用词错率衡量,越低越好;说话人一致性用相似度衡量,越高越好;自然度用人评与预测分衡量。后续各节按这个依赖展开:先看相关路线,再看权衡现象,再走完编码到对齐再到解码的样本路径,最后核对训练与评测条件。
已有路线分几类,各自解决了什么又留下什么?
按论文梳理,零样本合成先分自回归与非自回归。自回归模型把语音离散量化成词元,用上下文学习模仿音色,优点是音色还原能力强,代价是推理慢、误差累积和量化信息损失。非自回归模型多用扩散与流匹配,在连续表示上生成,优点是速度与质量兼顾。非自回归再按中间表示分成两类。第一类以梅尔谱为条件,代表有 VoiceBox、E2 TTS 和 F5-TTS,用预训练声码器重建波形,这是当前主流范式。
第二类以 VAE 隐表示为条件,直接用对应解码器合成波形,代表有 SeedTTSDiT 和 MegaTTS-3。论文引用这类工作的意义是说明紧凑表示已在大规模工业模型中被验证有效。离散音频编码器一侧已有工作用自监督语音模型对齐来改善下游自回归模型,代表有 SpeechTokenizer 等;扩散变换器训练中也有双模态对齐加速收敛的工作。但论文明确指出,据作者所知,还没有工作把语义正则用于语音连续隐空间,也没有检验它对下游任务的作用。
这就是本文的切入点。
变分自编码器 × 梅尔谱: 变分自编码器负责把波形压成紧凑连续隐表示再解回波形,分工是去冗余并保留可重建的声学信息;梅尔谱负责提供高维声学中间表示,分工是直接送给声码器重建波形。两者搭配的理由是梅尔谱冗余大且缺相位细节,而紧凑隐表示能加速收敛,组合意义在于论文把合成中间表示从梅尔谱切换到可学习的隐表示,再解决其新引入的权衡。
对照时要注意运行阶段是否一致:梅尔谱路线的重建质量依赖外部声码器,VAE 路线的重建质量是端到端编码器加解码器联合训练的结果,不能把两类重建数字直接当同系统比较。论文后续同时报告重建任务与下游合成任务,正是为了分开这两层判断。
高维隐表示为什么保真了却更难读准?
论文首先用预实验提出一个重建与生成的困境。增大隐维度能保留更多声学信息,重建质量与说话人相似度变好,但零样本合成的可懂度变差;减小隐维度则相反,可懂度变好,但重建保真与相似度受损。论文用信息瓶颈解释:低维表示抓住核心语义内容,高维表示保留丰富声学细节但引入冗余,使语义建模更难。这个解释是有限解释,不是因果证明,但它与视觉潜在扩散模型中的类似发现一致,因此值得作为设计动机。
潜在扩散模型 × 信息瓶颈: 潜在扩散模型负责在压缩隐空间做生成,分工是降低维度冗余并提升效率;信息瓶颈负责解释维度与内容取舍,分工是低维保留核心语义而高维保留更多声学细节但引入冗余。搭配理由是论文观察到与视觉领域一致的重建与生成矛盾,组合意义是用信息瓶颈解释为何增大隐维度提升重建与相似度却损害可懂度。
下图是该困境的雷达图呈现,需要沿 3 个评价角读出权衡,而不是只看某一个角的最大值。
看图路径: 1. 先看雷达图三个角分别标注的评价维度与箭头方向;2. 再对比三种隐维度多边形在重建角与可懂度角的相对大小;3. 最后看图例中 16 维、32 维、64 维颜色与多边形填充的对应关系
论文图 1。原论文 Figure 1:“Reconstruction and Generation(TTS) dilemma on continuous representation.”。
从像素可见,雷达图有 3 个角:顶部是重建保真,右下是下游合成相似度,左下是下游合成可懂度。图例区分隐维度 16、32、643 种多边形。顶部数值随维度增大向外扩张,64 维最大;左下角可懂度方向则是低维多边形更向外,说明低维在该角占优;右下角相似度方向同样是高维更向外。
这种此消彼长的形状就是论文所说的困境。它直接导出方法目标:在不降低隐维度的前提下,给高维隐空间加语义结构,让生成建模变容易。
Semantic-VAE 整体做了什么改变?
方法全景可以沿一个样本走完。输入是一段 16 千赫兹波形。编码器把它映射成隐表示序列。隐表示同时受 3 路约束:一是重建路径,经解码器重建波形;二是分布正则,使隐分布靠近标准正态。
三是新增的语义分支,把隐表示与冻结自监督模型的特征对齐。输出仍是波形,但中间隐表示被要求既可重建又具语义结构。论文把该模型称为 Semantic-VAE,含义是带语义对齐正则的语音 VAE。训练框架如原文总体图所示,编码器在下,解码器在上,中间是隐向量,对齐模块在右侧,冻结自监督模型在右下。 以下导读帮你先抓住主路径与新增分支的汇合点,再看图。
看图路径: 1. 先沿底部波形经编码器到隐向量再到顶部解码器的主路径走一遍;2. 再看隐向量左右两条虚线分别指向标准正态约束与对齐分支;3. 最后确认冻结自监督模型与对齐模块之间语义正则损失的箭头方向
论文图 2。原论文 Figure 2:“Overall training framework. The encoder maps the input into latent representations, regularized by a KL loss.”。
从像素可见,底部波形进入蓝色编码器,得到多个隐向量方块。隐向量向上送入绿色解码器生成顶部波形;向左虚线指向标准正态约束;向右虚线进入对齐多层感知机,再与来自右下冻结自监督模型的特征计算语义正则损失。冻结标记说明该自监督模型参数不更新,只提供监督来源。
这一结构对应后文 3 个损失:生成损失管重建与分布正则,对抗损失管感知质量,对齐损失管语义结构。理解这张图后,再看组件节的具体计算就不容易把监督来源弄混。
编码、解码与对齐三个部件各自算什么?
编码器与解码器沿用 DAC 的卷积编码器、判别器与损失权重,但把原始卷积解码器换成基于 AMP 块的解码器以提升重建。编码器对 16 千赫兹输入做多级下采样,得到 64 维、每秒 40 帧的隐表示;解码器再多级上采样回波形。判别器采用多周期判别器与多带多尺度短时傅里叶判别器,对抗目标用 HingeGAN 并加 L1 特征匹配损失。重建损失是多尺度频域重建损失,定义为真值与重建在多种窗长下梅尔谱之间的 L1 距离。
分布正则用 KL 散度把变分后验推向标准正态。生成损失是重建损失与 KL 损失的加权和。
语义对齐正则 × 自监督语音模型: 语义对齐正则负责在隐空间逐帧约束隐向量朝向语义特征的方向,分工是给无约束高维隐空间加结构;自监督语音模型负责从同一段语音抽取富含音素和语义的结构化表示,分工是提供冻结的监督来源。搭配理由是自监督模型已学到可迁移的语义结构,组合意义是让隐表示同时保留声学可重建性与语义可建模性。
语义分支的具体做法是:用预训练自监督模型对同一段语音抽特征,经过插值层对齐时间维度,再经 1 维卷积对齐特征维度,得到与隐表示同形状的语义表示。然后在每个时间步计算两者余弦相似度并取负均值作为对齐损失。余弦相似度的含义是只看方向是否一致,不强求绝对数值相等。论文的安排理由是余弦更适合捕捉结构化语义,而 L1 与均方误差会过度约束绝对数值差异。消融节会用数据验证这一选择。总目标是 VAE 目标加对齐损失,权重由超参数控制相对重要性。
训练目标如何相加,参数如何更新?
训练目标分两层。第一层是 VAE 目标,等于生成损失加对抗损失加特征匹配损失,权重分别控制。第二层是总目标,等于 VAE 目标加语义对齐损失。按原文交代,语义对齐权重、对抗权重、特征权重与重建权重的设置都有明确数值,KL 权重较小,说明分布正则只起轻约束作用。优化器方面,Semantic-VAE 用 Adam,学习率较小并做指数衰减。
下游 F5-TTS 用 AdamW,先热身再线性衰减。需要明确的冻结关系是:自监督模型冻结,不更新;编码器、解码器、对齐用的卷积与多层感知机参与更新;判别器按对抗训练更新。梯度路径方面,原文明确重建与对抗梯度经解码器回传到隐表示与编码器,对齐梯度经对齐模块回传到隐表示与编码器,KL 梯度约束编码器输出分布。
原文未报告是否对隐表示做停止梯度,也未报告判别器更新频率与重置时机,这是具体缺项,复现时应按 DAC 与 F5-TTS 默认流程补齐并记录,不从模型名称推定实现。
重建损失 × 语义对齐损失: 重建损失负责让解码波形在多尺度梅尔谱距离上逼近真值,分工是保真;语义对齐损失负责让隐向量与对齐后的自监督特征余弦相似度最大,分工是保可读。搭配理由是只保真会让高维隐空间冗余难建模,只保语义会丢细节,组合意义是总目标把两者加权相加,让生成建模变简单而不牺牲表示容量。
训练规模方面,Semantic-VAE 训练迭代次数与全局批量都有明确交代,每样本截 3 秒并重采样到 16 千赫兹。下游合成训练在低资源设置下只用 LibriTTS,高资源扩展才用更大数据,这一点在实验条件节核对,避免把不同数据量的结果混为同条件比较。
数据、基线与指标如何组织才算公平?
数据方面,Semantic-VAE 在 LibriTTS 与 Libriheavy 中小子集上训练,总计约 61,000 小时;除非另有说明,下游合成模型只在 LibriTTS 上训练。重建评测用 LibriTTS 测试集的另一划分;零样本合成评测用 LibriSpeech-PC 测试集的干净子集,采用跨句生成。指标方面,重建用 UTMOS、PESQ 与 STOI 分别反映感知质量与可懂度。
合成用词错率、说话人相似度与 UTMOS 分别反映可懂度、音色一致性与自然度,另做 5 分制主观平均意见分听测。基线方面,低资源下对比梅尔谱 F5-TTS、普通声学 VAE 版 F5-TTS 与 E2 TTS 及其语义版;高资源引用已发表结果仅作参考,不作同条件胜负判断。推理方面,下游沿用 F5-TTS 设置,用摆动采样与欧拉常微分求解器。资源状态方面,本次收到的官方页面显示代码与演示链接当前可用,状态码均为 200,可作为复现起点,但权重是否可下载需以页面实际内容为准,不把页面可达等同于系统可一键运行。
下表整理低资源主结果的比较问题:同数据、同模型规模下,把梅尔谱基线、普通 VAE 与语义 VAE 放在同一测试集上,指标方向为词错率越低越好,相似度越高越好。
| 条件 | 指标 | 梅尔谱 F5-TTS 基线 | 普通 VAE 基线 | 本方法 Semantic-VAE | 比较对象 |
|---|---|---|---|---|---|
| LibriSpeech-PC 干净集 | 词错率 | 2.23% | 2.65% | 2.10% | F5-TTS 系列 |
| LibriSpeech-PC 干净集 | 说话人相似度 | 0.60 | 0.59 | 0.64 | F5-TTS 系列 |
表后需要说明:该表数字来自原文连续报告,语义 VAE 在两个指标上同时占优,但这不等于在所有测试集与主观分上都占优,下一节结合收敛曲线与高资源扩展说明适用边界。原文同时报告 E2 TTS 加语义 VAE 也有提升,支持方法不只绑定某一个合成器,但跨合成器的增益大小仍需各自复现。
主结果与收敛速度支持什么判断?
主结果显示,接入 F5-TTS 的 Semantic-VAE 在低资源下取得最佳词错率与相似度,超过梅尔谱基线与普通 VAE 变体。把同样的隐表示接到 E2 TTS 上也有稳定增益,说明改进来自表示本身,而不仅是某个合成器的调参。收敛方面,论文比较不同训练步数下的词错率与相似度,语义 VAE 在相同步数下更快更好,最终性能尤其是相似度更高,训练成本相对更低。但总体趋势不等于每一步都成立,早期步数曲线差距大,后期差距收窄,判断时应看全程而不是只看末步。
以下导读帮你读收敛图:左轴是词错率,右轴是相似度,横轴是训练步数,注意双轴方向相反。
看图路径: 1. 先区分蓝色下降曲线对应左轴词错率与绿色上升曲线对应右轴相似度;2. 再对比 50k 到 100k 步之间三条词错率曲线的下降速度差异;3. 最后观察 200k 步之后相似度曲线中语义对齐分支的相对位置
论文图 3。原论文 Figure 3:“Comparison of WER and SIM on the LibriSpeech-PC test-clean dataset between the F5-TTS baseline, Vallina VAE, and Semantic-VAE across different training steps.”。
从像素可见,蓝色词错率曲线随步数快速下降,绿色相似度曲线随步数上升。50k 步附近梅尔谱基线的词错率起点很高,普通 VAE 与语义 VAE 起点更低;到 100k 步三者词错率已大幅收敛,语义 VAE 更低。相似度一侧,语义 VAE 的实线在全程处于相对上方,普通 VAE 与梅尔谱基线随后跟上但未反超。这支持论文的判断:语义对齐加速收敛并改善最终性能。
限制是该图只在 LibriSpeech-PC 干净集上绘制,不能推广到中文集或噪声集。高资源扩展在相同训练预算下于多个测试集上仍有一致提升,且英文训练的 VAE 在中文集上也有改善,论文据此称跨语言泛化稳健,但这仍是有限解释,因为语义模型本身可能已见过多语言信息,待验证。
哪种对齐损失与哪层语义特征真正起作用?
消融围绕两个问题:对齐损失用什么距离,语义监督用哪个模型哪一层。先看距离。负余弦相似度优于 L1 与均方误差。论文的解释是 L1 与均方误差过度约束绝对数值差异,而余弦关注方向对齐,更适合结构化语义。这是用数据支持的安排理由,复现时应优先保留余弦。
再看监督来源。WavLM 总体优于 HuBERT,相似度相当或更好,可懂度相当,论文归因于 WavLM 的说话人感知训练目标,但这属于有限解释,不是严格因果。再看层选择。所有层都能降词错率,但对相似度影响差异大:最后一层 consistently 导致相似度明显下降,论文推测是为对齐自监督训练目标做了分布调整,丢掉了说话人线索;平均所有层比只用最后一层相似度更好,说明平均引入更多声学细节,但也可能引入冗余而不利于语义建模。
折中方案是选 WavLM 第 23 层,该层在 SUPERB 中词错率权重最高,语义更丰富,实验确认它在词错率与相似度之间取得较好平衡。未胜出项也要保留:L1 与均方误差、最后一层特征在该测试集上未胜出,但不等于在其他数据或指标上必然无用。
下表整理训练超参数的复现要点,指标单位按原文交代,裸值不擅自添单位。
| 模块 | 参数 | 设定值 | 优化器 | 说明 |
|---|---|---|---|---|
| Semantic-VAE 训练 | 迭代次数 | 600k | Adam | 全局批量 64 |
| Semantic-VAE 训练 | 学习率 | 1×10−4 | Adam | 指数衰减 |
| Semantic-VAE 损失 | 权重组合 | 1,0.01,1,2,15 | Adam | 对齐,分布,对抗,特征,重建 |
| 下游 F5-TTS | 学习率 | 7.5×10−5 | AdamW | 热身 20000 步后线性衰减 |
| 隐表示 | 维度与帧率 | 64 维,40 帧每秒 | 不适用 | 输入 16 千赫兹 |
表后解释:该表的主要收益是给出可直接照抄的起点,代价是它没有覆盖判别器更新频率、数据采样与增强、随机种子与硬件预算,复现时需补记。特别是编码器下采样与解码器上采样因子链很长,任一因子写错都会改变帧率与对齐形状,应先用小批量验证隐序列长度与自监督特征对齐后的长度一致,再开大规模训练。
还有哪些没有测到,不能承诺什么?
首先,重建与合成的权衡只在给定维度、给定数据与给定评测集上被测量,不能承诺换数据、换语言或换声码器后趋势完全相同。其次,主观平均意见分样本量有限,每系统 250 个评分,25 位听者,结论应与客观指标联合阅读,不能把自动分当人评。第三,论文未报告误判率、延迟、实时率与训练显存,隐帧率虽降到每秒 40 帧,但总体推理开销与实际延迟需分别测量,不能从帧率直接承诺更快。
第四,冻结自监督模型的具体版本、层数与预处理若与复现不一致,对齐效果可能变化,论文给出第 23 层最优的结论只在所用 WavLM 配置下成立。第五,高资源结果与已发表长训练基线不在同预算下,不能把引用数字当同条件胜负;同预算复现部分才可比。最后,语义对齐是否在所有说话人、口音与噪声条件下都保留音色细节,原文未做细分组分析,这是未评测边界。把这些缺项说清,不是技术错误,而是避免把相关性当因果、把趋势当保证。
要复现应先做什么,先跑通哪条链路?
复现先做三件事。第一,确认资源:打开官方页面核对代码与演示当前可用,再确认权重、环境与数据脚本是否齐全,区分代码开源、权重下载与系统可运行三件事。第二,跑通重建链路:按原文下采样与上采样因子搭建编码器与解码器,用 3 秒片段、16 千赫兹、64 维每秒 40 帧验证形状;先训普通 VAE 复现重建基线,再加语义分支,检查插值加 1 维卷积后长度与隐序列一致,余弦损失是否下降。
第三,跑通合成链路:把梅尔谱替换为 VAE 隐表示接入 F5-TTS,保持优化器、热身步数与采样器与基线一致,在 LibriSpeech-PC 干净集上用跨句生成评词错率与相似度。关键超参数起点是语义权重、对抗权重、特征权重、重建权重与 KL 权重的组合,以及下游学习率与热身步数。常见误解是以为隐维度越大越好或语义层越深越好;论文特有的纠正是高维需配语义结构,层选择需在可懂度与相似度之间折中,第 23 层是经验最优点而非理论必然。
若复现中只见重建变好但合成可懂度不变,应先查对齐损失是否真正回传到编码器,再查自监督模型是否误设为可训练或层号取错。
何时值得尝试这个方法,如何一句话记住它?
当你的合成系统已从梅尔谱切换到连续隐表示,并观察到增大隐维度后重建变好但读不准、说话人相似度与可懂度此消彼长时,值得尝试语义对齐。它的做法不是继续调维度,而是在高维下加结构:用冻结自监督特征的余弦方向约束隐空间,让隐表示同时可重建与可建模。论文的支持证据是低资源下词错率与相似度双优、收敛更快、重建与普通 VAE 相当,以及高资源同预算下多集一致提升。
代价是新增对齐模块与超参数,层选择与权重需按数据验证,且延迟与成本未被测量。记住一句话:保真靠重建与对抗,可读靠语义方向约束,两者加权后才让高维隐空间真正可用。下表把可运行策略与引用策略分开,避免把不可部署的最优值当收益。
| 评价 | 可运行策略 | 引用策略 | 结论 |
|---|---|---|---|
| 低资源同条件 | 梅尔谱,普通 VAE,语义 VAE | 无 | 语义 VAE 词错率最低相似度最高 |
| 收敛过程 | 相同步数三曲线对比 | 无 | 语义 VAE 更快更好 |
| 高资源 | 同预算复现基线与语义版 | 已发表长训练数字仅参考 | 同预算下语义版一致提升 |
| 重建 | 普通 VAE 与语义 VAE | 声码器作背景参考 | 语义版与普通版相当 |
| 未评测 | 延迟,显存,分组稳健性 | 无 | 不承诺改善,需补验证 |
该表之后需要强调:引用策略列仅作背景参考而不计入收益,可运行策略列才是同条件可复现的比较,未评测的延迟与稳健性仍需补验证后才能谈部署取舍。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


