英文题目:LipAdapter: Text-to-Video Alignment is All You Need for Lip-to-Speech
会议身份:
conference:interspeech:2026:conference-paper-id:ghosh26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#Adapter #低资源 #多语言 #零样本 #音视频语音合成
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Souvik Ghosh:机构信息未能从会议 PDF 纯文本可靠映射
- C. V. Jawahar:机构信息未能从会议 PDF 纯文本可靠映射
- Vinay Namboodiri:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
唇语到语音需从无声视频恢复内容准确、音质自然且与唇动同步的语音,难点在于视素到音素映射多对一且野外数据音质差导致端到端模型泛化弱。该工作先用冻结视觉语音识别转写文本并用冻结唇特征提取器抽取唇嵌入,再由轻量文本到视频对齐网络预测唇部引导的音素时长,接着经由长度调节器扩展音素表征,最后送入冻结多语言文本到语音合成波形。与从零训练语音生成部件的方案不同,该方法只学习跨模态时长映射并复用文本到语音的韵律与音色能力。两阶段训练先学习帧级单调对齐能量再离散化为硬时长,使时长预测稳定可微并直接控制冻结合成器的韵律节奏。在LRS3测试集上该系统以30小时训练取得21.2%的词错率与3.13的DNSMOS,同步与质量接近430小时训练的扩散基线。该结论适用边界限于英语中长句与视觉语音识别转写基本正确条件,短于1秒片段对齐证据不足与零样本小语种转写噪声大时仍明显退化。原文未披露训练硬件、优化器与完整超参数。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出必须保留什么?
这篇论文研究的输入是一段无声的说话人视频,典型情况是只看得到唇部与脸部运动,听不到任何声音。目标输出是一段语音波形,要求同时满足三件事:内容可懂,即说的内容与视频中实际说的话一致;声音自然,即听感接近干净录制的语音而不是机械拼接;时间同步,即每个音的起止与唇形开合对上,长时间观看不出现声画错位。
初学者容易把这个任务理解为给视频配一段大概意思的旁白,但原文强调必须保留的信息包括音素序列的正确性与每个音素的持续时长分布,因为唇形本身存在歧义,不同的词可能对应相近的视觉运动。举例来说,这只是教学例子而非论文数值:如果只用视频直接回归波形,模型可能发出流畅但词错的声音;如果只用识别出的文本送给普通语音合成,声音自然但时长是合成器自己决定的,与唇动无关。
论文的出发点正是把内容决定权交给已很强的识别与合成模块,把时间决定权单独交给一个轻量对齐模块。为核对学习条件,需要记住后续所有比较都围绕这 3 个维度展开:可懂度用词错率衡量,质量用主观与客观语音质量指标衡量,同步用唇同步专家指标衡量。训练数据量是贯穿全文的约束条件, prior 方法需要 400 小时以上,而本文希望只用 30 小时左右完成适配。
两条已有路线各自解决了什么,又留下了什么?
原文把已有方法分成两类。第一类是纯视频输入的方法,直接从无声视频生成语音,代表包括基于生成对抗网络、多任务学习、语音单元、扩散与流模型的一系列工作。它们的好处是输出直接以视觉信号为条件,同步分数往往不差;代价是把视觉歧义直接带进发声过程,容易读错词,在跨数据集时词错率会显著上升。第二类是视频加文本的方法,先用视觉语音识别把视频转写为文本,再以视觉与文本共同指导语音生成,代表是 LipVoicer 与 Accurate L2S。
它们引入文本后词错率明显下降,但语音生成部分仍是从头训练,需要大量高质量音视频对,且训练语料多来自为识别任务收集的数据,语音的干净度与表现力不如现代文本转语音所用的语料。原文还指出,直接把原始视觉信息送入合成阶段会引入与发音无关的变化,相当于噪声。教学上的关键区分是:同输入、同目标、同监督才能公平比较。
纯视频方法与视频加文本方法不在同一信息条件下,前者少了文本这一强先验,因此不能简单用词错率判定谁的建模更优。LipAdapter 明确属于第二类,但与第二类的区别在于不重训语音生成器,而是复用冻结的多语零样本语音合成器,只学习对齐。这种选择把研究问题从如何生成好声音转变为如何为好声音安排正确的时间。
为什么只学时长就能解决同步,还需要什么假设?
论文把唇到语音分解为说什么与何时说。说什么由识别模型给出文本,再经音素编码器变为音素序列;何时说由对齐模块决定每个音素持续多少视频帧。只要时长准确,带有长度调节机制的语音合成器就能把音素拉长或压缩到与唇动一致的位置,从而实现同步。这个分解成立依赖 3 个假设。
第一,识别文本基本正确,否则后续再准的时长也只是把错误内容说得很同步。第二,音素与视频帧之间存在单调对应关系,即说话顺序不回退,这符合自然发音过程,也是在对齐矩阵上施加对角先验与单调搜索的依据。第三,冻结的语音合成器接受外部时长输入并能稳定渲染,这要求所选合成器本身是长度可控的结构。原文选用 ZMM-TTS 正是因为它分为文本到向量与向量到波形两段,中间经过离散语音表示,天然留出了时长控制接口。
若换成不可控时长的端到端合成器,该方法就无处插入。理解这一点才能明白后文消融为什么要换 FastSpeech2 风格的骨干做兼容性验证,以及为什么极短视频会成为失败模式:当可用的视频帧太少,单调路径缺乏足够的时间证据来分配时长。
沿一个样本走完从无声视频到同步语音的全链路
假设拿到一段英文演讲的无声视频。系统先走两条冻结支路:一条用预训练唇特征提取器得到每帧的唇嵌入,另一条用预训练视觉语音识别得到预测文本。预测文本经多语音素编码器变为音素嵌入,同时还带有说话人嵌入与语言嵌入以保留音色与语言条件。接着文本到视频对齐网络把唇嵌入投影为查询、把音素嵌入投影为键,计算二者之间的相似能量并结合对角先验得到软对齐矩阵。
对该矩阵做单调对齐搜索,得到每行恰有一个 1 的硬路径,按列求和即为每个音素应持续的帧数。最后把按时长复制扩展后的音素表示送入冻结或轻微微调的基座语音合成器,经文本到向量得到离散语音码,再经向量到波形得到与视频等长的波形。这个流程的核心信息瓶颈思想是:视觉只通过时长影响合成,不直接污染声学细节。 下面这张对比图把旧路线与新路线的训练代价差异放在同一画面,是理解全文动机最直接的入口。
看图路径: 1. 先看上下两条主路径的输入输出是否同为无声视频到唇同步语音;2. 再对比中间方块是整体重训的唇到语音模型还是外挂的适配器加冻结 TTS;3. 最后核对下方标注的训练数据量从 430 小时降到 30 小时的位置
论文图 1。原论文 Figure 1:“Previous approaches rely on end-to-end models to map silent video to speech.”。
上图上方是旧的复杂端到端模型,直接把无声视频映射为唇同步语音并标注需要 430 小时训练数据;下方是本文路线,在已有高水平文本转语音模型之上只加一个唇适配器,标注仅需 30 小时训练数据。图中两侧都保留了从无声视频帧到带波形的同步语音的对应关系,说明输入输出目标没有改变,改变的是中间是否复用预训练合成能力。需要强调的是数据量对比针对的是语音生成部分的训练需求,而识别与合成骨干本身是在更大规模外部数据上预训练的,不能理解为整个系统只见过 30 小时语音。
对齐模块内部如何计算相似度与时长?
对齐模块的输入是两组序列。视觉侧是经线性投影并上采样到语音码时间分辨率的查询序列,原文说明对于 n 帧视频会得到 2n 减 1 个码索引位置,这是为了与 wav2vec2 码的帧率对齐;文本侧是经 3 个非线性卷积块构成的键投影与查询投影编码后的音素序列。相似度以负平方距离乘以温度系数的形式计算,温度控制分布锐利程度,再加上外部对角先验的对数后做归一化得到软对齐。
软对齐在训练前 20000 步直接用于加权求和得到时间加权的文本嵌入,保持全程可微,使音频重建损失能回传优化注意力参数。20000 步之后切换为硬时长路径:对软矩阵做动态规划求累积对数概率,允许停留或前进两种转移,从终点回溯得到单调二值矩阵,再按音素维度求和得到整数时长。时长经长度调节器把每个音素重复相应次数,送入 ZMM-TTS。原文还用单调对齐似然目标与路径集中正则来约束训练,前者受联结时序分类启发,后者促使软注意力沿硬路径更集中。
视觉语音识别 × 文本转语音: 视觉语音识别负责从无声视频读出说了什么文本内容,提供内容准确性;文本转语音负责把文本变成自然、高质量的波形,提供声音自然度;二者搭配的原因是各自已在大规模数据上预训练、各有所长,组合意义是 LipAdapter 只在中间学习对齐时长,让内容与声音解耦而不必重训整个发声部件。
音素表示 × 唇嵌入: 音素表示是文本经 XPhoneBERT 得到的发音单元向量,承载说什么;唇嵌入是 VTP 特征提取器从唇部视频得到的视觉运动向量,承载何时张闭;搭配理由是两者序列长度与语义粒度不同,必须投影到共享注意力空间计算相似度,组合后可得到每帧视频对应哪个音素的软对齐矩阵。
下面这张结构图是复述方法时必须能画出的版本,建议按分支逐个核对冻结与可训练标记。
看图路径: 1. 沿左侧无声视频分叉追踪上方唇特征与下方识别文本两条支路;2. 观察中间软对齐矩阵经单调对齐搜索变为硬对齐的箭头方向;3. 确认右侧虚线框内 Text to Vec 到 Vec to Wav 再到波形的合成链路
论文图 2。原论文 Figure 2:“Given a silent video, we first extract the transcribed text using a pretrained Visual Speech Recognition model and obtain lip embeddings from a pretrained lip feature extractor.”。
该图左侧无声视频分出上下两路,蓝色表示冻结的唇特征提取器与视觉语音识别,粉色为音素编码器;中间绿色为可训练的线性层、查询与键投影以及软硬对齐部分,右侧黄色虚线框为基座语音合成的文本到向量与向量到波形。图中还用火焰与雪花图标区分可训练与冻结,用蓝色圆点表示离散表示,并示意了唇对齐音素时长如何对应到具体音素。复述时要能说清说话人与语言嵌入从下方注入音素编码器,而视觉信息只经由时长进入合成器。
基座合成器与时长接口如何配合?
基座采用 ZMM-TTS,分为文本到向量与向量到波形。文本到向量把对齐后的音素表示转换为离散码索引,这些码来自预训练多语 wav2vec2 的码本;再经码本映射为离散表示,送入向量到波形生成波形。这种两段式设计的教学意义在于离散码起到了声学缓冲的作用,使文本侧的小误差不至于直接变成波形畸变。
原文为了更好适配,允许对文本到向量做轻微联合微调,但同时报告只训练对齐器也能得到接近联合训练的结果,以此支持适配器独立于合成器内部参数、只改时长的判断。兼容性验证中,作者把 ZMM-TTS 替换为基于相同音素嵌入的 FastSpeech2 风格长度调节合成器,无需结构修改,只提供音素时长即可运行;性能虽因更简单的模型与非神经声码器而下降,但流程依然成立。这说明方法依赖的是长度可控这一类接口,而非某一个具体 checkpoint 的内部细节。
未报告的缺项是具体的优化器、学习率与微调层范围,复现时不能从模型名称推定这些实现,只能按原文已给的 2 阶段步数与冻结关系先搭建。
软对齐 × 硬单调对齐: 软对齐是经温度与对角先验加权的注意力权重,保持可微以便重建损失回传优化对齐参数;硬单调对齐是用单调对齐搜索从软矩阵中找出的不回退、不跳跃的二值路径,用于按帧计数得到整数音素时长;二者搭配是先用软路径稳定训练前 20000 步,再切换到硬时长供长度调节器复制扩展音素,供 TTS 合成。
Text2Vec × Vec2Wav: Text2Vec 负责把唇形对齐后的音素序列映射为来自多语 wav2vec2 离散码本的码索引序列,是语义到离散声学单元的转换;Vec2Wav 负责把离散表示经码本映射为连续波形,是声学渲染阶段;搭配原因是冻结的高质量 TTS 链路保留了多说话人多语言的发声能力,LipAdapter 只替换其时长输入即实现唇同步。
两阶段训练在优化什么,何时切换与冻结什么?
训练对象是文本到视频对齐网络,监督来源包括单调对齐似然目标、路径集中正则以及经由软加权路径回传的音频重建损失。前 20000 步使用软对齐直接构造时间加权的文本嵌入,保证梯度能经过注意力机制;20000 步后切换为用硬时长经长度调节器构造的扩展序列作为合成器输入,得到离散的、可计数的时长。冻结关系是视觉语音识别、唇特征提取器、音素编码器主体与向量到波形保持冻结。
可训练的是对齐网络中的投影与能量计算参数,以及可选的文本到向量轻量微调。原文没有给出完整的损失权重、批量大小与学习率曲线,因此不能复述具体的超参数数值,只能复述切换时机为 20000 步、上采样规则为视频帧到码索引的对应关系、以及时长求和满足所有音素时长之和等于视觉时间步数的约束。推理时流程是确定性的搜索加前向合成:先识别文本与提取唇嵌入,再计算软矩阵、单调搜索得硬时长,最后合成固定波形。
需要区分的是,无训练不等于确定性求解的说法在此不适用,因为本研究确实训练了对齐器;同时也不能从冻结参数推出输出确定,因为识别错误与搜索路径仍会带来不确定性。
在什么数据与指标下比较,条件是否一致?
英文主实验在 LRS3 上训练与测试,LRS3 被描述为野外采集的高挑战英文集;跨数据集泛化在 MultiVSR 的 500 个英文样本上测试,该集来自多样化网络视频内容与转写,适合检验分布外鲁棒性。零样本多语部分在 MultiVSR 的法语、德语、葡萄牙语与西班牙语测试集上直接推理,模型仅见过 30 小时英文视频,未做任何额外训练。基线按信息条件分为纯视频与视频加文本两组,前者包括生成对抗、多任务、语音单元、扩散与流模型,后者包括 LipVoicer 与 Accurate L2S,本文方法属于后者。
对于部分基线,作者直接使用公开仓库中已生成的样本或在 1321 个样本的标准 LRS3 测试集上推理。指标方面,可懂度用词错率,越低越好;语音质量与可懂的客观代理指标用 DNSMOS 与 STOI-Net,越高越好;同步用 LSE-C 越高越好、LSE-D 越低越好;主观用自然度、可懂度与同步 3 维平均意见分,1 到 5 分由 20 名标注者对 50 个随机样本打分。
硬件与耗时方面,原文给出在 2080 Ti 上生成 5 秒音频约需 6 秒,而 LipVoicer 扩散骨干约需 50 秒,这属于推理开销的直接报告,应与训练数据量分开讨论。资源状态方面,原文正文给出代码与演示链接,但本次未能确认其可达性,不应表述为已公开或当前可用。
英文主结果在相同信息下赢在哪里,输在哪里?
要回答的核心问题是:在给定视频加文本信息时,更少训练数据能否同时保住可懂度、质量与同步。表前需要明确比较条件与指标方向:比较对象限定为 LRS3 测试集上的可运行方法,训练小时数作为成本列出,词错率越低越好,客观质量越高越好,同步指标 LSE-C 越高、LSE-D 越低越好。
| 方法 | 训练小时 | 词错率 | 客观质量 STOI-Net | 客观质量 DNSMOS | 同步 LSE-C | 同步 LSE-D |
|---|---|---|---|---|---|---|
| V2SFlow | 430 | 28.5% | 0.948 | 3.24 | 7.752 | 7.015 |
| Accurate L2S | 660 | 23.1% | 0.77 | 2.79 | 7.886 | 6.850 |
| LipVoicer 视频加文本 | 430 | 21.4% | 0.92 | 3.11 | 5.803 | 8.637 |
| LipAdapter 本文方法 | 30 | 21.2% | 0.944 | 3.13 | 6.165 | 8.250 |
表后解释必须同时给出收益与代价。
收益是本文方法以约十五分之一的训练数据达到最低词错率 21.2%,客观质量接近最优,并在同步上超过同信息条件的 LipVoicer。代价与反例是同步仍不及纯视频的 V2SFlow 等方法,因为后者直接以视觉为条件,同步天然占优;但后者在 MultiVSR 上词错率大幅恶化到 61.09%,说明高同步分不等于可用系统。主观平均意见分也呈现同样权衡:本文方法可懂度 4.3 超过所列基线,自然度 4.2 与同步 4.2 与扩散方法相当,略低于 V2SFlow 的 4.2 到 4.4 区间。
跨数据集的 500 个 MultiVSR 英文样本进一步支持文本模态的价值,本文方法词错率 34.44% 优于 LipVoicer 的 35.95%,同步与质量同样略优。
词错率 × 唇同步置信度: 词错率是用 Whisper-Large 等自动语音识别转写合成语音再与参考比对得到的错误比例,反映内容可懂度,越低越好;唇同步置信度与距离 LSE-C 与 LSE-D 反映音画时间一致性,LSE-C 越高、LSE-D 越低越好;二者必须联合看,因为纯视频模型可能同步分高但词错率高,说明口型模糊导致发音错误。
零样本多语与小数据消融证明了什么,没有证明什么?
第二个要验证的问题是:只在英文上学的对齐能否零样本迁移到其他语言,以及极少数据是否仍能学到可用对齐。表前先限定条件:模型未见过目标语言训练数据,直接在 MultiVSR 多语测试集推理;对比对象为同样零样本推理的 LipVoicer;指标方向与主结果一致,词错率越低越好,同步与质量越高越好,表中斜杠左侧为 LipVoicer、右侧为本文方法。
| 语言 | 词错率 LipVoicer / 本文 | STOI LipVoicer / 本文 | DNSMOS LipVoicer / 本文 | LSE-C LipVoicer / 本文 | LSE-D LipVoicer / 本文 |
|---|---|---|---|---|---|
| 法语 | 108.4 / 62.09 | 0.71 / 0.94 | 2.85 / 3.85 | 3.42 / 4.16 | 12.8 / 10.17 |
| 德语 | 101.6 / 64.60 | 0.69 / 0.92 | 2.74 / 3.70 | 3.98 / 4.83 | 12.1 / 9.82 |
| 葡萄牙语 | 112.3 / 61.69 | 0.66 / 0.90 | 2.81 / 3.74 | 4.02 / 5.18 | 12.6 / 9.52 |
| 西班牙语 | 103.7 / 68.36 | 0.68 / 0.90 | 2.77 / 3.68 | 3.85 / 4.70 | 12.3 / 9.71 |
表后解释:本文方法在 4 种语言上全面优于 LipVoicer,后者词错率均超过 100%,意味着插入错误数已超过参考词数;本文方法词错率在 60% 量级,虽远高于英文,但同步与质量仍保持相对稳定,支持对齐学到的是视觉发音动作与音素的跨语映射。
限制是该词错率仍不可用,且误差分解显示视觉识别本身在多语上有约 23% 到 25% 的错误,评估用自动语音识别在干净原音频上也有 25% 到 39% 的错误,因此报告的合成词错率是保守估计,真实可懂度可能更高,但不能据此声称已解决低资源语言合成。小数据消融显示 3 小时数据词错率 27.4%、10 小时 25.2%、30 小时 23.6% 左右,骨干替换显示 ZMM-TTS 明显优于 FastSpeech2 的 31.4% 词错率,仅训练对齐器与联合微调文本到向量的差距约为 23.6% 对 21.2%,支持只改时长即有效,但也表明更强合成器仍是质量上限的来源。
| 条件 | 词错率 | STOI | 同步 LSE-C |
|---|---|---|---|
| 训练 3 小时 | 27.4 | 0.905 | 5.574 |
| 训练 10 小时 | 25.2 | 0.914 | 5.782 |
| 只训对齐器 | 23.6 | 0.923 | 5.922 |
| 对齐加 Text2Vec 微调 | 21.2 | 0.944 | 6.165 |
| 换 FastSpeech2 骨干 | 31.4 | 0.74 | 4.7 |
表后小结:消融表明用极少数据仍能学到可用对齐,仅训练对齐器已接近联合微调文本到向量模块的效果,说明唇形引导的时长预测是同步的关键;更换为较弱骨干后各项指标下降,表明合成器上限仍影响最终质量,低资源下应优先保证对齐稳定而非更换骨干。
短视频与误差累积在哪里使方法失效?
原文明确分析了 3 类误差累积:识别转写错误、对齐错误,以及评估用自动语音识别自身噪声导致的词错率高估。在野外视频中,任何一环出错都会向后传递,因为后续时长分配建立在错误的音素序列之上。更具体的失败条件是时长证据不足。作者按语音时长以 1 秒为箱统计同步置信度,发现低于 1 秒的极短片段同步置信度明显偏低,而长于 2 秒后显著改善并趋于稳定。这符合单调搜索需要足够时间上下文来分配时长的直觉。 下面这张箱线图把时长与同步置信度的关系可视化,是判断方法适用边界的关键证据。
看图路径: 1. 先确认横轴是按 1 秒分箱的语音时长区间从 0 到 7 秒;2. 再比较最左侧 0 到 1 秒箱体中位线与其他箱体的高低差异;3. 观察各箱体须线与离群圆点以判断短语音的分散程度
论文图 3。原论文 Figure 3:“Box plot showing LSE-C vs the video duration.”。
该图横轴为 0 到 1 秒直到 6 到 7 秒的语音时长区间,纵轴为置信度,蓝色箱体显示中位线、四分位与须线。可见最左侧 0 到 1 秒箱体的中位线与整体箱体明显低于其他区间,分散也更大;从 2 到 3 秒起中位线抬升并保持平稳,离群圆点多出现在低分侧。复述时不要把纵轴误读为词错率,也不要把末段平稳推广为越长越好,原文只支持极短片段仍是开放挑战、需要充足时间证据的判断。
要复现先搭什么,再核对什么?
复现的第一步是准备冻结骨干:视觉语音识别、VTP 唇特征提取器、XPhoneBERT 音素编码器、ZMM-TTS 的文本到向量与向量到波形,以及多语 wav2vec2 码本。原文未提供这些骨干的训练细节,复现时应直接调用已有预训练实现而不重训。第二步实现对齐网络:线性投影加两组各 3 个非线性卷积块的查询与键投影、温度加权的能量计算、对角先验、软注意力加权,以及单调对齐搜索的动态规划与回溯计数。
第三步按 2 阶段组织训练:前 20000 步用软加权路径保证可微,之后切换为硬时长加长度调节器,并加入单调似然与路径集中正则;可先只训练对齐器,再尝试轻微联合微调文本到向量以复现 21.2% 与 23.6% 的差距。数据侧先用 LRS3 的 30 小时子集验证英文主结果,再用 MultiVSR 的 500 英文样本与多语测试集验证泛化;评估需固定同一套词错率、DNSMOS、STOI-Net 与唇同步专家的实现与聚合方式,否则数值不可比。
缺失项包括优化器、学习率、损失权重与具体数据划分,复现报告应明确标注这些未验证假设,不从模型名称推定实现。原文补充材料还提到 oracle 文本、识别误差传播与对齐鲁棒性的扩展消融,可作为第二轮验证。
何时值得尝试这种改造,何时不值得?
当已有高质量、多语、多说话人的长度可控语音合成器,且只能拿到几十小时甚至几小时带视频的语音数据时,这种只学文本到视频对齐的改造值得优先尝试,因为它把数据需求集中在时长映射而非声音建模上,并保留了合成器的自然度与跨语能力。英文实验与零样本多语对比共同支持这一判断,但也给出明确边界:若上游识别在目标语言上错误率很高,或输入多为 1 秒以内的极短片段,或所用合成器不支持外部时长控制,收益会大打折扣。
实际部署还需单独测量推理延迟、显存与输出帧率,原文仅报告 2080 Ti 上 5 秒音频约 6 秒的耗时,不能直接换算为流式延迟。总体而言,论文把唇到语音从重训发声改为复用发声加学习时间,为低资源语言与野外视频提供了一条可核对的轻量路径,但短语音同步、识别误差传播与主观自然度的进一步提升仍待验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


