英文题目:Eliminating Stability Hallucinations in LLM-based TTS models via Attention Guidance
会议身份:
conference:interspeech:2026:conference-paper-id:wang26x_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#注意力机制 #知识蒸馏 #正则化 #文本到语音
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Shiming Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhihao Du:机构信息未能从会议 PDF 纯文本可靠映射
- Yang Xiang:机构信息未能从会议 PDF 纯文本可靠映射
- Tianyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Han Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Qian Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Xiangang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hanjie Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
基于大语言模型(Large Language Model, LLM)的文本到语音(Text to Speech, TTS)以文本与说话人提示为输入,自回归预测离散语音Token,缺乏显式对齐导致在长文本与困难文本上出现重复、无限延长与漏读等稳定性幻觉。本文以 CosyVoice2为对象分析解码器自注意力,发现中层存在类似交叉注意力的前向对齐带,据此提出最优对齐分数(Optimal Alignment Score, OAS):用维特比(Viterbi)动态规划在语音到文本注意力子矩阵中找到全局概率和最大的单调路径,再以路径概率占对齐区域总概率之比度量连续单调对齐质量。作者将第8层与第9层各一半注意力头指定为对齐头并加掩码限制其只关注文本到语音区域,以路径负对数似然作为正则(\(L_{OAS}\))联合训练;再用预训练教师模型中OAS最高头的最优路径换算文本Token持续时长,构造稀疏重复文本与进度条(progress bar)伪标签,以思维链(Chain of Thought, CoT)方式指导学生模型在预测语音Token时同步预测文本位置。与硬单调注意力及依赖强制对齐标签的方法不同,该链条无需外部对齐器且保留语音连续性。在Seed-TTS-Eval困难集上词错误率(Word Error Rate, WER)从13.568%降至9.984%,在CV3-Eval困难中文集上从10.239%降至6.660%,通用集相似度、UTMOS与主观平均意见分(Mean Opinion Score, MOS)未下降。结论仅在中文普通与困难朗读场景验证,未覆盖多语言、长篇章、流式与强重复口语,训练与推理成本未披露。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么难文本会念错?
这篇解读的输入是论文原文证据与 4 张官方原图像素,目标是让刚进入语音合成的研究生能复述方法与实验条件。必须保留的信息包括骨干为科大讯飞系的 CosyVoice2、两类干预为最优对齐分数正则与注意力引导的学生训练、测试集为 Seed-TTS-Eval 与 CV3-Eval 的困难与日常子集。输出是一套可核对的中文技术说明,不做营销式判断。任务本身是基于大语言模型的文本到语音合成,输入是文本与音色等声学条件,输出是离散语音记号再经声码器还原波形。
与扩散模型按预定时长并行生成不同,解码器大模型按下一个记号预测自回归生成,没有显式的文本到语音对齐过程。常见文本在大规模数据下已较稳定,但长文本、绕口令、重复句式等困难文本仍会出现稳定性幻觉,也就是重复某段、漏读某段甚至无尽生成。举例来说,这只是帮助理解的教学例子,不是论文报告的数值:若输入包含三处相似分句,模型可能在第二处打转重复,或直接跳过第三处。
论文把这类错误与注意力中文本语音对应关系的连续性与单调性联系起来,后续方法都围绕如何度量并强化这种对应关系展开。本次未能确认代码与附页链接可达,不声称代码模型数据已公开。
同输入同目标的前人走过哪几条路?
在同输入文本生成同目标语音的声学模型时代,前人直接优化编码器到解码器的交叉注意力,通过前向、单调、单步约束减少严重对齐错误。这条路依赖编码器解码器结构,与解码器独占的大模型结构不兼容,不能直接搬运。进入大模型时代,一条路是在推理期施加硬步进单调自注意力,强制每次只看固定文本窗口,论文指出这类硬注意力会损伤语音的连续性与自然度。
另一条路是用强制对齐标签帮助模型在生成语音时定位文本,包括 VALL-E-R 类思维链位置先验与音素位置预测等做法,效果依赖高质量对齐标签,在大规模数据上难以获得。还有稀疏对齐增强扩散等路线属于不同建模范式,运行阶段也不同。本文的选择是既不用硬推理约束,也不用外部强制对齐,而是先提出内部对齐质量度量,再把教师注意力提炼为伪标签。
这一选择的教学意义在于区分监督来源:前人要人工或对齐器给标签,本文要模型自己注意力中已有的稳定对应,对应代价是伪标签只反映近似位置,必须配合稀疏化与进度信号才能稳定使用。
论文把稳定性问题如何形式化为对齐问题?
论文研究的对象是解码器自注意力中语音记号对文本记号的权重子矩阵,记为 A,尺寸为语音长度 Ls 乘文本长度 Lt。理想情况下,每生成一个语音帧,其注意力能量应集中在当前应读的文本记号附近,并随时间向前连续移动。若能量分散、跳变或停滞,就对应漏读、错读与重复。论文用白话把问题说成找路:在注意力热力图上沿时间找一条从左到右连续不后退的能量中心线,线越清晰稳定,朗读越不容易错位。为此需要先确认哪些头真正负责找路,再给出打分,最后把打分变为训练约束,并把教师找到的路变为学生的中间监督。
稳定性幻觉 × 文本语音对齐: 稳定性幻觉指生成重复、遗漏或无尽语音的现象,文本语音对齐指输出语音记号应按顺序覆盖输入文本记号的对应关系,二者搭配的理由是论文把幻觉归因于对齐头能量不连续不单调,因此用对齐质量来解释并干预幻觉,组合意义是把听感错误转化为可计算的注意力路径问题。
后续所有公式与训练改动都服务于这条线:先度量,再选头加约束,再蒸馏路径。需要强调的是,相关性不等于因果,论文报告的是分数与词错误率负相关,不能直接读成提高分数必然消除一切幻觉,还需看受控训练对照。
两步注意力引导的全景是什么?
方法全景分为两步。第一步是提出最优对齐分数并把它作为正则加入 CosyVoice2 训练,做法是指定第 8 层与第 9 层各一半头为对齐头,用掩码限制它们只关注文本与语音之间的对齐区域,再最大化沿最优路径的注意力概率。第二步是注意力引导的学生训练,用预训练教师中分数最高的头的最优路径作为伪强制对齐,转化为稀疏文本目标与进度条目标,让学生在预测语音记号时先预测这两路中间信号,但中间预测不回填为下一步输入,以避免误差累积。
两步共用同一假设:中层存在对齐头,其注意力路径反映朗读进度。第一步直接优化该路径的清晰度,第二步把教师路径作为可学习的定位课程。 下面先看学生训练的整体数据流,再回到每一组件的计算,图中虚线框与掩码记号的含义将在图后解释。
看图路径: 1. 先从底部文本与波形两个分词器入口看输入如何变为文本记号与语音记号;2. 再看中间语音记号语言模型向上预测的箭头指向哪一排输出;3. 对比顶部虚线框内文本记号行与进度条值行的掩码与稀疏排列;4. 确认预测出的文本与进度值不作为下一步输入的断开关系
论文图 4。原论文 Figure 3:“Visualization of the attention-guided training for student CosyVoice2”。
该图展示的是学生 CosyVoice2 注意力引导训练的可视化,底部有两个入口,左侧文本经文本分词器变为 t1 至 t3 等文本记号,右侧波形经语音分词器变为蓝色语音记号,中间绿色块为语音记号语言模型。顶部虚线框内有两行监督:一行是进度条值 p1 至 p3 与掩码 M 交错,一行是稀疏文本 t1 至 t3 与掩码交错,下方还有一排蓝色待预测语音记号与结束符 E。
像素可见的教学要点是稀疏性与双路性:文本行每个有效位置只出现 1 次真实记号其余为 M,进度行同样稀疏,这对应正文为缓解伪标签边界不准而做的设计。另一要点是断开回填:中间预测只作损失监督,不作为下一步输入,这与 VALL-E-R 把预测文本回填的做法不同,目的是阻断不准预测的连锁影响。
思维链 × 伪强制对齐标签: 思维链在此指学生在预测语音记号之前先预测当前对应的文本记号与进度条值的中间步骤,伪强制对齐标签指从预训练教师最高分数对齐头提取的最优路径转化来的时长与位置监督,分工是前者给出推理格式后者给出监督来源,搭配理由是避免依赖大规模人工强制对齐,组合意义是用教师已学到的稳定对应关系引导学生逐步定位。
对齐头长什么样,最优对齐分数怎么算?
骨干 CosyVoice2 以 Qwen-0.5B 为初始大模型,论文交代包含 24 层 Transformer,每层 14 个注意力头,在 WenetSpeech4TTS 上从零训练大模型部分。分析发现低层偏全局信息,高层偏输出邻域,中层出现特定对齐头,其语音到文本权重呈现类似交叉注意力的全局前向路径。图 1 给出典型的单个对齐头分数可视化,阅读时先看坐标再看分界最后看路径。
看图路径: 1. 先确认横轴为输出语音记号纵轴为输入记号的热力图坐标;2. 再找到红色虚线标识的文本与语音分界位置;3. 观察分界线下方从左下向右上连续爬升的细亮对齐带;4. 对比上方大面积深色背景与零散亮点的全局稀疏程度
论文图 1。原论文 Figure 1:“The visualization of the score for a typical “ alignment head” in CosyVoice2, where the red dashed line represents the boundary between text tokens and speech tokens in the input…”。
该图横轴为输出语音记号,纵轴为输入记号,右侧色条表示注意力概率从 0.0 到约 1.0,红色虚线为文本与语音的分界。像素可见分界线下方有一条从左下向右上缓慢爬升的细亮带,代表语音生成过程中关注的文本位置连续前移,分界线上方大面积为深色背景并有少量零散亮点。教学上这说明对齐功能只占注意力矩阵的一小部分能量集中带,其余位置应被掩码或正则忽略,这也是后文只约束指定头并限制其关注区域的依据。
对齐头 × 最优对齐分数: 对齐头指中层自注意力中负责让语音记号关注文本记号的若干头,最优对齐分数指用维特比算法在语音到文本注意力子矩阵中找到全局最优单调路径并计算路径概率占比,分工是前者提供位置后者提供评价,搭配理由是直接对全部头加约束会干扰全局与局部建模,组合意义是只选并约束真正承担对齐功能的头。
最优对齐分数的计算分 3 步。输入是上述子矩阵 A。先用维特比算法求最优路径 P,递推允许从正上方或左上方转移,即 dpi,j 等于 Ai,j 加上 dp 上一行同列与左一列中的较大者,从而保证路径单调不后退并最大化路径概率和。得到长度为 Ls 的路径向量后,分数定义为路径上概率之和除以整个对齐区域概率之和,值越高说明能量越集中在一条连续单调线上。
论文强调该计算保留前向梯度,可直接作为优化目标,但因每轮各头功能随机漂移,不能对未指定的头直接加损失,必须先选头并加掩码,此时分母变为常数,正则简化为对路径上对数概率取负平均,记为 LOAS。原文未给出该正则与语言建模损失的加权系数与优化器细节,这是复现时需要补记的缺项,不从模型名推定。
如何选头加约束,如何构造稀疏与进度监督?
选头依据是在 Seed-TTS-Eval 上计算每层前 7 个最高分数的均值随层深的变化,论文报告第 8 层与第 9 层显著高于其他层,据此推断对齐头主要分布在这两层。训练时指定这两层各一半头为对齐头,加注意力掩码使其只看文本语音对齐区,再施加 LOAS 正则。这一安排的理由是只优化真正负责对齐的头,避免干扰全局与局部建模。需要指出,指定一半是人工先验,论文用对照 CV2-M 验证仅加掩码不加正则不损伤性能,再用 CV2-OAS 验证加正则带来困难集下降,从而分离掩码效应与正则效应。 下图是层均值随深度的变化,阅读时重点比较主峰与次峰和平坦段。
看图路径: 1. 先确认横轴为 1 至 24 层纵轴为平均最优对齐分数;2. 再比较第 8 层尖峰与第 9 层次高峰相对其他层的高度差;3. 观察第 10 层之后曲线贴近零线的平坦段;4. 回看第 2 层与第 6 层的小凸起与主峰的量级差异
论文图 2。原论文 Figure 2:“Variation of average OAS with Layer Depth in CosyVoice2”。
该图横轴为第 1 至 24 层,纵轴为平均最优对齐分数,蓝色折线在第 8 层形成超过 0.5 的尖峰,第 9 层回落至约 0.2 但仍高于两侧,第 10 层之后贴近零线,第 2 层与第 6 层有 0.1 左右的小凸起。像素细节支持正文判断:对齐能力高度集中在中层,主峰与背景的量级差明显,而深层几乎不承担跨段对齐,这与高层只看邻域的定性观察一致。复现时应先复算该曲线确认头位置,再决定约束层,不宜直接照抄层号到其他骨干。
稀疏重复文本 × 进度条值: 稀疏重复文本指每个文本记号在目标序列中只被标记 1 次其余位置填掩码记号的监督格式,进度条值指已合成文本比例随文本位置累积的绝对进度量,分工是前者降低伪标签边界误差影响后者补充重复句式下的全局位置,搭配理由是仅靠文本记号无法区分重复结构,组合意义是同时给出局部对应与全局进度两路定位信号。
学生监督的构造如下。设输入文本为 t1 至 tLt,由教师最优路径转化来的时长为 d1 至 dLt。若 d 等于 2、3、3,全重复目标为每个记号按时长重复,稀疏目标为每个记号只保留 1 次其余填 M,例如 Os 为 t1、M、M、t2、M、M、t3、M,且随机标记 1 次并尽量避开边界,以缓解伪标签不准与边界模糊。进度条值定义为到位置 n 为止的时长累积占比,pn 等于前 n 项时长和除以总时长,再按 Os 有效位置稀疏化。损失包括对进度值的 L1 损失与 1 阶差分惩罚,后者惩罚预测进度倒退,即对 pi-1 预测减 pi 预测取正部求和。
训练时梯度来自这两路中间损失与原语音建模损失,中间预测不作为下一步输入。原文未报告教师与学生参数冻结更新方式与训练步数,这是另一缺项。
数据测试集模型基线与指标如何组织?
训练数据为 WenetSpeech4TTS,用于从零训练大模型部分。测试分为困难与日常两类:Seed-TTS-Eval 的 hardcase 子集与 CV3-Eval 的 hard zh 子集用于困难文本,Seed-TTS-Eval 的 meta zh 子集与 CV3-Eval 的 zh 子集用于日常文本。待评模型包括标准 CosyVoice1 与 CosyVoice2 记为 CV1 与 CV2,仅人工指定对齐头加掩码的 CV2-M,在指定头上加 LOAS 的 CV2-OAS,以及注意力引导的学生模型 CV2-AG,后者又分全文本引导、稀疏文本引导、稀疏文本加进度条值三档。
指标方向为词错误率越低越好,由 Paraformer 计算,发言人相似度由 WavLM 计算越高越好,自然度由 UTMOS 工具计算越高越好,主观平均意见分由 15 位普通话母语听音人对每数据集随机 30 句打分,越高越好。公平条件是同一测试集与同一识别与打分工具,困难与日常分开报告,避免用日常平均掩盖困难错误。论文未报告解码温度、采样次数、统计显著性与硬件预算,复现时需固定这些条件并多次采样取均值。
主结果显示困难集变好日常集是否受损?
先验证度量本身。论文用 CV2 合成 400 句困难文本,取全部头中前 5 高分的均值作为整句分数,画出分数与词错误率散点并做线性拟合,报告相关系数为负 0.638,支持分数越高错误越低的判断,但散点离散说明不是单调决定关系。 下图是该散点与拟合线,阅读时先看轴再看趋势最后看离散。
看图路径: 1. 先确认横轴为最优对齐分数纵轴为词错误率的散点分布;2. 再看红色虚线拟合线从左上向右下的整体走向;3. 观察低分数左侧高错误率点团与高分数右侧贴零点团的密度变化;4. 注意中间分数段上下分散很大的离散程度
论文图 3。原论文 Figure 4:“The WER-OAS in CosyVoice2 scatter plot, where the red dashed line denotes the linear fitting line.”。
该图横轴为最优对齐分数约 0.28 至 0.85,纵轴为词错误率约 0.00 至 0.40,蓝色星点为每句样本,红色虚线为拟合线自左上向右下降。像素可见左侧低分区点团偏高且分散,右侧高分区大量点贴近零错误,但中段 0.5 至 0.65 仍有从零到 0.35 的垂直 spread,说明高分对应低错误是趋势而非逐点保证。教学上应把该图读成必要不充分证据:它支持用分数选头与监督,但不能把单句分数直接当错误率预测器。
词错误率 × 主观平均意见分: 词错误率指用识别模型转写合成语音后与原文的不一致程度方向越低越好,主观平均意见分指母语听音人对自然度的打分方向越高越好,分工是前者衡量稳定性后者衡量自然度是否受损,搭配理由是硬注意力或强约束可能换稳定性丢自然度,组合意义是必须同时看两类指标才能判断改进没有引入负效应。
主结果的比较问题是:在同一测试集与同一指标下,加对齐约束与注意力引导相对标准 CV2 能否降低困难集词错误率且不降低相似度自然度与主观分。表前公平条件为困难日常分开、指标方向按上节、基线包含可运行的 CV1 与 CV2。下表整理论文直接报告的相对下降量,日常基线已较稳定因此绝对变化小,困难集变化大,单位保留原文百分点写法。
| 场景 | 对比 | 困难集词错误率下降 | 日常集词错误率下降 | 日常基线稳定性 |
|---|---|---|---|---|
| Seed-TTS-Eval | CV2-OAS 相对 CV2 | 2.1% | 0.1% | WER of less than 4% |
| CV3-Eval | CV2-OAS 相对 CV2 | 1.6% | 0.2% | WER of less than 4% |
表后解释如下。
论文报告 CV2-OAS 在两套困难集上分别下降 2.1 与 1.6 个百分点,日常集仅下降 0.1 与 0.2 个百分点,同时相似度与 UTMOS 未下降,主观分在日常集上持平或略升。这支持对齐约束缓解幻觉且与合成任务特性一致的判断。代价与限制是日常绝对收益小,困难集仍有残留错误,且论文未测量延迟与训练成本,不能承诺这些量改善。未胜出项是仅加掩码的 CV2-M,其困难集未带来一致下降,说明掩码本身不是收益来源,必须配合正则。
原文大表还显示 CV2-AG 稀疏加进度档在困难集上进一步下降,但因逐字绝对值需原表绑定,此处只用相对量作可重放结论,绝对值复现时应以原论文大表与官方评测脚本为准。
稀疏与进度条各自解决了什么失败条件?
消融的比较问题是:在同一教师伪标签下,全文本、稀疏文本、稀疏文本加进度条三档学生监督哪一档更能抵抗伪标签不准与重复句式。公平条件是同骨干同教师同测试集,指标仍看困难集词错误率与训练文本预测准确率。论文报告稀疏优于全量,稀疏加进度最优,并用训练与验证集上的文本预测准确率解释:稀疏避免边界模糊与时长不准的逐帧强迫,全量则把伪标签误差逐帧放大。
进度条的增益集中在含重复结构的困难输入,因为它提供绝对进度,帮助模型知道已读多少。下表整理与该解释相关的规模与统计条件,数字与单位来自原文连续句,避免为凑宽度编造性能列。
| 环节 | 对象 | 数量与位置 | 统计方式 | 关键数字 |
|---|---|---|---|---|
| 骨干结构 | Transformer 层与头 | 中层对齐头 | 每层头数 | 24 Transformer layers with 14 attention heads |
| 度量验证 | 困难句合成 | 相关性样本 | 识别工具 | 400 hard text sentences was synthesized by CV2 |
| 度量验证 | 分数错误关系 | 全头取均值 | 相关系数 | −0.638 |
| 主观评测 | 听音规模 | 日常集随机句 | 听音人数 | 30 sentences were randomly selected and 15 native Mandarin speakers |
表后解释如下。
该表不支持性能排序,只用于复现核对:骨干规模决定选头空间,400 句与前 5 均值决定分数错误散点的计算口径,30 句与 15 人决定主观分的抽样规模。结合正文,三档学生的排序为稀疏加进度最好、稀疏次之、全量最弱,但论文未报告三档在日常集上的显著性差异,也未评测超长篇章与强重复对抗集,这是未评测边界。复现时应先固定教师最高分头的提取方式,再分别跑三档并记录文本预测准确率与进度倒退惩罚的变化,不能只看最终词错误率。
哪些结论不能推广,哪些开销尚未测量?
论文直接报告的是在 CosyVoice2 骨干与两套中文为主评测上的困难集下降与日常自然度不降,有限解释是对齐头集中于第 8 与第 9 层,未验证推测是该层号可迁移到其他大模型。相关性为负 0.638 支持度量有效,但散点离散说明单靠分数不能完全决定错误,须表述为支持而非证明。
缺失证据不是技术错误,但影响复现:正则权重、学习率、训练步数、教师学生是否冻结、解码采样参数、显著性检验、训练与推理开销均未在证据中交代,不能从模型名推定实现,也不能把无训练等同于确定性求解。总体趋势不等于每组每步成立,困难集平均下降不代表每句都变好,日常平均持平不代表无退化个例。推理延迟、输出帧率与实际首包延迟应分别讨论,论文未测量这些量,因此不承诺更快更便宜。
附页链接本次未能确认可达,资源状态为无绑定验证,不得声称已公开。
复现先做什么,需要哪些超参数与信息条件?
复现建议按学习依赖排序。第一步复算注意力分析:在 WenetSpeech4TTS 训练的 CosyVoice2 上抽取每层每个头的语音到文本子矩阵,用维特比递推求路径并计算路径占比,复画层均值曲线确认峰值是否仍在第 8 与第 9 层,若骨干不同则重选头。第二步复现 LOAS 训练:对选定头加掩码限制关注区,损失取路径上对数概率负平均,与原语言建模损失联合优化,需记录权重、优化器、冻结策略与随机种子,论文未给这些值,初次跑可用小权重起步并做权重扫描。
第 3 步复现教师引导:取教师最高分头路径转时长,构造稀疏文本与进度条目标,中间预测不回填,损失含 L1 与防倒退差分项,需记录稀疏标记随机规则与边界避让逻辑。评测先固定 Paraformer、WavLM 与 UTMOS 版本与解码参数,再分别跑困难与日常子集,报告词错误率、相似度、UTMOS 与主观分,避免跨工具比较。关键信息条件是文本分词与语音分词必须与教师一致,否则路径位置无法对齐。
若要声称可运行,必须区分代码开源、权重下载与端到端可运行,当前证据不足以确认,复现报告应写明缺项与替代做法。
何时值得尝试这套注意力引导?
当系统已是解码器大模型、困难文本出现重复漏读、且拿不到高质量强制对齐时,这套方法值得尝试,因为它只用模型自身注意力提炼监督,不引入外部对齐器。尝试顺序是先用最优对齐分数诊断:若困难句分数系统性偏低且散点呈负相关,再对中层对齐头加 LOAS;若重复句式仍错位,再引入稀疏文本加进度条的学生引导。适用条件是教师在日常文本上已较稳定,否则伪标签会把错误传给学生。
不适用场景包括需要严格逐字时长控制的配音任务,此时伪标签精度不足,应补人工对齐或显式时长模型。还需补的验证包括跨骨干层位置、跨语言困难集、长篇章稳定性、显著性与延迟成本。记住论文特有的易错点:掩码本身不带来收益,稀疏化与不回填是关键,分数高对应趋势好但不保证单句零错,日常小幅变化不能读成相对百分比大幅优化。按此理解,研究生可独立复述从输入到表示到组件到目标再到输出的完整链路,并据此设计对照实验。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



