英文题目:HW-TSC’s Submission to the IWSLT 2026 Cross-Lingual Voice Cloning Track
会议身份:
conference:iwslt:2026:conference-paper-id:2026.iwslt-1.11
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#Transformer #跨语言 #多语言 #语音克隆
评分:4.7/10 | 创新 0.8/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告
👥 作者与机构
- Yu He:机构信息未能从会议 PDF 纯文本可靠映射
- Daimeng Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Jiaxin GUO:机构信息未能从会议 PDF 纯文本可靠映射
- Yuanchang Luo:机构信息未能从会议 PDF 纯文本可靠映射
- Hengchao Shang:机构信息未能从会议 PDF 纯文本可靠映射
- Zongyao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiqiang Rao:机构信息未能从会议 PDF 纯文本可靠映射
- Jinlong Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhanglin Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Boqi Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoqing Lan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
跨语言语音克隆(Cross-Lingual Voice Cloning)要求在源语言参考音色约束下生成目标语言语音,保持内容可懂与音色一致。赛道含阿拉伯文、中文、法文三个目标语言,本文仅参加中文与法文两轨。难点在于官方提供的12段约5分钟长参考音频直接输入易出现特征衰减与特征分散,加之跨语言韵律失配导致音色相似度下降。本文方法为无训练三阶段流水线:重叠滑动窗口预处理将长音频按10秒窗长、5秒步长切分为约60个标准化短片段,构建多候选参考库;每个短片段作为独立音色约束,联合官方文本chinese.txt和french.txt中单句目标文本,输入Qwen3-TTS-12Hz-1.7B-Base进行一对多批量合成;再用冻结的ECAPA-TDNN说话人确认(Speaker Verification)模型提取声纹嵌入向量,以余弦相似度对同一文本同一说话人的全部候选取峰值保留。与直接使用整段长音频的常规零样本(Zero-Shot)克隆相比,该组合以冗余切分扩大候选多样性并以后验筛选替代人工试听。在BlindData评测中,中文字符错误率(Character Error Rate,CER)为1.39%到2.25%,法文词错误率(Word Error Rate,WER)为4.40%到8.52%,音色余弦相似度多在0.5以上,法文样本2023.acl-long.23达0.7173且WER为5.00%,中文样本2023.acl-long.193达0.7052且CER为2.10%。该结论仅适用于12个样本的单次评测,未验证短参考、噪声参考、阿拉伯文及其他语言的外推能力,原文未披露训练、推理耗时与部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,哪些信息必须保留?
这项工作的输入有两类。第一类是说话人参考音频,组织方提供 12 段原始音色参考,每段约 5 分钟,需要保留的是同一说话人在源语言下的音色质地、语速习惯与韵律细节。第二类是目标文本,组织方提供 chinese.txt 与 french.txt,每个独立句子对应一条待合成语音,要求严格保留原文顺序与语义信息。
输出是跨语言克隆语音,也就是用源说话人的音色说出目标语言的句子。参赛轨道包括阿拉伯语、中文与法语,本文实际参加的是中文与法语 2 个任务,阿拉伯语轨道未参加。输出既要让人听出是同一个人,又要让人听清说的是目标文本。
必须保留的信息分成 3 层。内容层要求合成语音经识别后与标准文本一致,中文用字错误率考核,法语用词错误率考核。音色层要求合成语音的声纹嵌入与原始说话人基线接近,用余弦相似度考核。自然度层要求语音不出现明显的机械感与断裂感,这是跨语言韵律迁移时最容易损失的部分。
初学者容易把 3 层混在一起。正确做法是把一个样本走完:输入一条中文句子加一个 10 秒参考切片,经过模型得到一条候选音频,再分别计算内容错误率与声纹余弦值,最后只保留同文本下余弦最高的一条。本解读只依据论文正文证据写作,不引入外部模型下载或代码仓库的断言。
未发现来源绑定且完成验证的资源,因此不声称代码、模型或数据已公开。复现部分只讲论文写明的调用与计算动作,不补写下载链接与运行环境假设。
同类路线如何划分,本文选择落在什么位置?
论文把背景分为规则合成、传统克隆与大模型克隆。早期规则与定制数据集方法在受限环境稳定,但难以刻画自然语言多样性、情感细节与个人音色差异。随着大规模预训练语音模型与生成式语言模型发展,出现了 Qwen3-TTS、Qwen3-Omni、IndexTTS2、CosyVoice3、OpenVoice2 与 VoxCPM 等路线。
这些新路线的核心变化是以少样本、零样本与跨语言范式打破数据约束与语言壁垒。也就是说,只用极短参考音频就能迁移音色,而且参考语言与目标语言可以不同。这正是本次跨语言音色克隆赛道的前提假设。
在同输入同目标下比较,本文路线属于零样本跨语言克隆。不为每个说话人训练分类标签,而是把说话人身份当作可迁移的解耦潜在向量,在推理阶段动态抽取重组。与需要额外适配的方案不同,本文直接调用多语言基座的零样本能力,省去适配工作,换来快速迭代与端到端集成。
与级联式声学模型加声码器不同,Qwen3-TTS-12 Hz-1.7B-Base 用 16 层多码本编码器把语音压缩为离散 token,再用多码本语言模型直接建模生成逻辑。论文也点出两类共性瓶颈,第一是特征解耦困难,第二是少样本与低质量参考下鲁棒性不足。这些判断用于解释后文为何要用大量重叠切片扩大候选,再用客观声纹筛选压住主观偏差。
跨语言克隆的难点为什么集中在长参考与韵律失配?
第一个难点是长参考的特征利用。约 5 分钟的原始音频包含不同时段的语速、音色与韵律变化,若只截一段代表全部,容易漏掉细粒度特征。若把整段直接送入模型,又会出现过长导致的特征衰减。论文的选择是全部保留而非部分采样,宁可增加计算量也要保证覆盖完整。
这是理解后文约 60 段设计的关键。减少段数可以节省计算,但可能丢失关键细粒度音色特征并降低克隆相似度。论文明确把最佳克隆效果放在首位,因此选择保留全部切分结果。这种以计算换覆盖的取舍贯穿全文。
第二个难点是跨语言韵律迁移。参考音频与目标生成分属不同语言,语调、节奏、重音分布与音节韵律本就不同。模型在迁移个人韵律习惯时无法完全复制,导致声纹嵌入偏移。论文的失败分析明确把部分低相似度归因于此类失配,而不是内容错误。
这提示初学者不要把余弦低一律解读为字词读错。第三个难点是候选爆炸后的公平选择。单一切片映射多条文本会产生大量差异化候选,若靠人工试听既不可复现又有偏好偏差。论文把选择问题转化为声纹向量比较问题,用同一文本同一说话人下的全局最高余弦作为保留标准,使筛选动作可重复、可核对。
整体流水线如何从长音频走到最优输出?
流水线分为 3 段。第一段是数据预处理,对 12 段原始参考做滑动窗口重叠切分,得到标准化短参考库。第二段是基于 TTS 的批量克隆,每个短切片作为独立音色约束,对全部文本句子做批量推理。第 3 段是最优结果搜索,用声纹嵌入并计算余弦相似度,为每个文本保留峰值对应音频。
零样本语音克隆 × Qwen3-TTS-12 Hz-1.7B-Base: 零样本语音克隆负责在不做说话人适配训练的前提下,仅凭短参考音频约束生成新文本语音;Qwen3-TTS-12 Hz-1.7B-Base 负责提供已覆盖中法双语的端到端生成能力,包括文本编码、说话人编码与声学解码。二者搭配的理由是前者定义了任务约束,后者提供了可直接调用的解耦表征与离散语音建模,组合意义是把跨语言克隆转化为参考切片约束加文本语义约束的 1 次前向推理加事后筛选流程。
沿一个样本走一遍更直观。假设目标是一句法语文本,先取出一个 10 秒中文参考切片,模型以切片约束音色、以法语文本约束语义,生成一条法语候选。换另一个切片重复,得到另一条候选。最后把所有候选与原始基线 3 段的嵌入比较,余弦最高者作为该句的最终输出。
论文对中法双语使用同一实现管线,不为某一语言单独改结构。这使双语结果具有可比性,也简化了系统集成与赛时迭代。批量生成保证多样性,声纹筛选保证一致性,最终输出兼顾自然度与声纹保真。
滑动窗口如何切分长音频,具体参数是什么?
论文的窗口长度设为 10 秒,滑动步长设为 5 秒。从音频起点每次取 10 秒再向前滑 5 秒连续裁剪,直到窗口边界超过总时长。每段原始音频据此分成约 60 段,12 段原始音频的全部切分都被保留到后续流程。
滑动窗口切分 × 说话人编码器: 滑动窗口切分负责把约 5 分钟的长参考音频按 10 秒窗、5 秒步长连续切成约 60 段标准化短片,保留语速音色韵律的时段差异;说话人编码器负责从每个短片中抽取音色相关的潜在向量作为合成约束。二者搭配的理由是过长音频直接输入易造成特征衰减,而短片更符合克隆模型对参考长度的假设,组合意义是用重叠冗余扩大参考样本量并避免非重叠裁剪丢失细粒度音色细节。
实现细节按原文 4 步复述。第一步遍历原始目录下全部 WAV 文件,按原始采样率加载,避免重采样引入失真与特征偏移。第二步按采样点总数计算总时长,把基于时间的窗长与步长换算为采样点数,以适配时域序列处理。
第 3 步执行滑动裁剪,从起点开始连续取段。第 4 步把切分结果汇总为参考任务清单,覆盖目标说话人在不同时期的声音细节与韵律特征。初学者应注意,这里的重叠不是数据增强的花招,而是用步长重叠同时实现标准化长度与信息冗余。
这种方法充分保留说话人的音色、韵律模式与声纹细节。它也扩大了参考样本量,有效避免非重叠裁剪造成的音色特征丢失。保留全部的理由在原文写明:减少段数可省计算,但可能丢失关键特征,而首要目标是最佳克隆效果。
批量合成如何用一个切片生成多条候选?
批量合成的构造方式是单参考切片映射多条文本。每条标准化切片独立作为音色强约束,捕捉原始说话人的音质与说话习惯,目标语言文本作为语义约束。模型生成高音色相似度的跨语言克隆语音,这种 1 对多生成极大丰富了候选的多样性与覆盖度。
论文强调文本顺序与语义严格保留,确保生成内容符合任务要求。遍历全部重叠切片与全部文本句子,就得到大规模差异化候选集。为后文基于嵌入相似度的筛选提供充足候选,是该步骤的直接目标。
内容约束 × 音色约束: 内容约束负责由目标语言文本决定合成语音要说什么,保证语义顺序完整;音色约束负责由当前参考短片决定合成语音像谁,约束音质与说话习惯。二者搭配的理由是跨语言克隆必须同时解耦语言信息与说话人身份,组合意义是在 Qwen3-TTS 的 1 次推理中形成语义分支与音色分支共同作用,使同一文本能由不同切片生成差异化候选再供声纹筛选。
这种分工使内容保真与音色还原被分开约束又联合验证。同一文本因此拥有来自不同时段的大量候选,覆盖了说话人在不同时期的声音状态。下一步的筛选只需要在同一文本分组内比较,不跨文本混合比分。
声纹选优如何把主观试听变成可复现排序?
选优管线的基线先固定。对 12 段原始参考的每段随机裁 3 段 10 秒样本,作为该说话人的基线音色样本,用于统一评价所有克隆音频的还原程度。这个基线在全文评价中保持一致,是公平比较的前提。
ECAPA-TDNN × 余弦相似度: ECAPA-TDNN 负责把基线参考与候选合成音频映射为固定维度的声纹嵌入向量,使音色变为可计算的高维特征;余弦相似度负责度量两组向量在特征空间中的方向一致程度,数值越高表示音色风格越接近。二者搭配的理由是嵌入提供了统一的比较空间,余弦提供了与幅度无关的客观标尺,组合意义是把从大量 1 对多候选中选最优的问题变成可复现的全局比分排序问题。
然后对每条克隆样本执行 3 步。第一步用 ECAPA-TDNN 抽取基线与克隆音频的固定维度声纹嵌入,把音色转为可量化的高维向量。第二步计算克隆向量与原始基线向量之间的余弦相似度,值越高表示音色风格与发声特征越一致。
第 3 步做全局最优选择,对同一文本同一原始音色的全部比分比较,保留峰值对应音频。通过声纹特征抽取与定量相似度计算,论文构建了客观可复现的音色评价体系。它高效实现海量生成样本的精细过滤,最终保留音色还原最佳的结果。
本研究训练了什么,没有训练什么?
本研究没有报告任何神经网络训练阶段。没有给出训练数据划分、优化器、学习率、梯度路径或参数更新安排。Qwen3-TTS-12 Hz-1.7B-Base 与 ECAPA-TDNN 在本工作中都是被调用的既有模型,前者负责推理生成,后者负责声纹嵌入抽取。
转写环节调用 Qwen3-ASR-0.6B,把生成音频转写为文本以计算内容错误率。不能把冻结或调用既有模型等同于确定性求解,同一文本不同参考切片会得到不同候选,筛选结果依赖候选集合的构成。随机裁剪基线 3 段也会引入抽样差异。
真实计算过程是推理加搜索。推理侧是遍历全部重叠切片与全部文本句子的批量前向生成,约束来自参考切片与目标文本。搜索侧是对同一文本的全部候选计算余弦分数并取最大值,属于事后全局选择,不是可部署的单次生成策略。
论文未报告梯度是否流动、参数是否冻结、声纹筛选阈值如何设定。这些属于具体缺项,复述时应明确指出未报告,而不从模型名称推定实现。对于研究生,关键是区分可复现与可部署,声纹选优可复现但需要先生成大量候选再比较。
推理开销与输出帧率、实际延迟是不同概念,论文未测量延迟与成本。因此不承诺该流程在延迟或成本上更优,也不把峰值筛选效果当作平均单次生成水平。
数据、基线、指标与评估动作如何组织?
数据侧的确定性事实是 12 段原始参考、每段约 5 分钟,以及官方标准文本 chinese.txt 与 french.txt。预处理后每段长音频得到约 60 个 10 秒短段,窗口 10 秒、步长 5 秒。基线音色样本是每段原始音频随机裁 3 段 10 秒,用于统一评价。
论文参加的是中文与法语两个目标语言任务,同一管线应用于双语。这种同一实现保证了跨语言比较的条件一致性,不因管线差异引入额外变量。文本顺序与语义在生成中严格保留。
指标侧分为内容一致性与说话人相似度。内容一致性用 Qwen3-ASR-0.6B 转写生成音频,再与标准文本比较,中文计算字错误率,法语计算词错误率。错误率越低表示语义完整性与语言准确性越高,增删替错误越少。
说话人相似度基于 ECAPA-TDNN 嵌入的余弦相似度,越高表示与原始说话人越一致。论文未报告人工评分,因此所有关于自然度的讨论都应理解为基于低错误率与高相似度的有限支撑,而不是人评结论。评估动作还包括对低相似度样本的归因分析。
论文把法语部分偏低分数主要归因于跨语言韵律失配,而非法语词错误本身。这种区分对实验设计有教学意义:内容指标与音色指标需要分别解读,不能用一个指标代替另一个。相关性不等于因果,低错误率与高相似度同时出现不证明筛选提升了发音准确性。
中文轨道的内容与音色结果支持什么判断?
这里的比较问题是同一管线在中文跨语言生成中能否同时保住内容与音色。公平条件是同一批量生成加同一声纹选优流程,基线音色样本统一为每音频随机 3 段 10 秒。指标方向是字错误率越低越好、余弦相似度越高越好,下表选取中文轨道 4 个代表性样本核对原文分布。
| 音频编号 | 语言轨道 | 比较条件与控制变量 | 内容错误率指标 | 余弦相似度指标 | 结果解释与代价说明 |
|---|---|---|---|---|---|
| 2023.acl-long.3 | 中文 | 同一管线批量生成加余弦选优 | 1.51 | 0.6405 | 内容较好且音色中等,支持批量候选有效 |
| 2023.acl-long.193 | 中文 | 同一管线批量生成加余弦选优 | 2.10 | 0.7052 | 中文最高相似度,抓住核心声音特征 |
| 2023.acl-long.290 | 中文 | 同一管线批量生成加余弦选优 | 2.25 | 0.4430 | 内容尚可但音色偏低,疑为韵律节奏偏差 |
| 2023.acl-long.810 | 中文 | 同一管线批量生成加余弦选优 | 1.39 | 0.6359 | 中文最低字错误率,内容保真最佳 |
表后解释需要同时给出收益与代价。收益是中文整体字错误率保持在低位,最低的 2023.acl-long.810 为 1.39,说明多切片批量生成加选优没有造成严重内容失真。音色上 2023.acl-long.193 达到 0.7052,为中文最高,表明模型抓住了该说话人的核心声音特征。
代价与反例是 2023.acl-long.290 的字错误率 2.25 并不算高,但余弦仅 0.4430。论文将其可能原因指向生成中的韵律节奏偏差,这说明内容正确不等于音色接近,两类指标必须分开看。原文还报告中文余弦范围为 0.4236 至 0.7052,多数样本在 0.5 以上。
字错误率 × 词错误率: 字错误率负责度量中文合成语音经识别后与标准文本在字级别的增删替差异;词错误率负责度量法语合成语音在词级别的同类差异。二者搭配的理由是中文与法语的书写与发音单位不同,需要用各自语言惯用的内容保真指标,组合意义是把内容一致性与音色相似度分开考核,避免把韵律失配误读为内容失真。
该分布支持方法有效实现了跨语言克隆,但波动受韵律与参考清晰度影响。法语整体词错误率略高于中文字符错误率,原文解释为发音规则、词汇复杂度与韵律特征的语言固有差异,仍在合理范围内。不能把自动指标当成人评,也不能把峰值最优当作单次部署收益。
法语轨道的反例揭示了什么边界?
这里的比较问题是同一方法换到法语时分布是否一致,以及高词错误是否必然对应低相似度。公平条件仍是同一管线与同一筛选标准,基线仍为每音频随机 3 段 10 秒。指标方向是词错误率越低越好、余弦越高越好,下表选取法语轨道 4 个关键样本检验内容与音色的解耦程度。
| 音频编号 | 语言轨道 | 比较条件与控制变量 | 内容错误率指标 | 余弦相似度指标 | 结果解释与代价说明 |
|---|---|---|---|---|---|
| 2023.acl-long.23 | 法语 | 同一管线批量生成加余弦选优 | 5.00 | 0.7173 | 法语最高相似度,跨语言适应性较好 |
| 2023.acl-long.193 | 法语 | 同一管线批量生成加余弦选优 | 5.12 | 0.6674 | 内容中等但音色较高,双语均表现稳定 |
| 2023.acl-long.289 | 法语 | 同一管线批量生成加余弦选优 | 8.52 | 0.6695 | 词错误最高但音色仍高,内容音色解耦 |
| 2023.acl-long.290 | 法语 | 同一管线批量生成加余弦选优 | 4.56 | 0.4420 | 内容尚可但相似度最低,指向韵律失配 |
表后解释要回答反证。法语最高相似度是 2023.acl-long.23 的 0.7173,略高于中文最高值,支持模型在跨语言克隆中有较好的适应性。关键反例是 2023.acl-long.289,它的词错误率 8.52 为法语最高,但余弦仍有 0.6695。
这表明模型在内容准确受损时仍能维持说话人一致性。另一个反例是 2023.acl-long.290,词错误率 4.56 并不差,但余弦 0.4420 为法语最低。论文把这类退化主要归因于跨语言韵律失配而非内容错误,不同语言的语调节奏与重音分布导致嵌入偏移。
原文报告法语余弦范围为 0.4420 至 0.7173,与中文分布相近,多数在 0.5 以上。未胜出项是 2023.acl-long.809 等低于均值的样本,论文未给出逐样本音频质量细节。总体趋势不等于每组每步都成立,个别样本的波动属于正常现象,不影响整体有效性判断。
哪些结论尚未验证,哪些代价没有测量?
论文直接报告的是客观指标分布与归因分析。余弦与错误率的数值是报告,多数样本余弦高于 0.5 支持方法有效。而韵律失配导致嵌入偏移属于有限解释,未来优化参考选择与音色匹配算法属于待验证推测。表达上应区分报告、支持与可能,不把推测写成已证结论。
缺失证据不是技术错误,但必须点明。论文未报告人工听辨评分、推理延迟、计算预算与硬件配置,也未给出消融对照。例如去掉重叠、减少保留段数或更换筛选指标后会发生什么,原文没有对照数据。因此不能承诺该方法改善了延迟或成本。
也不能从总体趋势推广到每组每步都成立。训练资源、推理开销、输出帧率与实际延迟应分别讨论,论文只涉及批量生成与事后筛选的逻辑,没有测量部署侧的实时性。另一个边界是可部署性,最终保留的是事后最优值。
它需要先生成全部候选再比较,不能直接当作单次在线生成的收益。若要部署,需要另行测量单切片单次生成的分布,而不是只看峰值。不同指标的差值不能混放比较,自动指标也不能替代人评结论。
复现应先做什么,需要保留哪些超参数?
复现的第一步是按原始采样率加载 12 段 WAV 并计算时长。把 10 秒窗与 5 秒步长换算为采样点数,从起点连续裁剪到窗口超出总长。保留全部约 60 段每音频的切分结果,不要自行抽样丢弃,这是保证覆盖完整的关键。
第二步用官方 chinese.txt 与 french.txt 的句子顺序逐条生成。每个切片独立作为音色约束批量推理,记录切片编号与文本编号的对应关系。文本顺序与语义严格保留,确保生成内容符合任务要求。
第 3 步为每段原始音频随机裁 3 段 10 秒基线。用同一 ECAPA-TDNN 抽取基线与候选嵌入,计算余弦并按文本分组取最大。内容侧用 Qwen3-ASR-0.6B 转写后计算中文字符错误率与法语词错误率,指标口径不要混用。
必须保留的信息条件包括窗口长度 10 秒、步长 5 秒、每音频约 60 段、全部保留不做部分采样。这些是论文实际给出的可执行细节,缺少任一项都会改变候选分布或评测口径。基线为每音频随机 3 段 10 秒,筛选指标为余弦相似度峰值,同样需要原样保留。
还需补做的验证包括固定随机种子后的基线稳定性、不同切片数量下的相似度变化。由于未发现可验证的公开资源,不应假设存在可直接运行的代码仓库。复现应从论文描述的预处理、批量推理与嵌入比对 3 段自行搭建,并先在少量文本上跑通全链路再扩大到全部句子。
何时值得尝试这种先切分后选优的路线?
当参考音频很长且内部状态不一致,而克隆模型更适合短参考时,值得尝试重叠滑动切分加全量保留。它用标准化长度对齐模型假设,用重叠冗余防止信息丢失,用候选多样性对冲单一切片的偶然偏差。论文在中法双语的低错误率与多数样本余弦高于 0.5 的结果支持这一选择的合理性。
但支持的是峰值筛选后的效果,而不是平均单次生成的水平。当任务要求可复现的客观筛选而非人工试听时,值得使用 ECAPA-TDNN 加余弦峰值的选优。它把音色比较变成向量计算,使同一文本下的选择可核对。需要清醒的是,这种选优依赖大量候选,计算代价明确存在。
论文选择保留全部切分正是以计算换覆盖。不适合的情况包括对延迟敏感的在线部署、参考质量极低且带噪严重的场景,以及需要人工自然度结论的评价。论文特有的误解是把内容错误率低等同于音色好,2023.acl-long.290 与 2023.acl-long.289 的对照恰好反驳了这一点。
前者内容尚可但音色偏低,后者内容最差但音色仍高。正确复述应是内容与音色分开考核,韵律失配是跨语言克隆中独立于字词正确性的风险来源。未来工作可优化参考选择与音色匹配算法,但这仍是待验证方向,不应写成已有增益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses