英文题目:PolyBench: Benchmarking LLM-based TTS Systems for Chinese Polyphone Disambiguation
会议身份:
conference:interspeech:2026:conference-paper-id:lu26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #数据集 #基准设计 #文本到语音
评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Chunhui Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Feifan Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Liming Song:机构信息未能从会议 PDF 纯文本可靠映射
- YoonChoon Hwang:机构信息未能从会议 PDF 纯文本可靠映射
- Junkwang Oh:机构信息未能从会议 PDF 纯文本可靠映射
- Gunu Jho:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
中文大语言模型语音合成直接从原始文本生成波形,消歧隐含在语言模型内部,传统字形到音素模块的显式准确率与语音识别转写的字错率都无法可靠捕捉声调与拼音错误。作者构建PolyBench的方法链分为四步:基于第7版现代汉语词典在3500个一级通用规范汉字内提取高频多音字词并做规则过滤,接着用DeepSeek-V3.1按词典义项生成带拼音标注与类别标签的语境句,然后经母语者人工核验语义唯一性与标注正确性形成三个测试集,最后用大音频语言模型转写合成语音并抽取目标字拼音自动判分。与已有中文多音字数据集相比,关键差异在于从训练集转向覆盖494字与88词的评测专用设计,并引入长句多音与词级语境等对抗性协议,具有暴露端到端系统隐性错误的实际意义。在主测试集6016句上,最优系统FireRedTTS-2的多音字拼音准确率为82.02%,高于最强字形到音素模型G2PW的79.10%,但方言类仅42.17%左右。该结论仅适用于普通话标准读音与高频字,未验证生僻字、情感变调感叹词与跨句篇章消歧的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 数据相关资源:https://github.com/Chunhui-Lu/PolyBench — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要交付什么
本文的输入是中文文本句子,句子中包含事先标好正确拼音和类别的多音字或多音词。目标是让语音合成系统读出与上下文语义一致的发音,并能量化它读对了多少。论文要交付的不是一个新合成模型,而是一套可复用的基准,名字叫 PolyBench。基准包含 3 套测试集、一个自动发音标注流程,以及对 3 个注音模型和 17 个开源大模型语音合成系统的评测。
资源状态是判断公开情况的唯一依据,本次收到的资源记录显示数据集链接状态为可用,地址为项目仓库,因此可以写当前已公开可用。读者需要保留的关键信息是覆盖规模、类别划分、指标定义和最佳系统的上限数字,后文所有复述都围绕这四点展开。学习路径是先理解为什么字对不等于音对,再看数据集怎么做,再看自动裁判是否可信,最后看评测条件和差距。教学中举的例子都明确标为例子,不代表论文报告的数值。
比如倔字在倔脾气中读一种音,在倔犟中读另一种音,这只是帮助理解上下文决定读音的例子,具体拼音以词典和论文标注为准。
附表一:三套测试集各考什么
这张表要回答的比较问题是 3 套测试集是否互补,公平条件是它们都源自同一 494 字的词典抽取和同一套类别定义,指标方向是规模越大、考查点越难越能暴露差距。表中数字来自论文正文连续原句,文本列为可直接复述的构造方式和考查目标。
| 测试集 | 覆盖对象 | 规模 | 构造方式 | 考查目标 |
|---|---|---|---|---|
| 主集 | 494 个多音字和 88 个多音词 | 6016 句 | 词典抽取加规则过滤加大模型造句加人工校验 | 单句单点消歧分 5 类 |
| DictWords | 375 个字对应的常见复词 | 2137 词 | 按语料库词频选前 5 高频词去重 | 词汇搭配记忆 |
| ALLinONE | 494 个多音字每字一句 | 494 句共 1138 实例 | 一句包含该字全部读音加人工检查 | 同句多点长距离 |
表后解释是主集保证广度和类别,DictWords 用高频词把难度降低从而检验基本功,ALLinONE 用密集多音把难度拉高从而检验推理。三者结合后出现分化,常见词分数高而整句全对极少,这正是互补的价值。代价是合成量大,每个系统约 6 小时音频,标注必须依赖自动裁判。未胜出项是只看其中一套会高估系统,比如只看 DictWords 会忽略同句多音的失败。
附表二:自动裁判与最佳上限的关键数字
这张表要回答的比较问题是在自动裁判可信的前提下最佳系统离可用还有多远,公平条件是同一 ALLinONE 语音上人工与自动对比,指标方向是标注一致越高越好、发音准确率越接近人工越好、系统拼音分越高越好。表中数字同样来自论文正文连续原句,其余为定性对照。
| 条件 | 指标 | 人工参考 | 自动裁判 | 最佳系统 |
|---|---|---|---|---|
| 代表系统在 ALLinONE 上 | 发音准确率 | 67.75% | 接近人工 | 未单独列出 |
| 大规模评测主集上 | 多音字拼音准确率 | 受标注误差影响 | Qwen3-Omni-Instruct 作裁判 | 82.02% |
| 类别短板 | 方言口语文学差距 | 显著落后 | 声调错为主 | 仍有约 18% 读错 |
表后解释是主要收益是用可扩展的自动裁判替代昂贵人工,且排序在差距大时稳固;具体代价是剩余声调错会让接近的系统分不出高下,方言口语文学 3 类的低分不能简单归为模型差,部分来自参考口径与实际口语的偏离。未评测边界是延迟、成本和更广生僻多音字,论文明确留作未来工作。
已有数据集和评测路线各解决了什么,还缺什么
同输入同目标的已有工作是中文多音字消歧数据集。论文回顾了 3 条路线。第一条是 CPP,包含 623 个多音字,测试划分有 10254 句,但论文指出其测试集存在标注错误,常用多音覆盖不足,且其中 425 个字实际上只有一种读音。第二条是 MCP,约 57000 句,来自多领域,每个多音字约 500 句,但只覆盖 114 个多音字。第 3 条是 CVTE-poly,规模约为 CPP 的 10 倍且标签更均衡,但主要贡献是新训练集,测试集沿用了 CPP 测试集。
把三者放在一起看,缺的是覆盖常用字、读音经过含义过滤、类别覆盖方言口语书面语姓氏的干净测试集。这正是 PolyBench 的定位。另一条相关路线是语音合成评测。传统做法是主观平均意见分、对比平均意见分和说话人相似度,以及客观的字错率、字形错误率和说话人相似度分数。论文指出字错率和字形错误率经由语音识别计算,经常检不出多音错误,因为合成把音读错了,识别仍可能写对字。
近期有用大音频语言模型做平均意见分、音质和情感韵律多维评价的工作,论文把这一思路延伸到多音字发音准确率。
前端注音模块 × 大模型语音合成: 前端注音模块指传统合成中把字转成音素的显式步骤,分工是可直接检查注音对错;大模型语音合成指直接输入原始文本、由大模型隐式完成消歧再生成语音,分工是省去显式音素但无法直接评估;二者搭配的理由是要把传统可直接评分的任务搬到新范式下,组合意义是必须先合成语音再对实际发音做标注才能评分。
需要澄清的误解是注音模块分数可以直接等同于大模型语音合成分数。论文明确说明两者流程不同,传统系统有显式注音输出可直接比对,大模型系统把消歧包在模型内部,必须先生成语音再听实际发音,因此比较时要考虑自动标注误差,只有差距足够大时结论才稳固。
为什么字写对了,音还可能是错的
问题可以沿一个样本走完。输入文本是他那个倔脾气一上来,谁也劝不动,目标是倔字在此处应取与脾气搭配的读音。表示层面,文本字符是倔,正确拼音是词典中对应脾气直、态度生硬这一义项的注音。组件层面,传统系统先由注音模块输出拼音再送声学模型,错了可以直接定位;大模型系统直接读原始文本,消歧发生在语言模型内部,没有中间拼音可查。
输出层面,系统生成一段语音,人耳听到的是实际声母韵母声调。评估层面,用语音识别把语音转写成文字,可能转写出倔字,从而字形判对,但实际声调或声韵母已错。论文用两个指标把这件事分开。字形准确率只看目标字是否被识别出来,拼音准确率要求声母、韵母、声调全对,后者是主指标。同一系统内两者常差 10 到 20 个百分点,系统之间字形分只差 4 个百分点以内而拼音分差 15 个百分点,这组对照直接支持字形分不够用的判断。
字形识别 × 拼音准确率: 字形识别指转写结果中目标汉字本身是否出现,分工是衡量可懂度和鲁棒性;拼音准确率指声母、韵母、声调三者是否与参考完全一致,分工是衡量多音字消歧是否真正做对;二者搭配的理由是语音识别可能把读错音的字仍然听写成对,组合意义是必须同时看两项才能发现高字形分、低拼音分的隐性错误。
另一个关键是类别。论文按词典标记把每条分为常用、姓氏、方言、口语、书面 5 类。常用是没有特殊标记的日常用法,姓氏是标记为姓,方言是标记为方,口语是标记为口,书面是标记为书。分类的目的是暴露数据不均,而不是给模型贴标签。
PolyBench 的全景:从词典到分数要走哪几步
全景分上下两层,上层做数据集,下层做评测。上层起点是第七版现代汉语词典,先抽取落在 3500 个 1 级字范围内的高频多音字和多音词,再做规则过滤,再用大模型按词典条目造句并带拼音和类别,最后经母语者人工校验得到主数据集。另有两套补充集分别考常见复词和一句话多音。下层是让每个待测系统把 3 套测试集全部合成语音,约每个系统 6 小时音频,再用自动标注器听出目标字的实际拼音,与参考拼音比对得到字错率、字形准确率和拼音准确率。
论文说明全部测试集和造句提示词已在项目仓库公开。下面的导读帮助按图走一遍,下图是官方原图,重点看左右箭头和中间示例表的对应关系。
看图路径: 1. 先沿上半部分从红色词典经规则过滤到数据集生成的箭头走一遍主路径;2. 再看下半部分从数据集经语音生成到模型裁判再到指标的评估链条;3. 对照中间表格示例看字、拼音、释义、短语、句子和类别六列如何对应;4. 注意人工校验回指主数据集的箭头表示生成后必须经过母语者修改
论文图 1。原论文 Figure 1:“Overview of PolyBench dataset construction and evaluation pipeline.”。
上图上半部分展示了数据集构造。下半部分展示了评估流水线。从左到右依次是数据集、语音生成、发音裁判和指标。数据集框中列出主集的 5 类和另两个补充集。语音生成框列出待测的大模型语音合成系统。
发音裁判框把传统识别模型和语音大模型并列对比,并注明要与人工裁判比较。指标框列出字错率、字形准确率和拼音准确率。中间示例表以倔和冯为例,说明每个条目包含字词、发音、释义、短语、句子和类别。人工校验箭头指回主数据集,表示生成内容必须经过检查修改才能入库。这张图的作用是把后文三节的细节串起来,读懂它就知道数据从哪里来、分数怎么来。
词典条目如何变成可测试的句子
组件的第一步是抽取与过滤。抽取范围限定在通用规范汉字表 3500 个 1 级字内的高频多音字词,初选后按 3 条规则过滤。第一条去掉啊哦等 7 个感叹词,因为其读音随情感、语速和变调变化,不适合稳定评测。第二条按含义过滤,去掉标为同某字的异体、非规范形式和不属于现代标准汉语的古义,还去掉同一字不同读音但含义相同造成评测目标含混的情况,论文以盖字作姓氏时两种注音都可作姓为例说明含混来源。第 3 条删掉过滤后只剩一种有效读音的 56 个字。
最终保留 494 个多音字和 88 个多音词,保留率为 90.2%。第二步是造句。论文用 DeepSeek-V3.1 扮演汉语语言学专家,按每条的释义和示例短语造句。有示例短语的扩写成完整句,只有释义的按语境新写,要求输出字词、发音、释义、短语、带拼音标注的句子和类别。类别按词典标记直接映射,不另行推断。
第三步是人工校验。母语者逐条检查上下文是否能唯一确定读音、语句是否自然合语法、拼音是否与词典一致、类别是否与标记一致,最终主集为 6016 句。补充集做法不同。DictWords 从词典中抽取含这 494 字中目标字的复词,先去掉在所抽复词中只有一种常见读音的 111 个字对应的词,因为人和模型几乎不会读错,再按北京语言大学语料库词频为每个字音对选前 5 个高频词,并去掉已在主集出现过的词,得到 2137 词覆盖 375 字,考词汇搭配。
ALLinONE 对 494 字中每字用 DeepSeek-R1 造一个包含该字全部读音的有意义句子,经人工检查逻辑和自然度,得到 494 句共 1138 个多音实例,考同句多点消歧和长距离建模。
本研究训练了什么,没有训练什么
本研究没有训练任何新的语音合成模型,也没有训练新的标注模型,这是必须先说清的。论文的计算过程是构造、调用、标注和比对。构造指用词典抽取、规则过滤和大模型造句加人工校验得到测试集。调用指把 3 套测试集的文本送给现成的 3 个注音模型和 17 个开源大模型语音合成系统生成语音。标注指用现成的 Kaldi 普通话声学模型、MMSpeech、Baichuan-Audio、StepAudio-R1.1、MiMo-Audio 和 Qwen3-Omni-Instruct 对合成语音做发音标注,其中对大音频语言模型的用法是提示其按实际听到的发音把整句转写为拼音,再抽取目标字的拼音。
比对指把标注拼音与参考拼音按声母韵母声调全对为正确来计分,并计算字错率和字形准确率。论文未报告任何梯度路径、参数冻结或优化器设置,因此不能从模型名字推定其内部实现,也不能把未训练等同于输出确定。生成式人工智能使用声明中说明 DeepSeek 用于主集和 ALLinONE 的数据生成以及早期草稿的语法和可读性修改,但生成内容严格遵循词典条目并经人工审核,未用于生成论文主体文字。
测什么,和谁比,在什么条件下比
评测要回答 3 个问题。第一是自动标注器是否可信。做法是先选一个代表性待测系统在 ALLinONE 上生成语音,对其中 1138 个实例做人工标注作为参考标准,再看各自动方法的标注与人工的一致程度,以及用它们算出的系统发音准确率与人工算出的 67.75% 有多接近。第二是主集上谁的消歧更好。待测包括 F5-TTS 中的注音模块、G2PM、G2PW 共 3 个注音模型,以及 CosyVoice2、CosyVoice3、VoxCPM1.5、Spark-TTS、Index-TTS2、OuteTTS、Qwen3-TTS、Chatterbox、Orpheus-TTS、VibeVoice、Step-Audio TTS、LLaSA、GLM-TTS、FireRedTTS-2、HiggsAudio-v2、Qwen2.5-Omni 和 Qwen3-Omni-Instruct 共 17 个大模型语音合成系统。
指标有 3 个。字错率是用 Qwen3-Omni-Instruct 转写合成语音再与参考文本比对,越低越好,反映整体可懂度和鲁棒性。字形准确率是目标字被正确识别的比例,越高越好。拼音准确率是声母韵母声调全对的比例,越高越好,是主指标。注音模型只报拼音准确率。
第三是补充集上是否一致。DictWords 和 ALLinONE 同样用拼音准确率,ALLinONE 还报 494 字中有多少字做到整句全部读音全对。公平性方面,所有语音合成系统都合成 3 套测试集的全部条目,标注器统一为选出的 Qwen3-Omni-Instruct。统计显著性用 McNemar 检验,对每列最佳系统与其他系统做配对比较,表中星号表示与该列最佳无显著差异,完整两两比较放在仓库。
自动语音识别 × 大音频语言模型: 自动语音识别指用 Kaldi 和 MMSpeech 这类工具输出音素或文本,分工是提供传统基线标注;大音频语言模型指能听音频并按实际发音转写为拼音的模型,分工是提供更贴近人耳的裁判;二者搭配的理由是要在约 6 小时每系统的合成量下找到可替代人工的标注器,组合意义是通过与人工标注对比标注一致性和发音准确率来选出最可靠的裁判。
需要保留的细节是字错率的计算依赖转写模型自身能力,插入和删除错误会推高字错率,因此字错率与字形分不一致时不能直接得出消歧结论,要以拼音准确率为准。
主集和补充集上谁更好,差距在哪里
先看自动标注的可信度,再看主结果。自动标注比较中,Kaldi 和 Qwen3-Omni-Instruct 算出的发音准确率最接近人工的 67.75%,但 Qwen3-Omni-Instruct 的标注一致性明显更高,论文报告其标注准确率为 93.06%,对应发音准确率为 66.34%。误差类型分析显示它比 Kaldi 产生更少的拼音错和声调错,声调错指声韵母对而声调错。基于一致性更高且发音准确率接近人工,论文选它做大规模评测的自动标注器。下图是官方原图,展示 6 种自动标注方法的 3 类错误堆叠,纵轴是错误个数,横轴是方法名。
看图路径: 1. 先按图例确认深蓝为声调错、中蓝为拼音错、灰色为漏字三段堆叠;2. 再从左到右比较六个标注模型的总高度判断总错误量排序;3. 重点看最右侧 Qwen3-Omni-Instruct 的灰段是否几乎消失且总高最低
论文图 2。原论文 Figure 2:“Error type distributions across automatic labeling models.”。
从左到右可以看到 Baichuan-Audio 总错误最高且灰色漏字段最大,MMSpeech 和 StepAudio-R1.1 次之,Kaldi 和 MiMo-Audio 居中,最右侧 Qwen3-Omni-Instruct 总高度最低,灰色几乎不可见,深蓝声调错占主体。这支持论文的判断,即它的漏标最少且整体最接近人工,但剩余误差以声调为主,后续若要降误差应先盯声调。主集上按拼音准确率排序,最好的 FireRedTTS-2 为 82.02%,常用类为 86.01%,姓氏 65.44%,方言 42.17%,口语 50.85%,书面 59.64%。显著性检验显示其字形分与 Qwen3-TTS 和 Index-TTS2 无显著差异,但拼音分在全部句子和常用类上显著好于其他所有系统。即便如此仍有约 18% 读错,说明数据集有难度且改进空间大。
类别规律是常用最高,方言最低,所有系统在方言和口语上都差。论文把口语差的一部分原因归于实际口语发音与词典注音存在偏离,这属于有限解释。与注音模型比,最好的大模型系统在拼音准确率上超过注音模型,尤其常用类,论文将其理解为大模型架构和数据规模的优势,这属于支持性解释而非因果证明;但在姓氏和文学类,G2PW 仍强于除 Index-TTS2 外的全部语音系统,论文推测与语音系统缺特定领域训练数据有关,同样是待验证的解释。
常用类 × 方言类: 常用类指词典无特殊标记的日常用法,分工是反映模型在高频语境下的基本功;方言类指词典标记为方言的读音和用法,分工是反映模型对低频地域知识的覆盖;二者搭配的理由是同一模型在两类上差距极大,组合意义是揭示训练数据分布不均,常用好不代表方言好。
补充集上 FireRedTTS-2 仍领先,除 ALLinONE 上与 Index-TTS2 无显著差异外,其余均显著最好。DictWords 上多数系统分数高于另两套,说明常见复词语境相对好处理,但最好与最差之间差 23.3 个百分点,鲁棒性差异大。ALLinONE 上最好系统也只有 202 个字做到整句全对,说明同句多音仍是硬骨头。下表把规模和上限放在一起,帮助 1 次核对数据集量级和主结论数字,表前已说明比较问题是规模是否足够大且上限是否足够低,表后会解释代价。
换一种考法,结论还成立吗
把主集、DictWords 和 ALLinONE 看作 3 种压力测试,可以做对照。主集考单句单点消歧,DictWords 考词记忆,ALLinONE 考同句多点。报告显示 DictWords 分数普遍高于另两套,ALLinONE 全对字数极低,说明记忆好不等于推理好。未胜出项也要看。Chatterbox 在主集和补充集上都偏弱,OuteTTS 在主集常用类尚可但方言和口语低,Orpheus-TTS 和 VibeVoice 在 DictWords 上分化明显,说明不同系统对词搭配的利用能力不同。
注音模型中 G2PW 在主集全部句子上为 79.10%,常用 82.18%,姓氏 72.69%,方言 37.10%,口语 49.09%,书面 67.91%,在姓氏和书面两类上超过多数语音系统,这是语音系统未胜出的直接反例,不能因为语音系统整体更强就忽略。另一个反例是字错率最低的系统不一定是拼音分最高的系统,因为字错率受插入删除等鲁棒性问题影响。
词汇语境 × 一句话多音: 词汇语境指 DictWords 中考查常见复词中多音字的读法,分工是测试词层面搭配记忆;一句话多音指 ALLinONE 中一句话包含同一字全部读音,分工是测试长距离上下文和同句多点消歧;二者搭配的理由是分别压测记忆和推理,组合意义是共同说明常见词容易、密集多音难。
本节没有做去掉某模块的消融,因为待测系统都是现成开源系统,论文未做受控的去掉对照。缺失对照不是技术错误,只是意味着类别差距只能归因到数据分布的推测,不能说成因果。若要进一步验证,需要补按领域均衡训练数据的受控实验。
哪些结论要打折,哪些边界没有测
第一,自动标注有误差。论文明确说明大模型系统的报告分数受标注错误影响,实际可能偏高或偏低,但因所选标注器与人工接近且差距大时比较仍有意义,所以只有差距足够大且经显著性检验的排序才稳固,接近的分数不应过度解读。第二,指标口径不同不能混算。字形分、拼音分和字错率的聚合对象和方向不同,百分点差和相对百分比不同,不同指标的差值不能放到模型列下比较,也不能把自动指标当人评。第三,未测量的量不能承诺。
论文未测量误判率之外的延迟、成本和输出帧率,因此不能说该基准改善了这些量,训练资源、推理开销和实际延迟要分开讨论。第四,覆盖边界。当前限定在 3500 个 1 级字内的高频字,论文在未来工作中计划扩展到更广的多音字,并探索更准的拼音标注以减少声调错。第五,口语和方言的参考本身可能与实际口语有偏离,低分部分来自参考口径,部分来自模型能力,两者未分离。
原文表头、图注与正文若有冲突应以冲突标注处理,本文未发现需要编造口径来圆的冲突,如有应明确标注。
要复现这套基准,先做什么
复现先做三件事。第一是拿数据和提示词。按仓库中公开的测试集和造句提示词恢复主集 6016 句、DictWords2137 词和 ALLinONE494 句的划分,不自行重造句或改类别映射。第二是统一合成条件。让每个待测系统合成 3 套测试集的全部条目,记录采样、文本归一化和说话人设置,保持跨系统一致,论文未给出超参数细节时按各系统默认可运行配置并如实记录。
第三是统一裁判。用 Qwen3-Omni-Instruct 按实际发音转写为拼音再抽取目标字拼音,拼音全对才算对,同时用同一转写算字错率和字形分。统计时对每列最佳做 McNemar 检验,显著性阈值为 0.05。需要补的验证是人工抽检,特别是声调错,因为误差分析显示剩余误差以声调为主。区分代码开源、权重下载和系统可运行,论文提供的是基准数据和提示词,被测的 17 个系统需各自按其仓库获取权重并确认可运行,不能把能下载当成能复现分数。
何时值得尝试是当研究目标是中文多音字在语音中的实际读音,而不是文本注音或识别字形时,这套基准比通用字错率更直接。
一句话收束:上限、短板和下一步
收束回到可核对的事实。基准规模是 494 字、88 词,主集 6016 句,DictWords2137 词覆盖 375 字,ALLinONE494 句共 1138 实例。裁判选择是 Qwen3-Omni-Instruct,标注一致性高且发音准确率接近人工 67.75%。上限是 FireRedTTS-2 主集 82.02%,补充集仍领先但 ALLinONE 仅 202 字整句全对。短板是方言和口语全线低,姓氏和书面类注音模型仍有竞争力。
下一步按论文是扩覆盖和降声调错,按复现视角是先统一合成与裁判条件,再补人工抽检和领域均衡的受控对照。下面两张表分别固定规模事实和上限事实,便于复述时逐项核对。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

