英文题目:WenetSpeech-Yue: A Large-Scale Cantonese Speech Corpus with Multi-dimensional Annotation
会议身份:
conference:aaai:2026:conference-paper-id:40429
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准测试 #数据集 #数据集构建 #语音识别 #文本到语音
评分:7.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Longhao Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zhao Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Hongjie Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhang Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Ziyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Hongfei Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Tianlun Zuo:机构信息未能从会议 PDF 纯文本可靠映射
- Chengyou Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Shuiyuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Bu:机构信息未能从会议 PDF 纯文本可靠映射
- Jie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Jian Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Binbin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Ruibin Yuan:机构信息未能从会议 PDF 纯文本可靠映射
- Ziya Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Xie:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
粤语自动语音识别(Automatic Speech Recognition,ASR)与文本到语音(Text to Speech,TTS)的输入是带九声六调、文白异读及中英混读的连续语音或文本,输出为准确转写或自然语音,难点在于标注稀缺、口语变体多与评测覆盖窄。本文构建可扩展流水线 WenetSpeech-Pipe,先采集多领域长音频并经语音活动检测(Voice Activity Detection,VAD)切分为短句,再并行完成说话人分离标注与属性估计及信噪比与平均意见分预测等多维标注,随后用三路识别器生成平行转写并经文本规范化消除繁简与格式差异,最后经识别器输出投票错误削减(Recognizer Output Voting Error Reduction,ROVER)融合与大语言模型(Large Language Model,LLM)轻量修正生成带置信度与字级时间戳的终版标注。与已有粤语库仅提供单一文本对齐不同,该机制以多系统互补误差融合加可分层置信度实现质量可控与多任务复用。在包含对话、朗读、Common Voice 与自建长短句的评测中,混合编码器加 LLM 模型 U2pp-Conformer-LLM-Yue 在自建短句集上混合错误率(Mixed Error Rate,MER)达到 4.73%,显著优于同类基线。该结论限于粤语朗读与网络多领域语音,情感与年龄等伪标签维度尚未经严格验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/ASLP-lab/WenetSpeech-Yue — 链接可访问(HTTP 200)
- 数据相关资源:https://github.com/ASLP-lab/WenetSpeech-Yue — 链接可访问(HTTP 200)
- 第三方资源:https://huggingface.co/datasets/CanCLID/zoengjyutgaai — 暂时无法访问
- 第三方资源:https://github.com/HLTCHKUST/cantonese-asr — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决什么障碍?
本文的输入是野外采集的粤语长音频,目标是同时支撑语音理解与语音生成两类任务,重点是自动语音识别与文本转语音。作者报告粤语有约 8490 万母语者,声调系统复杂,存在文白异读与频繁的中英码切换,现有公开粤语语料多为小规模朗读,缺少说话人属性与声学质量元数据,评测也多为短句。输出是三件套:可复用的数据构建流水线、大规模多维标注语料,以及覆盖识别与合成的评测基准。
学习时要先建立一个判断:数据规模与标注维度是本文所有模型结论的前提,脱离置信度划分与音质筛选去谈模型好坏会误读结果。项目代码与数据集链接在原文中给出,资源状态显示代码与数据集当前可用,第三方讲故事语料本次未能确认可达,另一个粤语识别仓库链接当前可用,复现时应以本次可达状态为准。
同输入同目标的已有路线走到哪里,缺口在哪里?
在大规模语音语料路线上,原文回顾了多语与中文普通话的自动爬取转写与对齐做法,包括迭代精标、自监督预训练与面向合成的时长与音质过滤思路。这些路线与本文同输入,都是长音频到短句加文本,但目标语言与标注维度不同。粤语已有资源方面,原文点名了众包朗读、香港有声书与单说话人讲故事数据,规模从几十小时到 300 小时量级,领域窄且多只有语音文本对齐。
模型方面,识别路线有训练含数千小时粤语的多语模型、通用大模型直接跨语言泛化,以及面向多方言的预训练加微调;合成路线有支持粤语的零样本克隆与轻量可控生成模型。本文的对照口径是同为粤语识别或合成,但在训练数据、领域与评测条件上并不一致,因此不能把类别差异直接读成同条件胜负。缺口被定位为缺少大规模、多领域、多标签且同时服务识别与合成的粤语语料与评测。
粤语建模难在哪里,数据流水线要满足什么条件?
难点来自 3 个互相牵制的方面。第一是语言现象,九声六调、多音字、轻声变调类现象、专有名词、数字日期与中英混排同时出现,同一发音可能对应不同字,文本归一化稍有不慎就会破坏投票对齐。第二是声学条件,野外数据有噪声、混响、带宽与采样率差异,直接拿来训练合成会损害自然度,必须有可筛选的质量分数。第三是说话人维度,多说话人建模与风格可控合成需要身份、年龄、性别等标签,否则只能做单说话人或无风格模型。
流水线因此要同时满足可扩展的长音频切分、 utterance 级多维标注、可度量的转写置信度,以及面向识别与合成的不同筛选策略。举例来说,一个 50 分钟的访谈节目是一个样本,流水线要先把它变成一批 10 秒左右的短句,再为每句补上谁在说、好不好听、写得对不对 3 类信息,后续才能按任务取子集。
流水线全景:一个样本如何走完六个模块?
流水线名为 WenetSpeech-Pipe,共 6 个模块。先沿一个长录音走一遍:音频采集用语音活动检测把长录音切成短句池;说话人属性标注给出局部说话人编号、年龄与性别;语音质量标注给出信噪比、平均意见分与带宽采样率信息;自动语音识别用 3 个系统各自转写。
文本后处理统一繁简、标点、数字与中英空格;投票模块对齐过滤投票,再用大语言模型做最小修正并做字级强制对齐得到时间戳。这一遍的输出是一条带音频路径、时长、文本置信度、说话人身份、信噪比、平均意见分、年龄性别与字级时间戳的记录。下面的导读先帮你定位图中左右与上下关系,再看图确认分支汇合点。
看图路径: 1. 先从左侧音频采集与语音活动检测看短句池如何产生;2. 再看上方说话人分支与语音质量分支各自输出哪些标注;3. 接着看下方三路识别转写如何进入对齐过滤投票;4. 最后确认大语言模型修正与强制对齐在投票后才发生
论文图 1。原论文 Figure 1:“An overview of the WenetSpeech-Pipe processing pipeline.”。
图 1 展示了六模块的布局与箭头走向。左侧黄色块是切分入口,图标为剪刀加波形,输出短句。右上粉色块是说话人分支,包含日志、年龄、性别 3 个子图标,箭头向下进入中部紫色语音质量块,质量块内有频谱、信噪比、平均意见分 3 个子图标。左下蓝色块是 3 路识别假设,中间蓝色块是归一化后的 3 路假设,最右绿色块是投票主干,依次为对齐、候选过滤、候选投票、大语言模型修正。看图时要注意 3 路假设在归一化之后才进入对齐,质量与说话人分支不直接改变文本,只提供筛选与建模用的并行标注。
切分、说话人与质量标注各自算什么,输出什么?
音频采集的计算是语音活动检测切分。白话说就是判断哪段有人声、哪段是静音或音乐,把几十分钟的长音频变成适合转写与评质的短片段。输出是领域多样的短句池,领域覆盖讲故事、娱乐、戏剧、文化、播客、新闻、教育、评论、生活记录等 10 类。说话人分支先用现成日志工具在同一录音内区分说话人甲乙丙,再用语音画像模型估计每句的年龄与性别。这里的说话人编号是录音内局部编号,不是跨全库的全局同一人追踪,复述时不能说成全局身份聚类。
质量分支做三件事:用噪声估计模型给出信噪比,用非侵入式感知模型预测平均意见分反映听感,用带宽检测估计有效高频与频谱覆盖以补充标称采样率。输出是每句的信噪比数值、平均意见分数值与采样率参考,供合成筛选。
说话人日志 × 说话人属性标注: 说话人日志负责把同一长录音切出的短句按声音区分成局部分离的说话人身份,说话人属性标注负责为每句估计年龄与性别;两者搭配是因为仅有身份编号不足以做多说话人建模与风格可控合成,组合后每条语音同时带有身份、年龄、性别,形成可用于监督与风格控制的多维元数据。
信噪比 × 平均意见分: 信噪比负责刻画噪声相对语音的能量水平,平均意见分负责预测人耳感知的清晰自然程度;两者搭配是因为能量指标高不等于听感好,组合后同时给出定量分数与感知分数,为合成任务筛选高保真子集提供互补依据。
三者分工不同:切分决定训练单元,身份与属性决定能否做多说话人与风格建模,质量决定能否做高保真生成。教学例子是同一条戏剧对白,日志告诉你前后两句不是同一人,质量告诉你前句干净适合合成、后句噪声大只适合识别鲁棒训练,文本分支才告诉你每句写的是什么。
三路转写、归一化与投票修正如何得到可信文本?
自动识别模块对每条短句并行调用 3 个粤语能力较强的系统:开源的 SenseVoice 与 Whisper,以及商用 TeleASR。白话说就是让 3 个口音与训练偏好不同的听写员各写一遍,利用互补错误得到多样假设。文本后处理把三份假设拉到同一书写规范:繁体转简体、去掉标点与特殊符号、规则改写数字日期、在粤英之间加空格。投票模块先做动态规划对齐,再算每路输出与其他两路均值的编辑距离,超过阈值的离群假设被过滤。
剩余假设按对齐位置多数表决,整句投票频率均值记为文本置信度,并并行做粤语拼音层面的发音一致性投票。最后用 Qwen3-4B 只做最小的上下文修正,参考 3 路原始假设改语法、用词或实体,不重写口语内容,再用预训练声学模型做字级强制对齐得到每个字的时间戳。
多系统集成 × 投票融合: 多系统集成负责用 3 个架构与训练数据不同的粤语识别系统各自产生转写假设,投票融合负责对齐假设并按位置多数表决;搭配理由是单系统有系统性偏置与领域失配,组合后用互补错误分布得到更稳的共识文本与逐句文本置信度。
这一设计的安排理由在原文中明确写出:单系统有架构约束、训练数据局限与领域失配带来的系统偏置,多系统可缓解。未报告的是过滤阈值具体数值、拼音投票权重与大模型修正的提示模板,复述时应指出这些缺项,不从模型名推定实现。
语料如何划分,模型训练与合成适配如何调度数据?
语料构造没有神经网络梯度训练,它是用规则与已有模型推理完成标注与筛选的计算过程。总量 21800 小时,平均每句 11.40 秒。只保留文本置信度大于 0.6 的标签,并按置信度切成强、中、弱三档,高置信用于精调,中低置信用于首阶段收敛或半监督与域自适应。面向合成的筛选是保留平均意见分大于 2.5 且信噪比高于 25 分贝的样本,得到约 12000 小时高质量子集,该策略还可迁移到声码器、编解码与声音转换。识别模型训练采用 2 阶段策略:先用中高置信混合标签快速收敛,再用高置信标签精调以提高转写精度。合成采用迁移学习,在已预训练的 Llasa-1B 与 CosyVoice2 上用合成子集微调以适应粤语语言与声学特性。
文本置信度 × 2 阶段训练: 文本置信度负责记录投票频率均值所代表的标签可靠程度,2 阶段训练负责先用中高置信混合数据快速收敛再用高置信数据精调;搭配是因为全部数据混训会引入噪声而只用高置信会损失量,组合后让置信度直接决定训练数据的调度顺序。
下表把划分与筛选条件放在一起,便于按任务取数时核对口径,表中小时数与阈值均来自原文连续句子,采样率范围与质量分布见后文统计图。
| 子集 | 置信度或质量条件 | 小时数 | 原文用途 | 适用任务 |
|---|---|---|---|---|
| 强标签 | 置信度大于 0.9 | 6771.43 小时 | 精调主力 | 识别精调 |
| 中标签 | 置信度大于 0.8 且不超过 0.9 | 10615.02 小时 | 首阶段混合训练 | 识别收敛 |
| 弱标签 | 置信度大于 0.6 且不超过 0.8 | 4488.13 小时 | 鲁棒与自适应候选 | 半监督备选 |
表中比较问题是不同置信度与质量阈值是否对应不同训练阶段,公平条件是同一流水线同一置信度定义,指标方向是小时数越大覆盖越广但噪声风险越高。
表后解释是强标签总量最小但驱动精调增益,中标签量最大支撑首阶段收敛,弱标签保留但不直接用于主结果,合成子集用双阈值换自然度而牺牲领域广度。未胜出项是弱标签在主识别结果中没有单独带来最优,边界是低于 0.6 的样本已被丢弃,未评测其利用价值。
评测测什么,与谁比,指标方向如何定?
评测分识别与合成两套。识别评测 WSYue-ASR-eval 经多轮人工标注,带文本、情感、年龄、性别标签,按时长分为短句 0 到 10 秒与长句 10 到 30 秒,并覆盖中英码切换与多领域。对比集合分 3 组:自有对话与朗读、开源的 Common Voice 粤语与港式中文、多领域 MDCC、日用对话与车载指令,以及新基准的长短子集。指标用混合错误率,中文按字、英文按词算错,越低越好。合成评测 WSYue-TTS-eval 分 Base 与 Coverage,Base 是从 Common Voice 采的 1000 条提示文本对,测真实分布。
Coverage 是人工加模型生成的覆盖多领域与多音字、变调、码切换、专有名词、数字等难点的文本,测泛化。客观指标有可懂度混合错误率、说话人相似度与 UTMOSv2 自然度,混合错误率越低越好,相似度与自然度越高越好,主观指标有可懂度、相似度与口音地道度三项平均意见分,5 分制越高越好。合成的可懂度转写用自训的识别模型计算,相似度用说话人嵌入工具计算。
混合错误率 × 说话人相似度: 混合错误率负责按中文按字、英文按词计算识别或合成可懂度错误,说话人相似度负责计算合成与参考音频说话人嵌入的余弦式接近程度;两者搭配是因为可懂不等于像原说话人,组合后在合成评测中同时约束内容正确与音色一致。
下表归纳评测协议,便于核对采样与被试条件,数字来自原文连续句子而非猜测。
| 评测分支 | 子集与采样 | 时长或条数条件 | 标注或被试 | 覆盖重点 |
|---|---|---|---|---|
| 识别评测 | 短句与长句子集 | 0 到 10 秒与 10 到 30 秒 | 人工多轮标注 | 长短与码切换 |
| 合成 Base | CommonVoice 采样提示文本对 | 1000 条 | 真实分布 | 日常对话 |
| 合成 Coverage | 人工加模型生成难例 | 多领域多语言现象 | 难点全覆盖 | 多音字与数字 |
| 合成主观 | Base 抽 30 条 Coverage 抽 20 条 | 共 50 条 | 10 名粤语母语者 | 三项平均意见分 |
| 合成客观 | 生成音频再识别与嵌入比对 | 全量生成 | 工具自动打分 | 可懂与相似 |
表前问题是两类评测是否测同一能力,公平条件是同一文本与同一参考音频,指标方向已按越低或越高标明。
表后解释是 Base 反映日常分布,Coverage 暴露泛化短板,主观 50 条加 10 名被试只能支撑趋势判断而非细粒度显著性,未评测边界包括长篇章合成与多轮对话合成。
识别结果:谁在什么集上赢,代价是什么?
原文报告在小、中、大与带大语言模型四档中,自训模型在多数集上最好;小模型中微调版在低容量下仍具竞争力;不带大语言模型的中型微调版超过部分大参数基线;带大语言模型的混合结构取得最优。2 阶段增益被单独报告:首阶段已具竞争力,第二阶段在新基准长短子集上进一步下降。
领域分布显示讲故事占比最高,娱乐与戏剧次之,其余领域占比较小,这意味着识别增益可能更多来自故事与娱乐口语,而新闻与播客等低占比领域的结论外推要谨慎。下面的导读帮你先看领域不均衡,再看质量与置信度分布,避免把平均增益当成每个领域都成立。
看图路径: 1. 先确认横轴是百分比纵轴是十个领域名称;2. 比较讲故事条形与其他九个领域条形的长度差异;3. 记录娱乐与戏剧之后各领域占比的下降顺序
论文图 2。原论文 Figure 2:“Domain distribution of WenetSpeech-Yue.”。
图 2 是横轴百分比、纵轴 10 个领域的条形图。可见讲故事条形最长,原文给出约 45.7%,娱乐约 13.8%,戏剧约 13.0%,文化约 7.1%,生活记录约 5.3%,评论与教育各约 4.0%,播客约 3.6%,新闻约 2.4%,其他约 1.1%。像素上娱乐与戏剧长度接近,之后明显缩短,新闻与其他最短。教学含义是训练量高度倾斜,模型在故事化表达上见得多,在新闻播报等正式文体上见得少,复现时若只测平均混合错误率会掩盖领域短板。
看图路径: 1. 先看标签置信度子图横轴 0.60 到 1.00 的小时分布峰位;2. 再看信噪比子图在 0 附近与 40 到 50 附近的两个堆积;3. 对照平均意见分子图与采样率子图的集中区间
论文图 3。原论文 Figure 3:“Visualization of statistical analysis for the WenetSpeech-Yue corpus.”。
图 3 是六宫格统计,含时长、标签置信度、年龄性别、平均意见分、信噪比与采样率。标签置信度子图横轴 0.60 到 1.00,小时数在 0.85 到 0.90 附近最高,两端较低,与强中弱划分一致。信噪子图横轴分贝,低端 0 附近与中段 40 到 50 附近各有一个堆积,说明野外噪声与干净录音并存。平均意见分子图集中在 2.9 到 4.1 之间,采样率子图集中在 8000 与 12000 以上两档。看图时不要把信噪高端堆积直接读成全库干净,也不要把单峰推广到全部年龄性别,原文报告男性中年占比高达 50.6%,女性各年龄段偏少,存在说话人偏差。
合成结果:微调带来多大可懂度与听感变化?
合成比较问题是微调前后与商用单说话人系统相比,可懂度、相似度与听感如何变化,公平条件是同一 Base 与 Coverage 文本,指标方向是混合错误率越低越好、相似度与平均意见分越高越好。下表只收录原文连续句子中明确给出的数字,缺失项用文字说明而不编造,基线用未微调与商用系统作参照,可运行策略是两个微调后的零样本合成模型。
| 系统 | Base 混合错误率 | Coverage 混合错误率 | 说话人相似度 | 主观关键项 |
|---|---|---|---|---|
| CosyVoice2-Yue | 10.33% | 9.49% | 0.821 and 0.834 | 4.45 ± 0.16 可懂度最高 |
| Llasa-1B-Yue | 10.89% | 12.78% | 原文仅定性报告有竞争力 | 4.11 ± 0.37 相似度与 4.34 ± 0.34 地道度最优 |
| 未微调与商用参照 | 原文报告微调前更高商用机械感强 | 未给出可引用数字 | 单固定说话人不计相似度 | 商用可懂度数字低但听感更机械 |
表后解释是两个微调模型相对各自预训练明显降低混合错误率并提高自然度,CosyVoice2-Yue 在客观可懂度与相似度上占优,Llasa-1B-Yue 在主观相似度与口音地道度上占优。
代价与反例是客观相似度高不等于主观相似度高,原文把差异归因于上下文学习带来的韵律风格更自然;商用系统虽混合错误率数字更低,但主观可懂度反而低于微调模型,可能因机械感强。未胜出项是零样本基线在码切换与多音字等 Coverage 难例上落后,边界是主观仅 50 条与 10 名被试,不宜做细粒度显著性断言。
置信度与质量阈值拿掉或放宽会发生什么?
原文的反证集中在 2 阶段训练。首阶段用混合置信已具竞争力,第二阶段只用高置信精调在新基准长短句上进一步提升,支持高置信是主要驱动力的判断。但这只是有限解释,不是因果证明,因为 2 阶段还伴随学习率与训练步数变化,原文未做只换数据不换优化的完全对照。
质量阈值的反证是间接的:合成子集用平均意见分与信噪比双阈值筛选,若放宽阈值会纳入更多噪声与低带宽样本,原文未报告放宽后的合成劣化曲线,因此不能承诺阈值外的数据必然变差。文本后处理与离群过滤的作用是保证对齐,若拿掉繁简统一或离群过滤,对齐错误会上升,但原文没有给出拿掉后的定量掉点,只能说这是设计动机而非已验证的消融量。
复述时要用报告显示 2 阶段增益,用支持表达阈值选择的合理性,用可能待验证表达放宽阈值的后果。
哪些结论不能推广,缺了哪些验证?
第一是分布偏差。领域向讲故事倾斜,性别年龄向中年男性倾斜,低占比领域与女性、儿童、青少年的结论外推受限。第二是标注噪声。文本置信度来自投票频率均值,不是人工逐字校验,拼音投票与大模型最小修正的具体阈值与模板未公开,错误会残留。第三是评测边界。
识别用混合错误率统一中英,但不同测试集的文本风格与音频条件不同,数值相同不代表同一难度;合成用自训识别模型算可懂度,存在自评偏向,不同指标差值不能混放一列比较。第四是成本缺项。原文未报告爬取、转写、投票与微调的硬件预算、推理延迟与输出帧率,不能承诺延迟或成本改善。相关性不等于因果,总体趋势不等于每组每步都成立,长句与码切换子集需单独看数。
要复现应先做什么,需要什么信息条件?
先按任务取数。做识别先用中高置信混合数据跑通,再用强标签精调;做合成先取平均意见分大于 2.5 且信噪比高于 25 分贝的 12000 小时子集,注意该子集领域与说话人分布已不同于全库。关键超参数与信息条件要保留:置信度三档阈值 0.6、0.8、0.9,合成双阈值 2.5 与 25 分贝,平均句长 11.40 秒,总量 21800 小时,识别分长短 0 到 10 秒与 10 到 30 秒,合成 Base1000 条与主观 50 条 10 名被试。代码与数据集当前可用,可从官方仓库获取。
第三方讲故事数据本次未能确认可达,不要默认可下载;另一个粤语识别仓库当前可用,可作领域对照。缺失的复现信息是离群过滤阈值、拼音投票权重、大模型修正提示与强制对齐声学模型版本,需补做记录才能完全重放。若做对比,应保留原文实际可运行的微调策略作基准,搜索最优或事后最优值另行标注,不能代替可部署收益。
何时值得尝试这套方法,下一步还需验证什么?
当你的粤语任务同时缺量、缺领域与缺标签,且需要兼顾识别与合成时,这套先切分、再并行补说话人与质量标注、最后多系统投票加最小修正的路线值得尝试。它的价值在于把不可训练的长音频变成可按置信度与质量调度的短句池,强标签驱动精度,中低置信支撑收敛与自适应,高质量子集支撑合成。
下一步需补三项验证:在低占比领域与女性儿童语音上单独测长短句与码切换表现,公开过滤阈值与修正模板后重测消融量,以及用第三方识别模型重算合成可懂度以排除自评偏向。常见误解是把投票次数多等同于人工正确,把平均意见分高等同于适合所有合成任务,实际上投票只是共识而非真值,高分只是听感与能量门槛,不保证情感与风格覆盖。记住按任务取子集并报告分布,才能把本文结论用对地方。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


