英文题目:DEBATE: A Dataset for Disentangling Textual Ambiguity in Mandarin Through Speech
会议身份:
conference:interspeech:2026:conference-paper-id:guo26e_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据集 #数据集构建 #韵律 #语音 #音频问答
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Haotian Guo:机构信息未能从会议 PDF 纯文本可靠映射
- Jing Han:机构信息未能从会议 PDF 纯文本可靠映射
- Yongfeng Tu:机构信息未能从会议 PDF 纯文本可靠映射
- Shihao Gao:机构信息未能从会议 PDF 纯文本可靠映射
- Weihao Gan:机构信息未能从会议 PDF 纯文本可靠映射
- Zixing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向普通话书面歧义需靠声音澄清的问题,本文构建语音消歧(disambiguation through speech,DTS)基准DEBATE,输入为歧义文本加对应朗读语音,输出为与语音意图一致的语义解释,难点在于文本相同而发音、停顿与重音不同导致语义分叉。构建链条先从开源歧义库、社交媒体关键词检索与公务员考试言语理解题三路汇集候选句并划为多音字、结构切分、语义焦点三类,再由大语言模型(large language models,LLMs)扩写并经人工筛查语法、逻辑与伦理后保留200、401、400条文本并逐句精选最优语义解释,随后由10名性别均衡、含8名青年与2名老年的母语志愿者按发音、斜杠停顿边界、尖括号重音标注录制,最后经文件对应检查、每任务随机抽10条人工质检与SenseVoice-small自动语音识别(automatic speech recognition,ASR)转写算字错率入库。全库1001条文本对应10010条音频共9.66小时。在零样本二选一评测中,Qwen2.5-Omni在结构任务准确率68.08%为最高,Gemini 2.0 Flash为68.00%,重音任务最高仅58.83%,均明显低于同协议人类听辨且跨说话人离散更大。该结论仅适用于朗读短句与受控二选一协议,未验证自发对话、噪声远场与开放式问答外推能力。原文未披露训练、推理与部署成本,未提供可核验的数据下载链接与许可证。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要解决的语音消歧任务长什么样?
这篇解读的输入是论文正文与 4 张官方原图像素,目标是让刚进入语音与语言方向的研究生能够复述数据集做法与评测结论。必须保留的信息包括 3 类歧义的定义、文本与音频规模、标注符号、录音与质检流程、零样本二选一评测设置,以及模型与人类的准确率对比。输出是 1 篇按学习依赖展开的中文技术解读,不做超出证据的效果承诺。
论文研究的任务叫语音消歧,白话就是文字本身有两种以上讲得通的理解,但人一开口念出来,听的人立刻知道是哪一种。英文对应消歧经过语音,缩写可记为语音消歧。普通话是孤立语,白话就是语法关系主要靠词序和语义搭配表达,不靠丰富的词形变化,这让书面中文更容易出现一形多解。教学例子仅为帮助理解:重字不同读音可以是语气重或又说了一遍,苹果句按不同停顿可以是好吃或不好吃,想起来了按重音位置可以是回忆起来或想要起身。
论文把能被语音自然解开的歧义分成 3 类。第一类是多音字带来的发音歧义,靠实际读音区分。第二类是缺少词边界带来的结构歧义,靠韵律停顿区分。第 3 类是强调落点不同带来的焦点歧义,靠重音与语调区分。任务的输入是一段歧义文本加一段按其中一种意图朗读的音频,输出是从两个候选解释中选出与音频一致的一项。
为了先建立整体印象,可以看第一张总览图,它把 3 类场景、占比、说话人与评测落差放在同一画面,是后文数据管线与实验的地图。
看图路径: 1. 先看左侧三张示例卡每张上方的中文原句与两种英文解释;2. 再看每张卡片中间上下两条波形颜色与高亮文本的对应关系;3. 再看每张卡右下角标注的 20% 与两个 40% 占比环;4. 最后看右侧不同颜色小人表示的地域分布与右下测试图标
论文图 1。原论文 Figure 1:“DEBATE contains over 10k audio recordings and their corresponding texts, each read by 10 native speakers.”。
这张总览图左侧并排给出 3 个例子,每个例子都包含中文原句、两种英文解释和上下两条波形,分别对应发音、停顿、重音 3 种线索,右下角分别标出约 20% 与两个 40% 的占比。右侧用不同颜色小人表示来自华北、华中平原与南方的说话人分布,右下再用测试与人机对比图标点明评测意图。像素可见的要点是波形颜色与文本高亮相互对应,说明同一文字在不同读法下声学实现不同,这正是语音消歧可行的直观依据,也为后文按三列组织结果埋下伏笔。
已有路线走到哪里:文本消歧与语音理解各缺了什么?
在进入做法之前,需要把相关工作放在同一输入、同一目标、同一监督下比较,否则容易把类别差异误当成同条件胜负。第一条路线是中文文本消歧。论文提到字级别的多义语素词表工作,也提到句子级别利用网络数据或专门语料构建的词义消歧数据集,例如面向大语言模型中文歧义挑战的语料。这类工作的输入是纯文字,目标是通过改写或上下文推理选出合理理解,监督来自人工标注的语义标签。
它们为歧义分类提供了基础,但按论文报告,它们不使用发音、停顿与重音信息,因此无法回答语音能否解开文字歧义。即使文本模型能利用更大上下文,也无法获得朗读时才出现的读音与韵律证据,这是输入模态决定的边界,不是简单增大模型就能跨越的。
第二条路线是语音与多模态理解。论文提到多方对话中的听者判断、幽默与反讽检测,以及韵律特征对意图推断的作用。这类工作的输入包含语音,目标是识别情绪、幽默或交际意图,监督来自副语言标注。它们证明了重音语调有用,但按论文报告,没有专门针对普通话文本歧义构造语音配对数据。
两条路线合起来留下的缺口很清楚:既需要歧义文本,又需要按不同意图朗读的语音,还需要把两者对齐成可评测的任务。论文的定位就是补上这个缺口,而不是在通用语音识别或纯文本消歧上再刷一个分数。理解这个定位,才能明白后文为何强调一一对应录音与二选一协议。
问题如何形式化:什么算用语音解开了歧义?
把任务说严谨一点有助于复述。设一条书面句子在不加语音时至少对应两种合理解释,记为选项甲与选项乙。说话人按甲的意图朗读得到音频甲,按乙的意图朗读得到音频乙。评测时把音频甲与包含甲乙的文字提示一起交给被测对象,若其选择甲则记为正确。
关键在于 2 次朗读的文字转写相同,区别只在读音、停顿位置与时长、重音与音高变化等声学实现上。因此只看文字的模型在理论上只能猜测,而能利用声学线索的听者或模型才有信息优势。这种设计把语言理解问题转化为听觉证据使用问题,控制了文字先验的影响。
论文把 3 类子任务分别记为发音任务、停顿任务与重音任务,后文所有结果都按这三列组织。需要区分的是,论文直接报告的是二选一准确率与宏平均分数所显示的选择正确程度,有限解释是模型对某类线索更敏感,未验证的推测是模型内部如何编码韵律。解读中会用报告、支持、可能 3 类措辞分开表达,避免把相关性说成因果。
方法全景:从歧义句到可用数据集要走哪几步?
论文的数据管线可以概括为 3 段:先收集并标注文本,再组织录音,最后做质量检验。文本端要解决来源多样性与歧义类型纯度,录音端要解决说话人多样性与韵律执行一致性,质检端要解决文本音频对齐与可懂度。3 段之间有回流,任一段不合格都要返回修正,而不是 1 次性通过。
先沿一个样本走完全程有助于理解。假设收集到一句结构歧义的原句,人工先判定它属于结构类并用斜杠标出预期的停顿位置,再用大语言模型生成候选语义解释并经人工挑选保留最优的一条,随后 10 名说话人按标注的停顿位置分别朗读录音,最后用抽检与语音识别转写检查录音是否缺漏或含糊,合格后进入数据集。
覆盖 3 段流程的管线图是复述方法时最重要的地图,它明确了数据源、标注、录音与质检之间的先后关系。
看图路径: 1. 先沿下方主链看歧义句到人工筛选标注再到录音最后到数据集的箭头;2. 再看上方数据源与语义标注与质量检验三个分支框分别汇入的位置;3. 重点看中间标注框内多音字与结构与焦点各自对应的标注符号说明
论文图 2。原论文 Figure 2:“Pipeline for creating DEBATE: Ambiguous sentences were collected from diverse sources, manually filtered with disambiguation-related speech cues annotated, and semantically labeled.”。
这张图下方主链从左到右依次是歧义句、人工筛选与消歧标注、录音、数据集,上方分别挂出数据源、句子语义标注与质量检验 3 个分支。中间标注框明确写出三行对应关系:多音字原因对应标注读音,句子结构对应使用斜杠标记停顿,语义焦点对应使用尖括号标记重音。右侧质检分支写出随机抽样检查与语音识别转写两项动作。像素可见的箭头构成回路,表明语义标注需经人工检查,录音后还需回流到质检,这与正文所述双人协作与重录机制相互印证。
文本从哪里来:三类歧义如何收集与标注?
原始文本来自 3 类来源:公开的歧义语料、按歧义与断句等关键词检索到的社交媒体表达,以及公务员考试言语理解中结构复杂且有歧义的题目。收集后人工把样本归入多音字歧义、结构歧义与焦点歧义 3 类,排除不属于这 3 类的其他歧义。为了扩大覆盖与句法多样性,论文用大语言模型生成补充句子,但每句都经人工核查语法、逻辑一致性与歧义类型归属,并删除不当或敏感内容。
标注采用韵律层面的 3 套符号:多音字处标注具体读音以明确词义,结构歧义处用斜杠标记韵律边界,焦点歧义处用尖括号标出需要重读的词以突出语用焦点。在此基础上,每条消歧后的句子再配一条语义解释:先由大语言模型生成多个候选解释,再经人工按流畅度、语义准确性与逻辑一致性挑选最优者保留。文本总量最终形成发音类二百句、停顿类四百零一句、重音类四百句的配比。
多音字歧义 × 发音消歧: 多音字歧义负责提出问题:同一个汉字在书面形式下对应多个读音和词义,缺少上下文时无法确定说话人意图;发音消歧负责给出答案:朗读时只能发出其中一个具体读音,听者据此锁定词义。二者搭配的理由是书面符号的 1 对多映射恰好被口语音频的 1 次具体实现所唯一化,组合意义是把字形判断转化为可听的读音识别。
结构歧义 × 韵律停顿: 结构歧义负责提出切分问题:中文书面没有空格,同一字串按不同断词位置会得到好吃与不好吃这类相反理解;韵律停顿负责提供切分证据:说话人在语义完整的词组之间留下可感知的停顿与时长变化。二者搭配的理由是文本缺失的边界信息在语音时间轴上显式出现,组合意义是把句法选择转化为停顿位置检测。
焦点歧义 × 重音与语调: 焦点歧义负责提出强调问题:想起来了可以是回忆起某事,也可以是想要起身,文字不标记强调落点;重音与语调负责标记强调:通过音高、强度和时长变化突出想起来或起来。搭配理由是语义焦点在文字层不可见但在声学层有连续可测的实现,组合意义是把意图判断转化为对重音位置的感知。
3 组概念桥放在这里,是因为只有先理解每类歧义的分工,才能明白标注符号为什么这样设计。发音标注解决一字多音,斜杠解决无空格切分,尖括号解决强调落点,三者都是把听觉线索提前写成可执行的朗读指令。标注完成后,录音人只需按符号执行即可复现意图,这保证了后文评测中音频与选项的对应关系是可控的。
有没有训练:本研究实际计算了什么?
本研究没有训练新的神经网络模型,该节按要求明确说明缺席的训练阶段并讲清实际发生的计算过程。未训练的对象包括声学编码器、大语言模型与任何新提出的消歧模型参数,论文也没有报告优化器、学习率、梯度路径或参数冻结与更新策略,这些属于具体缺项,不从模型名称推定实现。
实际发生的计算与人工操作包括 4 类。第一类是文本生成与标注计算:用大语言模型生成补充歧义句与候选语义解释,再由人工筛选与定稿。第二类是录音执行:招募 10 名志愿者,年龄覆盖 8 名青年与 2 名老年,性别按 5 比 5 平衡,所有人先接受重音、语调与停顿位置的指导,再用手机与笔记本内置麦克风在真实环境下录音,以贴近实际部署条件。
每人先提交 10 条试录音,经人工检查设备与环境合格后才进入正式录音。正式录音采用双人协作,1 人朗读 1 人实时监听,发现误读或漏读立即反馈重录。第 3 类是质量检验计算:核对文本条目与音频文件的一一对应,随机抽听检查发音清晰度、完整性、语速自然度与韵律规范性,并用语音识别系统转写全部录音计算字错率。第 4 类是评测推理:调用 3 个现成的大语音语言模型做零样本推理,不做微调。
因此本研究的可靠性来自流程控制而非梯度优化,不能把无训练等同于确定性求解,也不能从调用现成模型推定输出稳定。复述时应强调试录音筛选与双人监听是质量保证的关键动作,而非附带细节。
实验条件:用什么数据、怎么问模型、用什么指标?
数据划分与规模需要 1 次讲清。文本层面共 1001 条歧义语句,每条由 10 名说话人朗读,得到 10010 条音频,总时长约 9.66 小时。按类型看,发音、停顿、重音 3 类的文本量与音频量在正文表格中分别列出,录音时长从 1.15 秒到 11.8 秒不等。说话人覆盖不同年龄、性别与地域,录音设备以日常手机与笔记本麦克风为主。
采样与聚合方式是每条文本乘以 10 个说话人,评测时按任务分别计算准确率与宏平均分数,并在 10 个说话人上报告均值与方差。被测对象是 3 个代表性大语音语言模型,均为零样本设置,不做针对本数据集的训练。任务构造是单选题:输入为按某种意图朗读的人声音频,文字提示给出两种人工挑选的可能解释,其中仅一项与音频意图一致,要求模型选出最合适的一项。
指标方向是准确率与宏平均分数越高越好,比较条件是同一音频与同一文字提示下不同模型的选择结果。人类对照是在每个子任务随机抽 50 条、保证每名说话人贡献 5 条不重复样本的小规模集合上,由 3 名未参与研究的志愿者独立作答,流程与模型推理一致。
为了明确二选一的提问方式,先看一道发音任务的真实样例,它是理解后文所有数字的前提。
看图路径: 1. 先看左侧音频输入框内的朗读文本与波形及其上方英文解释;2. 再看右侧文字提示框内两个候选英文解释与要求二选一的题干;3. 对比左右两框确认音频与文字提示是两个独立输入通道
论文图 3。原论文 Figure 3:“A test sample from TPronu. The Audio Input is the recorded speech after disambiguation, while the two options in the Text Prompt represent the possible interpretations of the…”。
这张图左侧框内是一条已按重复含义朗读的音频输入,框中同时显示对应文本与波形,右侧框内是文字提示,先说明将提供两种可能含义,再列出语气重与重复自己两个选项并要求选择最合适的一项。像素可见的左右分框表明音频与文字提示是两个独立通道,模型必须联合两者才能作答,单看文字无法确定答案,这正是语音消歧评测的关键设计,也解释了为何转写正确不等于选择正确。
主结果:录音质量与模型选择准确率各是多少?
先看质量检验的结果,它决定后文模型失误能否归因于录音不清。下表提出第一个比较问题:在相同语音识别转写条件下,3 类任务的字错率高低如何排序,对照高质量语料又处于什么水平。
| 任务类型 | 本数据集字错率 | 对照语料名称 | 对照语料字错率 | 指标方向与含义 |
|---|---|---|---|---|
| 发音任务 | 4.75% | 爱舍尔 1 测试集 | 2.96% | 越低表示音频与文字越一致 |
| 停顿任务 | 2.82% | 爱舍尔 1 测试集 | 2.96% | 越低表示音频与文字越一致 |
| 重音任务 | 1.94% | 爱舍尔 2 测试集 | 3.80% | 越低表示音频与文字越一致 |
表后解释要给出判断与限制。论文报告 3 类任务的字错率分别为 4.75%、2.82% 与 1.94%,而同一识别系统在两个高质量普通话识别语料上的字错率为 2.96% 与 3.8%,这支持音频与文字高度一致的判断。代价与反例是发音任务字错率相对最高,可能与多音字本身的识别难度有关,不能据此断言发音类录音不合格,也不能把自动转写字错率当成人类可懂度。未胜出项在这里是发音类在一致性上不占优,后文若出现发音任务方差更大,需要结合识别难度理解。
再看模型主结果。下表提出核心比较问题:在相同零样本二选一条件下,3 个模型在 3 类任务上的准确率与宏平均分数如何排序,表头单位为百分比,数据格保留原表裸值与均值加减方差写法。
| 被测模型 | 发音任务准确率(%) | 发音任务宏平均(%) | 停顿任务准确率(%) | 停顿任务宏平均(%) | 重音任务准确率(%) | 重音任务宏平均(%) |
|---|---|---|---|---|---|---|
| Qwen2-Audio | 58.60 ±3.43 | 55.40 ±4.03 | 55.64 ±1.85 | 51.10 ±1.66 | 51.57 ±1.01 | 47.60 ±1.43 |
| Qwen2.5-Omni | 65.65 ±2.30 | 65.20 ±2.62 | 68.08 ±1.47 | 67.90 ±1.60 | 55.02 ±2.16 | 55.20 ±2.15 |
| Gemini 2.0 Flash | 61.15 ±3.95 | 60.80 ±4.16 | 68.00 ±1.69 | 67.90±1.79 | 58.83 ±4.06 | 58.00 ±4.47 |
表后解释需要结合方差与未胜出项。论文报告后 2 个模型总体较强,第一个模型相对较弱,论文将其部分归因于前两者底层语言模型更强与训练语料更大,这属于有限解释而非因果证明。分任务看,发音与停顿任务表现尚可,停顿任务输出更稳定,支持模型能感知句内停顿并推断层级结构的判断。未胜出项非常明确:所有模型在重音任务上都较差,第一个模型在重音任务上接近随机,说明对音高与强度等细粒度韵律的建模不足。还需指出总体趋势不等于每位说话人都成立,后文箱线图显示模型跨说话人波动大于人类。
语音消歧 × 大语音语言模型: 语音消歧负责定义任务:给定一条歧义文本加上一段已按某种意图朗读的音频,从两个候选解释中选出与音频一致的一项;大语音语言模型负责执行任务:同时接收音频输入和文字提示并输出选项。搭配理由是模型必须真正使用声学线索而非仅靠文字先验,组合意义是用可控的二选一准确率检验模型是否听懂了发音、停顿和重音。
人机对比的箱线图是主结果的反证,它把平均数背后的分布与离散程度暴露出来。
看图路径: 1. 先确认横轴三组任务与纵轴准确率以及图例中人类与三个模型颜色;2. 再比较每组内人类箱体与三个模型箱体的中线高度;3. 最后观察箱体宽度与须线长度判断跨说话人离散程度
论文图 4。原论文 Figure 4:“Comparison of human and model performance on the small-scale test set with box plot.”。
这张图横轴为发音、停顿、重音 3 组任务,纵轴为准确率,图例区分人类与 3 个模型。像素可见人类白色箱体在 3 组中中线都接近顶部且箱体较窄,而 3 个模型的箱体中线明显更低且须线与离群点更多,尤其在重音任务上模型箱体整体下移。这支持论文的判断:大语音语言模型不仅在平均准确率上低于人类,在跨说话人与跨句子的一致性上也更差,不能把某 1 次的高分推广为全程稳定。
反证与边界:停顿为何相对好做,重音为何最难?
论文没有做常规的模块消融,但提供了两类可当作反证的对照,值得按问题组织。第一类是任务间对照:停顿任务相对最好,重音任务最差。机制上的解释是停顿有明确的时间边界,在波形上对应静音或时长拉长,模型较易捕捉;重音则是同一音段内部音高、强度与时长的复合变化,且在大规模自动转写语料中很少被标注,模型缺乏学习信号。
这属于论文的有限解释,支持韵律显式程度决定难度的判断,但尚未用受控实验分离声学难度与数据稀缺的影响,仍是待验证部分。不能据此断言增加韵律标注必然补齐差距,只能说可能是改进方向之一。
第二类是说话人间对照:正文中报告的说话人方差与箱线图中的箱体宽度表明模型对不同嗓音更敏感,而人类听者更稳健。这提示评测必须按说话人聚合,不能只报告总体准确率。失败条件还包括重音任务上接近随机的结果,它说明当前模型即使能转写文字,也未必能利用超音段信息做语义选择。
未评测的边界是开放式问答与多轮交互,论文明确留到未来工作,当前二选一结论不能直接推广到生成式回答。若把二选一分数当成开放生成的质量保证,就会超出证据范围。
限制在哪里:哪些结论不能超出证据?
需要分清 3 层表述。论文直接报告的是数据集规模、标注符号、录音流程、字错率数字与零样本二选一准确率,这些可以复述为事实。有限解释是模型差距部分来自底层语言模型与训练规模,以及停顿比重音更易感知,这些有数据支持但不是因果证明。未验证推测是未来通过增加韵律标注就能补齐重音能力,论文并未给出训练实验,因此只能说可能与待验证。
缺失的证据不是技术错误,但必须点名:论文未报告误判率的错误类型分布、推理延迟与计算成本、不同录音设备的分层结果,也未测量开放式生成的质量。若需要部署选型,还需补测噪声环境下的稳定性、方言口音覆盖是否充分,以及模型是否过度依赖文字先验而忽略音频。
相关性不等于因果,例如模型在停顿任务上分数高,不能直接断定它真正理解了句法,只能说在当前二选一协议下选择更准。总体趋势也不等于每组都成立,个别说话人或个别句子上的高分不能推广为全程稳定。复述时应保留这种谨慎措辞。
复现先做什么:按原文重走一遍的最小动作?
若要复现数据集构造,建议按原文顺序先做文本再做音频。文本侧先从 3 类来源收集候选歧义句,再人工过滤为 3 类并用读音、斜杠、尖括号 3 套符号标注,随后用大语言模型生成候选语义解释并人工挑选最优者,同时记录二百、四百零一、四百的文本量配比。音频侧先招募性别平衡、年龄兼顾青年与老年的 10 名母语者,统一讲解重音与停顿的执行标准,先收 10 条试录音检查设备与环境,再用双人协作边录边听、错即重录。
质检侧先核对文本与音频的一一对应,再随机抽听并用语音识别转写计算字错率,对照高质量语料的字错率判断录音可用性。若要复现评测,需准备同一音频加同一二选一文字提示,把音频作为语音输入、选项作为文字提示送入模型,统计 3 类任务的准确率与宏平均分数,并按说话人计算均值与方差。人类对照需另招未参与录制的志愿者在相同小规模集合上独立作答。
关于可用性,本次收到的资源状态显示没有完成超链接可达性验证的绑定资源,因此不能声称代码、模型或数据已公开或当前可用,复现前需自行按论文描述重新实现流程并核对授权。任何超出原文的划分或超参数都不应自行补充。
何时值得尝试:这套数据与结论对你有什么用?
当研究问题涉及一形多解且朗读方式能改变理解时,这套思路值得尝试,例如同音字选择、断句不同的语音助手查询理解,以及需要正确重读的语音合成评估。它的价值在于把模糊的语感变成了可执行的标注与可比较的准确率:读音、停顿、重音各自有符号、录音要求与对照实验。若只做纯文本消歧或通用语音识别,则不必照搬全部流程。
复述方法的关键超参数与信息条件是一千零一句文本乘以 10 人朗读、约 9.66 小时音频、3 类任务划分与二选一评测协议,缺了其中任何一项,数字都不可比。还需补的验证是开放式与交互式消歧,以及更细的韵律标注对重音任务的提升效果。
常见的误解是把转写正确等同于听懂意图,本文的反例恰好说明模型可以转对文字却选错意图,原因在于意图藏在读音、停顿与重音等超音段线索里,而这些线索在文字层不可见。只有同时使用音频与文字提示并按说话人聚合评估,才能检验模型是否真正用到了语音证据。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



