英文题目:Rapid Prosody Transcription as a tool to assess the perception of phrase-level prominence in Mandarin
会议身份:
conference:speechprosody:2026:conference-paper-id:rohrer26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#众包评测 #韵律 #言语感知 #语音 #语音属性识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Patrick Louis Rohrer:机构信息未能从会议 PDF 纯文本可靠映射
- Yuting Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yiya Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hans Rutger Bosker:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为6个普通话TED演讲中切分的146个自然语句共1326词,输出为每个词是否被感知为短语层显著的二值判断,难点在于基频同时承载声调词义与焦点韵律调制,朴素母语者难以直观区分声学显著范畴。方法链分三步衔接:先用Whisper生成字符级时间对齐并在Praat中人工校对翻译与加注得到可点击文本,再将146句按奇偶编号分为72句的List 1与74句的List 2以阻断相邻语篇信息结构依赖,最后在Gorilla平台让被试至多听两遍后勾选听感上更响更长夸张清晰的词并计算词级显著得分与成对一致性。与面向重音语言的ToBI音高重音标注思路不同,该工作不依赖语调音系类别而直接众包朴素显著感,因而能检验感知方法向声调语言迁移的可行性与局限。在奇偶分列的双列表评测任务下,List 1的Cohen’s Kappa指标为0.27,高于List 2的Cohen’s Kappa指标0.231。该结果表明自然语流中声调与显著性线索相互混淆导致朴素判断离散较大,显著性并非稳定的直觉范畴。结论的适用边界仅限于自然演讲普通话的声学显著性感知任务,尚未验证其向朗读语体受控焦点材料或声学预测模型的外推表现。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://osf.io/mtf3p/ — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/mtf3p/ — 链接可访问(HTTP 200)
- 复现相关资源:https://osf.io/mtf3p/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.prolific.com/ — 链接可访问(HTTP 200)
- 第三方资源:https://praat.org — 链接可访问(HTTP 200)
- 第三方资源:https://www.R-project.org/ — 链接可访问(HTTP 200) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决的听感问题是什么?
这篇解读的输入是 2026 年语音韵律会议上关于普通话短语层面显著性感知的论文,目标是让刚进入语音领域的研究生能复述它做了什么、怎么做的、在什么条件下得到什么数字。必须保留的信息是被试量、刺激量、任务指令、一致性指标的具体数值和跨语言对照的大致位置,输出是一套可核对的操作描述,而不是对普通话韵律理论的重新评价。
任务本身可以白话理解为听响亮度比赛。给母语者放一段自然演讲,让他们凭第一印象点出听起来更响、更长、更夸张、更清晰的词。这里的短语层面显著性就是这种词比邻词更扎耳的听感,英文是 phrase-level prominence。研究者想知道的是,在普通话这种每个字自带声调的语言里,外行听者还能不能稳定地听出谁更突出。
短语层面显著性 × 焦点: 短语层面显著性指听者感觉某个词比邻近词更响、更长、更夸张的听感,焦点指说话人为了表达新信息或对比而在发音上做加强的意图,二者搭配的理由是普通话中焦点常通过时长、响度和音高范围扩张来实现,组合意义在于判断听到的响是否等于说话人想强调的意思,本研究只测前者是否被稳定听到。
为什么这个问题不简单?在英语或荷兰语这类重音语言里,提高基频、推迟峰值、加大响度和拉长时长,往往直接对应重音和焦点,听者容易把响和重要画等号。在普通话里,基频首先要区分字义,焦点加强只能在原有声调上把音高范围撑大一点。生产端已经报告时长变长、响度变大、音高范围扩张,但生产上有加强不等于听者一定把它听成独立于语义的响。论文要补的正是感知端用自然语料的大样本证据。
已有路线如何标注突出,普通话为何特殊?
已有路线大致分两条。一条是专家标注体系,以语调标注系统为代表,英文是 ToBI。在重音语言里,标出音高重音就间接标出了短语突出,因为带音高重音的音节按定义就承载短语突出。另一条是外行听感路线,以快速韵律转写为代表,英文是 Rapid Prosody Transcription,简称 RPT。它不要求被试懂语调,只做突出或不突出的二值判断,再汇总成突出分。
普通话的特殊性在于两套路线都不好直接搬。泛普通话标调系统曾提出重音层和背景音高范围等标签,其中还有强调性突出的 discourse 标签,但作者自己也说这是未完成的编码系统,后续只有少量研究沿用,学界并没有公认的短语显著性判定标准。RPT 在普通话里此前只有一项 12 人的初步研究,对照了 RPT 和标调系统的重音层并报告中等相关,但只以摘要形式出现,没有报告被试间一致性。
声调 × 语调: 声调负责区分字词本身的调形,如高平、升调、降调等,语调负责在更大短语上调节音高范围和起伏以表达焦点或语气,二者在普通话中共用基频通道,搭配研究的原因是焦点加强会扩大原有声调的音高活动空间,组合后要看的是听者能否把这种叠加后的变化仍听成更突出。
教学上要区分两个相近词。焦点标记研究常让被试判断对比含义或语用功能,例如听出是对立还是新信息,这测的是用韵律理解意思。RPT 测的是更前端的听感,即是否觉得某个词声音上更显著。能用韵律猜对意思,不等于能稳定点出哪个词最响。论文明确把显著性操作化为声音显著,而非信息重要性,这决定了后续指令和指标的选择。
本研究把问题收窄到哪一个可测的判断?
本研究把大问题收窄为一个可重复的判断:在自然演讲条件下,非专家普通话母语者用传统 RPT 范式点选突出词时,被试之间的一致性有多高。判断标准不是与某个金标准对齐,而是人与人之间是否指向同一批词。如果一致性明显低于其他语言的 RPT 研究,就说明要么普通话的突出听感本身更依赖语言特有概念,要么当前任务措辞不适合声调语言。
例子只是帮助理解,不代表论文数据。比如听到讲述的一个观点,若把讲和观点选为突出,这就是 1 次二值标注。论文不预设哪个词该被选,只统计不同人是否选了相同的词。后续所有数字都是围绕这个重合度展开的。
需要提前说明边界。论文是探索性研究,没有建立声学到感知的映射模型,也没有训练分类器去预测突出分。它只报告感知一致性,并讨论可能的原因和下一步应补的声学对照。因此不能从本文得出时长或基频哪个 cue 更重要的结论,只能得出当前方法下听感是否稳定的结论。
方法全景:从演讲视频到每词 0 或 1
全流程可以沿一个样本走一遍。输入是一段普通话 TED 演讲视频,先用自动语音识别得到带时间对齐的汉字转写,再人工校对、翻译和加注,筛选出目标语句。接着把语句分成两个列表呈现给不同被试,被试听完音频后在屏幕上点选觉得突出的汉字,每个词最终记为突出或不突出。最后把多人对同一词的判断汇总,计算两两一致性和每个词的突出分。
快速韵律转写 × 突出分: 快速韵律转写是让非专家听一句点出觉得突出的词的二值判断方法,分工是每人每词只给突出或不突出,突出分是把同一词被多少人点选汇总成的比例,分工是把众人的离散点击转成连续的突出程度,搭配理由是用人群重合度代替专家标调,组合意义是分越高代表该词的声音显著性越被公认。
这个设计刻意保留了自然语料的难度。说话人是被判断为标准普通话的北京或上海出生者,男女各 3 人,语句长度不一,包含真实演讲的语速、停顿和信息结构变化。代价是变异来源多,听者分歧可能来自声学本身,也可能来自对信息结构的理解差异。论文用奇偶句分列来削弱相邻句的信息结构依赖,但并未消除自然语料的整体变异。
与专家标调相比,这条路线的优点是可众包、门槛低、直接反映外行听感,缺点是完全依赖被试对突出概念的理解。如果被试心里没有独立于字调和语义的响的概念,点选就会漂移。论文在培训阶段用声音夸张和清晰来解释概念,并沿用以往 RPT 的声音描述式指令,这为后续讨论指令是否跨语言适用埋下伏笔。
刺激如何构造:多少句话,多长,分给谁听?
刺激构造是本研究可复述的关键部分。研究者从 6 个普通话 TED 演讲视频中选出 146 个目标语句,大致在 6 位演讲者之间平衡。自动转写工具得到时间对齐的文本网格文件,再在语音分析软件中人工校对汉字、翻译和加注。目标语句长度从 3 个词到 22 个词不等,平均约 9 个词,共 1326 个词。
分组方式值得单独讲清楚。146 个目标语句按顺序编号,奇数句和偶数句分到不同列表,避免被试连续听到上下文相关的两句,从而减少信息结构带来的偏差。列表 1 有 72 句,列表 2 有 74 句,被试大致分到两个列表之一,只听自己列表内的句子。这种设计使两个列表的结果可以互相参照,但也意味着两个列表的被试集合不完全相同。
下表把刺激和被试的基本规模放在一起,帮助初学者核对复现时的数据量是否对齐。表前的问题是:要重做 1 次实验,需要准备多少语音材料、招募多少人、年龄和方言背景如何记录。公平条件是同一批 TED 说话人、同一套人工校对流程和同样的奇偶分列逻辑,指标方向是数量越多不代表一致性越高,只是决定估计精度。
| 材料与人群条件 | 统计指标 | 列表 1 或总量 | 列表 2 或均值 | 备注说明 |
|---|---|---|---|---|
| 目标语句总数 | 语句数 | 146 句 | 72 句与 74 句分列 | 6 位演讲者大致平衡 |
| 语句长度范围 | 词数与均值 | 3 到 22 词 | 平均 9.12 词 | 标准差 3.35 词 |
| 词汇总量 | 词数 | 1326 词 | 同左 | 突出判断的基本单位 |
| 被试总量 | 人数 | 65 人 | 38 人线上招募 | 另 27 人经私人网络招募 |
| 被试年龄 | 年龄均值 | 30.47 岁 | 标准差 11.39 岁 | 方言含中原官话吴语客家话等 |
表后需要解释主要事实与代价。总量 146 句和 1326 词保证了每个被试要做约 70 多试次,平均 16 分钟完成,负担可控。代价是自然演讲的语句长短不一,短句可选词少,长句可选词多,不同长度语句的一致性可能不可比。方言背景多样更接近真实母语者群体,但也引入听者相关变异,后文讨论是否应分析方言影响时需要回到这一点。未胜出的边界是论文没有报告按说话人或按语句长度拆分的一致性,因此不能判断低一致是否集中在特定说话人身上。
被试听到什么、看到什么、允许点几次?
实验在在线行为实验平台上搭建,包含实验前检查、简短培训、主任务和事后问卷。培训阶段先用白话解释韵律突出,意思是带较大突出的词其词调听起来更夸张、更清晰,因为短语层面突出对普通话母语者可能不是现成概念。随后给 4 个练习试次熟悉界面,再进入主任务。
单试次流程是固定的。先看 1000 毫秒注视十字,然后点击耳朵图标播放语句音频,播完后屏幕出现可点击的汉字转写。被试被要求选出听起来更响更长、夸张清晰的词或词组,允许再听一遍音频,可以自由点选和取消,最后按空格键进入下一试次。整个实验限时 2 小时,自定步速的主任务平均 16 分钟完成。
操作细节决定可比性。只允许听两遍是为了保留快速转写的即时印象,避免反复推敲转向语义分析。允许自由取消是为了减少误触,但也意味着最终记录的是深思熟虑后的选择,而非第 1 次点击。指令中同时出现响、长、夸张、清晰多个形容词,这在以往 RPT 中常见,但在声调语言中可能把响度和时长与调形清晰度混在一起,这是后文讨论指令效应的事实基础。
本研究训练了什么模型,没有训练什么?
本研究没有训练任何声学模型或突出预测模型,也没有更新神经网络参数,不存在梯度路径、参数冻结或早停等概念。把无训练等同于结果确定是误解,无训练只说明本文不做模型拟合,被试判断本身仍有随机性和个体差异。
实际执行的计算是标注汇总与一致性统计。数据从在线平台导出后在统计软件中处理,先剔除无效被试,再对每个列表计算所有被试两两之间的科恩卡帕并取平均,同时报告原始一致率。数据和脚本已公开在开放科学平台,可重复跑出同样的均值和分布矩阵。
需要指出的缺项是论文未报告具体的随机种子、缺失值处理之外的预处理代码细节,也未对突出分建模。后续若要把突出分与声学特征关联,需要另写提取基频范围、时长、响度的脚本,并明确以词为单位的聚合方式,而这些不在本文的计算范围内。
实验条件与剔除规则如何保证可比?
被试条件按原文交代。共 65 人参与,其中 38 人来自被试招募平台,27 人为志愿者,平均年龄 30.47 岁,母语方言包括中原官话、吴语、客家话、湘语等,无人报告听力障碍。伦理审批来自大学伦理委员会,通过招募平台参与者获得报酬。方言多样是如实记录,不是作为协变量建模,复现时应同样记录但不必强求相同方言比例。
剔除规则同样明确。1 名被试因 72 试次中 20 试次未作答而被剔除,另有 3 名被试因完成时间超过 40 分钟而被剔除,该阈值对应平均任务时长的 2 倍标准差。剔除后才计算分列表的两两卡帕。这种基于缺失率和时长的剔除不涉及判断内容本身,因此不会直接抬高或压低一致性,但复现时必须采用相同规则才能对齐样本量。
以下导读针对任务界面截图,帮助初学者把文字流程对应到被试视角。该图是音频转写子任务在实验平台上的截屏,拼音和英文翻译在图注中给出,像素显示的是中文点选界面。
看图路径: 1. 先看顶部进度条和中间耳朵图标,确认这是先听两遍再点选的流程;2. 再看下方汉字方框排列,确认点选单位是字词而非拼音或声波;3. 对照中文提示语,确认任务口径是选听起来被强调的汉字
论文图 1。原论文 Figure 1:“Screenshot of the AO-RPT sub-task on the Gorilla platform of stimulus (pinyin: Jiˇangshu de y ́ı ge gu ̄andiˇan; trans- lation: ‘a viewpoint that is narrated.’)”。
从像素可见,顶部有一条灰色进度条配红色已完成段,中间是请选择被强调的汉字的中文指令和耳朵图标,下方是讲述的一个观点的汉字方框,其中点字换行显示。对应到真实组件,进度条反映试次进度,耳朵图标是 2 次播放的入口,汉字方框是可点击和取消的标注单元。这说明被试的判断单位是视觉呈现的字,听觉是两遍音频,复现时若改成拼音或分词不同的切分,一致性将不可比。
主结果:一致性数字是多少,与以往差多少?
主结果要回答的是测什么、与谁比、条件是否一致。测的是同一列表内被试点选突出词的重合度,指标是原始一致率和扣除偶然一致的两两科恩卡帕,指标方向是越大代表越一致。与以往 RPT 研究的比较条件并不完全一致,因为语言和语体不同,但论文整理了德语叙事复述、英语自发对话、希腊语朗读等研究的一致性,作为量级参照。
两两科恩卡帕 × 原始一致率: 原始一致率是任意 2 人判断相同的词数占比,分工是直观反映重合多少,两两科恩卡帕是扣除偶然猜中后的一致性,分工是防止都选不突出也能得到虚高一致,搭配理由是本任务不突出词远多于突出词,组合意义是只有同时看两者才能判断低一致是真分歧还是基率造成的。
本研究的具体数字是列表 1 原始一致率 76.73%,平均卡帕 0.27,列表 2 原始一致率 77.61%,平均卡帕 0.231,两列汇总后的总平均为 0.251。个体差异很大,列表 1 的两两卡帕从 0.019 到 0.589,列表 2 从负 0.016 到 0.507。论文据此判断,相比以往多数语言的 RPT 研究,本次普通话的一致性偏低。
下表把两列的一致性放在同一框架下,便于核对均值与离散度。表前的问题是:在相同任务指令和相似试次量下,两个列表是否给出一致的低一致结论。公平条件是两列都经过相同剔除、相同两两卡帕平均流程,指标方向是原始一致率高不代表卡帕一定高,因为不突出词占多数会推高原始一致。
| 实验分组条件 | 一致性指标 | 列表 1 数值 | 列表 2 数值 | 跨列汇总与离散 |
|---|---|---|---|---|
| 听辨列表 | 平均科恩卡帕 | 0.27 | 0.231 | 总平均 0.251 |
| 听辨列表 | 两两卡帕下限 | 0.019 | -0.016 | 存在接近零或负值 |
| 听辨列表 | 两两卡帕上限 | 0.589 | 0.507 | 最高仅中等一致 |
| 刺激规模 | 语句数 | 72 句 | 74 句 | 合计 146 句 |
表后解释主要收益与代价。收益是两个列表独立算出相近的低均值,说明低一致不是某一列偶然造成的。代价是原始一致率约 77% 看起来不低,容易误读为一致很好,实则扣除基率后卡帕只有 0.25 左右。未胜出项是上限 0.589 表明少数被试对之间可达中等一致,但均值被大量低一致拉低。未评测边界是论文没有报告突出分高词的声学特征,因此不能说高突出分词一定更长更响,这留待后续声学对照。
以下导读针对一致性矩阵图,帮助理解均值背后的分布。该图上下两面板分别显示两个列表的两两卡帕矩阵,颜色深浅代表数值高低。
看图路径: 1. 先区分上下两个三角矩阵,分别对应两个 utterance 列表的被试两两比较;2. 再沿横轴被试编号看颜色深浅变化,确认一致性存在很大的个体差异;3. 最后对比底行偏暖色与其他格偏冷色的分布,思考少数高一致被试对均值的影响
论文图 2。原论文 Figure 2:“Reliability matrix of Pairwise Cohen’s Kappa values for List 1 (upper panel) and List 2 (lower panel)”。
从现有像素看,矩阵呈上三角形式,横轴为被试编号,纵轴亦为被试序号,格子颜色从偏红到偏蓝黄渐变,底行部分格子偏暖,提示个别被试与其他人的一致性相对较高,而多数格子偏冷则对应低一致。由于像素分辨率有限,不应硬读每个格子的精确数值,具体均值和极值以正文报告的 0.27、0.231、0.251 及范围为准。该分布支持论文的判断,即低平均一致伴随很大的个体差异,而非所有被试都均匀地低。
反证与对照:低一致更像语言特性还是任务措辞?
论文没有做消融实验意义上的去掉某个模块,但提供了两类反证式对照。第一类是跨语言量级对照。论文整理的以往 RPT 一致性从德语叙事复述的 0.475、英语自发对话的 0.401 左右,一路低到政治演讲的 0.204 和巴布亚马来语叙事复述的 0.106,本研究 0.251 处于偏低区间,但并非孤立的最低值。这支持低一致可能与语言类型和语体都有关,而不是普通话独有的全盘失败。
第二类是文献中的指令效应和跨语言听辨对照。有研究在英语、法语、西班牙语中比较声音显著指令和信息要点指令,发现英语两种指令结果相似,而西班牙语和法语差异显著,提示突出与信息结构映射具有语言特异性。另有巴布亚马来语研究发现,当地听者评自己语言一致性很低,但评没学过的德语时却与德国母语者模式相似,提示语言系统本身会约束突出判断,同时可能存在普遍的声音显著性。这两条证据都是论文引用的已发表结果,不是本文新测的数据,引用时必须标明是支持性讨论而非本研究的直接证明。
对初学者而言,关键是区分直接报告和有限解释。直接报告的是本研究两列的低卡帕和大个体差异,有限解释是声调占用基频、自然语料变异、指令假设外行心中有突出概念这三点可能共同导致低一致,未验证推测是若改用朗读语料或换一种任务措辞一致性就会提高。论文明确说未来可用更可控的朗读语音获得更清晰的感知模式,但这只是待验证的建议,不是已测的因果结论。
哪些条件限制了结论,什么还不能说?
限制首先来自概念本身。在重音语言里,突出对应声学显著比较直接,带音高重音的词通常被判为突出。在普通话里,基频首先受声调支配,已有工作聚焦焦点下韵律如何调节,但这种调节是否在听感上等同于重音语言意义上的声学突出,仍不清楚。听者能用韵律线索理解对比含义,不保证会把这些线索概念化为独立于语用和语义的响。
泛普通话标调系统 × 快速韵律转写: 泛普通话标调系统试图用分层符号记录重音层和背景音高范围等类别,分工是给专家提供可比的标注体系,快速韵律转写分工是收集外行基于第一印象的听感,搭配讨论的原因是前者在普通话中尚无公认的短语显著性标准,组合意义是思考未来能否用后者的听感分布去补充或校准前者的类别定义。
其次是指令与被试理解的错位。任务从声音角度框定,要求选声音上突出的词,这假设外行心中已有突出构念,在重音语言中或许成立,但在声调语言中未必。尽管培训解释了夸张和清晰,被试可能并未把解释与自身语言经验对齐。论文讨论这不是被试不认真,而是任务提示的突出概念与语言经验不匹配。
还有方法实施层面的限制。自然非朗读语音引入变异,可能进一步模糊判断。论文据此提出未来可用更可控的朗读语音,但同时也承认即便如此,声调与语调纠缠的根本问题仍在。缺失的证据包括声学对照、方言背景效应、声调类别效应,这些都未测量,因此不能承诺本方法改进后能用于语料库标注,也不能把低一致简单归因于某一个声学 cue。
若要复现,先准备什么,按什么顺序跑?
复现的第一步是拿材料与代码。论文声明数据和脚本已公开在开放科学平台,当前可用状态以资源清单为准,链接指向同一地址。第三方工具包括被试招募平台、语音分析软件、统计软件和自动转写模型,复现时应记录各自版本,因为转写和对齐版本变化会影响词切分和语句筛选。
第二步是重建刺激列表。按原文做法选 6 位标准普通话演讲者的 TED 视频,用自动识别得到时间对齐文本网格,人工校对汉字并翻译加注,筛选 146 句目标语句,记录每句词数和总词数,再按奇偶编号分成 72 句和 74 句两列。必须保留原有的词切分口径,否则突出分无法按词对齐。
第三步是重跑实验流程与统计。用在线实验平台搭建注视十字加 2 次播放加汉字点选的流程,培训中解释词调更夸张更清晰,练习 4 试次,主任务自定步速。导出后在统计软件中按缺失率和超时剔除,再分列计算两两科恩卡帕均值、原始一致率和个体范围。若要进一步验证,应补做声学提取与突出分回归,并分析声调和方言的影响,这些是原文明确留给未来的工作。
何时值得尝试这种方法,还需补哪项验证?
综合来看,当研究目标是快速了解外行母语者能否稳定听出谁更响时,这种众包式点选仍值得尝试,因为它成本低、能直接给出突出分和一致性分布。但当目标是在普通话中建立可比的短语突出标注标准时,当前实施显示一致性只有 0.251 左右,单独依赖它做语料库标注风险较大,更适合作为补充听感去对照声学和标调系统。
复现后最优先补的验证是声学映射。把高突出分词的时长、响度、基频范围与低突出分词对比,看哪些 cue 真正对应声音显著,并检验声调类别是否调节这种对应。若高突出分词并无稳定的声学差异,就说明点选更多反映信息结构理解而非声音显著。其次应补指令对照,例如比较声音显著指令与信息要点指令在普通话中是否分离,这能直接检验任务措辞的影响。
对初学者的特有误解需要澄清。原始一致率约 77% 不等于一致很好,因为不突出词占多数时偶然一致本来就高,关键看扣除偶然后的卡帕。个体上限接近 0.5 也不等于方法有效,因为均值才代表人群稳定性。自然语料更真实不等于更适合首次验证方法,在声调语言中先用朗读语料收窄变异,再回到自然语料,可能是更稳的学习依赖顺序。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 6 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

