英文题目:Enhancing and reducing prosodic cues: A preliminary investigation of turn-end prediction in listeners with hearing loss
会议身份:
conference:speechprosody:2026:conference-paper-id:curetti26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#心理声学实验 #韵律 #语音 #轮次切换
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Lorenza Zaira Curetti:机构信息未能从会议 PDF 纯文本可靠映射
- Hae-Sung Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Lauren Hadley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究面向听力损失听者的会话轮次末端预测,输入为自然朗读的英语wh-疑问句音频,输出为按键预测的结束时刻及努力度与自信度,难点在于听觉退化下需提前利用微弱韵律线索而非被动等待静音。方法链分三步:先由青年南部英格兰男性以会话风格录制189个常识问句并预试均衡难度,输出难度相当的目标与填充问句集进入下一步。再用Praat提取并重合成句末基频轮廓,形成自然、增强与降低三种条件,输出仅基频峰高与下降起点不同的可比刺激进入下一步。最后通过在线按键任务采集相对题偏的速度与绝对距离的精度反应时并关联下降起点时长,输出速度与精度的条件差异进入解释。与既往以夸张基频峰值增强显著性改善识别的思路不同,本文假设压低末重音峰值并提前呈现语调短语边界低边界与延长下降更能提供早期预警,实际意义在于以语言结构对齐的早期线索促进预测而非增加显著性。在在线按键任务条件下,降低条件的速度反应时指标为193 ms,低于增强条件的速度反应时指标224 ms。该结论适用边界受限于安静下单说话人朗读问句与句末降调,主观评分触顶,且尚未验证噪声、多说话人、自发对话及经听力学确诊人群的外推,失败条件包括设备差异噪声与自报告听力样本偏差。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要解决的会话困难从何而来?
本解读的输入是 Speech Prosody 2026 的 1 篇初步探索论文,目标是让刚进入语音与听觉领域的研究生能核对方法并复述全流程。必须保留的信息包括被试筛选标准、问句材料构成、3 种基频条件的具体做法、在线按键任务的指示语与计时定义、速度与准确性的双指标、以及主要统计结果与限制,输出是 1 篇按学习依赖展开的中文技术解读。
听力损失者在对话中常表现出话轮时机延迟且变异更大。论文把可能原因之一指向对韵律性话轮结尾线索的可及性下降。外周听觉输入退化会削弱对音高轮廓的敏感性,老年性听力损失进一步限制了对韵律信息的利用,情绪韵律识别困难是另一个例证。中枢层面的老化还可能影响基频辨别等基础功能。作者引用 Fernandez 等人的预测框架,认为听力损失可能通过 3 条路径限制预测:认知负荷升高、可供预测的语言上下文被感知得很差、或优先使用替代策略如唇读。改善对结尾的预测或检测,被期望最终促进会话参与。
话轮转换 × 话轮结尾预测: 话轮转换指对话中说话人与听者交替发言的组织过程,分工是描述谁在何时接话;话轮结尾预测指听者在对方话语结束前利用语言和韵律信息提前判断结束点,分工是提供时间准备。两者搭配的理由是流畅转换依赖提前预测而非等停顿后再反应,组合意义在于把本研究的按键时间差解释为预测能力而非简单反应速度。
对初学者而言,关键是把预测与检测分开。检测是等声音停了再说停了,预测是没停之前就估计何时停。日常问答需要后者,因为组织回答需要提前准备发音。本研究用让被试在预期问句结束时按键的方法,直接测量这种提前量,而不是只测听懂了几个词。
相关路线如何看待音高峰与边界线索?
第一条路线关注夸张的基频轮廓是否有助于听损者。以往研究显示夸张轮廓可在噪声中改善言语识别。由此引出一个干预假设:把话轮末尾词的高音高峰做高、做突出,可能吸引注意并促进词识别,从而间接促进结尾预测。论文把这条路线操作化为增强条件,即只抬高末尾重读音节对应的峰。
第二条路线关注语调短语终结线索。Bögels 与 Torreira 系列研究表明,听者用语调短语边界线索投射话轮结尾,具体包括基频降低与末尾 lengthening。在他们的按键范式中,韵律完整刺激的反应快于句法完整但在短语中间截断的刺激;若把终结韵律拼接到多短语问句前半段,听者更易把延续误判为结尾。这说明边界韵律有因果性提示作用。论文把这条路线操作化为压低条件,即降低末尾峰并让下降更早开始。
两条路线在同输入、同目标、同运行阶段上形成对照:输入都是英语 wh 问句的末尾下降,目标都是更快更准地按键,运行阶段都是在线听句即时判断。区别在于监督信号不同,前者靠显著性吸引注意,后者靠符合语言结构的终结形态。本文同时检验两者,避免把任何一种音高改动都当作增强。
本文要回答的具体问题与预期是什么?
研究问题是:对自报有听力困难的听者,操纵话语末尾基频轮廓的 excursion 大小,是增强末尾重读峰还是压低峰并延长下降,更能改善话轮结尾预测。实验使用以末尾下降结尾的问句,要求被试在自然、增强、压低 3 种韵律条件下,在预期问句结束的时刻按键,同时收集听觉努力与听觉信心评分。
作者的假设是操纵条件都应比自然条件更快更准,即反应时更早且更贴近真实偏移;若预测受损与认知需求相互关联,提供韵律支持还应降低任务消耗的认知资源并提高信心。教学上要注意这是一个有方向的预期,但结果只部分支持压低条件,另一方向出现反转,因此不能把假设当结论复述。例子:如同给下坡路提前立警示牌,压低条件相当于提前出现下坡,而增强条件相当于把坡顶垫高,听者反而要多花时间判断何时真正下完。
方法全景:从一句话样本走完输入到输出
沿样本 What is the name of a planet 走一遍。输入是青年英格兰南部男性 talker 以自然会话方式录制的常识 wh 问句,末尾词 planet 为双音节且重音在首音节,整体为 wh 问句常见的末尾下降。表示是提取出的基频轨迹,做法是先在 75–600 Hz 宽范围初估,再按初估调整窄范围 2 次提取,以减少八度错误并得到更平滑可靠的轮廓。组件是对末尾词对应峰的两种改法,自然条件不改作为基线,增强条件抬峰,压低条件降峰并提前下降,再经 Praat 重合成可播放问句。目标是被试听完整问句并在预期结束时按 Stop 键,输出是按键时刻与问句偏移的时间差,以及随后的努力评分、信心评分与键入的问句答案。
基频 × 音高重音: 基频指声带振动频率在听觉上对应的音高轨迹,分工是提供连续可操纵的声学变量;音高重音指与重读音节绑定的音高事件如本文末尾词上的 H*,分工是把基频运动锚定到语言结构上。搭配理由是只改基频数值而不锚定到末尾重读音节就无法解释为何提前下降会被当作边界,组合意义在于增强与压低两种操纵都围绕同一个末尾重音峰进行。
为理解 3 种轮廓的形态差异,需要先读懂基频随时间变化的面板。下面这张图是方法部分的核心证据,它把同一句话的 3 种重合成轨迹画在一起,并标出末尾词起点与各自峰点。
看图路径: 1. 先看横轴时间与纵轴 F0 单位,确认这是 What is the name of a planet 一句的末尾段;2. 对比黑色自然、绿色增强、红色压低三条轨迹在虚线后峰高与下降起点的差异;3. 找到每条轨迹上的实心峰标记,确认增强峰最高、压低峰提前且贴近终点低值;4. 注意 of a 附近红色小隆起,核对正文说它不构成可感知的重音
论文图 1。原论文 Figure 1:“f0 contours for the natural (black circles), enhanced (green squares), and reduced (red diamonds) conditions.”。
上图显示横轴为时间,单位为秒,纵轴为基频,单位为赫兹,底部标注了 What is、the name、of a、planet 4 段,垂直虚线标出末尾词起点约 1.0 秒处。黑色圆圈自然轨迹在 planet 重读音节处有约 118 赫兹的蓝色实心峰,随后逐渐下降至约 75 赫兹;绿色方形增强轨迹从 of a 末尾抬升至约 156 赫兹的实心峰再陡降;红色菱形压低轨迹的峰提前到 of a 段约 110 赫兹处,planet 段则贴着 85 赫兹附近平缓滑落。图注说明 the 与 of a 处的高值由分段微扰造成,不应解读为重音。教学要点是增强只改变峰高而不提前下降起点,压低则同时降低峰高并把下降起点提前到末尾词之前约 210 毫秒,这是后文速度效应的形态基础。
语调短语 × 语调短语终结线索: 语调短语指由完整语调轮廓界定的韵律单位,分工是划分话语的韵律边界;语调短语终结线索指边界处的基频降低与末尾 lengthening 等信号,分工是告诉听者此处可能是完整结束。搭配理由是 Bögels 与 Torreira 的工作表明听者用边界线索投射话轮结尾,组合意义在于本文压低条件正是通过降低峰高并提前下降来提前给出终结线索。
组合机制的白话总结是:末尾重音峰决定改哪里,语调短语边界决定改成什么样。增强让峰更像强调重音,边界感推迟;压低让峰接近说话人低音区,下降更像终结。作者还做了自然度预试,19 名同类人群在 1 代表很自然、9 代表很不自然的量表上评分,自然为 2.1、增强为 2.1、压低为 2.4,经 95% 等价检验认为三者感知自然度相当,因此后文差异不易简单归因于人工感。
两种操纵具体怎么做:抬高多少、压低到哪里?
增强条件的操作对象是末尾重读峰。做法是相对原值提高 5 个半音,峰周围向前 200 毫秒渐升、向后 300 毫秒渐降,若不足 200 毫秒则从首个可用采样点算起,向后不足则延至问句结束。效果是听感上比自然对应物更强调,但下降起点仍在末尾词重读音节。
压低条件的操作更复杂。先把末尾高音高峰降到仅比问句末尾基频值高 10% 的位置,峰与终点之间的值按比例压缩以保留相对起伏,但不低于终点值低 1% 以上以免过度掉音;峰前 200 毫秒平滑下斜衔接。重合成后保留 of a 前的小上升与末尾词上的降阶高重音,但感知音高接近说话人低区,且作者明确指出该小上升不构成末尾词前的可感知重音。关键后果是下降起点提前到末尾词之前,而非从末尾重读音节开始。
定位峰的方法也需复述。先经听觉与波形、语图、基频轮廓目视检查确定末尾词起点,再用迭代峰检测在末尾词内找最大基频,且前后各一点在正负 8 赫兹容限内。提取重合成用 Praat 6.4.26,操纵在 MATLAB 完成。复现时必须保留这些容限与斜坡时长,否则峰位置与下降斜率会系统偏移。
本研究有无模型训练:实际计算过程是什么?
本研究没有训练任何神经网络,也没有更新声学模型权重,因此不存在优化器、梯度路径、冻结层或早停等训练要素。若按训练节的要求表述,就是训练阶段为空,方法职责由刺激构造、重合成与行为测量承担。
真实计算过程分为 4 步。第一步是材料筛选:用 20 名同类人群口头回答并在 7 点量表评分,只保留反应时与评分落在中位数四分位区间内的问句,144 个单分句目标问句中双音节与三音节末尾词各 72 个,另加 45 个双分句填充问句每表 15 个。第二步是基频提取与操纵,如前所述的双轮提取、峰检测与斜坡重塑。第三步是在线行为采集:NOTE 平台呈现,先 100 毫秒 1 千赫提示音加 400 毫秒静音再播问句,音频播完才停,记录 Stop 键时刻。
第 4 步是统计:对被试内 3 条件的中位数反应时做 Friedman 检验,再用 Wilcoxon 符号秩配对比较并做 Bonferroni 校正,另对下降时长做 Spearman 秩相关。缺项是原文未报告重合成声码器细节与在线端计时精度校准数据,复现时只能说明使用 Praat 默认重合成流程并接受浏览器计时噪声。
被试、分组、流程与指标如何保证可比?
被试经 Prolific 招募,纳入 36 人,21 名女性,平均年龄 61.3 岁,预筛要求 55–75 岁、居住英格兰、英语为母语的英国人且自报听力困难。另招 5 人因筛查失败剔除,其中 2 人报威尔士国籍、3 人自评听力很好,另有 2 人因异常反应剔除。预试另有 20 人做难度平衡、19 人做自然度评定,平均年龄均为 64.3 岁左右。资源状态方面,论文未绑定经 HTTPS 验证的代码、模型或数据资源,因此不得声称材料或代码已公开,复现需按描述重新录制与构造。
分组采用被试内轮转。144 个目标问句分三表,系统轮转分配到 3 种韵律条件,每名被试每条件遇到三分之一目标问句,每个目标只出现 1 次,每表双音节与三音节末尾词数量相等。实验分 3 组块,每块 63 试次,含每条件 16 个目标加 15 个填充,块内随机,仅首试次固定为填充以吸收在线计时初试误差。设备要求用扬声器舒适音量、安静环境,不允许戴耳机。
下面这张表把材料与被试规模放在一起核对,阅读时先确认总体试次与分组均衡,再看操纵量级是否可重放。
| 条件与材料 | 指标与口径 | 自然基线 | 增强做法 | 压低做法 |
|---|---|---|---|---|
| 目标问句总量与结构 | 单分句目标 144 句,双音节与三音节末尾词各 72 句 | 末尾下降 wh 问句,未改基频 | 末尾重读峰提高 5 个半音 | 峰降至仅比末尾值高 10% |
| 填充问句总量 | 双分句填充 45 句,每表 15 句 | 仅用自然语调,引入延续变异 | 不用于目标操纵 | 不用于目标操纵 |
| 被试规模 | 纳入 36 人,21 名女性,平均 61.3 岁 | 55–75 岁英格兰英语母语自报困难 | 剔除筛查失败 5 人 | 剔除异常反应 2 人 |
| 预试规模 | 难度预试 20 人,自然度预试 19 人 | 难度保留中位区间,自然度 2.1 分 | 增强自然度 2.1 分 | 压低自然度 2.4 分 |
| 实验块结构 | 每块 63 试次,每条件 16 目标加 15 填充 | 首试次固定填充 | 块内随机呈现 | 音频播完才停 |
上表的主要价值是确认公平比较条件:每名被试都经历 3 种条件且材料轮转,填充问句只用自然语调以防被试学会单一结尾模式,自然度评分接近排除了人工感主导效应的简单解释。代价是安静下扬声器播放与无噪声设计使任务偏易,后文主观评分触顶即与此有关,未胜出项是增强条件虽更突出却未带来优势。
听觉努力 × 听觉信心: 听觉努力指被试自评为听懂内容付出了多少力气,分工是估计认知资源消耗;听觉信心指被试自评确信自己听全内容的程度,分工是估计元认知层面的把握。搭配理由是预测困难理论认为预测受损与认知负荷相互关联,组合意义在于作者希望检验韵律支持是否同时降低努力并提高信心,但安静条件下两者均触顶而无法检验。
指标定义必须精确。速度是有符号差,正值表示按晚于偏移,负值表示按早;准确性是该差的绝对值,只看距离不看方向。努力题为你花了多大力气听懂所说内容,信心题为你确信自己完全听对的程度,均用 1 到 10 量表,1 为很费力或完全没信心,10 为毫不费力或很有信心。键入的问句答案仅用于保证理解与注意,不进入正式分析。
主结果:哪种改动更快更准、数字差多少?
主分析只用反应时,因为努力与信心在安静条件下触顶。分析对象是被试中位数以抵抗偏态,极端离群用四分位法剔除,整体用 Friedman 检验,配对用 Wilcoxon 符号秩并做 Bonferroni 校正。结果显示速度与准确性均随条件显著变化,速度卡方为 6.17、准确性卡方为 17.06。事后比较中,压低比增强显著更快更准,自然比增强显著更准,自然与压低之间数值上有利压低但未达显著。换言之,提前下降优于垫高峰,而垫高峰反而损害对齐。
要读懂分布形态,需同时看直方图与中位数连线。下面这张图左列为速度、右列为准确性,上三行为 3 条件分布,底行为中位数。
看图路径: 1. 先区分左列速度为有符号分布、右列准确性为绝对值分布,横轴单位均为毫秒;2. 逐行对比自然、增强、压低三行的直方图峰位置与尾部拖长;3. 再看底部 D 面板三条件中位数连线,确认增强最高、压低最低的 V 形;4. 结合纵轴计数判断样本量大但偏态明显,理解为何用中位数与非参数检验
论文图 2。原论文 Figure 2:“RT distributions (left: speed; right: accuracy) for the (A) natural, (B) enhanced, (C) reduced conditions. The bottom panel (D) displays the median RTs for each condition.”。
上图左列速度分布以零附近为中心近似对称,存在早按到负 1000 毫秒与晚按到 2500 毫秒的长尾;右列准确性分布为从零开始的右偏形态,多数集中在数百毫秒内。底行 D 面板显示速度中位数自然约 215 毫秒、增强约 224 毫秒、压低约 193 毫秒,准确性中位数自然约 264 毫秒、增强约 293 毫秒、压低约 253 毫秒。教学判断是纵轴为计数而非性能,曲线向右不直接等于变差,需结合速度看方向、结合准确性看距离;像素不能精确读出每个柱的计数,不硬写柱值,只复述原文报告的中位数与检验结论。
反应时速度 × 反应时准确性: 反应时速度指按键时刻减去问句偏移的有符号差,分工是反映多早做出承诺,负值偏早、正值偏晚;反应时准确性指该差值的绝对值,分工是反映预测与真实结尾贴得多紧。搭配理由是早按不一定准,准也不一定早,必须分开才能发现提前下降主要加快承诺而不一定同等收紧对齐,组合意义在于本文同时报告两者并用中位数抵抗偏态。
下面这张表把核心数字与统计放在同一行,便于核对基线、策略与方向,比较时注意速度与准确性单位同为毫秒但含义不同,百分点与百分比在此不适用。
| 测量问题 | 指标与方向 | 自然条件 | 增强条件 | 压低条件 |
|---|---|---|---|---|
| 按得多早 | 速度中位数,越小越早 | 215 ms | 224 ms | 193 ms |
| 贴得多紧 | 准确性中位数,越小越贴近偏移 | 264 ms | 293 ms | 253 ms |
| 整体是否随条件变化 | Friedman 检验,小 p 支持有差异 | 速度 p 为 0.046 | 准确性 p 小于 0.001 | 卡方速度 6.17 准确性 17.06 |
| 压低相对增强 | 配对比较,负 Z 支持压低更优 | 速度 Z 为 -2.94 | 准确性 Z 为 -3.68 | 速度 p 为 0.008 准确性 p 小于 0.001 |
| 自然相对增强 | 配对比较,负 Z 支持自然更优 | 速度差异不显著 | 准确性 Z 为 -2.53 | 准确性 p 为 0.03 |
上表的主要收益是压低相对增强同时改善速度约 30 毫秒量级与准确性约 40 毫秒量级,自然相对增强也显著更准,说明垫高峰引入不确定性。具体代价是自然与压低差异未达显著,自然与增强速度差异也不显著,因此不能声称压低全面显著优于自然。未胜出项是增强条件,它在两指标上均为最差,直接反驳了越突出越好预测的直觉。
下降时长能否解释加速:相关分析做了什么?
为检验压低优势是否来自下降起点提前,作者做了下降时长与反应时的 Spearman 秩相关。自然条件的时长从末尾词峰到问句结束,压低条件的起点从其前面的最近局部极大算起,要求最小突出度 6 赫兹,在示例中落在 of a 段,平均比末尾词起点早 210 毫秒。只用自然与压低数据以保证峰高为自然高度,若加入增强数据相关会增强但引入非自然峰高,因此主结论不用增强数据。
结果显示速度呈弱负相关,相关系数为负 0.13 且显著,准确性呈弱负相关但不显著,相关系数为负 0.05。这支持下降越长按得越早,但不保证贴得更紧。作者的有限解释是提前线索像早期预警,提供更多时间准备预测,但精调对齐还需句法等其他线索。教学上要强调相关不是因果,且系数绝对值小,不能把全部加速归因于时长。
反证方面,增强与压低效应方向相反,说明结果不是人工重合成本身所致,否则两种人工条件应同向偏离自然。作者提出一种可能机制:英语常人听者倾向把末尾词高重音解读为延续、低重音解读为结束,垫高峰可能引发犹豫或混淆。但该机制在本文听损样本中未直接验证,应表述为待验证解释而非报告事实。
哪些边界未被测到:在线、样本与安静条件的代价?
第一,在线实验引入计时变异且对实验环境控制有限。作者采用被试内设计且浏览器内延迟相对一致,但设备间变异仍会增加噪声。复现时应记录浏览器、设备与采样率,并保留首试次填充的做法,不承诺实验室级毫秒精度。
第二,样本依赖自报听力而无正式听力学评估,可能不能完全代表典型老年性听力损失人群。年龄集中在 60 岁上下,英语为母语且居住英格兰,推广到其他语言、其他年龄或助听设备使用者需另行验证。
第三,刺激为安静下孤立问句、无背景噪声,加工需求小,主观评分触顶,任务可能比预期容易。这会掩盖更细微的操纵效应,也使努力与信心假设无法检验。作者指出真实对话常在噪声中进行,提前线索的好处可能在噪声中更明显,但本文未测量噪声条件下的误判率、延迟或认知负荷改善,不应承诺这些量已改善。
第四,操纵仅针对基频,未改时长与强度等边界线索,且只用 wh 问句的末尾下降。结论限于基频下降起点与峰高的权衡,不适用于所有韵律增强手段。
复现先做什么:材料、参数与分析清单
先重建材料。按 144 个单分句目标加 45 个双分句填充的规模准备常识 wh 问句,末尾词双音节与三音节各半且重音在首音节,均为末尾下降;另找同类人群做难度预试,只保留反应时与评分落在中位区间的问句。录制用自然会话风格,单 talker 即可起步,多 talker 留待扩展。
再实现操纵。基频提取用两轮自适应流程,宽范围 75–600 赫兹初估再窄范围复估;末尾词起点经听辨加波形语图确认;峰检测用末尾词内最大值且前后各一点在正负 8 赫兹内。增强提高 5 个半音,前 200 毫秒渐升、后 300 毫秒渐降。
压低降至仅比终点高 10%,中间值按比例压缩且不低于终点低 1% 以上,前 200 毫秒平滑衔接。重合成后做自然度等价检查,自然与增强约 2.1 分、压低约 2.4 分量级可作参考,但不必强求完全相等。
行为与分析按原文搭建 NOTE 或等价在线流程:提示音 100 毫秒 1 千赫加 400 毫秒静音,指导语为你预期说话人讲完时尽快按 Stop,音频播完才停,随后 1 到 10 量表评努力与信心并键入答案。分三块每块 63 试次,每条件 16 目标加 15 填充,首试次固定填充。分析取被试中位数,用 Friedman 加 Wilcoxon 配对并做 Bonferroni 校正,显著阈按校正后 0.017 理解配对结果,同时报告速度与准确性双指标。若资源允许,补做正式听力评估与噪声条件,并记录设备与浏览器以评估计时噪声。
何时值得尝试这种压低思路:收束判断
当目标是帮助听损者在问句末尾更快做出接话准备,且能接受轻微重合成时,值得尝试压低末尾峰并提前下降的思路,因为它在本文中比垫高峰更快更准,且自然度未明显受损。当目标是提高词显著性或噪声下识别时,不应直接套用本文结论,因为增强峰在识别任务中的好处不等于在时机预测中的好处,本文恰显示垫高峰损害对齐。
复述要点是:早期符合语言结构的边界线索比单纯突出更有用,下降起点提前约 200 毫秒量级可作为首个可调参数,评估必须同时看速度与准确性。未验证部分是长期对话效果、噪声下收益与助听器链路中的实时实现成本,需补验证后再谈部署。本文作为初步探索,其价值在于指出了一个有潜力的干预方向,而非给出可直接上线的增强算法。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 17 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

