英文题目:Linguistic Complexity Modulates Pitch Variability in 3-5-Year-Old Mandarin-Speaking Children
会议身份:
conference:speechprosody:2026:conference-paper-id:chen26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:5.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Lu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Aijing Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为3至5岁普通话儿童自发对话中的陈述句语音与转写文本,输出为基音频率派生的句内Pitch Range与Pitch SD,难点在于声调词汇功能与语调结构功能共享同一音高通道,且认知负荷与运动控制成熟度共同干扰变异解释。筛选ChildMandarin语料中45名轻微口音儿童每人30句共1350句并以平均话语长度等验证组间发展阶段差异后,用Praat自相关算法提取F0并计算极差与标准差,其输出直接进入下一步复杂度计算。接着用spaCy分词与依存分析得到平均词数、异词数与句法树深度及生产性句法与发展性句子评分近似值并以第一主成分解释59.32%方差构成句法综合指数,最后用以被试为随机截距的线性混合效应模型检验复杂度与年龄交互并以emmeans做简单斜率分解。相对已有在非声调语言中争论高负荷压缩或扩张的机制,本研究利用普通话高功能负荷情境同时检验节约、唤醒与权衡预测,揭示音域扩张与标准差稳定分离的权衡意义。在ChildMandarin语料任务下,4岁组相对3岁组的Pitch Range指标为-2.07,低于5岁组相对3岁组的Pitch Range指标-1.99。该结论适用边界限于5至12字陈述句自发对话场景,疑问句与朗读任务及纵向个体发展轨迹尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么普通话儿童的音高问题值得单独研究?
这篇论文的输入是 3 到 5 岁普通话母语儿童在日常对话中自然说出的自发陈述句,目标是检验当句子变长、用词变多、结构变难时音高范围与音高稳定性如何变化。必须保留的信息包括样本量与年龄分组、声学指标定义、复杂度 3 维定义以及统计方法,因为缺少其中任何一项,后续的斜率方向与年龄差异都无法复述。输出是 1 篇能让研究生照着重做测量和建模的技术解读。
普通话的特殊性在于音高同时承担两份工作。用白话说,每个字的声调决定字义,而整句话的上扬或下降标记句式与意图,英文分别叫 lexical tone 和 intonation。儿童 2 岁左右已能把 4 个声调发得比较准,但这不等于他们能同时协调字调与句调。当句子变难时,计划要说什么与控制喉部肌肉发声会争夺有限的认知资源,这是理解全文的起点。
声调 × 语调: 声调分工是决定单个汉字意义的字词层面音高形状,语调分工是标记整句结构与交际意图的句子层面音高走向,二者搭配的理由是普通话用同一条基频曲线同时承载两种功能,组合意义在于儿童必须在发准字调的同时完成全句起伏,这正是本文把语言复杂度视为认知负荷来观察音高的原因。
生理背景也很重要。论文引用的证据指出 0 到 5 岁儿童已经拥有约 2.5 到 3 个八度的生理音高范围,因此早期的问题不是嗓子拉不开,而是能否在很宽的范围内保持精确稳定的控制。纵向证据显示音高稳定性随年龄提高,从波动走向稳定。初学者容易误以为 3 岁孩子音高变化大是因为嗓子小,这个误解需要先纠正,论文的立场是更多与神经运动控制成熟度和语言计划效率有关。
高负荷下音高会压平还是拉大?两条路线为何打架?
与本研究同输入同目标的路线主要有两条。第一条是资源节省路线,认为认知负荷升高时说话人会减少非必要的声学变化,表现为音高范围压缩与单调模式,目的是保住基本可懂度并节省加工资源。第二条是生理唤醒与补偿路线,认为高负荷激活交感神经或触发清晰化策略,说话人反而放大音高对比,听感上更夸张。两条路线都报告过声学参数随负荷发生稳健变化,但在音高变化方向上没有共识。
资源权衡 × 清晰化策略: 资源权衡分工是解释高负荷下计划系统挤占运动控制资源从而导致压缩或失稳,清晰化策略分工是解释高负荷下说话人主动放大对比以保可懂度,二者搭配的理由是同一批音高变大现象可以有节省资源与用力补偿两种相反机制,组合意义在于本文用年龄分化来判断哪种解释更符合普通话儿童的数据。
在儿童运动控制文献里,另一支证据更接近资源权衡。句长与句法复杂度上升时,儿童发音动作变异增大,对任务要求更敏感。当计划超出能力时,高层句法或语义目标可能以牺牲发音准确性或韵律精确性为代价实现。论文把这一点作为解释 3 岁组不稳定的候选机制。同时论文也承认另一种可能,即音高范围扩大可能只是生理唤醒的非自主反应,或者是运动系统在计划重压下被动失去精度。
区分主动策略与被动失稳需要同时看范围与稳定性两个指标,这正是本文设计两个因变量的原因。同运行阶段的对照还包括年龄趋势研究,已有 5 到 18 岁研究指出 5 到 8 岁是关键稳定期,基频标准差随年龄下降。本文把窗口前移到 3 到 5 岁,检验从不稳定到稳定的轨迹是否在更高语言负荷下更明显。相关工作不是用来比模型分数高低,而是用来定位本文增量,即在声调语言里同时检验长度、词汇、句法 3 个维度并用年龄交互判断转折点。
本文到底要回答哪两个可检验的问题?
论文把大问题拆成两个可检验的问题。第一个问题是语言复杂度是否预测音高范围,以及这种预测是否随年龄减弱。第二个问题是语言复杂度是否预测以音高标准差代表的不稳定性,以及这种影响是否只存在于最小年龄组。两个问题共用同样的自变量结构,但因变量不同,结论方向也可能不同。
举例说明只是教学例子:假设一个三岁儿童先说 5 个字的短句,再说 12 个字的长句,论文关心的是长句的最高最低差是否更大,以及整句音高是否更抖。例子不附带任何数值效果,真实数值必须来自原文的模型估计。任务类型是观察性建模,不是做语音合成也不是做识别,因此没有解码器与训练损失,只有测量加回归。
需要提前固定的术语是语言复杂度在本研究中的 3 维定义。长度维度是平均每句词数,词汇维度是不同词数即 Number of Different Words,句法维度是由依存树深度、生产性句法指数近似和发展句分近似经主成分分析合成的综合指数。声学侧的两个术语是音高范围与音高标准差,前者是句内最大值减最小值,后者是句内音高的标准差。后面所有结果都围绕这 3 乘 2 的结构展开。
从一句话到两个音高数字:全流程长什么样?
先沿着一个样本走完全程。输入是一句儿童自发说的陈述句,文本长度限制在 5 到 12 个汉字之间。研究者用 Praat 及其自相关算法提取基频,再以 1 赫兹为参考把赫兹值转成半音,使度量更接近听觉感知。然后对这句的半音序列计算两个数字,最大值减最小值得到音高范围,标准差得到音高标准差。与此同时,用自然语言处理工具对同一句文本计算长度、不同词数与句法综合指数。最后把声学数字当因变量,把复杂度数字与年龄组当自变量送入混合效应模型。
数据来源是 ChildMandarin 语料库,收录 3 到 5 岁母语儿童在日常对话中的无限制内容录音。本文选取 45 名儿童,每年龄组 15 人,性别平衡,只纳入轻微方言口音者以减少方言干扰。每人抽取 30 句有代表性的句子,共 1350 句。研究还用方差分析与事后检验确认 3 组在平均话语长度、词汇广度与句法复杂度上确有发展阶段差异,说明年龄分组能代表语言能力差异。
控制条件值得注意。只保留陈述句,排除疑问或感叹可能带来的句调混淆。文本长度控制在较窄窗口,避免过短无法估计变异或过长引入额外停顿。针对普通话第三声可能拉大音高范围的担忧,论文做了稳健性检查,把第三声比例作为协变量加入模型,发现主要结论依然成立。这一步是方法可信度的关键细节,复现时不应省略。
三个复杂度指标和两个音高指标各自怎么算?
声学组件的做法是先用自编 Praat 脚本批量提取基频,再转半音。转半音不是可有可无的装饰,它的理由是赫兹是物理频率而半音更接近人对音高距离的感知。音高范围的计算目标是捕捉一句之内的伸展幅度,音高标准差的计算目标是捕捉围绕均值的波动程度。两个指标配合才能区分拉大但稳定与拉大且抖动。
音高范围 × 音高标准差: 音高范围分工是刻画一句内最高与最低拉开的幅度,反映夸张或克制的外在伸展,音高标准差分工是刻画一句内音高围绕均值的离散抖动,反映控制是否稳定,二者搭配的理由是幅度大不等于不稳定,组合意义在于本文能区分主动拉大起伏的策略与控制不住的被动波动。
语言组件的做法是用 spaCy 做分词与依存分析。长度维度直接数词而不是数字符,理由是中文是语素文字,按词计数更符合语言计划单位。词汇维度用不同词数衡量多样性。句法维度比较特殊,它不是只用树深,而是把树深、生产性句法指数近似和发展句分近似 3 个分数做主成分分析,取第一主成分作为综合指数。原文报告第一主成分解释总方差的 59.32%,3 个载荷均为正,说明它们共享与句子计划相关的认知负荷。
句子长度 × 句法复杂度: 句子长度分工是度量一句话装载多少词与需要发声多长时间,直接关联呼吸支持与发音时长负担,句法复杂度分工是度量句子结构规划难度,关联词汇提取与结构组装的认知负担,二者搭配的理由是前者更偏生理执行负荷而后者更偏计划负荷,组合意义在于解释为何只有长度与年龄的交互最显著。
初学者常问为什么句法要合成一个指数。白话解释是单一树深容易受句子长短牵连,而临床常用的句法量表各有侧重,合成可以在保留共同计划负荷的同时减少单一指标的噪声。论文没有给出 3 个近似量表的完整手工计分过程,而是明确写了基于自然语言处理的自动近似,因此复现时应理解为近似实现而非临床原版量表。
没有神经网络训练时,这里的计算工作是什么?
本研究没有训练神经网络,也没有冻结或更新权重、梯度路径与优化器的说法。该节必须明确说明这一点,避免把统计建模误说成深度学习训练。真实的计算工作分为两块,一块是信号与文本的测量计算,另一块是线性混合效应模型的估计与检验。
测量侧的计算是确定性脚本加工具调用。Praat 负责基频提取与标准差,spaCy 负责分词、依存树深度与两个句法近似分数,主成分分析负责把 3 维句法信息压成 1 维综合指数。这些步骤没有学习参数需要拟合,但有可重放的软件版本与参数依赖,复现时需要记录 Praat 算法选择、半音参考频率与 spaCy 模型版本。原文未报告这些工具的超参数细节,这是具体缺项。
线性混合效应模型 × 被试随机截距: 线性混合效应模型分工是同时估计群体层面的复杂度与年龄效应,被试随机截距分工是允许每个儿童拥有自己的基线音高水平,二者搭配的理由是每人贡献 30 句且个体基线差异大,组合意义在于不把个体差异误读成复杂度效应,使斜率比较更可信。
模型侧的计算是用 R 的 lme4 包拟合线性混合效应模型,用 lmerTest 包判断显著性,用 emmeans 包做简单斜率与组间两两比较。因变量分别是音高范围与音高标准差,自变量是某一复杂度维度、年龄组及其交互,被试编号作为随机截距以吸收个体基线差异。对显著交互再分解到每个年龄组看斜率,并检验斜率差异。原文未报告随机斜率、残差分布检查或多重比较校正细节,这些也是复现时需要补记的缺项,不能从包名推定默认实现。
数据划分、指标方向和统计口径如何固定?
数据协议是每人多句、共一千余句的嵌套结构,不存在训练集测试集划分。聚合对象是句子,统计时以句子为观测,以被试为分组。指标方向需要提前讲清,音高范围越大表示伸展越大,音高标准差越大表示越不稳定。年龄效应以三岁组为参照,四岁和五岁分别与之比较。复杂度效应的方向看回归斜率正负,交互项看斜率是否随年龄变化。
公平条件是所有模型都控制被试随机截距,并在各自复杂度维度内比较年龄。3 个复杂度维度分别建模,而不是把三者同时塞进一个模型,因此对应长度、词汇、句法对音高范围与音高标准差的影响。这种分别建模的选择避免了三者高度相关带来的共线性,但代价是不能直接回答哪个维度独立贡献最大。
下表整理数据规模与采样口径的比较问题,公平条件是同一批被试与同一筛选规则,指标方向是句数越多估计越稳。表中总数、分组人数与每人句数均来自原文连续句,文本长度窗口同样有源可查。
| 条件 | 指标 | 总句数 | 总人数 | 每组人数 | 每人句数 |
|---|---|---|---|---|---|
| 自发陈述句采样 | 句子与被试规模 | 1,350 | 45 | 15 | 30 |
表后解释主要收益与具体代价。收益是每人句数相等且性别平衡,个体基线差异可由随机截距吸收,斜率比较更可信。代价是文本长度限制在 5 到 12 个汉字之间,结论不能直接推广到更长叙事或对话轮替。未胜出项是方言变异控制,只纳入轻口音者,意味着重口音儿童的声调实现差异尚未评测。
硬件预算、推理开销与帧率在原文中未报告,因为本研究不涉及实时系统。统计口径方面,原文报告的是回归系数与 p 值,没有报告效应量、置信区间数值或方差解释率。复现时应保留原文的小数精度与 p 值阈值写法,不自行四舍五入。百分点与相对百分比的区分在这里不适用,因为因变量单位是半音,斜率单位是每单位复杂度对应的半音变化。
复杂度越高音高拉得越开吗?年龄带来什么转折?
先看音高范围的主效应问题。论文报告 3 个复杂度维度都显著正向预测更大的音高范围,方向一致且显著性都很强。这意味着无论句子是变长、用词变多还是结构变难,儿童都倾向于把音高拉得更开。这个结果不支持高负荷下压缩音高以节省资源的预测,而更接近用力补偿或被动波动的预测,具体归因还需要结合稳定性结果判断。
下表整理主效应比较问题,在控制被试差异后,复杂度每增加一个单位,音高范围平均扩大多少半音。公平条件是 3 个模型各自只含一个复杂度维度加年龄,指标方向是系数越大表示拉开幅度越大。
| 条件 | 指标 | 长度模型斜率 | 词汇模型斜率 | 句法模型斜率 |
|---|---|---|---|---|
| 全年龄合并音高范围 | 每单位复杂度对应半音增量 | 0.45 | 0.45 | 0.55 |
表后解释需要同时讲收益与代价。主要收益是 3 个维度方向一致,说明结论不是某个指标的偶然。代价是分别建模不能比较维度间相对重要性,且句法综合指数的单位不如词数直观,数值不能直接比较大小。未胜出项在这里体现为没有哪个维度出现负向或不显著,模型的区分力完全靠后面的年龄交互实现。
再看年龄主效应与长度交互问题。控制复杂度后,四岁组比三岁组显著更窄,五岁组呈现边缘显著的更窄趋势,整体随年龄收缩。这支持随生理成熟和控制成熟语调走向更平更稳的纵向文献。教学上要强调这是截距差异,不是斜率差异,即在相同复杂度下,年长儿童起点更窄。最关键的转折是长度与年龄的交互,简单斜率显示三岁组最陡,五岁组最平缓,且五岁交互项显著为负。
| 条件 | 指标 | 四岁相对三岁 | 五岁斜率 | 五岁交互项 | 三岁斜率 |
|---|---|---|---|---|---|
| 长度预测音高范围 | 半音组间与斜率 | -2.07 to -2.11 | 0.30 | −0.47 | 0.77 |
表后解释要讲清支持的判断与限制。支持的是生理负荷假说在长度维度成立,词汇句法维度交互未达显著,不能推广为所有复杂度都随年龄减弱。反例是如果只看截距会误以为年长儿童音高完全压平,但斜率结果显示他们在高复杂度下依然扩大范围,只是起点更低扩张更缓。未评测边界包括停顿、语速与呼吸参数未测量,因此长度效应的生理机制仍是推断而非直接验证。
下段是图 1 的导读,聚焦左右两大面板如何同时呈现范围与稳定性的分化。左侧三幅横轴分别是长度、词汇与句法,纵轴是音高范围,右侧三幅横轴相同,纵轴是音高标准差,3 条线分别代表三岁、四岁与五岁,阴影为估计不确定性。读图前必须先确认线型与年龄的对应,再比较斜率方向。
看图路径: 1. 先看左侧长度、词汇、句法三幅中红色 3 岁实线是否比蓝色 4 岁虚线和绿色 5 岁点线更陡;2. 再看右侧三幅中红色 3 岁线是否向上走而蓝色与绿色线是否走平或向下;3. 对照横轴标签确认长度、词汇多样性与句法复杂度是三个独立维度;4. 注意高复杂度端阴影带变宽,说明高负荷下估计不确定性增大
论文图 1。原论文 Figure 1:“Interactive Effects of Linguistic Complexity”。
解释段针对可见内容展开。左侧三幅中红色三岁实线上升最陡,尤其在长度面板从低到高拉开明显距离,蓝色四岁虚线与绿色五岁点线上升较缓但仍向上,说明扩张效应跨年龄存在但强度递减。右侧三幅中红色三岁线在 3 个维度都向上走,而蓝色与绿色线基本走平甚至在词汇面板略向下,说明不稳定性只在三岁组随复杂度上升。像素不能精确读出每一步的半音数值,因此具体斜率仍以正文回归数字为准,图只用于判断方向与分化。同时可见高复杂度端阴影变宽,提示高负荷下估计更不确定,这是讨论个体差异时的重要视觉证据。
稳定性结果和稳健性检查能否排除声调混淆?
稳定性模型的主效应不显著,但交互呈现清晰的年龄分化。三岁组 3 个维度的简单斜率均为正且显著,说明复杂度越高抖动越大。四岁和五岁组的交互项为负,斜率接近零且不显著,说明从四岁起复杂度不再系统影响稳定性。两两比较显示四岁与五岁斜率差异不显著,而三岁与五岁在长度和词汇上差异显著,句法上不显著。这支持从不稳定到稳定的转折发生在三到四岁之间。
下表整理稳定性与句法合成透明度的比较问题,公平条件是同一批句子与同一被试结构,指标方向是标准差斜率为正表示更抖,为零表示保持稳定。表中三岁斜率与四至五岁交互区间均有原文连续句覆盖,句法主成分解释率与载荷同样有源。
| 条件 | 指标 | 三岁斜率 | 四至五岁交互区间 | 主成分解释率 |
|---|---|---|---|---|
| 复杂度预测音高标准差 | 半音离散变化 | 0.12 | −0.13 to −0.14 | 59.32% |
表后解释要讲清代价与反例。主要收益是 3 个维度在稳定性侧也一致指向三岁脆弱、四岁后稳定。代价是交互项显著性落在边缘区间,证据强度弱于范围侧。反例是句法维度的三岁与五岁差异不显著,说明句法对稳定性的年龄分化不如长度和词汇干净,不能把转折说成在所有维度同等清晰。
稳健性检查针对第三声混淆。普通话第三声本身有先降后升的曲折,可能天然拉大范围与标准差。如果长句或难句恰好含更多第三声,复杂度效应可能是声调成分的假象。论文把第三声比例作为协变量加入混合模型,发现主要结论依然稳健。这是论文特有的第二类细节,必须单独强调。未测量的是具体声调组合、焦点位置与语速,这些仍可能影响音高,复现时应记录并在局限中承认。
哪些结论还只是相关,哪些边界尚未评测?
首先区分报告、支持与推测。论文直接报告的是回归系数方向、显著性与斜率差异,这些是有数字支撑的。论文支持的是资源权衡解释,即三岁因计划挤占控制资源而变抖,四至五岁因效率提高而保持稳定,这种支持来自范围与稳定性分化的组合模式。论文的推测是把长度交互归于呼吸与肌肉负担、把词汇句法归于计划负荷,这些机制未直接测量呼吸、肌电或反应时,因此只能写可能或待验证,不能写成因果。
相关性不是因果的提醒在这里很具体。复杂度与音高的正相关不能证明是儿童主动选择夸张策略,也可能是唤醒或失稳的副产品。论文用四至五岁稳定性改善来反驳纯唤醒解释,理由是同样任务下年长组并未更抖,但这仍是间接证据,不是操纵唤醒的实验。
未评测边界包括纵向追踪缺失、语速停顿未控制、焦点与信息结构未标注、误判率延迟成本未测量。本文是横断面比较,推断的发展轨迹需要纵向数据验证。混合模型只控制被试随机截距,未纳入随机斜率与声调序列细节,未来声学实验需要更细的控制。训练资源与推理延迟的讨论不适用于本研究,不应承诺任何效率改善。
要重做这项研究,先做什么、记什么?
复现的第一步是重建数据管道。从 ChildMandarin 获取三到五岁日常对话录音,按每年龄 15 人、性别平衡、轻口音筛选。每人选三十句陈述句,文本控制在较窄汉字窗口,记录筛选规则与剔除原因。用 Praat 自相关法提取基频,以 1 赫兹为参考转半音,逐句计算范围与标准差,保存最大值最小值以便核查异常值。文本侧用 spaCy 做分词与依存分析,计算每句词数、不同词数与树深,再按原文思路近似计算句法分数并做主成分合成,记录第一主成分解释率与载荷以对照原文报告。
第二步是重建统计管道。用 lme4 分别对范围与标准差拟合复杂度加年龄加交互的模型,被试随机截距必备。用 lmerTest 取显著性,用 emmeans 做简单斜率与两两比较。先复现 3 个主效应为正,再复现四岁截距显著更窄、五岁边缘更窄,再复现长度交互显著而词汇句法交互不显著,最后复现稳定性只在三岁显著。第三声比例协变量检查必须重跑,确认结论稳健。
资源状态必须如实说明。本次未发现来源绑定且完成安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。ChildMandarin 在参考文献中有预印本信息,但本次没有可用性验证,不能写当前可用或已公开。复现者需要自行确认获取路径与版本,并保留关键软件版本、随机种子与剔除日志,才能让他人可核对。
何时值得借用这套方法,记住什么、忘掉什么?
当研究问题是语言难度如何改变语音实现时,这套 3 维复杂度加双音高指标加年龄交互的设计值得借用。它的优点是 1 次区分幅度与稳定性,避免把夸张等同于失控。适用条件是声调语言或需要同时处理局部与全局韵律的场景,以及每人有多句重复观测、个体基线差异大的数据。此时被试随机截距与简单斜率分解是必备动作。
需要记住的关键超参数与信息条件是句子长度窗口、每人句数、半音参考频率、复杂度定义与分别建模的选择。需要忘掉的是把横断面斜率直接当成个体成长曲线,以及把边缘显著当成确证。总体趋势不等于每组每步都成立,句法维度的年龄分化就弱于长度维度。
对论文特有的误解要用自然段澄清。误解一是三岁音高范围大等于嗓音条件好,实际上论文强调生理范围早已很宽,大范围更多是补偿计划与表达局限的策略性选择。误解二是音高拉大一定是进步,实际上三岁的拉大伴随标准差上升,代价是稳定性下降,而四至五岁的进步体现在拉大但不抖。误解三是压缩策略普适,实际上本研究不支持高负荷压缩的预测,至少在自发陈述句与当前负荷范围内,扩张才是跨年龄的一致方向。
还需补的验证包括纵向追踪、呼吸语速控制、焦点标注与声调序列精细建模。只有补上这些,才能把资源权衡从得到支持的解释推进为更接近因果的结论。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
另有 16 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

