英文题目:Profiling Speech Rate Abilities of Visually Impaired Screen Reader Users by Bayesian Item Response Theory
会议身份:
conference:interspeech:2026:conference-paper-id:miura26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#心理测量 #主观评测 #言语感知 #语音 #语音可懂度评估
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Takahiro Miura:机构信息未能从会议 PDF 纯文本可靠映射
- Masatsugu Sakajiri:机构信息未能从会议 PDF 纯文本可靠映射
- Masaki Matsuo:机构信息未能从会议 PDF 纯文本可靠映射
- Keiichi Yasu:机构信息未能从会议 PDF 纯文本可靠映射
- Junji Onishi:机构信息未能从会议 PDF 纯文本可靠映射
- Ken-ichiro Yabu:机构信息未能从会议 PDF 纯文本可靠映射
- Tohru Ifukube:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理日语视觉障碍屏幕阅读器用户的合成语音语速理解评估,输入为150 WPM至500 WPM合成的音素平衡句,输出为可懂度与听辨能力的人物能力估计与项目难度分离。方法链分三步推进:先用ITA语料库语句在多语速下采集复述准确率与主观评分,再以贝叶斯累积probit模型与贝叶斯Beta回归分别建模有序评分与有界百分比,最后从随机效应抽取能力参数并用回归检验视力状态与使用经验的作用。与传统准确率混淆项目难度和个体能力的做法不同,该框架将二者置于同一潜在量表并用后验区间显式表达小样本不确定性。在ITA语料朗读句评测设置下,150 WPM条件的准确率为99.4%,高于500 WPM条件的准确率74.0%。该结果受限于小样本后验不确定性,表明语速提升系统性压低理解表现,而个体能力方差仍是主导差异来源。结论仅适用于有经验的日语用户与朗读体短句,尚不能外推至新手、自然阅读材料或音节语言。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?为什么读屏语速不能只看平均正确率?
本解读的输入是 Interspeech 2026 论文原文证据,研究对象是 11 名日本视障读屏用户在 150 到 500 WPM 合成语音下的句子理解。目标读者是刚进入语音、音乐、音频领域的研究生,目标是把方法复述到可核对的程度。必须保留的信息包括被试构成、42 句 ITA 语料与 5 档语速的构造、3 类因变量的定义、贝叶斯累积 probit 与 beta 回归的建模分工、先验与采样设置、收敛指标、能力与难度的关键数字,以及全盲与弱视比较和听速经验回归的限定结论。输出是 1 篇按学习依赖展开的中文技术解读,不做超出证据的效果承诺。
任务的起点是读屏器的语速配置。论文指出全球有超过 2.85 亿视觉损伤者,日本约有 30 万重度视觉损伤者,读屏器把屏幕文本转成合成语音,是数字接入的关键工具。熟练用户能听懂每分钟 1400 到 1500 莫拉、约 400 到 500 WPM 的极快语音,远高于约 150 WPM 的日常会话速度。问题在于个体差异很大,现有读屏器只提供手动调节,没有基于证据的个性化指导。
只看平均正确率会把两件事混在一起。一句没听对,可能是这句在该语速下本身很难,也可能是这个人当前理解能力较低。论文举例的逻辑是,80 分可能来自高能力者做难题,也可能来自中等能力者做容易题,这对个性化是完全不同的情境。更麻烦的是,大多数研究集中在英语,日语是莫拉节拍而非音节节拍,文字系统也不同,因此需要针对日语合成语音与语速理解建立能分离题目难度和人的能力的框架。
已有路线研究了什么?为什么还需要项目反应理论?
第一条路线是读屏语速感知研究。论文回顾 Asakawa 等人报告熟练日本用户最高听速达 1400 到 1500 莫拉每分钟,Dietrich 等人用功能磁共振发现早期盲人在超快语音理解中动用了视觉皮层,提示跨模态可塑性。Guerreiro 和 Gonçalves 研究双语音并发呈现,发现视障被试在约 278 WPM 时扫描理解较好。Bragg 等人用 990 人的大规模研究确认视障群体的舒适听速显著高于明眼人,但个体差异仍然很大。这条路线确立了视障用户能听懂远超会话速度的合成语音,但没有系统量化句子难度与个人能力的关系,也没有给出基于用户特征的个性化配置框架。
第二条路线是语音评估中的项目反应理论。Ng 等人用 Rasch 模型开发粤语识别测试,说明心理测量学选题目能提高可靠性。Brackenbury 等人用双参数 logistic 模型做构音筛查,找出难度和区分度合适的音素。但这些工作没有用于语速理解或语音合成评估。传统项目反应理论用极大似然估计,一般需要 200 人以上的大样本,这对视障这类特殊小群体很困难。
第三条路线是贝叶斯项目反应理论。论文引用 Stan 与贝叶斯项目反应理论的工作,指出通过正则化先验可以在小样本下得到更稳定的估计,并用后验分布显式表达不确定性。弱信息先验例如标准差上的正态分布可以在防止过拟合的同时让有信息的 data 主导推断。这正是本研究选择贝叶斯路线的原因。研究提出两个问题:题目难度如何随 150 到 500 WPM 变化、个体理解能力差异有多大;全盲与弱视用户在语速理解能力上是否存在系统差异。
要回答的两个问题是什么?成功标准如何界定?
第一个问题是难度与能力的刻画问题。在 150、225、300、400、500 WPM 五档语速下,题目难度是否随语速上升,以及 11 人之间的能力差异是否大于语速带来的变化。成功不是报告某档语速的平均分最高,而是估计出每题难度参数和每人能力参数,并给出不确定性。如果能力方差大于语速固定效应,说明个性化比统一限速更重要。
第二个问题是群体差异与经验解释问题。全盲与弱视是否在 3 类测量上系统不同,以及这种差异能否被日常听速经验解释掉。成功标准同样不是只比较两组均值,而是把视觉状态和相对听速同时放入贝叶斯回归,看两者是否独立预测理解。如果全盲优势在控制听速后仍然存在,才支持超出习惯化的听觉处理解释。
本研究是概念验证性质。论文明确承认小样本导致可信区间宽,交互作用无法可靠估计,需要 200 人以上的大规模复制才能得出确定结论。因此解读中凡是相关性、组间差异和机制联系,都要按证据强度分别表达为报告、支持或待验证,不能把相关写成因果。
方法全景:从一句话音频到能力和难度参数经历了什么?
先沿一个样本走完全程。取一条 ITA 语料中的中等长度日语句子,用 macOS 说命令的 Kyoko 日语女声合成出 150 WPM 版本,保存为波形文件后通过网页界面呈现给被试。被试听完后立即复述该句,同时给出可理解性和可听性两个 1 到 7 分的评分。复述文本与原句逐词比对,再细化到莫拉级别,只有完全一致的莫拉才算正确,最后算出该句正确复述莫拉的百分比,范围是 0 到 100%。同一个句子与语速组合会被重复 3 次,全部被试共产生数千条反应。
然后进入建模。3 个因变量对应 3 个贝叶斯模型。可理解性和可听性是有序分类反应,用贝叶斯累积 probit 模型处理,它是等级反应模型的贝叶斯对应物,把有序评分看作来自连续潜能力的不同阈值切分。理解正确率是 0 到 100% 的有界连续分数,先变换到 0 到 1 区间,再用贝叶斯 beta 回归建模,因为 beta 分布天然适合有界连续数据。每个模型都包含人的随机效应和题目的随机效应,以及语速条件的固定效应。
最后输出参数。后验均值给出每人的能力西塔和每题的难度,每人的 95% 可信区间量化小样本不确定性,固定效应的后验判断语速和句长是否系统影响可理解性,贝叶斯回归再检验视觉状态和听速经验是否独立预测理解。整个流程没有训练神经网络合成模型,合成器是现成调用,学习发生的是贝叶斯推断中的后验更新。
核心组件如何分工?能力、难度和区分度各管什么?
论文用非专业读者可读的方式解释了项目反应理论的核心假设。每个人有一个潜能力西塔,例如理解能力。每道题有一个难度参数贝塔,反映这道题多难理解,还有一个区分度参数阿尔法,反映这道题区分高低能力者的效果。作答正确的概率被写作累积分布函数作用于区分度乘以能力减难度的形式。能力高于难度越多,答对概率越高。区分度越大,能力跨过难度时概率上升越陡峭。
这种写法的作用是把人与题放在同一潜变量尺度上。原始正确率无法区分语音太快还是人能力较低,而项目反应理论通过同时估计两组参数实现分离。对语音合成评估,这意味着可以将语速效应归于题目侧,将稳定个体差异归于人的侧,从而为不同用户推荐不同默认语速。
项目反应理论 × 能力与难度分离: 项目反应理论负责给出作答概率随人与题变化的生成规则,能力与难度分离负责把 1 次得分拆成谁更强和题更难两个来源,二者搭配的理由是原始正确率把两者混在一起,组合后可以在同一潜变量尺度上比较不同语速的题和不同用户,为个性化语速提供可比的依据。
本研究实际估计了 70 个题目的难度,对应 14 句乘以 5 档语速,以及 11 人在 3 类测量上的能力。论文报告难度参数与语速的题层面相关只有 0.16,说明不能只用语速预测每题难度,句子自身因素带来了很大变异。固定效应则揭示了平均趋势,可理解性在超过 300 WPM 后下降 1.2 到 2.0 个标准差单位,而人的能力标准差也在 0.91 到 1.10 之间,说明个体差异仍是主导因素。
没有神经网络训练时,什么在更新?先验和采样如何设置?
本研究没有训练语音合成模型,也没有训练听觉识别模型,必须明确说明这一点。实际调用的是 macOS 现有日语女声,参数标准化为波形格式、32 位浮点、44.1 千赫采样率。需要学习的全部是贝叶斯模型的后验分布,包括阈值参数、随机效应标准差、固定效应和 beta 回归的精度参数。更新机制是哈密顿蒙特卡洛采样,通过 brms 包调用 Stan 实现,设置 4 条链,每条 4000 次迭代,其中 2000 次为预热。
先验是弱信息先验。阈值参数用正态分布均值 0 标准差 2,随机效应标准差用正态分布均值 0 标准差 1,固定效应正态分布均值 0 标准差 0.5,beta 回归精度参数用伽马分布形状 2 速率 2。这些先验的作用是正则化,防止小样本过拟合,同时在数据有信息时让数据主导。论文没有报告冻结或更新神经网络权重,因为不存在这类参数,也没有报告梯度路径与早停,这类概念不适用于本研究的贝叶斯采样流程。
贝叶斯估计 × 弱信息先验: 贝叶斯估计负责用后验分布同时给出参数估计和不确定性,弱信息先验负责在 N=11 的小样本下约束参数不至于过拟合,搭配的原因是传统极大似然需要 N≥200 才能稳定,组合后数据有信息时仍由数据主导,数据不足时先验起到正则化并如实保留宽的可信区间。
收敛用 R 帽统计量和有效样本量评估,目标是 R 帽小于 1.01。论文报告所有模型成功收敛,最大 R 帽为 1.004,有效样本量大于 1000,后验预测检查显示拟合充分。人能力取随机效应的后验均值,95% 可信区间量化不确定性。平均可信区间宽度为 1.29,直接反映了小样本精度的局限,这是解读结果时必须同时记住的代价。
被试、刺激和评分协议是如何构造的?
被试是 11 名日本视障者,7 男 4 女,平均年龄 38.2 岁,标准差 12.4 岁,范围 22 到 58 岁。其中 6 人全盲,5 人弱视。3 人先天视障,8 人后天视障,后天组平均发病年龄 24.1 岁。所有人持有日本残疾证书并定期使用读屏器,平均使用经验 8.6 年,标准差 6.2 年。问卷还收集了行动训练 0 到 15 年、盲文熟练度 5 点量表平均 2.8、音频游戏经验 0 到 20 年、电脑使用频率等背景。
被试自报读屏语速为每分钟 200 到 600 字符,平均 387 字符每分钟,标准差 134,按日语字符密度换算约 150 到 500 WPM。伦理经筑波技术大学机构审查委员会批准,被试知情同意并获得报酬。
刺激是 42 句从 ITA 语料选取的音素平衡日语句,来自朗读风格的 RECITATION324 子集,按长度分层抽样。短句 8 到 18 字符共 12 句,中句 21 到 30 字符共 18 句,长句 45 到 66 字符共 12 句。每句用 5 档语速合成,共 210 个音频文件,随机化呈现顺序。实验通过可接入读屏器的网页界面进行,音频嵌入谷歌表单,每个文件允许播放 1 次并可选择第二次播放,播放次数被记录。每人对每个句子与语速组合完成 3 次重复,设计上每人 630 试次,共 6930 个反应,但因数据收集不完整,有效数据集为 2310 个反应。总参与时间平均 3 到 4 小时,分多次完成。
可理解性 × 可听性: 可理解性负责记录被试主观上觉得句子多容易理解,可听性负责记录主观上觉得声音多容易听清,分工不同但都用 1–7 等级量表收集,搭配的理由是客观复述正确率不能反映主观负担,组合后可以检验主观与客观是否分离,例如听速经验对正确率和可听性出现相反方向的作用。
3 类因变量各有明确操作。理解正确率是听后立即复述,按莫拉计分,不给部分分。莫拉是日语基本音韵单位,只有完全匹配才算正确。可理解性是觉得多容易理解,可听性是觉得多容易听清,均为 1 到 7 分。
莫拉正确率 × ITA 语料: 莫拉正确率负责以日语音韵基本单位逐莫拉比对复述是否完全一致,ITA 语料负责提供音素平衡且控制句法复杂度和词频的句子集合,搭配的原因是日语是莫拉节拍而非音节节拍,组合后可以在发音覆盖均衡的前提下得到不受主观判断影响的客观理解指标。
相对听速的计算需要保留原文口径。被试自报听速相对读屏器默认设置标准化,PC-Talker 默认 5,VoiceOver 默认 50。4 名次要用户保留默认即 1.0 倍,7 名主要用户自定义为 1.4 到 3.0 倍,平均 2.2 倍,标准差 0.6 倍。
语速越快越难理解吗?句长为什么出现反直觉结果?
先看本节要回答的比较问题。在保持题目随机效应和人的随机效应的条件下,不同语速相对 150 WPM 基线是否系统降低可理解性,不同句长相对短句基线是否改变可理解性,以及个体差异是否大于语速效应。公平条件是同一贝叶斯累积 probit 模型同时包含人与题的随机效应,指标方向是固定效应贝塔越负表示可理解性越低,区间不包含零表示有系统证据。
下图是论文图 1 的官方原图,显示语速与句长的固定效应及其 95% 可信区间,阅读时应先确认纵轴条件与横轴效应方向,再判断区间是否跨过零线。
看图路径: 1. 先看纵轴六行标签:上面四行是相对 150 WPM 的 225、300、400、500,下面两行是相对短句的 long 和 medium;2. 再看横轴零线位置:蓝色语速点越向左表示可理解性下降越多,绿色句长点在零线右侧表示更易理解;3. 比较 225 与 300 的误差条:225 的横线跨过零线附近,300 及更快速率的横线整体位于零线左侧;4. 观察句长两行:medium 和 long 的点与区间都位于零线右侧,与语速下降方向相反
论文图 1。原论文 Figure 1:“Fixed effects of speech rate on comprehensibility (rel- ative to 150 WPM baseline) and sentence length (relative to short baseline). Error bars represent 95% credible intervals.”。
从像素可见,纵轴从上到下依次为 225、300、400、500、long、medium 六行。横轴是相对基线的效应量,右侧虚线为零线。上方四行蓝色点与横向误差条表示语速效应,225 的点最靠右且区间跨过零线附近,300 向左移动,400 和 500 进一步左移且区间整体在零线左侧。下方两行绿色点表示句长效应,long 和 medium 的点都在零线右侧,区间也不包含零。语速越快点越靠左,句越长点越靠右,两类效应方向相反,这解释了题层面难度与语速相关只有 0.16 的原因。
文字证据给出的关键数字是,225 WPM 相对 150 WPM 无显著变化,中长句比短句更易理解。表后解释需要同时给出收益与代价。收益是阈值模式清晰,225 WPM 下降很小,300 WPM 以上大幅下降,提示该熟练群体理解极限约在 250 到 300 WPM。代价是题层面变异大,语速负效应与句长正效应部分抵消,论文解释为 ITA 语料长句更重视音素平衡而非句法复杂度,不能把平均语速效应直接用于预测每一句的难度。
个体差异的数字同样重要。下表整理 3 类测量的人能力范围,比较问题是同一测量内最高与最低相差多少,公平条件是同一模型的后验均值,指标方向是范围越大、标准差越大表示个性化需求越强。
| 测量 | 最低能力 θ | 最高能力 θ | 标准差 SD | 指标含义 |
|---|---|---|---|---|
| 可理解性 | −0.68 | 2.45 | 0.91 | 主观理解容易度 |
| 可听性 | −0.89 | 2.81 | 1.10 | 主观听清容易度 |
| 理解正确率 | −0.60 | 0.53 | 0.38 | 客观莫拉复述 |
表后解释是,3 个能力估计高度相关,可理解性与可听性相关 0.91,可理解性与正确率相关 0.76,可听性与正确率相关 0.69,但分布宽度不同。主观两项的个体标准差接近或超过 1,客观正确率标准差较小。未胜出或反例是,平均可信区间宽 1.29,最高能力者为全盲且使用最高速,说明单点估计不能忽略不确定性,也不能推广到新手群体。
全盲优势能否被用得更快解释掉?听速经验的作用一致吗?
本节的比较问题是,在同时考虑视觉状态和日常听速的条件下,两者是否独立预测理解。公平条件是同一贝叶斯回归控制相对听速,指标方向是正确率越高越好,可听性评分越高表示主观负担越小。论文报告全盲组在 3 类测量上一致高于弱视组,最高能力者全盲且开启高速检查模式。但两组日常听速本身不同,全盲平均 2.33 倍,标准差 0.58,弱视平均 1.42 倍,标准差 0.50,因此必须检验独立效应。
下表整理固定效应的原文数字,比较对象是不同语速条件与不同句长条件,基线分别保留原文的 150 WPM 与短句,效应为负表示更难理解,为正表示更易理解,区间是否包含零决定证据强度。
| 条件 | 参照基线 | 效应 β | 95% 可信区间 | 是否排除零 |
|---|---|---|---|---|
| 225 WPM | 150 WPM | −0.17 | [−0.49, 0.16] | 否 |
| 300 至 500 WPM | 150 WPM | −1.23 至−2.00 | 区间不含零 | 是 |
| 中句 | 短句 | 0.29 | [0.10, 0.47] | 是 |
| 长句 | 短句 | 0.29 | [0.09, 0.50] | 是 |
表后解释必须区分两个看似矛盾的发现。论文的贝叶斯回归显示,全盲状态与更高正确率和更高可听性相关,即使控制听速后仍然存在,支持超出习惯化的听觉处理优势,并与早期盲人动用视觉皮层处理超快语音的神经影像证据方向一致。相反,更高的听速经验与更高正确率但更低可听性相关,表现为客观与主观的分离,而非同一人内部的此消彼长。代价与边界是样本仅 11 人,交互作用因功效不足无法可靠估计,模型比较支持只含主效应。未评测的边界包括先天与后天、发病年龄、盲文与行动训练等背景变量,本研究没有报告它们的独立检验。
全盲 × 听速经验: 全盲负责标记视觉损伤状态这一用户特征,听速经验负责标记用户日常把读屏语速调到相对默认多少倍的使用习惯,搭配的原因是两者都可能预测理解能力但机制不同,组合进同一贝叶斯回归可以检验视觉状态的优势是否只是因为用得更快,从而区分神经可塑性解释与单纯习惯化解释。
复述时要避免因果夸大。论文用词是独立预测与提示神经可塑性重组可能是基础,相关性不是因果,听速经验与可听性的负相关也可能反映评价标准变化而非听力损伤。实际含义是,读屏默认语速通常 150 到 180 WPM,可能低估了视障用户尤其是全盲用户的能力,但任何个性化推荐都应同时考虑用户特征与经验水平,而不是直接把所有人调到高速。
哪些结论暂时不能下?小样本与语料带来什么限制?
第一个限制是样本量。11 人导致平均可信区间宽 1.29,速度与句长的交互无法可靠估计。论文明确指出需要 200 人以上才能对速度效应、用户特征与非线性模式得出确定结论。当前结果是概念验证,证明弱信息先验能给出稳定估计并如实报告不确定性,而不是证明所有效应在更大群体中必然成立。
第二个限制是被试经验。所有人平均使用读屏器 8.6 年,属于熟练用户,可能比新手更适应高速,因此速度耐受可能被高估。论文要求未来纳入新手,检验弱速度效应是否只是熟练适应的结果。
第 3 个限制是生态效度。ITA 语料是为语音合成评估设计的朗读句,可能不能完全反映自然阅读材料,长句反而更易理解就提示了语料设计的影响。题难度与语速相关仅 0.16,说明句法、词频、音韵复杂度与语速的交互超出了本次探索范围,在真实语境中速度效应可能更大。
第四个限制是主观量表冗余。可理解性与可听性相关高达 0.91,几乎重叠,未来需要开发更区分的量表,例如 effort 与自然度。论文还声明在准备过程中辅助使用了 Claude、ChatGPT、Grammarly 与 DeepL,用于文献调查、解释打磨与语言润色,但研究设计、数据收集、分析与发现均为作者原创,人工智能内容经过核查与大幅编辑。
要复现这项研究,先做什么?需要补哪项验证?
复现应从数据构造开始。按原文抽取 42 句并保留短 12、中 18、长 12 的结构,用同一日语女声以 150、225、300、400、500 WPM 合成 210 个文件,格式为波形、32 位浮点、44.1 千赫,随机化呈现顺序。每人对每个句子与语速组合做 3 次重复,允许 1 次必播加 1 次可选重播并记录重播次数。评分必须保留 3 类因变量,复述按莫拉精确匹配计百分比,不给部分分,主观两项保留 1 到 7 分。
建模复现的关键是分工不混。有序评分走贝叶斯累积 probit,百分比走变换到 0 到 1 后的 beta 回归,两类模型都包含人与题的随机效应与语速固定效应。先验按原文设置阈值正态 0 与 2、随机效应标准差正态 0 与 1、固定效应正态 0 与 0.5、精度伽马 2 与 2。采样用 4 链各 4000 次、预热 2000 次,检查最大 R 帽是否小于 1.01、有效样本量是否大于 1000,并做后验预测检查。相对听速按 PC-Talker 默认 5、VoiceOver 默认 50 标准化,保留 1.0 倍默认与 1.4 到 3.0 倍自定义的区分。
还需补的验证包括大规模复制、纳入新手、追踪训练的纵向设计、跨音节语言验证,以及基于校准题库的自适应测试工具。资源状态方面,本次收到的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,复现应按论文描述自行构造流程并记录缺项。
何时值得尝试这种方法?应记住的取舍是什么?
当任务同时关心题目有多难和人有多强,且样本小到传统方法不稳定时,值得尝试贝叶斯项目反应理论。本研究的值在于把语速这个题目侧因素和听者能力这个人侧因素放在同一尺度上,使个性化语速从手动试错变为可估计、可比较、可报告不确定性的问题。对日语这类莫拉节拍语言,用莫拉正确率搭配音素平衡语料,能避免把发音覆盖不均误读为语速效应。
取舍有 3 层。第一层是精度代价,小样本下估计稳定但区间宽,任何单人推荐都应附带不确定性,不宜直接推广到新手或自然文本。第二层是指标取舍,客观正确率与主观可听性可能分离,调快语速可能提高信息吞吐但增加主观负担,需要同时报告两类指标。第 3 层是群体取舍,全盲平均能力高于弱视 0.45 到 0.71 个西塔单位,且独立于听速经验,但总体趋势不等于每组每步都成立,默认语速应是个性化起点而非统一结论。记住这些条件,才能把这篇概念验证正确地用在读屏器设计与后续大规模研究中。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
