英文题目:“You Good?”: Examining the Coordination of F0 and Eyebrow Movements in the Differentiation of Sentence Types
会议身份:
conference:speechprosody:2026:conference-paper-id:lowe26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#统计分析 #韵律 #音视频 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Kendall Lowe:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonjeong Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Natasha Abner:机构信息未能从会议 PDF 纯文本可靠映射
- Jelena Krivokapić:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为非裔美国英语使用者朗读的陈述与疑问句目标短语音视频,输出为句类标签的韵律与手势区分线索,难点在于疑问句终调多变且高音调重音加低短语调和低边界调轮廓可兼用于陈述,单靠基频轮廓形状难以区分。方法链分三步:先用十二组剧本对话诱发多义短语你好及单义对照的陈述与疑问变体并由同方言合作者引导朗读,其输出的录制视频直接进入下一步特征提取;再用Praat标记目标短语基频峰位置并用OpenFace追踪左侧眉弓垂直位移后经标定手势起始与极值,其输出的峰时间戳进入下一步关系建模;最后计算基频峰与最近眉峰时距并做逻辑回归检验句类与多义性效应。与已有英语研究的关键机制差异在于发现疑问句眉上扬更少而眉峰更早,提示手势标记具方言特异性而非疑问普遍上扬,具有矫正通用疑问手势假设的实际意义。在375段对话的基频峰位置逻辑回归评测任务下,句子类型效应的回归系数指标为5.25,高于多义性效应的回归系数指标0.74。结论适用边界仅限于实验室朗读的双音节浊音短语,尚未验证自发对话、皱眉类型区分及跨方言泛化。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:为什么要用同一句话来研究陈述与疑问?
本研究的输入是说话人真实产出的音视频对话,目标是判断陈述句与疑问句在声音与面部动作上如何被区分开。作者选择非裔美国英语中的多义短语 you good 作为核心材料,因为它在音段完全相同时可以表达陈述意义也可以表达疑问意义,例如安抚对方与质问对方是否找事。这样的设计把音段内容固定住,如果两种用法在语调或眉毛动作上仍然不同,差异就更可能来自句类本身,而不是因为说了不同的词。
对于刚入门的研究生,需要先建立一个基本判断:在很多英语变体里,疑问常被描述为句末上扬或眉毛上抬,但在非裔美国英语的是非疑问句中,终边界可以是升调、平台调或降调,陈述句常见的降调模式也可能出现在疑问句中。因此只看调形轮廓不足以稳定分类,必须引入额外线索。本文要检验的额外线索包括基频峰落在哪个词、眉毛动了几次、是否上抬,以及声音峰与眉毛峰谁先谁后。
本解读只依据论文正文证据写作,不引入外部数据或评价。资源状态方面,本次未发现来源绑定且完成验证的公开代码、模型或数据,因此不能声称材料已公开。后续各节按学习依赖展开,先讲相关路线与具体任务,再讲数据如何采集与标注,最后讲统计结果与可复现细节。
已有路线如何看待语调与眉毛的关系?
语调路线关注基频峰的时间对齐。论文回顾指出,加拿大英语疑问句的 F0 峰比陈述句更靠后,澳大利亚英语回声疑问句的平均 F0 更高且 F0 范围更宽。非裔美国英语的已有描述是,陈述句常在核心音节带高重音后接低短语调与低边界调,但部分是非疑问句也出现相同模式,这直接引出本文问题:当调形重叠时,说话人是否用峰位置或面部动作补充分辨。
手势路线关注眉毛运动与语调重音的配合。既往报告包括陈述句眉毛活动少且音高下降、回声疑问句上抬明显且音高上升或延迟,眉毛上抬常在韵律突出区之前开始,头部运动峰则更晚。也有研究发现眉毛上抬在教学性陈述中比疑问中更频繁,这动摇了上抬专属疑问的简单说法。作者据此提出,眉毛与音高的协调可能是随言语社群而变化的,需要在非裔美国英语使用者中重新测量。
两条路线的交汇点是时间对齐。有的工作只检验眉毛起始是否先于重音音节,有的发现眉峰并不一致地先于 F0 峰。本文把检验细化为第一眉峰与第二眉峰分别相对 F0 峰的先后,并同时检验多义与单义是否一致,这是对既往只看起始点或只看单一峰的扩展。
要回答的五个具体问题是什么?
论文把目标写成 5 个可检验假设。第一,陈述与疑问的 F0 峰时间不同,峰在陈述中更早。第二,疑问的眉毛运动次数多于陈述。第三,疑问的抬眉多于陈述。第四,眉毛运动峰在各类句子中都先于 F0 峰。第五,同句类的多义版与单义版模式相似,即多义疑问与单义疑问 alike,多义陈述与单义陈述 alike。
理解这 5 个假设的依赖关系很重要。假设 1 检验语调对齐,假设 2 检验面部活动总量,假设 3 检验面部活动形态,假设 4 检验声手时序的普适方向,假设 5 检验词汇多义是否带来额外调节。前 4 个假设的自变量都是句类,第 5 个假设引入多义性作为对照维度。若假设 5 成立而假设 1 至假设 4 中只有部分成立,则结论是句类驱动部分通道,而非所有通道都按教科书预测工作。
教学上可以把例子固定为一个样本:同一说话人说出一句目标短语,先得到它的 F0 峰时间戳与所在词,再得到眉毛轨迹的起点与峰时间戳与上下方向,然后计算峰间毫秒差并归类为先行、对齐或跟随。5 个假设就是对大量此类样本做分组比较,看差异是否落在句类上还是多义性上。
从对话到数字:整体流程如何走通?
方法全景可分为刺激、采集、对齐与统计 4 个阶段。刺激是 12 组脚本对话,6 组含多义短语 you good,6 组含语义相关的单义表达,每组内再分陈述与疑问各 3 组,使多义陈述、多义疑问、单义陈述、单义疑问四格平行。每句目标行只含浊音段、长两音节,后接七音节话语,以控制 F0 跟踪与韵律边界和短语长度。每位被试把 12 组对话各重复 4 遍,与扮演对话伙伴的非裔美国英语使用者完成 48 组对话。
采集在实验室完成,被试坐在笔记本电脑前通过视频与同伴对话,研究者远程观察并录制,必要时因不流利要求重说。实验前先让被试默读全部对话并与同伴用非裔美国英语简短闲聊,以降低在机构场合回避该变体的压力。对话中目标短语出现在被试第二行,整体为第三或四行,角色固定为同伴说甲、被试说乙。
对齐阶段把声音与视频映射到同一时间轴。声音侧用 Praat 的音高最大值功能标出目标短语 F0 峰并记录落在第一词还是第二词,视频侧用 OpenFace 跟踪左眉弓垂直位移再用 findgest 按速度阈值标出起点与最大收缩点。统计阶段用逻辑回归与有序逻辑回归分别检验峰位置、抬眉似然与峰先后关系,自变量为句类、多义性及其交互,显著性阈值为小于 0.05。
声音侧如何得到 F0 峰位置?
声音侧的起点是目标短语的 F0 轨迹。白话说,基频是声带振动快慢在听感上对应的音高高低,F0 峰就是这段两音节短语里音高最高的那一刻。英文名为 F0 peak。操作上作者在 Praat 中对目标短语区间运行音高最大值函数,直接取峰值时间与频率,并人工或半自动判断该峰落在 you 还是 good 上。这个二分类是后文逻辑回归的因变量。
基频峰 × 句类: 基频峰指目标短语内 F0 轨迹的最大值及其落在第一词还是第二词,本研究用它做语调对齐的代理;句类指陈述与疑问的功能区分,负责决定发音计划与信息结构。二者搭配的理由是非裔美国英语的是非疑问句终边界可升可平可降,单看调形不足以分类,因此用峰位置是否随句类系统前移或后移来检验语调是否仍参与区分,组合意义是把连续的 F0 轨迹压缩为可在 4 种话语类型间比较的位置变量。
沿一个样本走完全程有助于理解。假设被试说出 You good?,先切出目标短语的音频区间,保证只含浊音以减少断裂,再提取 F0 曲线并找到最大值点,记录其毫秒时间戳与赫兹值,并标注为第一词或第二词。若疑问句系统地把峰放在第二词而陈述句放在第一词,就形成假设 1 预测的早晚差异。论文未做正式的音系学标注,原因是自生韵律模型与 ToBI 体系具有语言特异性且目前缺乏非裔美国英语音系模型,作者明确说明只标 F0 峰是迈向完整音系理解的一步。
视频侧如何计数眉毛运动与抬眉?
视频侧的起点是 OpenFace 输出的面部关键点。白话说,OpenFace 是开源面部行为分析工具包,会逐帧估计眉毛关键点坐标与头部姿态并给出置信度;findgest 是手势标注程序,根据速度信号与阈值找出起点、上行峰速、核心段起止、下行峰速与偏移等 7 个界标。英文名为 eyebrow movement 与 eyebrow raise。作者观察到左右眉运动对称,因此只分析左眉弓沿纵轴的垂直位移,并用 MATLAB 脚本把眉毛轨迹与 F0 轨迹时间对齐。
眉毛运动 × 抬眉: 眉毛运动指在目标短语内开始或达到峰值的任意上下位移,用发生次数度量总体面部活动量;抬眉是其中向上位移的子类,用是否出现度量特定手势形态。二者搭配的原因是既往文献把疑问等同于更多活动且更多上抬,混淆了数量与形态,拆开后才能分别检验假设 2 与假设 3,组合意义是避免把皱眉或下压也计为对疑问的支持,从而更准确地定位分歧点。
计数规则需要准确复述。若手势开始于目标短语内或峰位于目标短语内,则计入该短语;若同一短语内出现两个起点或两个峰,则计为 2 次不同手势。方向按纵轴位移判为上或下,上即抬眉。阈值采用软件默认的起点与偏移峰速 0.15、其余界标 0.20,作者说明这些默认设置已能准确捕捉各被试运动,无需调整。低置信度帧是质控依据,整段视频若 OpenFace 置信度低于 80% 的比例过高则整人剔除。
声手时间差如何计算与分类?
对齐侧把两个时间戳相减。白话说,手势起始点是眉毛开始动的那一刻,最大收缩点是眉毛到达最高或最低的那一刻;F0 峰是音高最高的那一刻。英文名为 gesture onset 与 maximum constriction。作者只用这两个在言语手势协调文献中最常用的界标,其余 5 个仅在标注示例中展示。R 脚本提取起点与峰的时间、上下方向以及 F0 峰时间与频率,汇总后计算每个 F0 峰与最近眉峰的毫秒距离。
手势起始点 × 最大收缩点: 手势起始点指 findgest 从速度阈值判定的眉毛运动起点,用于判断手势是否落入目标短语窗口;最大收缩点指眉毛达到最高或最低的峰时刻,用于与 F0 峰计算毫秒级时距。前者分工是界定归属与计数,后者分工是提供可对齐的时间锚点,二者搭配是因为只用起点会错过峰时序,只用峰会漏掉边界归属,组合后才能同时回答出现了几次与何时达到峰。
分类采用严格的 3 类法:小于零毫秒为先行,此时 F0 峰在眉峰之前;等于零毫秒为对齐;大于零毫秒为跟随,此时 F0 峰在眉峰之后。作者说明不用宽容窗口是因为何为先行或跟随的理论边界尚不明确,避免强加武断阈值。若目标短语出现两个眉峰,文献没有规定选哪一个,因此两个峰分别与 F0 峰计算距离并分别建模,这就是后文第一眉峰与第二眉峰两个有序回归的来源。
多义性 × 句类: 多义性指 you good 同一音段串可表陈述或疑问而单义对照短语只表其一,用于控制音段内容;句类指说话人意图实现的陈述或疑问功能,用于解释韵律与手势差异。二者做析因设计的原因是若多义句与同句类单义句模式一致,则差异来自句类而非词汇歧义或语用负担,组合意义是把印象式观察中归于 you good 特殊的现象还原为一般句类效应。
F0 峰 × 眉毛峰时距: F0 峰是声学时间戳,眉毛峰是运动时间戳,时距是二者相减得到的毫秒差并按小于零、等于零、大于零分为先行、对齐与跟随。前者提供语调锚点,后者提供手势锚点,搭配理由是文献多只看眉毛起始先于重音,而本研究要检验峰是否也先行,组合意义是把协调从定性先后变为可在陈述与疑问间做有序逻辑回归的可检验变量。
本研究有无模型训练?实际计算是什么?
本研究没有训练神经网络,也没有更新任何声学或视觉模型参数,因此不存在优化器、梯度路径、损失函数或参数冻结与解冻的安排。OpenFace 与 Praat 都是作为既有工具被调用,findgest 阈值保持默认且未按被试调整,R 脚本只做时间戳抽取与距离计算。论文未报告训练轮数、学习率或验证集,因为这些概念在此不适用,不能把无训练理解为确定性求解,输出仍受录制质量、跟踪置信度与标注阈值影响。
真实计算过程是测量与统计推断。测量侧是对每段对话产出 F0 峰位置、眉毛运动次数、是否抬眉与峰间时距;推断侧是用析因逻辑回归检验句类与多义性对二分类结果的影响,用多项逻辑回归检验运动次数,用有序逻辑回归检验先行、对齐、跟随三分类。缺项需要明确指出:论文未给出全部模型的完整系数表与随机效应结构,未说明缺失眉毛或音高数据的插补方式 beyond 剔除,也未报告统计软件包版本之外的可重复脚本。复现时应把重点放在重做标注规则与回归对照,而非寻找模型权重。
被试、材料与可用样本量如何确定?
被试从密歇根大学学生中招募,最初 11 人中有 8 名自认女性、3 名自认男性,年龄 18 至 33 岁,均自认黑人或非裔美国人,其中 10 人自认是非裔美国英语使用者。剔除 1 名不自认使用者与 2 名因 OpenFace 低置信度导致超过 25% 视频被删者,最终保留 8 人。这个剔除标准直接关系到面部关键点可靠性,复现时必须同样记录置信度分布。
材料包括 12 组对话,每人重复 4 遍,理论上每人 48 组,8 人共 384 组。论文报告原始总量为 528 组,分析时先去掉 3 名被试对应的 144 组,再去掉 9 组因音高跟踪错误与运动信号跟踪失败而两类数据都不可靠的对话,最终保留 375 组可分析对话。其中 288 组含眉毛运动,52 组无可检测眉毛运动,35 组有眉毛运动但因音高不可跟踪而只保留视觉分析、剔除声学分析。
对话设计控制了行数、目标位置与音段可跟踪性,目标行仅两音节且全浊音,后接七音节,目标出现在被试第二行。对话经非裔美国英语顾问审校以保证语言与拼写真实,呈现给被试的纸质材料无加粗,被试角色固定。退出问卷收集了被试对自身变体使用的反思,但未作为因变量建模。
F0 峰位置与抬眉分布显示了什么句类效应?
在进入条形图之前,需要明确比较问题与公平条件。问题是句类是否决定 F0 峰落在第一词还是第二词,公平条件是多义与单义在四格中音段受控且目标长度一致,指标方向是疑问落在第二词的比例是否高于陈述。若多义与单义在同句类内同向,则支持多义性不起主要作用。
看图路径: 1. 先看横轴四组话语类型与纵轴 Pitch Peaks 计数,确认比较单位是目标短语个数;2. 再对照图例灰色为落在第一词、蓝色为落在第二词,看陈述与疑问的颜色翻转;3. 比较多义陈述与单义陈述内部灰蓝比例是否同向,疑问侧同理;4. 注意疑问侧几乎无灰色柱、陈述侧蓝色柱很矮,判断分离程度是否支持句类主效应
论文图 1。原论文 Figure 1:“Distribution of F0 peak locations across utterance types”。
该图显示陈述侧灰色柱远高于蓝色柱,疑问侧蓝色柱占绝对主导,灰色几乎为零,多义与单义在同句类内方向一致。回归进一步量化了分离程度,疑问比陈述更可能把峰放在第二词,优势比接近 191 倍,而多义性主效应与交互均不显著。这支持假设 1 与假设 5,说明驱动 F0 峰放置的是句类而非多义性。教学例子是:同样说 you good,陈述更早达峰而疑问更晚达峰的模式在单义对照句中同样出现。
抬眉部分的问题是疑问是否带来更多上抬,指标方向是疑问出现抬眉的似然是否高于陈述。下表汇总了峰位置与抬眉两个二分类模型的报告值,便于 1 次核对方向与显著性。表中数值保留原文写法,优势比与置信区间只在原文给出时列出,不自行换算。
| 条件 | 指标 | 陈述侧模式 | 疑问相对陈述 | 多义性效应 |
|---|---|---|---|---|
| 目标短语峰位置 | F0 峰落在第二词的似然 | 更可能落在第一词 | β=5.25,OR=190.9,95% CI [56.5,644.8],p<.001,显著更高 | β=0.74,OR=2.10,95% CI [0.86,5.17],p=.107,不显著;交互 β=15.77,p=.989,不显著 |
表后解释需要同时给出收益与反例。主要收益是句类效应的方向清晰:疑问把 F0 峰推向第二词却降低抬眉似然,这直接违背假设 3 预测的疑问更多抬眉。代价或反例是总体眉毛运动次数在句类与多义性上均无显著差异,不支持假设 2,说明不能把疑问等同于面部更忙。未胜出项是印象式观察曾以为多义与单义会不同,但数据不支持,假设 5 反而成立。复现时应注意优势比置信区间很宽,提示样本量有限,方向比精确倍数更值得复述。
声手峰先后关系是否支持眉峰先行的普适说法?
这一节检验假设 4 的反证条件。问题是眉峰是否在各类句子中都先于 F0 峰,操作是把 F0 峰减眉峰的时距分为先行、对齐与跟随 3 类,再看疑问相对陈述是否更可能出现眉峰更早。公平条件是第一眉峰与第二眉峰分别建模,避免在有两个峰时武断选一。指标方向是有序回归中疑问的系数为正即更可能出现眉峰先行。
看图路径: 1. 先确认四面板标题区分单义与多义、陈述与疑问,横轴为毫秒时距且分箱宽度 200 毫秒;2. 以每面板中央零线为界,左侧灰色为 F0 峰先于眉峰,右侧深蓝为 F0 峰后于眉峰;3. 对比上排陈述以灰色为主、下排疑问深蓝占比明显增大的左右分布差异;4. 观察多义与单义在同句类内分布形状是否相近,判断多义性是否改变时序
论文图 3。原论文 Figure 3:“Distribution of temporal distances between F0 peaks and first eyebrow peaks. Gray bars = F0 peak before the eyebrow peak; dark blue bars = F0 peak after.”。
该图为四面板直方图,横轴是毫秒时距且分箱宽度为 200 毫秒,纵轴是计数,零线两侧颜色不同。可见陈述两面板左侧灰色堆积更高,疑问两面板右侧深蓝色占比明显上升,多义与单义在同句类内形状相近。这与普适先行说法不符:陈述更多是眉峰跟随 F0 峰,疑问才更多出现眉峰先行。下表把第一眉峰与第二眉峰两个有序回归的关键报告值放在一起,便于核对效应量与多义性是否显著。
| 条件 | 指标 | 疑问相对陈述 | 多义性效应 | 对假设 4 的含义 |
|---|---|---|---|---|
| 第二眉峰相对 F0 峰 | 更早出现眉峰的似然 | β=2.84,SE=0.76,t=3.76,p<.001,OR=17.0 | β=0.84,SE=0.46,t=1.84,p=.066,OR=2.32,不显著 | 探索性分析同样不支持普适先行 |
表后解释要区分直接报告与有限解释。直接报告是疑问的眉峰相对更早,两个峰的分析一致且多义性均不显著,支持假设 5。有限解释是作者把疑问侧的相对更早与既往只看眉毛起始的工作联系起来,但同时强调眉峰并不一致先行,因此不能把经典说法推广为跨句类的普适规律。未评测边界是视频印象提示疑问可能更多皱眉而非抬眉,但本研究未正式检验皱眉,复现时不应把抬眉更少解读为面部无标记。
哪些结论不能从现有证据推广?
第一,样本与场景限制明显。最终仅 8 名被试的 375 组对话,且为实验室朗读脚本对话并经多次重复,与自然会话的韵律与手势可能不同。优势比如 F0 峰位置的置信区间跨度大,提示估计不确定性高,不宜把 191 倍当作精确总体值复述,而应复述方向与显著性。
第二,测量口径有明确边界。眉毛只分析左眉弓纵轴位移,方向只分上下,未建模皱眉、头部运动与眼部线索;F0 只取峰位置而未做完整音系标注,作者已说明缺乏非裔美国英语音系模型是原因之一。因此不能声称已刻画该变体的完整语调音系,只能说峰位置是有效的一步。
第三,统计与因果表述需克制。相关性不等于因果,疑问与眉峰相对更早的关联不能解释为疑问导致眉毛提前;缺失误判率、延迟与成本测量,不能承诺这些量得到改善。总体趋势不等于每组每步成立,个别样本仍可出现相反时序。未测量皱眉频率、语用背景细分与说话人随机效应细节时,不应补编划分或聚合口径来弥合不一致。
若要复现,应先固定哪些动作与核对点?
复现应从材料与流程固定开始。准备 12 组对话并保持多义与单义各 6 组、陈述与疑问各半,目标行只用浊音两音节短语后接等长后续话语,目标出现在被试第二行。招募时记录变体使用身份与年龄分布,实验前安排变体闲聊与默读,角色固定为同伴甲与被试乙,每组对话重复 4 遍并记录因不流利的重说。
标注侧先固定工具与阈值。用 Praat 音高最大值标 F0 峰并记录第一词或第二词,用 OpenFace 跟踪并保留逐帧置信度,用 findgest 默认阈值标七界标但只取起点与最大收缩点做分析。归属规则为开始于目标内或峰位于目标内即计入,出现两个峰计 2 次。用 R 或等价脚本抽取时间戳并计算毫秒差,再按小于零、等于零、大于零分为先行、对齐与跟随。
统计侧按原文对照重跑析因逻辑回归、多项回归与有序回归,自变量为句类、多义性及其交互,阈值取小于 0.05,并同时报告系数、标准误、优势比与置信区间。质控核对点包括低置信度视频比例、因音高不可跟踪而只保留视觉的样本数,以及第一眉峰与第二眉峰是否分别建模。若要扩展,应优先补皱眉标注与自然对话验证,而非先调阈值或换跟踪器。
何时值得借用这套声手联合思路?
当研究对象满足 3 个条件时值得尝试:句类在单一通道重叠严重,需要第二通道补充分辨;音段内容可通过多义短语或最小对立固定,使韵律与手势差异可归因;有同步音视频且能获得可靠时间戳。若只有音频而无视频,或只有文本而无产出数据,则本文的时距方法不适用。
可带走的判断是句类而非多义性驱动了 F0 峰放置、抬眉似然与峰先后关系,陈述倾向更早 F0 峰与更多抬眉但眉峰相对更晚,疑问倾向更晚 F0 峰与更少抬眉但眉峰相对更早。不可带走的是疑问必然更多活动或眉峰必然先行的普适断言,本文证据恰好对这两点提出反证。
对初学者的特有误解需要澄清。把曲线或柱形高低直接读成绩效好坏是错误的,本题柱高只是计数,直方左右只是时距方向,需结合零线与图例判断。把末组结果推广全程也是错误的,多义与单义一致只在本文四格与当前样本量下成立。还需补的验证是皱眉形态、更大样本与自发语料,以及未来若建立变体音系模型后的重标注,这些都是在复述方法时应一并说明的边界。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 19 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

