英文题目:Estimation de l’âge d’un locuteur par des auditeurs humains et un système de détection : comparaison et analyse acoustique
会议身份:
conference:jep:2026:conference-paper-id:millot26_jep
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#人类参与评测 #可解释性 #言语感知 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Carole Millot:机构信息未能从会议 PDF 纯文本可靠映射
- Clara Ponchard:机构信息未能从会议 PDF 纯文本可靠映射
- Cedric Gendrot:机构信息未能从会议 PDF 纯文本可靠映射
- Jean-François Bonastre:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为VoxCeleb2年龄增补语料中每轮3秒至12秒的说话轮次,输出为说话人年龄回归值与人类配对年龄判断正确率及其声学解释,难点在于野外录音质量不均与年龄分布不平衡导致年轻段和年老段估计不稳。方法先用预训练WeSpeaker ResNet293提取256维说话人嵌入,再经三层多层感知机回归年龄,其输出的每说话人平均绝对误差直接进入下一步分层抽样。接着按平均绝对误差大于10年与小于3年并结合3年与10年年龄差构造32个配对刺激,最后用广义与线性混合模型关联f0等11个声学韵律指标与双方绩效。与以往仅对比准确率的工作不同,该文把系统误差作为人类绩效模型的固定效应预测因子并检验共享声学基础,因而具有可解释说话人表征意义。在测试集与验证集条件下,系统在测试集上的平均绝对误差指标为6.8年,高于验证集上的平均绝对误差指标2.6年。89名被试问题A平均52%而问题B平均47%,系统误差效应p为2.32e-07而年龄差效应p为1.58e-12,人机判断Phi系数为0.4,声学上双方共享f0与H1-A3而人类额外依赖语速与F1。该结论适用边界限于英美口音25岁至43岁中等质量录音,对儿童老年人及高噪声场景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么要同时研究机器和人耳的年龄判断?
输入是这篇法语论文的正文证据与 3 张官方原图,目标是让刚进入语音领域的研究生能核对方法并复述流程,必须保留的关键信息包括数据划分、系统结构、听辨设计、评价指标与声学解释,输出是按学习依赖展开的中文解读。
年龄听起来像是一个可以直接回归的数字,但论文的起点是可解释性。尤其在法庭语音等场景中,如果只给出一个年龄估计而不说明依据哪些参数,就容易引入偏见。作者因此提出两个可检验的问题:机器难的样本是否人也觉得难,双方是否用了相同的声学和韵律线索。这决定了全文不是单纯刷低误差,而是把系统误差与人类行为并排分析。
对初学者而言,要先建立白话直觉。说话人嵌入,英文为 speaker embedding,是把一段长短不一的语音变成固定长度向量的表示,期望保留谁在说话以及嗓音特质。年龄检测在此被做成回归,即输出一个连续年龄值,再用平均绝对误差衡量偏离。人类听辨则被做成成对比较,不要求说出确切岁数,只判断年龄差是否超过五年以及谁更年轻,这降低了任务难度,也更符合人类只能粗分类的已知结论。
修辞上的谨慎很重要。论文报告的是在特定语料和特定年龄段上的相关与显著性,不是证明机器完全模拟人耳。后续各节将沿着任务路线、方法全景、组件计算、训练构造、实验条件、结果反证到复现收束展开,每一步都回到原文证据,不引入外部数值。
已有路线如何看待嗓音老化与自动估计?
论文回顾的嗓音老化文献指出,青春期和六十岁左右是两个主要变化阶段,七十到九十岁与二十到五十岁相比有多项声学差异。原文转述的已有观察包括抖动与闪烁上升、谐噪比下降、基频按性别反向变化、前两个共振峰随基频同向而第三共振峰反向、频谱重心下降、频谱斜率如 H1-H2 增大、语速减慢等。初学者可以把这些理解为声源变不稳定、声道形状变化与节奏变慢 3 类线索。
在感知方面,已有工作显示人工加快语速会让人觉得更年轻,减慢则觉得更老,基频、第一共振峰、气息声、嘶哑度和强度也会影响年龄感。人类精确估计年龄并不准,综述给出的平均绝对误差约十年,因此实践中建议只做年轻、成年、年老等宽分类。听者自身年龄还会带来偏移,对比自己更年轻的倾向高估,对更年长的倾向低估,而母语和性别影响不明显。
自动方法方面,论文提到在 CommonVoice 上按十年分段可达较高准确率的系统,以及显式使用基频、抖动闪烁和特定频带的四分类系统。但作者强调,多数系统不可解释,且直接比较人与机器性能的研究较少,唯一较接近的探索性工作认为人与机器误差来源不同,只有人受嘶哑等老化感知影响。这正是本文要更系统检验的缺口:不仅比谁更准,还要检验误差是否同向以及声学解释是否重合。
本文要回答的两个假设是什么?
论文把目标形式化为两个假设。第一个假设是系统的错误可以预测听者的表现,如果成立,意味着难样本在两种判断者之间是共通的。第二个假设是系统与听者的表现能被共同的声学与韵律测量解释,如果部分成立,则说明机器近似了人类感知的某些通道。
为检验这两个假设,作者需要同一批语音同时经过机器与人耳。做法是先在带年龄标注的 VoxCeleb2 子集上训练并评估系统,再从系统已评估过的测试集中挑选片段组成听辨材料。这样机器的逐话者平均误差可以直接作为听辨材料的分组依据,避免用两套互不相交的数据空谈相关。
教学上可以举一个例子帮助理解,但这只是例子,不代表论文数据:假设有 2 位说话人真实年龄差十岁,若系统对其中 1 位误差很大,人耳也更可能判断错谁更年轻,这就支持第一个假设;若进一步发现基频和语速同时能解释双方的对错模式,则支持第二个假设。论文后续用混合模型与声学回归把这个直觉变成可检验的统计陈述。
从一段语音到年龄判断,全流程经过哪些步骤?
沿着一个样本走完全程有助于建立全局图。输入是一段 3 到 12 秒的话轮,来自 VoxCeleb2 的访谈录音并带有说话时年龄标签。系统侧先用说话人嵌入提取器把波形变成 256 维向量,再用一个小型回归网络输出一个年龄数,与真实年龄相减取绝对值即单样本误差,按说话人平均即逐话者平均误差。人类侧则是把两段各 3 秒的话轮拼成 1 对,中间插入提示音,要求听者回答年龄差是否超过五年以及谁更年轻,从而得到每对刺激的正确率。
声学解释是第 3 条并行路径。对测试集语音用 Praat 与 PraatSauce 按默认参数提取基频、倒谱峰值、谐噪比、第一到第三共振峰、频谱斜率、频谱重心与语速,再用自动转写与对齐做音素级过滤,排除变异过大的音素,只保留中间分布的测量用于建模。随后分别检验这些测量是否随年龄变化、是否影响系统误差、是否影响人类正确率。
3 条路径的交汇点在统计模型。系统误差作为预测变量进入人类表现的混合模型,声学测量分别进入年龄、系统误差与人类表现的混合模型。这样既能回答难易是否一致,也能回答依据是否相同,而不只是报告各自的平均分。
嵌入提取器与回归头各自做什么?
系统采用标准 2 阶段架构。提取器选择 WeSpeaker ResNet293,这是一个为说话人识别训练的模型,期望最大程度刻画说话人特异性。论文明确写出选择理由是该表征与年龄检测任务相关,因为年龄正是说话人特征的一部分。对初学者而言,可以把提取器理解为压缩器,它把时变声学序列折叠成一个定长向量,后续不再处理时序。
分类器或回归头则非常简单,是一个多层感知机,英文为 multilayer perceptron。输入层 256 维对应嵌入维度,隐藏层 128 维,输出层 1 维对应年龄。激活用 ReLU,损失用均方误差,优化器用 Adam,学习率千分之一。这些细节表明时序复杂性已由前端承担,后端只需学习从说话人空间到年龄轴的映射。
嵌入 × 多层感知机: 嵌入负责把变长语音压成固定维向量,保留说话人特质,多层感知机负责把该向量映射为一个年龄数值,二者搭配的理由是时序建模已由嵌入完成,回归头只需做静态映射,组合后新增的作用是让年龄检测复用说话人识别的表征能力。
需要指出原文的一个笔误:训练描述中出现了检测语言的字样,但结合上下文与公式目标可知实际是年龄回归,解读时应以年龄回归为准。原文未报告嵌入是否冻结、梯度是否回传到 ResNet,也未给出训练轮数与早停规则,因此不能从模型名称推定前端被微调,只能确定回归头是被训练的,后续复现必须把该缺项记为待确认点。
系统在什么数据上训练,如何验证?
训练语料是带年龄标注的 VoxCeleb2 子集,同一说话人在不同录音时可有不同年龄标签,这既保留了年龄变化,也增加了鲁棒性。训练与测试没有重叠说话人,这是评价说话人相关任务的基本公平条件。训练时取 10% 做验证,测试集用于报告平均绝对误差。论文报告测试集全局误差与验证集误差差距明显,提示存在分布差异或难度差异,初学者应把验证误差看作训练过程监控,把测试误差看作泛化表现。
论文没有给出完整的训练预算、硬件时长或批量大小,只提到计算资源来自 Jean Zay 的 V100 分区与 GENCI 分配。因此本节只能讲清数据构造与监督来源:监督信号是录音时刻的说话人年龄,损失是预测与真实年龄的均方误差,评价是平均绝对误差。没有训练的环节是嵌入前端的预训练过程,本文只是调用已有 WeSpeaker 模型,不重新训练声学特征提取。
为减少听辨阶段的混杂,作者在挑选听辨说话人时限定美国或英国来源、年龄二十五到四十三岁,以提高系统精度并降低口音与极端年龄带来的偏差,并用谐噪比过滤掉过噪录音,具体是去掉测试分布上四分位数以上即高于 75 分贝的部分。这个过滤阈值的写法在原文中数值偏高,复现时应严格按原文描述实现并核查单位理解,不自行改为常规信噪比阈值。
听辨材料与声学测量如何构造才能公平对照?
听辨设计的核心是同时操纵年龄差与系统难易。作者挑选误差低的见证说话人作为基准,一组对比高误差说话人,另一组对比低误差说话人,每位说话人取两段 3 秒话轮,共组成 32 个成对刺激。年龄差设为三岁与十岁两档,分别对应难区分与较易区分。所有话轮归一化到负 2 分贝并加首尾淡入淡出,每对之间插入 662 赫兹纯音作为分隔。听辨在 PsyToolKit 上进行,共 89 名参与者,并收集性别、年龄、母语与语音领域熟悉度。
声学侧的公平性靠转写、对齐与音素过滤保证。先用 Whisper-base 自动转写,再用 WebMAUS 切分,然后计算每个测量的四分位数,排除位于第一或第四四分位音素上的测量,原文列出的排除音素包括塞音擦音等高变异辅音,只保留其余音素。这一步的目的是避免爆破与摩擦噪声污染共振峰与斜率估计。
以下原图展示训练与测试的数据分布,是理解后续误差按年龄变化的前提,阅读时先看文字导读,再看图,最后回到解释段核对不均衡结论。
看图路径: 1. 先看左侧表格中训练与测试的话者数、录音数与话轮数差异;2. 再看右侧直方图中橙色训练条与蓝色测试条随年龄的覆盖范围;3. 确认两端年轻与年老区间条形明显变矮的不均衡位置;4. 记住测试集无重叠话者的划分条件
论文图 1。原论文 Figure 1:“Répartition des données des corpus d’entraînement et de test.”。
该图左侧表格给出训练 3316 名说话人、测试 535 名说话人,以及话轮数十万与六千九百的量级差异,右侧直方图显示训练语音集中在二十到七十岁而两端稀疏,测试语音整体矮小且同样中间多两端少。这直接支持论文关于年轻与年老段因样本少而性能下降的论述,也说明听辨限定在二十五到四十三岁是为了避开稀疏两端,保证对照更干净。
系统误差随年龄如何变化,人耳整体表现如何?
系统在测试集上的平均绝对误差为 6.8 年,标准差 4.2 年,验证集上为 2.6 年,标准差 2.4 年,论文称与文献中六年左右的结果可比。按年龄细分,十到二十五岁平均 8.3 年,五十五到七十五岁平均 12.4 年,而二十五到五十五岁在 5.5 到 7.2 之间。作者将其归因于训练文件数:中间每五岁段超 10000 条,而两端平均仅数千条。初学者应注意这是相关解释,不是因果证明,但数据分布与误差曲线的对应关系是明确的。
基频 × 共振峰: 基频对应声带振动快慢决定的音高,共振峰对应声道谐振决定的元音音色,二者搭配的理由是分别反映声源与滤波器两端老化,组合意义在于同时解释音高变化与元音空间变化对年龄判断的贡献。
人耳方面,89 名听者中六成女性,三分之二为法语或英语母语,八成在二十到四十五岁,与听辨说话人年龄段接近。个人正确率从三成三到七成不等,问题 A 平均五成二,仅比随机高两点,问题 B 平均四成七,约为随机 1.5 倍。混合模型显示土耳其语与意大利语母语的 7 名听者显著更低,但作者保留全部数据,因为目标不是筛选优秀听者而是检验总体规律。
谐噪比 × 倒谱峰值: 谐噪比衡量周期性谐波相对噪声的比例,倒谱峰值衡量嗓音周期性与清晰度,二者分工都是刻画嗓音嘶哑与气息声,搭配理由是互补验证嗓音质量退化,组合意义在于区分噪声录音带来的假性退化与真实年龄性嗓音变化。
以下原图把文件数与误差画在同一横轴上,是核对数量不均衡解释的关键证据,读图时注意左右纵轴分别对应误差与文件数,不能把橙色高峰误读为误差高。
看图路径: 1. 先区分橙色训练文件数曲线与蓝色平均误差曲线的左右纵轴;2. 观察中间年龄段文件数高而误差低的对应关系;3. 再看两端特别是 70 岁附近误差尖峰与文件数低谷
论文图 2。原论文 Figure 2:“Performance en MAE et nombre de fichiers par âge dans les données d’entraînement.”。
图中橙色训练文件数在三十岁附近达到峰值后向两端下降,蓝色平均误差在中间段平稳偏低,在十岁附近与七十岁附近出现尖峰,尤其是七十一岁附近的孤立高点。这与表格中两端误差更高的数字一致,共同说明数据稀疏是系统在年轻与年老段不可靠的重要背景,也为听辨避开两端提供了依据。
比较系统难易与人类对错之前,先提出公平问题:在相同语音、相同年龄差条件下,机器误差大时人是否也更易错,指标方向是系统误差越大人类正确率应越低。表后解释将结合混合模型说明该趋势是否成立及其代价。
| 条件 | 指标 | 全局结果 | 低误差段 | 高误差段 |
|---|---|---|---|---|
| 测试集全局 | 平均绝对误差 | 6.8 年 | 2.6 年验证 | 8.3 年与 12.4 年两端 |
| 验证集全局 | 平均绝对误差 | 2.6 年 | 标准差 2.4 年 | 测试标准差 4.2 年 |
| 年龄分组 | 分组平均误差 | 5.5 年到 7.2 年中间 | 8.3 年年轻段 | 12.4 年年老段 |
表后解释需要回到原文数字。该表整理的 3 个数字分别来自全局与分组报告,主要收益是让初学者一眼看到中间稳、两端差的格局,具体代价是两端样本少导致估计方差大,测试标准差明显大于验证。未胜出的部分是年轻与年老段,论文明确承认这是可靠性短板,不能把全局 6.8 年推广为所有年龄都可用,尤其不能用于儿童与高龄的精确估计。
控制年龄差与噪声后,机器难是否等于人耳难?
本节按问题组织对照。测的是人类正确率,随谁变,比较的是高低系统误差与三岁或十岁年龄差,条件一致性靠同一批刺激与混合模型中的随机效应保证,指标方向是系统误差越大、年龄差越小、噪声越大则人类越易错。模型形式为正确率对系统误差、信噪比与年龄差回归,并把听者年龄、母语与问题类型作为随机效应。结果显示三者都显著:系统误差效应显著为负向影响,年龄差十岁显著提升正确率,信噪比越低人类越差,而信噪比对系统无显著影响。
平均绝对误差 × 听辨正确率: 平均绝对误差是系统预测年龄与真实年龄之差的平均,衡量机器难易,听辨正确率是人类在成对比较中答对的比例,衡量人耳难易,二者搭配的理由是同一段语音可同时得到两个分数,组合意义在于检验机器难样本是否也是人类难样本。
年龄感知一致性用 Phi 系数衡量,系统判断偏年轻或偏年老与人类平均判断的相关为 0.4,属于中等相关。混淆矩阵显示 32 个片段中双方同判偏年轻 7 个、同判偏年老 16 个,分歧共 9 个,且一致性主要集中在判为偏年老的一侧。这说明双方在听出偏老方面更一致,而偏年轻的判断分歧更大,初学者不应把 0.4 理解为高度一致。
以下原图同时给出混合模型数值与分组柱形,是检验第一个假设的核心证据,读图时先确认显著性,再看柱形方向是否与系数一致。
看图路径: 1. 先读左侧混合模型表格中系统误差、年龄差与信噪比三行的估计与显著性;2. 再对比中间按系统误差高低分组的人类表现柱形高低;3. 最后对比右侧按年龄差分组的柱形,确认大年龄差更易判断
论文图 3。原论文 Figure 3:“Présentation des résultats du modèle mixte (a). Effet de la MAE du système (b) et de l’écart d’âge des locuteurs (c) sur la performance des auditeurs, selon la question posée.”。
左侧表格给出系统误差、年龄差与信噪比的估计与极小 p 值,中间柱形显示低系统误差组的人类表现高于高误差组,右侧柱形显示十岁差组高于三岁差组,且蓝色与橙色分别对应两个问题但趋势同向。这支持论文的第一个假设:机器难样本人类也更难。然而信噪比只影响人而不显著影响机器,提示双方鲁棒性通道不同,这是后续声学分析需要解释的反例。
为完整呈现人类基线,整理下表并在表后说明问题形式带来的代价。
| 条件 | 指标 | 随机基线 | 问题 A 结果 | 问题 B 结果 |
|---|---|---|---|---|
| 总体分布 | 个体差异 | 中等离散 | 80% 听者在 20 到 45 岁 | 60% 女性 |
表后解释指出主要收益是问题 B 更能拉开能力差异,而问题 A 接近随机,说明五岁阈值的二分类对十岁最大差仍太难或刺激太少。具体代价是 32 个刺激数量有限,且最大年龄差仅十岁,可能压低了问题 A 的区分度。未评测的边界包括更大年龄差、更多刺激与更干净录音下的表现,论文在局限中明确承认这一点。
哪些结论站得住,哪些还只是相关?
声学解释部分先检验测量是否随年龄变化,再检验是否影响系统误差与人类表现。测试集大样本下显著阈值取 0.005,听辨小样本下取 0.05。报告显示系统误差可由基频、第二第三共振峰、倒谱峰值、频谱重心与 H1-A3 解释,人类表现可由基频、H1-A3、第一共振峰与语速解释。共同部分是基频与 H1-A3,分歧是人类额外依赖第一共振峰与语速,而系统额外依赖高阶共振峰与倒谱特征。论文据此称第二个假设部分成立。
相关性处理需要谨慎。基频与倒谱峰值相关 0.57,H1-H2 与 H1-A3 相关 0.68,论文指出前两者虽相关但各自仍显著,说明倒谱峰值提供增量信息,而后两者中只有 H1-A3 显著,说明 H1-H2 未提供增量。音素交互检验发现只有元音与鼻音的交互显著,频谱重心无显著交互,作者据此认为系统误差不是测量不稳定造成的。谐噪比虽随年龄显著,但不显著影响双方表现,作者归因于 VoxCeleb2 录音质量参差,这属于有限解释而非因果证明。
局限还包括抖动与闪烁因需受控语音而未纳入、年龄不均衡限制两端可靠性、听辨问题 A 接近随机可能源于刺激少与年龄差上限不足。训练资源只给出分区与分配号,未报告时长与能耗,推理开销与延迟也未测量,因此不能承诺效率改善。总体趋势不等于每组都成立,例如信噪比对人与机器的影响就方向不同。
| 条件 | 指标 | 共同线索 | 系统特有 | 人类特有 |
|---|---|---|---|---|
| 年龄相关 | 显著测量 | 基频与 H1-A3 | 倒谱峰值与频谱重心 | 语速与第一共振峰 |
| 样本条件 | 可靠范围 | 25 到 43 岁听辨 | 25 到 55 岁系统稳 | 两端均不可靠 |
表后解释强调,主要收益是机器与人共享基频与斜率线索,支持用机器近似部分人类感知,具体代价是人类特有的节奏线索未被系统利用,而系统依赖的高阶特征人类未必使用。未胜出项是谐噪比,它虽是文献中的老化标志,但在本数据与本测量链下未能解释双方表现,这提醒复现时优先检查录音质量与测量稳定性,而不是直接否定该指标的生理意义。
要复现这套对照,最先做什么?
复现应按依赖顺序先做数据与系统,再做听辨与声学。第一步按原文重建无重叠话者的训练测试划分,保留同一说话人多年龄标签,训练二百五十六到一百二十八到一的回归头,损失用均方误差,评价用逐话者平均绝对误差,并记录验证与测试的全局值以核对 6.8 年与 2.6 年的量级。嵌入调用指定的 WeSpeaker 模型时,必须记录是否冻结与版本日期,因为原文未明确该关键超参数。
第二步重建听辨材料时,严格限定美国或英国来源、二十五到四十三岁、每人两段 3 秒、归一化负 2 分贝加淡入淡出、中间 662 赫兹提示音,并按系统误差高低与年龄差三岁十岁分组,共 32 对。实施时用相同平台呈现两个问题,收集听者元数据,并在分析中把听者年龄、母语与问题作为随机效应,不能只做简单平均比较。
第三步重建声学链时,用相同工具与默认参数提取 11 种测量并做自动转写对齐,按四分位数过滤高变异音素,再分别跑年龄、系统误差与人类正确率的混合模型,注意大小样本采用不同的显著阈值。资源状态方面,本次未发现来源绑定且完成验证的开源代码模型或数据,不得声称代码模型或数据已公开,复现前需自行确认 VoxCeleb2 与标注的可达性与许可。还需补做的验证包括更大年龄差、均衡年龄采样、干净录音与抖动闪烁的补充测量,才能检验结论的稳健性。
何时值得用机器近似人耳的年龄感?
综合全文,只有在中间年龄、质量尚可、年龄差较大的条件下,用系统误差预测人类难易才更有把握。当面对年轻与年老两端、噪声较大或只需判断微小年龄差时,双方都不可靠且影响因素不同,此时不宜直接部署。论文的价值不在于给出最低误差,而在于给出可核对的对照方法:同一语音双评、混合模型控制混杂、声学回归解释依据。
对初学者的实践建议是,先复现分布图与误差曲线确认不均衡,再复现混合模型确认系统误差与年龄差的主效应,最后才深入声学显著性,避免把单个显著 p 值当成因果。若要在系统里更好地接近人类,应显式加入语速与第一共振峰相关的节奏与强度信息,而不是只增加模型容量。若要反驳本文,最有力的方向是换用均衡干净语料重测谐噪比与抖动闪烁,看人类特有通道是否消失。
最终应以报告的语言总结:结果显示系统误差能预测听者表现,系统与听者共享部分声学线索但听者额外依赖韵律节奏,这支持部分近似而非完全替代。任何超出二十五到四十三岁听辨范围或超出 VoxCeleb2 访谈场景的推广,都属于可能但待验证的推测,需要新的数据与实验才能确认。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 4 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


