英文题目:Variation Vocalique relative à l’âge et classification automatique en Corse Taravai
会议身份:
conference:jep:2026:conference-paper-id:collardburesi26_jep
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#集成学习 #社会语音学 #低资源 #语音 #语音属性识别
评分:4.4/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Lesia Collard-Buresi:机构信息未能从会议 PDF 纯文本可靠映射
- Hiyon Yoo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务是从塔拉瓦科西嘉语自发对话音频与转写推断说话人年龄组,输入为连续自发语音与元音标注信息,输出为青年组与老年组的二分类标签,难点在于说话人数量极少的低资源变体条件下个体变异主导年龄效应。方法链首先用WebMaus做词与音素强制对齐并用TextGridTools精修边界以获得可靠元音切分,其输出的边界信息进入声学表征阶段。该阶段在元音内多个时点提取共振峰并做说话人间归一化以捕捉动态轨迹,随后用Parselmouth补充提取时长、共振峰与梅尔频率倒谱系数形成分类特征。最后用随机森林结合合成少数类过采样与留一说话人验证完成监督分类,前步特征矩阵直接作为该分类器的输入并避免说话人泄漏。相对仅看中点共振峰的静态比较,该链条强调轨迹形态与小样本防泄漏验证,对低资源语言具有迁移参考意义。原文未提供可核对的关键定量结果。该结论适用边界仅限于当前小规模子集与现有特征集,不能外推至更大科西嘉人群、其他元音系统或朗读语体,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要解决的年龄与元音问题从哪里来?
这篇解读的输入是标题为塔拉瓦科西嘉语中与年龄相关的元音变化与自动分类的会议论文正文,目标是让刚进入语音与音频方向的研究生能够核对实验条件并复述方法全过程,必须保留的信息包括语料来源与规模、说话人构成与年龄划分、3 个目标元音、声学特征种类、分类器与验证方式以及各精度的具体数值,输出就是下面按学习依赖展开的完整技术说明。
成年人的发音在解剖结构稳定和发音控制精细化的共同作用下,元音目标相对稳定,但性别、说话风格和说话人个体身份仍然会带来很大差异,这是理解年龄效应的起点。已有文献报告的老化效应包括元音空间向中心集中、元音空间面积缩小以及说话人内部变异性增大,但这些效应在不同元音上分布并不均匀。论文回顾指出,高元音似乎对年龄更敏感,尤其体现在动态属性上,例如共振峰轨迹的形状和时间上的稳定性。把白话说清楚就是,同一个元音念出来时舌头和嘴唇的运动路径会随年龄改变,老年人的运动可能更小、更平,而年轻人的运动可能更大、更快。
自发语音 × 低资源语言: 自发语音负责提供自然语速、连音与风格变化下的真实元音实现,低资源语言负责限定标注语料少、缺少现成声学模型与大样本基线的约束条件,二者搭配的原因是塔拉瓦语只有小规模自发语料可用,组合意义在于方法必须先解决对齐与归一化等基础工程问题,才能谈年龄分类是否可行。
论文选择科西嘉岛南部的塔拉瓦语,正是因为它是研究很少的意大利罗曼语变体,相关老化模式是否成立尚属未知。教学上可以这样理解,例子就是如果只在英语或葡萄牙语上验证过集中化,那么换一种元音系统丰富的语言需要重新检验。论文明确说明,选择该语言一方面是因为有奥萨语料可用,这是少见的专门面向塔拉瓦语的自发语音视听语料,另一方面是想检验自动方法能否迁移到代表性不足的变体上。
本研究只用了该语料的音频通道,视频通道没有参与分析。资源状态方面,本次没有发现来源绑定且完成网络状态验证的资源,因此不得声称代码、模型或数据已公开,奥萨语料在原文中也被注明为未发表。
已有路线告诉我们什么:哪些效应已被验证,哪些还没有?
论文把相关工作分成两条线。第一条是语音老化的声学语音学路线,引用包括成年英语元音声学特征、老年嗓音频率变异性、成人语音随年龄的声学变化、纵向追踪基频与第一共振峰的研究,以及欧洲葡萄牙语元音随年龄变化和共振峰动态对研究老化重要性的论证。这些工作共同支持一个判断,即只看平均共振峰可能不够,还要看轨迹和变异性。第二条是低资源语言自动语音识别路线,以综述低资源语言识别方法的工作为代表,说明在数据稀缺条件下需要适配的方法。
同输入、同目标、同监督的对照可以这样做。同样以自发语音为输入,同样以年龄或说话人属性为目标,先前在大语言上的工作通常拥有更多说话人和更规范的录音条件,因而更容易把年龄效应与说话人个性分开。本文的输入同样是自发语音,但语言是塔拉瓦语,监督同样是年龄组标签,运行阶段同样是离线分析加监督分类,差别在于说话人只有 6 人且录音经过挑选,数据规模约束更紧。因此不能把大语言上报告的分类成功直接当作本文应达到的基线。
同样以元音声学测量为输入,先前工作多报告集中化与高元音动态变化,本文也观察到年轻人运动更动态的图示趋势,这属于方向一致的有限支持,但本文的分类精度并没有达到可部署水平,这是否定性差异而非方法失误。
初学者容易误以为相关性就是因果,例如看到老年人元音更集中就断定是生理老化必然导致。本文的语料控制提醒我们,方言接触、个体习惯和样本选择都可能影响结果,论文因此要求说话人本人及其父母均为同一方言母语者,以减少语言接触的混杂。这一步不是提高精度的技巧,而是保证年龄比较更干净的前提。
具体要回答什么:只用元音声学测量能分出年龄组吗?
论文提出的核心问题非常聚焦,能否仅凭元音的声学测量完成年龄分类,并且在塔拉瓦语中是否存在特定的年龄相关元音产生模式。输入是自发语音中切分出的元音段,输出是该段所属的年龄组标签,即年轻组或年老组。论文把年龄切成两组,年轻组为 30 至 52 岁,年老组为 68 至 78 岁,每组各 3 人且性别构成相同,这是一个二分类问题。
需要强调的是,论文不是做语音识别,也不是做说话人识别,更不是用文本内容判断年龄。它刻意限制信息源,只用元音段的时长、共振峰和梅尔倒谱系数,不用基频轮廓、嗓音质量或词汇语法等可能更直接提示年龄的线索。这种限制的教学意义在于,它检验的是元音本身携带了多少年龄信息。如果只用元音就能分,说明元音老化效应很强,如果分不出,说明至少在小样本下说话人个性压过了年龄共性。
评价标准是分类精度,方向是越高越好。但由于只有 6 个说话人,论文采用留一说话人交叉验证,这意味着精度反映的是对未见说话人的泛化,而不是对已见说话人新句子的记忆。理解这一点才能正确解读后文 43,3% 这类数字,否则会误把低于随机的全局精度当作简单的模型没有训练好。
方法全景:一个元音样本要经历哪几站?
沿着一个元音样本走完全程有助于建立整体图像。假设输入是一段 8 小时精选子集中的自发语音长录音,第一站是音频优化与对齐,系统先用在线对齐服务对音频和文本做分割与对齐,得到词与音段的时间边界,再用工具对文本网格做精修。第二站是声学测量,对每个目标元音在其内部相对位置的 3 个时间点提取共振峰,并做说话人间归一化,同时用语音分析接口提取段时长、共振峰值与梅尔倒谱系数。第三站是监督分类,把每个元音样本表示为一个特征向量,用随机森林学习年轻与年老的边界,训练时用合成过采样平衡类别,测试时用留一说话人验证避免说话人偏置。
这个流程中有两个关键约束。第一,语料是自发语音,边界不可能像朗读语料那样整齐,因此对齐后的手工或半自动精修直接影响后续 3 个时间点的取值位置。第二,说话人很少,任何把同一说话人的样本同时放入训练和测试的做法都会高估性能,所以必须按说话人划分。论文明确采用留一说话人验证,正是为了堵住这个漏洞。
从可复述的角度记住 4 个名词就够了,音频对齐、网格精修、动态声学提取、带平衡与说话人无关验证的随机森林分类。下一节展开每个组件的具体计算与工具分工。
对齐与测量组件:时间边界和三个时间点如何得到?
对齐组件的分工是给出每个元音在哪里开始、在哪里结束。论文使用基于网络服务的马乌斯对齐工具完成初始分割与对齐,再用文本网格处理工具包对得到的网格文件做精修。用白话说,前者是自动听音并把文字贴到时间轴上,后者是整理和修正这些时间标记的脚本工具。只有边界可靠,后续在 20%、50%、80% 处取点才有意义,否则取到的可能是相邻辅音的过渡段。
声学测量组件负责把时间段变成数字。共振峰是声道共鸣频率,通常第一共振峰对应开口度与舌位高低,第二共振峰对应舌位前后,单位是赫兹。梅尔倒谱系数是对频谱包络做梅尔刻度滤波再做倒谱变换得到的紧凑向量,常用于刻画整体音色。段时长是元音持续的时间长短。论文对每个元音在 3 个相对时间点提取共振峰值,目的是捕捉动态属性,也就是轨迹是平坦还是弯曲、运动幅度大还是小。随后做归一化以允许跨说话人比较,这一步的直觉是去掉声道长短带来的整体偏移,保留与发音目标和年龄更相关的相对格局。
共振峰轨迹 × 动态特性: 共振峰轨迹负责在 20%、50%、80% 3 个时间点记录第一、第二共振峰随发音过程的变化位置,动态特性负责解释这种变化的幅度与方向是否随年龄改变,二者搭配的原因是单点均值只能看到目标位置,而轨迹能看到年轻组是否运动更剧烈,组合意义在于把静态的元音目标比较转为对发音过程稳定性的比较。
需要指出的缺项是,原文没有报告归一化的具体方法名称与参数,也没有给出梅尔倒谱系数的阶数、窗长与窗移、共振峰提取的上下限与算法阈值。复现时只能先按所用工具的默认流程补记自己的选择,并明确标注这些是自选而非原文报告,这是诚实复现的要求。
特征与对象组件:为什么只看/i/、/a/、/u/三个元音?
塔拉瓦语被描述为元音系统丰富,文献记载有多达 13 种实现,但其中/i/、/a/、/u/被视为基元音,分别对应前、不圆唇、闭元音,中央、开元音,以及后、圆唇、闭元音。用白话说,这 3 个点构成元音空间的 3 个角,最能撑起整个空间的形状。论文选择它们做分类,既是因为它们在自发语音中相对容易定位,也是因为它们在声学上分得最开,最有希望显现集中化或动态减弱。
梅尔倒谱系数 × 共振峰: 共振峰负责显式刻画元音的舌位高低与前后等可解释的发音维度,梅尔倒谱系数负责稠密刻画整段频谱包络的整体形状与音色细节,二者搭配的原因是前者可解释但信息窄,后者信息宽但与发音动作的对应更间接,组合意义在于同时检验可解释的元音空间变化与整体频谱变化是否携带年龄信息。
每个样本的表示可以理解为一行特征,包含时长、3 个时间点的第一与第二共振峰及其归一化版本,再加上梅尔倒谱系数向量。目标是二值的年龄组标签。论文还做了分元音建模,也就是为/i/、/a/、/u/各自训练和评估模型,而不是只训练一个混合全部元音的全局模型。这种设计的教学价值在于,它允许回答更细的问题,是所有元音都同样携带年龄信息,还是只有高元音更敏感。后文结果显示/i/精度最高而/a/最低,正是对该问题的直接回应。
初学者常问为什么不用全部 13 种实现。原文没有给出逐一建模的计划,从自发语料的现实可以推断,稀有变体的样本会更少,按说话人划分后更难评估。只做 3 个角元音是在数据极少时的务实折中,但代价是结论不能推广到整个元音系统。
没有神经网络训练时:分类器实际学了什么、如何评估?
本研究没有训练神经网络,因此本节必须明确说明没有训练阶段,实际的计算过程是传统监督分类器的拟合与交叉验证。随机森林是多个决策树的集成,每棵树在自助采样的数据与随机子集特征上学习分裂规则,预测时投票决定年龄组。它负责拟合,而评估的公正性由外层的验证协议保证。
随机森林 × 留一说话人验证: 随机森林负责在时长、共振峰与梅尔倒谱系数构成的特征空间中学习区分年轻组与年老组的决策边界,留一说话人验证负责每次留出一个说话人的全部样本做测试以切断说话人记忆,二者搭配的原因是样本只有 6 人且说话人个性极强,组合意义在于让报告的精度反映对未见过的新说话人的泛化能力而不是对已见说话人的记忆能力。
具体操作是留一说话人交叉验证,每次留出一个说话人的全部元音样本做测试,用其余 5 个说话人的样本做训练,轮转 6 次后汇总精度。这种划分保证测试说话人在训练中从未出现,测得的是跨说话人泛化。由于自发语料中不同年龄组或不同元音的样本数可能不平衡,论文在训练侧使用合成少数类过采样来平衡类别。该方法在特征空间中对少数类样本插值生成合成点,只应作用于训练折,不能让测试信息泄漏到训练中。
合成少数类过采样 × 类别不平衡: 类别不平衡负责描述不同年龄组或不同元音样本数不一致可能把分类器拉向多数类的风险,合成少数类过采样负责在训练折内对少数类插值生成合成样本以补足数量,二者搭配的原因是自发语料中 3 个元音的出现次数天然不等,组合意义在于让训练时的类先验更均衡,但它不能创造新的说话人多样性。
原文未报告随机森林的树数、深度、特征采样策略、过采样的近邻数与采样比例,也未说明是否做超参数搜索、随机种子如何固定、精度是按样本平均还是按说话人平均。梯度路径、参数冻结等概念不适用于本研究,因为不存在可微的神经网络优化。复现时应先固定一个可运行的默认配置并完整记录,再做敏感性检查,而不是猜测原文用了某种特定配置。
实验条件:数据、划分、指标与成本如何交代?
数据方面,完整奥萨语料为 50 小时塔拉瓦语自发语音,本研究使用的精选子集为 8 小时,挑选标准是音质好、外部噪声最小且音频清晰。子集包含 6 名说话人,年轻组 30 至 52 岁,年老组 68 至 78 岁,每组均为 1 名女性加 2 名男性,且本人与父母均为同一方言母语者以避免语言接触混杂。音频之外的视频通道未被使用。
下表把数据规模与分组条件整理成可核对的形式,阅读时先确认比较问题是否公平,年龄比较的前提是性别构成相同且方言背景一致,指标方向在分类表中是精度越高越好,在声学观察中则是看轨迹动态与中心化趋势。
| 分组与规模 | 指标与条件 | 年轻组 | 年老组 | 全体与备注 |
|---|---|---|---|---|
| 说话人数 | 人数 | 3 人 | 3 人 | 共 6 人,每组 1 女 2 男 |
| 年龄范围 | 岁 | 30 至 52 岁 | 68 至 78 岁 | 两组不重叠,中间有间隔 |
| 语料规模 | 小时 | 未单独报告 | 未单独报告 | 全库 50 小时,精选子集 8 小时 |
| 方言控制 | 母语要求 | 本人与父母母语一致 | 本人与父母母语一致 | 避免语言接触混杂 |
| 录音挑选 | 音质条件 | 音质好噪声小 | 音质好噪声小 | 仅用音频通道 |
上表整理后需要说明主要代价与边界,未胜出的不是某一组说话人,而是全局混合建模本身,因为它把 3 个元音混在一起反而掩盖了分元音差异。未评测的边界包括中间年龄段、更多说话人、朗读风格以及除 3 个基元音之外的其他实现,这些都不能从现有 6 人子集外推。硬件预算与运行时间在原文中没有报告,因此不能承诺任何延迟或成本改善。
划分、采样与指标方面,声学上在每个元音的 20%、50%、80% 处取共振峰并归一化,分类上用随机森林加合成过采样与留一说话人验证,指标为精度。聚合口径原文没有明确是微平均还是宏平均,统计检验报告了一个显著性值,后文结果节再展开。训练与部署成本原文未报告,这本身就是一项缺项。
主结果:全局精度与分元音精度分别说明什么?
要回答的核心问题是测什么、与谁比、条件是否一致。测的是仅用元音声学特征区分年轻组与年老组的能力,比的是全局混合模型与分元音模型在相同留一说话人验证下的精度,条件一致指的是同一精选子集、同一特征家族与同一验证协议。指标方向是精度越高越好,但必须结合说话人泛化的难度来理解。
下表集中呈现论文直接报告的定量主结果,它是判断能否部署的唯一依据,数据配置表不能替代这张结果表。
| 建模范围 | 指标 | 全局混合 | /i/模型 | /u/与/a/模型 |
|---|---|---|---|---|
| 全部 3 个元音 | 精度 | 43,3% | 55,6% | /u/44,6%,/a/32,3% |
| 声学观察 | 中心点差异 | 未单独报告 | 第一与第二共振峰中心点无差异 | /a/与/u/中心点有差异 |
| 轨迹趋势 | 动态程度 | 未单独报告 | 年轻组更动态 | 年轻组更动态 |
| 统计检验 | 显著性 | p=0,002 | 未单独报告 | 未单独报告 |
| 归因判断 | 说话人效应 | 说话人变异大 | 未单独报告 | 说话人个性占主导 |
上表之后需要解释主要收益与具体代价。名义上最强的数字是/i/的 55,6%,它支持高元音对年龄更敏感的文献预期,但它只是略高于随机猜测,且论文同时报告/i/在中心点的第一与第二共振峰上没有组间差异,说明它的微弱优势并不来自静态目标位置,而可能来自轨迹等动态细节。/u/的 44,6% 与/a/的 32,3% 更低,尤其是/a/明显偏低,表明并非所有元音都同样有用。全局 43,3% 为非结论性,论文将其归因于说话人依赖的巨大变异与小样本。显著性值 p=0,002 被用来说明分类总体上仍非结论性,且说话人特异性占主导,初学者不应把显著误读为分类成功。
重提结果时要增加适用条件,上述精度只在 6 人精选子集与留一说话人验证下成立,换一批说话人或加入中间年龄都可能改变排序。百分点与相对百分比不可混用,本文报告的都是精度本身,不是提升幅度。
反证与消融:哪些对照说明成败来自说话人而非特征?
论文没有给出神经网络中常见的逐模块消融,但它用两种等价的反证完成了类似功能。第一种是全局与分元音的对照,如果年龄信息均匀分布在所有元音中,全局模型应至少与最好的分元音模型相当,实际却是全局 43,3% 低于/i/的 55,6%,说明混合建模掩盖了元音特异性。第二种是静态中心点与动态轨迹的对照,/i/中心点无差异却精度相对最高,而/a/与/u/中心点有差异但精度更低,说明仅看中心点均值不足以预测分类成败,动态过程可能更重要。
失败条件也写得很明确,样本只有 6 人时,留一说话人验证的每一折都高度依赖被留出的那个人是谁。如果某位年老说话人的发音恰好更接近年轻组的分布,该折就会大幅拉低平均精度。论文因此指出需要更多说话人以避免偏置,这不是客套话,而是小样本下对方差的正确归因。
未胜出项必须点名,/a/的 32,3% 是 3 个分模型中最差的,它提醒我们不能把元音空间缩小这类总体趋势直接翻译为每个元音都可分类。未评测的边界包括去掉梅尔倒谱系数只留共振峰会怎样、去掉过采样会怎样、换分类器会怎样,原文都没有报告,因此不能补写拿掉后必然怎样的断言。
限制:哪些结论不能下,哪些验证还缺?
首先区分 3 类表述。论文直接报告的是全局 43,3%、分元音 55,6% 与 44,6% 与 32,3%、年轻人轨迹更动态、说话人变异大且样本小。有限解释是高元音更敏感与动态特征可能更重要,这有文献支持但在本文小样本下只是趋势。未验证推测是增加说话人后分类可能可行,这合理但尚未被数据证明,必须用可能或待验证来表达。
数据限制方面,6 人两组的划分使年龄与个体完全纠缠,任何 1 位说话人的特异习惯都会被误读为年龄效应。8 小时精选虽然保证了音质,但也引入了选择偏差,噪声更大、风格更随意的真实场景表现只会更差而不会更好。50 小时全库尚未被充分利用,本文结论不能代表全库。
方法限制方面,归一化方法、梅尔倒谱系数配置、共振峰提取参数、随机森林超参数、过采样作用范围、精度聚合口径与随机种子均未完整报告,他人无法逐字复现。统计方面只给出一个显著性值,没有给出置信区间、按说话人分解的精度或混淆矩阵,无法判断错误集中在哪些说话人或哪些音位环境。成本方面没有报告训练时间、推理开销与硬件预算,不能讨论部署可行性。这些缺失不是技术错误,但它们决定了本文目前只能作为探索性研究,而不能作为可部署的年龄识别方案。
复现先做什么:按原文重走一遍的最小清单是什么?
复现的第一步是重建数据条件,而不是先调模型。需要确认使用的是奥萨语料中 8 小时精选子集,核对 6 名说话人的年龄与性别构成,确认只用音频通道,并记录挑选标准与排除标准。由于该语料注明未发表且本次没有验证可用的公开链接,外部研究者应先解决数据获取与使用许可,再谈复现,否则任何数字都不可比。
第二步是重建对齐与测量。按原文顺序先做音频优化与对齐得到时间网格,再精修网格,然后在每个目标元音的 20%、50%、80% 处提取共振峰并做跨说话人归一化,同时提取段时长与梅尔倒谱系数。务必把自己选择的归一化方法、共振峰上下限、梅尔阶数与窗参数完整记录,因为原文缺失这些细节,你的记录就是未来可比性的基础。
第三步是重建评估。实现留一说话人六折验证,外层按人划分,内层只在训练折做合成过采样,分类器先用一个固定的随机森林默认配置跑通全局与分元音两套评估,报告全局精度与/i/、/u/、/a/各自精度,并按说话人分解每一折结果。只有先拿到可运行的基线,才有资格讨论换特征或换模型的改进。需要保留的关键超参数与信息条件包括树数、深度、过采样比例、随机种子与精度平均方式,这些在原文中缺失,复现报告中必须补齐并声明为自选。
常见误解是把无训练等同于确定性求解。随机森林的自助采样与特征采样本身带随机性,过采样插值也带随机性,不固定种子就得不到稳定数字。另一个误解是从参数冻结推定输出确定,本文不存在冻结的预训练权重,所有随机性都来自拟合与采样过程,必须通过多次运行看方差。
收束:何时值得尝试这种只用元音的思路?
回到最初的问题,只用 3 个基元音的声学测量能否在塔拉瓦语中分出年轻与年老。论文的回答是否定的,至少在 6 人精选子集与当前特征加随机森林的配置下,全局 43,3% 不支持部署,分元音最好的/i/也只有 55,6%。但否定本身有价值,它说明说话人个性在小样本下压过了年龄共性,也说明静态中心点差异与分类成败并不一一对应。
何时值得尝试,取决于 3 个条件是否同时满足。第一,你有足够多的说话人使年龄效应能与个体习惯分离,6 人远远不够。第二,你关注的是可解释的语音学发现而非产品精度,例如验证高元音动态是否随年龄减弱,那么轨迹分析仍值得做。第三,你能接受自发语音的噪声与风格变异,并把按说话人划分的泛化评估作为硬门槛,而不是用混人划分自欺欺人。
还需要补的验证很具体。扩大说话人数量并纳入中间年龄,补报置信区间与按人分解的混淆情况,公开完整的特征配置与随机森林超参数,系统比较只用共振峰、只用梅尔倒谱系数与两者结合的差异,并检验朗读与自发两种风格是否一致。只有这些补齐后,才能判断/i/的微弱优势是稳定的年龄标记,还是特定 6 人组合下的偶然排序。对于刚入门的研究者,记住一句话就够了,先让评估对说话人诚实,再谈特征是否有效。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 1 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses