英文题目:Audio-Based Understanding of Audiobook Narration Appeal
会议身份:
conference:interspeech:2026:conference-paper-id:elisha26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#统计分析 #韵律 #语音 #音频理解
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Shahar Elisha:机构信息未能从会议 PDF 纯文本可靠映射
- Mariano Beguerisse-Díaz:机构信息未能从会议 PDF 纯文本可靠映射
- Emmanouil Benetos:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为单叙述者英语有声书录音、体裁标签与文本来源链接,输出为叙述吸引力的关联解释与预测,难点在于内容热度、体裁期待与录制质量相互混杂且真实完播行为不可得。方法链先将每本录音按章节切分为30秒片段并采样拼接,再用eGeMAPS、YAMNet与Whisper转录三通道抽取频率、能量、频谱、节奏与音频事件表征并聚合为129维书级向量,接着用广义线性模型做全局回归、按体裁独立拟合观察特异性、用线性混合效应模型以书组随机截距吸收标题效应,最后用四分位分类与组内排序检验预测力。相对以往小规模感知实验或合成语音偏好调查,差异在于以8854本大规模真实消费与同文本多版本对照控制内容混淆。LibriVox全局回归伪R2为0.09,Spotify回访率子集提升至0.16,组内排序Kendall’s τ在回访率下达到0.28且显著优于随机。结论仅适用于英语志愿朗读与粗粒度人气代理,难以直接外推至专业演播与个性化偏好。原文未披露训练推理成本与延迟。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要保留哪些关键信息?
本文的输入是公开有声书录音与配套元数据,目标是回答叙述声音本身是否影响吸引力。研究对象限定为单人朗读的英文有声书,数据规模是 8854 本有声书、1206 名朗读者、65 种类型。同一文本的不同录制被归为一个书组,用于控制内容。声音侧的输入不是整本连续音频,而是每本最多取 10 分钟的抽样:把录音按 30 秒切段,每本至多取 20 段,取首段、尾段与中间随机 18 段,短录音则全部纳入。这种抽样在代表性与计算量之间折中,后续所有声学统计都建立在这批片段上。
吸引力侧的主度量是浏览率,即互联网档案馆记录的页面浏览数除以上线天数。作者明确承认该代理很粗糙:它不区分听完、短暂试听或重复访问,也无法区分先点后听的曝光效应。收藏与评论数量太小无法使用,下载量、收听时长与完播率没有公开数据。论文的策略是先用这个唯一可公开复现的粗糙代理完成全部建模,再在 3428 本同时上架 Spotify 的子集上用 14 天回访率做稳健性检验。阅读时必须保留这一条件:所有 LibriVox 结论都是在噪声大、粒度粗的代理下得到的,效应方向比绝对数值更值得关注。
输出是 3 类可复述的判断。第一,声学向量是否与浏览率显著相关,哪些特征显著,效应量多大。第二,这种相关是否随类型变化,是否在同一本书的不同版本之间仍然存在。第三,声学向量能否用于预测吸引力档位与组内排序,精度与排序相关系数是多少。全文没有训练新的音频基础模型,所有音频模型都以默认参数调用,真正的拟合只发生在广义线性模型、混合效应模型与浅层分类排序器上。
已有路线研究了什么,本文的空白在哪里?
第一条路线是计算副语言学与声音感知。人类声音携带说话人身份与意图的副语言信息,已有工作覆盖感知性别年龄、健康、情绪、社会地位、嗓音品质、说话风格乃至声音吸引力。经典做法是从音频预测基频、响度、频谱等声学特征再训练机器学习模型,近年 Transformer 方法提升性能但牺牲可解释性。本文继承经典路线的可解释特征思路,选用 eGeMAPS 等已知描述子,而不是端到端黑箱嵌入,因为研究问题需要指出哪个可理解的声音属性与吸引力有关。
第二条路线是叙述风格研究。一部分工作用语音合成与音色转换生成适合讲故事的富有表现力语音,但用户调查显示听众仍更偏好真人叙述。另一部分工作分析真实有声书的声音:话语层区分叙述、描写与对话模式且跨语言成立,对话层发现女性角色被赋予更高音调与更低音量,叙述者层用声门源参数或卷积网络嵌入聚类说话风格。
与本文最接近的一项研究把声学特征与用户自评的沉浸感和喜欢程度关联,发现较快语速同时预测两者,但特征相关使具体驱动因素不清。关键空白是此前没有研究同时满足大规模、跨类型、同一文本多版本与真实消费数据的组合。本文的增量正在于把声音、类型、书名与消费放在同一框架下检验。
为什么浏览率不够用,还要引入回访率?
浏览率的优点是公开、可覆盖全部 8854 本、可用上线天数校正时间偏差。缺点是它记录的是页面访问,不是收听行为。作者假设多次访问反映多次回来继续听,因为有声书很少 1 次听完,但也承认短录音可能 1 次听完从而系统性拉低浏览率,长录音则因需要多次回访而虚高。这种偏差意味着时长相关特征的系数不能直接解读为偏好,例如总时长与浏览率正相关更可能是访问机制造成的。
回访率的定义是不同用户中在 14 天内回到同一本有声书继续听的比例,分母是总用户数。它更接近听后是否愿意继续,但同样偏向 against 较短录音,因为短书可能 1 次听完而无需回访。它的代价是仅覆盖 3428 本子集且数据不公开,无法支撑完全复现。因此论文把浏览率作为主结果的可复现基准,把回访率作为稳健性检验的更细粒度补充。
浏览率 × 回访率: 浏览率指 LibriVox 页面浏览数除以发布天数,是公开但粗糙的吸引力代理,分工是保证可复现的大规模排序;回访率指 Spotify 子集中 14 天内回访的不同用户比例,分工是刻画听后是否愿意回来继续听的参与度;两者搭配的原因是先用公开代理建立全量结论,再用更细的私有指标检验结论是否在更接近真实参与的度量下依然成立,组合意义在于区分人气曝光与听后留存。
对初学者而言,复述时要固定这种层级:浏览率回答曝光加持续访问的混合人气,回访率回答接触后的留存倾向。两者都不是完播率或满意度打分,任何把声学系数说成因果效应的表述都超出证据。
方法全景:一个样本如何从录音走到吸引力预测?
沿一本有声书走完全流程最清楚。输入是该书的若干录音文件与元数据,先按章节切成 30 秒片段,再按首尾加随机中间段抽取至多 20 段。每个片段分别过 3 个预训练音频管线:用 openSMILE 提取 eGeMAPS 声学描述子,用 YAMNet 给出音频事件分数,用 whisper-tiny 转写并计算词与音节速率。随后把全书所有片段的特征沿时间轴拼接,对每维求汇总统计,最终拼成 129 维书向量,其中 eGeMAPS 贡献 84 维功能特征,音频事件贡献 34 维均值与标准差,语速时长贡献 11 维。
得到书向量后进入两条分析线。统计线用广义线性模型拟合对数浏览率,用分类型广义线性模型看类型特异效应,用线性混合效应模型在书组随机截距下分离书名效应。预测线把浏览率按四分位分档做四分类,用逻辑回归、支持向量机、XGBoost 与多层感知机比较声学、类型与组合输入;另在 305 个多版本书组共 736 本书上训练排序模型,预测组内谁的浏览率更高。最后在 Spotify 子集上把浏览率换成回访率重跑全局模型与排序,检验结论是否依赖粗糙代理。
声学特征 × 类型: 声学特征指从 30 秒音频片段提取并聚合到书级别的 129 维向量,分工是刻画音色、能量、频谱、语速和音频事件等可听属性;类型指 65 种题材的多热编码,分工是刻画内容先验和受众选择偏好;搭配理由是两者可能携带重叠但不等同的信息,组合意义在于检验声音是否在已知题材之外提供增量预测力,原文组合模型准确率高于任一单模态即支持这种互补性。
129 维声音向量是如何构造的?
频率、能量与频谱部分来自 eGeMAPS 版本 2,共 25 个底层描述子,覆盖基频、抖动、共振峰及其带宽、响度、微扰、谐噪比、等效声级、每秒响度峰、频谱斜率、Alpha 比、Hammarberg 指数、谐波差与 1 至 4 阶梅尔倒谱系数等,再复刻 openSMILE 聚合逻辑得到 84 个功能特征。教学上可以把这部分理解为嗓音品质与发声方式的工程化快照,优点是文献中有对应解释,缺点是彼此高度相关,必须做共线性处理。
音频事件部分来自 YAMNet 的 521 类分数,按 AudioSet 本体归组为音效、音乐、录音质量、非言语发声与语音五大类,其中语音保留 13 个细分子类,其余 4 组取最大子类激活,最终每类取时间均值与标准差得到 17 乘 2 共 34 维。这部分捕捉的是朗读之外的质感,例如背景音乐、环境声与录制瑕疵。语速部分来自 whisper-tiny 带时间戳转写,用外部音节计数工具得到词数、音节数、词速率与音节速率的均值、标准差、最小最大值,以及总时长与总数,共 11 维。3 个模块拼接即 129 维,全程使用默认参数,没有微调音频模型。
广义线性模型 × 线性混合效应模型: 广义线性模型分工是在全量样本上估计每个声学特征与对数浏览率的固定效应,用于筛选显著特征和比较类型内差异;线性混合效应模型分工是为每个同文本书组设置随机截距,把书名带来的基线人气吸收掉,再估计声学固定效应;搭配原因是前者回答声音是否总体相关,后者回答在同一本书的不同录制之间声音是否仍然相关,组合意义是把内容效应与演绎效应分离。
统计与预测组件各自解决什么混杂?
全局广义线性模型以对数浏览率为因变量,以方差膨胀因子剪枝后标准化的 70 维声学特征为自变量,假设高斯误差,报告伪决定系数与经 Benjamini-Hochberg 校正的显著系数。它回答声音总体上解释多少变异,但混入书名、类型与推广因素。类型特异模型为每个类型重标准化特征,以全局模型参数为初值,剔除近常数特征后重拟合,再比较显著系数的大小与方向是否跨类型变化,用于检验同一声音属性在言情与历史等类型中是否作用不同。
组内分析用线性混合效应模型处理书名混杂,为每个书组设随机截距,声学特征为固定效应,同样拟合对数浏览率,并用赤池信息准则与全局模型比较拟合优劣。若组内声音仍显著,说明效应不完全是热门书自带流量。预测侧的分类用全部 129 维并在训练内标准化,五折交叉验证按朗读者分组并按浏览率四分位分层,避免同一朗读者同时出现在训练与测试。排序只用多版本组,五折按书组分组,训练 XGBRanker 的 NDCG 与 pairwise 目标及 LGBMRanker,评估则用 Kendall 秩相关以避免小组全相关时 NDCG 虚高。
分类 × 排序: 分类分工是把浏览率按四分位离散化后预测每本书属于哪个吸引力档,检验声学向量的全局判别力;排序分工是在同书组内预测哪个录制版本浏览率或回访率更高,直接控制文本内容;搭配原因是分类保留跨书比较但混入书名偏差,排序消除书名偏差但样本更小,组合意义是从全局预测与组内相对偏好两个角度交叉验证声音的作用。
本研究训练了什么,没有训练什么?
本研究没有训练任何音频基础模型。YAMNet、whisper-tiny 与 eGeMAPS 提取器均以预训练权重与默认参数前向调用,参数冻结,不存在梯度回传到音频侧,也没有报告音频侧的学习率、优化器或早停。需要复现者做的计算是片段切分、特征提取、时间拼接与汇总统计,输出 129 维书向量。
真正发生拟合的是下游统计与浅层模型。广义线性模型与混合效应模型用最大似然估计系数,类型模型以全局系数为初值启动;分类侧的逻辑回归、支持向量机、XGBoost 与多层感知机在 129 维上训练,排序侧的提升树优化排序损失。论文未报告这些浅层模型的完整超参数网格与训练耗时,也未报告硬件预算,复现时只能按默认或常规设置重建,并明确标注该缺项。评估侧用 1000 次随机实现与 1000 次自助法估计准确率与排序系数的置信区间,用 Kolmogorov-Smirnov 检验确认优于随机。
方差膨胀因子剪枝 × 错误发现率校正: 方差膨胀因子剪枝分工是在建模前迭代删除与其他特征高度共线的特征,直到全部因子低于 5,把 129 维降到 70 维以稳定系数估计;错误发现率校正指 Benjamini-Hochberg 方法,分工是在多特征多类型检验中控制假阳性;搭配原因是先降共线性再做多重检验,组合意义是让报告的 31 个显著特征和类型特异系数更少受到重复检验与共线放大的误导。
理解这一点可避免两个误解:一是把伪 R 方提升误认为音频模型学得更好,实际只是下游回归拟合更好;二是从参数冻结推定系统输出确定,实际上随机抽段、交叉验证划分与自助抽样都会引入随机性。
数据划分、基线与指标方向如何保证可比?
数据层面,主实验用全部 8854 本,类型分析覆盖 65 个类型,组内排序限定为组大小至少 2 的 305 组 736 本书,最大组 13 本,多数组为 2 本。Spotify 稳健性子集为 3428 本,其中排序子集缩小为 138 组 327 本。分类交叉验证按朗读者分组,避免同一声音特质泄漏;排序交叉验证按书组分组,避免同一本书的不同版本跨折。分类按浏览率四分位分层,保证每折档位均衡。
基线层面,分类比较随机基线 0.25、纯类型多热编码、纯声学向量与两者拼接;排序比较随机排序、组内逻辑回归逐点模型与全量逻辑回归,以及 3 种提升树排序器。指标方向上,分类准确率越高越好,伪 R 方越高说明声学解释的变异越多,赤池信息准则越低拟合越好,Kendall 秩相关越高说明组内顺序预测越准。需要特别记住排序评估用 Kendall 系数而非训练用的 NDCG,因为小组全相关时随机排序的平均 NDCG 已达 0.92,直接报 NDCG 会夸大效果。
聚合层面,声学向量是片段级特征经时间聚合到书级,音频事件取均值与标准差,语速取均值、标准差、最值与总量。统计显著性经多重检验校正,预测不确定性用自助置信区间呈现。原文未给出按朗读者或按类型的完整划分表,也未报告计算成本,复现时应保留分组键并记录运行时间以补齐该信息。
声学与吸引力的全局、类型与组内关系是什么?
全局模型伪 R 方为 0.09,作者解读为在粗糙代理且遗漏书名、类型与推广因素下,声音仍解释近一成变异。有 31 个声学特征显著,但单个系数绝对值多在 0.13 以内,说明吸引力由多个小效应叠加而非单一主导因素。例如嗓音微扰的变化被认为与气息感等嗓音品质变化有关,呈正效应;频谱通量较高则不利,该量与说话人性别等嗓音特性相关;音节速率标准差与均值高度相关,语速变化大的一侧呈正效应,与既有用户研究中较快语速提升沉浸感的发现一致。总时长正相关更可能反映长书需要更多次访问,而非偏好更长的书。
类型特异结果显示效应大小与方向随类型变化。全局为正的嗓音微扰变化在言情中更强,系数达 0.31,在历史中则不显著;历史中最强的是 Hammarberg 指数变化,系数为负 0.35,而全局仅负 0.04,在言情中不显著。作者提醒需先排查异常值再下定论。组内变异达 0.52,与跨书名变异 0.54 几乎相当,说明同一本书换人朗读带来的差异可与换书相比。混合效应模型相对全局模型的赤池信息准则差为 210,拟合明显改善,但多数全局显著特征在加入书组随机截距后仍显著且方向一致,支持声音效应独立于书名。
综合来看,证据支持声音有稳健但分散的小效应,且其重要性排序依赖类型与书名背景。把任一显著系数直接解读为选角规则都为时过早,因为特征间相关与录制质量混杂尚未完全解开。
分类与排序的预测力有多大?比较条件是否公平?
分类问题是把浏览率按四分位分成四档,随机猜测准确率为 0.25。比较的问题是声学向量能否在未知书名热度时给出高于随机的档位判断,公平条件是同一五折划分、按朗读者分组、按档位分层,指标方向是准确率越高越好。下表整理原文 4 种浅层模型在 3 类输入下的准确率与置信区间,随机行作为必要基线,组合列检验增量信息。
| 条件 | 指标 | 逻辑回归 | 多层感知机 | 支持向量机 | 集成树与随机基线 |
|---|---|---|---|---|---|
| 类型输入 | 四分位准确率 | 0.31 [0.31, 0.32] | 0.31 [0.31, 0.32] | 0.32 [0.31, 0.33] | 0.32 [0.31, 0.33] |
| 声学输入 | 四分位准确率 | 0.32 [0.32, 0.33] | 0.30 [0.29, 0.30] | 0.31 [0.30, 0.32] | 0.29 [0.28, 0.30] |
| 组合输入 | 四分位准确率 | 0.35 [0.34, 0.35] | 0.32 [0.31, 0.33] | 0.33 [0.32, 0.34] | 0.31 [0.31, 0.32] |
| 随机基线 | 四分位准确率 | 0.25 [0.24, 0.26] | 0.25 [0.24, 0.26] | 0.25 [0.24, 0.26] | 0.25 [0.24, 0.26] |
表中可见所有模型均高于随机基线,声学单模态最高提升约 0.07,类型与声学单模态表现相近,拼接后逻辑回归达 0.35,说明两者相关但不等同。代价是绝对精度仍然偏低,且简单模型多优于多层感知机与 XGBoost,复杂模型并未带来收益。类别分析进一步显示声学更擅长中间档,类型更擅长两端极值,这是选择组合输入的实质理由,也是未胜出项的明确记录:XGBoost 在纯声学下仅 0.29,为四者最低。
排序问题是组内谁更受欢迎,评估用 Kendall 秩相关,越高越好。下表比较全量浏览率、子集浏览率与子集回访率 3 种定义下的排序效果,公平条件是同一按书组分组的五折划分。
| 模型 | 全量浏览率排序 | 子集浏览率排序 | 子集回访率排序 | 点式对照与随机基线 |
|---|---|---|---|---|
| NDCG 目标提升树 | 0.08 [-0.03, 0.17] | -0.02 [-0.18, 0.13] | 0.26 [0.11, 0.41] | 随机约 0.00 |
| Pairwise 目标提升树 | 0.10 [0.00, 0.20] | 0.01 [-0.14, 0.16] | 0.26 [0.11, 0.42] | 组内逻辑回归 0.08 |
| Lambda 排序器 | 0.13 [0.03, 0.23] | 0.02 [-0.13, 0.17] | 0.28 [0.13, 0.42] | 全量逻辑回归 0.10 |
| 点式逻辑回归 | 0.09 [0.02, 0.15] | 0.02 [-0.08, 0.12] | 0.08 [-0.01, 0.18] | 随机区间含零 |
主要收益是所有排序模型在全量浏览率下显著优于随机,且逐点模型与排序模型表现相近,即使后者训练样本多 10 倍也未拉开差距,说明去除书名偏差本身比模型形式更重要。反例是排序性能对折划分敏感,不同随机种子下结论强度有波动,需更大更细的数据才能确定哪种排序目标更合适。
换成回访率后结论是增强还是消失?
稳健性实验把样本换成 3428 本 Spotify 子集,先重跑全局模型。直接重拟合浏览率时伪 R 方从 0.09 升至 0.13,这反映样本构成变化而非度量变好。把因变量换成 14 天回访率并以总用户为暴露偏移后,伪 R 方进一步升至 0.16,且模型拟合的赤池信息准则改善约 6000。作者据此认为声学与接触后参与的关联强于与原始人气的关联,但复述时要加上适用条件:该比较仅在子集内成立,且回访率同样对短书不利,不能说回访率是无偏真值。
排序侧的变化更具教学意义。在缩减为 138 组 327 本后,用浏览率定义组内相对吸引力时 Kendall 系数接近零,几乎学不到关系;换成回访率后 3 种提升树分别达 0.26 至 0.28 且区间稳定为正,而点式逻辑回归仅 0.07 至 0.08。这支持回访率在组内更具判别力,也反证浏览率在小样本组内噪声过大。未胜出项是子集浏览率下的所有模型全部失效,这是重要的负结果,说明主结果的排序部分依赖全量样本规模,换样本后若仍用粗糙代理会消失。
综合两类细节,稳健性检验不是简单重复,而是同时改变样本、因变量与聚合对象。复现者若只换因变量不换样本,或只换样本不换评估指标,会得到不同的数字,比较时必须对齐这三者。
哪些边界未被评测,哪些解读必须降级为待验证?
数据边界上,LibriVox 为志愿者录制,录音质量参差,声学特征可能同时编码朗读风格与录制设备差异,论文未分离两者。消费侧缺少完播、跳过、重听与用户人口属性,无法回答哪类听众偏好哪种声音,也无法验证跨人口组的差异假设。类型标签为 65 类但分布不均,小类型系数易受异常值驱动,原文已提示需做异常值分析。
方法边界上,129 维经剪枝剩 70 维,但语速均值与标准差相关达 0.66 等共线性仍残留,具体驱动因素不清。显著不等于因果,浏览率先于收听发生的曝光机制、书名热度与平台推荐都可能同时影响声音选择与浏览量。分类绝对精度偏低,排序对划分敏感,任何把 0.35 准确率或 0.28 秩相关直接包装为可部署收益的说法都超出证据。训练与部署成本、推理延迟、误判代价均未测量,不能承诺这些量得到改善。
解读层级上,论文直接报告的是相关系数、显著性、伪 R 方、准确率与秩相关;有限解释是声音有稳健小效应且随类型变化;未验证推测是据此选角或个性化能提升留存,后者需要随机对照或上线实验才能确认。复述时应对三者使用报告、支持、可能待验证的不同措辞。
要复现这篇工作,先做什么,需要什么条件?
先重建数据清单与抽样。下载 LibriVox 元数据与音频,过滤单人英文有声书,记录书组键即原文链接,按首尾加随机中间段抽取至多 20 个 30 秒片段并固定随机种子。保留每本书的浏览数、收藏评论数、上线天数以计算浏览率,明确时长偏差的检查项。对照样本量是否达到 8854 本、1206 名朗读者、65 类型、305 组 736 本等规模,若差距大应先检查过滤条件而非直接调模型。
再重建特征与建模。用 openSMILE 默认参数提取 eGeMAPS 并复刻聚合逻辑得 84 维,用 YAMNet 默认参数得音频事件均值标准差 34 维,用 whisper-tiny 转写加音节计数得 11 维,拼接为 129 维。统计侧先做方差膨胀因子剪枝至阈值 5 并标准化,再拟合对数浏览率广义线性模型、分类型模型与书组随机截距混合效应模型,报告伪 R 方、校正后显著数与赤池信息准则差。预测侧按朗读者分组做分类五折,按书组分组做排序五折,分类报四分位准确率与自助区间,排序报 Kendall 系数并说明不用 NDCG 评估的原因。
关于可用性,资源状态是正文开源声明的唯一依据。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。复现时应把缺失的超参数、硬件预算与划分种子如实记为缺项,用默认设置重建并报告敏感性,而不是从模型名称推定实现。
何时值得尝试这种声音建模,何时应先补验证?
当平台存在同一文本多版本、需要为不同类型匹配不同声音,或推荐系统已用尽内容与行为信号仍需增量特征时,值得尝试这种可解释声学向量。它不要求重训音频大模型,只需在抽样片段上调用现成提取器并拟合浅层模型,成本相对可控。类型特异与组内建模的思路可直接迁移:先看全局是否显著,再看分类型方向是否翻转,最后用同书组检验是否独立于内容热度。
当目标是直接上线选角或承诺留存提升时,应先补验证。需要更细的参与度量如完播率与回听行为,需要记录录音设备与后期处理以排除质量混杂,需要按听众分群检验偏好异质性,并用随机对照评估实际收益。在补齐之前,最稳妥的复述是声音与吸引力存在稳健但分散的小关联,组内差异可与换书相比,组合内容信息后预测更好,但具体哪维声音决定成败仍待验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses