英文题目:Protecting Bystander Privacy via Selective Hearing in Audio LLMs
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.693
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准设计 #音频大模型 #隐私保护 #音频问答
评分:8.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Xiao Zhan:机构信息未能从会议 PDF 纯文本可靠映射
- Guangzhi Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Jose Such:机构信息未能从会议 PDF 纯文本可靠映射
- Phil Woodland:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音频大模型在穿戴与助手场景中会无意收录旁观者语音,输入为多说话人混合音频,输出需在通用模式下正确作答而在选择模式下只答主讲并对旁观者拒答,难点在于重叠语音下的身份归因与指令可控的拒答。方法链分三段衔接:先用真实录制与 AMI 混合两路构建评测音频并由 GPT-4o 生成主讲与旁观者选择题与主讲描述,再以通用与选择两种指令模式与选择性效能统一度量理解与隐私,最后用主讲保留作答而旁观者强制拒答的成对指令数据做旁观者隐私微调。与已有匿名化与遗忘等面向主动用户的方法不同,该工作把隐私保护做成听觉注意控制而非表征抹除,具有直接可部署的指令语义。在 SH-Bench 测试集上微调后 Step-Audio-2-mini 的选择性效能达到 91.7%,超出最强未微调基线 Gemini 2.5 Pro 约 15.9 个百分点,论文摘要另声称旁观者选择准确率绝对提升 47%。结论仅适用于单主讲加单旁观者的英语短时场景,未验证群组讨论与音视频多主讲的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 数据相关资源:https://www.prolific.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么音频大模型会无意中泄露旁观者?
输入是这样进入系统的。用户在咖啡馆、健身房、合租客厅、公共交通或候诊室打开语音助手或佩戴设备,麦克风收到的不是干净的单人指令,而是一段包含前景主说话人与背景旁观者的混合音频。目标不是把所有听到的都答出来,而是只服务有意图交互的主说话人,对无意被收录的旁观者信息必须拒绝处理与拒绝透露。必须保留的信息包括谁是主说话人、混合音频中哪段内容属于谁、以及当前处于通用回答还是隐私保护指令之下。
输出是五选一选择题的选项字母,其中旁观者问题在保护模式下的正确输出是不知道的各种改写形式。 论文把旁观者定义为在智能设备语境下被动被收录、没有知识、没有同意、没有交互意图的人。这与主动用户不同,主动用户知道自己在和模型说话,可以控制措辞,而旁观者甚至不知道自己被录音,却面临同样的声音泄露风险。声音本身携带音色、音调、韵律等可识别属性,可能暴露身份、情绪与健康状态,大规模语音训练还可能让模型记住说话人痕迹。
已有隐私工作多针对主动用户,例如表征匿名化、机器遗忘与前端对抗防御,但没有系统评测与缓解旁观者泄露。于是任务从单纯的听懂转向按身份做访问控制。 看懂这张示意图就能抓住矛盾。前景人物在用笔记本电脑与模型交互,背景桌旁 2 人在谈论搬家与电话号码等私人内容,模型同时收到两路声音。正确行为是一条路径放行、一条路径阻断,而不是把听到的私人号码也回答出来。
看图路径: 1. 先看右侧绿色区域的主说话人与笔记本电脑的绿色对勾箭头,确认允许回答的路径;2. 再看左侧红色区域两位旁观者对话气泡中的敏感信息与红色禁止符号;3. 对比两条箭头指向同一音频大模型框,理解选择性听觉是按身份分流
论文图 1。原论文 Figure 1:“An illustration of the bystander privacy chal- lenge in audio LLMs.”。
图中右侧绿色区域用对勾箭头表示主说话人到音频大模型的允许路径,左侧红色区域用禁止符号与红色箭头表示旁观者语音不应进入回答。气泡中高亮的地点与号码说明泄露的具体形态是内容复述,而非仅声纹识别。黑色标签明确区分旁观者与主说话人,底部音频大模型框说明决策点在语言模型问答阶段。这个例子是教学示意,数值与效果不代表评测结果,但它固定了后文所有评测的判定标准:主说话人要答对,旁观者要拒答。
已有评测为什么没有覆盖旁观者?
先看同输入的工作。多说话人基准长期存在,一类做非隐私任务,例如语音识别、说话人日志、语音分离与面向音频大模型的问答,也包括需要音视频联合理解的基准。另一类做安全与隐私,例如重叠对话的多说话人匿名化基准,以及把有害指令藏在良性语音中的多说话人越狱基准。论文指出这两类都只关注主动说话人,没有把被动旁观者作为需要拒绝的对象。这是输入相同但目标不同的缺口。
再看同目标的工作。音频大模型的隐私研究多围绕主说话人,例如端到端识别与自监督语音编码器可通过黑盒查询泄露训练集信息,音频私有属性画像可推断敏感个人属性,还有音频越狱与后门触发等交互漏洞。缓解手段包括表征级匿名化、遗忘与前端防御。论文的对照是这些工作都不回答如何在 1 次混合录音中只听 1 人而拒另 1 人。 同监督与同运行阶段的对照更直接。
以往监督教模型听得更全,而这里的监督要教模型在特定指令下少说。运行阶段也不同,以往在离线转写后做匿名化,而这里要求在线问答时按指令与说话人描述动态决定是否拒答。理解这个差异才能理解后文为什么需要两种操作模式与统一指标,而不是只报告识别准确率。
选择性听觉任务到底要模型做什么?
任务可以沿一个样本走完。输入是一段多人混合音频、一道关于其中某人所说内容的选择题、以及当前模式指令。在通用模式下,指令是根据音频回答问题,期望是对主说话人与旁观者问题都给出正确答案,这测量多说话人理解。在选择模式下,指令额外给出前景主说话人的内容条件描述,并明确要求只听前景、忽略背景以保护隐私,期望是主说话人问题仍答对,而旁观者问题必须选不知道。这测量隐私保护。
表示层面不需要模型输出声纹标签,只需要输出选项字母。组件层面需要模型先根据描述锁定目标内容,再判断题目问的是目标还是背景,最后执行回答或拒答。目标层面用 4 个准确率刻画:通用主说话人、选择主说话人、通用旁观者、选择旁观者,其中只有选择旁观者以不知道为正确。输出层面把 4 个准确率再聚合成选择有效性。 举个例子帮助初学者建立直觉。
假如混合音频中主说话人说了表亲婚礼,旁观者说了会话编号。通用模式下两题都要答出婚礼与编号。选择模式下婚礼题仍答婚礼,编号题则必须答不知道。例子中的具体事件与编号仅为说明判定规则,不代表真实题目。这种设计防止了保守策略作弊:如果模型什么都说不知道,它在通用模式与主说话人上会失分。
如果什么都答,它在选择旁观者上会失分。
SH-Bench 与微调管线如何组成完整闭环?
方法全景分为评测与缓解两部分。评测部分是 SH-Bench,包含测试集与训练集,测试集又分真实录音分区与合成混音分区,每段音频配多道选择题与一段主说话人描述。缓解部分是旁观者隐私微调,复用合成数据构造管线造出更大训练集,用成对指令做监督微调,让模型在通用指令下全答、在保护指令下拒答旁观者。两者闭环是基准暴露泄露,微调修复泄露,再用同一基准验证。 真实分区的构造强调生态效度。
先选 5 个日常场景,再用大模型为每场景生成主说话人与旁观者两套脚本,主说话人是较长的、有目的的交互内容,旁观者是短而杂的背景闲聊且常含敏感细节。然后通过招募平台成对招募英语成年人,按角色用手机或笔记本麦克风录制,保留真实声学变异,并经作者人工审核。合成分区则从会议语料的头戴近讲麦克风中找主说话人长段与信息密集的旁观者短段,把旁观者衰减后随机混入并加会议室混响,模拟远场背景。
中间的标注流程把脚本或转写变成可评测的题目。每段测试音频生成十道题,主与旁观者各五道,每题一个正确答案、3 个干扰项与一个不知道选项,选项随机打乱,知道的表述还会被改写以防模型只记字面。另一路生成内容条件的主说话人描述,用于选择模式的定位线索。
看图路径: 1. 从左虚线框的五个场景图追踪到脚本再到真人录音的纵向流程;2. 从右虚线框的双说话人波形加混响追踪到合成混合音频;3. 看中间由脚本转十道选择题与主说话人描述的汇合箭头
论文图 2。原论文 Figure 2:“An illustration of the pipeline used to construct the SH-Bench test set.”。
该流程图左侧展示从场景图到脚本生成再到 100 人录音的真实链路,底部汇总为 100 段真实音频。右侧展示从会议语料取出双说话人波形、叠加混响再混合为合成音频的链路,底部汇总为 100 段合成音频。中间展示脚本与转写经大模型生成十道选择题示例与主说话人描述示例的两条输出。蓝色箭头表示文本依据的流向,黑色箭头表示音频混合的流向。读图时应把左右两路看作测试集的两个来源,把中间看作评测协议的统一出口。
两种模式、描述线索与统一指标如何分工?
先沿样本走完组件。输入混合音频与题目进入模型,通用模式只给回答指令,模型需要从重叠语音中抽取答案。选择模式额外给主说话人描述,模型需要先用描述锁定前景内容,再判断题目指向前景还是背景。若指向前景则正常作答,若指向背景则输出不知道。表示上不需要分离波形,论文的基线之一虽有用分离加识别加问答的流水线,但主力评测的是端到端音频大模型直接听混合音频作答。
选择性听觉 × 旁观者隐私: 选择性听觉负责按指令只处理前景主说话人并对旁观者问题选择不知道,旁观者隐私负责定义什么不能说即被动收录者的语音内容不可被复述或回答,二者搭配的理由是仅有理解能力不够,还需要按说话人身份做访问控制,组合意义是把多说话人理解转化为可执行的拒绝行为。
通用模式 × 选择模式: 通用模式负责测量模型在多说话人混合语音中的全面理解,要求主说话人和旁观者问题都答对,选择模式负责测量隐私保护,要求主说话人答对而旁观者问题必须选不知道,二者搭配的理由是只有对照才能区分是真保护还是听不懂,组合意义是为选择有效性指标提供 4 个准确率的完整输入。
主说话人描述 × 内容条件: 主说话人描述负责在提示中给出前景说话人的可追踪线索,内容条件负责限定描述必须来自该说话人开头说了什么而不是声纹标签,二者搭配的理由是音频混合中仅说前景二字不足以定位,需要内容锚点区分前后景,组合意义是让模型在不做声纹识别的情况下按语义内容锁定目标。
选择有效性 × 调和平均: 选择有效性负责用一个数同时要求理解与保护都不塌,调和平均负责对 4 个准确率取倒数平均的倒数从而对短板更敏感,二者搭配的理由是算术平均会被高分掩盖拒答失败,组合意义是只有通用与选择、主与旁观者四项都高时指标才高。
统一指标选择有效性的计算目标是只有四项全高才高。它对通用与选择、主与旁观者的 4 个准确率取调和平均,任何一项过低都会把总分拉低。原文明确给出公式编号为公式 1,但本次可核对的公式文本不完整,因此正文不复写公式符号,只讲计算意图:通用旁观者低说明听不懂多人语音,选择旁观者低说明听得懂却不保护,选择主说话人低而选择旁观者高则说明模型在无差别拒答。指标方向是越高越好,适用于比较不同模型的综合能力,但不能替代分项诊断。
微调管线用什么数据与更新方式教拒答?
训练集构造复用合成管线但规模更大。每段混合音频配二十道题,覆盖选择题与开放问答,主与旁观者各半。每道题配 1 对指令,一种要求通用回答,另一种要求若问及旁观者则拒绝。这样模型在 1 次训练中同时看到同一问题在两种指令下的不同正确行为,既增强多人理解,又学会按指令保护。论文报告训练集包含数千段混合音频与数万道问题,具体规模见后文整理表。
更新方式上论文选择两个开源示例模型做验证,只微调大语言模型骨干并采用低秩适配,秩为 32,冻结其他部分。原文没有报告学习率、步数、优化器细节与梯度路径的完整配置,因此不能推定训练成本或收敛行为,只能确认参数更新范围是骨干低秩增量。监督来源是合成混合音频的脚本与转写派生的问题答案对,不是真人反馈。重置时机未报告,复现时应把该缺项记为待确认。
旁观者隐私微调 × 低秩适配: 旁观者隐私微调负责提供成对指令的监督信号让模型学会该答则答、该拒则拒,低秩适配负责只更新大语言模型骨干的小秩增量而冻结音频编码等其他部分,二者搭配的理由是要在不重训整个音频大模型的前提下改变问答策略,组合意义是以小参数改动获得可迁移的拒答能力。
需要区分的是微调只针对单主说话人加单旁观者的设置,没有在训练中加入多主说话人,因此论文在局限中明确模型可能在多主说话人时失效。这不是实现缺陷,而是训练分布的边界。复现时若改变说话人数,需要重新构造数据而不能直接沿用权重。
评测在什么数据、模型与判定条件下进行?
数据条件按原文交代。整个数据集包含 3,968 段音频、约 157.5 小时语音、285 位说话人,测试音频每段 10 题、训练音频每段 20 题,总题量为 77.36k 道。测试集共 200 段,真实与合成各 100 段。真实录音来自 100 位成年人,合成来自会议语料的近讲麦克风片段经衰减与混响混合。主说话人语音相对清晰,旁观者音量低且有重叠与噪声,因此旁观者理解更难。
招募通过在线平台进行,参与者为英国或美国的专业水平英语成年人,流程经伦理审查,脚本为虚构个人信息,文件以匿名编号存储。 模型条件包括流水线系统、开源音频大模型与闭源模型。流水线用分离模型分离主说话人,再用识别模型转写,最后用大语言模型按隐私指令问答。开源模型经过多说话人筛选,只保留能较准数出说话人数的模型。闭源模型选 2 个主流音频感知模型。
微调模型是 2 个开源模型加微调的版本。推理沿用各仓库官方系统提示与解码配置,代码仓库在原文中给出链接,本次收到的招募平台资源状态为可用。 判定条件是理解评分的关键。通用模式下主说话人与旁观者都以正确答案为对。选择模式下主说话人仍以正确答案为对,旁观者以不知道为对。
去掉不知道选项后变为 4 选 1,此时旁观者在选择模式下答对反而代表泄露,理想行为是 4 个选项概率接近均匀,论文用熵辅助判断是否真拒答。开放问答则看拒答率。
看图路径: 1. 先看左侧主说话人与旁观者两行题目的正确选项标注方式;2. 再看中间通用模式两格都要求给出具体答案;3. 看右侧选择模式下旁观者格变为不知道选项而主说话人格不变
论文图 3。原论文 Figure 3:“Illustration of how accuracy is measured for the main speaker and the bystander in two modes.”。
该图用 2 行 2 列展示判定逻辑。左侧列出主说话人与旁观者的题目与选项,中间列展示通用模式下 2 题都要求具体答案,右侧列展示选择模式下主说话人仍要求具体答案而旁观者要求不知道选项。虚线分隔通用与选择,颜色区分题目类型与答案类型。读图时应把行看作说话人身份,把列看作指令模式,二者交叉决定正确标准。
主结果显示理解强不等于保护强吗?
先提出比较问题:在同一测试集上,哪个模型同时做到听得懂多人语音与按指令拒答旁观者,选择有效性方向越高越好,公平条件是同一 200 段测试音频与同一通用与选择提示。整理表聚焦数据集规模这一可核对维度,帮助确认评测体量,再在表后解释主结果的收益与代价。表前说明已满足比较问题与指标方向的要求。
| 条件 | 指标 | 测试集规模 | 训练集规模 | 总题量 |
|---|---|---|---|---|
| 真实加合成混合 | 音频段数与题量 | 200 段测试音频,每段 10 题 | 3768 段训练音频,每段 20 题 | 3,968 段音频,77.36k 题,157.5 小时,285 人 |
| 合成训练 | 问答对分布 | 主与旁各 5 题每段 | 主与旁各 37.5k 问答 | 75k 训练问题 |
| 旁观者内容难度 | 音量与混响 | 真实更难,通用旁观者更低 | 衰减 -10 dB 加混响 | 前景清晰,背景低音量重叠 |
表后解释需要同时看收益与代价。论文报告未经微调的模型普遍泄露严重,主说话人准确率虽高但旁观者保护不足,最好的闭源模型选择有效性也只有 75.8%。
微调后 2 个开源模型在选择模式下旁观者准确率大幅提升,分别达到 96.1% 和 93.8%,开放问答拒答率从 45% 和 48% 提升到 92% 和 96%,选择有效性达到 91.7% 和 90.2%。代价是 1 处主说话人准确率轻微下降,另 1 处则略升,说明保护增益很大但并非零成本。未胜出项包括流水线与多个开源模型,它们或在通用旁观者理解上尚可但在选择拒答上不足,或走向过度拒答而拉低主说话人。 散点图把这种权衡看得更清楚。横轴向右代表多人理解更好,纵轴向上代表隐私保护更好,斜向右上代表统一指标更高。
看图路径: 1. 先确认横轴是通用模式旁观者准确率代表多说话人理解,纵轴是选择模式旁观者准确率代表隐私保护;2. 看右上角两个微调后星形标记与其他圆点的分离距离;3. 看左上高纵轴低横轴的三角标记,理解保守拒答但理解弱的情况
论文图 4。原论文 Figure 4:“Accuracies on bystander-related questions under selective mode against those accuracies under general mode for systems evaluated in this paper.”。
图中横轴为通用模式旁观者准确率,纵轴为选择模式旁观者准确率,图例区分各模型与微调版本。多数未微调模型沿负对角线分布,说明理解与保护难以兼得。左上三角标记代表理解弱但拒答多,右下菱形与三角代表理解尚可但保护弱。右上角 2 个星形标记为微调后模型,明显脱离原分布进入高理解高保护区。红色箭头标注了 3 个方向,帮助读者把位置与指标含义对应起来。
去掉描述线索与去掉不知道选项会发生什么?
第一个反证是主说话人描述的作用。比较问题是选择模式下有无内容条件描述时主与旁观者准确率如何变化,公平条件是同一模型与同一音频,指标方向是主说话人越高越好、旁观者以不知道为对故越高越好。论文报告所有系统在去掉描述后都有不同程度下降,且下降主要落在旁观者而非主说话人,说明描述是定位旁观者从而决定是否拒答的关键线索。
对描述依赖最大的是闭源最强模型与某一开源模型,而微调后模型受影响更小,支持微调让模型更多直接从音频线索区分前后景。未评测边界是若描述本身含糊或错误会如何,原文未给出该条件。 第二个反证是去掉不知道选项后的拒答行为。此时从五选一变为四选一,主说话人与通用旁观者仍越高越好,但选择旁观者越低越好,因为答对即泄露。论文还用熵判断是否真不确定,理想是接近均匀分布。
未微调开源模型在去掉该选项后准确率明显上升,说明难以拒绝。微调后模型在该条件下准确率明显下降、熵明显上升,其中一个微调模型在选择旁观者上接近随机选择的 1/4,支持其真正学会拒答。反例是另一微调模型仍有约 50% 以上泄露,论文解释为被迫四选一时的残留泄露,说明拒答能力不等于在强制选择下完全不泄露。 第 3 个反证是开放问答。把选择题去掉选项变为开放提问,在选择模式下观察是否拒答。
微调前拒答率不足 50%,微调后提升到 90% 以上。代价与限制是开放问答的拒答判定依赖模型输出文本是否表达拒绝,与选择题的选项判定口径不同,不能把两类数字直接相减当作提升幅度。百分点与相对百分比也不同,论文报告的绝对百分点提升应按原单位理解。
| 条件 | 指标 | 微调前可运行策略 | 微调后策略 | 比较对象 |
|---|---|---|---|---|
| 开放问答选择模式 | 拒答率越高越好 | 45% 与 48% | 92% 与 96% | 同一两开源模型前后对照 |
表后解释要看到收益的适用条件。微调收益在合成场景上接近满分,在真实场景上虽高但略低,因为训练只用合成混合,真实声学变异更大。
真实与合成的主说话人差异可忽略,差异主要在旁观者。这支持微调学到的是可迁移的拒答策略而非仅记住合成混响,但也说明真实场景仍是未完全解决的边界。
哪些场景与风险还没有被解决?
论文明确的局限是只聚焦单主说话人,这是个人助理最常见的场景,但开放空间群聊等多主说话人未覆盖。由于微调训练中没有多主说话人,模型在该分布外可能失效。另一局限是只评测音频输入,尽管所测模型多为可同时接收音视频的全能模型,音视频联合的旁观者隐私未展开。 伦理与数据边界也需交代。真实录音来自成年人并经伦理审查与知情同意,报酬与匿名存储在原文中有记录。
合成音频来自已匿名化的公开会议语料,遵循研究许可,不做重识别。剩余风险是录音声纹被滥用或与外部数据关联,因此基准拟以研究性非商业许可发布,并提醒避免未经授权的窃听用途。 从证据等级看,泄露存在与微调有效是论文直接报告,有统计置信区间支持且区间宽度远小于提升幅度。描述线索的作用与熵变化是对机制的有限解释,支持但不证明因果。未测量延迟、算力成本与误拒率时,不能承诺这些量得到改善。
总体趋势不等于每组都成立,例如真实与合成、不同基座模型的增益幅度并不一致。
复现时先做什么才能对齐原文条件?
先复现数据划分与采样。测试集 200 段中真实与合成各半,训练集为合成混合,测试每段 10 题、训练每段 20 题。合成时主说话人取 2-3 分钟且说话占比超 70% 的长段,旁观者取 20-50 秒的信息密集短段并衰减后随机混入,同时加会议室混响。标注时主说话人与旁观者题目数量相等,选项含不知道的多种改写并随机打乱。若改动衰减量、混入位置或混响,旁观者难度会变,不能与原文数字直接比较。
再复现评测协议。通用与选择 2 种提示要逐字区分,选择提示必须包含内容条件的主说话人描述与只听前景的要求。评分时通用 2 类都看正确答案,选择主说话人看正确答案、选择旁观者看不知道。去掉不知道选项的消融要切换为 4 选 1 并同时报告准确率与熵,开放问答要单独统计拒答率。聚合对象是题目级准确率再平均,置信区间用二项比例的区间方法。
微调复现先准备成对指令的监督对,同一问题在通用指令下教回答、在保护指令下对旁观者教拒绝,覆盖选择与开放 2 种题型。更新范围限定为语言模型骨干的低秩增量并冻结其余部分,秩按原文取 32。原文未给出的学习率、批量与步数是具体缺项,需要自行搜索并报告,不能从模型名称推定实现。何时值得尝试是当部署为单主说话人的语音助手且麦克风会收录背景时;若为多人会议记录,则还需补多主说话人验证。
这套框架留下了什么可带走的判断?
带走的判断有 3 层。任务层是音频大模型的隐私问题不仅是记住训练数据,还包括在 1 次录音中把无辜旁观者的内容说出来,因此评测必须同时考理解与拒答。方法层是两种模式对照加统一指标的设计比单一准确率更能暴露问题,而内容条件描述是当前定位目标的关键信息条件。缓解层是成对指令的微调可以在不重训音频编码的情况下改变问答策略,且在合成训练后能泛化到真实录音,但对强制选择与多主说话人仍有残留风险。 常见误解需要澄清。
第一,通用旁观者分数高不代表隐私好,它只代表听得懂,在选择模式下仍可能泄露。第二,选择旁观者分数高不一定代表真理解,它可能是无差别拒答,需要看选择主说话人与通用分数是否同时高。第三,去掉不知道选项后分数下降才是保护的证据,不能把四选一的低分误读为能力退化。第四,合成接近满分不等于真实已解决,真实声学变异仍是更难的分布。 还需补的验证包括多主说话人、音视频联合、误拒率与延迟成本,以及描述缺失或错误时的鲁棒性。
代码开源、权重下载与系统可运行是三件不同的事,复现应区分评测代码可运行、基座权重可下载、微调后系统可部署,并保留超参数与信息条件,才能把论文的绝对百分点增益转化为可部署的收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



