英文题目:FoleyImmersive: Decoupling What and Where for Video-to-First-Order Ambisonics
会议身份:
conference:interspeech:2026:conference-paper-id:liang26b_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#数据集 #扩散模型 #空间音频信号 #视频到声音生成
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Liming Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Lingfeng Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Luo Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Chenxing Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yuexian Zou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理无声视场视频到一阶Ambisonics生成,输入为普通视场视频与相机朝向,输出为WXYZ四通道空间音频,难点在于视频语义稀疏且内容与几何易纠缠而难以兼顾听感与方位。为补足发声事件 grounding,先用结构化文本增强数据集,详细描述事件物体与所处环境以强化视听对齐与语义 grounding。第一阶段语义优先扩散模型以多速率跨帧注意力与概率时间调制生成单声道W通道并冻结其输出,直接进入第二阶段。第二阶段复数频域空间化器以方向残差门控由W残差预测XYZ通道而不改写W,实现最小干预空间化。与端到端直接生成FOA及级联空间编码器相比,该解耦通过瓶颈门控兼顾语义保真与方向稳定,避免空间化改写已学语义。在YT-AMBISEM评测下,FOLEYIMMERSIVE的KLDdec指标为1.532,低于ViSAGe的KLDdec指标为1.833。该结论限于 5 秒短片段与已有相机朝向条件,对长时、多声源遮挡及未见场景的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 演示资源:https://foleyimmersive2026.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么,什么信息必须保留?
输入是一段无声的普通视角视频,也就是日常相机拍到的有限视场画面,不附带任何参考音频,也不附带全景声采集设备。目标是直接生成 1 阶 Ambisonics,即用 4 个通道表达的声音:一个全向通道记录整体响了什么,3 个方向通道记录声音在左右、前后、上下维度上的分布。解码或耳机渲染时,这 4 个通道共同决定听感中的内容与方位。
必须保留的信息有两类,一是语义内容,画面里滑雪板刮雪、风声、人群欢呼这类事件不能被改成别的声音,二是几何一致性,声音出现的时刻要与动作对齐,方向要与可见声源和相机朝向大体一致。初学者容易把这个任务理解为给视频配一段好听的单声道就行,但这里多出来的要求是方向通道的相位与能量分布也要可解码,评价时既看内容像不像,也看能量图与真值的相关性。
1 阶 Ambisonics × 全向通道 W: 1 阶 Ambisonics 是用 4 个通道表示 3 维声场的一种格式,全向通道 W 记录声音的内容与响度,3 个方向通道 XYZ 记录声音来自哪个方向;该文把 W 理解为“响什么”,把 XYZ 理解为“从哪响”,先把 W 做对再小幅度补上 XYZ,就是为了不让方向处理改写内容。
论文把任务难点归纳为两点。数据一侧,公开的视频与 1 阶 Ambisonics 配对数据缺少细粒度文本语义和稠密时间线索,模型难以判断该响什么。系统一侧,端到端直接生成 4 个通道容易把内容和几何纠缠在一起,而朴素的 2 阶段先做单声道再做空间化,又常在加强空间感时损伤语义。本文的官方演示与数据集链接当前可用,资源状态显示为可访问,这为后文复述实验条件提供了可核对的起点。
已有路线在同输入同目标下走到了哪里?
第一条路线是有参考音频的视觉条件空间化。给定单声道再利用视频把它变成双耳或 Ambisonics,代表工作包括三百六十度视频的自监督分离与定位、面向窄视场的单声道到双耳、以及统一分离与立体声生成。这类方法需要输入一条音轨,因此不解决从静音开始生成的问题。第二条路线是沉浸式视频到音频,直接从静音视频生成空间音频。条件扩散生成器、面向普通视角视频的视频到 1 阶 Ambisonics 框架、以及面向全景视频的单阶段框架,都属于这一线。
第 3 条路线是开域单声道视频到音频,推进了语义对齐与同步,但通常只输出单声道。本文与第二条路线同输入同目标,与第一条路线同用视觉与方向条件但输入阶段不同,与第 3 条路线共享语义保真诉求但输出通道数不同。理解这种划分很重要,因为后文把单声道基线接空间化器的做法,只能算作朴素 2 阶段对照,不能与端到端空间生成混为一谈。
为什么要把是什么响和从哪响分开?
论文提出的核心判断是内容与几何应当解耦。第 1 阶段只管全向通道的语义与同步,第二阶段只做从全向到方向通道的最小干预空间化。举一个教学用的例子而非原文实验:若画面中 1 人从左走向右并拍手,理想行为是拍手音色在全程保持稳定,只有方向参数随位置变化;若让一个网络同时决定音色与方向,方向误差的梯度可能反过来改写音色。分开的好处是第 1 阶段冻结后语义不再被改写,第二阶段只加小残差。
代价是管线变长,训练与推理都要维护 2 个模型,且第二阶段训练与测试时的输入分布可能不一致。本文用后期小概率替换与扰动来缓解这一失配,但并未声称完全消除。另一个隐含取舍是文本增强带来的依赖,若自动生成的描述有错,语义 grounding 可能被带偏,论文用分层抽样人工核查来控制质量,但没有报告误标率。
两阶段总览:一个样本走完全程
跟着一个 5 秒滑雪片段走一遍。视频同时进入 3 条处理:快速视觉分支以每秒 4 帧抽取动态特征,慢速视觉分支以每秒 1 帧抽取语义特征,视觉语言模型分支生成一句话标题、事件列表与场景总结。快速与慢速视觉特征先融合成每帧一个视觉令牌,再与文本令牌、时间显著性概率一起送入扩散模型,生成全向波形。
接着该波形被固定下来,做短时傅里叶变换得到实部虚部,与对齐到谱时间轴的视觉特征、相机方向嵌入一起进入 2 维 U 形网络,在瓶颈处做 1 次方向门控残差相加,解码出 3 个方向通道的复谱,再逆变换回波形。最终输出是全向不变、方向补齐的四元组。下面这张框架图把上述数据流画成了左右两大块,左侧是条件构造,右侧是 2 阶段网络,值得对照正文慢慢看。
下面这张图是本文唯一的系统总览图,阅读时先分清左右,再分清上下条件支路,不要把数据集构造箭头误读为推理时的数据流。
看图路径: 1. 先从左侧 FoV Videos 出发,沿 CLIP 1 fps 与 4 fps 两条箭头找到慢特征与快特征的汇合位置;2. 再看下方 Qwen 与 YT-Ambisem 支路如何产生文本隐状态并进入右侧 U-Net 块;3. 对照图例中火焰可训练与雪花冻结符号,确认时间检测器是冻结而注意力与前馈是可训练;4. 最后沿右侧虚线框内 H、Ub 与 Etext 进入上下两个注意力再求和的路径理解双条件注入
论文图 1。原论文 Figure 1:“Illustration of the proposed FoleyImmersive Framework.”。
从像素可见,左上是视角视频示例,向右分出两条标注为每秒 1 帧与每秒 4 帧的特征箭头,分别进入慢特征与快特征框,再共同进入蓝色多速率跨帧注意力块,块内可见多头注意力、加法与前馈符号。左下是视觉语言模型到文本标注再到数据集圆柱体的构造支路,文本隐状态向上进入扩散块,时间检测器作为冻结模块向右输出门控。右上虚线框内画出了扩散 U-Net 单个块的双路注意力与残差缩放关系,底部标有残差乘以门控的公式含义。这种画法支持了是什么与何时响分开注入、从哪响只在瓶颈处轻触的总体叙事。
第一阶段如何让声音响得对、响得准时?
第 1 阶段的输入是 4 组条件。快速视觉序列捕捉帧间变化,慢速视觉序列提供邻域语义上下文,词级别文本嵌入提供事件与场景 grounding,每帧时间显著性概率给出该时刻该响的可能性。实现上先把 3 类嵌入线性投影到同一维度,然后对每个快速帧找到最近的慢速帧,并在其左右各取 1 帧构成小窗口,把窗口内慢特征堆成矩阵做 1 次多头注意力,再与原始快特征相加后过前馈网络,得到融合后的视觉令牌。
这个设计的直觉是快帧负责定位当前时刻,慢邻域负责提供前后语义,避免只看单帧造成的闪变。在扩散 U-Net 的每个块中,特征图先沿频率池化到时间轴,再分别与视觉令牌和文本令牌做并行交叉注意力,前者捕捉何时变化,后者维持响什么。时间门控把检测器概率插值到对应块的时间分辨率,再经可学习缩放与偏置过激活函数,逐时间步乘到该块的残差特征图上。与硬开关相比,连续门控可微且能在静音段压住误激活。
训练目标是标准的扩散噪声预测均方误差,解码后得到语义对齐的单声道。
多速率跨帧注意力 × 概率时间调制: 多速率跨帧注意力负责把慢速语义帧和快速动态帧对齐,让模型知道当前画面对应哪段语义上下文,概率时间调制负责给出每一时刻该不该出声的连续门控,抑制静音段的误发声;前者解决看什么,后者解决何时响,两者在扩散 U-Net 的不同位置配合注入条件。
需要提醒的是,时间检测器沿用了已有工作的设计并直接使用其概率做连续门控,论文未报告该检测器在本数据上的阈值或校准细节。复述时只能说它被冻结使用,不能推定其内部结构与本文联合训练。
第二阶段如何只补方向不改内容?
第二阶段的输入是第 1 阶段或真值的全向波形、逐帧视觉特征与相机方向。波形经短时傅里叶变换取实部虚部作为双通道张量,视觉特征按最近邻对齐到谱时间轴并投影,相机方向先转成单位向量再经多层感知机嵌入。为匹配编码器下采样后的瓶颈长度,视觉序列做平均池化下采样,再与方向嵌入拼接投影成每时刻的门控向量。
方向残差混合器的做法是在瓶颈特征上加一个通道门控残差,门控由该时刻向量经线性层与激活函数产生,偏置初始化为很小的负值使初始门控接近零,训练中逐渐学会空间增益。这种小初值设计就是最小干预的字面含义:开始时几乎不改变内容,后续只学必要的方向调整。解码器输出 3 个方向通道的复谱,逆变换后与保持不变的全向组成 4 通道。
监督由复数域均方误差与能量预算正则组成,前者同时约束实部虚部从而约束幅度与相位,后者要求每时频点方向总能量不超过全向能量的一定比例,权重以可学习的正数形式联合优化。
复数短时傅里叶变换 × 方向残差混合器: 复数短时傅里叶变换把单声道波形展开为实部与虚部,保留幅度和相位从而保留方向线索,方向残差混合器只在 U-Net 瓶颈处根据视觉与相机朝向产生一个小通道门控残差;前者提供可监督的相位载体,后者提供最小干预的空间注入方式,组合起来是只调方向不重写内容。
能量预算正则 × 复数域损失: 复数域损失要求预测的 XYZ 在实部虚部上都接近真值,直接约束幅度和相位,负责把方向学准,能量预算正则要求 XYZ 的总能量不超过 W 能量的比例上限,负责防止过空间化;前者拉向准确,后者拉向克制,两者加权构成第二阶段的完整目标。
推理时全向直接取第 1 阶段的输出,第二阶段单次前向给出方向通道。训练时主要用真值全向监督方向通道,后期以小概率换成轻微扰动版本或第 1 阶段输出,以缩小训练与测试的输入差异。论文没有给出替换概率与扰动幅度的具体数值,这是复现时需要留意的缺项。
数据如何构造,模型如何训练与推理?
数据构造从已有配对数据出发,保留官方划分,训练集八万多条,验证与测试各约 10000 条,每条 5 秒并带有相机方向。增强部分用视觉语言模型为每条生成结构化描述,包括一句话标题、显著声音事件列表与整体声场景总结。论文举例的滑雪片段包含板雪摩擦、风声、雪裂声、雪杖与人群欢呼等事件,总结强调速度感与度假氛围。创建过程耗费约 840 个显卡小时,3 位标注者对按场景与事件密度分层抽样的子集做了人工核查,数据集已公开。
训练实现上音频重采样到 16 kHz,短时傅里叶变换参数为一千零二十四点窗长、二百五十六点跳长与汉宁窗。2 阶段均用自适应矩估计优化器,学习率十的负 4 次方,每卡批量三十二,共 200 轮。第 1 阶段推理用 50 步去噪采样,第二阶段单次前向。
YT-Ambigen × YT-AmbiSem: YT-Ambigen 是原文所基于的公开视频与 1 阶 Ambisonics 配对数据,提供 5 秒视角片段与相机方向,YT-AmbiSem 是在其上用视觉语言模型补写结构化语义描述后的增强版本;前者提供声音与几何真值,后者补上事件与场景文本,前后搭配是为了加强是什么在响的 grounding。
需要区分的是,第 1 阶段冻结后才用于生成第二阶段推理时的全向输入,但第二阶段主体训练仍用真值全向,这是一种课程式的失配缓解,不是端到端联合微调。论文未报告文本编码器的具体冻结状态与梯度路径,复述时不应自行假设。
用什么数据、什么指标、什么条件比?
训练与评测都在增强后的数据集上进行,沿用官方划分。评价沿用已有视频到空间音频工作的两族指标。语义质量先把 1 阶 Ambisonics 按相机方向解码到单声道,再算音频距离与散度,并报告平均音频距离,数值越小越好。空间性比较预测与真值的音频能量图在全部时间、每秒 1 帧、每秒 5 帧 3 种粒度下的相关系数与曲线下面积,数值越大越好。
对照包括端到端视频到空间音频模型、两种单声道视频到音频模型各自外接同一个空间化器的朴素 2 阶段版本,以及去掉关键模块的消融版本。主观评价招募 30 名筛选后的研究生听众,在安静房间用耳机听 50 条 5 秒视频,每条的 4 个系统输出用相同播放设置随机排序,从语义匹配、方向正确性与稳定性、总体质量三方面按 5 分制打分。这种主客观并行的设置,使得后文既能看自动指标,也能看人耳是否认可方向改进。
语义与空间谁变好了,代价在哪里?
先看语义问题:在相同解码与相同数据划分下,哪种策略保留内容最好,指标方向是距离与散度越小越好。表中同时列出端到端对照、两种外接空间化器的基线、去掉多速率注意力的版本与完整方法,公平性来自同一评测协议与同一解码方式。
| 数据集 | 方法 | KLDdec | FADdec | FADavg |
|---|---|---|---|---|
| YT-AmbiSem | ViSAGe | 1.833 | 4.701 | 4.478 |
| YT-AmbiSem | Diff-Foley 加空间化器 | 3.26 | 8.243 | 9.621 |
| YT-AmbiSem | SpecVQGAN 加空间化器 | 2.698 | 6.299 | 5.001 |
| YT-AmbiSem | 去掉多速率注意力 | 2.491 | 5.312 | 5.134 |
| YT-AmbiSem | FoleyImmersive 完整版 | 1.532 | 4.253 | 4.126 |
表后解释需要同时说清收益与代价。完整方法在三项语义指标上均为最优,散度约为 1.53,明显低于单阶段与朴素 2 阶段管线。论文的解释是全向内容端到端保留、空间化只做残差,因此第二阶段不重写第 1 阶段学到的语义。代价或反例是外接空间化器的基线在加强空间线索时牺牲内容,语义距离显著变大,这恰好说明朴素级联不是免费的。未胜出项是去掉多速率注意力的版本语义全面退化,说明融合模块对语义确有贡献,但也意味着完整方法的语义优势部分依赖该模块而非仅靠文本增强。
再看空间问题:在 3 种时间粒度下谁的方向能量图更接近真值,指标方向是相关系数与曲线下面积越大越好。下面这张定性图用同一鼓房片段的 4 通道频谱图做了直观对照,阅读时先看事件对齐,再看方向通道的稀疏性。
同一片段下比较全向事件对齐与方向通道能量分布,重点是区分对齐良好、能量弥散与通道塌缩 3 种形态,不要把亮度整体偏高直接等同于方向准确。
看图路径: 1. 先看顶部全景鼓房画面,确认这是一个打击乐为主的室内场景;2. 逐行对比 GT 与各方法四通道频谱图的亮暗分布,先看全向通道的事件对齐再看方向通道;3. 重点观察 ViSAGe 方向通道的弥散亮带与两类 Ambi Enc. 基线的近全黑塌缩通道;4. 再回到 FoleyImmersive 行,检查其方向通道是否同时保留稀疏性与事件结构
论文图 2。原论文 Figure 2:“Qualitative Comparison of Different Models”。
从像素可见,顶部是全景鼓房画面,往下依次是真值、本方法、端到端对照、两种外接空间化器基线,每行各有 4 个频谱小图。真值行中全向事件呈现清晰的竖条敲击结构,绿色框标注事件起点对齐。本方法行在对应位置复现了相近的竖条与包络,绿色对勾框标示对齐良好。端到端对照行的方向通道出现横向弥散亮带,黄色虚线框标注为泄漏或涂抹能量。两种外接空间化器基线各有一行出现近全黑的方向通道,红色虚线框标注为通道塌缩与弱空间线索。
这种像素级对照支持了最小干预空间化减少纠缠、朴素级联可能塌缩的判断,但它只是单样本展示,不能推广为全测试集的分布结论,定量结论仍需下表。
| 数据集 | 方法 | CC 全部 | CC 每秒 1 帧 | AUC 全部 | AUC 每秒 5 帧 |
|---|---|---|---|---|---|
| YT-AmbiSem | ViSAGe | 0.617 | 0.553 | 0.831 | 0.757 |
| YT-AmbiSem | Diff-Foley 加空间化器 | 0.350 | 0.339 | 0.687 | 0.670 |
| YT-AmbiSem | SpecVQGAN 加空间化器 | 0.352 | 0.340 | 0.688 | 0.671 |
| YT-AmbiSem | 去掉方向残差混合器 | 0.534 | 0.463 | 0.732 | 0.681 |
| YT-AmbiSem | FoleyImmersive 完整版 | 0.741 | 0.689 | 0.851 | 0.783 |
表后解释是完整方法在全部粒度的相关系数与曲线下面积上均提升,全部时间相关系数达到 0.741,每秒 1 帧粒度提升相对最大。论文把原因归于瓶颈处小残差稳定定位、复数监督约束通道间相位、能量预算抑制过空间化。代价是去掉方向残差混合器后空间指标回落到端到端对照之下,说明空间收益高度依赖该小模块。同时要承认,外接空间化器基线在该表上空间性也弱,这意味着它们既丢语义又未换来方向,不能简单理解为用语义换空间的成功权衡。
人耳听感是否认可自动指标?
主观问题是自动指标的提升能否被人耳感知。测试条件是 5 分制越高越好,30 名听众、50 条视频、相同播放设置与随机顺序,评价维度分为语义、空间感与总体。下表整理论文报告的主观均值与相对提升,自动指标不能当成人评,差值也不能混入模型列下的绝对分。
| 评测条件 | 维度 | FoleyImmersive 均值 | 与 ViSAGe 差值 | 与空间化器基线比较 |
|---|---|---|---|---|
| 30 人 50 条 5 分制 | 语义 | 4.01 | 加 0.31 | 高至少 1.0 |
| 30 人 50 条 5 分制 | 空间感 | 4.16 | 加 0.58 | 高至少 1.0 |
| 30 人 50 条 5 分制 | 总体 | 4.08 | 加 0.40 | 高至少 1.0 |
| 30 人 50 条 5 分制 | 对照 ViSAGe 总体 | 3.68 | 未胜出项 | 本方法更高 |
| 30 人 50 条 5 分制 | 对照基线总体 | 约 3.0 上下 | 未胜出项 | 本方法更高 |
表后解释是本方法在 3 维度均为最高,空间感领先幅度大于语义,这与能量图相关系数的提升方向一致,支持方向改进被人耳感知到的判断。代价是主观样本仅 50 条且听众为研究生群体,房间与耳机条件受控,结论外推到嘈杂环境或非专业听众时需谨慎。未胜出项是端到端对照与两种外接空间化器基线,它们的主观总体分别在 3.68 与 3.0 上下,说明自动指标上的落后在人评中同样存在,但论文未报告显著性检验与方差,因此不能断言每两两差异都统计显著。
拿掉关键模块会发生什么?
消融围绕是什么与从哪响两个假设展开。拿掉多速率跨帧注意力后,散度从 2.491 下降约 39%,两个音频距离各下降约 20%,这是论文报告的相对改善幅度,支持融合模块带来更干净、时间更准的全向声。拿掉方向残差混合器后,全部时间相关系数为 0.534,曲线下面积为 0.732,落后于端到端对照;加回后相关系数在 3 种粒度上提升约 39%、四十九、二十,曲线下面积提升约 16% 到十八。
这些数字表明第 1 阶段管语义保真,第二阶段管空间相干,分工成立。但要注意相对百分比与百分点的区别,这里是相对变化,不是绝对差值,且聚合对象是测试集平均,不是每条都成立。论文没有报告只保留文本或只保留视觉的细粒度消融,也没有报告能量预算系数的敏感性,因此无法判断文本增强与视觉融合各自的独立贡献,这是一个明确的未评测边界。
哪些结论还不能下,缺了哪项验证?
首先,自动语义描述的质量只做了分层抽样人工核查,没有报告错误率、召回率或对最终指标的敏感性,因此文本增强的收益可能包含噪声,待验证。其次,能量预算与门控初值的设计理由来自最小干预直觉与已验证对照,但超参数敏感性、不同场景下的最优比例没有展开,论文也未给出替换概率与扰动幅度的具体数值。
第三,空间评价依赖能量图相关性与主观方向打分,没有报告定位角误差、误检率或延迟,训练资源只给了数据构造的显卡小时,没有给出 2 阶段训练与推理的完整开销,因此不能承诺实时性或部署成本得到改善。第四,结论局限于官方划分的视角视频,作者在结尾也指出未来要提升对未见过与更复杂声场景的鲁棒性与泛化,这意味着当前的最优是数据集内的最优。把这些边界说清楚,比重复最优数字更重要。
要复现应先准备什么,先跑哪一步?
先按官方划分准备增强数据集,确认每条有 5 秒视频、1 阶 Ambisonics 4 通道与相机方向,并检查结构化描述的 3 个字段是否齐全。音频统一重采样到 16 kHz,短时傅里叶变换用一千零二十四点窗长、二百五十六点跳长与汉宁窗,视觉用每秒 4 帧与每秒 1 帧两路特征,文本用词级别嵌入,时间显著性用冻结检测器的概率。先训第 1 阶段扩散模型并冻结,再用真值全向训第二阶段,后期加入小概率的轻微扰动或第 1 阶段输出以缓解失配。
评测时先按相机方向解码到单声道算语义距离与散度,再在 3 种时间粒度下算能量图相关系数与曲线下面积,最后再做小规模人评。官方演示页当前可用,可先听效果再搭训练。需要区分的是,数据集公开不等于代码与权重可运行,论文正文只给出演示与数据集链接,没有在本证据中报告代码开源状态,复现前应先确认本次可达的官方页面是否补充了代码。
何时值得尝试这种解耦,何时不必?
当任务同时要求内容保真与方向可解码,且已有较强的单声道视频到音频基础时,值得尝试先冻结语义再做小残差空间化的路线,因为它把最难的音色学习与相对低维的方向学习分开,调试时也能分别定位是响错了还是指错了。当输入本身缺少方向真值、或场景以弥散混响为主而非点声源时,这种强方向监督的收益可能有限,能量预算反而会压住必要的空间感。
常见误解是把方向通道塌缩当成模型容量不足,本文的对照提示更可能是空间化器改写语义或监督失衡,增大模型未必有效。另一个误解是把单样本频谱图的好看等同于全集最优,实际仍需回到多粒度的相关系数与人评。总体上,这是 1 次用模块化换取可控性的选择:多一个阶段,多一份超参数与失配管理,但换来语义与空间可以分别验证。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

