英文题目:Back to Ear: Perceptually Driven High Fidelity Music Reconstruction
会议身份:
conference:interspeech:2026:conference-paper-id:wang26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#变分自编码器 #音乐 #空间音频信号 #音频编码
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:模型报告
👥 作者与机构
- Kangdi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiyue Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Rui Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Junyu Dai:机构信息未能从会议 PDF 纯文本可靠映射
- Tao Jiang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音乐重建要求将44.1 kHz立体声波形压缩为连续隐变量后再波形级还原,难点在于人耳对中高频和谐波瞬态相位极敏感而传统谱距离一视同仁,且立体声空间在压缩中易塌陷。所提耳形变分自编码器(ear-VAE)采用非对称变分自编码器生成对抗网络(VAE-GAN):卷积编码器提取局部特征并经重参数化采样128维连续隐变量,转置卷积加旋转位置编码(RoPE)Transformer解码器重建波形,多尺度短时傅里叶变换(MS-STFT)判别器提供对抗监督。重建分支在算损失前先经K加权(K-weighting)感知滤波以突出敏感频段,幅度监督覆盖中侧左右(MSLR)四路而相位相关损失只监督左右(LR)声道。与对称结构和A加权做法不同,该机制把心理声学与声像约束直接写进优化目标而非依赖判别器隐式学到。在MuChin上该模型梅尔距离0.55、多尺度谱距离1.17、尺度不变信噪比(SI-SDR)9.99 dB,均优于次优基线,主观平均意见分(MOS)达4.70。该结论的适用边界受限于音乐重建任务,向通用音频、低码率语音、极端削波和强混响场景的泛化尚未验证,且对细微空间效应的衰减倾向仍需改进。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要解决哪类失真?
本文的输入是已经完成混音与母带的立体声音乐波形,目标是把它先压缩成低维连续隐变量,再解码回与原信号在听感上难以区分的波形。这不是生成新旋律的任务,而是压缩与解压缩的保真任务。初学者容易把变分自编码器理解成只管生成,其实在这里它承担的是感知压缩器的角色:编码器丢掉人耳不敏感的信息,解码器尽力恢复敏感的谐波、瞬态与声像。
论文报告现有开源模型常出现两类可听伪影,一是瞬态涂抹,也就是鼓点起振变软、清晰度下降,二是立体声声像不准,也就是乐器左右位置与宽度发生变化。原因是训练目标没有对齐听觉,缺少对相位与空间的有效监督。作者因此提出名为 ear-VAE 的模型,输入输出均为 44.1 千赫立体声,强调高频谐波与空间特性的重建。本文后续按学习依赖展开,先讲路线差异与整体流程,再讲每个损失与结构的作用,然后讲训练数据管线与 3 阶段训练,最后讲评价条件、主结果与消融反证。
需要保留的关键信息是:模型自称为开源音乐重建模型,但本次收到的证据中资源状态为未发现可用链接,因此不能写代码权重已公开,只能写论文正文给出仓库地址而本次未能确认可达;所有数字结论都依赖原文报告的客观指标与 5 位专业混音师的主观评分,不能推广为所有音乐类型都成立。
同输入同目标的路线有哪些,为何选连续表示?
同输入同目标的路线主要有两条。第一条是离散量化路线,以向量量化变分自编码器为起点,代表是 EnCodec 与 DAC 这类神经音频编解码器。做法是把波形编码成离散码本序号,再用对抗损失与特征匹配提升听感,优点是压缩率高、适合传输,但瓶颈处的量化会直接丢掉细微信号细节,对重建上限不利。第二条是连续表示路线,代表是 Stable-Audio-Open 的变分自编码器加生成对抗框架,用下调权重的散度约束学习连续隐变量,不做硬量化,潜在保真上限更高。
论文选择第二条路线,理由是重建任务优先忠实恢复而非生成新内容,连续瓶颈更适合保留谐波尾音与弱空间残响。相关工作中还提到声码器判别器的来源,如 MelGAN 与 HiFi-GAN,以及大模型声码器 BigVGAN 的最小二乘对抗目标与多尺度短时傅里叶判别器。需要区分的是,传统生成型变分自编码器如 MusicVAE 用散度约束换取可采样先验,而本文的散度权重极小,主要起正则作用,重心在重建与对抗。
同运行阶段的对照是 EnCodec、DAC、AudioGen 与 Stable-Audio-Open,论文报告在 MuChin 与内部验证集上以 44.1 千赫重建做比较。但要注意内部数据参与了继续训练,因此比较条件不完全公平,解读时必须把数据优势单独说明,不能把类别差异直接当成同条件胜负。
为什么幅度算对了,听起来还是不对?
举一个教学用的例子而非论文数据:假设左右声道幅度谱都已拟合,但左声道某高频分量的相位超前了半个周期,幅度损失几乎不变,人耳却会听到瞬态位置偏移与声像漂移。这说明只监督幅度会放过相位错误。论文指出的问题正在于此,现有模型对相位与 Mid-Side 空间缺乏直接监督机制。
具体分解为 3 个可操作问题。第一,频率加权不对齐听觉,训练时对所有频带平均用力,导致中高频谐波投入不足。第二,相位没有可微监督,短时傅里叶幅度距离与梅尔距离都不惩罚相位旋转,瞬态与清晰度受损。第三,空间监督方式不当,Mid-Side 能表达宽度,但若在 Mid-Side 上强行收敛相位,反而可能扭曲原始左右声道间的相位差。
因此论文把问题定义为训练范式的改造,而非单纯加大模型。输入仍是波形,输出仍是波形,改变的是算损失之前先做什么变换、在哪个表示上算哪种损失。后续方法部分将沿一个样本走完输入到输出,再解释每个变换的监督来源。
一个样本如何走完编码、瓶颈、解码与两路监督?
先沿一个立体声片段走全程。波形进入由步进卷积块构成的编码器,用 SnakeBeta 激活提取局部特征,输出均值与方差参数,经重参数化采样得到隐变量。隐变量不直接进卷积解码器,而是先经过纯自注意力分支的变换器块建模长时依赖,再经转置卷积上采样恢复波形。解码后的波形与原始波形分别送入两条监督支路,一条是重建支路,先经 K 加权滤波再算多尺度频谱与相关损失,另一条是对抗支路,直接送多尺度短时傅里叶判别器算真假与特征匹配。
下段导读图 1 有助于建立整体因果链,重点看主路径与两条支路的分叉位置,以及 K 加权只加在重建侧的安排。
看图路径: 1. 先从左侧波形输入沿编码器到重参数化再到解码器的主链路走一遍;2. 观察重参数化后的隐变量直接进入纯自注意力分支的位置;3. 对比上方重建损失支路与下方对抗损失支路各自接收哪两路信号;4. 确认 K 加权滤波器只出现在重建损失之前而不在对抗支路上
论文图 1。原论文 Figure 1:“Architecture of εar-VAE, where the re-parameterized latent z is directly processed by the transformer blocks with pure self-attention branch.”。
从像素可见,主链从左侧波形经卷积编码器进入虚线框的重参数化模块,框内分为均值与方差两路汇合为隐变量,之后经过标注倍数的自注意力堆叠再进入卷积解码器,输出端画出重建波形。重建波形与原始波形在右侧分叉,上方蓝色支路先经过两个圆形滤波符号并标注 K 加权,再进入重建准则得到重建损失,下方绿色支路与原始波形直连进入判别器得到对抗损失。该布局对应正文说法:重建损失是感知加权后的频谱监督,对抗损失是未加权的真假监督,二者交替优化生成器与判别器。
加权、相关与声道拆分各自算什么,为何这样搭配?
先说白话。K 加权感知滤波就是一种听觉均衡器,英文为 K-weighting,源自响度测量标准,它在中高频给正增益、在极低频大幅衰减,使误差计算更重视人耳敏感区。A 加权则是另一种更陡的听觉曲线,对低频与极高频压得更多。论文报告 K 加权比 A 加权更适合音乐,因为它保留了关键的中高频细节,而 A 加权可能把这些细节也衰减掉。实现上论文只在算重建损失时先对信号预滤波,不改变对抗支路的输入。
K 加权感知滤波 × 重建损失: K 加权感知滤波的分工是在计算损失之前对原始波形与重建波形做听觉加权,抬高中高频敏感区、压低不敏感区;重建损失的分工是度量加权后信号的多尺度频谱差异。搭配理由是若直接在原始波形上算误差,模型会平均用力,而先加权再算误差能让梯度集中到人耳敏感的谐波与瞬态上,组合意义是把心理声学曲线变成可微训练目标的权重。
相位相关损失的白话是相位方向一致性检查,英文为 Correlation Loss,灵感来自混音电表。它取真实复频谱与重建复频谱在每个时频点的共轭乘积,归一化后取实部再平均,用一减该均值作为损失。符号含义是分子为共轭相关的实部,分母为幅度加极小常数防止除零,目标是让所有时频点的相位差余弦均值趋近于一。论文明确只在左右声道表示上用相同短时傅里叶参数计算该损失,而在中间侧边通道上去掉该损失,避免对派生通道强行对齐相位。
相关损失 × 相位相干: 相关损失的分工是监督重建复频谱与真实复频谱在各时频点的相位差余弦均值,直接惩罚相位偏离;相位相干的分工是描述评价阶段单通道与跨通道相位误差是否稳定。搭配原因是幅度损失不管相位旋转,而相关损失补上相位方向约束,组合意义是用可训练的相关目标去提升评价时的个体通道相位相干与跨通道相位差保持,从而改善瞬态清晰度。
声道拆分的白话是立体声的两种看法,英文为 Mid-Side-Left-Right split,其中间为左右平均、侧边为左右差。论文的安排是幅度损失用全部中间侧边左右分量,相位相关只用左右分量。理由已在消融中验证,只用中间侧边监督会退化,而只用左右基线更稳。
Mid-Side 分解 × Left-Right 监督: Mid-Side 分解的分工是把立体声拆成中间和与侧边差,显式表达声像宽度与空间差信息;Left-Right 监督的分工是直接在左声道与右声道上约束幅度与相位。搭配原因是只监督 Mid-Side 容易扭曲原始相位线索,而只监督 Left-Right 又不易强调空间,组合意义是论文对幅度用全部 Mid-Side-Left-Right 分量、对相位相关只用 Left-Right,既保留空间细节又避免在 Mid-Side 上强行收敛相位。
生成器结构上编码器负责高效局部特征,解码器变换器负责全局依赖,选用转置卷积而非上采样加卷积是为了保留信号能量与感知响度,代价是高频清晰度略有让步。判别器选用多尺度短时傅里叶判别器而不用恒 Q 变换辅助判别器,理由见后文图 2。所有卷积做权重归一化以稳定训练。
连续隐变量 × 对抗判别器: 连续隐变量的分工是用无量化的高斯后验做高压缩率瓶颈,保留量化会丢掉的细微谐波;对抗判别器的分工是用多尺度短时傅里叶判别器分辨真实与重建,逼迫生成器补足频谱与相位伪影。搭配原因是连续表示保真上限高但容易模糊,对抗信号提供感知层面的修正,组合意义是以变分自编码器加生成对抗的复合目标同时保证压缩可重建与听感真实。
下段导读图 3 用于理解为何选 K 加权而非 A 加权,重点看两条曲线在低频与高频的衰减差异。
看图路径: 1. 先确认横轴为对数频率轴、纵轴为增益、采样率标注为 44.1 千赫;2. 对比红色 K 加权曲线与蓝色虚线 A 加权曲线在低频段的衰减斜率差异;3. 观察 1 千赫附近两条曲线的交点与中高频段的走向分叉
论文图 3。原论文 Figure 3:“K-weighting vs. A-weighting Curve. The frequency axis is log-scaled.”。
从像素可见,横轴为对数频率从约 20 赫到 20 千赫,纵轴为增益,红色实线 K 加权在低频从负 20 分贝快速上升,1 千赫附近归零,中高频升至约正 3 分贝后保持平坦;蓝色虚线 A 加权在 100 赫以下衰减更剧烈,在 2 到 3 千赫达到峰值后向高频明显下落。可见差异是 K 加权对高频保持增益而 A 加权对高频衰减,这直接对应论文说法:K 加权强调人耳最敏感的中高频,只衰减感知不敏感频率,因此更适合在重建损失前做预滤波。
模型如何分阶段训练,损失权重与优化如何设置?
训练分为 3 个阶段,总步数为 2M 步。第一阶段为热身约 10k 步,只训练生成器,用短时傅里叶与散度损失并做学习率线性热身,此时判别器不参与。第二阶段为预训练约 1M 步,在公开数据上激活全部损失并交替训练生成器与判别器,学习率在 200k、400k 与 600k 步减半。第 3 阶段为继续训练约 1M 步,在内部约 10000 小时专业音乐数据上用相同损失配置继续训练,学习率保持恒定。优化器为 AdamW,论文给出明确超参数,判别器与生成器按最小二乘生成对抗目标交替更新。
下表整理论文明确报告的可复现训练超参数,比较问题是不同损失量级如何平衡,公平条件是同一优化器与步数框架,指标方向是权重越大对应分量梯度占比越高。
| 配置项 | 参数值 | 适用对象 | 训练阶段 | 备注 |
|---|---|---|---|---|
| 重建幅度权重 | 50 | 生成器 | 预训练与继续训练 | 平衡幅度误差量级 |
| 相关损失权重 | 10 | 生成器左右声道 | 预训练与继续训练 | 只监督相位相关 |
| 特征匹配权重 | 20 | 生成器 | 预训练与继续训练 | 判别器中间层距离 |
| 对抗权重 | 1 | 生成器 | 预训练与继续训练 | 最小二乘目标 |
表后解释是论文报告散度权重设为极小值以保证连续表示的保真,观察到模型对小幅系数变化鲁棒,但当散度权重超过阈值时重建质量明显下降。代价是判别器与重建损失的相对平衡依赖经验设定,未报告自动搜索过程。未胜出项是更大的散度约束本有助于先验规整,但在这里会牺牲重建,因此作者选择保真优先。未评测边界是不同 batch 与学习率调度下的敏感性未展开。
优化细节上编码解码步长、隐变量维度与判别器分辨率均有明确报告,见后文复现表。梯度路径方面论文只说明生成器损失包含五项加权和、判别器损失为对抗损失,交替优化,但未给出是否对判别器截断梯度或对编码器冻结等细节,复现时应按标准交替更新实现并记录缺项。
数据如何过滤,评价指标与基线条件是什么?
数据管线分 2 级。第一级为格式与响度标准化,丢弃原生采样率低于 44.1 千赫的文件,保留 44.1 千赫及以上并下采样到 44.1 千赫立体声,再用综合响度指标只保留负 22 到负 5 响度单位之间的曲目,去除声学极端样本。第二级仅用于内部数据,做真峰过滤,丢弃真峰超过正 1 分贝的曲目,但比严格拒绝任何削波更宽松,以容忍现代母带中常见的有意轻微削波。训练先用公开混合数据做预训练,包括环境声与音乐数据集,再用内部专业音乐做继续训练。
评价设置上客观指标主要来自音频损失库,包括多尺度短时傅里叶距离、多尺度梅尔距离与尺度不变信噪比,方向是距离越小越好、信噪比与相干越高越好。论文还引入两个仅用于评价的相位指标,个体通道相位相干衡量单通道内相位误差的稳定性,跨通道相位相干衡量左右声道间相位差误差的保持程度,均做能量加权平均。此外测量真峰响度差与主观平均意见分,主观评分为 5 点量表,由 5 位专业混音师按空间保真与音色分级。
基线为 EnCodec、DAC、AudioGen 与 Stable-Audio-Open,均用官方权重在 44.1 千赫下重建 MuChin 与内部验证集。需要强调的不公平条件是本文模型部分受益于内部继续训练数据,论文脚注已提示解读时考虑该优势。聚合口径上多尺度指标用特定傅里叶尺寸与 1/4 窗长的跳长,但未报告置信区间与显著性检验,这是后续验证需要补的项。
主结果测了什么,谁在什么条件下更好?
主结果要回答的问题是在相同采样率重建下,新模型是否在频谱距离、相位相干、信噪比与主观分上同时占优。论文报告在两个验证集上新模型全面领先,尤其高频谐波与空间特性。受证据限制,这里不复述原宽表全部裸值以免引入未逐字覆盖的数字,改为用正文连续原句可支撑的消融关键数字展示可运行策略的收益,完整宽表趋势请回到原文表 1 核对数据集、基线版本与聚合对象。
下表聚焦论文明确用连续原句报告的 2 次改进,比较问题是相关损失与去掉恒 Q 变换判别器是否带来可运行的提升,公平条件是同一内部评测子集与同一多尺度配置,指标方向是信噪比越高越好、梅尔距离越小越好。
| 策略 | 尺度不变信噪比 | 梅尔距离 | 短时傅里叶距离 | 论文给出的机制解释 |
|---|---|---|---|---|
| 增加相关损失 | 9.85 | 0.61 | 1.07 | 显式建模通道间相关提升谱相干 |
| 去掉恒 Q 变换判别器 | 10.56 | 0.54 | 1.03 | 允许优化全频带响应谱更干净 |
| 采用 K 加权 | 10.86 | 0.51 | 1.01 | 保留中高频关键细节 |
| 增加变换器块 | 11.00 | 0.49 | 1.01 | 建模长时依赖细化谐波 |
表后解释是 2 次改进均有明确代价与反例。相关损失的收益是信噪比显著提升,但它只加在左右声道,若误加到中间侧边反而扭曲相位线索,这是未胜出项只用中间侧边监督退化的原因。去掉恒 Q 变换判别器的收益是客观指标全面变好,代价是放弃了对低中频旋律特征的额外强调,论文用图 2 解释该取舍。需要说明的边界是主观平均意见分在原文表 1 中同时报告,但自动指标好不等于每首曲目主观都好,且内部集上的优势部分来自继续训练数据,不能直接推广为跨库最优。
拿掉或换掉每个组件会发生什么,恒 Q 变换为何被去掉?
消融按依赖顺序分 4 组。第一组比较立体声监督,只用中间侧边比只用左右基线差,说明对派生通道强行收敛相位会失真;加上相关损失后信噪比提升,支持通道间相关比独立监督更有效地增强谱相干。第二组比较辅助判别器,降低恒 Q 变换权重与完全去掉均带来指标改善,支持音乐重建任务中去掉该监督能优化全频带响应。第三组比较感知加权,K 加权优于 A 加权,支持保留中高频的说法。第 4 组加入两层变换器达到最优,支持自注意力对长时谐波结构的作用。
下段导读图 2 用于理解第二组消融,重点看恒 Q 变换与短时傅里叶在能量分布上的偏差。
看图路径: 1. 先确认横轴为对数频率、纵轴为能量幅度、标题注明三分之一倍频程尺度;2. 对比蓝色恒 Q 变换曲线在低中频的尖峰与红色短时傅里叶曲线在中高频的连续谐波;3. 观察 10 千赫以上两条曲线的能量差异与高频谐波保留情况
论文图 2。原论文 Figure 2:“Energy&Resolution-normalized frequency response comparison between CQT and STFT of a chorus excerpt.”。
从像素可见,标题注明三分之一倍频程尺度下的能量分布对比,横轴为对数频率从 20 赫到 20 千赫,纵轴为能量幅度,蓝色恒 Q 变换曲线在 50 到 100 赫附近有高尖峰而在中高频迅速贴近零,红色短时傅里叶曲线在低频更平滑且在数百赫到数千赫保留大量梳状谐波峰,在 10 千赫附近仍有明显包络。这支持正文判断:恒 Q 变换过度强调低中频旋律特征而丢失高频谐波,短时傅里叶提供更均衡的频率响应,因此去掉恒 Q 变换辅助判别器后频谱更干净。像素不能精确读出每个峰的数值,结论只到趋势层面。
反证方面论文也报告了失败条件:散度权重过大导致重建下降,转置卷积保留能量但高频清晰度略逊于上采样加卷积,适度削波被保留而非全部丢弃。这些都是复现时需要保留的权衡,不能只记最优数字。
哪些结论还不成立,哪些边界没有测?
首先是数据公平性限制。模型在内部约 10000 小时数据上继续训练,而基线没有享受该数据,因此主结果中的领先部分来自方法、部分来自数据,论文已提示考虑该因素。严格的同数据复训对比未报告,不能把领先全部归因于损失设计。
其次是评价覆盖限制。客观距离与相位相干不能替代人评,主观评分仅 5 位混音师平均,未报告评分者一致性、曲风分层与统计显著性。真峰差、延迟、实时率与训练成本未系统测量,不能承诺这些量得到改善。论文结论中也承认模型倾向于衰减微妙空间效果,未来需针对性损失改进,这属于已知的未解决方向。
最后是实现缺项。变换器层数、步长与窗口尺寸已报告,但梯度截断、判别器更新频率、数据增强与随机种子均未明确,恒 Q 变换判别器的具体权重调度只给定性描述。这些缺失不是技术错误,但在复现时必须如实记录为未知条件,不从模型名称推定实现。
要复现应先做什么,需要哪些超参数与数据条件?
复现先做数据管线而非直接训练。按原文 2 级过滤实现采样率、响度与真峰筛选,公开阶段用环境声与音乐混合,继续训练阶段用高质量立体声音乐。信息条件是保留 44.1 千赫立体声,避免上采样伪影,响度区间与真峰阈值按原文设置。
下表整理结构与优化的可执行配置,比较问题是复现时哪些参数必须原样保留,公平条件是同一隐变量维度与多尺度分辨率,指标方向是偏离这些值可能改变压缩率与保真权衡。
| 模块 | 配置值 | 作用阶段 | 论文说明 | 复现提示 |
|---|---|---|---|---|
| 编码解码步长 | [2, 4, 4, 4, 8] | 压缩率 | 卷积下采样 | 决定隐变量帧率 |
| 隐变量维度 | 128 维 | 瓶颈 | 均值方差各 64 维 | 保持连续无量化 |
| 变换器层数 | 2 层 | 解码 | 旋转位置编码 | 只加在解码侧 |
| 短时傅里叶窗口 | [2048, 1024, 512, 256, 128] | 重建与判别 | 多尺度 | 与评价窗口区分 |
| 总参数量 | 141M | 全模型 | 含判别器 | 核对显存预算 |
表后解释是训练时先热身生成器再交替训练,优化器与权重按前文表格设置,硬件预算为 8 卡,判别器用多尺度短时傅里叶而不用恒 Q 变换分支。代价是 2M 步训练成本较高,小资源复现可先在子集上验证消融趋势。未胜出路径是若直接加入恒 Q 变换判别器,预期高频谐波指标可能回落,需记录该负结果。
关于可用性必须准确表述:论文正文给出仓库地址与权重、推理配方、滤波器与损失实现、评价框架与试听样例的发布承诺,但本次未发现可验证的可用资源,因此只能写链接本次未能确认可达,不能写已公开可下载。区分代码开源、权重下载与系统可运行三者,缺一不可称为可运行。
何时值得尝试这种改造,记住哪条因果链?
当任务是音乐压缩重建且抱怨瞬态发软、声像变窄、高频泛音丢失时,值得尝试本文的三件套:先在重建损失前加 K 加权让梯度重视中高频,再在左右声道上加相位相关损失补齐相位方向,最后幅度用全部分量而相位只用左右分量以保护空间。当任务是语音低码率传输或需要离散码本时,则不适合照搬,因为连续表示与对抗训练的成本和稳定性假设不同。
记住一条因果链即可复述方法:波形经卷积编码到连续隐变量,经自注意力解码回波形,重建侧先听觉加权再算多尺度幅度与左右相关,对抗侧用多尺度判别器逼真,散度只做极小正则。3 阶段训练先热身再公开预训练最后内部对齐,评价同时看频谱距离、相位相干与主观空间分。
还需补的验证是同数据下的公平复训、曲风分层的显著性检验,以及推理延迟与显存的实测。只有补齐这些,才能把论文报告的优势从有限解释升级为可部署结论。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


