英文题目:AURA: Audio-Geometry Conditioned U-Net Refinement with Flow Matching for High-Fidelity Monaural-to-Binaural Synthesis
会议身份:
conference:interspeech:2026:conference-paper-id:zhang26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#流匹配 #空间音频信号 #语音 #空间音频渲染
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Wenjie Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Changjun He:机构信息未能从会议 PDF 纯文本可靠映射
- Yinghan Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Shiyun Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Mingjiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务以单声道音频与声源位置姿态序列为输入,直接合成双耳波形,难点在于单声道缺失头间级差与时差线索,且混响与环境微细节呈随机弱信号难以从内容推断。方法链分三步:先用时间动态规整对齐单声道内容与几何运动,再经混合Transformer-CNN下采样块提取全局与局部表征并由空间增强残差上采样块融合多阶段姿态条件生成粗粒度双耳估计,粗估计加噪作为先验起点进入下一步。最后条件流匹配网络以加噪估计与时刻及姿态序列为条件学习最优传输直线路径上的恒定速度场,并用10步定步长Euler求解器积分得到精修双耳波形。相对BinauralGrad类随机扩散逆过程,关键差异是用显式姿态条件的连续时间流匹配替代扩散生成,使训练退化为稳定速度回归并更好补足声传播细节与空间微线索。在KEMAR基准测试集下,AURA的Wave-L2指标为0.123,低于BinauralGrad的Wave-L2指标0.128。结论适用边界受限于2小时KEMAR人头1.5米内近场语音语料,尚未验证对多说话人、音乐、强混响与未见头型的外推能力。在计算量方面,AURA的参数量为11.26M,乘加运算量为759.17M,训练成本为300000步余弦退火训练。
🔗 开源与复现资源
- 演示资源:https://ethuil.github.io/AURA/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入只有单声道时,输出要保留什么?
这篇论文研究的输入是单声道音频加上一段几何序列,几何包括声源相对听者的位置和朝向,朝向用单位四元数表示。目标是从这些输入合成双耳 2 通道波形,要求既有可懂的内容,又有能让人判断方位和距离的空间感。必须保留的信息有两类,一类是内容对应的频谱包络和时序,另一类是双耳级差与时差。白话说,双耳级差与时差就是左右耳听到的声音大小不一样、到达有先后,英文是 ILD 与 ITD,人靠它们判断声源在左还是右、远还是近。
传统做法是用头相关传输函数来渲染,英文是 HRTF,也就是在离散位置上测好耳朵的滤波器,需要哪个方向就取哪个滤波器来卷积。这种做法在消声室和固定头模下有效,但论文指出它 tied 到固定采集装置,难以处理声源与听者相对运动、环境噪声和混响。学习类方法则想从数据里直接学单声道到双耳的映射,但单声道本身不显式编码姿态和运动,所以模型必须显式引入几何条件,否则只能靠猜。
双耳级差与时差 × 头相关传输函数: 双耳级差与时差是人判断方位的线索,分别对应两耳的能量差和到达时间差,头相关传输函数是传统方法用离散位置测量来近似这些线索的滤波器库,二者关系是前者为感知目标、后者为一种实现手段,但固定测量难以覆盖运动与混响。
对刚入门的读者,可以这样走一遍样本。输入是一段 200 ms 的单声道切片和同步的 7 通道几何序列,其中 3 通道是位置、4 通道是朝向。模型先把音频按几何做时间对齐,再提取特征并重建出左右 2 通道,最后用生成式细化补上混响和微观空间细节。输出是与输入内容一致、但左右耳有合理差异的双耳波形。演示页当前可用,地址为官方展示页,本文写作时状态码为 200,读者可以听例子对照空间感,但听感例子不能代替受控评测。
同输入同目标的前人走了哪几条路?
在只有单声道的设定下,最接近的前人是 WarpNet。它引入时变弯曲模块,英文是 Time Dynamic Warping,简称 TDW,按相对几何对单声道做动态时间对齐,再用条件超卷积融合音频与几何。AURA 沿用了 TDW 作为入口,说明作者认可先对齐再建模的路线。
第二条路是 BinauralGrad 的 2 阶段扩散。它先从 TDW 估计中生成共享的双耳公共成分,再合成双耳差异成分得到最终信号。AURA 同样是 2 个阶段,但第二阶段不用扩散而用条件流匹配,论文给出的理由是连续时间形式优化更稳定、训练目标更简单。这是有源对照,不是无条件说流匹配一定更好。
第三条路是在傅里叶域做渲染的 NFS,强调可解释性和跨声源域的鲁棒性。第四条路是 DPATFNet,用双位置注意力融合位置线索并考虑多普勒效应。论文报告 DPATFNet 在 Phase-L2 上强,但模型更大。还有一类用视觉辅助的工作,用图像或深度帮助生成双耳,但本文明确限定为只有单声道可用的最基本设定,所以视觉方法不在同条件比较之列,不能把类别差异当成同条件胜负。
难在哪里:内容要保真,空间又要凭空推?
难点在于单声道把左右耳信息混成一路,空间线索是丢失的。模型既要从几何序列推断出合理的左右差异,又不能破坏音色细节。弱的或随机的成分更难,例如背景氛围和细微的空间微线索,在单声道里能量很小,却决定了是否像真实录音。
论文把这个问题拆成两步。第一步做粗估计,解决大结构和大致方位。第二步做细化,专门补那些难以回归的随机声学细节。这种拆分的学习依赖是,先让判别式网络学确定性映射,再让生成式模型学残差分布。如果粗估计方向错了,细化只能在附近修正,不能凭空搬运声源位置,这一点从细化的先验构造可以看出,起点就是粗估计加小噪声。
评价也要两面看。客观上用波形均方误差 Wave-L2、幅度误差 Amp-L2 和相位误差 Phase-L2,方向都是越小越好。主观上用总体 MOS、空间感 Spatial MOS 和与真值的相似度 Similarity MOS,方向都是越大越好。只看其中一面会误判,例如波形误差小不一定空间感好,相位误差小不一定音色自然。
AURA 全景:一条主路加一个细化器如何分工?
AURA 的输入是单声道波形 Mono 和姿态序列 Pose,输出是双耳波形。主路自下而上是 TDW 对齐、多个 Transformer-CNN 下采样块 TCDB 提取特征、空间感知与运动注意力 SAMA 注入几何、多个空间增强残差上采样块 SERUB 重建出粗双耳估计。细化器是条件流匹配,以粗估计加噪为起点、以真值为终点,在姿态条件下学习速度场,推理时解常微分方程得到精修波形。图注明确虚线表示跳连,右侧细化分支以空间信息和中间状态为条件。
对照图 1 阅读时,先把 4 个面板当成从左到右的说明书,最左是上采样块,最右是细化网络,中间是整体流水线,这样就不会把细化网络当成独立声码器。
看图路径: 1. 先从底部 Mono 与 Pose 入口向上追踪 TDW 到 TCDB 再到 SERUB 的主路径;2. 再看虚线跳连把浅层音频特征送到深层重建的位置;3. 对比最右侧细化分支中 Pose 与中间状态 xτ 在底部相加进入 CNN 堆叠的方式;4. 确认 SAMA 在中间把几何特征拼接到音频特征的位置
论文图 1。原论文 Figure 1:“Overview of the AURA architecture. (a) illustrates the detailed architecture of the Spatial-Enhanced Residual Upsample Block (SERUB).”。
从像素看,中间面板底部有两个入口,左侧波形图标对应 Mono,右侧地球图标对应 Pose,TDW 只接 Mono 一路,Pose 则从右侧长竖线直接送到上方的 SERUB 和 SAMA,这说明几何是多处注入而非只在入口用 1 次。最左侧 SERUB 面板显示底部 1×1 卷积后有一个拼接点接入 Pose,上方还有一个拼接点接入 Skip,顶部经过上采样和归一激活后输出,虚线框内标注重复次数与编码器层数有关。最右侧细化面板底部同样是 Pose 与中间状态相加进入 CNN 堆叠,中间按层数重复,顶部输出随时间的变化率,整体构成条件速度场。这种多处条件注入是 AURA 与只在入口融合几何的方法的关键区别。
下采样与上采样块:全局和局部由谁来做?
TCDB 是下采样块,内部有两条分支。左侧 Transformer 分支先归一化再做多头自注意力 MHSA,再经 1×1 卷积和 SimpleGate 做前馈,SimpleGate 替代了传统前馈网络,目的是更高效地传播信息。右侧 CNN 分支用 1×1 和 3×3 深度卷积编码通道与空间局部模式,带有归纳偏置。两条分支各有可学习缩放系数,图注写明阿尔法与贝塔均为可学习参数,最后逐元素相加输出。输入先经过底部的 DownSample,输出为深层音频特征。
SERUB 是上采样块,内部把 1×1 卷积、拼接 Pose、多层归一激活按编码器层数重复,再与来自浅层的 Skip 特征拼接,最后经上采样输出。论文强调在 SERUB 多阶段拼接空间信息以增强空间感知,同时保留浅层音频特征防止下采样丢失细节。复述时要记住,TCDB 负责压缩并提取表示,SERUB 负责在几何条件下展开重建,跳连负责把低层细节送回。
Transformer 分支 × CNN 分支: Transformer 分支用多头自注意力抓长时上下文和声源运动趋势,CNN 分支用 1×1 与 3×3 深度卷积抓局部纹理和谐振细节,搭配理由是双耳信号既有长距离包络又有短时频谱纹理,二者融合后得到同时保留全局与局部的特征。
消融显示拿掉任 1 分支都会让 Wave-L2 从 0.123 升到 0.132 或 0.130,说明全局与局部都对波形保真有贡献,但这只是支持两者有用,不证明两者缺一不可的因果强度,仍需结合具体数据分布理解。
下面这张图是 SAMA 的放大结构,需要在同一小节内形成读图闭环,重点看位置与朝向如何分开再融合。
看图路径: 1. 先看左侧自注意力与残差回路如何处理 7 通道几何序列;2. 再看中间 Split 把位置与朝向分成 Pos 与 Ori 两路送入交叉注意力;3. 观察右侧 1×1、3×3、5×5、7×7 多尺度卷积汇合后再做拼接的分支
论文图 2。原论文 Figure 2:“The architecture of Spatial-Awareness and Motion At- tention (SAMA), where γ1 and γ2 are all learnable parameters.”。
从像素看,该图是一条从左到右的单链。最左输入先过归一化和自注意力,再乘以可学习系数伽马 1 后与原始输入相加。中间再次归一化后做 Split,分出 Ori 朝上与 Pos 朝下两路,一起进入黄色交叉注意力块,随后接 4 个不同核尺寸的并行卷积再拼接,经 1×1 卷积与归一激活后乘以伽马 2,最后与中间残差相加输出。图注同样说明伽马均为可学习参数。教学动作是,先确认自注意力处理的是 7 通道几何的上下文,再确认交叉注意力建模的是位置与朝向的相互关系,最后确认多尺度卷积是在融合不同时间尺度的运动信息,而不是在处理音频频谱。
几何注意力 SAMA:位置和朝向如何一起起作用?
SAMA 的输入是形状为批次乘 7 乘长度的几何序列,7 等于 3 维位置加 4 维单位四元数朝向。步骤是先做自注意力抓上下文,再做交叉注意力建模位置与朝向的关联,再用多尺度卷积在不同尺度上提取空间信息,最后经 1 维卷积、归一化和激活输出,全程带残差。
时变弯曲 × 空间感知与运动注意力: 时变弯曲负责按几何把单声道在时间轴上先对齐到双耳的大致延迟和增益,空间感知与运动注意力负责把位置和朝向序列编码成权重去调制音频特征,二者搭配的原因是前者解决粗对齐、后者解决方向变化时的细调制,组合后网络不再只靠音频内容猜空间。
论文没有给出 SAMA 内部注意力头数和卷积通道数的完整配置,这是复现时的缺项,只能按描述实现自注意力加交叉注意力加多尺度融合的骨架,缺失的超参数需要自行搜索并报告。消融中去掉 SAMA 后 Wave-L2 变为 0.145,Amp-L2 为 0.031,相位误差也上升,支持它对空间建模有用。但要注意这是单数据集上的结果,不能推广为任何场景下去掉几何注意力必然掉这么多。
条件流匹配:从粗估计走到真值的速度场怎么学?
细化阶段记粗估计为 2 通道波形,真值为同形状波形。先验构造是粗估计加各向同性高斯噪声,噪声强度由西格玛控制,论文取 0.01。目标样本就是真值。两者之间用线性最优传输路径连接,中间状态是两端的线性插值。对应的目标速度场是终点减起点,为常数场。
网络学习 1 个条件速度场去拟合它,训练损失用 L1,条件是姿态序列。关键细节是网络输入只有中间状态、时间步和姿态,粗估计只通过起点隐式影响细化,显式空间条件只来自姿态。
粗估计 × 条件流匹配细化: 粗估计给出双耳波形的基本结构和大致空间感,条件流匹配细化以粗估计加噪为起点学习一条指向真值的速度场,搭配原因是单声道缺失的环境混响与微观空间线索难以 1 次回归写准,分两步后第二步只补残差细节。
推理时从粗估计加噪出发,用固定步长欧拉求解器走 10 步,解由学到的速度场定义的常微分方程,终点即为精修双耳输出。细化网络本身按层数配置为下、中、上 3 段重复次数分别为 1、3、1。去掉细化后 Wave-L2 升到 0.183 而幅度误差基本不变,说明细化主要补的是波形时域细节而非单纯的频谱能量,这与论文称其补空间微线索的说法一致,但仍属于有限解释,不是直接观测到微线索的证明。
损失和优化:四个目标各自监督什么?
训练用复合损失,包含波形 L2、相位误差、幅度误差和流匹配损失,权重分别为 1.0、1.0、0.01 和 1.0。波形 L2 是合成与真值的均方误差。相位与幅度误差先做短时傅里叶变换,再分别比较相角和幅值。流匹配损失是预测速度场与目标速度场的 L1 距离。幅度权重明显更小,复现时不要自行改成等权,否则频域监督占比会被放大。
波形均方误差 × 幅度与相位误差: 波形均方误差在时域约束整体波形接近真值,幅度与相位误差在短时傅里叶域分别约束频谱能量和相位结构,搭配原因是只看波形容易忽略听感相关的频域差异,组合损失让时域对齐与频域听感同时被监督。
优化器用 Adam,最高学习率 0.001,最低 0.00001,用余弦退火加 1000 步线性暖机,总共训练 300000 步。每批含 200 ms 音频。归一化用批量归一化,激活用 GELU。TCDB 与 SERUB 各 6 层,SERUB 内编码器重复数设为 3。论文未报告批量大小对应的样本数、短时傅里叶窗长跳长、相位误差的具体距离形式,也未说明各损失是否在同一分辨率下计算,这些是复现时需要补齐或对齐原实现的缺项,不能从模型名推定。
数据、划分与指标:比较条件是否一致?
数据集采用前人提出的非消声室录制集,据称是目前唯一在消声室外录制的公开配对集。听者用 KEMAR 假人加双耳麦克风,被试在 1.5 m 半径内围绕假人移动并说话,共 2 小时 48 kHz 配对录音。划分沿用原训练验证测试切分,与 NFS 一致,这保证了与表中基线的可比性。主观评测招募 15 名听者,对测试集样本按 1 到 5 打分,含总体、空间感和相似度三项,汇总时跨听者和样本聚合,并报告 95% 置信区间。在线双盲、随机顺序、方法名隐藏,用来减少顺序效应。
客观指标方向要记牢,Wave-L2、Amp-L2、Phase-L2 都是误差,越小越好。主观指标越大越好。参数量 Param 与乘加数 MACs 用来看代价,传统 DSP 方法用公开 CIPIC 库合成,不计参数。硬件预算论文未报告,这是部署评估的缺项,不能把参数少直接等同于延迟低。
成本上 AURA 为 11.26 M 参数,MACs 较高,论文称相比 BinauralGrad 参数和计算更少但性能更好,相比 NFS 则参数和计算更大但性能更好。这种比较只在同一数据集和同一指标下成立,换数据集或换采样率后结论需重新验证。
主结果:哪里赢了,哪里没赢?
比较的问题是,在同一非消声室数据集上,AURA 相对可运行的神经基线能否同时提升波形保真和听感。公平条件是同一划分、同一采样率、同一客观与主观协议。指标方向如上,误差越小越好,MOS 越大越好。
| 模型 | 年份 | Wave-L2 越小越好 | Amp-L2 越小越好 | Phase-L2 越小越好 | 参数量与计算 |
|---|---|---|---|---|---|
| WaveNet | 2016 | 0.179 | 0.037 | 0.968 | 4.65 M,22.34 G |
| WarpNet | 2021 | 0.167 | 0.048 | 0.807 | 8.59 M,4.27 G |
| BinauralGrad | 2022 | 0.128 | 0.030 | 0.837 | 13.82 M,15.32 G |
| NFS | 2023 | 0.172 | 0.035 | 0.999 | 0.55 M,357.58 M |
| DPATFNet | 2025 | 0.148 | 0.037 | 0.717 | 14.88 M,2.44 G |
| AURA | 2026 | 0.123 | 0.028 | 0.843 | 11.26 M,759.17 M |
表后解释要同时看到收益与代价。AURA 在 Wave-L2 的 0.123 优于次优的 0.128,在 Amp-L2 的 0.028 也是最好,支持粗到细路线对波形与幅度保真的提升。但 Phase-L2 的 0.843 并未最好,最好的是 DPATFNet 的 0.717,这是一个明确的未胜出项,说明相位结构仍有差距。计算上 AURA 的 MACs 明显高于表中多数基线,NFS 以极小参数实现中等性能,说明 AURA 是用更高计算换取波形与听感收益。总体趋势不等于每段音频都更好,论文只报告聚合均值,未给出按方位或运动速度分组的结果。
主观部分的问题是,听感的总体、空间感和相似度是否一致提升。条件是 15 人双盲随机顺序。
| 模型 | 年份 | 总体 MOS 越大越好 | 空间感 MOS 越大越好 | 相似度 MOS 越大越好 |
|---|---|---|---|---|
| DSP | - | 3.47±0.23 | 3.46±0.179 | 3.62±0.157 |
| WaveNet | 2016 | 3.57±0.178 | 3.54±0.326 | 3.92±0.317 |
| WarpNet | 2021 | 3.47±0.145 | 3.67±0.242 | 3.67±0.238 |
| BinauralGrad | 2022 | 3.53±0.181 | 3.84±0.132 | 3.78±0.215 |
| NFS | 2023 | 3.42±0.315 | 3.56±0.328 | 3.63±0.223 |
| DPATFNet | 2024 | 3.56±0.17 | 3.78±0.176 | 4.14±0.257 |
| AURA | 2026 | 3.82±0.152 | 3.89±0.127 | 4.21±0.137 |
AURA 总体 3.82 超过基线的 3.47,空间感 3.89 与相似度 4.21 也是表中最高,支持高保真主张。但论文自己也写空间感 across 模型差异不大,可能与听者对空间线索期望更高有关,这提醒不能把 MOS 小幅领先直接读成空间感知已解决。自动指标不能当成人评,相似度高也不等于方位判断准确,因为评测没有报告定位误差或混淆率。
拿掉哪一块会掉多少?反证说了什么?
消融的问题是,TDW、双分支、SAMA 和流匹配是否各自对最终质量有贡献。条件是保持其余结构与训练不变,只移除待测组件。指标仍看 Wave-L2、Amp-L2 与 Phase-L2,越小越好。
| 消融条件 | Wave-L2 越小越好 | Amp-L2 越小越好 | Phase-L2 越小越好 | 说明 |
|---|---|---|---|---|
| AURA 完整 | 0.123 | 0.028 | 0.843 | 可运行的完整策略 |
| 去掉 TDW | 0.223 | 0.031 | 1.183 | 三项全差,对齐缺失影响最大 |
| 去掉 Transformer 分支 | 0.132 | 0.031 | 0.863 | 全局缺失波形掉得多 |
| 去掉 CNN 分支 | 0.130 | 0.029 | 0.904 | 局部缺失相位掉得多 |
| 去掉 SAMA | 0.145 | 0.031 | 0.970 | 几何调制缺失 |
| 去掉流匹配 | 0.183 | 0.028 | 0.906 | 波形掉得多而幅度几乎不变 |
表后要读出机制差异。去掉 TDW 后三项误差全面恶化,支持先对齐再建模是基础。去掉任 1 分支都有损失,但掉的侧重不同,Transformer 缺失更伤波形,CNN 缺失更伤相位,这与全局抓包络、局部抓纹理的分工吻合。去掉 SAMA 后相位恶化到 0.970,支持几何注意力对相位结构重要。去掉流匹配后波形从 0.123 升到 0.183 而幅度保持 0.028,说明细化补的是时域与相位细节,不是简单的能量修正。未评测的边界是噪声强度与求解步数,论文只给西格玛 0.01 与 10 步欧拉,改大改小会怎样仍待验证。
哪些结论还不能下?代价和边界是什么?
论文直接报告的是单数据集上的聚合均值提升,支持在该条件下尝试 2 阶段路线。有限解释是流匹配补了空间微线索与随机声学细节,这与去掉细化后波形大跌而幅度不变的现象一致,但没有直接可视化或分离出微线索,不能当成因果证明。未验证的推测是跨房间、跨头模、跨语种与强运动下的泛化,原文没有这些实验,不能承诺换场景仍有同样收益。
代价要分开讨论。训练资源只给了步数与学习率,未给 GPU 型号与时长,不能评估训练成本。推理开销给了参数与 MACs,AURA 的 MACs 偏高,10 步欧拉求解会增加实际延迟,但输出帧率与端到端延迟未测量,不能把参数更少于 BinauralGrad 直接说成实时可用。相位未胜出、空间感主观差异不大、未按方位分组,都是明确的限制。相关性不是因果,客观误差低与主观好听相关,但不证明是某一个模块单独导致好听,消融是联合证据而非单因证明。
要复现,先对齐什么,再调什么?
复现先做数据与协议对齐。用同一 2 小时 48 kHz 配对集与原划分,保持 200 ms 分批、同一客观指标定义与 15 人双盲主观流程。先跑通 TDW 加 TCDB 加 SERUB 的粗估计基线,确认 Wave-L2 量级,再接入 SAMA 与流匹配。关键超参数保留原文值,TCDB 与 SERUB 各 6 层、编码器重复 3、细化 3 段重复 1 加 3 加 1、欧拉 10 步、西格玛 0.01、损失权重 1.0 加 1.0 加 0.01 加 1.0、Adam 加余弦退火与 1000 步暖机。
缺项要主动补报告。短时傅里叶窗长跳长、相位距离形式、批量样本数、归一化位置、随机种子与硬件耗时,原文未交代,复现时需固定并写明。不要从模型名推定实现,也不要把去掉某块必然怎样当成先验,消融数字只在原文配置下成立。演示页当前可用,可用于定性听感对照,但定量结论必须回到本地评测,不能用网页试听代替测试集分数。代码与权重是否公开在原文中没有给出,不能写已开源,只能说复现需自行实现。
何时值得试 AURA,何时先选更轻的路?
当任务是只有单声道加几何、目标是高保真双耳、且能承受较高计算时,AURA 的 2 阶段值得试,因为它在 Wave-L2 与主观三项上都是表中最好,且消融显示对齐、双分支、几何注意力与细化各自都有贡献。当设备受限或需要极小模型时,先选 NFS 这类轻量路线,因为它以 0.55 M 参数实现可用性能,虽然波形与听感低于 AURA,但部署代价小得多。当相位精度优先时,DPATFNet 在 Phase-L2 上更好,应先对照它的位置注意力设计。
还需补的验证是按方位角、距离、运动速度与混响强度分组的误差,以及定位听辨实验与实际延迟测量。只有补上这些,才能判断 AURA 的收益来自真正的空间建模,还是主要来自波形细节的打磨。对初学者而言,复述这篇论文的关键不是背数字,而是能说清样本如何从单声道与 7 通道几何出发,经过对齐、双分支编码、几何调制、上采样重建,再经 10 步流匹配走到双耳输出,以及每一步拿掉后哪个指标会先变差。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

