英文题目:Probing Spatial Structure in Pretrained Audio Representations
会议身份:
conference:interspeech:2026:conference-paper-id:chen26ba_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #基准设计 #空间音频信号 #声源定位
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Chuyang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Sivan Ding:机构信息未能从会议 PDF 纯文本可靠映射
- Adrian S. Roman:机构信息未能从会议 PDF 纯文本可靠映射
- Juan P. Bello:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理预训练多通道音频表示中空间结构不清的问题,输入为立体声、双耳和一阶Ambisonics渲染的单声源场景,输出为声源级因子与房间级因子的线性可解性判断,难点在于端到端评测将表示质量与下游结构纠缠而难以分离。方法链分三步:可控场景合成负责独立采样声源与房间因子并跨格式匹配渲染,输出房间与声源互不重叠且分布均衡的训练验证测试场景;冻结编码加线性探测负责将帧级嵌入均值池化后训练轻量分类回归器,输出各因子的解码分数;几何敏感度分析负责以前两步的冻结表示为输入,固定其他属性仅扰动一组因子并计算余弦偏移,输出与探测分数互补的几何响应。与HEAR、SUPERB等多通道任务型基准相比,关键差异是以冻结表示加轻量探针替代任务精度,并用AudibleLight保真定位线索、用PyRoomAcoustics独立控制房间参数,从而实现架构无关的表示质量隔离比较。在SARL基准协议下,方位角任务的指标离散区间数为36,高于俯仰角任务的指标离散区间数12。结论适用边界限于单声源合成场景与线性可解信息,未验证真实录音、多声源及非线性探测下的外推能力。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读的对象是 1 篇空间音频表示评估论文。输入是已经预训练好的音频编码器,涵盖单声道、立体声、双耳和 1 阶 Ambisonics 4 种输入格式,以及自监督、监督定位和神经编解码 3 种训练范式。目标不是再训练一个定位器或增强器,而是回答一个表示学习问题:冻结编码器输出的向量里,方位角、俯仰角、距离、事件类别、混响时间、房间体积和房间形状这 7 个因子是否线性可读,以及嵌入几何对声源变化和房间变化是否同等敏感。
解读必须保留的关键信息包括受控仿真如何构造、线性探针如何训练、指标如何聚合、哪些模型在哪些任务上强或弱,以及作者明确声明的单声源合成与均值池化等限制。输出是一套可核对、可复述的方法链条,研究生读后能说清数据从干声到场景的每一步、探针的输入与监督来源、敏感度分数的计算口径,并知道在什么条件下结论成立,在什么条件下不能推广。
已有路线在测什么,为什么还需要探针式评估?
在空间音频一侧,已有路线长期围绕具体任务组织。声事件定位与检测联合预测类别与方向,阵列相关的挑战评估定位、增强、去混响或识别的端到端性能。这类评估的优点是贴近应用,但表示质量、下游结构、监督信号和训练策略被缠绕在一起。当一个系统定位误差下降时,无法判断是编码器本身保留了更好的空间线索,还是下游网络更深、后处理更强。
另一侧是通用音频表示基准,例如面向单声道语义任务的基准,它们覆盖语音、音乐和环境声的分类与理解,但几乎不控制方向、距离和房间参数,因此不能回答空间结构是否被编码。表示学习领域此前已发展出探针方法,用冻结嵌入加轻量分类器检验哪些属性可恢复,并用控制任务排除探针本身的记忆能力。本文的定位是把探针范式搬到空间音频,用统一仿真与统一线性协议补上受控分析的缺口。
需要强调的是,这不是对端到端基准的替代,而是互补:端到端回答系统在真实任务上能走多远,探针回答冻结向量里线性保留了什么。把类别差异当成同条件胜负是常见误解,正确读法是同输入、同目标、同监督阶段内比较,例如都在双耳输入内比较不同自监督目标,或都在监督定位范式内比较不同输入格式。
要解决的判断问题是什么,什么算证据?
论文把评估问题形式化为 7 个探针任务。声源级包括方位角、俯仰角、距离和事件类别,房间级包括混响时间、房间体积和房间形状。连续因子被离散为线性等间隔分箱,分类因子保持类别预测。证据分为两类。第一类是可解码性证据:冻结主干,对每个任务训练线性分类器,连续因子用归一化平均绝对误差的变形分数,分类因子用宏平均 F1,再用相对随机基线的归一化提升聚合为声源定位、语义和房间 3 组分数。
第二类是几何敏感度证据:固定其他条件,只扰动声源组或房间组,比较扰动前后嵌入的余弦相似度相对随机对期望的偏离。只有当两类证据同向时,关于声源与房间差距的判断才更可信。如果只有探针分数高而敏感度低,或反之,就需要检查是探针过拟合、池化丢失时序结构,还是嵌入变化大但方向与任务无关。论文的研究对象是单声源、合成房间、均值池化后的场景级向量,因此任何关于多声源、真实录音或帧级定位能力的推论都超出证据范围,需要额外验证。
方法全景:一个样本如何从干声走到分数?
沿一个样本走完全程最有助于建立依赖关系。起点是一段 10 秒干声,来自 7 类事件池,涵盖环境声、音乐、语音和噪声语料。系统为它采样一组空间参数,包括方位角、俯仰角、距离,以及所在房间的混响时间、体积和形状。然后根据任务家族选择房间脉冲响应生成器:声源级任务使用基于真实房间网格的光线追踪传播,房间级任务使用可独立控制混响与几何的解析房间仿真。
干声与脉冲响应在所属划分内配对,实时卷积渲染为立体声、双耳和 1 阶 Ambisonics 3 种格式,保证跨格式比较时声学条件匹配。渲染后的波形按各编码器原生采样率重采样,送入冻结编码器得到帧级嵌入或令牌序列,再经均值池化得到场景级向量。探针阶段为每个任务训练一个线性分类器,连续因子使用以真值分箱为中心的高斯软标签,分类因子使用独热目标,优化器与轮数全局固定。
评估时连续因子比较预测分箱中心与真值的绝对误差并归一化,分类因子计算宏平均 F1,最后相对随机预测基线做归一化提升。敏感度分析复用同一渲染管线,但构造配对样本:参考场景与变体只在声源组或房间组上不同,计算冻结嵌入的归一化余弦位移并在多对样本上平均。这条链条中,仿真控制保证因子解耦,冻结保证只测表示,均值池化保证跨架构可比,配对扰动保证几何解释只归因于目标因子组。
组件与计算:编码器、探针与敏感度各自负责什么?
编码器组件负责把波形变为向量。论文评估 13 个具名模型,按输入格式组织为单声道的掩码自编码器、立体声的编解码与监督定位模型、双耳的掩码重建与对比对齐模型、1 阶 Ambisonics 的联合嵌入预测与事件无关网络等。白话说,编码器是特征仓库,探针是只读卡尺。探针组件负责把场景级向量映射到离散分箱。它的输入是均值池化后的冻结向量,参数只有一层线性映射加交叉熵训练,梯度不回传到编码器。
连续因子的高斯软标签让邻近分箱共享监督,避免硬分类对边界抖动的过度惩罚,这一步是探针训练特有的平滑,不是编码器重训练。敏感度组件负责度量几何响应。记冻结嵌入为向量函数,对参考场景与配对变体计算余弦相似度,再减去随机样本对的期望相似度并归一化,得到扰动引起的相对位移。声源敏感度固定房间只变声源,房间敏感度固定声源只变房间,因此位移差异可以直接归因于因子组。
3 个组件的依赖顺序不能颠倒:先有受控场景才有可比输入,先有冻结向量才有探针与敏感度,先理解单样本流程才能解释聚合分数。
空间音频表示 × 线性探针: 空间音频表示负责把多通道波形压缩为冻结向量,保留方向、距离和混响等线索;线性探针负责在其上训练一个轻量线性分类器,只检验这些线索是否线性可解码。二者搭配的理由是冻结主干、只训练探针,从而把表示质量与下游结构解耦,组合意义在于实现跨架构的公平比较。
声源级因子 × 房间级因子: 声源级因子指方位角、俯仰角、距离和事件类别,描述声源相对接收点的位置与内容;房间级因子指 RT60、体积和形状,描述全局声学环境。二者搭配的理由是前者可从单次接收观测直接获得,后者需要跨位置推断,组合意义在于揭示预训练表示中局域线索与全局上下文的不对称编码。
输入格式 × 训练范式: 输入格式指单声道、立体声、双耳和 1 阶 Ambisonics,决定模型能接触到何种物理空间线索;训练范式指自监督、监督定位与神经编解码,决定学习信号保留或丢弃何种信息。二者搭配的理由是只有同时控制通道与目标才能分离线索可得性与目标偏置,组合意义在于解释为何同为多通道模型空间性能差异仍很大。
可解码性 × 表示敏感度: 可解码性指用线性分类器从冻结嵌入预测空间因子的准确率,回答信息是否存在且线性可读;表示敏感度指受控扰动前后嵌入余弦距离的变化,回答几何上嵌入对哪类变化更响应。二者搭配的理由是前者看判别边界,后者看流形位移,组合意义在于从解码与几何两个视角交叉验证声源与房间差距。
本研究训练了什么,没有训练什么?
本研究没有训练任何音频编码器主干,所有被评估的编码器参数全程冻结,这是探针范式成立的前提。实际被训练的只有每个任务的线性探针。探针以场景级嵌入为输入,以离散分箱为输出,用交叉熵优化,连续因子用高斯软标签,分类因子用独热标签,优化器为学习率万分之一的 Adam 并配合余弦衰减,训练 20 轮,结果在 3 个随机种子上平均。数据侧也没有人工标注训练,空间标签来自仿真采样时的已知参数,因此不存在标注噪声,但存在仿真与真实的域差距。
构造过程是确定性播种以保证可复现,声源与房间在训练、验证和测试划分之间不重叠,同一声学场景被渲染为 3 种格式以支持匹配比较。需要明确的缺项是原文未报告探针训练的批量大小、权重衰减和早停细节,也未报告各编码器前向推理的耗时与显存占用,因此不能从冻结推定系统输出确定,也不能承诺延迟或成本改善。把无主干训练误读为确定性求解是错误的:仿真采样、探针初始化和优化随机性依然存在,只是通过固定种子和多种子平均加以控制。
实验条件:数据、划分、指标与聚合如何对齐?
数据生成分为干声与脉冲响应两条管线。干声池每类 4000 段,按 3200 段训练、400 段验证和 400 段测试划分,统一转为单声道、24 千赫兹、负 24 分贝相对满幅均方根归一化,并补齐或裁剪到 10 秒。脉冲响应按任务家族分别生成,声源任务侧重几何真实的光线追踪,房间任务侧重可独立控制混响、体积和形状的解析仿真。离散化与评估口径是复现的关键,连续因子分箱数与分类因子类别数全局固定,连续因子用归一化平均绝对误差的补数,分类因子用宏平均 F1,再相对随机基线做提升归一化。
下表提出的核心比较问题是不同因子是否在同一离散化与同一指标下被检验,公平条件是分箱数与指标类型按因子性质事先固定,指标方向均为越大表示相对随机基线提升越大。表后解释见正文后续段落。
| 因素组 | 因素 | 类型 | 离散档数 | 评估指标 |
|---|---|---|---|---|
| 声源级 | 方位角 | 连续分箱 | 36 | 归一化误差补数 |
| 声源级 | 俯仰角 | 连续分箱 | 12 | 归一化误差补数 |
| 声源级 | 距离 | 连续分箱 | 20 | 归一化误差补数 |
| 声源级 | 事件类别 | 分类 | 7 类 | 宏平均 F1 |
| 房间级 | 混响时间 | 连续分箱 | 29 | 归一化误差补数 |
| 房间级 | 房间体积 | 分类 | 5 对数箱 | 宏平均 F1 |
| 房间级 | 房间形状 | 分类 | 4 类 | 宏平均 F1 |
上表的主要收益是让 7 个任务的难度与指标可比,避免把分箱粗细不同的误差直接对比。具体代价是离散化引入量化误差,俯仰角仅 12 箱而方位角 36 箱,箱宽不同会影响绝对误差尺度,因此跨因子比较必须依赖相对随机基线的归一化提升,而非原始误差。未胜出项在后文结果中可见:房间任务即使在强模型上提升仍小,这不是探针失败,而是房间信息本身更难线性读出。
下表提出的数据公平性问题是跨格式与跨任务比较时声学条件是否匹配,公平条件是同一场景渲染为多种格式、声源与房间跨划分不重叠,指标方向为划分隔离越严格泛化评估越可信。
| 因素组 | 因素 | 采样范围 | 模拟器 | 划分规模 |
|---|---|---|---|---|
| 声源级 | 方位角 | [-180◦, 180◦] | 光线追踪网格 | 每轮 15000/3000/3000 场景 |
| 声源级 | 俯仰角 | [-60◦, 60◦] | 光线追踪网格 | 每轮 15000/3000/3000 场景 |
| 声源级 | 距离 | [0.5, 2.5], m | 光线追踪网格 | 每轮 15000/3000/3000 场景 |
| 干声池 | 事件类别 | 7 类,每类 4000 段 | 混合语料库 | 3200/400/400 段 |
| 房间级 | 混响时间 | [0.1, 3.0], s | 解析房间仿真 | 12000/3600/3600 脉冲响应 |
| 房间级 | 体积 | [60, 2500], m3 | 解析房间仿真 | 12000/3600/3600 脉冲响应 |
| 房间级 | 形状 | 4 类形状 | 解析房间仿真 | 房间跨划分不重叠 |
上表的主要收益是声源任务获得几何真实的传播线索,房间任务获得独立可控的混响与几何采样,二者互补。代价是两种模拟器不同,跨家族的绝对分数不能简单归因于因子难度,还包含模拟器差异。复现时应保留确定性播种与跨划分不重叠,否则房间泛化评估会被泄漏高估。
下表回答探针训练与场景渲染的运行配置是否统一,公平条件是所有编码器共享同一探针优化器与轮数、同一重采样到原生采样率与均值池化流程。
| 环节 | 输入 | 监督形式 | 优化配置 | 数据规模 |
|---|---|---|---|---|
| 探针训练 | 冻结场景向量 | 高斯软标签或独热 | Adam 学习率 1×10−4 余弦衰减 20 轮 | 3 种子平均 |
| 场景渲染 | 干声加脉冲响应 | 已知仿真参数 | 实时卷积 | 每家族每轮 15000/3000/3000 |
| 脉冲响应 | 房间网格或解析房间 | 采样参数 | 确定性播种 | 12000/3600/3600 |
| 干声预处理 | 原始语料 | 类别标签 | 单声道 24 kHz 负 24 dBFS10 秒 | 每类 3200/400/400 |
| 跨格式对齐 | 同一场景 | 相同标签 | 重采样到原生率 | 立体声双耳 FOA 三版 |
上表的主要收益是统一协议隔离了表示质量,任何模型都不能靠更强的探针或更长的训练获益。代价是均值池化丢弃时序与频谱分辨率差异,帧级定位能力未被检验。未评测边界包括多声源、真实录音和非线性探针,这些都留待后续工作。
主结果:输入格式与训练范式如何塑造空间编码?
主结果围绕两个设计轴展开。输入格式侧,总体趋势是携带空间结构的多通道表示优于单声道与立体声,双耳与 1 阶 Ambisonics 一致地领先,尤以 1 阶 Ambisonics 最强。任务差异进一步细化了判断:方位角、距离和事件分类上双耳与 1 阶 Ambisonics 相当,说明双耳线索已足够;俯仰角与房间属性上高阶空间表示优势扩大,提示球谐基带来垂直定位与全局环境所需的附加信息。
一个重要的反例是单声道掩码自编码器,它在除方位角外的多数任务上具有竞争力,尤其在房间任务上不弱,说明混响衰减与几何染色可从单通道谱时结构部分推断,不能把多通道等同于一切空间信息的必要条件。训练范式侧,监督定位模型在方位角上最强,但其优势不迁移到房间任务,在混响、体积和形状上表现 consistently 偏弱,支持定位监督强调方向线索而丢弃全局上下文的解释。
自监督整体更均衡,基于输入空间直接重建掩码谱块的模型持续强于预测隐表示或蒸馏导出空间特征的模型,支持直接重建保留源与房间信息更有效的判断。编解码模型整体最弱,支持压缩目标为感知保真与码率优化的表示不易被线性探针读出空间结构的判断。
以下导读帮助初学者阅读按输入格式与训练范式双重排序的七行柱状图,纵轴为相对随机基线的提升,行为任务,列分组为模型排序,颜色区分格式与范式,阅读时先分清任务行再比较组间高低。
看图路径: 1. 先按行确认 7 个任务:上四行为声源任务,下三行为房间任务,注意纵轴为相对随机基线的提升量;2. 再按左半部分颜色比较输入格式:单声道、立体声、双耳、一阶 Ambisonics 的整体高低;3. 接着看右半部分按训练范式重排:监督、自监督、编解码三组在方位角与房间任务上的反差;4. 最后定位单声道 A-MAE 在方位角失效但在房间任务仍有柱高的例外位置
论文图 1。原论文 Figure 1:“Probing performance across spatial factors shown as improvement over a random predictor baseline.”。
上图可见内容支持三点判断。第一,多通道组整体柱高于单声道与立体声组,且 1 阶 Ambisonics 在俯仰角与房间三行相对更高,这与高阶表示有助于垂直与全局属性的机制解释一致。第二,右半按范式重排后,监督组在方位角行突出但在房间行回落,自监督组跨行更均衡,编解码组多数行贴近基线。第三,单声道模型在方位角行几乎无提升但在房间行仍有可见柱高,构成对输入决定论的反证。像素不能精确读出的具体提升数值不硬写,方向性结论以原文归一化提升为准。重提结果时新增的适用条件是所有比较都在匹配声学条件的三格式渲染下进行,跨模拟器家族的绝对值仍需谨慎对待。
声源与房间差距:语义、定位与房间三组有何不同?
把 7 个任务聚合为语义源、定位源和房间 3 组后,差距更为清晰。定位提升取方位角、俯仰角和距离的平均,房间提升取混响、体积和形状的平均,语义单独报告事件分类。原文报告显示所有编码器的声源相关提升都大于房间提升,语义提升普遍强且跨模型稳定,定位提升虽强但跨模型方差更大,房间提升持续更小且更接近基线。
结构解释是声源因子局域可观测,单次录音即含方向与距离线索,而房间几何与体积是全局属性,单点脉冲响应只给出一个源接收配置下的投影,推断全局需要多位置观测,典型预训练设置对前者的信号更强。这属于有限解释而非因果证明,相关性不等于因果,仍需多位置或显式房间监督的对照才能验证。
以下导读帮助阅读聚合后的点线图,横轴为相对基线的归一化提升,纵轴为模型,每行 3 个符号分别代表 3 组,越靠右表示提升越大,阅读时先看同行三符号的左右关系再看不同行的整体排序。
看图路径: 1. 先确认图例:方块为语义源任务,实心圆为定位源任务,空三角为房间任务;2. 再沿横轴比较每行三符号的位置:房间三角是否系统性偏左;3. 最后自上而下比较模型排序:顶部 GRAM-F 与 EINv2 和底部编解码模型的差距
论文图 2。原论文 Figure 2:“2”。
上图可见内容显示几乎每行空三角都位于同行方块与实心圆左侧,表明房间组系统性落后;顶部模型三符号整体靠右,底部编解码模型三符号整体靠左,表明强弱排序跨组大致保持;语义方块普遍靠右且跨模型差异小于定位圆点,支持语义最易线性读出的判断。未胜出项是部分监督定位模型虽定位强但房间三角仍偏左,说明方向优势不自动带来房间理解。未评测边界是该聚合依赖随机基线归一化,若基线估计有偏,跨组差距的绝对幅度会变化,但原文用统一基线与多种子平均缓解了该风险。
几何敏感度是否与可解码性同向,强模型是否变化更大?
敏感度分析提供了几何视角的对照。原文报告几乎所有编码器对声源扰动的嵌入位移都大于对房间扰动的位移,与探针中声源易读、房间难读同向,构成双视角的相互支持。一个反直觉的发现是敏感度大小与探针强弱不成单调关系:最强的模型位移相对较小,较弱的模型位移反而大得多,中等模型分布宽广。这支持强模型以更稳定、更结构化的方式编码空间因子,而非靠大幅波动来区分,大的嵌入变化不必然对应更好的可解码性。该判断为解释性推论,需标记为可能而非已证明,因果链条尚未通过干预实验验证。
以下导读帮助阅读敏感度条形图,蓝色为声源敏感度,橙色为房间敏感度,横轴向右更敏感,纵轴按聚合探针性能排序,阅读时先比较同行蓝橙长度再比较不同行的绝对长度。
看图路径: 1. 先确认蓝色为声源敏感度、橙色为房间敏感度,横轴向右表示更敏感;2. 再逐行比较蓝条与橙条长度:是否几乎每行蓝条都长于橙条;3. 最后观察顶部强探针模型与底部 BANC 和 SFD 的绝对敏感度差异
论文图 3。原论文 Figure 3:“Representation sensitivity to controlled perturba- tions of source and room factors.”。
上图可见内容显示几乎每行蓝条长于橙条,证实表示对声源变化更响应;顶部模型的蓝橙条都相对较短,底部个别模型的蓝橙条显著更长,证实强弱与位移幅度分离;个别模型的橙条相对更长但仍短于自身蓝条,说明房间敏感的相对差异存在但不改变总体差距。局限在于该分析仍在单声源合成环境与均值池化向量上进行,帧级特征、真实房间和多声源下的敏感度模式尚未测量,不能推广为所有部署条件下的稳定性结论。
复现先做什么,需要哪些信息条件?
复现应从数据管线开始,而非直接训练探针。先按原文超参数重建干声池:统一单声道、24 千赫兹、负 24 分贝相对满幅归一化、10 秒补齐或裁剪,并保留每类 3200 段训练、400 段验证和 400 段测试的划分。接着分别搭建两条脉冲响应管线:声源任务用光线追踪网格并在给定方位角、俯仰角和距离范围内均匀采样,房间任务用解析仿真并对混响时间、体积与形状独立均匀采样,两条管线各生成 12000 段训练、3600 段验证和 3600 段测试脉冲响应且房间跨划分不重叠。
然后在每个任务家族内每轮渲染 15000 段训练、3000 段验证和 3000 段测试场景,同一场景渲染为立体声、双耳和 1 阶 Ambisonics 以保证匹配比较。编码器侧保持冻结,按各自原生采样率重采样,帧级嵌入均值池化为场景向量。探针侧为每个任务训练线性分类器,连续因子用高斯软标签,分类用独热,Adam 学习率万分之一加余弦衰减训练 20 轮,3 种子平均。资源状态方面,原文脚注给出代码与数据集链接,但本次可验证资源清单为空,因此必须写本次未能确认可达,不可声称已公开或当前可用。
还需补的验证包括真实录音上的迁移、非线性探针的对照、帧级特征的检验,以及训练与推理开销的实测,原文未报告这些量,不可承诺改善。
何时值得尝试这套基准,如何避免误读?
当研究问题是比较不同预训练表示保留了多少空间结构,而非交付一个端到端定位产品时,这套基准值得尝试。它的价值在于受控仿真解耦因子、冻结加线性探针隔离表示、配对敏感度提供几何对照,三者结合能快速定位偏置:方向强而房间弱指向监督目标过窄,多通道仍弱指向目标设计而非通道不足,单声道在房间任务不弱提示谱时线索已被利用。
适用条件必须同时满足:单声源假设可接受、合成到真实的差距可用后续真实验证弥补、均值池化后的场景级判断足以回答研究问题。若目标是多声源重叠、强混响真实房间或低延迟帧级定位,则只能把本文结论当作起点,还需补充多声源环境、真实脉冲响应和时序敏感的评估。常见误解有三:把探针分数高低直接等同于下游任务胜负,忽略探针只测线性可读;把敏感度大等同于表示好,忽略原文明确的非单调关系。
把 1 阶 Ambisonics 优势推广为所有任务必需,忽略双耳在方位角与分类上已相当。正确的收束是声源易读、房间难读是跨模型的一致模式,空间输入加直接重建的自监督是当前最稳健的组合,但房间理解仍需新的数据与目标设计。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


