英文题目:Neural Directional Coding: Joint Spatial Coding and Filtering with Configurable Directivity Patterns

会议身份:conference:interspeech:2026:conference-paper-id:huang26o_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#向量量化 #麦克风阵列 #空间音频信号 #语音 #音频编码

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Weilong Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Emanuël A. P. Habets:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

神经方向性编码(Neural Directional Coding,NDC)要解决的任务是发送端仅有紧凑传声器阵列信号,接收端需按推理时任意给定的方向性图合成虚拟方向性传声器(Virtual Directional Microphone,VDM)信号,难点在于高阶频率不变波束通常需要多通道细节而全阵列传输码率过高。该方法先由空间信息编码模块将多通道频谱压缩为可传输边信息,再在接收端将其与单通道参考信号拼接后送入条件化空间滤波器估计复数掩蔽,最后用掩蔽乘以参考信号得到目标方向输出。相对先重建全部通道再做神经方向滤波的级联方案,其机制差异在于完全跳过波形重建并联合优化编码与滤波,使有限比特只保留通道间幅度相位差等可滤波性信息。在4通道16 kHz阵列的EARS测试集上,空间边信息压缩至0.25 kbps的1.4 M参数模型在12阶心形图上取得22.01 dB信号失真比(Signal-to-Distortion Ratio,SDR),超过7.5 kbps的90.8 M参数级联基线的22.02 dB量级并在感知语音质量(Perceptual Evaluation of Speech Quality,PESQ)上领先约0.1分。该结论目前仅在无混响静态点源仿真和固定阵列几何下验证,对高混响、运动源和阵列失配的外推尚未定量证明。原文未披露训练硬件型号与训练时长,推理成本仅能以轻量参数规模间接体现。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

通信时为什么不想传全部麦克风信号?

这篇论文面对的是一个很具体的通信场景。发送端有一个小麦克风阵列,例如 4 个全向麦克风,录到了多个说话人或噪声的混合。接收端并不想原样听到全部混合,而是想听到一个具有方向选择性的效果,就好像在接收端架了一个指向某个方向的虚拟麦克风。如果把 4 个通道的波形都用高码率传过去,接收端当然可以慢慢做波束形成或滤波,但传输代价太大。

单通道神经语音编码已经可以在很低码率下传一路语音,而多通道阵列信号的通道间存在大量冗余,全部重建并不是必需的。论文要回答的问题就是,能不能只传最关键的空间信息,再加一路普通的单通道参考信号,就在接收端合成出指向可配置的虚拟定向麦克风信号。输入是阵列的短时频谱混合,目标输出是按给定指向性图样加权后的参考通道混合,约束是空间边信息必须压缩到零点几 kbps 量级。

必须保留的信息是声源到达角、通道间幅度和相位差这类空间线索,输出是与目标指向一致的增强语音波形。后续所有方法、训练与评估都围绕这条输入到输出的链路展开。

已有路线各自解决了什么,又缺了什么?

理解这篇工作需要先分清 3 条路线。第一条是单通道神经编码,例如文中提到的 SoundStream、EnCodec、HiFi-codec,它们把一路波形压得很小并高质量重建,但本身不处理空间。第二条是阵列神经编码的代表 SpatialCodec,它基于 HiFi-codec 结构,把全部阵列信号压缩成边信息加一路参考通道,在解码端用复数比值滤波器重建全部通道。它的优点是通用,但缺点是即使接收端只想要一个指向输出,它也要为重建所有通道付码率。

第 3 条是参数化空间音频编码 DirAC 及其在波束形成中的变体,它只传方向等参数,码率很省,但传统参数滤波的指向阶数与频率不变性受限。近期出现的神经方向性滤波解决了用很少全向麦克风合成高阶频率不变指向的问题,其中用户可定义图样的版本称为 UNDF,可以在推理时输入任意图样向量。论文的神经方向性编码可以看成第二条与第 3 条的交叉。

它不重建全部通道,也不直接用传统参数滤波,而是联合学习一个空间编码器与一个可配置的非线性空间滤波器。直接把 SpatialCodec 与 UNDF 级联起来也能跑通,但论文认为这种分开训练的方式是低效的,这正是后文基线要验证的对照。

任务输入输出与虚拟定向麦克风如何定义?

论文把问题放在无混响、声源与麦克风共面的简化条件下形式化。设有 N 个声源与 Q 个麦克风,短时傅里叶域第 q 个麦克风的混合记为 Yq,等于 N 个声源分量之和加传感器噪声。作者把阵列信号向量记为 y。目标不是恢复每个 Yq,而是合成虚拟定向麦克风信号 Z。Z 的定义很直观,对每个声源取其在参考麦克风处的分量,乘以该声源到达角在当前配置图样上的增益,再对所有声源求和。

参考麦克风取为第一通道。图样记为 Lambda 随角度变化,假设频率不变,因此一个图样可以用一个跨全频带有效的向量表示,并在推理时配置。下面的任务示意图把这件事讲得很完整,左侧是真实阵列与多人,中间是编码与传输,右侧是按心形指向合成的虚拟麦克风。

虚拟定向麦克风 × 指向性图样: 虚拟定向麦克风的分工是描述接收端最终想要听到的信号,即好像放置了一个具有方向选择性的麦克风;指向性图样的分工是定量规定这个虚拟麦克风对不同入射角声音的增益分布,可在推理时配置;二者搭配的原因是同一组阵列录音可以对应多种收听指向,组合意义是用一个图样向量控制同一个滤波器生成不同空间选择结果。

看图路径: 1. 先看左侧麦克风阵列与阵列信号标注,确认输入是多通道混合;2. 再看中间编码器与传输箭头,确认只传压缩后的空间边信息;3. 最后看右侧虚拟定向麦克风与心形指向示意,确认输出由推理时图样决定

原论文 Figure 1:Illustration of the NDC task, with a cardioid pattern shown as an example of a configured…

论文图 1。原论文 Figure 1:“Illustration of the NDC task, with a cardioid pattern shown as an example of a configured directivity pattern.”。

读完这张任务图后要抓住三点。第一,发送端看到的是全部阵列波形,但只编码传输空间边信息,参考通道另用现成单通道编码器传输。第二,接收端的估计模块同时看到解码后的空间信息与推理时给定的指向性图样。第三,最终输出是虚拟定向麦克风信号,不是原始多通道。论文用心形图样举例,但后文测试会用到 2 阶、5.5 阶、12 阶乃至 14 阶等更尖锐的图样,用来检验泛化。目标信号的构造方式决定了监督信号的来源,训练时按式子用已知到达角与图样增益直接加权合成目标,这一点在复现时必须严格对齐,否则评估的信号失真比就没有意义。

联合编码与滤波的全链路是怎样走通的?

沿着一个样本走一遍最容易理解整体。4 个麦克风的时域波形先做短时傅里叶变换,得到复数频谱。默认情况下直接把实部虚部拼接成实数张量作为空间编码器输入,消融分支会先按参考通道幅度归一化,只保留通道间相对差异。空间编码器加残差向量量化加空间解码器的结构来自 SpatialCodec 的改造,输出是解码后的空间信息 S。S 与参考麦克风频谱 Yref 拼接成 I,送入空间滤波估计模块。

该模块按 JNF 结构实现,先用沿频率的双向长短时记忆网络看频带关系,再用特征线性调制引入图样向量,接着用单向长短时记忆网络保证因果滤波,最后经线性层加双曲正切输出复数掩蔽 M。估计信号就是 M 乘以 Yref。训练时 Yref 直接用干净的第一通道,推理时 Yref 是经过增强语音服务编码再解码的版本。损失是批量归一化的 L1 时域损失加权重量为 0.1 的量化器损失。

空间信息编码 × 空间滤波: 空间信息编码的分工是把多通道阵列信号压缩成极低码率的边信息,只保留声源方向等可用于滤波的线索;空间滤波的分工是在接收端根据可配置指向性图样对单通道参考信号做加权提取;二者搭配的理由是接收端不需要重建全部麦克风波形,只需要足以合成目标指向输出的线索,组合意义是把传输与滤波联合优化,避免先重建全部通道再滤波的冗余码率。

下面是论文给出的网络总览,左右两大块分别对应空间信息编码与空间滤波估计,下方还区分了训练与推理时参考通道的不同走法。

看图路径: 1. 先沿上方主链看短时傅里叶变换到空间编码器到残差向量量化到空间解码器的连接;2. 再看中间拼接模块如何把空间信息与参考通道频谱拼成滤波器输入;3. 最后对比训练阶段与推理阶段两条虚线,确认参考通道是否经过语音编码

原论文 Figure 2:An overview of the proposed DNN framework.

论文图 2。原论文 Figure 2:“An overview of the proposed DNN framework.”。

看懂这张总览后要记住分工。左侧编码部分只负责把多通道的空间线索压小,不负责重建波形细节。右侧滤波部分负责把图样要求翻译成逐时频点的掩蔽。中间的拼接是关键结合点,空间信息提供声源在哪里,参考通道提供内容是什么,图样向量提供想听哪里。训练与推理的开关说明参考通道在训练时是干净的,在推理时是带编码失真的,这种不一致是评估必须包含单通道编码失真的原因。论文默认用增强语音服务编码作为单通道编码器示例,但方法本身不绑定这一种编码器。

掩蔽估计与图样条件具体如何计算?

空间滤波估计模块是可配置能力的来源。输入 I 的通道数很小,论文指出当空间隐维度 L 取 2 时,加上参考通道实虚部,滤波器输入只有 4 维,远小于直接用原始阵列。图样向量在离散角度上均匀采样,维度 D 取 72,覆盖零到三百六十度。特征线性调制把这个向量变成对频率特征的缩放与偏置,使同一个网络能响应不同指向。双向长短时记忆网络沿频率建模,单向长短时记忆网络沿时间建模以保证因果,这延续了神经方向性滤波系列的做法。最后的线性加双曲正切层输出复数掩蔽,作用到参考通道上。

参考麦克风信号 × 复数掩蔽: 参考麦克风信号的分工是提供目标输出的频谱包络与内容载体,论文默认用第一通道并经单通道编码传输;复数掩蔽的分工是根据解码后的空间信息与配置图样逐时频点估计幅度和相位修正;二者搭配的原因是空间信息本身不含完整语音内容,必须乘到参考通道上才能恢复波形,组合意义是把多通道问题降为单通道掩蔽估计,大幅降低建模与传输负担。

归一化消融的设计值得单独说明。把阵列频谱除以参考通道幅度后,绝对频谱包络被去掉,只剩下通道间幅度差与相位差。如果这种纯空间输入仍能取得接近原始输入的性能,就说明编码器确实主要在编码空间而非偷存语音内容。论文把该变体记为带归一化的神经方向性编码,后文结果显示它只比默认版本差一点,从而支持空间信息已足够完成滤波的判断。复现时要注意归一化是可选的前处理,不是量化结构的变化,对比时要固定码率与滤波器结构,否则无法归因。

两阶段训练如何构造数据与冻结参数?

论文采用 2 阶段训练,目标不同。第 1 阶段让编码模块见多样的声源阵列配置,但图样保持简单。作者生成 28800 个随机声源阵列配置,每个含 4 秒阵列信号,共 32 小时。对每个配置用 1 阶心形图样在 4 个正交指向各生成一个目标,共 128 小时训练数据。第 2 阶段实现图样自适应,用第 1 阶段权重初始化,然后冻结编码器与量化器,继续训练空间解码器与滤波估计模块。

第 2 阶段生成 2160 个配置共 2.4 小时,每个配置配 60 个随机指向性图样,参数从形状系数、转向角与阶数中采样,共 144 小时。图样定义采用简化形式,由形状系数 mu 与阶数 J 控制,mu 在零到 0.5 之间取值,J 在一到十之间取值,零陷处最大衰减统一设为 -20 dB。声源阵列距离固定 1.5 米,直达声用零反射阶的房间脉冲响应生成器仿真。训练与验证语音来自 LibriSpeech 的训练与开发集,训练样本最多 3 个并发声源。两个阶段各跑 100 轮。

残差向量量化 × 2 阶段训练: 残差向量量化的分工是把空间编码器输出的连续隐表示离散为可传输码字并控制码率;2 阶段训练的分工是先用简单心形指向让编码器见多样的声源阵列配置,再冻结编码器与量化器专训图样自适应的掩蔽估计;二者搭配的原因是若一开始就联合学多阶可变图样,编码与滤波容易互相干扰,组合意义是先学稳空间表征再学灵活指向控制。

这个安排的理由在原文讲得很明确。第 1 阶段用简单图样暴露编码器给多样的几何,第 2 阶段用多变图样训练掩蔽估计的适应性。冻结的含义是第 2 阶段编码器与量化器参数不再更新,梯度只走解码器与滤波器,监督来自按随机图样合成的目标虚拟麦克风信号。消融中不做预训练的版本就是只用第 2 阶段数据从头训练,用来证明 2 阶段的必要性。复现时要保留码本大小、组数、层数、降采样因子与输出维度等细节,论文在两种码率下把空间隐每隔 1 帧量化 1 次并复用码字,时间降采样因子为二,从而把码率减半。

实验在什么阵列、语音与码率条件下测什么?

评估条件需要逐项核对,否则数字无法比较。阵列是四麦克风直径三厘米的结构,3 个成均匀圆阵加中心参考麦克风,所有信号 16 kHz 采样。短时傅里叶变换用五百一十二点窗与两百五十六点跳,每秒 62.5 帧。参考通道用增强语音服务编码在 12.8 kbps 下编码。空间边信息有 0.5 kbps 与 0.25 kbps 两档,输出特征维度均为二。

测试语音选自无混响全频带语音数据集并设响度门限,每个图样配置含 3240 个样本,测试为双声源并发,到达角按五度网格选取。测试图样包括训练见过的 2 阶心形、训练未见的小数阶 5.5 阶、超出训练最高阶的 12 阶,以及同时改变形状系数与阶数的 14 阶,用来检验阶数与形状的外推。指标有 3 类,宽带与窄带指向性图样按掩蔽分别作用到各声源后算功率比,信号失真比衡量与目标波形的失真,语音质量感知评估衡量感知质量。

计算信号失真比与语音质量时,目标信号也要过一遍单通道编码,以剔除单通道编码本身的失真,保证比较的是空间处理带来的差异。 为便于核对,把最关键的阵列与信号处理条件整理成下表,表中数值与单位保留原文写法,表头单位与裸值的对应关系按原文说明理解。

条件指标基线本方法比较对象
四麦直径 3 厘米圆阵加中心参考通道数 Q44阵列几何一致
采样率信号采样16 kHz16 kHz全系统一致
参考通道编码单通道码率12.8 kbps12.8 kbps增强语音服务编码
短时分析窗长与跳长512-point 窗,256-point 跳62.5 帧每秒分析条件一致

表后需要说明公平性。所有方法在测试时都经过同一单通道编码的参考通道,空间码率单独计量,不含参考通道的 12.8 kbps。

基线包括独立训练的级联、原始信号上的参数滤波与无编码上限,它们的训练数据与提出方法对齐,级联中的编码部分与对应码率的提出方法同结构。未胜出项在后文结果中会专门指出,不能只看提出方法的最优行。

极低空间码率能否逼近高码率级联?

主结果要回答 3 个问题,测什么、与谁比、条件是否一致。测的是 4 个未见图样下的信号失真比与语音质量,比较对象是同码率级联、七点 5 kbps 原始级联、直接处理原始信号的参数滤波,以及无编码的神经方向滤波上限。条件一致性上,级联的编码器与提出方法同结构同数据,目标都过单通道编码,指标方向都是越高越好。论文报告显示,0.25 kbps 与 0.5 kbps 的神经方向性编码在各图样上都明显高于同码率级联,也多数高于七点 5 kbps 原始级联与参数滤波。

模型量级差异很大,提出方法仅 1.4 M 参数,而七点 5 kbps 基线为空间编码 89.9 M 加滤波约 0.9 M,共 90.8 M。 下面先看指向性图样的视觉证据,上排为宽带估计,下排为窄带估计,重点看主瓣保真与旁瓣抑制以及频率不变性。

看图路径: 1. 先看上排极坐标中目标曲线与神经方向性编码曲线的重合程度;2. 再对比同码率下级联基线在主瓣与零陷处的偏离;3. 最后看下排频率随到达角变化的窄带响应是否随频率保持竖直条带

原论文 Figure 3:Estimated directivity patterns at 0.25 kbps: (a) and (b) depict the wideband estimates for the…

论文图 4。原论文 Figure 3:“Estimated directivity patterns at 0.25 kbps: (a) and (b) depict the wideband estimates for the NDC and baseline [Spa- tialCodec(S) + UNDF], while (c) and (d) show the narrowband…”。

从像素可见,上排极坐标中红色目标、蓝色提出方法与黑色虚线级联基线在主瓣大体重合,但在零陷与旁瓣处蓝色更贴近红色,黑色虚线偏离更大。下排频率随角度的热图中,亮带基本竖直,说明增益不随频率漂移,这与论文声称的频率不变窄带响应一致。需要提醒,像素不能读出精确分贝数,定量结论要回到下表的信号失真比与语音质量。 为核对量级与码率关系,把参数与码率对照整理如下,数字与单位来自原文连续句,比较时注意空间码率不含参考通道码率。

条件指标基线本方法比较对象
空间边信息 0.25 kbps 档总参数90.8 M 级联1.4 M提出方法轻量
空间边信息 0.5 kbps 档空间码率7.5 kbps 原始级联0.25 kbps 与 0.5 kbps极低码率仍占优
原始编码部分编码参数89.9 M 与 948 K1.4 M 含滤波结构差异大

表后解释主要收益与代价。收益是空间信息被证明可以压到 0.25 kbps 仍完成高阶指向滤波,且模型小一个多数量级。代价是绝对性能仍低于无编码上限,说明量化与单通道编码仍有损失。

未胜出项是无编码的神经方向滤波,它的信号失真比在 26 到 30 dB 区间,明显高于所有编码方法,但它不可部署为低码率传输,只能作为滤波器本身能力的上界。另一个边界是参数滤波用理想到达角也只有 19 到 20 分贝左右,说明传统参数方法在该阵列与高阶图样下并不占优。

编码器到底存了语音内容还是只存了空间?

消融要验证编码器是否真的在编码空间。论文对比原始阵列输入与按参考幅度归一化后的输入,后者去掉了绝对频谱幅度,只剩通道间幅度和相位差。结果是原始输入最好,但差距很小,说明额外可用的频谱幅度只带来边际增益,大部分比特确实用于空间。第二个消融是不做第 1 阶段预训练,只用第 2 阶段数据训练,性能明显下降,证明 2 阶段策略对同时学编码与滤波是必要的。第 3 个隐含对照是同码率级联远差于联合训练,证明联合优化的价值大于独立优化之和。 下面用混响仿真检验未见条件的泛化,该仿真不是主表的无混响双说话人条件,应单独看。

看图路径: 1. 先看上方面板中静态语音源与半圆轨迹上移动音乐源的几何关系;2. 再看蓝色指向主瓣是否对准零度方向的语音源;3. 最后对比下方左右两张语谱图在音乐进入旁瓣后高频竖纹是否被压暗

原论文 Figure 4:Testing NDC in a simulated reverberant room.

论文图 3。原论文 Figure 4:“Testing NDC in a simulated reverberant room.”。

从像素可见,上方面板中语音固定在零度,音乐从同一起点沿半圆移向九十度,蓝色主瓣对准语音方向。下方左图为未处理混合语谱,右图为处理后语谱,在约 6 到 7 秒音乐进入旁瓣后,高频竖纹明显变暗而低频语音谐波保留,说明即使只在无混响静态语音上训练,模型仍能在混响时间 0.15 秒的房间里逐渐抑制移动音乐。但这只是单个场景的可视化,不能量化为混响下的平均增益,也未测试高混响或多移动源。论文如实将其作为泛化示意,而非主性能声明。

为核对训练与数据量的边界,把阶段配置整理如下。

条件指标基线本方法比较对象
第 1 阶段几何多样性配置数与时长28800 配置 32 小时128 小时目标简单心形四指向
第 2 阶段图样多样性配置数与时长2160 配置 2.4 小时144 小时目标60 图样每配置
零陷与并发衰减与声源数−20 dB 零陷训练至多 3 源测试 2 源泛化条件更窄

表后要指出限制。训练最多三源而测试两源,训练静态而仿真移动,训练无混响而仿真低混响,这些错位都只做了定性展示。

归一化消融虽支持空间编码的解释,但没有给出码字利用率或互信息等直接证据,仍是间接推断。

哪些结论不能从当前证据推出?

首先区分 3 类表述。论文直接报告的是在给定四麦小阵列、无混响训练、双源测试与 12.8 kbps 参考编码下,0.25 kbps 空间边信息达到与七点 5 kbps 级联相当或更好的信号失真比与语音质量。有限解释是归一化差距小支持主要编码空间,2 阶段缺一不可。未验证推测是真实房间、高混响、多移动源、非语音干扰或不同阵列几何下的表现,原文只有一个低混响单移动音乐源的可视化,不能推广为普遍鲁棒。

其次,相关性不等于因果,参数量小且码率低与性能好同时出现,但不能断言参数量是性能原因,联合训练与任务简化同样起作用。再次,缺失证据不是技术错误,论文未测量端到端延迟、实时因子、量化码本利用率与主观听感,训练硬件只说明用了高性能计算中心,未给出可复现的耗时预算,因此不能承诺延迟或成本得到改善。

最后,资源状态方面,本次收到的证据中没有完成超链接状态验证的开源声明,不得声称代码模型或数据已公开,复现应按论文文字与参数重写流程。

要复现应先固定哪些信息条件与超参数?

复现的第一步是固定信息条件。阵列几何必须按直径三厘米三加一结构实现,参考通道为中心麦克风,声源阵列距离 1.5 米,到达角按五度网格采样。直达声用零反射阶生成,目标按图样增益加权合成,零陷衰减统一负 20 分贝。单通道参考在训练用干净第一通道,测试用增强语音服务编码 12.8 kbps 版本,且目标也要过同一编码再算指标,否则信号失真比会虚高或虚低。第二步是固定编解码与滤波超参数。

空间隐输出维度 L 取二,输出通道取十二、十六、十六、十六,解码镜像对称,残差向量量化按两档码率配置并每隔 1 帧量化复用,时间降采样因子为二。滤波器按双向长短时记忆网络看频率、特征线性调制注入 72 维图样、单向长短时记忆网络看时间、线性加双曲正切输出复数掩蔽的顺序实现。损失用批量归一化 L1 加 0.1 权重的量化损失。第三步是固定 2 阶段流程。

先用 1 阶心形四指向训编码,再冻结编码器与量化器训解码器与滤波器,图样采样覆盖形状系数零到 0.5、转向全圆、阶数一到十,测试再外推到 12 阶与 14 阶。评估时每个图样 3240 样本,分别算宽带功率比曲线、信号失真比与语音质量,并保留同码率级联与无编码上限作为必备对照。

何时值得尝试这种只传空间的做法?

当系统瓶颈在上行码率而接收端有明确的收听指向时,这种做法值得尝试。典型例子是会议或助听回传,发送端是小阵列,接收端只想增强某个方向而不想为全部通道付费。此时可以先用现成单通道编码器保证内容可懂,再用极低码率的空间边信息实现方向选择。尝试前要确认 3 个前提,阵列孔径小到传统高阶波束形成会出现空间混叠,目标指向可以在推理时改变而不需要重传模型,参考通道质量足以支撑掩蔽估计。

若前提不满足,例如需要重建完整声场做后期混音,就应回到重建全部通道的阵列编码路线。还需补的验证包括不同混响与移动速度下的平均指标、参考编码码率变化时的敏感性、以及三源以上与非语音干扰下的失效边界。教学上最容易误解的是把空间边信息当成压缩语音,实际上它更像方向说明书,语音内容主要由参考通道承载。

另一个误解是把无编码上限当成可部署收益,它只是说明滤波器本身学到了图样控制,真正的部署收益必须看含单通道失真的端到端表。抓住内容与空间分离这一条主线,就能复述全文方法而不被细节带偏。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总