英文题目:Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones

会议身份:conference:interspeech:2026:conference-paper-id:yalegama26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#CNN #多通道 #语音 #语音增强

评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • Oshan A. B. Yalegama:机构信息未能从会议 PDF 纯文本可靠映射
  • Wageesha N. Manamperi:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文研究多声源多麦克风下的相对传递矩阵(Relative Transfer Matrix,ReTM)估计,目标是由B组麦克风观测线性表示A组观测,即在短时傅里叶变换(Short-Time Fourier Transform,STFT)域满足 \(M_A(f,t)=R_{AB}(f)M_B(f,t)\),其中 \(R_{AB}(f)=H_A(f)H_B(f)^{\dagger}\),难点是多源同时激活时W不交叠正交假设失效,且混响使频域乘性近似对窗长敏感。方法对比三条监督路径:STFT卷积网络(STFT Convolutional Network,SCoNet)在STFT域做按频率的深度卷积回归A组谱;卷积滤波求和网络(Convolutional Filter and Summation Network,FuSNet)在时域用 \(Q_A \times Q_B\) 个可学习一维卷积核参数化相对冲激响应并求和重构波形;长短时记忆自动编码器网络(LSTM-based Autoencoder Network,LAeNet)按频点用权重共享双向长短时记忆网络(Bidirectional Long Short-Term Memory,BiLSTM)加时间平均提取特征,再经前馈网络估计矩阵系数并经确定性乘法重构谱。三者均以时域负信干比与频域相对谱误差加权损失联合训练,避免对长时平稳协方差的依赖。在6 m × 7 m × 3 m、混响时间500 ms仿真房中,频域模型在三源语音去噪上优于协方差基线,LAeNet在场景B达8.67 dB、0.92可懂度,基线为6.06 dB、0.87;但FuSNet去噪仅2.21 dB、0.80,与其在矩阵重构指标上的领先相矛盾。该结论限于静止声源、固定分组和40 dB加性白噪声仿真,未验证真实房间、移动声源与源数泛化。原文未披露训练成本,仅给出推理延迟与参数量。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么多声源同时说话时相对传递估计会变难?

输入是这篇 Interspeech 2026 论文的正文证据与 3 张官方原图,目标是让刚进入语音与音频方向的研究生能核对条件并复述方法,输出是 1 篇按学习依赖展开的技术解读。必须保留的信息包括任务定义、两组麦克风划分、3 套网络的输入输出、训练损失构成、仿真房间与数据时长、五项估计指标与去噪应用的对照结论。

从任务看,研究对象不是增强某一段语音本身,而是估计两组麦克风之间的空间关系。传统相对传递函数假设同一时频点主要只有一个声源占优,这就是常说的 W 不交叠正交假设,单人说话时可以用它做波束形成或定位。一旦空调、音乐和人声同时响起,同一时频点混着多个源,单源假设失效,直接估计每条声学路径会混入源内容。论文引入的相对传递矩阵就是为了解决这个并发问题,它把 A 组接收信号写成 B 组接收信号的线性变换,矩阵本身与源信号无关,只与声源位置和房间环境有关。

相对传递函数 × 相对传递矩阵: 相对传递函数负责描述单个声源到不同麦克风的相对声学路径,相对传递矩阵负责把这一思想推广到多个同时发声的声源和两组麦克风之间,搭配理由是单源常用的 W 不交叠正交假设在多源并发时不再成立,组合意义是用一个与源信号无关、只与位置和环境有关的矩阵 1 次性刻画组间映射。

举例来说,教学例子是两支笔同时在纸上写字,单源方法相当于假设每个时刻只有一支笔在动,多源方法则允许两支笔同时动,只关心两张纸上字迹之间的固定几何变换。这个例子只帮助理解为何需要矩阵而非向量,不附带任何数值或效果承诺。后续所有数字都回到原文仿真条件核对。

已有路线分几支,本文补的是哪一块?

按同输入、同目标、同监督来对照,相关工作可分成两支。第一支是单源相对传递函数估计,包括基于协方差的方法和基于学习的方法,前者利用多通道协方差的结构求解,后者用流形学习、深度直达声估计或掩蔽加权等手段提升低信噪比下的鲁棒性。第二支是多源相对传递矩阵,原文指出此前唯一被提出的可实用方法是利用两组协方差矩阵的统计关系求解,并在后续工作中被用于去噪、分离和相继说话人估计。

本文补的是第二支中的学习路线空白,提出 3 个全监督框架,分别覆盖短时傅里叶变换域和时域。作者明确假设环境平稳且所有声源静止,这意味着矩阵不随时间变化,网络只需要学一个与时间无关的空间映射,而不是跟踪运动声源。理解这一点很重要,否则会误以为模型能处理说话人走动。

协方差矩阵估计 × 监督深度学习映射: 协方差矩阵估计负责利用两组接收信号的 2 阶统计关系解析地求解组间矩阵,监督深度学习映射负责用成对录音直接学习从 B 组到 A 组的变换,搭配原因是前者实用但精度受限而后者此前未被系统探索,组合意义是在同一任务上形成可公平比较的传统路线与学习路线。

对照时不能把单源学习的胜负直接搬到多源任务上,因为输入从单组麦克风变成两组麦克风,目标从向量变成矩阵,运行阶段也从单源占优时频筛选变成全时段并发建模。论文的公平比较对象因此选为协方差矩阵的相对传递矩阵基线,而不是单源相对传递函数方法。

两组麦克风的信号关系如何形式化?

设房间中有 L 个同时发声的声源,在短时傅里叶变换域记源信号向量为 S,A 组和 B 组接收向量分别记为 MA 和 MB。声学传递矩阵 HA 和 HB 把源映射到两组接收,相对传递矩阵定义为 HA 乘以 HB 的伪逆,要求 B 组麦克风数不少于声源数,这样伪逆才成立。得到的核心关系是同一频率和时间点上 MA 等于矩阵乘以 MB,矩阵只与频率有关,与具体帧无关。

在时域上,这个频域乘法对应多通道卷积求和,A 组第 j 路信号等于 B 组每一路信号分别与对应相对脉冲响应卷积后再相加。论文把待学习的目标抽象为两个映射,频域映射把 B 组频谱变为 A 组频谱,时域映射把 B 组波形变为 A 组波形。沿一个样本走一遍就是输入 B 组录音,经过表示变换、网络组件和目标重建,输出 A 组录音的估计,中间隐含的矩阵即为所求。噪声方面,原文说明忽略麦克风热噪声,但在仿真接收信号上会加入加性白噪声,这属于实验构造而非模型假设。

初学者容易把矩阵当成波束形成器,实际上它不直接输出干净语音,而是刻画组间可预测性,去噪应用是再利用噪声段估计的矩阵做相减。先记住输入是 B 组,输出是 A 组,矩阵是连接二者的桥梁,后文 3 套网络只是实现这座桥的不同施工方式。

三套网络的全景分工是什么?

3 套网络共享同一个监督思想,用已知的 A 组信号作为目标,迫使网络学到正确的组间变换。短时傅里叶变换卷积网络处理频域映射,输入 B 组频谱,输出 A 组频谱。卷积滤波求和网络处理时域映射,输入 B 组波形分段,输出 A 组波形分段。长短时记忆自编码网络同样处理频域,但按频点独立建模时间序列,再经平均和全连接得到矩阵系数,最后乘回 B 组频谱得到 A 组估计。

从计算视角看,前两者直接预测目标信号,矩阵隐含在卷积核中,第三者显式预测矩阵再做乘法。这种差异决定了后续误差分析的不同,频域直接预测容易在谱失真上占优,时域直接卷积容易在波形误差上占优,而显式矩阵更便于接到去噪公式里复用。3 个模型都假设声源静止,因此训练和测试的房间布局固定,不能期望跨房间零样本泛化。

全景记住一句话,输入侧都是 B 组,监督侧都是 A 组,区别只在表示域是波形还是频谱,以及矩阵是隐式藏在权重里还是显式写出来再乘 1 次。

频域深度卷积如何对应矩阵的分频结构?

短时傅里叶变换卷积网络的导读是,先把 B 组复频谱的实部虚部分开并沿通道堆叠,形成以时间为长轴、频率为深度的立方体,再用深度卷积为每个频率学独立参数,最后重排成 A 组频谱。这个走向与相对传递矩阵按频率定义的物理结构一致。

看图路径: 1. 先从左侧 MB 输入立方体看通道数标注 2QB 与 T、F 两轴的含义;2. 再看中间深度卷积框标注的滤波器数量与形状;3. 最后跟踪右侧重排框如何把二维输出恢复为 A 组频谱结构

原论文 Figure 1:Model architecture of SCoNet, where F and T are the number of frequency bins and time frames,…

论文图 1。原论文 Figure 1:“Model architecture of SCoNet, where F and T are the number of frequency bins and time frames, respectively.”。

从像素可见,左侧输入立方体标注了通道数与 T、F 轴,中间框明确写出深度卷积与滤波器数量形状,右侧扁平输出标注了通道数后经重整形框回到 A 组频谱,箭头构成从 MB 到 MA 的单向闭环。图中没有给出具体数值曲线,只有结构与维度标注,因此只能解读数据流向与重排逻辑,不能读出任何性能高低。

深度可分离卷积 × 相对传递矩阵频点结构: 深度可分离卷积负责沿时间和通道维对每个频率分量学习独立参数集,相对传递矩阵频点结构负责要求同一频率内的组间关系自成一体,搭配原因是矩阵按频率定义因而不同频点不应共享同一映射,组合意义是让网络结构与物理量的分频定义对齐。

具体动作是把实部虚部翻倍后的通道送入 2 维深度卷积,卷积跨时间与通道轴进行但不混叠频率,学到的通道输出再堆叠成 A 组频谱表示。原文没有报告该网络的层数、激活或归一化细节,这部分属于缺项,复现时只能按图示的数据流搭建最小实现,不应自行脑补残差或注意力。它的优点是参数按频点复用思想清晰,代价是窗长必须足够长以支撑乘法传递函数近似。

时域滤波求和为何能直接参数化脉冲响应?

卷积滤波求和网络的导读是,顶部是一条很长的 B 组波形,中间截出带上下文的一段并按通道拆开,分别做卷积后再重组求和到底部 A 组波形。这个图把时域公式画成了施工图。

看图路径: 1. 先看顶部长条 mB 与中间截取的上下文窗口的位置关系;2. 再数第二行四个 B 组通道与卷积符号的对应关系;3. 最后看重组与求和箭头如何汇聚成底部三个 A 组通道

原论文 Figure 2:Model architecture of FuSNet for the case of QB = 4 and QA = 3.

论文图 2。原论文 Figure 2:“Model architecture of FuSNet for the case of QB = 4 and QA = 3.”。

从像素可见,顶部长条标注为 mB 并用不同底色区分中心段与上下文,第二行 4 个绿色小条对应 QB 等于 4 时的 4 路 B 组信号,每个都引出卷积符号与多层滤波结果,中间经重组箭头按颜色汇聚,底部经求和符号得到 3 路 A 组信号。颜色只区分通道归属,不代表幅值大小,波形内部纹理是示意而非真实采样值。

1 维卷积滤波器组 × 时域卷积求和: 1 维卷积滤波器组负责用可学习的 QA 乘 QB 个滤波器近似相对脉冲响应,时域卷积求和负责把 B 组每路信号滤波后再按 A 组通道重组相加,搭配原因是时域公式本身就是多输入多输出卷积求和形式,组合意义是把物理公式直接参数化为网络权重。

实现上,网络输入无重叠的长度为 L 的分段与长度为 3L 的上下文,滤波器长度取为 L 以保证卷积输出与原段等长,滤波器总数为两组通道数的乘积。原文强调窗口长度应长于房间混响时间,这是为了让分段卷积近似成立,选择 8192 个采样点即出于该理由。它的优势是推理延迟最低、参数最少,代价是内存随窗长线性增长,且在非均匀谱源下频域指标容易退化,后文实验会给出反例。

共享循环结构如何得到与时间无关的矩阵?

长短时记忆自编码网络的导读是,左上把两组频谱拼在一起并按频率展开成时间序列,送入共享双向循环层与层归一化,再沿时间平均得到每频点的定长向量,最后经全连接与重整形得到矩阵并乘回 B 组频谱。这个环路的关键是从时变序列中提炼时不变参数。

看图路径: 1. 先看左上拼接输入如何展开为按 F 堆叠的时间切片;2. 再看 BiLSTM 加层归一化后通道数从 2 倍变为 4 倍的位置;3. 最后跟踪沿 T 平均、全连接 k 与重整形到矩阵乘法的链路

原论文 Figure 3:Model architecture of LAeNet with a shared BiLSTM.

论文图 3。原论文 Figure 3:“Model architecture of LAeNet with a shared BiLSTM.”。

从像素可见,右上圆角框标出双向循环加层归一化与频率记号,中间粉色立方体标注的通道数变为蓝色立方体的 2 倍,体现双向拼接带来的维度翻倍,左侧平均框把时间轴压掉,底部经 k 函数与重整形得到矩阵符号再与 MB 相乘。箭头呈顺时针大回路,输入包含 A 组和 B 组,输出为 A 组估计,中间矩阵是显式瓶颈。

共享双向长短时记忆网络 × 窄带空间信息: 共享双向长短时记忆网络负责对每个频点独立建模时间上下文并在频点间共享权重,窄带空间信息负责提供同一频率内多通道间的相对幅相线索,搭配原因是空间线索主要存在于窄带而时间平均可以抑制源内容起伏,组合意义是用循环结构提取稳定于声源静止假设的环境特征。

原文写明每个频点独立送入权重共享的双向层,输出经层归一化稳定训练,再沿时间平均得到维度为 4 倍通道和的特征向量,随后全连接映射为矩阵系数。这里的平均操作对应声源静止假设,若声源运动则平均会抹掉轨迹信息。它的优点是内存几乎不随窗长增长,代价是循环展开导致推理延迟最高,表中延迟达到秒级,这对实时部署是明确限制。

监督信号与损失如何同时约束波形与频谱?

训练的目标不是分类标签,而是用 A 组真实录音同时约束波形与频谱。损失是负信号失真比与相对谱误差的加权和,前者在时域衡量波形重建精度,后者在频域衡量相对谱误差,权重分别取为 1 和 10。联合优化的理由是两域对噪声和伪影的敏感性不同,同时约束可以提高鲁棒性。优化器采用 Adam,学习率按验证集表现自适应降低,原文未报告初始学习率、衰减 patience 或早停轮数,这些属于缺项。

需要区分原始目标、近似与优化步骤,原始目标是组间矩阵,近似是直接最小化 A 组重建误差,优化步骤是反向传播更新卷积核或循环权重。显式矩阵模型多了一步矩阵乘法,但梯度仍可经乘法回传到矩阵生成器,原文未给出梯度裁剪或停止梯度的说明,因此不做推定。训练数据是仿真房间脉冲响应与源信号卷积后再加噪声的结果,监督来源是同步录制的 A 组信号,不需要人工标注。

复现时先固定随机种子与数据划分,再按窗长与损失权重搭建最小训练环路,不要从模型名称推定归一化或正则化。若验证集不下降则只按原文说的降低学习率,不引入原文未提的调度器。

仿真房间、声源配置与评估指标如何设定?

实验要回答两个问题,矩阵本身估计得准不准,以及估计出的矩阵做去噪有没有用。与谁比的条件是统一的协方差基线,所有场景共享同一房间建模工具与加噪流程。指标方向是信号失真比越高越好,均方误差、对数谱失真、平均相位失真和相对谱误差越低越好,去噪阶段另用信号失真比与短时客观可懂度。

下表整理房间与麦克风配置,比较问题是不同通道数下任务难度是否一致,公平条件是同一房间尺寸、混响与加噪流程,指标单位按原文保留。

条件房间尺寸麦克风配置采样与加噪
场景 A 与 B6 × 7 × 3 m 矩形房间Q = 7,其中 QA = 3,QB = 440 dB SNR 白噪声,每麦克风加噪,降采样到 16 kHz
场景 C6 × 7 × 3 m 矩形房间Q = 12,其中 QA = 5,QB = 740 dB SNR 白噪声,每麦克风加噪,降采样到 16 kHz

表后解释是,房间与混响固定保证了声学环境可比,通道数从 7 增至 12 提高了空间自由度,理论上有利于矩阵求解,但也增加了参数量与延迟。未胜出项是原文未评测真实录音与运动声源,这意味着仿真结论不能直接推广到走动说话的会议场景。声源设置上,A1 用两路白噪声,A2 用空调加音乐,B 用语音加空调加音乐,C 与 B 同源但麦克风更多,这种递进便于观察谱均匀性与通道数的影响。

下表整理数据时长与网络超参数,比较问题是训练预算是否一致,公平条件是同一优化器与损失权重,单位按原文保留。

配置项A1 数据划分其余场景数据FuSNet 窗口频域分析窗损失权重
取值训练 3 minutes,验证 1 minute,测试 1 minute训练 50 s,测试 10 s窗与上下文 8192 samplesHann 窗 size 8192,50% overlapα 为 1,β 为 10

表后解释是,较长的 A1 数据对应谱均匀的白噪声任务,短数据对应更难的真实噪声任务,窗口都选 8192 以满足乘法传递函数近似。代价是长窗带来高内存与延迟,频域模型内存随窗长线性增长,循环模型延迟显著更高。复现时必须先对齐这组时长与窗长,否则指标差异可能来自数据量而非模型。

矩阵估计精度谁更好,代价在哪里?

主结果测的是用估计矩阵重建 A 组信号的五项误差,基线是协方差法,可运行策略是 3 套学习模型,条件在同一场景内一致。原文报告显示,在白噪声场景 A1 中时域模型整体最强,在非均匀谱场景 A2 中它仍在多数指标领先但对数谱失真与相位失真退化,在三源场景 B 与多麦克风场景 C 中频域卷积模型显著优于基线。总体趋势是学习模型在时域误差上明显占优,但趋势不等于每组每指标都成立。

为避免混放不同条件的数字,这里不把原宽表逐格搬运,而是用原文连续句中的去噪汇总数字做可核对的比较,比较问题是估计精度优势能否转化为去噪收益,公平条件是同一噪声段估计的噪声矩阵与同一相减公式,指标方向是两者越高越好。

应用场景方法平均 SDR平均 STOI原文定性
场景 B 与 CLAeNet+10.55 dB37%两场景最高
场景 B 与 CSCoNet+8.41 dB33%排名第 2
全部方法增强相对含噪+0.5 dB in SDR13% in STOI均有提升

表后解释是,主要收益属于频域 2 个模型,去噪后 LAeNet 最高,SCoNet 次之,都超过基线,支持频域估计对去噪更有利的判断。具体代价与反例是 FuSNet 虽然在矩阵重建的多项指标上领先,去噪性能却退化,原文经非正式试听归因于残留混响,并指出可用去混响改进但尚未验证。这说明重建误差低不等于去噪可懂度高,时域波形拟合可能保留了混响尾巴。另一个未胜出项是基线在相对谱误差上有时保持第二,表明传统方法在谱包络上仍有竞争力,不能一概否定。

计算成本上,原文在 RTX 3090 上测得 FuSNet 参数最少、延迟最低,SCoNet 居中,LAeNet 延迟达秒级且参数最多。因此最强去噪来自最慢的模型,这是精度与延迟的直接交换。

谱均匀性与通道数如何改变结论?

把场景对比当作天然消融,第一个变量是谱均匀性。A1 用白噪声,频谱平坦,时域模型受益最大,原文解释为均匀谱便于频域估计。换成空调加音乐的 A2 后,非均匀谱使时域模型的对数谱失真与相位失真明显变差,而频域卷积模型保持与循环模型相当并超过基线。这支持均匀谱假设对时域卷积更关键的解释,但属于有限解释而非因果证明,因为源类型同时改变了时间平稳性。

第二个变量是通道数与源数。从 B 到 C,麦克风从 7 增至 12,源保持语音加空调加音乐三源,所有方法在五项指标上大多变好,传统方法在部分谱指标上仍非最差。这支持增加空间自由度有助于矩阵估计,但代价是参数量近乎翻倍,表中 SCoNet 从 196.7k 增至 573.6k 即为例证。

第 3 个对照是估计误差与应用误差的不一致,FuSNet 在重建上强而在去噪上弱,说明仅看重建指标会误判实用价值。复现时应同时跑重建五项指标与去噪两项指标,缺一不可。若只复现重建而不跑相减去噪,就无法观察到这一反例。

哪些边界尚未被验证?

论文直接报告的是仿真房间、静止声源、固定分组下的结果,有限解释是均匀谱与多通道有助于估计,未验证的推测是真实房间、运动声源与不同分组策略下的表现。缺失证据不是技术错误,但不能把仿真提升承诺为实际会议或无人机录音的改善。原文未测量误判率之外的逐帧延迟分布、训练能耗与跨房间泛化,这些量在未测量前不应声称得到优化。

另一个边界是基线选择,公平性限于协方差矩阵方法,没有与单源学习方法或 oracle 矩阵比较,因此学习路线的上限未知。时域模型的去混响改进只写在未来工作,没有给出算法与数字,属于待验证。数据上,A1 之外训练仅 50 秒,测试仅 10 秒,小样本下方差可能较大,原文未报告置信区间或多次随机种子,这限制了对微小差距的解读。

使用时要记住,矩阵依赖声源位置与环境,换房间或移动麦克风后需要重新估计或重训,不能把 1 次学到的权重当成通用空间知识。

复现应先固定什么,再跑什么?

先固定信息条件,用开源房间脉冲响应生成器建模 6 乘 7 乘 3 米、混响 500 毫秒的房间,按场景放置不规则麦克风并划分 A 组 B 组,再把源信号卷积后加 40 分贝信噪比白噪声并降采样到 16 千赫。数据划分按 A1 训练 3 分钟验证 1 分钟测试 1 分钟、其余场景训练 50 秒测试 10 秒执行,STFT 用 8192 点 Hann 窗、50% 重叠,FuSNet 窗口与上下文取 8192,损失权重取 1 和 10,优化器用 Adam 并按验证集降学习率。

再跑 3 套最小实现,频域卷积按分频深度卷积加实虚堆叠与重排搭建,时域模型按通道数乘积个 1 维滤波加分组求和搭建,循环模型按频点共享双向层加层归一化、时间平均、全连接与矩阵乘法搭建。评估先算重建的五项指标,再用 1 分钟纯噪声段估计噪声矩阵并按相减公式做去噪,算信号失真比与可懂度。资源状态方面,本次收到的证据中未发现完成 HTTPS 验证的开源资源,因此不得声称代码、模型或数据已公开,复现应按上述文字条件自行仿真。

还需补的验证是多次种子取均值方差、真实录音复测、运动声源跟踪与延迟内存实测,只有补齐后才能判断部署取舍。

何时值得尝试这套方法?

当任务是多源并发且有两组固定麦克风可用、环境近似静止、能拿到成对的 B 组与 A 组录音做监督时,这套方法值得尝试。优先尝试频域 2 个模型,因为它们在估计精度与去噪可懂度上更均衡,循环模型精度最高但延迟最大,卷积模型次之但更快。若推理预算极紧且只关心波形重建,可考虑时域模型,但要接受其在真实噪声谱与去噪任务上的退化,并预留去混响模块。

不值得的情况是声源经常走动、房间频繁变化或只有单组麦克风,此时矩阵的时不变假设与分组前提不再成立。常见误解是把矩阵当成降噪本身,实际上矩阵只描述组间可预测性,去噪还依赖噪声段估计与相减公式,噪声段不准则增益消失。另一个误解是把重建指标等同于听感,FuSNet 的反例已说明二者可以背离。

收束一句话,论文的贡献是把相对传递矩阵从统计求解扩展到监督学习,并用统一仿真与双层评估给出可复述的对照,代价与边界同样清晰,初学者沿输入到输出复述一遍数据流,再对照条件重跑指标,就能判断它是否适合自己的多麦克风场景。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总