英文题目:HFMSE: Harmonic-Guided Speech Enhancement with Flow Matching

会议身份:conference:interspeech:2026:conference-paper-id:li26l_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #信号处理 #语音 #语音增强

评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Jizhen Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Weiping Tu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuhong Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Xinhong Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音增强需从加性噪声与混响中恢复目标干净语音,生成式方法的瓶颈在于条件不可靠:带噪浅层谱的谐波与共振峰结构破碎,而预训练语义模型在低信噪比下本身难以提取准确语义,形成循环依赖。该工作提出HFMSE,先将干净与带噪语音转为梅尔谱并对干净目标做随机掩码。再由谐波编码器经梅尔音高谐波转换矩阵完成基频软定位与谐波掩码估计,接着以掩码门控后的谐波特征与噪声上下文作为持久条件送入扩散Transformer驱动的流匹配模型学习速度场。最后由常微分方程求解器采样梅尔谱并经BigVGAN声码器合成波形。与把基频或谐波仅作后处理或辅助监督的做法不同,该工作用发声物理先验持续约束从噪声到干净语音的整条生成轨迹。在DNS Challenge 2020无混响集上其OVRL为3.485,超过FlowSE的3.451且说话人相似度为0.958高于FlowSE的0.940,有混响与真实录音集优势保持。该结论目前仅在该单基准与感知代理指标上验证,未覆盖强截断、丢包或多说话人等外推场景,原文未披露训练优化细节与推理成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/xxnhq/HFSE — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,必须保留什么?

这篇论文研究的输入是带噪语音,目标是恢复出清晰、自然且保留原说话人音色的干净语音。输入与目标在论文中都先转换为梅尔谱表示,记为带噪谱与干净目标谱,最终输出需要经过声码器还原为波形。初学者容易把增强理解为把噪声减掉即可,但论文强调必须保留的信息有两层:一是谐波与共振峰等结构化声学特征,它们决定可懂度与自然度;二是说话人身份与韵律连续性,不能为了去噪而把音色换掉。

举例来说,浊音段在频谱上表现为基频及其整数倍泛音构成的梳状条纹,若增强过程把条纹抹平或在间隙处虚构出能量,人耳会听到粗糙或金属声。论文把任务放在复杂声学环境下讨论,包括加性噪声与混响,因此输出不仅要压住背景声,还要在混响条件下恢复谐波完整性。代码当前可用,已公开在资源给出的地址,这是复现时唯一可确认的开源依据。

已有路线为何在条件信息上卡住?

论文把生成式语音增强分为两条路线。一条是离散 token 路线,先用神经编码器把语音压成离散 token,再用语言模型或监督学习做 token 域重构;另一条是连续的扩散或流匹配路线,模拟数据分布演化或构造确定性概率流,从噪声迭代生成语音。两条路线在概念上都属于条件生成建模,效果都依赖条件的质量。现有条件策略又被归纳为两类。

第一类直接用浅层声学特征做条件,例如带噪梅尔谱或波形,这类特征本身已被噪声污染,谐波与共振峰可能残缺或扭曲,容易导致虚假频谱成分。第二类试图用预训练深层模型从带噪语音中提取高层语义特征,例如语音编解码器、语音识别模型或语音语言模型,把增强转化为条件合成。论文指出这隐含了一个强假设,即预训练模型能从带噪输入中抽出完整准确的语义,而这恰恰与增强的前提冲突:正因为噪声遮蔽了语义才需要增强。

即使换用对噪声更鲁棒的特征提取器,论文认为这相当于预先解决了一个与增强本身一样难的子问题,形成循环依赖。

判别式增强 × 生成式增强: 判别式增强负责学习带噪到干净的直接映射,优势是噪声抑制明确但上限受限于确定性映射;生成式增强负责建模干净语音分布再按条件采样,优势是质量上限更高但依赖条件可靠。HFMSE 选择生成式路线的原因是作者认为浅层带噪特征与高层语义条件在低信噪比下都不可靠,需要改用更鲁棒的谐波物理先验来约束生成。

理解这组对比后,才能明白 HFMSE 为何不走语义路线。它既不把带噪谱直接当作唯一条件,也不依赖外部语言模型抽取语义,而是估计语音产生过程固有的谐波规律性,并将其作为显式结构先验注入生成过程。

问题如何形式化,难点在哪里复现?

形式化地说,给定干净语音信号与其带噪对应,模型要在梅尔谱域学习从噪声分布到干净分布的映射。训练时编码器同时看到随机掩码后的干净目标与带噪输入,掩码策略迫使模型不能直接复制目标,而必须利用上下文与补充线索重构被遮蔽区域。推理时没有干净参考可用,目标序列全长被视为待生成区域,从高斯噪声出发由常微分方程求解器驱动生成。难点集中在条件可靠性上。

低信噪比与混响会同时破坏浅层谱结构与高层语义提取,使生成轨迹失去锚点。初学者复述时要抓住论文的判断:谐波规律来自发声物理,对噪声相对鲁棒,且可以用轻量模块估计,因此适合做持久约束。另一个难点是评价口径。论文用感知质量与说话人相似度衡量输出,报告的数值都取自已发表结果,测试前统一重采样为单声道,这种跨模型引用比较要求复现者严格对齐采样率与通道,否则数字不可比。

HFMSE 让一个样本走完哪条流水线?

沿一个样本走一遍有助于建立整体感。训练阶段,干净梅尔谱被随机遮蔽中间一段,两端保留上下文,带噪梅尔谱完整保留,谐波编码器从退化谱提取谐波增强特征,三者按图示方式拼接并加入噪声后送入基于延迟变换器的流匹配模型。模型被训练去预测线性插值路径上的速度场,即从噪声指向干净样本的方向。

推理阶段,目标分支变为全零张量,不再有干净参考,模型从高斯噪声出发,在谐波特征与带噪谱的持续约束下积分求解,最终得到增强梅尔谱,再用预训练的高保真声码器转回波形。论文采用 BigVGAN 承担这一步,并说明它在语音合成中已被验证有效。时间步信息单独输入变换器块,用于调节不同噪声水平下的速度预测。分类器无关引导在训练时随机丢弃条件,推理时按强度系数放大条件与无条件预测之差,以增强条件控制力。

谐波结构 × 流匹配: 谐波结构负责提供可验证的声学约束,它从带噪谱中估计基频概率并展开为全频带谐波能量分布;流匹配负责学习从噪声到干净语音的速度场与生成轨迹。两者搭配的理由是生成轨迹本身没有结构偏好,容易在谐波间隙产生虚假成分,谐波掩码作为持久条件在每一步锚定轨迹,使模型增强谐波位置、抑制间隙噪声。

下面先看整体框图,再进入两步谐波编码器的细节。读图时注意区分训练与推理分支,以及推理才启用的求解器与声码器虚线框。

总览图导读:三路条件如何汇入生成主干?

这张总览图是理解 HFMSE 信息流的关键,建议先不看文字,只沿箭头走一遍。底部有 3 条并行的输入带,顶部是输出波形,中间是变换器主干与预测流,右侧有两个小符号分别表示相加与拼接。训练时目标谱中间被灰色零块覆盖,推理时整条变为零张量,这个切换是全图最重要的状态变化。谐波编码器单独在左下角,它输出的增强特征不直接送入主干,而是先与退化谱在拼接点汇合,再与含噪的目标分支一起进入主干。时间步从右侧注入,用于告诉模型当前处于生成轨迹的哪个位置。

看图路径: 1. 沿底部三路输入向上追踪:目标谱、退化谱和谐波增强特征在哪里汇合;2. 确认训练与推理在目标谱分支上的区别:中间置零块与全零张量;3. 观察加法与拼接符号的位置:噪声注入点与条件拼接点;4. 从 DiT Blocks 向上看预测流、调制线性层到推理虚线框的输出路径

原论文 Figure 1:The overview of proposed Harmonic-Guided Speech Enhancement with Flow Matching (HFMSE) method.

论文图 1。原论文 Figure 1:“The overview of proposed Harmonic-Guided Speech Enhancement with Flow Matching (HFMSE) method.”。

从像素上看,底部目标分支在训练态保留左右两端紫色谱纹理、中间为灰色零块,推理态整条为灰色;中部退化谱呈橙红色连续谱;谐波增强特征为浅黄色长条。箭头显示目标分支先与噪声相加,再与退化谱和谐波特征拼接后进入蓝色变换器块,向上经调制线性层与预测流进入紫色虚线框。虚线框明确标注推理才使用,框内为常微分方程求解器加声码器,最终向上输出波形图标。该布局说明谐波先验不是后处理,而是在每次速度预测时都存在的拼接条件,直接塑造从噪声到干净语音的轨迹。

谐波编码器分哪两步计算,注意力在算什么?

谐波编码器的输入是退化谱特征,输出是谐波增强特征,内部可分为基频定位与谐波掩码生成两步,外加门控整合。第一步先用卷积层把输入投影到高维,再用两个逐点卷积分别产生键与值特征。键与梅尔尺度基频谐波转换矩阵相乘,得到基频注意力分数。这个矩阵的行对应候选基频,每行按谐波阶数的倒数平方根衰减幅度编码理想谐波梳状 pattern,谐波峰之间用余弦插值平滑,再经梅尔滤波器组投影到梅尔尺度。

注意力图越亮表示该时间帧出现该基频的概率越高,论文明确说这是在噪声谱中搜索周期性声源的过程。第二步把基频概率分布再与同一转换矩阵相乘,按物理上的基频到谐波先验推断所有可能谐波在时频面上的期望能量分布,得到谐波掩码。亮区对应基频及其泛音应增强的位置,暗区对应低概率与模板低值相乘的结果。对清音或噪声主导帧,概率分布弥散,掩码接近均匀,从而避免过度抑制非谐波成分。

基频定位 × 谐波掩码生成: 基频定位负责回答每 1 帧最可能是哪个基频,它把频谱特征与候选基频模板比较得到注意力权重;谐波掩码生成负责把该概率展开为时频面上的增强权重,它用同一模板矩阵做第二次矩阵乘法。搭配原因是单点基频估计在噪声下脆弱,而概率加权的掩码保留不确定性,清浊判断失误时退化为近均匀掩码,避免过度抑制。

读懂两步相乘的物理含义后,再看门控如何把掩码落到特征上。加权后的值张量先经轻量卷积压缩聚合,门控分支用自适应平均池化抓全局信息,经通道压缩扩张后由 Sigmoid 决定门控强度,再作用回原始特征。这种设计基于声学物理直觉:用掩码重标定谱信息,同时保留通道选择能力。

编码器细节图导读:掩码与门控在哪里闭环?

这张细节图信息密度高,建议分 3 段阅读。左段是输入与模板准备,中段是 2 次相乘与掩码生成,右段是门控增强与输出,下方虚线框是积分模块的展开。左侧输入经卷积模块后分叉为两路逐点卷积,下方另有一路从零向量出发经候选基频选择与谐波填充得到转换矩阵。中间的谱特征热图与转换矩阵在第一个叉乘符号处相遇,输出为蓝底橙块的注意力分数,再经柔性最大化进入第二个叉乘符号。

看图路径: 1. 从左侧输入 X 出发,对比上下两路:谱特征支路与候选基频模板支路;2. 观察中间两次相乘:先得到基频注意力分数,再得到谐波掩码;3. 追踪顶部 V 直连与掩码加权路径在增强特征处的汇合方式;4. 查看右下虚线框内积分模块的门控链路:池化、压缩、扩张到 Sigmoid

原论文 Figure 2:The proposed overall architecture of the two-step harmonic encoder.

论文图 2。原论文 Figure 2:“The proposed overall architecture of the two-step harmonic encoder. (a) The detail of Integrating Module.”。

从像素上看,中部注意力分数呈离散亮块,表明每帧只在少数候选基频上取得高权重;其右侧谐波掩码呈黑底红色竖条纹,与浊音谐波结构对应。顶部长箭头把值张量直接送到右侧,与经卷积模块后的掩码加权路径汇合为增强特征热图,该热图恢复出清晰的横向谐波条纹。右下虚线框内依次为深度可分离卷积、自适应池化、压缩积分、激活、归一化、扩张与 Sigmoid,最终输出门控系数与增强特征相乘后经最终卷积得到输出。这一闭环说明编码器不是输出单个基频轨迹,而是输出帧级概率性谐波表示,更适合生成式流匹配中的不确定性建模。

门控与掩码训练为何是独立的贡献?

论文把门控与掩码训练作为两个可消融的设计。门控的作用在上一节已述,它不是简单的逐点相乘,而是带全局池化与通道压缩扩张的选择性聚合。消融中把它替换为简单逐点相乘后性能下降,支持了显式压缩聚合的必要性。掩码训练的作用是构造学习压力。训练时目标谱被部分置零,模型必须利用未遮蔽上下文与谐波、带噪条件重构缺失段,这被形式化为掩码预测任务。

与标准条件流匹配把所有条件平等对待并随机丢弃不同,谐波先验被作为持久结构约束,在整个常微分方程轨迹中都不缺席。推理时掩码区域扩展为全序列长度,不需要外部干净参考,这与需要拼接干净参考的参考推理方法形成区别,使方法适用于一般增强场景。

门控机制 × 谐波掩码: 谐波掩码负责给出时频面上哪里该增强、哪里该抑制的先验权重;门控机制负责决定这些加权后的通道特征以多大强度回灌到原始特征,它经全局池化与通道压缩扩张后输出 sigmoid 门控系数。搭配原因是直接逐点相乘会平等对待所有通道,而门控可以跨通道蒸馏出真正有效的谐波信息,消融显示替换为简单相乘后性能下降。

初学者容易混淆掩码训练与推理掩码。前者是训练时的人为遮挡,用于逼模型用条件;后者是推理时全序列待生成的状态。两者共用掩码思想,但目的不同,前者为了学习,后者因为没有参考只能全生成。

训练如何组织,哪些更新哪些冻结?

训练数据由多语料混合构成,干净语音来自多个公开语音库,噪声来自两个噪声库,再用室内房间冲激响应模拟混响。混合信噪比覆盖从负到正的宽范围,并以一定概率加入混响,最终得到大规模训练集。声码器训练只用干净语音。所有音频先重采样到高采样率训练,输出评测前重采样到低采样率以保证公平。短时傅里叶变换采用汉宁窗与固定窗长跳长,再经梅尔滤波器组得到百带梅尔谱。

流匹配主干采用大通道数、二十余层、多头的变换器结构,谐波编码器特征维度较小。训练持续数十轮,采用大规模多卡训练。

掩码预测训练 × 分类器无关引导: 掩码预测训练负责迫使模型依赖条件信息,它在训练时把目标干净梅尔谱的中间段置零,只保留两端上下文;分类器无关引导负责在推理时放大条件的作用,它以一定概率丢弃条件训练无条件分支,再按强度系数组合两者速度。两者组合使模型既在训练中学会补全缺失段,又在推理中可调节对谐波与带噪输入的依赖强度。

关于参数冻结与梯度路径,原文明确给出的是损失形式与条件丢弃策略:模型预测速度场与真实位移之差的均方误差,条件在训练中被随机丢弃以支持分类器无关引导。原文未报告优化器类型、学习率、丢弃概率与引导强度的具体数值,也未说明声码器在增强训练中是否联合微调,因此复现时应将这些视为缺项,不能从模型名称推定实现。监督来源是干净目标谱与噪声样本的成对插值路径,重置时机是每步采样新的时间与噪声样本。推理开销与输出帧率在原文中未单独测量,不能据此承诺延迟改善。

在什么数据与指标下比较,条件是否一致?

评测选用 DNS Challenge 2020 测试集,分为带混响、不带混响与真实录音 3 组。测试语音统一重采样为单声道后再处理,报告的基线数字取自已发表结果。指标包括感知质量类的 DNSMOS 及其子项与总体分,以及衡量音色保真度的说话人相似度。DNSMOS 分数越高表示感知质量越好,说话人相似度越高表示越接近原说话人。比较对象覆盖回归模型、扩散模型、离散 token 模型与流匹配模型,具有代表性。

需要提醒的是,这种引用已发表结果的开放比较不能保证所有基线的训练数据与预处理完全一致,公平性依赖于同一测试集与同一重采样流程。论文还报告了消融集,固定在无混响子集上逐项移除组件,以验证每个设计的增量作用。训练与部署成本方面,原文只给出数据规模、模型宽度深度与训练轮数,未报告参数量、浮点运算量、实时率与显存占用,因此不能从趋势推定每组都省算力。

下表整理原文明确给出的信号处理与模型配置,数字与单位保留原文写法,便于复现时逐项核对。

可核对的配置表:窗长、模型宽度与混合条件

提出一个可执行问题:若要复刻数据管线,哪些数字必须先对齐?答案是采样率、窗长跳长、梅尔带数、模型宽度深度与混合信噪比范围。下表把原文连续句中的关键配置集中呈现,表头单位按原文交代,裸值不擅自添加百分号或新单位。阅读时注意训练集总量与混合信噪比是构造条件,不是模型参数;窗长与跳长同时给出采样点数与毫秒数,两者对应同一设置。

配置项关键取值说明
短时傅里叶变换窗1024 samples (42.67 ms),跳长 256 samples (10.67 ms)汉宁窗,原文同时给出点数与毫秒
梅尔谱与主干100‑band Mel‑scale,1024 feature channels,22 layers,16 heads主干宽度深度与注意力头数
混合条件与规模SNRs from –5 dB to 20 dB,40% reverberation,2000 h training set训练集构造条件与总量

表中三行分别对应信号分析、模型容量与数据构造,覆盖了复现时最易错的环节。短时分析决定时频分辨率,模型容量决定拟合能力,混合条件决定训练分布的难度。若其中任一项对不齐,后续感知分数的差异将无法归因到谐波先验本身。原文未给出批大小与学习率,复现时需自行记录并在报告中标明为自选而非原文值。

主结果测了什么,谁在什么条件下更优?

主结果要回答的是在同一测试集上,谐波约束的流匹配是否在感知质量与音色保真上同时占优。比较分为 3 组条件:带混响、不带混响与真实录音,每组报告信号、背景与总体分,不带混响与带混响还报告说话人相似度。方向都是越高越好。总体上 HFMSE 在多数指标上达到或超过所列主流模型。论文报告它超过判别式模型的代表,理由是生成式直接建模干净分布,不依赖噪声特定先验,表达自由度与质量上限更高。

与离散 token 生成方法相比,论文强调后者依赖预训练编解码或语言模型抽取语义,在强噪声下脆弱并可能损伤音色,而谐波先验来自低层物理规律更鲁棒。与同为流匹配的基线相比,HFMSE 在多数指标上更好,且对方最优需要额外文本引导,去掉后会退化。论文还指出在低信噪比与混响下增益更大,这与浅层与语义特征在该条件下不可靠的判断一致。

无混响条件指标NoisyFlowSEHFMSE
Without ReverbSIG3.3923.6903.685
Without ReverbBAK2.6184.2004.203
Without ReverbOVRL2.4833.4513.485
Without ReverbSpk Sim0.9690.9400.958

该表聚焦无混响子集,便于在同一聚合口径下比较。可见 HFMSE 在背景与总体分上超过流匹配基线,在信号分上略低但差距很小;在说话人相似度上高于该基线,但仍低于带噪输入本身的数值。这是一个重要的反例细节:去噪与重构可能轻微改变音色,使得相似度不及未处理信号,说明感知质量提升存在音色保真代价。带混响与真实录音的完整行可回原文大表核对,此处不把不同条件的差值混入同一模型列下比较。

拿掉哪一块会掉点,门控与掩码训练各值多少?

消融要回答每个设计的增量价值,实验固定在无混响测试集上,指标方向同样越高越好。被考察的项包括去掉带噪语音条件、去掉谐波编码器、把门控退化为简单相乘,以及去掉基于掩码的训练。论文报告去掉谐波编码器带来的下降大于去掉带噪语音条件,支持了谐波先验在强噪声下仍可靠的判断。把门控替换为简单逐点相乘后性能下降,支持了显式通道压缩聚合的必要性。去掉掩码训练后训练稳定性与结果变差,支持了填充式训练的作用。

无混响消融指标HFMSE 完整去掉谐波编码器去掉掩码训练
Without ReverbSIG3.6853.6223.604
Without ReverbBAK4.2034.1644.196
Without ReverbOVRL3.4853.4253.409
Without ReverbSpk Sim0.9580.9360.933

表后需要同时看到收益与代价。谐波编码器对信号分与总体分贡献明显,去掉后总体分下降较多;掩码训练对信号分与相似度影响更大,去掉后两者下降显著。未胜出项也要记录:去掉带噪语音后仍保留较高分数,说明谐波条件本身已携带较强信息,但完整模型仍是最高,因此两路条件互补而非冗余。该消融未评测计算量与延迟边界,也未报告多次运行的方差,因此不能把单次差值解读为因果必然,复现时应补多次种子与统计检验。

哪些边界没有测,不能承诺什么?

首先是指标边界。论文使用非侵入式感知质量与说话人相似度,未报告可懂度、误判率、主观听感测试与统计显著性,不能把自动感知分直接当作人评。其次是条件边界。训练混合信噪比与混响概率明确,但真实录音的噪声类型与混响时间未细化,总体趋势成立不等于每组每步都成立。再次是成本边界。

原文未测量推理步数、求解器耗时、声码器延迟、参数量与显存占用,训练资源只提到大规模多卡与轮数,没有给出硬件型号与时长,因此不能承诺延迟或成本得到改善,训练资源、推理开销与实际延迟应分别讨论。最后是比较边界。主表数字取自已发表结果,不同基线的训练语料与预处理可能不一致,引用比较支持相对判断,但待验证的是在完全统一管线下的差距。

缺失证据不是技术错误,相关性也不是因果,复现报告应明确标注哪些是原文直接报告,哪些是有限解释,哪些是待验证推测。

复现先做什么,需要保留哪些超参数?

复现的第一步是对齐数据管线。按原文把音频重采样到训练采样率,短时分析用给定窗长跳长与梅尔带数,混合时覆盖原文信噪比范围并按概率加入房间冲激响应,评测前统一重采样为单声道低采样率。声码器训练只用干净语音,增强主干训练同时喂入掩码目标、带噪谱与谐波特征,并保留随机丢弃条件以支持引导。

关键超参数中原文明确的是变换器宽度深度头数、谐波编码器维度、训练轮数与数据规模,缺项的是优化器、学习率、批大小、丢弃概率与引导强度,复现时必须自行选值并记录。代码当前可用,可从资源地址获取,但应区分代码开源、权重下载与系统可运行三件事:有代码不等于有权重,有权重不等于在你的采样率与声码器版本下可直接运行。建议先跑通无混响子集的推理与评分,再补带混响与真实录音,最后做多次种子的消融复检。

常见误解是把谐波编码器当作后处理或辅助监督,原文明确它是持久条件,直接塑造速度场与生成轨迹;另一个误解是把单点基频估计等同于本文方法,本文输出的是帧级概率性表示,不确定性被保留到掩码中。

何时值得尝试,还需补哪项验证?

当你的场景满足 3 个条件时值得尝试谐波约束的流匹配:一是浊音谐波对可懂度与自然度关键,二是噪声会同时污染浅层谱与语义提取,三是你能承担扩散类模型的迭代推理与声码器级联。它的价值在于用物理先验锚定生成轨迹,在混响与低信噪比下保持结构完整性与音色稳定。若场景以清音或非语音为主,或对延迟极敏感,则应先评估掩码退化为均匀后的实际收益与求解器步数的代价。

还需补的验证包括统一管线下的基线重跑、主观听感与可懂度测试、不同混响与噪声类型的分条件报告,以及推理步数与显存延迟的实测。只有补齐这些,才能把当前由自动指标支持的判断升级为可部署的结论。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总