英文题目:LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement

会议身份:conference:interspeech:2026:conference-paper-id:chen26s_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#强化学习 #音频大模型 #可解释性 #音视频 #语音增强

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Chih-Ning Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Jen-Cheng Hou:机构信息未能从会议 PDF 纯文本可靠映射
  • Hsin-Min Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Shao-Yi Chien:机构信息未能从会议 PDF 纯文本可靠映射
  • Yu Tsao:机构信息未能从会议 PDF 纯文本可靠映射
  • Fan-Gang Zeng:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音视频语音增强以含噪语音与唇部视频为输入并输出干净波形,难点在于均方误差与尺度不变信噪比与人耳感知错位。LR-AVSE先以编码器-分离器-解码器基座输出时域掩码并注入高斯扰动构造随机策略,其输出进入冻结语音语言模型SALMONN。SALMONN生成清晰度与噪声的自然语言评价并经情感分析模型转成1-5分相对奖励,再以近端策略优化联合尺度不变信噪比微调策略。与直接回归平均意见分的标量奖励不同,该链条保留文本作为可读证据并以相对增益稳定训练,从而实现可解释的感知对齐。在AVSEC-4测试集上该方法感知语音质量评估(Perceptual Evaluation of Speech Quality,PESQ)达到1.25,超过预训练基线的1.20与RL-DNSMOS基线的1.24,同时主观偏好率分别达96.7%与67.6%。在AVSEC-4测试集下,LR-AVSE的PESQ为1.25,高于预训练基线的PESQ为1.20。该结论适用边界受限于双耳英语场景与真实房间脉冲响应,跨语言跨噪声与更强LLM下的可迁移性尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决的听感差距是什么?

这篇论文的输入是带噪语音波形与同步的静音说话人视频,目标是从混合音频中恢复出目标说话人的干净语音。论文交代的输出是时域增强波形,后续直接送给奖励模型打分和客观指标评测。必须保留的信息是任务属于视听语音增强,视觉提供与音频互补的线索,但传统训练目标与人耳实际听感之间存在差距。

对于刚入门的读者,可以把视听语音增强理解为同时用耳朵和眼睛去噪。耳朵听到的是混着背景声的波形,眼睛看到的是嘴唇运动,白话说就是多一个模态帮助判断谁在说话。缩放不变信噪比是一种只算波形能量比的客观损失,它能让波形在数字上更接近干净语音,却不保证听起来更清晰自然。

论文要解决的正是这种数字变好但听感未必变好的错位。作者因此希望引入能说出清晰度、噪声和失真情况的大语言模型反馈,让优化方向更贴近人的描述。本解读的输出是一套可核对、可复述的方法说明,先讲相关路线,再走完一个样本从输入到奖励再到更新的全过程。

凡是教学用的比方都会明确标为例子,不添加原文没有的数值或效果承诺。例如把掩码想象成遮住噪声的时频筛子,只是帮助理解掩码即动作的设定。后续所有数字都回到原文核对,不从常识推定性能或开销。

同输入同目标的路线有哪些,为何还缺可解释奖励?

在相同输入和相同目标下,论文回顾了 3 条路线。第一条是常规监督式视听增强,用缩放不变信噪比或均方误差直接训练编码器分离器解码器结构,优点是稳定可微,缺点是与主观感知相关性不足。第二条是生成对抗思路,例如 MetricGAN 学习判别器去近似语音质量感知评价,CMGAN 同时优化幅度和相位以提升自然度。

但论文指出感知评价、短时客观可懂度等分数变高并不总对应听感变好。第 3 条是基于强化学习的语音增强,曾有人用声音质量测量、自动语音识别性能、NISQA 预测平均意见分或直接偏好优化来做奖励。这些工作证明了用感知相关信号做奖励的可行性,但奖励仍是单一数值。

论文把自己的位置放在第 3 条的延伸上,同样用强化学习微调,但奖励不再是单一数值,而是先由音频大语言模型生成自然语言描述,再转成数值。原文明确说,据作者所知,这是首个把大语言模型生成的描述性评价转为奖励信号并用于视听增强优化的框架。

与同期只用标量目标的工作不同,该设计保留了语义依据,文本能说明为何某个样本更好,例如清晰度提升、噪声减少或失真降低。这种对照的公平含义是,输入都是带噪音频加视频,目标都是输出增强语音,区别只在监督信号的形式。理解这一点后,就能明白后文为何要设置 DNSMOS 奖励基线,从而分离出自然语言带来的增量。

要优化的具体问题如何形式化?

论文把问题形式化为策略优化问题。基线是经过监督微调的模型,记为从状态空间到动作空间的映射,状态包含所有可能的带噪波形分布,动作是所有可能的掩码分布。预测的掩码被解释为动作,因为原始掩码输出是确定性的,作者向掩码注入高斯噪声以满足强化学习的随机性要求。

举例来说,一个训练样本可以想象为一段多人说话加家庭噪声的双耳录音,信噪比在负十几分贝到几分贝之间,模型要输出一个时域掩码去遮住噪声。例子仅用于帮助理解掩码即动作的设定,不代表原文报告了该样本的具体分数。形式化的好处是,后续近端策略优化可以直接比较新策略与旧策略在同一输入下的动作概率。

并用奖励差来决定更新方向,这是强化学习微调的核心。需要区分的是,原始目标仍然包含缩放不变信噪比损失,它保证波形不偏离太远。新增的强化学习目标则负责把人类可解释的感知评价带进来,两者的权重在后文训练节给出。

复现时不能只用其一来替代整体,否则要么退回纯监督,要么出现感知奖励主导下的漂移。这种双目标设计也是全文反复出现的约束,后续总损失会再次体现。

LR-AVSE 全景:一个样本走完输入到更新需要经过什么?

LR-AVSE 的全称是基于大语言模型的强化学习视听语音增强框架。沿一个样本走完全程,左侧进入的是带噪语音波形与视频帧,中间蓝色方块是视听增强模型,它输出增强语音。增强语音同时分两路,一路与干净语音比较计算缩放不变信噪比,一路进入奖励模型得到感知分数。

两路信号再汇入近端策略优化损失并与总损失结合,最终返回更新增强模型的权重。下图展示了论文给出的训练流程全景,重点是双目标如何汇合再回传,阅读时不要把奖励支路误认为只在推理时使用。

看图路径: 1. 先从左上找到带噪语音波形与人物视频汇入蓝色 AVSE 模型的箭头;2. 再沿增强语音分叉看一路去 SI-SNR 一路去 Reward 的走向;3. 最后看 PPO Loss 与 SI-SNR 如何汇入 Ltotal 再返回更新权重

原论文 Figure 1:The training procedure of the proposed LR-AVSE framework.

论文图 1。原论文 Figure 1:“The training procedure of the proposed LR-AVSE framework.”。

从像素可见,顶部左侧是带噪语音波形图标与人物视频图标,顶部右侧是干净语音波形图标。中间蓝色圆角矩形标注 AVSE Model,右侧两个橙色椭圆分别标注 SI-SNR 和 PPO Loss,下方橙色椭圆标注 Ltotal,中间还有橙色方块标注 Reward。蓝色箭头从增强语音同时指向 SI-SNR 和 Reward,Reward 再指向 PPO Loss,SI-SNR 同时指向 PPO Loss 和 Ltotal,Ltotal 经 Update weight 返回 AVSE Model。

这种画法说明感知奖励与信号保真损失是并行计算再联合优化,而不是串行替代。全景的教学意义在于先建立主路径,再看分支,主路径保证模型始终能重构语音,分支提供人类听感方向。冻结的大语言模型在训练中保持不变,以确保奖励标准稳定,这一点在复现时必须保留,否则奖励本身漂移会导致策略学到投机行为。

增强网络与奖励模型各自算什么,为何这样搭配?

增强网络采用编码器分离器解码器结构。编码器用 1 维卷积加激活把时域信号变为高维表示,视觉分支用视觉前端从视频提取特征。分离器采用时域卷积网络结构,先对视觉特征做深度时间卷积和点卷积,再与音频特征融合后预测时域掩码。

解码器把掩码作用于编码特征重构出时域波形,原文给出了带噪波形、视频、掩码和重构波形的符号与形状定义。训练基线阶段用负的缩放不变信噪比作为损失,这是监督起点。下图是论文给出的可解释奖励生成管线,核心是两步转换,先说后打分。

看图路径: 1. 先确认左侧 Speech 进入橙色 LLM 方块的蓝色箭头;2. 再看顶部语音质量提示词从上方注入同一方块的位置;3. 最后跟踪自然语言描述进入情感分析模型再输出分数的链条

原论文 Figure 2:Pipeline of the LLM-based interpretable reward gen- eration.

论文图 2。原论文 Figure 2:“Pipeline of the LLM-based interpretable reward gen- eration.”。

从像素可见,左侧 Speech 蓝色箭头进入橙色 LLM 方块,顶部 Prompt for speech quality 蓝色箭头从上方进入同一方块。LLM 向右输出 Natural language description,再经蓝色箭头进入 Sentiment analysis model 橙色方块,最终向右输出 Score。这条链的输入是增强语音波形与提示词,输出是 1 到 5 分的情感分数。

论文选用的大语言模型是为语音任务微调过的 SALMONN,提示词采用官方推荐的请对该语音样本质量给出评估,情感分析模型具体是 BERT。

视听语音增强 × 强化学习: 视听语音增强分工是把带噪语音波形和唇部视频一起编码、融合后预测掩码并重构出增强语音,强化学习分工是把掩码预测看作连续动作并用奖励高低调整策略;搭配理由是传统 SI-SNR 可微但与感知不完全一致,而强化学习允许优化不可微的感知奖励,组合意义是让同一增强网络在保持信号重构能力的同时向感知更优方向试探。

SALMONN × 情感分析: SALMONN 分工是听增强后语音并用自然语言说出清晰度、噪声和失真情况,情感分析模型分工是把这段描述映射为 1-5 分的数值奖励;搭配理由是纯数值无法说明为何好坏而纯文本无法直接优化,组合后既保留语义依据又得到可用于 PPO 的标量信号。

为验证文本奖励的有效性,论文还实现了一个对照,把上述 SALMONN 加 BERT 换成 DNSMOS 直接预测平均意见分,其余训练流程完全相同。DNSMOS 是预训练的语音质量评估模型,直接输出 1 到 5 分的预测。这种对照让读者能判断增益来自自然语言的丰富信息,而非仅仅来自引入强化学习。

如何用相对奖励和 PPO 把感知反馈变成权重更新?

训练分为 2 个阶段。预训练阶段直接使用 AVSEC-4 组织方提供的预训练权重,该权重已用缩放不变信噪比做监督训练。强化学习微调阶段在该权重上继续优化,超参数在原文明确给出,掩码噪声标准差为 0.05,近端策略优化截断范围为 0.1,KL 系数为 0.0001。

缩放不变信噪比损失权重为 1.0,学习率为 0.001,大语言模型在训练中保持冻结,以保证奖励标准稳定。具体计算上,作者用相对提升作为奖励,即当前策略输出的得分减去基线策略输出的得分。得分本身是情感分析对大语言模型文本的映射,或在对照组中是 DNSMOS 的输出。

文本例如语音清晰但仍有轻微背景噪声,或去噪效果好但略有失真感,这些描述为奖励提供了可解释性,而不只是分数优化。总体优化目标是相对奖励减去 KL 散度惩罚,KL 项防止新策略过度偏离原始策略。策略更新基于近端策略优化,但做了简化。

由于每个回合是单步决策且相对奖励已包含基线信息,作者用上述总体目标替代传统优势函数,从而省去额外的评论家网络。截断损失用新旧策略概率比与截断区间控制更新步长,微调时还加入原始预训练损失以稳定模型,最终总损失是截断损失加权缩放不变信噪比损失。

相对奖励 × KL 散度约束: 相对奖励分工是用当前策略输出得分减去基线策略输出得分来抵消绝对打分漂移,KL 散度约束分工是惩罚新策略相对基线策略的分布偏离;搭配原因是向掩码加噪试探容易走远,组合意义是在鼓励超越基线的同时把更新幅度锁在可信范围内。

复现时要注意梯度路径,原文明确的是增强模型参数更新、大语言模型冻结、情感分析模型作为打分器使用。未报告情感分析模型是否微调,因此不应假设其参与训练,若缺失该细节,应在复现记录中标为待确认,而不是从模型名称推定实现。

数据、划分、基线与指标条件是什么?

实验使用第四届 COG-MHEAR 视听语音增强挑战赛数据集。训练、验证与评估的场景数量、说话人数与噪声来源各不相同,信噪比覆盖从很低到中等正值的范围。训练用模拟房间脉冲响应,测试用 3 个会议室实录的房间脉冲响应,带来泛化挑战。

所有语音下采样到 16 千赫,本工作用双耳信号,每个场景提供静音视频、目标语音及其混合音频。下表整理了原文报告的数据划分与采集条件,阅读时注意场景数、说话人数与噪声文件数是相互独立的列,不能混为一谈。

数据划分场景数量目标说话人数竞争说话人或噪声文件信噪比与采样
训练集34,524 scenes605 TED/TEDx405 competing speakers,7,346 noise files,15 类−18 dB to +6.55 dB,16 kHz
验证集3,365 scenes85 target30 competing speakers,1,825 noise files16 kHz,16 位
评估集3,180 scenes噪声为训练子集实录房间脉冲响应,1 到 2 米会议室双耳信号,静音视频

表后解释需要同时看到规模与难度。训练集三万多场景与六百多位目标说话人保证了多样性,七千多噪声文件覆盖家庭、 freesound 与音乐等多类。验证与评估场景数各为三千多,但评估噪声是训练子集而房间响应变为实录,这种设计把泛化压力放在混响而非全新噪声上。

未评测边界是原文未报告按信噪比或噪声类别细分的性能,因此不能推定在极低信噪比下同样提升。基线有两类,都基于同一预训练视听骨干,预训练基线仅用监督训练,RL-DNSMOS 与新方法共享同一强化学习管线。客观指标包括宽带 PESQ、STOI、NISQA 预测 MOS、VQscore 和 SpeechBERTScore,主观评价是 21 人每组 10 条的偏好测试。论文未绑定可用资源链接,因此本解读按资源状态写作链接当前不可用。

主结果测了什么,数字在什么条件下支持什么判断?

主结果要回答的问题是,在同一测试集与同一骨干下,文本奖励微调是否同时提升有参考客观指标与无参考神经质量指标。比较条件一致,三者都从官方预训练权重出发,新方法与 RL-DNSMOS 共享 PPO 超参数与训练流程,指标方向均为越高越好。下表整理了原文以连续句报告的测试集客观结果与主观偏好规模,数值保留原文精度。

条件PESQNISQA 预测 MOSVQscore 与 S-BERT听测偏好与规模
Noisy 输入未在连续句报告0.97未在连续句报告未参与听测
Pretrained Baseline1.200.99未在连续句报告96.7% 偏好归属 LR-AVSE,21 人,10 条每组
RL-DNSMOS1.24未在连续句报告未在连续句报告67.6% 偏好归属 LR-AVSE,21 人,10 条每组
LR-AVSE1.251.290.62 and 0.5796.7% 对基线,67.6% 对 RL-DNSMOS

表后解释需要同时看到收益与代价。LR-AVSE 在 PESQ 上达到 1.25,超过预训练基线的 1.20 和 RL-DNSMOS 的 1.24。在 NISQA 上达到 1.29,明显超过 Noisy 输入的 0.97 和预训练基线的 0.99。在 VQscore 与 S-BERT 上分别得到 0.62 和 0.57,为所有方法中最好。

论文报告这支持自然语言描述提供了更丰富的质量信息,帮助模型学到更细致的增强策略。但也要看到未胜出项的边界,部分基线在个别指标上的具体数值未在连续句中报告,因此本表以横线或文字说明标示缺项而不补数。下图展示了单样本的可解释性证据,说明奖励、PESQ、STOI 三者同向变化,阅读时注意这是一个示例而非全集平均。

看图路径: 1. 先对比左侧带噪语音与增强语音经 LR-AVSE 输出的波形变化;2. 再读中间 SALMONN 对两段语音的红绿英文描述关键词;3. 最后看右侧奖励、PESQ、STOI 三组红绿条形的增量标注

原论文 Figure 3:LR-AVSE inference with SALMONN.

论文图 3。原论文 Figure 3:“LR-AVSE inference with SALMONN. Rewards from textual descriptions align with PESQ and STOI, demonstrating LR-AVSE’s interpretability.”。

从像素可见,左侧视频加 LR-AVSE 同时输出带噪语音波形与增强语音波形,中间用户气泡写着请评估该语音样本质量。SALMONN 图标后分出红绿两框,红色框说样本质量差、失真闷、难懂且背景噪声多,绿色框说样本质量好、清晰易懂、组织良好但仍有背景噪声。右侧 3 组条形分别标注奖励提升正 1.79、PESQ 提升正 0.38、STOI 提升正 0.02。

这种文本让读者能说出分数为何上升,而不只是看到数字变大。

PESQ × NISQA: PESQ 分工是按宽带模式给出与干净参考比较的客观语音质量分,NISQA 分工是无参考的神经网络预测平均意见分;搭配原因是前者需要干净参考而后者更接近整体听感预测,二者一起看可以同时检验新方法在有参考失真和无参考感知两个维度是否一致变好。

总体判断应表述为报告显示新方法在多指标上领先,且单样本的文本奖励与客观指标正相关,但相关性不等于因果,单样本的增量不能推广为每条语音都有相同幅度提升。

换掉文本奖励会怎样,人听更喜欢哪一个?

该节要回答的对照问题是,如果把 SALMONN 加 BERT 换成 DNSMOS 直接打分,在相同 PPO 管线下效果差多少。论文的设置是公平的,除奖励模型外其余训练流程相同,因此 PESQ、STOI 与神经质量分数上的差距可以直接归因于奖励形式。客观上文本奖励在 PESQ 与 NISQA 上领先,而主观上新方法对预训练基线取得很高偏好率。

对同样经过强化学习的 RL-DNSMOS 仍取得超过六成的偏好率,论文报告这支持可解释奖励不仅提升客观分数,也更符合听感。下图是偏好率柱状图,重点看两组对比的高度差异而非绝对听感分数,横轴是两种对比条件,纵轴是偏好率百分比。

看图路径: 1. 先确认横轴两组对比条件与纵轴偏好率百分比的含义;2. 再比较左侧深蓝 96.7% 与橙色小柱的悬殊高度差异;3. 最后看右侧 67.6% 与 32.4% 在同一 RL 管线下的差距收窄

原论文 Figure 4:A/B preference test results on the AVSEC-4 test set.

论文图 4。原论文 Figure 4:“A/B preference test results on the AVSEC-4 test set.”。

从像素可见,纵轴为偏好率百分比,横轴左侧为 LR-AVSE 对预训练基线,右侧为 LR-AVSE 对 RL-DNSMOS。左侧深蓝柱标注 96.7%,橙色小柱很矮,右侧深蓝柱标注 67.6%,绿色柱标注 32.4%。图例区分了 3 种颜色对应的方法。这种可视化支持文本奖励相对监督基线提升很大、相对标量强化学习仍有可辨优势的判断。

但反例同样重要,对 RL-DNSMOS 仍有约三成偏好落在对手,说明标量奖励并非无效,在部分语音上听感差距不大。此外主观实验只覆盖每组 10 条共 21 人,未报告统计显著性与误判率,因此不能把偏好率当成部署后每批语音的保证。

DNSMOS × 大语言模型可解释奖励: DNSMOS 分工是直接输出 1-5 分预测作为标量奖励,大语言模型可解释奖励分工是先生成文本描述再转分;搭配做对照的原因是二者共享同一 PPO 管线和超参数而只有奖励来源不同,组合比较能分离出自然语言描述带来的额外感知增益而不只是强化学习本身的作用。

论文未做拿掉视觉、拿掉 KL 约束或更换提示词的消融,因此这些维度的贡献在本研究中属于未评测边界,不应自行推断拿掉后必然怎样。待验证的是更大样本与更多噪声类型下优势是否稳定。

文本奖励的局限与未验证的推测是什么?

论文在讨论节明确报告了当前大语言模型选择的局限。生成描述时句子倾向固定模式,例如重复语音样本质量差或好、音频失真闷等表述。这种重复限制了奖励捕捉语音质量细微差异的能力。原文用可能、潜在等措辞指出这会使区分细微差别变得困难,这属于有限解释而非已验证的因果。

未来方向在原文列为两点,一是采用能力更强的模型以生成词汇更丰富、更细粒度的描述,二是更细致的提示工程。例如要求从清晰度、噪声水平、音色自然度与响度稳定性等方面做结构化评价,这些是待验证的改进假设,不是已证明的增益。

从复现角度看,还有三项缺项需要标明。第一,情感分析模型是否冻结、阈值如何映射未详细交代,不能从 BERT 名称推定实现。第二,训练与推理的计算开销、延迟、显存未报告,不能承诺该方法在实时系统上同样高效。

第三,主观实验样本量较小且未报告统计方法,总体趋势不等于每组每步都成立。区分报告、支持与待验证的表述,有助于避免把相关性误读为因果。缺失证据不是技术错误,但在补足之前不应把推测当作结论使用。

复现先做什么,需要哪些条件与检查点?

复现应先准备 AVSEC-4 数据与官方预训练权重。数据需按原文划分为训练三万多场景、验证三千多场景、评估三千多场景,语音 16 千赫 16 位,双耳信号,信噪比覆盖负 18 分贝到正 6.55 分贝。测试用实录房间脉冲响应,模型骨干是编码器分离器解码器加时域卷积分离器。

初始权重用组织方提供的监督权重,损失为负缩放不变信噪比。第二步搭建强化学习微调管线,向预测掩码加标准差 0.05 的高斯噪声以获得随机策略。PPO 截断范围 0.1,KL 系数 0.0001,缩放不变信噪比权重 1.0,学习率 0.001。

奖励管线为 SALMONN 加 BERT,提示词使用官方推荐的请评估该语音样本质量,SALMONN 冻结,相对奖励用当前策略得分减基线得分。总损失为截断损失加权缩放不变信噪比,对照组把奖励换成 DNSMOS 直接输出 1 到 5 分,其余不变。检查点包括奖励文本是否出现清晰、噪声、失真等关键词并与分数同向变化。

客观指标是否在测试集上复现出 LR-AVSE 领先的现象,主观抽查是否更偏好新方法但对 RL-DNSMOS 仍有约三成偏好。由于原文未绑定可用资源链接,本次解读按资源状态写作链接当前不可用。不得声称代码或权重已公开,复现中遇到缺失的映射细节应记录为缺项而不是自行补数。

何时值得尝试这个思路,如何一句话记住它?

当你的增强模型在缩放不变信噪比上已收敛但听感仍有闷、吵或失真抱怨,且你有视频辅助与可调用的音频大语言模型时,值得尝试这种先说后打分的强化学习微调。它把不可微的人类描述变成可优化的相对奖励,同时用 KL 约束与原始损失防止跑偏。

不值得盲目尝试的情况是实时性要求极高或无法承担大模型打分开销时,因为论文未测量延迟与成本,感知增益不能自动兑换为部署收益。同样,如果你的数据与 AVSEC-4 差异很大,实录混响与噪声分布不同,应先小规模验证文本奖励是否仍与 PESQ 和听感同向。

一句话记住,用冻结的会说话的评委给增强结果写评语,再把评语转成分数去微调去噪策略,评语本身就是可读的优化依据。后续若换更强的评委或更细的提示词,需要重新核对文本多样性是否真正带来分数与听感的双重提升。

这种核对应包括客观指标、文本关键词与小规模听测三者是否同向,缺一都应暂缓推广。只有在三者一致且开销可接受时,才值得把该思路纳入正式训练流程。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总