英文题目:UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement
会议身份:
conference:interspeech:2026:conference-paper-id:yan26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#自回归模型 #多任务学习 #偏好优化 #语音增强
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Haoyin Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Chengwei Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shaofei Xue:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaotao Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Yinghao Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxiang Kong:机构信息未能从会议 PDF 纯文本可靠映射
- Zheng Xue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从含噪、混响、削波、限带、丢包及双人混叠的退化语音中恢复目标干净语音,难点在于失真类型多样且语音恢复与目标说话人提取及语音分离的学习范式相互冲突。UniSE先以冻结WavLM Base Plus抽取参考与退化语音连续特征并经线性适配器映射为条件,再由12层解码器自回归生成BiCodec解耦的全局与语义离散令牌,最后经BiCodec解码器重建波形,条件特征作为前缀进入解码器而输出令牌经编码器监督训练。任务令牌切换语音恢复与目标说话人提取及反向提取模式,首轮恢复较响说话人再以其为参考提取并反向提取另一人,从而多轮组合实现双人分离,渐进式直接偏好优化先以DNSMOS平均分再以WavLM特征距离做偏好对齐听感。相对掩码预测与直接映射的多任务框架,该自回归按条件生成目标令牌的机制兼容不同任务模式切换与组合,避免了统一映射冲突并支持感知对齐细化。在DNS 2020含混响测试集下,UniSE+PRL的OVRL得分为3.64,高于Conv-TasNet的OVRL得分2.01。该结论限于16 kHz非流式英文与中文数据及双说话人分离流程,尚未验证严格流式与多于2人场景。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文面向刚进入语音增强的研究生,输入是退化录音,有时附带一段参考语音,目标是还原出干净的目标语音。本文讨论的语音增强已经超出传统去噪,包含 3 类子任务。第一类是语音恢复,要从含噪声、混响、削波、限带、丢包等多种失真的录音中恢复干净语音。第二类是目标说话人提取,要在混合语音中根据参考语音的音色取出目标人。第 3 类是语音分离,要把混合中的说话人逐个分开,本文只考虑双人情形。
读完这篇解读,你应当能复述统一框架如何组织输入序列,如何用任务标记切换模式,连续特征与离散令牌如何分工,训练与 2 阶段偏好微调如何衔接,以及实验在哪些数据集与指标下比较。需要保留的关键信息包括模型结构与参数规模、训练数据的来源与失真配置、推理时 3 种模式的调用顺序、评价指标的方向性。原文未公开可验证的代码与模型资源,本次不能声称已公开,只能按论文文字复述方法。
此前语言模型做增强走了哪些路线,缺口在哪里?
在神经音频编解码器普及之后,语言模型被引入语音增强,常见做法是预测干净语音的离散令牌。文中提到的生成式路线包括 2 阶段自回归建模,先在含噪语义条件下生成干净语义令牌,再预测干净声学特征;也有目标说话人提取工作把混合与参考的连续特征作前缀,再自回归估计目标令牌。另一类路线采用掩码预测或非自回归映射,例如在多层离散令牌上做掩码生成,或把含噪特征直接映射到干净离散令牌,并用双通道输入输出支持多任务。
论文指出,这些工作或局限于单一失真与单一任务,或采用掩码生成与直接映射范式,自回归建模在多任务统一框架中的效果仍需验证。解码器结构的优势在于前缀组织灵活,可以通过不同的起始标记与特征拼接形式容纳多种条件,因此被选作统一多种学习模式的载体。
在强化学习方面,大语言模型领域常用人类偏好对齐与任务目标对齐,语音合成中已有偏好优化改善情感一致性的尝试,但增强领域仍主要依赖信号级监督损失,而信号级指标与听感并不总是相关,这构成引入感知奖励的动机。
三种任务的学习模式为何难以放在一个模型里?
语音恢复、目标说话人提取与语音分离的条件与目标定义不同。恢复任务只有退化语音,没有参考语音,目标是退化的干净对应。提取任务同时有混合语音与参考语音,目标是与参考音色匹配的成分,不论响亮与否。分离任务需要输出所有说话人,存在排列与跨段一致性问题。如果为每种任务训练专用模型,参数与维护成本上升,且难以共享声学与语义表示。
若简单拼接条件,模型可能混淆何时该利用响度线索、何时该利用音色线索。举例来说,同样一段双人混合,恢复模式应当输出较响者,提取模式应当输出与参考同音色者,反向提取则输出剩余者,三者的期望输出不同,但输入波形可以相同。因此统一框架必须显式告知模型当前处于何种模式,并保证不同模式的监督信号格式一致,才能用同一自回归分布完成学习。论文用可学习的任务令牌加统一的序列模板解决该问题,并用多次推理的组合策略处理分离。
整体框架如何让一个样本走完输入到输出?
框架包含 4 个部分。第一是条件特征提取器,采用预训练语音编码器加可训练线性适配器,从参考语音与退化语音得到连续特征。第二是离散语音编解码器,训练时由编码器产生标签令牌,推理时由解码器根据预测令牌重建波形。第三是解码器语言模型骨干,负责在给定条件下自回归预测目标离散表示。第四是偏好微调框架,用于提升生成语音的感知质量。
沿一个样本走一遍,在恢复模式下,退化语音先经编码器与适配器得到退化特征,与任务标记及起始标记拼接成输入序列,语言模型逐个输出全局令牌与语义令牌,最后由编解码器解码器合成波形。在提取模式下,参考语音同样经过编码器与适配器得到参考特征,与退化特征共同作为条件,目标是音色匹配成分。
在分离的双人情形下,先用恢复模式取出较响者,再以该结果为参考调用提取模式固定说话人,最后以第 1 位说话人为参考调用反向提取得到另 1 位说话人。目标说话人提取与反向提取共享输入格式,只是目标定义互补。
目标说话人提取 × 反向: 目标说话人提取负责取出与参考音频音色匹配的成分;反向负责取出与参考音频音色不匹配的剩余成分;搭配理由是两者共享相同的输入格式与损失形式,只是目标定义互补,组合意义是双人分离可以通过先取响亮者、再按参考取一致者、最后取剩余者的多次推理完成。
以下导读帮助你阅读整体结构图,先抓住主路径与分支汇合,再看微调回路如何与主干连接。
看图路径: 1. 沿底部参考语音与退化语音箭头向上追踪到适配器与条件嵌入;2. 对比黄色参考嵌入与绿色退化嵌入在解码器下方的拼接位置;3. 观察右侧全局令牌与语义令牌如何向上送入编解码器解码器;4. 查看左上偏好微调虚线框内策略模型生成两个样本并判定胜负的回路
论文图 1。原论文 Figure 1:“Overall architecture of UniSE, where the BiCodec Encoder is only utilized to generate label tokens during training and excluded during inference.”。
该图展示了底部两路输入经同一编码器与适配器得到参考嵌入与退化嵌入,中部解码器在任务标记与各类起始标记引导下生成全局与语义令牌,顶部由编解码器解码器汇总为目标语音。训练时目标语音还向下送入编解码器编码器产生标签,推理时该支路不再使用。左上虚线框表示偏好微调,策略模型在给定条件下生成两个候选样本,经准则判定胜负后更新策略模型,参考模型保持对齐锚点。图例区分了参考嵌入、退化嵌入、全局令牌、语义令牌与各类起始结束标记,雪花与火焰图标分别表示冻结与优化的参数。
条件、令牌与任务标记各自负责什么?
先解释术语。连续条件特征指未经量化的语音表示,白话说就是保留细节的向量序列。离散目标令牌指经量化后的语音单元,白话说就是把语音切成有限词表中的编号,便于语言模型预测。全局令牌承载说话人特性,长度固定为 32 个;语义令牌承载内容,速率为每秒 50 个,二者均为单层量化,便于自回归接入。
条件提取器把所有变换器层的特征平均,以同时获得声学与语义信息,再经线性适配器映射到适合语言模型建模的空间,分别得到参考特征与退化特征。预训练编码器参数冻结,适配器与解码器参数优化。任务标记是 3 种可学习向量,分别指示恢复、提取与反向提取。输入序列按模板组织,恢复模式为任务标记加退化起始与退化特征,再加全局起始与全局特征、语义起始与语义特征;提取模式在此基础上加入参考起始与参考特征。
输出序列为全局特征加语义起始与语义特征加结束标记。优化目标是给定前缀下输出序列的负对数似然。
连续条件特征 × 离散目标令牌: 连续条件特征负责保留输入语音的声学与语义细节,由冻结的语音编码器加可训练适配器产生,不做量化;离散目标令牌负责把回归问题转成可自回归建模的分类问题,由神经音频编解码器给出全局与语义两类令牌;二者搭配的理由是连续特征避免过早丢失退化语音信息,离散令牌便于语言模型学习目标分布,组合后模型以条件概率逐个预测目标令牌,再由解码器合成波形。
任务令牌 × 操作模式: 任务令牌是可学习的起始标记,分别对应语音恢复、目标说话人提取与反向提取;操作模式是输入序列的组织方式,决定是否接入参考语音以及目标是响亮者、匹配音色者还是剩余者;搭配理由是解码器只需根据前缀中的任务令牌切换条件组合,组合意义在于同一套参数通过切换与串联 3 种模式即可覆盖单失真恢复、按音色提取与双人分离。
全局令牌 × 语义令牌: 全局令牌负责承载说话人特性,长度固定;语义令牌负责承载内容,随时长变化;搭配理由是显式解耦让模型分别学习音色保持与内容恢复,组合意义是推理时解码器同时利用两类令牌重建波形,训练时编码器只在训练阶段提供标签,推理阶段不再使用。
这种分工使连续侧负责信息保留,离散侧负责分布建模,任务标记负责模式选择,三者缺一不可。
训练与两阶段偏好微调如何衔接?
训练分两个大阶段。第一阶段是多任务自回归训练,随机选择操作模式,按概率施加失真,目标是最小化对应模式的交叉熵损失。恢复、提取与反向提取各有形式相同但条件不同的损失,反向提取的输入格式与损失与提取保持一致,只是目标为音色不匹配成分。第二阶段是渐进式强化学习微调。预训练好的统一模型同时作为参考模型并初始化策略模型。
微调时策略模型在给定参考与退化条件下即时生成两个候选结果,按特定准则判定胜者与败者,再计算偏好优化损失。该损失比较策略模型与参考模型在胜负样本上的序列概率比,由温度系数控制偏好强度,并经激活函数得到期望。第一阶段只用语音质量预测分数的平均值判定胜负,损失为交叉熵加偏好损失的加权和。第二阶段额外引入语音编码器特征的欧氏距离作为相似性准则,距离越小表示与真值越相似,损失为交叉熵加两项偏好损失各一半权重。
先建立感知质量基础再细化一致性,是为了避免异质偏好信号冲突。
直接偏好优化 × 渐进式强化学习: 直接偏好优化负责利用胜者与败者样本对调整策略模型,使其相对参考模型更偏向高分样本;渐进式强化学习负责分两个阶段先后引入不同偏好标准,先做感知质量再加入特征相似性;搭配理由是避免异质偏好信号相互冲突,组合意义是先建立稳定的整体质量基础,再细化语义与声学一致性。
原文报告了微调超参数,但未报告温度系数的具体取值与偏好对构造的随机种子等细节,复现时需按文字默认实现并记录这些缺项。
数据、失真、模型与评价条件是什么?
训练用干净语音来自整合清洗后的语音集合,包含读书语音、英语多说话人集合与中文集合的多个子集,总时长数千小时。噪声语料约数百小时,来源覆盖挑战赛噪声、事件声、音乐、环境声等多个库,另有数万条房间脉冲响应用于仿真混响。所有音频采样到 16 千赫。失真按概率施加,噪声概率较高,混响、削波、限带、丢包概率较低,干扰说话人在恢复模式下以较低概率出现且信干比较高,在提取与反向提取模式下必定出现且信干比范围更宽。
具体类别包括噪声、混响、削波、限带、丢包与干扰说话人,信噪比与带宽、丢包率等超参数在原文表格中给出范围。训练与推理时参考与退化语音裁剪或补齐到 5 秒。骨干为 12 层、每层 8 头、隐维度 512 的语言模型结构。优化器为 AdamW,训练 30 轮,学习率经数千步预热达到峰值后按每轮衰减。微调时交叉熵权重取中间值,更新数千步,批量与学习率按原文设置。
评价覆盖去噪挑战赛测试集、紧急挑战赛盲测集、干净混合的提取测试集以及含噪混合与另一双人混合的分离测试集。指标采用语音质量预测分数的 3 个子分与总分、另外两种非侵入式质量预测分数,以及用说话人验证编码器计算的说话人相似度。分数越高表示质量或相似度越好,距离越小表示越相似。
下面表格整理模型规模与训练配置,提出的问题是该方法的参数量与训练预算是否属于轻量可复现范围,公平条件是同一骨干与同一截断长度下的比较,指标方向是参数越少、轮数越少则成本越低。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 12 | 8 | — | — |
| 来源句二 | 7 | 2493 | 24 | 5;2024;2;30;829;852;2022;2407.10671;25;6 |
| 来源句三 | 1787 | 5 | 20 | 1;2015;5206;5210;7178964;2109.13731;2021 |
该表显示骨干参数量为数十兆量级,训练轮数与截断长度明确,微调步数与批量较小,说明主要成本在多任务自回归训练阶段。代价是仍需大规模干净与噪声语料以及脉冲响应仿真,复现时需准备相同量级的数据管道。未胜出项是更大规模的基线在个别子分上仍有竞争力,边界是本文只报告双人分离,未评测更多说话人与流式条件。
主结果在恢复、提取与分离上说明了什么?
恢复任务在去噪挑战赛测试集上比较了传统卷积分离模型、频域增强模型、时频网格模型与多个生成式基线。生成式方法总体优于判别式方法,统一模型在含混响与不含混响子集上均取得有竞争力的总分,仅用恢复模式训练的变体与多任务版本性能接近,说明多任务学习未明显损害单任务。引入 2 阶段偏好微调后,分数进一步提升,且分阶段引入准则优于单阶段优化。
在紧急挑战赛盲测集上,该方法面对未见过的编解码损伤与风噪仍取得有竞争力的非侵入式分数,显示一定泛化能力。提取任务在干净双人混合测试集上与专用提取模型及生成式统一模型比较,统一模型与同规模自回归提取方法接近,多任务版本与单任务变体接近,偏好微调一致提升质量分数。直接用编解码器处理目标语音的重建分数揭示了低码率编解码器本身的性能上限。
分离任务在两个双人混合测试集上比较了卷积与混合结构分离模型及生成式基线,统一模型取得更高的总分,偏好微调再带来提升,支持多模式串联推理的有效性。 下面表格整理编解码表示、微调配置与分离总分及提升量,比较问题是在相同双人测试与相同质量总分下可运行策略带来多少增益,公平条件是同一模型经偏好微调前后对比,指标方向是总分越高越好。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 2020 | 4 | 2492 | 2496;32;2477;2493;24;5;2024;2 |
| 来源句二 | 2020 | 4 | 2492 | 2496;32;2477;2493;24;5;2024;2 |
| 来源句三 | 3.62 | 4.09 | 3.34 | 3.63;3.36;0 |
| 来源句四 | 3.76 | 4.20 | 3.55 | 3.71;4.19;3.49;0.21 |
表后解释是全局与语义表示的固定长度与速率决定了自回归序列长度与建模难度,微调权重取中间值以平衡质量与相似度,分离总分在 2 个数据集上均有明确提升且微调带来额外增益。代价是自回归解码效率低于非自回归,且全 utterance 条件不利于严格流式。未胜出项是基线在背景抑制等子分上仍接近,限制是总分改善不代表每段语音都改善,也未测量延迟与误判率。
哪些对照支持自回归与结构选择,权重如何权衡?
消融研究首先把自回归建模替换为非自回归映射,即直接预测语义令牌再结合真实全局令牌重建,结果性能明显下降,支持自回归更适合刻画目标分布的判断。其次把骨干替换为另一开源大模型结构,结果接近,显示框架对骨干有一定灵活性。改用另一编解码器则性能明显下降,原文解释为码本过大增加了语言模型负担,该解释属于有限解释而非因果证明,仍待验证。
权重系数的扫描显示,当交叉熵权重过低时优化由偏好损失主导,整体质量很高但说话人相似度严重下降,呈现模式坍塌;权重取中间值时两者达到平衡,因此后续微调采用该值。 以下导读帮助你阅读权重扫描图,先分清双纵轴,再看交叉与平稳。
看图路径: 1. 先确认横轴为权重系数与纵轴左侧为整体质量、右侧为说话人相似度;2. 观察权重为零附近整体质量最高而相似度最低的交叉形态;3. 追踪权重增大到中间值后两条曲线趋于平稳的转折位置
论文图 2。原论文 Figure 2:“The OVRL and SIM scores in terms of different α values in the TSE task on Libri2Mix clean test set.”。
该图横轴为权重系数,左侧纵轴为整体质量,右侧纵轴为说话人相似度。蓝色质量曲线从左侧高点随权重增大快速下降后趋平,红色相似度曲线从左侧低点快速上升后趋平,两者在较小权重处交叉,中间权重之后均进入平台期。像素可辨的趋势支持权重过小导致相似度崩塌、权重适中实现平衡的结论,但具体数值不宜从像素硬读,应以正文报告的中间取值为准。该结果的适用条件是提取任务的干净混合测试集,是否推广到恢复与分离仍需补充验证。
还有哪些边界与未验证的推测?
论文在结论中明确两项限制。其一是推理条件为整句级,输入分段长度与训练一致以降低开销,但仍需完整上下文,不满足严格流式。其二是非自回归相比,解码效率处于劣势。此外还有若干未评测边界。分离只考虑双人情形,更多说话人、强混响与极低信噪比下的行为未报告。
评价以非侵入式质量预测与相似度为主,侵入式信号指标对生成式模型不友好,原文未以此作为主要依据,因此不能把质量分改善等同于波形误差减小。偏好微调依赖质量预测模型与编码器特征距离,这些代理与真实人评的相关性未在本文直接验证,只能视为支持感知对齐的间接证据。编解码器码本大小与性能关系的解释属于可能的原因,待验证。训练资源方面未报告硬件时长与显存占用,推理开销仅给出每秒乘加运算量,实际延迟与帧率需另行测量。
复现应当先做什么,需要补哪些验证?
复现先准备数据管道。按原文收集干净语音、噪声库与脉冲响应,统一采样率,实现按概率施加 6 类失真的仿真,训练与推理统一截断到 5 秒。接着实现条件侧与令牌侧。条件侧用预训练语音编码器平均所有层特征并接线性适配器,编码器冻结而适配器训练。令牌侧用单流解耦编解码器,训练时编码器提供固定长度全局令牌与变长语义令牌,推理时只用解码器。
语言模型按 12 层、8 头、隐维度 512 实现,输入模板按 3 种模式组织,输出为全局加语义加结束标记,损失为负对数似然。训练时随机选择模式,优化器与预热、衰减按原文设置。微调时先实现单准则偏好优化,再加入相似性准则,注意保留交叉熵项并取原文权重。推理时恢复取较响者,提取按音色取匹配者,分离按恢复加提取加反向提取串联,并用首段结果固定跨段一致性。
还需补的验证包括真实人评、延迟与显存测量、3 人以上分离、流式分块的影响,以及不同编解码器码本下的系统性对照。资源状态方面,未发现可验证的公开链接,本次不得声称代码、模型或数据已公开。
何时值得尝试这种统一路线?
当你的场景同时涉及恢复、按参考提取与双人分离,且希望用同一模型维护多任务时,该路线值得尝试。它的可复述要点是连续特征保信息、离散令牌便建模、任务令牌做切换、多次推理做分离、2 阶段偏好先保质量再保一致。若你只需要单一去噪且对延迟敏感,传统判别式或非自回归方案可能更直接。若你关注严格流式或超低延迟,需另行设计因果条件与高效解码。教学上的常见误解是把质量总分提升当成波形误差必然减小,或把某一权重下的平台推广到所有任务,正确做法是按数据集、模型、阶段、指标与聚合对象逐项核对,并区分报告显示、有限支持与待验证推测。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

