不用教师也能学轨迹跳转:自蒸馏一致性轨迹的快速语音增强
针对扩散增强推理步数多、原有 SBCTM 依赖预训练教师的问题,该工作用学生自身的 EMA 拷贝生成轨迹目标并配合三阶段课程,在相同 NCSN++ 骨干上以两步几何调度达到 PESQ 3.01、SI-SDR 19.07 dB,代价是 PESQ 仍低于直接优化 PESQ 损失的教师模型。
针对扩散增强推理步数多、原有 SBCTM 依赖预训练教师的问题,该工作用学生自身的 EMA 拷贝生成轨迹目标并配合三阶段课程,在相同 NCSN++ 骨干上以两步几何调度达到 PESQ 3.01、SI-SDR 19.07 dB,代价是 PESQ 仍低于直接优化 PESQ 损失的教师模型。
该综述把视频大模型开销定位到帧选择、编码器、连接器压缩与大模型预填充解码四段,显示约 25 % 视觉 token 保留下多类方法接近基线精度,而推到约 10 % 保留与流式内存时必须显式建模时间冗余并计入选择器与编码代价。
增量文本流式语音合成需要在线知道说到原文何处,X2-NativeCursor 用原生语音令牌加局部匹配做可修正估计再输出单调光标,在 80 毫秒前视下中文平均绝对误差 0.151 字,对比在线波形基线 320 毫秒前视下 1.253 字,代价是每个主干需单独训练观察器且对未见音色敏感。
RAFM-SER++ 以文本为查询、语音为键值的单向残差注意力替代双向跨模态 Transformer,结合 BYOL 式对齐与注意力池化,在 IEMOCAP 上达到 81.10% BACC、ESD 上 95.39% BACC,同时将可训练参数从 8.9M 降至 3.6M 并提升推理吞吐。
针对语音情感识别中时序依赖不稳定与计算冗余问题,SETEAB 在 TIM-Net 基础上引入深度可分离下采样、SE-Res2Block、TEAB 与全局加权双向融合,在 5 个库平均上以 0.06 - 0.12 GFLOPs 实现 47.69% UA 与 45.23% F1,并在跨库平均 WA 上达到 37.53% 且保持 0.4 - 0.5M 参数量级。
TontaubeV1 把 12.5 Hz 分层编解码的语义流交给大模型定韵律与时长、三个小模型逐层补声学细节,并用配对边界与有界窗口做长文本流式合成,代价是四阶段串行与非因果解码需二次转码,在 400 段英文有声书评测中韵律与 ElevenLabs Flash v2.5 持平并领先其余三家。
论文针对修复任务中全局时间 t 无法刻画样本相关退化程度的问题,提出以冻结判别编码器表示替代时间条件来驱动流匹配速度场,在语音增强上报告了可复核的提升,并以额外编码器开销和自适应推理换取计算节省。
EffVOC 用因果卷积加 LSTM 的上采样声码器从幅度谱或 Mel 系数直接重建宽带与全频带波形,在 20 毫秒算法延迟下宽带 MOS 达到 4.17 与 4.15、全频带达到 4.14 与 4.11,代价是更高帧率带来的计算量与对短窗高重叠的依赖。
GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …
针对单乐器身份未知的乐器无关转录,Harmonica 以 CQT 输入与多深度谐波卷积在多源温度采样训练下实现 26.3K 至 15.1M 的规模化,x-large 在多数测试集上取得最高帧 F1,medium 以 848.5 倍实时保持可比精度,nano 以 1622.5 倍实时仍显著超过同量级基线。
针对正常到伦巴德语音转换中风格与说话人、内容纠缠的问题,ProLombard 用对齐说话人编码、音素级去风格与再注入、VQ 中值下采样三层结构建模,在中英文数据上提升了可懂度和伦巴德相似度,代价是推理仍需目标噪声等级且与真实伦巴德仍有差距。
论文在 LoRA 适配的 ASR-LLM 中复用基座 LLM,以对应层隐状态的余弦相似度和范数比定位需语义纠错的词;单遍混合解码的平均实体错误率为 18.38%,有效搜索宽度约为贪心的 1.4 倍,双遍精修则把波束基线的 18.29% 降到 17.69%,但其总计算成本与墙钟时间未量化。
论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。
StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。
语音识别 | 6.8/10
语音识别 | 7.4/10
音乐转录 | 8.2/10
语音识别 | 7.2/10
音乐生成 | 7.9/10
语音增强 | 6.7/10