说话人偏置当捷径:用教师引导加信息瓶颈做去身份的伪造检测
针对 ASVspoof 5 训练中说话人分布与真伪标签纠缠导致跨域失效的问题,论文用 VoxCeleb 教师经梯度反转引导学生去身份并以变分信息瓶颈控制抑制强度,在九个域外集的混合评估上相对 MHFA 基线降低混合等错率 25.7%,代价是在 ASVspoof 5 域内集上弱于挑战赛前列系统且部分数据集出现回退。
针对 ASVspoof 5 训练中说话人分布与真伪标签纠缠导致跨域失效的问题,论文用 VoxCeleb 教师经梯度反转引导学生去身份并以变分信息瓶颈控制抑制强度,在九个域外集的混合评估上相对 MHFA 基线降低混合等错率 25.7%,代价是在 ASVspoof 5 域内集上弱于挑战赛前列系统且部分数据集出现回退。
针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。
针对 Qwen3-ASR-0.6B 的 18 层音频编码器,X-AuT 用短预算行为探针选择可恢复层组合,再经表示对齐、跨尺度蒸馏与 LoRA 微调分两跳压到 14 层,单次运行显示 16 层宏平均误差从 5.61% 降到 5.27%,14 层为 5.75% 且音频塔参数减少 20.7%。
ZipCodec 针对流式语音 token 序列过长问题,用因果 log-mel 前端加 16 帧组块把帧率压到 6.25 Hz 与 0.80 kbps,再以约 94000 小时英文语音上的 WavLM 第 6 层蒸馏加标量球面量化保持重建与下游表征质量,代价是 842M 参数与严格的流式因果约束。
针对引用音频视觉分割中语言理解浅与推理分割互损问题,AURORA 用结构化思维链加分割特征蒸馏起步,再经纠错反思与分组奖励强化学习提升,在引用音频视觉分割的已见与未见划分上取得最高分,其代价是三阶段流水线与多模型标注依赖。
ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。
针对扩散零样本语音合成中时长预测长期游离于感知指标优化之外的问题,DMOSpeech 2 用分组相对策略优化对时长预测器做强化学习并引入教师引导采样,在 Seed-TTS 上把英文 WER 降到 1.752、相似度提到 0.698,代价是教师引导模式需同时保存师生参数并增加采样步数。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。
针对 Whisper 在噪声下出现流畅但错误转写的幻觉问题,论文用自适应层注意力融合编码器分块表征再用多目标蒸馏对齐干净教师,印地语 -10 dB 等低信噪比下同时降低词错误率并提升语义分,同时增加约 0.98% 参数和约 8% 推理延迟。
针对严重噪声下生成式增强容易编造内容与音色的问题,PASE 把预训练 WavLM 蒸馏成去噪专家并用高低层双流重建波形,在自建 LibriTTS 低信噪比集上把内容错误压到更低,同时以双流声学条件把说话人相似度拉回可用水平,代价是浅层声学流会带入残留噪声并拉低部分感知分。
针对扩散增强推理步数多、原有 SBCTM 依赖预训练教师的问题,该工作用学生自身的 EMA 拷贝生成轨迹目标并配合三阶段课程,在相同 NCSN++ 骨干上以两步几何调度达到 PESQ 3.01、SI-SDR 19.07 dB,代价是 PESQ 仍低于直接优化 PESQ 损失的教师模型。
针对低码率下仅靠语音表示难以保留上下文与发音信息的问题,论文在 MDCTCodec 上增加语义与图像两个辅助分支并用交叉注意力融合,以直接拼接的融合模式和蒸馏后纯语音推理的蒸馏模式组织实验,在 TaL80 上把 ViSQOL 从 3.86 提升到 4.01,代价是融合模式推理需要额外的唇部图像与预训练语义输入。
该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。
该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。
语音编码 | 8.3/10
扩散模型 | 5.9/10
回声消除 | 8.5/10
音视频生成 | 8.9/10
语音合成 | 10.0/10