论文解读

说话人偏置当捷径:用教师引导加信息瓶颈做去身份的伪造检测

针对 ASVspoof 5 训练中说话人分布与真伪标签纠缠导致跨域失效的问题,论文用 VoxCeleb 教师经梯度反转引导学生去身份并以变分信息瓶颈控制抑制强度,在九个域外集的混合评估上相对 MHFA 基线降低混合等错率 25.7%,代价是在 ASVspoof 5 域内集上弱于挑战赛前列系统且部分数据集出现回退。

 · 更新于 2026-09-24 · 约 21 分钟 · 10515 字 阅读 →
论文解读

多语言一起训反而互相拖累:用梯度冲突定位瓶颈再做局部专化

针对 8 个低资源语音到文本翻译方向,该系统用梯度统计自动决定语言分组与共享比例并只专化编码器第 11 层 FFN2,在 bem 上比统一微调高 2.07 BLEU、hau 高 1.50 BLEU,代价是 ckb 等离群语言仍需靠推理时重排恢复。

 · 更新于 2026-09-24 · 约 18 分钟 · 8755 字 阅读 →
论文解读

剪层扰动解码接口后如何恢复:X-AuT 的渐进压缩与跨尺度蒸馏

针对 Qwen3-ASR-0.6B 的 18 层音频编码器,X-AuT 用短预算行为探针选择可恢复层组合,再经表示对齐、跨尺度蒸馏与 LoRA 微调分两跳压到 14 层,单次运行显示 16 层宏平均误差从 5.61% 降到 5.27%,14 层为 5.75% 且音频塔参数减少 20.7%。

 · 更新于 2026-09-24 · 约 8 分钟 · 3529 字 阅读 →
论文解读

把每秒 token 压到 6.25 个:ZipCodec 如何在流式与 160 ms 时延下保住语义和音质

ZipCodec 针对流式语音 token 序列过长问题,用因果 log-mel 前端加 16 帧组块把帧率压到 6.25 Hz 与 0.80 kbps,再以约 94000 小时英文语音上的 WavLM 第 6 层蒸馏加标量球面量化保持重建与下游表征质量,代价是 842M 参数与严格的流式因果约束。

 · 更新于 2026-09-24 · 约 19 分钟 · 9318 字 阅读 →
论文解读

推理与分割打架时:AURORA 用四步推理加蒸馏保住像素精度

针对引用音频视觉分割中语言理解浅与推理分割互损问题,AURORA 用结构化思维链加分割特征蒸馏起步,再经纠错反思与分组奖励强化学习提升,在引用音频视觉分割的已见与未见划分上取得最高分,其代价是三阶段流水线与多模型标注依赖。

 · 更新于 2026-09-24 · 约 22 分钟 · 10802 字 阅读 →
论文解读

用光流解耦外观与运动、再用强度引导噪声搜索压住闪烁的说话头生成

ConsistTalk 针对音频驱动说话头视频的闪烁、身份漂移与音画失同步,用面部光流时间模块解耦运动、用音频到强度蒸馏建模帧级运动幅度、用强度引导的噪声束搜索做推理初始化,在 HDTF 上报告 FVD 171.7 与更低闪烁,但推理束搜索带来约 B 倍的计算代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9366 字 阅读 →
论文解读

时长定多久才好听:DMOSpeech 2 把时长预测也纳入指标优化

针对扩散零样本语音合成中时长预测长期游离于感知指标优化之外的问题,DMOSpeech 2 用分组相对策略优化对时长预测器做强化学习并引入教师引导采样,在 Seed-TTS 上把英文 WER 降到 1.752、相似度提到 0.698,代价是教师引导模式需同时保存师生参数并增加采样步数。

 · 更新于 2026-09-24 · 约 17 分钟 · 8292 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

多人对话先找对说话人,再把文本的情绪理解教给声音和画面

该研究用音画同步选出说话人、用文本教师蒸馏音频与视觉图网络、再用分层注意力与组合损失做融合,在 MELD 达到 67.75% 加权 F1、在 IEMOCAP 达到 72.44% 加权 F1,代价是引入更多超参数与调参负担。

 · 更新于 2026-09-24 · 约 17 分钟 · 8365 字 阅读 →
论文解读

噪声下不只纠错,而是让编码器和解码器都向干净表征对齐

针对 Whisper 在噪声下出现流畅但错误转写的幻觉问题,论文用自适应层注意力融合编码器分块表征再用多目标蒸馏对齐干净教师,印地语 -10 dB 等低信噪比下同时降低词错误率并提升语义分,同时增加约 0.98% 参数和约 8% 推理延迟。

 · 更新于 2026-09-24 · 约 17 分钟 · 8440 字 阅读 →
论文解读

不用从噪声里学语法:PASE 直接借用 WavLM 的语音结构先验做低幻觉增强

针对严重噪声下生成式增强容易编造内容与音色的问题,PASE 把预训练 WavLM 蒸馏成去噪专家并用高低层双流重建波形,在自建 LibriTTS 低信噪比集上把内容错误压到更低,同时以双流声学条件把说话人相似度拉回可用水平,代价是浅层声学流会带入残留噪声并拉低部分感知分。

 · 更新于 2026-09-24 · 约 22 分钟 · 10897 字 阅读 →
论文解读

不用教师也能学轨迹跳转:自蒸馏一致性轨迹的快速语音增强

针对扩散增强推理步数多、原有 SBCTM 依赖预训练教师的问题,该工作用学生自身的 EMA 拷贝生成轨迹目标并配合三阶段课程,在相同 NCSN++ 骨干上以两步几何调度达到 PESQ 3.01、SI-SDR 19.07 dB,代价是 PESQ 仍低于直接优化 PESQ 损失的教师模型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8276 字 阅读 →
论文解读

低码率语音编解码装不下时:用语义与唇动补上高层信息

针对低码率下仅靠语音表示难以保留上下文与发音信息的问题,论文在 MDCTCodec 上增加语义与图像两个辅助分支并用交叉注意力融合,以直接拼接的融合模式和蒸馏后纯语音推理的蒸馏模式组织实验,在 TaL80 上把 ViSQOL 从 3.86 提升到 4.01,代价是融合模式推理需要额外的唇部图像与预训练语义输入。

 · 更新于 2026-09-24 · 约 22 分钟 · 10955 字 阅读 →
论文解读

15 秒参考合成整库:固定音色泰语 TTS 的质量与覆盖取舍

该工作用 15 秒参考驱动 OmniVoice 教师批量合成泰语语料并训练 82M 固定音色 Kokoro 学生,以 68.2% 挑战集关键词准确率与 91.4% 停顿精确率保留音色并减少词内停顿,代价是难词实现仍落后于教师与更大系统。

 · 更新于 2026-09-24 · 约 20 分钟 · 9770 字 阅读 →
论文解读

只抄最后一层表示:预量化潜变量蒸馏压缩流式音频前端

该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9661 字 阅读 →
论文解读

单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡

语音编码 | 8.3/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12427 字 阅读 →
论文解读

7B 做原生音画同步:用门控与路由把对齐做轻,而不是把参数做大

扩散模型 | 5.9/10

 · 更新于 2026-09-24 · 约 30 分钟 · 14580 字 阅读 →
论文解读

把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么

回声消除 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4423 字 阅读 →
论文解读

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

音视频生成 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4722 字 阅读 →
论文解读

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

语音合成 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4848 字 阅读 →