eusipco-2026 论文深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对多声源视频中只生成文本指定声音的选择性视频到音频任务,SELVA 用文本调制的视频编码器加两阶段自监督混合训练实现目标声源分离生成,在 VGG-MONOAUDIO 上同时改善语义与时间对齐,但仍受训练数据噪声与细粒度文本理解限制。
针对声学回声控制中深度模型计算量过大而直接缩小模型会明显掉性能的问题,论文用大教师指导小学生的知识蒸馏训练轻量 CGGN16,在双讲条件下保住近端语音并有效抑回声,代价是仍需先训练大教师且依赖仿真数据条件。
针对含噪机器声中最近邻匹配不可靠的问题,该研究用机器与噪声标注加混合对齐做保留式再预训练,在受控信噪比与噪声失配下相对 BEATs 提升低信噪比约 4.1、平均约 3.1,代价是仍与嵌入混合上界有差距且依赖固定的 0.5 混合系数。
针对 CLIP 视频文本检索丢弃音轨且 AST 类编码器不理解语音的问题,SAVE 用 Whisper 转写加 CLIP 文本编码的语音分支与 ImageBind 软监督的 soft-ALBEF 先对齐再融合,在五个基准上超过 AVIGATE 等基线,代价是依赖 ASR 可用性与离线三分支特征抽取。
针对对比掩码自编码中随机可见块污染全局表示的问题,TG-DP 把重建与对比拆成两条掩码不同的前向路径并用全量教师做蒸馏与引导掩码,在 AudioSet 检索上把 R@1 从 35.2% 提升到 37.4% 和从 27.9% 提升到 37.1%,代价是每轮预训练时间从 730 s 增加到 1045 s 且推理前需丢弃教师分支。
针对已知说话人提取任务,论文提出掩码加深滤波的 DualDF 并用逐块特征蒸馏把块数与隐层压缩,教师约 12 块 224 维、学生在 6 块 120 维等配置下仍保持目标音质,代价是背景抑制主要依赖掩码分支且轻量学生仍需教师监督。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。
针对整块循环把语言表示回灌到底层造成语音到语言反复的问题,BiCycle 用累积注意力对角性划分语音组与语言组并只在组内递归,在英语与法语数据上以约一半物理参数报告更低词错率,代价是仍需预训练教师与先蒸馏 30 轮再识别训练 100 轮的两阶段成本。
针对语音条件推理弱于语义等价文本条件推理的问题,CORD 用同一模型内文本分支做教师并沿音频采样轨迹做标记级加权反向 KL 与序列级裁判奖励 GRPO 优化,在仅 8 万条合成数学训练样本下把两 backbone 的平均模态差距缩小约四成,但训练域集中数学且未报告延迟与人工误判率等代价。
针对全双工口语对话模型缺可靠在线奖励的问题,论文提出把语义连贯与轮次时机分开推理再给总分的生成式奖励模型,用三阶段感知加推理加 GRPO 训练,在合成与真实人机对话上报告了更高的准确率,代价是需要合成加真实数据联合调优且尚未验证在线强化学习收益。
该文在 FSD50K 与 AudioSet 上以 30 类起步加 4 个 5 类增量任务比较冻结、蒸馏与核级可塑性调制,报告显示冻住卷积特征并只微调动态分类头遗忘最小而核级约束反而更不稳定,但新类学习能力仍低于联合训练。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对单向量语音嵌入把内容与说话人混在一起的问题,该工作用共享声学编码器加分轴线性投影头做因子分区嵌入,并用带符号加权余弦实现可控检索,最强证据是跨语料库语义检索在加入说话人辅助任务后从近随机恢复到上限,而代价是纯语义蒸馏会坍缩且梯度反转与降维会破坏负权重几何。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对 IWSLT 2026 跨语言克隆学术演讲到阿拉伯语、法语和汉语的任务,该工作用 OmniVoice、VoxCPM 和 Chatterbox 三教师做 Best-of-N 合成蒸馏再对 OmniVoice 按语言做 LoRA 微调,在完整盲测上阿拉伯语 WER 由 0.244 降到 0.228、法语和汉语说话人相似度分别升到 0.760 和 0.732, …
针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。
针对非口语与极少口语自闭症个体的多标签沟通理解问题,论文用教师模型按照护者标注生成动作与功能描述并微调开源学生模型,在动作与功能分类上接近闭源教师模型,但绝对准确率仍不高且依赖小规模特定综合征队列。