每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只听指定的那一个:文本如何从混合画面中挑出目标声音

针对多声源视频中只生成文本指定声音的选择性视频到音频任务,SELVA 用文本调制的视频编码器加两阶段自监督混合训练实现目标声源分离生成,在 VGG-MONOAUDIO 上同时改善语义与时间对齐,但仍受训练数据噪声与细粒度文本理解限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8784 字 阅读 →
论文解读

把大模型的回声控制能力压缩到小模型:知识蒸馏如何弥补轻量化损失

针对声学回声控制中深度模型计算量过大而直接缩小模型会明显掉性能的问题,论文用大教师指导小学生的知识蒸馏训练轻量 CGGN16,在双讲条件下保住近端语音并有效抑回声,代价是仍需先训练大教师且依赖仿真数据条件。

 · 更新于 2026-09-24 · 约 16 分钟 · 7581 字 阅读 →
论文解读

噪声下保住机器线索:用保留混合表示做域泛化异常声音检测

针对含噪机器声中最近邻匹配不可靠的问题,该研究用机器与噪声标注加混合对齐做保留式再预训练,在受控信噪比与噪声失配下相对 BEATs 提升低信噪比约 4.1、平均约 3.1,代价是仍与嵌入混合上界有差距且依赖固定的 0.5 混合系数。

 · 更新于 2026-09-24 · 约 15 分钟 · 7343 字 阅读 →
论文解读

环境声编码器听不懂人话时如何检索:SAVE 用语音分支与软对齐补齐音轨

针对 CLIP 视频文本检索丢弃音轨且 AST 类编码器不理解语音的问题,SAVE 用 Whisper 转写加 CLIP 文本编码的语音分支与 ImageBind 软监督的 soft-ALBEF 先对齐再融合,在五个基准上超过 AVIGATE 等基线,代价是依赖 ASR 可用性与离线三分支特征抽取。

 · 更新于 2026-09-24 · 约 22 分钟 · 10562 字 阅读 →
论文解读

把重建和对齐分开做:教师引导的双路径如何减少语义噪声

针对对比掩码自编码中随机可见块污染全局表示的问题,TG-DP 把重建与对比拆成两条掩码不同的前向路径并用全量教师做蒸馏与引导掩码,在 AudioSet 检索上把 R@1 从 35.2% 提升到 37.4% 和从 27.9% 提升到 37.1%,代价是每轮预训练时间从 730 s 增加到 1045 s 且推理前需丢弃教师分支。

 · 更新于 2026-09-24 · 约 19 分钟 · 9205 字 阅读 →
论文解读

小模型留不住背景声:用分块蒸馏把双分支个性化增强做进端侧

针对已知说话人提取任务,论文提出掩码加深滤波的 DualDF 并用逐块特征蒸馏把块数与隐层压缩,教师约 12 块 224 维、学生在 6 块 120 维等配置下仍保持目标音质,代价是背景抑制主要依赖掩码分支且轻量学生仍需教师监督。

 · 更新于 2026-09-24 · 约 15 分钟 · 7147 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把情绪当作首要优化目标:AffectCodec 如何在离散量化中留住情绪

针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10128 字 阅读 →
论文解读

整块循环打乱先听后写的流水线:BiCycle 用分组递归保留语音识别机制

针对整块循环把语言表示回灌到底层造成语音到语言反复的问题,BiCycle 用累积注意力对角性划分语音组与语言组并只在组内递归,在英语与法语数据上以约一半物理参数报告更低词错率,代价是仍需预训练教师与先蒸馏 30 轮再识别训练 100 轮的两阶段成本。

 · 更新于 2026-09-24 · 约 21 分钟 · 10296 字 阅读 →
论文解读

在自己的语音轨迹上学文本推理:CORD 的加权在策略跨模态自蒸馏

针对语音条件推理弱于语义等价文本条件推理的问题,CORD 用同一模型内文本分支做教师并沿音频采样轨迹做标记级加权反向 KL 与序列级裁判奖励 GRPO 优化,在仅 8 万条合成数学训练样本下把两 backbone 的平均模态差距缩小约四成,但训练域集中数学且未报告延迟与人工误判率等代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9227 字 阅读 →
论文解读

说什么与何时说分开评:面向全双工对话的双轴生成式奖励模型

针对全双工口语对话模型缺可靠在线奖励的问题,论文提出把语义连贯与轮次时机分开推理再给总分的生成式奖励模型,用三阶段感知加推理加 GRPO 训练,在合成与真实人机对话上报告了更高的准确率,代价是需要合成加真实数据联合调优且尚未验证在线强化学习收益。

 · 更新于 2026-09-24 · 约 17 分钟 · 8143 字 阅读 →
论文解读

遗忘主要发生在分类头:同分布声音分类中冻住特征只调动态头的对比

该文在 FSD50K 与 AudioSet 上以 30 类起步加 4 个 5 类增量任务比较冻结、蒸馏与核级可塑性调制,报告显示冻住卷积特征并只微调动态分类头遗忘最小而核级约束反而更不稳定,但新类学习能力仍低于联合训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9238 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

一句话多属性纠缠时,如何让检索按语义或按说话人分开算相似

针对单向量语音嵌入把内容与说话人混在一起的问题,该工作用共享声学编码器加分轴线性投影头做因子分区嵌入,并用带符号加权余弦实现可控检索,最强证据是跨语料库语义检索在加入说话人辅助任务后从近随机恢复到上限,而代价是纯语义蒸馏会坍缩且梯度反转与降维会破坏负权重几何。

 · 更新于 2026-09-24 · 约 17 分钟 · 8349 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

科学口音难克隆:用三教师蒸馏加单语 LoRA 补学术域数据

针对 IWSLT 2026 跨语言克隆学术演讲到阿拉伯语、法语和汉语的任务,该工作用 OmniVoice、VoxCPM 和 Chatterbox 三教师做 Best-of-N 合成蒸馏再对 OmniVoice 按语言做 LoRA 微调,在完整盲测上阿拉伯语 WER 由 0.244 降到 0.228、法语和汉语说话人相似度分别升到 0.760 和 0.732, …

 · 更新于 2026-09-24 · 约 17 分钟 · 8174 字 阅读 →
论文解读

一段话里换情绪又调语速:以后训练如何教会已有 TTS 听懂分段指令

针对同一句内分段情绪与时长难以用自然语言独立控制的问题,该文用分阶段监督微调加分组相对策略优化改造 CosyVoice2 的语音语言模型,最强证据是联合优化后在标准集上 MER 语句准确率 54.12% 与时长 A15 54.64%,代价是严格联合满足率仅 5.29% 且换说法时仍需蒸馏修复。

 · 更新于 2026-09-24 · 约 15 分钟 · 7305 字 阅读 →
论文解读

从“是不是自闭”到“在说什么”:ROSCO-Omni 用标签引导把照护者理解蒸馏进开源全模态模型

针对非口语与极少口语自闭症个体的多标签沟通理解问题,论文用教师模型按照护者标注生成动作与功能描述并微调开源学生模型,在动作与功能分类上接近闭源教师模型,但绝对准确率仍不高且依赖小规模特定综合征队列。

 · 更新于 2026-09-24 · 约 23 分钟 · 11277 字 阅读 →