门控只在新模态上打开:在冻结嵌入模型里加音频与热成像而不改动旧输出
该文把瓶颈适配器装进冻结解码器每一层并用输入成分做二进制门控,使旧模态走原计算图实现逐位不变,同时用对照实验显示音频检索提升与热成像包的可组合性,代价是新增模态的文本混排输入属于新行为且双门同开不在保证内。
该文把瓶颈适配器装进冻结解码器每一层并用输入成分做二进制门控,使旧模态走原计算图实现逐位不变,同时用对照实验显示音频检索提升与热成像包的可组合性,代价是新增模态的文本混排输入属于新行为且双门同开不在保证内。
共分析 62 篇语音/AI 论文
Voice-Light 研究全双工级联语音交互中的轮次判断与重叠处理,用共享流式识别编码器的因果适配器加可逆混合控制器与私有推测生成,在 1673 个静音候选的锁定测试中学习策略仅获 12.53% 召回而保留混合控制器,在 36 轮真机麦克风案例中取得 758 毫秒中位响应但以 800 毫秒超时兜底。
共分析 26 篇语音/AI 论文
针对语音大模型在儿童与方言语音上编码器适配不足的问题,论文提出先只训练编码器适配器再联合微调的两阶段 EAVA 方法,在三个数据集上报告了优于直接微调和多阶段对齐的新最低词错误率,但更大适配器并未持续带来增益且需两阶段训练成本。
共分析 29 篇语音/AI 论文
针对非侵入式 MOS 预测中语音基础模型层利用不稳定的问题,论文在 10 个骨干与 4 个数据集上对比末层探测、最优单层、朴素加权融合与全量微调,并评估逐层适配器校准后聚合的冻结骨干方案,最强证据是 Wav2BERT A+M 在四库平均上达到话语级 0.388/0.749 与系统级 0.052/0.932,代价是仍需为每个层训练独立适配器与回归头且最优深度随 …
针对 Whisper 不支持的三种低资源语言,研究比较暖初始化、注意力融合与顺序适配器堆叠三种源适配器复用方式,最强证据是最近源上的顺序堆叠在全量数据上相对全量微调降低词错误率 5-8%,在一小时数据上降低 12-26%,代价是需先在约 120 小时源语言数据上训练并冻结源适配器。
共分析 59 篇语音/AI 论文
针对文字难以规定节拍、旋律与演绎细节的问题,该工作用与主干同构的模板把控制音频转成逐层键值记忆注入冻结的生成分支,在单控制评测中把五类控制依从指标推到基线之上,同时自动音质与文本对齐分数与基线大体相当但存在指标级回落。
共分析 27 篇语音/AI 论文
针对印地语英语代码切换中声音对但文字错的问题,论文冻结语音编码器与指示大模型只训练 27.8M 瓶颈适配器,以 21.56% 词错误率与 20.69% 转写词错误率超过解码器微调基线,代价是依赖大模型词表与干净盲测集。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对视频生音频只学外观关联而忽视撞击轻重的问题,PAVAS 用估计出的物体质量与速度去调制潜在扩散模型,在 VGGSound 与 VGG-Impact 上同时报告了分布、感知与物理一致性证据,但依赖多组冻结视觉模块且未验证延迟与成本。
MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。
针对博杰普尔语到印地语新闻领域语音翻译,论文比较了 Wav2Vec2 加 NLLB 解码器的端到端适配方案与 Whisper 加 NLLB 的级联加 QE 融合方案,最强可复述证据是开发集端到端 32.77 分与级联经 QE 融合后 COMET 提升,但测试集大幅回落暴露了标注噪声与适配器泛化瓶颈。