小语言模型下保住多任务语音跟随:换大容量投影器并补科学演讲合成数据
针对英语语音输入并按多语指令完成识别翻译问答的问题,该工作用只用识别数据训练的语音映射器对接冻结语言模型并加入合成科学演讲数据,在更小语言模型下追平上届最优并用跨域基准揭示识别与问答的权衡。
针对英语语音输入并按多语指令完成识别翻译问答的问题,该工作用只用识别数据训练的语音映射器对接冻结语言模型并加入合成科学演讲数据,在更小语言模型下追平上届最优并用跨域基准揭示识别与问答的权衡。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对附和预测中缺视频、模态时间不对齐和只盯触发点的问题,论文用多层跨模态对齐加两阶段课程学习,在韩语 KC-Dialog 上宏 F1 达到 58.53,代价是视频推理耗时从 18.868 毫秒增至 20.083 毫秒。
针对文本、音频、视觉在噪声与缺失连续变化时情感分析退化的问题,论文用连续可靠度谱统一三种退化协议并提出以偶然不确定性驱动路由的 QA-MoE,在 CMU-MOSI 等基准上保持领先,代价是需要谱感知的数据增强与双分支不确定性建模。
针对呼吸音频编码与临床文本编码语义不兼容的问题,RespiraMFM 采用先对比训练投影器再冻结做指令微调的两阶段结构,在九个呼吸疾病任务上报告了监督平均 AUROC 0.823 与零样本平均 AUROC 0.738,代价是依赖症状元数据质量且小病种评测样本较少。
该文以聚合 10.7M 字幕的 CaptionStew 为试验床,在冻结编码器条件下比较对比学习与字幕生成两种目标,发现在判别任务上对比更数据高效而生成式随规模追赶更快,但有监督初始化的增益随规模衰减且声音事件检测出现反向扩展。
针对连续音视频流中被动问答与主动触发难以统一的问题,ROMA 用一秒多模态单元加分块时间位置编码与独立说话头做对齐与时机判断,在主动提醒与实时解说上报告最优并保持被动问答竞争力,代价是每秒决策粒度和有限上下文。
针对流利度评分既要看整体节奏又要抓局部停顿且等级有序的问题,该研究用专家特征锚定 Whisper 时序表示做深度融合,并用距离感知的顺序平滑损失建模等级远近,在 SpeechOcean762 上报告 83.40% 准确率,代价是依赖冻结声学表示与有限人群验证。
针对自动音频描述缺少细节与上下文的问题,该工作用专家模型抽取语音、音乐、通用声音和视频线索再由大语言模型融合成纯音频描述,并用 120 万条描述与 600 万问答对证明检索与理解收益,代价是融合带来细节提升的同时幻觉风险上升且需离线专家与过滤成本。
针对噪声下单流纠错被音频质量卡住的问题,论文用独立 ASR 与 VSR 双路 N-best 假设加可靠性提示词做语言空间组合,在 LRS2 上把基线相对误差降低约一半,代价是依赖上下游识别头质量并增加大模型串行纠错开销。
该研究用劣化加补救的可控流程检验能否以对比语言音频预训练相似度估计人声录音质量并推荐处理,最强证据是强档降噪在噪声与混响上大幅提升对比语言音频预训练相似度却被听众打低分,而去轰头与去闷处理得到听众正向评价,代价是嵌入指标与人耳判断并不一致。
针对短视频中文本主导而音视频易误判的问题,TEXT 用多模态大模型生成解释做语义锚点,再做解释对齐与轻量时间对齐并以文本路由稀疏专家融合,在四个数据集上取得最低平均绝对误差,但细粒度分类仍有两项未胜出且依赖外部大模型。
针对教师情感的表演性与教学情境依赖问题,该研究构造 14,938 条四模态 T-MED 数据集并提出以音频为中心的非对称注意力模型 AAM-TSA,在 T-MED 上报告加权准确率 86.84% 与加权 F1 值 86.37%,代价是依赖视频转文本描述与教学信息输入且未公开可验证代码数据链接。
共收录 1 篇 aistats-2026 会议论文的 Reader 深度解读
针对带声音的人脸视频在压缩、模糊和低分辨率下的退化,GAVN 用低分辨率空间的帧间时域特征做粗修复、用高分辨率空间的音频加关键点身份特征补细节,在 VoxCeleb2 和 Obama 两种说话人场景下取得最优的图像质量与唇音同步分数,但代价是两阶段训练与多模块推理成本。
该工作把长片搞笑片段抽取拆成镜头检测、视觉加文本的场景合并、笑声加长文本幽默判断加不当内容过滤与排序四步,用 MovieNet-SSeg 指导的三元组预训练和 10 句 ColBERT 在 OVSD 上提升 18.3% 的 AP、在 MHD 上达到 0.834 的 F1,代价是预告片快切下场景结尾准确率下降与文本分支目前只支持英文。
针对已有视频音轨需随画面增删替换音效的问题,AV-Edit 先用细粒度对比掩码预训练学到音画对齐表示,再用相关门控加多模态扩散重生成,在 VGG-Edit 三类编辑与 VGGSound 生成上报告最优距离与质量,代价是原文承认不能无失真保留原音。
针对混合声中只定位目标声源的问题,该研究用跨实例图像做语义提示,先做语义对齐再做多频带空间对齐,在 VGGSound-SSL 上报告平均绝对误差 16.59 度、准确率 71.29%,代价是依赖合成空间音频与人工核验的提示池。
针对普通话四声在脑电中细微难分且跨人易失效的问题,CAT-Net 用脑电与肌电双分支时空编码加双向交叉注意力融合与域对抗训练,在 20 个脑电通道加 5 个肌电通道上报告了默读 88.08% 与出声 87.83% 的五折精度以及留一被试 85.10% 与 83.27% 的跨被试精度,但消融显示去掉融合与单模态后精度大幅下降且重度异常被试仍明显偏低。
针对只有视频级标签的稠密音视事件定位,CLASP 用双模态预测一致性找出显著锚点再向全时序传播语义,在 UnAV-100 与 ActivityNet1.3 上取得弱监督最优,但与全监督约 50% 平均精度仍有明显差距且更依赖锚点超参数。