cvpr-2026 论文深度解读
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对视觉听觉情绪线索稀疏且时间不同步导致隐式融合稀释与纠缠的问题,EmoThinker 用结构化 token 选择提纯面部与声音证据并用 CoET 数据集做分步推理,在 DFEW 等基准上报告了最高分,但背景丢弃与长尾类别仍带来代价与不稳定。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对语音编码器偏发音而大语言模型偏语义的对齐错位,该文提出先预测音素再生成文本的联合训练,在 100 小时低资源和 960 小时及荷兰语条件下报告词错率下降,代价是输出变长与仍需低秩适配。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该工作用翻译导向大模型加语音编码器处理英文语音并执行英中意德指令,以先转写后作答的思维链复用纯文本监督,在 IWSLT 2025 评测上翻译与问答达到可比最优,代价是语音编码器只训练约 0.8 轮且依赖后编辑修正格式。
针对语音数据稀缺与跨语言扩展难的问题,CSLM 用持续预训练做模态内与跨语言对齐、再用语音文本分块交错微调做细粒度生成,在约 77 千小时语音数据下取得可比大数据的对齐与对话能力,但大语种覆盖与更大规模验证仍待补足。
F-Actor 用冻结音频编码器加只微调语言模型的单阶段方案,在约 2000 小时数据上实现对音色、话题、打断与应答和起话方的指令跟随,最佳配置以词级文本对齐加 2 步音频延迟取得低困惑度和高起话准确率,但打断等稀有行为仍只能给出方向性控制且语音自然度未达真值。
该研究用同一套语音大模型先做短语音指令跟随再扩展到长语音,比较三种切分策略,最强证据是固定 30 秒切分取得 2.0663 的 HIFS 分数,代价是长摘要与章节任务仍不稳定且幻觉以重复插入为主。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对印地语、孟加拉语、马拉地语语音转写中填充词与重复修复残留问题,论文用 MuRIL 词级标记引导指令微调并以对比损失惩罚复现不流利词,在人工校对与真实口语两类测试上取得一致提升,但真实集规模小且仅验证 3B 量级模型。
该工作把短语音语料拼接成最长 15 分钟的长指令数据并覆盖六任务四语言,用温度采样和端到端加级联两种结构参赛,最强证据是似然加最小贝叶斯风险重排在英语上把词错率从 37.65 降到 21.39 而语义任务仅小幅波动,代价是似然重排会误选切分候选并损害问答与摘要。
针对阿拉伯语语音指令数据稀缺与评测缺失问题,Nuha-Speech 用约 150 万条统一问答式语料对 Qwen-Omni 系列做两阶段 LoRA 微调,并在七任务评测中报告语义与副语言能力的全面提升,但合成数据占比与评测合成偏置仍是主要代价与限制。
论文针对需综合多个独立音频才能作答的多音频推理问题,选择在 Audio Flamingo 3 上做交错多音频指令微调,最强证据是 PolyAudio-Bench 上从 32.9% 提升到 73.5%,代价是依赖合成管线构造数据并把组合范围限制在最多 5 段。
针对语音到语音对话既要评语义又要评声学而级联评测会丢声学信息的问题,论文用大规模合成偏好数据加带解释理由的两阶段监督微调构建端到端语音裁判 SageLM,以 82.79% 的人类一致率超过级联与语音理解基线,代价是依赖合成语音分布与有限声学数据。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对视觉特征预处理复杂且跨域易失效的问题,InstructDubber 用多模态大模型生成语速与情绪自然语言指令,再分别蒸馏时长线索与校准情绪分析以预测音素时长和韵律,在三个基准的域内与跨域零样本配音中报告了更稳的对齐,但部分时长指标仍有基线更优且推理依赖外部大模型。
针对主播与观众实时互动的直播视频理解问题,论文用多智能体加种子问题的人机协同流程构建含音频语音评论的 3168 视频 3175 题基准,并以两阶段指令微调加视频到评论检索训练 LiVi-LLM-7B,在 LiViBench 上报告 64.4% 的总准确率,代价是仍落后最优闭源模型的直播专有任务与对海量评论的依赖取舍。
针对有声视频中按自然语言指代表达分割目标的问题,论文把任务拆成用多模态大模型先推理出目标描述再调用冻结检测与分割模型的智能体流程,在标准与推理增强基准上报告了对最强基线的提升,但阈值与细粒度描述的取舍仍有条件限制。