论文解读

从原始音视频算起:用参考锚定身份再推理社交指向

论文提出只用原始音视频判断最后说话人在跟谁说话的 Omni-MMSI 任务,并用参考引导的工具抽取加两步思维链推理的 Omni-MMSI-R 解决身份归属难题,在 Ego4D 和 YouTube 上取得报告的最优准确率,代价是需手工构建参考对和过滤生成推理标注。

 · 更新于 2026-09-24 · 约 19 分钟 · 9246 字 阅读 →
论文解读

语义冲突与任务竞争之下统一视频文本到音频生成的三段式解法

该工作针对统一视频文本到音频生成中音频歧义导致的数据语义冲突与跨任务和任务内竞争,用高对齐的 SoundAtlas 数据做语义桥并以三阶段渐进训练解耦竞争,在 VGGSound-Omni 上实现三任务统一最优,但强依赖数据流水线质量与分阶段训练成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9292 字 阅读 →
论文解读

从网上视频到可控舞蹈:OpenDance 用解耦词元与联合掩码统一音乐加空间加文本控制

针对只有音乐无法做空间与风格精细控制的问题,论文用 100.26 小时多模态 OpenDanceSet 与解耦词元加联合掩码预测的 OpenDanceNet 实现音乐加文本加关键点加轨迹的任意组合生成,在 AIST++ 与 OpenDanceSet 上取得更优保真与节拍对齐,但精修带来保真指标与物理指标的权衡。

 · 更新于 2026-09-24 · 约 23 分钟 · 11271 字 阅读 →
论文解读

从离散分类到连续追踪:OSMO 把自我情绪做成时间线

论文提出第一人称自我情绪追踪任务,用 110 小时智能眼镜数据的开放词表时间线与五任务基准支撑 OSIRIS 模型,该模型以对话历史加情绪记忆加分步推理取得领先,但仍受日常社交场景与文化覆盖限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8760 字 阅读 →
论文解读

文本挤占参数更新时,单块 LoRA 如何隐式分出模态分工

针对多模态微调中文本主导参数更新的问题,论文用单矩阵隐式分区加解耦与对齐两个梯度约束来恢复平衡,在音频视觉文本等任务上提升精度且保持与标准 LoRA 相同的可合并参数量与推理结构。

 · 更新于 2026-09-24 · 约 18 分钟 · 8995 字 阅读 →
论文解读

多人同时说话时,目标人该接话还是倾听:PolySLGen 的在线多模态反应生成

针对多人交互中只建模说话或只建模双人的不足,PolySLGen 用过去全组语音与动作为条件联合生成目标人的文本、语音风格、身体动作和说话状态分,证据是动作与说话状态预测上优于多个基线,代价是推理约 5 帧每秒且说话状态预测仍困难。

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
论文解读

不只绑一个锚点:用合成字幕把音频视频文本一起对齐

论文用两阶段合成字幕数据引擎和覆盖八到十组跨模态对的对比学习训练 PEAV,在零样本声音音乐语音视频检索分类上取得最强证据,但代价是 92M 加 32M 数据与大音频编码器和长视频推理成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9367 字 阅读 →
论文解读

环境声编码器听不懂人话时如何检索:SAVE 用语音分支与软对齐补齐音轨

针对 CLIP 视频文本检索丢弃音轨且 AST 类编码器不理解语音的问题,SAVE 用 Whisper 转写加 CLIP 文本编码的语音分支与 ImageBind 软监督的 soft-ALBEF 先对齐再融合,在五个基准上超过 AVIGATE 等基线,代价是依赖 ASR 可用性与离线三分支特征抽取。

 · 更新于 2026-09-24 · 约 22 分钟 · 10562 字 阅读 →
论文解读

先分清冗余与噪声,再按输入调节瓶颈:SeD-UD 的分层解耦信息瓶颈

针对多模态意图识别中固定维度信息瓶颈难以适应样本级冗余与噪声、且把两者混在一起压缩的问题,SeD-UD 用影响因子驱动的自适应瓶颈做单模态去冗余与融合后统一去噪,在 MIntRec 加权精度 73.96% 等指标上报告最优,但文本增强基线与情感泛化边界仍是代价与限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8924 字 阅读 →
论文解读

声音停了之后还怎么找:连续环境语义视听导航与记忆增强目标推理

论文提出连续环境语义视听导航任务 SAVN-CE 与记忆增强模型 MAGNet,用自运动线索加情景记忆维持静音后目标推理,直接报告最高 12.1 个百分点成功率提升,代价是 128 线程加 4 卡约 14 天训练与干扰声下增益收窄。

 · 更新于 2026-09-24 · 约 19 分钟 · 9454 字 阅读 →
论文解读

单图加文本加音频做分钟级视频:Soul 用关键帧锚定与阈值码本抑制长时漂移

Soul 针对单帧人物图加文本加音频的人体动画任务,在 Wan2.2-5B 上新增音频注意力并用关键帧表示、段间重叠与阈值码本维持长时一致,再用步数蒸馏与轻量 VAE 加速,在 Soul-Bench 的开源对比与商用人评中取得优势,代价是复杂全身大动作仍可能出现伪影。

 · 更新于 2026-09-24 · 约 22 分钟 · 10657 字 阅读 →
论文解读

二分容器装不下成对线索:用三子空间为模态对单独留位置

针对只有全局共有与单模态私有两类表示会漏掉仅在两个模态之间成立的情感协同的问题,论文把表示分成公共、两两共享、私有三路并用子空间感知交叉注意力融合,在对齐与非对齐条件下报告了更低的平均绝对误差与更高的细粒度准确率,代价是更多分支与正则项需要逐项验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9615 字 阅读 →
论文解读

双模态变差、三模态恢复:用聚合标记锚定含噪转写的流利度评估

针对二语流利度评估中声学加文本的朴素双模态融合在转写含噪时会低于纯声学基线的问题,论文用声学自监督嵌入加 BERT 文本加六维心理语言学标记的三模态投影加 BiLSTM 融合恢复并超过基线,在 Speechocean762 上达到 82.60% F1、在 Avalinguo 上达到 95.84% F1,代价是依赖转写与三编码器拼接带来的额外计算量。

 · 更新于 2026-09-24 · 约 24 分钟 · 11966 字 阅读 →
论文解读

先想再动再说:U-Mind 用文本先行统一语言语音动作的实时交互

U-Mind 针对语音动作与语言推理难以同步且联合训练易损伤推理的问题,采用离散统一表示加分段对齐与排练式预训练加文本先行解码,原文报告在指令跟随上 FGD 为 5.12 并在消融中显示去文本先行后相关性降至 1.24,代价是动作细粒度受限于离散词表且数据配比依赖经验。

 · 更新于 2026-09-24 · 约 21 分钟 · 10184 字 阅读 →
论文解读

不只把话说对,还要动得对:ViBES 如何联合规划语言与身体

ViBES 针对多轮对话中语言与身体脱节的问题,采用文本语音专家加面部与身体专家的混合模态专家结构并在 25 帧统一时钟上联合生成,在对话行为基准上取得高于共语音手势与文本到动作基线的对齐度,代价是依赖单目重建数据与尚不完善的行为评价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9907 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

鸡尾酒会里看口型说话:AV-Dialog 如何同时听清、看准接话时机

AV-Dialog 针对多人干扰下跟丢目标说话人与抢话时机错乱问题,用声学码加唇部视觉做流式理解与轮次预测,在干扰下把轮次预测准确率从 54% 提升到 79%,代价是双模型并行与视觉前视带来的额外延迟与显存开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9965 字 阅读 →
论文解读

缺模态是因果链断裂:先按历史补锚点,再用超图挖高阶组合

针对对话中模态缺失切断细粒度跨模态因果链的问题,CaM-HG 采用先由历史条件混合专家补全再由非对称因果动态超图挖掘的路线,在 IEMOCAP 等 3 套基准上报告了高缺失率下更慢的衰减,但连续极端缺失与结构因果解耦仍是边界。

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

静态特质约束动态偏见:CMTD 用认知建模做多模态对话情绪识别

CMTD 针对纯文本与浅层推理在对话情绪识别中误判复杂思维模式的问题,用多智能体分别提取大五人格特质、四步认知扭曲、表情与语音描述再融合预测,在 MELD 与 IEMOCAP 零样本条件下报告优于同条件基线的准确率,同时以多轮大模型调用带来明显更高的时间与费用开销。

 · 更新于 2026-09-24 · 约 16 分钟 · 7691 字 阅读 →