acl-2026 论文深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该综述把多模态遗忘按实例级与概念级切分并按干预阶段组织方法,以遗忘强度与效用保留的权衡为主线,报告了身份隐私内容与安全基准的规模与评估维度,并指出跨模态泄漏与对抗再激活是主要代价。
针对非口语与极少口语自闭症个体的多标签沟通理解问题,论文用教师模型按照护者标注生成动作与功能描述并微调开源学生模型,在动作与功能分类上接近闭源教师模型,但绝对准确率仍不高且依赖小规模特定综合征队列。
v-HUB 把视频幽默拆成字幕匹配、幽默解释和开放问答三类可核对任务,用文本、纯视频、视频加音频三组输入对照测出模型重度依赖文字线索,而环境声和画面内文字只带来小而稳定的增益且历史默片更难。
针对音视频大模型推理时 KV 缓存过大问题,AccKV 按层自适应聚焦关键模态并先模态内合并再跨模态校准,在 MVBench 与 AVSD 上用 10% 缓存与 120 词元预算维持接近全缓存精度,但未测量延迟与吞吐提升。
针对引用音频视觉分割中语言理解浅与推理分割互损问题,AURORA 用结构化思维链加分割特征蒸馏起步,再经纠错反思与分组奖励强化学习提升,在引用音频视觉分割的已见与未见划分上取得最高分,其代价是三阶段流水线与多模型标注依赖。
该工作把长片搞笑片段抽取拆成镜头检测、视觉加文本的场景合并、笑声加长文本幽默判断加不当内容过滤与排序四步,用 MovieNet-SSeg 指导的三元组预训练和 10 句 ColBERT 在 OVSD 上提升 18.3% 的 AP、在 MHD 上达到 0.834 的 F1,代价是预告片快切下场景结尾准确率下降与文本分支目前只支持英文。
针对短视频广告中夸大表述与跨模态错位带来的细粒度政策违规,BLM-Guard 采用规则锚定的交错模态推理冷启动加自适应评论奖励的分组优化实现可解释审核,在自建基准与消融矩阵中报告严格准确率与一致性提升,但资源本次未能确认可达且一致性依赖大模型打分。
针对直接从外部行为回归真实人格偏向观察者印象的问题,该文用 10 秒音视频生成密钥修正通用面部反应生成器得到个性化认知权重,再编码为矩阵图用二维图网络回归自陈大五特质,在 NoXI 与 UDIVA 上报告了误差与相关提升,代价是仍需扩散预训练与双损失联合训练且细粒度言语未建模。
论文把音乐诱发绘画评估定义为直接预测感知一致性分数,用音乐调制视觉的 MPJudge 结合回归与偏好优化学习,在自建专家标注集上报告 SRCC 0.86 与 MAE 0.04,代价是更大的绘画编码器与对专家标注的依赖。
SafeLens 针对短视频中仇恨内容只在少数时刻出现而整片标签会引入时间噪声的问题,用先切分语义片段再融合语音转写、屏幕文字和画面描述并由微调策略大模型输出标签加置信度加一句话理由加伤害类别的结构化判断,演示证据显示其能在同一视频内区分出 93% 与 73% 等不同置信度的多个片段,但原文未报告可复算的检出率与对照基线所以只能作为工作流演示而非性能结论。
针对有声视频中按自然语言指代表达分割目标的问题,论文把任务拆成用多模态大模型先推理出目标描述再调用冻结检测与分割模型的智能体流程,在标准与推理增强基准上报告了对最强基线的提升,但阈值与细粒度描述的取舍仍有条件限制。
该综述把视频大模型开销定位到帧选择、编码器、连接器压缩与大模型预填充解码四段,显示约 25 % 视觉 token 保留下多类方法接近基线精度,而推到约 10 % 保留与流式内存时必须显式建模时间冗余并计入选择器与编码代价。
针对仅靠音频评估无法诊断唇动与语音时序错位的问题,论文用跨模态注意力显式建模帧级对齐并导出时滞轨迹与稳定性指标,在 8 类录制条件下以线性复杂度和可视化分析实现可解释的同步性诊断。
论文用冻结视觉语言模型加 Whisper 转写路由构造免训练语音中心全模态理解,在 56 个基准和 21 种语言的配对比较中语音任务可比原生全模态训练而保留视觉推理能力,代价是增加串行语音识别延迟且无法处理音乐与环境声等非语音线索。
音视频理解 | 6.3/10
音视频理解 | 6.0/10
音视频理解 | 6.5/10
音视频理解 | 5.5/10
音视频理解 | 7.7/10