论文解读

只给整段真假标签,如何找回伪造片段的起止时间

问题是弱监督时间伪造定位中训练只做整段二分类而推理要输出边界,方法选择两阶段分类回归加隐属性分解与时序图精炼,最强证据是在两个基准上平均 mAP 分别提升约 8% 和 4%,代价是定位阶段引入约 45M 回归参数与伪标签噪声管理。

 · 更新于 2026-09-24 · 约 20 分钟 · 9981 字 阅读 →
论文解读

不训练也能定位声源:用生成、核验、修正三步约束多模态大模型的猜测

针对声源定位中特征匹配缺少显式验证的问题,该研究用 Qwen2.5-Omni-7B 的提示工程实现生成-分析-精修三阶段零样本定位,在 MUSIC 与 VGGSound 单源和双源基准上报告了可比或更高的精度,代价是单样本约 4 秒的多轮推理开销。

 · 更新于 2026-09-24 · 约 21 分钟 · 10133 字 阅读 →
论文解读

不用反演找噪声:以视觉氛围与音高约束同时改风格、保旋律

该文把音乐风格迁移拆成视觉文本联合定风格与色度约束保旋律两件事,用无反演流直接搬运隐变量并以内层梯度拉回音高结构,代价是旋律锚定越强时目标风格贴合会轻微下降。

 · 更新于 2026-09-24 · 约 21 分钟 · 10502 字 阅读 →
论文解读

同时去噪的音视频为何对不齐:Harmony 用跨任务监督稳住对应关系

针对联合扩散中双路噪声导致的对齐漂移,Harmony 用音频驱动与视频驱动辅助任务提供干净锚点,并以全局局部解耦交互与同步增强引导提升细粒度同步,主结果报告 Sync-C 为 5.61、Sync-D 为 7.53,代价是三阶段训练与双分支推理开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8328 字 阅读 →
论文解读

从听见对准到记住行动:HAVE-Bench 用三层结构测音频视觉模型

论文针对音频视觉评测偏重单轮感知的问题,提出感知—推理—交互三层基准并区分指令与上下文两种音频角色,用 2451 个样本和多轮任务图揭示语音指令推理弱于文本指令且交互成功率普遍偏低,代价是构造依赖人工标注而交互判定依赖大模型裁判。

 · 更新于 2026-09-24 · 约 20 分钟 · 9811 字 阅读 →
论文解读

只听指定的那一个:文本如何从混合画面中挑出目标声音

针对多声源视频中只生成文本指定声音的选择性视频到音频任务,SELVA 用文本调制的视频编码器加两阶段自监督混合训练实现目标声源分离生成,在 VGG-MONOAUDIO 上同时改善语义与时间对齐,但仍受训练数据噪声与细粒度文本理解限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8784 字 阅读 →
论文解读

看见鼓槌落下才发声:用音视频对齐的扩散变换器与语义时间偏好优化做视频生音频

针对无声视频生成音频时语义错位与时间错位并存的问题,论文用音视频时间对齐加图文语义引导的流匹配扩散变换器做基座,再用 ImageBind 与 Synchformer 自动排序的偏好优化做对齐微调,在 VGGSound 测试集上以 151M 参数取得分布与同步指标的领先,但高帧率编码与多轮偏好迭代仍带来额外开销与过优化风险。

 · 更新于 2026-09-24 · 约 19 分钟 · 9262 字 阅读 →
论文解读

只听见声音不够:当语义对不上时用双耳空间线索做视听推理

论文把视听空间推理定义为超越语义匹配的定位与关系判断,用 SoundSpaces 2.0 渲染的全景图加双耳音频构造 100 万问答对并训练连接视觉与空间音频编码器的大语言模型,在语义错位与多同类目标场景上报告了双耳相对单耳的定向优势,但分类精度仍远低于 Oracle 且依赖仿真场景。

 · 更新于 2026-09-24 · 约 19 分钟 · 9064 字 阅读 →
论文解读

鼓面共振强、单点信噪比低:用模态把多点双轴散斑位移对齐后再反推声音

针对固体共振物体声音恢复弱且染色重的问题,该工作用模态形状梯度与二阶模态传递函数建立多点双轴散斑位移到声源的前向模型并做正则优化反演,在鼓等多物体上比单点、平均与固定延迟融合更干净,但高频模态漏检仍是主要代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 10016 字 阅读 →
论文解读

按语音层级拆开看:低层管内容音色、高层管韵律的视频到语音生成

针对无声视频生成语音时视觉稀疏而语音稠密的不对称问题,HiCoDiT 用残差向量量化的 12 层离散 token 层级先验把唇动身份与表情解耦注入低层和高层扩散块,在未训练的 LRS3 与 LRS2 上以 A/B 偏好 57.0% 对 38.1% 胜过 AlignDiT 等基线,代价是身份多样性受限且部分客观指标未全面领先。

 · 更新于 2026-09-24 · 约 17 分钟 · 8430 字 阅读 →
论文解读

长视频不止于切分检索:用视听实体黏合与分层索引保持叙事连贯

针对小时级视频上下文过长与朴素切分检索导致碎片化的问题,论文提出离线构建全局-场景-片段-实体四层索引并用说话人身份做跨模态实体黏合,再由智能体按需多粒度检索,在 LVBench 上以 30 秒粗切分与至多 10 步推理达到 84.1% 整体准确率,但高密度采样与多工具调用仍带来离线与在线开销。

 · 更新于 2026-09-24 · 约 22 分钟 · 10570 字 阅读 →
论文解读

合成数据能替代、修正再扩展声源定位训练吗

该文用文本到图像与文本到音频模型构造 VGGSound 合成克隆并固定 ACL-SSL 做对比学习,验证同规模替代、合成图像配真实音频修正与 2 倍 3 倍混合扩展三类用法,最强混合配方相对纯真实基线提升约 8.62 cIoU、5.58 mIoU 与 12.16 IIoU,代价是合成音频弱于真实音频且纯合成需到 3 倍才稳定超越。

 · 更新于 2026-09-24 · 约 18 分钟 · 8631 字 阅读 →
论文解读

从标注到干扰项:HumanVBench 用人为可核查的流水线逼问视频模型的看人能力

论文针对视频多模态大模型看人不细的问题,用两条自动标注与组装干扰项的流水线合成 16 个细粒度选择题,并在 30 个模型与人类基线上显示情绪与声画对齐仍远落后于人,且开放流水线把人工从出题转为验题。

 · 更新于 2026-09-24 · 约 20 分钟 · 9660 字 阅读 →
论文解读

不对称伪造下为何要先估一致性再分配计算:IaMSB 的三段桥

针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。

 · 更新于 2026-09-24 · 约 21 分钟 · 10450 字 阅读 →
论文解读

长视频越播越走样:先定低分辨率动作再用姿态锚定外观的音频驱动动画

针对长时长音频驱动全身动画的身份漂移与手部畸变问题,论文采用先生成低分辨率同步视频再用姿态引导精炼器恢复高分辨率的由粗到精路线,在全身集上报告图像距离 60.71 与手部置信度 0.90 等结果,代价是两阶段训练与大规模单人数据依赖。

 · 更新于 2026-09-24 · 约 20 分钟 · 9524 字 阅读 →
论文解读

自监督表示真能看穿音画伪造吗:冻结特征加线性头能走多远

论文把多种自监督音频、视觉和音画特征冻结后只训练线性分类头,在科学数据集与野外数据上比较检测、异常检测、可解释定位与互补融合,发现含音频信息的表示泛化最好但野外数据仍困难,且随机特征也能靠捷径得高分。

 · 更新于 2026-09-24 · 约 21 分钟 · 10404 字 阅读 →
论文解读

不微调也能说话:用预训练扩散模型拼出口型、身份与时间一致

论文研究无任务微调的说话脸生成,用冻结的稳定扩散加图像适配器做骨干并配三个无可训练参数的模块,在 CREMA 和 HDTF 上报告了最低的口型几何误差和最高的口型相关性,代价是依赖外部人脸先验与逐帧重绘加后滤波的推理链路。

 · 更新于 2026-09-24 · 约 20 分钟 · 9972 字 阅读 →
论文解读

零前视下全身协调:LiveGesture 用分区域专家加因果融合做流式手势

LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →
论文解读

跨模态检索错位与单跳知识太浅:用多跳图加两步剪枝补齐音视频问答证据

针对音视频问答中共享嵌入检索错位与单跳图证据太浅的问题,论文用三步多智能体构造多跳多模态知识图并以模态内检索加 GRASP 接地剪枝供给答案有用子图,在 AudioCaps-QA、VCGPT 和 VALOR 上一致提升但强依赖阈值与外部接地模型。

 · 更新于 2026-09-24 · 约 20 分钟 · 9674 字 阅读 →
论文解读

先问该听谁再解码:用自评估权重压住跨模态幻觉的 MAD

针对音视频大模型中一个模态错误污染另一模态描述的跨模态幻觉,MAD 用免训练的两步流程先让模型自评问题需要音频、视频还是两者,再用权重调节四路对比解码,在 CMM 和 AVHBench 上提升 VideoLLaMA2-AV 与 Qwen2.5-Omni 的准确率,代价是每步需计算多组 logits 且依赖模型自身判断的可靠性。

 · 更新于 2026-09-24 · 约 18 分钟 · 8746 字 阅读 →