论文解读

以相位为公共时钟:让声音、图形与颜色共用同一时间基准的音频激光合成

论文针对同一信号同时驱动振镜、音箱与激光二极管时跨域漂移与视觉先崩溃的问题,提出以全局相位斜坡为统一时间基础设施的架构,并以超过 40 个模块的 Phosphene 系统在 200 到 400 模块规模与 8 场演出中验证其可扩展性,代价是仍受 VCV Rack 非确定性调度与 CPU 负载限制。

 · 更新于 2026-09-24 · 约 23 分钟 · 11312 字 阅读 →
论文解读

在嘴型与动作抢注意力时,如何让化身在正确时间做正确动作

ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10172 字 阅读 →
论文解读

粗框也要贴边、对时也要对帧:声画同步实例编辑的空间与时间分工

AVI-Edit 以 Wan2.2 为视频骨干,用精度因子引导的掩膜精修器管空间边界、用分离生成混音返工的音频智能体管时间对齐,在 AVISET 与 AvED-Bench 上报告了质量与同步优势,代价是多实例只能串行逐个处理。

 · 更新于 2026-09-24 · 约 20 分钟 · 9981 字 阅读 →
论文解读

简单输入画不准、精细能量难手绘:AudioSketch 如何调制出有语义的时间能量

针对单张图像对应多种合理声音的一对多图像到音频生成问题,AudioSketch 用轻量图像到音频映射复用预训练文本到音频扩散模型并以 ControlNet 注入能量轨迹,再用语义条件能量调制器把简单时间戳转换为精炼能量,在 VisualSound 上无控制时以 16.21 的 FD 与 12.41 的 IS 领先同类,而代价是对平滑归一化选择敏感且客观起振对 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8996 字 阅读 →
论文解读

数得准还要指得出:长视频线索级音视计数的基准与能力迁移训练

论文针对长视频多模态计数难评难训的问题,构建带细粒度线索标注的 CG-AV-Counting 并用课程式 GRPO 训练 AV-Reasoner,最强证据是在 DVD-Counting 上达到 44.00 准确率且多项音视定位任务达到新高,代价是显式输出思维链在域外幻觉子集上反而降低准确率。

 · 更新于 2026-09-24 · 约 20 分钟 · 9734 字 阅读 →
论文解读

边听边说还不能卡:用因果扩散迫使头像实时接住用户

针对双人对话头像需要实时响应用户语音与动作、且倾听表情难以标注的问题,论文用因果扩散强迫在动作隐空间逐块生成并用丢用户条件的合成负样本做偏好优化,报告约 500 ms 延迟、6.8 倍加速与超 80% 人工偏好,代价是口型与画质只保持可比而非全面领先。

 · 更新于 2026-09-24 · 约 17 分钟 · 8137 字 阅读 →
论文解读

看听推理不断线:AVATAR 用离线复用与首尾加权修补 GRPO

针对长视频音频问答中 GRPO 样本浪费、组内奖励相同导致优势为零、全序列平均授信的问题,AVATAR 用分层回放加离线修正与首尾抛物线加权做强化学习,在 Qwen2.5-Omni 上取得 MMVU 加 5.4 等增益,代价是四阶段课程与多奖励判断器带来的训练复杂度。

 · 更新于 2026-09-24 · 约 22 分钟 · 10852 字 阅读 →
论文解读

从人脸二分类到十一场景四层追问:AVFakeBench 如何考住音视频大模型

该研究针对真实世界音视频伪造超越人脸、混用编辑与合成的问题,构建含 3000 片段与 12000 问答的 AVFakeBench 并评测 11 个音视频大模型与 2 个专用检测器,报告显示大模型在二分类上更稳但在细粒度分类与解释上大幅下滑且存在视觉偏向与编辑盲区。

 · 更新于 2026-09-24 · 约 18 分钟 · 8895 字 阅读 →
论文解读

只听其声不够:用单因素反事实考视频生音频的物理因果

论文提出只变一个物理因素的时间对齐视频对与单视频模式测试来审计视频生音频模型,用方向一致性与敲击对齐度量揭示文本提升语义却损害同步、像素物理推理普遍偏弱的代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10082 字 阅读 →
论文解读

先降噪再分割:用自监督音频增强与动态原型约束弥合音视语义鸿沟

针对单模态噪声与跨模态语义鸿沟,BYOAVP 以自监督音频增强对齐视觉语义、以动量原型约束做像素级分类,在 AVSBench 与 VPO 六个子任务上取得最优,同时需承担双分支注意力与原型维护的额外开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8105 字 阅读 →
论文解读

不出错比出彩更难:CamJam 用四个摄像头乐器拼一个协同乐队

CamJam 针对零基础协同演奏问题选择纯摄像头加循环约束的四模块乐队结构,在 36 人轮换实验中弦乐模块直观性最高而协作评分偏低,代价是连续映射可预测性不足与面部追踪的不适感。

 · 更新于 2026-09-24 · 约 22 分钟 · 10739 字 阅读 →
论文解读

先估计各模态可不可信,再决定听谁的:CICA 的感知与决策耦合

针对语言、视觉、声音互相冲突时融合不可靠的问题,CICA 先让每个单模态编码器输出置信度和不确定度,再用它们调制融合注意力,在 MOSI 上报告 MAE 0.630 和 Corr 0.855、在 MOSEI 上报告 MAE 0.489 和 Corr 0.856,代价是需要两阶段训练并保留互信息正则以防止文本主导时压垮其他模态。

 · 更新于 2026-09-24 · 约 24 分钟 · 11594 字 阅读 →
论文解读

看不见脸时说话人是谁:CineSRD 用视觉锚点加语音语义补齐影视对白

针对影视长视频、多说话人和音画不同步问题,CineSRD 先用视觉锚点聚类注册说话人再用音频语言模型做轮次检测与幕后补充,在 SubtitleSD 上报告更低的 DER 与 JER,代价是多阶段集成而非端到端且依赖人脸与字幕时间轴。

 · 更新于 2026-09-24 · 约 17 分钟 · 8047 字 阅读 →
论文解读

模态吵架时别硬拉齐:冲突加权交叉重构的共享语义对齐

针对同一视频中语言、视觉、音频情感极性不一致时相似性对齐会扭曲共享语义的问题,论文提出冲突感知自适应交叉重构 CACR,用共享空间冲突分数加权交叉重构实现隐式对齐并以视听线索精炼文本,在 MOSI 上报告 ACC7 为 48.69、ACC2 为 87.04,代价是需要多组重构解码器与多项正则损失协同训练。

 · 更新于 2026-09-24 · 约 18 分钟 · 8759 字 阅读 →
论文解读

没有文字转写时,如何用图像字幕把语音和书面词连起来

该文用图像字幕先建视觉词表再过滤语音,用无监督词发现做两两对齐与堆叠评分定位关键词,在视觉监督下超过神经基线,但共现词与字幕噪声仍带来明显定位损失与计算代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9158 字 阅读 →
论文解读

只听声音选画面:声学氛围与歌词语义谁更决定背景视频的自然感

该研究比较声学氛围驱动与歌词语义驱动的背景视频选择,提出在约 14000 个音乐视频上对比学习音乐视频联合嵌入并用束搜索做全局非重叠选段,最强证据是主观评价中声学方法在整体不自然感和转场连续性上显著优于歌词方法,代价是剪辑节奏与歌词具体指涉仍存在错位。

 · 更新于 2026-09-24 · 约 16 分钟 · 7971 字 阅读 →
论文解读

不用表情图片,只用情感语音的差向量去改脸:C-MET 的跨模态情绪编辑

针对说话人视频中情绪编辑受限于离散标签和参考图像的问题,C-MET 用语音与表情空间的情绪语义向量差做跨模态回归,在 MEAD 上把情绪准确率做到最高,同时保留唇动与身份,且能处理训练未见的扩展情绪。

 · 更新于 2026-09-24 · 约 22 分钟 · 10870 字 阅读 →
论文解读

不追求更像人脸,而是生成对判别更有用的视觉特征:跨模态引导的抑郁识别训练框架

针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10499 字 阅读 →
论文解读

把音色拆成泛音再拼回去:用四件中国乐器做可玩的视听合成器

该研究用古筝、二胡、唢呐、堂鼓四种乐器的自录样本做前 8 个泛音的分轨重组与心电驱动的视听交互,在百余人次的非正式展览观察中看到熟悉又陌生的文化联想,代价是只有定性观察而无可控评估与生理推断力。

 · 更新于 2026-09-24 · 约 20 分钟 · 9944 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →