论文解读

从歌曲证据到可执行分镜:MVWeaver 为何用层次规划加歌曲到视觉的桥接来做长篇音乐视频

针对全曲音乐视频需要把歌曲语义与音乐结构转成连贯视觉发展的难题,MVWeaver 用层次化规划把总概念逐级展开为可渲染镜头,并用从真实歌曲-MV 对中学习到的歌曲到视觉桥接来条件化规划,证据显示其在歌曲贴合与长程连贯上优于同条件基线,但增益依赖桥接监督与层次资产复用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10949 字 阅读 →
论文解读

AVENUE:当提示只改一个模态时,模型能否守住另一个模态

AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。

 · 更新于 2026-09-24 · 约 23 分钟 · 11214 字 阅读 →
论文解读

长时音视频为何不能只靠分块拼接:Encore 用参考锚点与自适应信号路由维持一致性

针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。

 · 更新于 2026-09-24 · 约 24 分钟 · 11802 字 阅读 →
论文解读

PRISM-Bench:用音频类型与声源可见性交叉诊断文生音视频的接地能力

针对文生音视频评估重视频轻音频的问题,PRISM-Bench 以语音/音乐/音效与 On-screen/Off-screen 交叉分层与四维度 35 条细粒度标准组织 900 条人工校验样本,并用盲式并排、以真值为锚的 MLLM-as-a-Judge 两阶段打分实现超过 70% 的人类一致性,揭示前沿闭源模型在可感保真度上已超真值但在可见声源同步与精细声音控 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9227 字 阅读 →
论文解读

注意力三角:当音频-视频边把鹦鹉的话转给海盗

论文研究文本到音频视频联合生成中的语义泄漏与声源归属错误,提出只在推理时对文本-视频、文本-音频、音频-视频三条交叉注意力边加偏置的转向方法,在 100 个挑战提示上把 Qwen 声源归属分从 0.1216 提高到 0.1349,代价是约 2.5 倍推理开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9171 字 阅读 →
论文解读

剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本

音视频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9837 字 阅读 →
论文解读

掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处

音视频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 26 分钟 · 13008 字 阅读 →
论文解读

当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令

音乐生成 | 7.1/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13132 字 阅读 →
论文解读

有害不在一处:当声音与画面由多模态共同拼出

音视频生成 | 7.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7570 字 阅读 →
论文解读

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

空间音频 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6952 字 阅读 →
论文解读

EchoWM: Open and Enterable Omnimodal World Models

音视频生成 | 10.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5157 字 阅读 →
论文解读

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

音视频生成 | 8.9/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4722 字 阅读 →
论文解读

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

音视频生成 | 8.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5274 字 阅读 →
论文解读

Generalized Audio-Driven Synthesis of Precise Drummer Motion

音视频生成 | 7.8/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4876 字 阅读 →
论文解读

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

音视频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3309 字 阅读 →
论文解读

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

语音克隆 | 6.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7652 字 阅读 →
论文解读

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

音视频语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6606 字 阅读 →
论文解读

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

音视频生成 | 6.8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8158 字 阅读 →
论文解读

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

音视频生成 | 6.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8252 字 阅读 →
论文解读

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

音视频生成 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7021 字 阅读 →