从歌曲证据到可执行分镜:MVWeaver 为何用层次规划加歌曲到视觉的桥接来做长篇音乐视频
针对全曲音乐视频需要把歌曲语义与音乐结构转成连贯视觉发展的难题,MVWeaver 用层次化规划把总概念逐级展开为可渲染镜头,并用从真实歌曲-MV 对中学习到的歌曲到视觉桥接来条件化规划,证据显示其在歌曲贴合与长程连贯上优于同条件基线,但增益依赖桥接监督与层次资产复用。
针对全曲音乐视频需要把歌曲语义与音乐结构转成连贯视觉发展的难题,MVWeaver 用层次化规划把总概念逐级展开为可渲染镜头,并用从真实歌曲-MV 对中学习到的歌曲到视觉桥接来条件化规划,证据显示其在歌曲贴合与长程连贯上优于同条件基线,但增益依赖桥接监督与层次资产复用。
AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。
针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。
针对文生音视频评估重视频轻音频的问题,PRISM-Bench 以语音/音乐/音效与 On-screen/Off-screen 交叉分层与四维度 35 条细粒度标准组织 900 条人工校验样本,并用盲式并排、以真值为锚的 MLLM-as-a-Judge 两阶段打分实现超过 70% 的人类一致性,揭示前沿闭源模型在可感保真度上已超真值但在可见声源同步与精细声音控 …
论文研究文本到音频视频联合生成中的语义泄漏与声源归属错误,提出只在推理时对文本-视频、文本-音频、音频-视频三条交叉注意力边加偏置的转向方法,在 100 个挑战提示上把 Qwen 声源归属分从 0.1216 提高到 0.1349,代价是约 2.5 倍推理开销。
音视频生成 | 7.5/10
音视频生成 | 7.2/10
音乐生成 | 7.1/10
音视频生成 | 7.3/10
空间音频 | 6.9/10
音视频生成 | 10.0/10
音视频生成 | 8.9/10
音视频生成 | 8.3/10
音视频生成 | 7.8/10
音视频生成 | 8.0/10
语音克隆 | 6.4/10
音视频语音合成 | 7.3/10
音视频生成 | 6.8/10
音视频生成 | 6.2/10
音视频生成 | 6.6/10