PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

📄 PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads 标签:#音视频生成 #多模态模型 #端到端 #高效推理 #可解释性 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #多模态模型 | #端到端 #高效推理 | arxiv 👥 作者与机构 Ao Fu(ORCID: 0009-0006-9933-9240,邮箱:220232248@seu.edu.cn):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 Yi Zhou(ORCID: 0000-0003-3021-3229,邮箱:yizhou.szcn@gmail.com):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 论文发表于 Proceedings of the 34th ACM International Conference on Multimedia(MM ‘26),2026年11月10–14日,巴西里约热内卢。DOI: 10.1145/3767308.3835096。 💡 毒舌点评 把音素级离散语言信息和连续音频特征用门控融合注入 3DGS 说话头,确实打中了“漏嘴”(leaky mouth)和嘴部过平滑这一真实痛点;LFM 的可视化也让融合过程有了初步可解释性。但整体仍是对 per-person 说话头框架的组件级改进,而非范式级突破:所谓音素来自离线 ASR+强制对齐,且仅 2 个受试者的消融与跨数据集实验支撑一个高达 40 音素的词汇表,证据链偏单薄;代码权重一概未公开,可复现性近于零。把“phoneme-driven”的普适性说到太满之前,至少应给出多身份、多语言、对 ASR 噪音的鲁棒性分析。 ...

2026-08-07 · 更新于 2026-09-04 · 4 min · 721 words

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

📄 Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming 标签:#音视频生成 #后训练 #扩散模型 #流式处理 #音频理解 7.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #后训练 | #扩散模型 #流式处理 | arxiv 👥 作者与机构 共同第一作者:Menglin Han(Vorch Team;同济大学)、Yang Ding(Vorch Team),均标注 * 通讯作者:Zhangkai Ni(同济大学)、Lin Ma(机构未说明)、Yaohui Wang(Vorch Team),均标注 † 作者列表:Menglin Han(Vorch Team;同济大学)、Yang Ding(Vorch Team)、Yulei Lu(Vorch Team)、Haoran Yu(Vorch Team;哈尔滨工业大学(深圳))、Xin Ma(Vorch Team)、Junyi Chen(Vorch Team;上海交通大学)、Zhangkai Ni(同济大学)、Lin Ma(机构未说明)、Yaohui Wang(Vorch Team) 💡 毒舌点评 亮点是把双向 LTX2.3 的短片段生成能力拆成“因果块 + 稳定前缀窗口 + 显式 LLM 语音规划”,在两分钟 T2AV 上做到 27.12 FPS 并维持较低 WER,工程完成度很高。短板是训练语料和分布蒸馏教师都来自同一双向 LTX2.3,存在明显自举闭环;对比的流式基线只能跑到 30 秒,且论文没有提供代码、权重或数据,验证可信度被削弱 ...

2026-08-07 · 更新于 2026-09-04 · 3 min · 538 words

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

📄 OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films 标签:#音视频生成 #流匹配 #音频理解 #Transformer #模型评估 7.7/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #流匹配 | #音频理解 #Transformer | arxiv 👥 作者与机构 作者:Xin Lu†、Zihao Fan†、Mingchen Zhong、Jie Huang‡、Xueyang Fu、Zheng-Jun Zha †表示共同一作;‡表示项目负责人 通讯作者为 Xueyang Fu 机构:1. 中国科学技术大学(University of Science and Technology of China);2. JD Explore Academy(京东探索研究院) 💡 毒舌点评 这是那种“口号很满、源码欠奉”的典型顶会式论文:标题里“首个联合音视频生成式修复”和“22B 模型”都很唬人,但实际训练参数只有约 396M,也就是 22B 的约 1.8%。视觉修复确实强,六项无参考指标全部碾压;可一到全参考音频指标就露馅,STOI 和 SI-SDR 被简单的 VoiceFixer 反杀,作者只能用“生成式重合成所以不保相位对齐”来解释。OmniVRBench 是自己造的 benchmark,Controlled track 还全是 talking-face,却直接冠以“历史电影修复”的大名。不过实验设计、消融、统计检验和附录透明度都算厚道,说明作者清楚自己的软肋。问题在于:代码、权重、数据目前都只有“will be released”,可复现性约等于画饼。 ...

2026-08-06 · 更新于 2026-09-04 · 4 min · 748 words

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

📄 Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation 标签:#音视频生成 #扩散模型 #音频生成 #课程学习 #音频理解 6.8/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #扩散模型 | #音频生成 #课程学习 | arxiv 👥 作者与机构 共同第一作者:Zehua Chen(论文脚注标注 “Equal contribution”,邮箱 zhc23thuml@tsinghua.edu.cn;正文未列出机构) 共同第一作者:Junyou Wang(脚注标注 “Equal contribution”,邮箱 ackokomi0222@gmail.com) 通讯作者:Jun Zhu(论文脚注标注 “Corresponding author” 及邮箱 dcszj@tsinghua.edu.cn,按作者列表位置推断) 其他作者:Yuxuan Jiang、Zhenying Fang、Yusheng Dai、Jianfei Chen、Ziwei Liu(文献信息均未披露所属机构) 说明:论文正文与附录均未给出明确机构列表;邮箱域名仅作为线索,不作为机构确认依据。作者姓名后的数字 1/2/3/4 可能标注不同的单位,但对应单位列表未在论文中披露。 💡 毒舌点评 这篇论文想要解决的问题是真实的,视频生成音频确实绕不开时间同步;它的方案也很"简洁"——把相邻帧做差送给 CLIP 再拼回去。问题是,整篇论文的卖点几乎全部压在"时间差异(TD)“这一个概念上,而"把两帧相减"这样一个操作能否撑起一整篇顶会论文,值得打一个大大的问号。审稿人看完全文最想追问的一个问题或许是:FTD 本质上是否只是在用相邻帧的高频残差作为一种隐式的运动正则?如果是这样,TD 的"表示学习"含量并没有标题暗示的那么高。更让人遗憾的是,论文已经用了 massive 的预训练资源——AudioSet(5800 小时)、FreeSound(6246 小时)、MSD(7333 小时)、VGGSound(550 小时),最后却只在 VGGSound 一个测试集上做客观评测,主观评测更是只抽了 20 个样本、15 个被试,统计功效极其有限。与 Diff-Foley 相比,你的 AA 指标并没有全面超越,论文自己在正文里也承认只是"comparable”。此外,ATDG 引导需要在线执行三次 DiT 前向(无条件、帧条件、帧+TD 条件),虽然在 NFE 口径下与 CFG 对齐,但实际内存和延迟开销并未讨论。最后,最致命的是,代码、模型权重、数据集全部没有开源,唯一的结果来源是"自我报告"。对于一篇声称"surpassing dedicated V2A representations like CAVP"的论文来说,这样的可复现性现状是完全不合格的。结论:适合作为一项技术报告被公开,但作为顶会论文,其核心贡献的深度、评测的广度与开源诚意都有明显短板。 ...

2026-08-06 · 更新于 2026-09-04 · 6 min · 1069 words

AcoustiTrace: When Plausible Sound Violates Physics

📄 AcoustiTrace: When Plausible Sound Violates Physics 标签:#音视频生成 #多模态模型 #音视频理解 #基准测试 #扩散模型 6.9/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频生成 | #多模态模型 | #音视频理解 #基准测试 | arxiv 👥 作者与机构 第一作者:Shiyang Li (中科院的机构1和2) 通讯作者:Changqing Zou (中科院的机构1和6) 作者列表:Shiyang Li (机构1,2), Yuewen Cao (机构2), Yihao Liu (机构2), Yuandong Pu (机构3), Baochang Zhang (机构4), Xiaofei Li (机构5), Changqing Zou (机构1,6) 机构说明:论文未明确给出机构全称,仅以数字标记了6个不同机构。 💡 毒舌点评 AcoustiTrace以其声学物理过程的三阶段八维度拆解,为现有音视频生成评估中“听着真但物理假”的棘手问题,提供了一套迄今最具结构感的诊断工具箱。它细致、体面、有洞见。然而,当这个基准的全部数据、验证过的评估器以及精心设计的提示套件都被作者们揣在兜里,拒绝开源时,它就从社区的公共基础设施退化成了一场自娱自乐的内部演习。再精巧的“手术刀”,若只允许少数人使用,其价值也大打折扣。 ...

2026-08-04 · 更新于 2026-09-04 · 3 min · 434 words

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

📄 CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation 标签:#音视频生成 #多模态模型 #基准测试 #数据集 #模型评估 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.5/1.5 ✅ 7.2/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频生成 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Xianjing Han(Nanyang Technological University) 通讯作者:Bin Zhu(Singapore Management University, binzhu@smu.edu.sg) 作者列表:Xianjing Han(Nanyang Technological University)、Yuhan Su(Centrale Supélec)、Yang Deng(Singapore Management University)、Dong Ma(University of Cambridge)、Wee Peng Tay(Nanyang Technological University)、Bin Zhu(Singapore Management University, 通讯作者) 💡 毒舌点评 本文准确命中了当前T2V评估的一个盲区:文化理解,并构建了一个多维度、覆盖12国的文化视频基准。论文的设计思路清晰,问题定义精准。然而,作为一个纯粹的CV/多模态生成评测工作,它对语音/音乐/音频社区的直接贡献微乎其微,音频评估仅作为极小附属部分存在。此外,评估的可靠性高度依赖MLLM与少数标注者,缺乏对MLLM自身文化偏见的反思,导致基准和评估工具的权威性都需打上问号。 ...

2026-08-04 · 更新于 2026-09-04 · 3 min · 473 words

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

📄 LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation 标签:#音视频生成 #知识蒸馏 #流式处理 #实时处理 #音频理解 6.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #知识蒸馏 | #流式处理 #实时处理 | arxiv 👥 作者与机构 第一作者:Rongxiang Zhang(机构标注为1,2,具体单位未说明) 通讯作者:Songhua Liu(机构标注为1,具体单位未说明,标注为corresponding author) 作者列表:Rongxiang Zhang(1,2)、Songhua Liu(1) 💡 毒舌点评 用布朗桥替代噪声起始,身份漂移的缓解效果在实验中一目了然,SNR对齐的时间变换也把流匹配教师和桥式学生的跨范式蒸馏推到了新高度。但“开源”只有一个空壳项目主页,代码和模型权重一概欠奉,让“200FPS实时生成”的豪言成了薛定谔的承诺——无法复现验证的工程奇迹,在顶会审稿人眼里终究是空中楼阁。此外,对极端姿态、严重遮挡和超长时(>10分钟)场景的稳定性仍是一笔带过,工业落地前的最后一道坎还远未迈过。 📌 核心摘要 本文针对音频驱动说话人头生成中长期存在的延迟与质量权衡问题,提出了一种名为LeapTalk的框架。其核心思路是摒弃传统的“噪声→数据”扩散范式,转而将生成过程重新定义为一个以参考图像为起始锚点的布朗桥数据到数据传输过程(Bridge Forcing),从根本上抑制流式自回归生成中的身份漂移和误差累积。为实现单步实时推理,论文设计了一套异构分布匹配蒸馏(DMD)方案:通过一个基于信噪比对齐的闭式时间变换函数\(\Phi(\tau)=1/(1+\sqrt{(1-\tau)/\tau})\),将流匹配教师的多步知识稳定转移至布朗桥单步学生模型,并引入音频驱动的分类器自由引导(Audio-Driven CFG)以在极端步数压缩下维持唇动细节和运动多样性。主要实验表明,在HDTF和CelebV-HQ上,LeapTalk仅用1步推理(NFE=1)就取得了21/197的FID/FVD(HDTF),唇音同步指标Sync-C达到8.38,同时Lite版本达到200FPS(H200,512×512),Pro版本55FPS,性能显著优于多步扩散基线和现有自回归方法,并在DINOv2身份一致性时序曲线上保持平坦,证实了长期生成的稳定性。实际意义在于为实时、无限长度的数字人驱动提供了兼顾效率与稳定性的新范式。主要局限是开源不完整(缺少代码与模型权重),且对极端参考姿态、大面积遮挡或超长时生成的鲁棒性尚未充分量化。 ...

2026-08-04 · 更新于 2026-09-04 · 2 min · 419 words

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

📄 TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation 标签:#音视频生成 #扩散模型 #音频理解 #Transformer #模型评估 6.7/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #扩散模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Qijun Gan(未说明机构) 通讯作者:Meiguang Jin(未说明机构) 其他作者:Chenwei Zhang, Junfeng Ma, Qiu Shen(均未说明机构) 备注:论文中未明确标明各作者所属的具体机构名称和地址。 💡 毒舌点评 这篇工作将不可变锚点与受门控的动态记忆巧妙地结合起来,用于抑制长时因果生成中的身份漂移,其细致的记忆因子化和推理流水线设计展现了扎实的工程功底。然而,实验对比避开了最直接的因果生成竞品(如 Mutual Forcing/AvatarForcing)的同条件较量,使得其宣称的领先优势说服力打折;完全依赖合成数据进行训练和评估,也为这项工作的泛化能力打上了一个大大的问号。虽然有承诺开源的网页,但当前缺乏复现所需的核心资产与数据。 ...

2026-07-30 · 更新于 2026-09-04 · 3 min · 589 words

Parallel Decoding Distillation for Fast Image and Video Generation

📄 Parallel Decoding Distillation for Fast Image and Video Generation 标签:#音视频生成 #知识蒸馏 #扩散模型 #音频理解 #Transformer 6.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #知识蒸馏 | #扩散模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Neta Shaul(NVIDIA, Weizmann Institute of Science) 通讯作者:未说明,Arash Vahdat和Julius Berner为共同指导(equal advising) 作者列表:Neta Shaul(NVIDIA, Weizmann Institute of Science)、Chao Liu(NVIDIA)、Arash Vahdat(NVIDIA)、Julius Berner(NVIDIA) 💡 毒舌点评 这篇论文在轨迹蒸馏的路上走得扎实:用并行解码替代单步回归,既免去了JVP/有限差分的计算开销,又把视频生成的多样性从分布蒸馏的泥潭里拉了出来。但作为一篇自称“方法简单鲁棒”的工作,实验对比中对核心创新“并行解码”本身的消融近乎为零——你从未直接证明并行预测优于单步预测,也未在相同NFE下与步进蒸馏做公平对比,这使得核心论证悬空。此外,生成模型的音视频评测中视频部分做得很足,但音频质量评估仅靠一个LLM打分,缺乏FAD等客观声学指标,这在此类应用中是个明显的短板。 ...

2026-07-29 · 更新于 2026-09-04 · 5 min · 964 words

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

📄 JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents 标签:#音视频生成 #多模态模型 #开源工具 #音频理解 #Transformer 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.1/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频生成 | #多模态模型 | #开源工具 #音频理解 | arxiv 👥 作者与机构 共同核心贡献者(按字母序排列):Yunlong Lin(未说明)、Zixu Lin(未说明)、Zhaohu Xing(未说明) 贡献者:Biqiang Li(未说明)、Chenxin Li(未说明)、Haonan Wang(未说明)、Haitao Wu(未说明)、Hengyu Liu(未说明)、Jianghai Chen(未说明)、Kaituo Feng(未说明)、Kaixin Li(未说明)、Shawn Chen(未说明)、Shijue Huang(未说明)、Sixiang Chen(未说明)、Tsung-Yi Ho(未说明)、Wenxuan Huang(未说明)、Xiangyan Liu(未说明)、Xiaomeng Hu(未说明)、Xuanhua He(未说明)、Yan Sun(未说明)、Yunqing Zhao(未说明)、Zhiqin Yang(未说明)、Zehan Wang(未说明)、Zhengyang Tang(未说明) 学术顾问:Tianyu Pang(未说明)、Xiangyu Yue(未说明) 团队署名:JarvisX Team,具体机构未明确标注 💡 毒舌点评 将画布提升为代理的共享项目状态,这一设计直觉不错,架构分层也清晰,代码直接可跑。但硬伤是致命的:通篇没有一个数字——没有准确率、没有完成率、没有延迟、没有用户研究、没有任何形式的对比。三个"定性案例"加上几张截图就敢交稿,这在语音/音乐/音频领域的从业者眼里,基本是一篇来自隔壁社区的概念展示,远够不上系统验证的门槛。 ...

2026-07-28 · 更新于 2026-09-04 · 2 min · 320 words