PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads
📄 PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads 标签:#音视频生成 #多模态模型 #端到端 #高效推理 #可解释性 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频生成 | #多模态模型 | #端到端 #高效推理 | arxiv 👥 作者与机构 Ao Fu(ORCID: 0009-0006-9933-9240,邮箱:220232248@seu.edu.cn):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 Yi Zhou(ORCID: 0000-0003-3021-3229,邮箱:yizhou.szcn@gmail.com):东南大学计算机科学与工程学院;新一代人工智能技术及其跨学科应用教育部重点实验室,南京,中国。 论文发表于 Proceedings of the 34th ACM International Conference on Multimedia(MM ‘26),2026年11月10–14日,巴西里约热内卢。DOI: 10.1145/3767308.3835096。 💡 毒舌点评 把音素级离散语言信息和连续音频特征用门控融合注入 3DGS 说话头,确实打中了“漏嘴”(leaky mouth)和嘴部过平滑这一真实痛点;LFM 的可视化也让融合过程有了初步可解释性。但整体仍是对 per-person 说话头框架的组件级改进,而非范式级突破:所谓音素来自离线 ASR+强制对齐,且仅 2 个受试者的消融与跨数据集实验支撑一个高达 40 音素的词汇表,证据链偏单薄;代码权重一概未公开,可复现性近于零。把“phoneme-driven”的普适性说到太满之前,至少应给出多身份、多语言、对 ASR 噪音的鲁棒性分析。 ...