Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis
📄 Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis 标签:#语音合成 #大语言模型 #多模态模型 #数据集 #强化学习 6.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | 文档类型:模型报告 | 评分置信度:高 | #语音合成 | #大语言模型 | #多模态模型 #数据集 | arxiv 👥 作者与机构 第一作者:Yifan Hu(内蒙古大学) 通讯作者:Rui Liu(内蒙古大学) 作者列表:Yifan Hu(内蒙古大学)、Shuwei He(内蒙古大学)、Rui Liu(内蒙古大学)、Haizhou Li(香港中文大学(深圳)) 💡 毒舌点评 论文将面部动作单元(AU)引入对话语音合成,思路直接且工程完整,自动化构建了千小时级视频-语音对话数据集,消融明确。但技术层面的"新"更多体现在组合与适配:AUTokenizer本质上是一个有监督AU分类+FSQ量化,DualDPO也只是把两个模态的DPO目标加在一起联合优化,缺乏更深层的跨模态融合创新;主观评测仅基于二语英语者,对话境匹配感的生态效度存疑。 ...