论文解读
不改唇形只定静音时刻:用二值语音活动信号约束配音合成
该文用帧级二值语音活动掩码约束补画式语音合成以对齐源语言静音结构,在 mTEDx 上把帧对齐准确率从约 73% 提升到约 96%,而主观自然度无显著下降,代价是在翻译时长严重失配时出现可复述的删词、重复与重排。
该文用帧级二值语音活动掩码约束补画式语音合成以对齐源语言静音结构,在 mTEDx 上把帧对齐准确率从约 73% 提升到约 96%,而主观自然度无显著下降,代价是在翻译时长严重失配时出现可复述的删词、重复与重排。
针对戏剧配音中角色跨轮音色漂移、高潮台词演绎不足与长句分段节奏断裂三类场景级失效,SceneTTS-Bench 用统一输入协议与 SCS、UAR、RDR 三条自动诊断链在 160 场双语剧本上测出四套系统的互补短板,且场景级排序与句级可懂度排序明显背离。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
论文把唇同步拆成一步潜空间图像编辑器与音频到唇姿态变换器,用纯重建加流匹配代替对抗与扩散,并在重建与跨音频评测中以 109.41 帧每秒的单卡速度达到可比的同步与保真,代价是遮挡与极端姿态仍待加强。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对视觉特征预处理复杂且跨域易失效的问题,InstructDubber 用多模态大模型生成语速与情绪自然语言指令,再分别蒸馏时长线索与校准情绪分析以预测音素时长和韵律,在三个基准的域内与跨域零样本配音中报告了更稳的对齐,但部分时长指标仍有基线更优且推理依赖外部大模型。
针对仅对目标语句做跨模态建模导致情感表达不足的问题,论文用多模态参考片段库加情感相似检索与渐进图融合来模拟导演给素材、演员逐步内化的流程,在 V2C-Animation 上把情感准确率做到 47.21%,代价是需要维护检索库并做三阶段图编码。