Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis
📄 不数拍子也能合唱:对齐无关的配音与双人对话合成 英文题目:Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis 一句话:用 mT5 交叉注意力隐式对齐替代强制对齐与时长预测,结合 48 kHz DAC-VAE 隐变量流匹配统一单双通道生成,在内部配音基准可分享性提升约 0.40、短对话人类相似度 4.53 接近真人 4.62,代价是依赖闭源数据与多候选重排序。 标签:#语音合成 | #流匹配 | #语音克隆 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Sanyuan Chen:FAIR at Meta Min-Jae Hwang:FAIR at Meta Sho Inoue:FAIR at Meta Anna Sun:FAIR at Meta Bokai Yu:FAIR at Meta David Kant:FAIR at Meta Dongmin Hyun:FAIR at Meta Dorian Desblancs:FAIR at Meta Gregory Antonovsky:FAIR at Meta Oleg Repin:FAIR at Meta Peng-Jen Chen:FAIR at Meta Xutai Ma:FAIR at Meta Zehai Tu:FAIR at Meta Juan Pino:FAIR at Meta Wei-Ning Hsu:FAIR at Meta 💬 毒舌点评 把对齐无关文本接口、48 kHz低码率隐变量扩散与单双通道统一建模做成可落地的配音加全双工对话大系统,工程链条完整。短板是全程依赖内部数据与内部基线且无外部可验证产物,情绪与长对话评估多靠自动指标与自建主观量表,说服力打了折扣。 ...