DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling
📄 DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling #语音交互 #扩散模型 #语音分离 5.9/10 | 创新 0.6/2 | 严谨 0.7/1.5 | 实验 0.4/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 📝 5.9/10 | 前50% | #语音交互 | #扩散模型 | #语音分离 | arxiv 👥 作者与机构 第一作者:Wataru Nakata(The University of Tokyo, Japan) 第二作者:Yuki Saito(The University of Tokyo / JST BOOST) 第三作者:Hiroshi Saruwatari(The University of Tokyo) 通讯作者:未明确标注,推测为 Wataru Nakata 💡 毒舌点评 DuplexChat通过播客管道规模化构建说话人分离的全双工对话语料,填补了公开大规模双通道训练数据的空白,工程集成能力扎实,构建了当前最大规模对话语音资源(~415k小时)。但下游SDLM训练实验完全缺失,使得"适合全双工建模"的核心断言悬空;单通道混合到双通道估计的分离链路引入模型噪声,其分离错误对下游对话建模的长期影响并未讨论。更致命的是,论文仅与Fisher这一电话窄带语料对比声学质量,既未与J-CHAT等相近的播客/音视频对话语料对比,也未讨论pyannote日志模型的级联误差,导致语料真实可用性缺乏说服力。整体来看,这是一个优秀的工程基础设施论文,但缺少SDLM训练验证使其影响力大打折扣——就像造了一条高速公路却从未让它跑过车。 ...