论文解读
一步到位改三维声场:SwanWeave 为何把事件、空间、运动与房间一起学
SwanWeave 针对 FOA 四通道声场的指令编辑任务,用可控房间仿真构造 125K/类单操作与 250K 复合操作的源-目标配对监督,以潜空间流匹配为生成器,配合双层路由的 SE-MoE 与面向错编负样本的 SPO 偏好对齐及分阶段课程,实现一阶段复合编辑,并在客观与人评上一致优于现有通用与立体声编辑基线,代价是依赖仿真数据与约 10 秒短场景。
SwanWeave 针对 FOA 四通道声场的指令编辑任务,用可控房间仿真构造 125K/类单操作与 250K 复合操作的源-目标配对监督,以潜空间流匹配为生成器,配合双层路由的 SE-MoE 与面向错编负样本的 SPO 偏好对齐及分阶段课程,实现一阶段复合编辑,并在客观与人评上一致优于现有通用与立体声编辑基线,代价是依赖仿真数据与约 10 秒短场景。
针对跨语言配音与双人全双工对话,Text-AB 用 DAC-VAE 潜变量上的流匹配 DiT 加 mT5 交叉注意力学对齐,经 480k 小时预训练与三路微调,在配音可分享性上领先内部系统约 0.38-0.40 分,短对话接近真值,但长音频依赖多扩散拼接与多候选重排带来额外推理代价。
语音合成 | 6.8/10
音视频生成 | 7.5/10
音乐源分离 | 5.3/10
扩散模型 | 5.9/10
语音识别 | 6.2/10
语音合成 | 7.9/10
语音合成 | 9.6/10
音频理解 | 8.7/10
音频分离 | 9.0/10
音视频生成 | 6.8/10
音视频生成 | 6.6/10
语音合成 | 6.8/10
音频生成 | 8.2/10
语音合成 | 6.0/10
语音合成 | 6.5/10
语音增强 | 7.1/10
音乐生成 | 7.5/10
语音合成 | 7.0/10