论文解读
直接学对话会失语:用课程学习与说话轮次嵌入让流匹配学会双人对话
针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。
针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。
音视频语音合成 | 7.3/10
音频字幕生成 | 7.9/10
语音翻译 | 8.2/10
音视频生成 | 6.8/10
音频生成 | 7.1/10
语音交互 | 7.6/10
音视频理解 | 6.0/10
音乐生成 | 6.5/10
语音分离 | 6.6/10
语音识别 | 6/10
语音识别 | 7.3/10
语音识别 | 8.5/10
语音情感识别 | 7.4/10
强化学习 | 6.3/10
语音识别 | 7.2/10
课程学习 | 7.2/10
语音识别 | 7.6/10
音频生成 | 7/10
语音合成 | 8.9/10