修音准节奏又不换嗓:整流流如何把遮罩补全做成风格保持的美化
针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。
针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。
论文把生成与编辑看作稀疏到稠密的条件谱,用同一潜在流匹配模型在生成分支与重建分支间随机切换训练,以词级音素对齐、节拍条件和变分自编码器表征对齐提升可懂度,并用残差瓶颈容量换取重建保真度与可编辑性,最强证据是分离人声词错误率做到 0.133 但感知质量仍落后于偏好优化基线。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
论文把 sygyt 双声复制写成从录音反推声道形状的可微优化问题,用带舌下第二声源和 B 样条声道的 Kelly-Lochbaum 波导在 20 段录音上把对数谱距离相对基线降低 30-38%,代价是每段仍需约 30 分钟离线优化且绝对误差仍在 9 分贝量级。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对全局提示无法刻画配器情绪能量随段落演变的问题,SegTune 用全局加分段层级条件与大模型句级时长预测做非自回归扩散生成,在 15 首中文流行歌测试中把音素错误率降到 14.5% 并把音乐性主观分做到 4.57,代价是偏好优化后性别年龄跟随出现下滑。
UniVocal 把同一话语内说话与唱歌自动切换定义为 SCS 合成,用 CosyVoice 2 加两阶段课程学习与精细 cent 音高规划实现语义驱动切换,在 SCSBench-Mixed 上报告 0.871 客观与 0.810 主观切换 F1,代价是歌声数据电流音与真实纯隐式场景泛化仍受限。
语音合成 | 6.0/10
歌唱生成 | 5.5/10
语音合成 | 7.0/10
歌唱生成 | 6.1/10
歌唱生成 | 7.5/10
音乐生成 | 7.6/10
语音转换 | 6.0/10
音乐生成 | 7.4/10