先想明白再开口:用数据清洗、蒸馏与偏好对齐修好上下文语音合成
针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。
针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
针对乐谱与真实录音只有粗对齐时标注不够准的问题,该文把逐音符的起音修正做成按音高独立的二分图匹配,并在 MusicNet 训练、多数据集测试中报告了对贪心修正的一致提升,代价是窗口越大越依赖后验质量与一对一约束是否成立。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对 F0 可控声码器在大规模多说话人训练和噪声下是否仍可控的问题,论文用概率潜变量替代确定性特征并以重合成谱误差做数据筛选,报告显示筛选能阻止错误数据拖累训练、上移 F0 时清浊判断更准而下移与高频区仍有挑战、噪声下优于基线,但筛选阈值仍需人工设定。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文把播放会话当句子训练跳元向量并用艺术家质心相减剥离歌手身份,以原始均值 0.2487 降至残差均值 0.0005 后仍有 4577 对跨歌手高相似为存在性证据,但自动播放混杂与重度用户偏差使结论止于信号存在而不及推荐性能。
论文把自然语言质检需求编译为依赖感知的有向无环工作流并调用 24 个音频与文本核查工具,在专家一致率 80-90% 的条件下把人工成本时间压到 20% 以下,代价是规划器选型与幻觉和运行时的权衡。
论文把 Instruct-TTS 训练不稳归因于标签转指令中超过 40% 的语义漂移,用可控改写扩大覆盖、用大模型校验过滤保真、再用音高语速音量扰动补齐韵律监督,在中文评测上把平均指令遵循率做到 56.4%,代价是组合过滤只保留约 61.5% 候选。
语音交互 | 9.7/10
音视频语音分离 | 6.8/10
语音识别 | 6.5/10
音频理解 | 6.1/10
语音识别 | 7.2/10
基准测试 | 7.7/10
音频分离 | 9.2/10
语音合成 | 5.2/10
语音识别 | 7/10
数据清洗 | 5.5/10
多模态模型评估 | 5.5/10