jep-2026 论文深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该研究以保留原说话人听感为前提替换语音中的敏感词,对比直接波形剪贴与经神经编解码器重建的插入路径以及克隆嗓音与合成语境的选择,用自然度、可懂度和信号质量自动指标报告编解码器路径更优,其中自然度倾向于带原句嵌入的编解码器与克隆嗓音,而信号质量倾向于通用嗓音与孤立词合成。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对带环境噪声的插入与替换编辑问题,SeamlessEdit 选择先用分离模型分出人声与噪声、再用稀疏贝叶斯与滤波压残留噪声并做语境精修,在 EARS-WHAM 上把插入自然度做到 3.78 而基线 VoiceCraft 仅 2.93,代价是仍需依赖现成分离与编辑模型且对女声高频与重叠说话人保留残留问题。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对零样本语音合成中误读、可听噪声与异常停顿导致的不稳定问题,论文用能同时输出错误时间范围、转写文本与整句质量分的 Vox-Evaluator 做局部遮罩重改与细粒度偏好优化,在 Seed-TTS 上把 F5-TTS 的字错率从 1.73% 降到 1.42%,代价是最多两轮迭代改写与偏好训练过久后奖励饱和回落。
AuK 用自然语言指令加可选音频统一五类语音任务,以多模态大语言模型语义条件、联合训练的音频变分自编码器声学潜变量和混合整流流 Transformer 为核心,在约 3.03 billion 指令音频实例与 1.95 million 小时监督上经生成预热、联合预训练、编辑偏好优化与生成强化学习取得零样本与指令合成及通用编辑的领先结果,并以 4 步无分类器自由 …
音频理解 | 8.7/10
语音合成 | 9.0/10
语音合成 | 6.8/10
语音编辑 | 7.3/10
语音编辑 | 7.4/10
语音合成 | 7.3/10
语音转换 | 8/10
语音编辑 | 7.5/10
语音编辑 | 8.7/10
语音编辑 | 7.2/10
语音合成 | 8/10
语音编辑 | 8.6/10
语音编辑 | 6.5/10