论文解读

修音准节奏又不换嗓:整流流如何把遮罩补全做成风格保持的美化

针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。

 · 约 17 分钟 · 8144 字 阅读 →
论文解读

以重建代替配对:SongCraft 用条件密度统一歌曲生成与细粒度编辑

论文把生成与编辑看作稀疏到稠密的条件谱,用同一潜在流匹配模型在生成分支与重建分支间随机切换训练,以词级音素对齐、节拍条件和变分自编码器表征对齐提升可懂度,并用残差瓶颈容量换取重建保真度与可编辑性,最强证据是分离人声词错误率做到 0.133 但感知质量仍落后于偏好优化基线。

 · 更新于 2026-09-24 · 约 23 分钟 · 11229 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

双声泛音靠声道形状算出来:可微波导怎样复制 sygyt

论文把 sygyt 双声复制写成从录音反推声道形状的可微优化问题,用带舌下第二声源和 B 样条声道的 Kelly-Lochbaum 波导在 20 段录音上把对数谱距离相对基线降低 30-38%,代价是每段仍需约 30 分钟离线优化且绝对误差仍在 9 分贝量级。

 · 更新于 2026-09-24 · 约 17 分钟 · 8472 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

SegTune:把歌曲控制从整首描述下沉到分段时间窗

针对全局提示无法刻画配器情绪能量随段落演变的问题,SegTune 用全局加分段层级条件与大模型句级时长预测做非自回归扩散生成,在 15 首中文流行歌测试中把音素错误率降到 14.5% 并把音乐性主观分做到 4.57,代价是偏好优化后性别年龄跟随出现下滑。

 · 更新于 2026-09-24 · 约 19 分钟 · 9487 字 阅读 →
论文解读

无标签也要会切歌:UniVocal 用语义推断驱动说唱切换

UniVocal 把同一话语内说话与唱歌自动切换定义为 SCS 合成,用 CosyVoice 2 加两阶段课程学习与精细 cent 音高规划实现语义驱动切换,在 SCSBench-Mixed 上报告 0.871 客观与 0.810 主观切换 F1,代价是歌声数据电流音与真实纯隐式场景泛化仍受限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9094 字 阅读 →
论文解读

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

语音合成 | 6.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6735 字 阅读 →
论文解读

Beyond Call and Response: Modelling Reciprocal Coordination in Human-AI Vocal Ensembles

歌唱生成 | 5.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5433 字 阅读 →
论文解读

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7896 字 阅读 →
论文解读

MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

歌唱生成 | 6.1/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6210 字 阅读 →
论文解读

VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

歌唱生成 | 7.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7140 字 阅读 →
论文解读

WanSong v1.0 Technical Report

音乐生成 | 7.6/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6596 字 阅读 →
论文解读

Adapting a Diffusion-Based Music Synthesis Model to Human Voice Conversion

语音转换 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8922 字 阅读 →
论文解读

Qwen-Music Technical Report

音乐生成 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7232 字 阅读 →