论文解读

不做反演的音乐编辑:用分数蒸馏把改动留在数据空间

针对前向加噪加反向去噪带来的旋律失真问题,论文用增量去噪分数直接在数据空间优化音频,并用个性化增量分数加分布偏移正则与时序对比损失引入用户自定义风格,报告显示在内容保持与偏好率上占优,但强风格迁移与原曲保持之间仍需权衡。

 · 更新于 2026-09-25 · 约 18 分钟 · 9011 字 阅读 →
论文解读

似然能学会音符,对不上人心:音乐生成的偏好对齐怎么做

本文要解决似然训练抓不住主观音乐审美的问题,对比训练时 RLHF 与 DPO 和推理时树搜索三条路线,最强证据是约 300000 对偏好训练的 MusicRL 与 CLAP 提升 29.4% 的推理对齐,主要代价是数据不公开与推理延迟。

 · 更新于 2026-09-25 · 约 18 分钟 · 8602 字 阅读 →
论文解读

改音色不改骨架:Melodia 只替换自注意力查询与键来保住旋律

针对改乐器风格情绪时旋律节奏易丢失的问题,Melodia 在冻结的 AudioLDM 2 上做部分逆向并只替换 8 到 14 层自注意力图来保结构,探测分类与三数据集主客观实验支持其在文本贴合和结构保持间的平衡,但综合分依赖跨方法归一化且未报告延迟与误改成本。

 · 更新于 2026-09-25 · 约 19 分钟 · 9085 字 阅读 →
论文解读

视频回声成乐:以分层解析同时约束语义、时间与转场对拍

针对视频配乐中视频细节刻画不全与转场对拍不准的问题,VeM 用分层视频解析作指挥家组织多模态条件,以故事板引导交叉注意力和转场节拍对齐适配器生成波形音乐,在 TB-Match 上报告了语义与节奏指标的提升,但强转场对拍假设与评测阈值限制了其适用边界。

 · 更新于 2026-09-25 · 约 19 分钟 · 9446 字 阅读 →
论文解读

耳朵有了,还要给手表:用外部节拍网格锚定实时伴奏

针对严格因果实时伴奏中自回归节奏漂移问题,Silent Metronome 用与生成音频无关的外部节拍相位加速度拍子条件做逐帧锚定并辅以未来词元预测塑形表示,在 Slakh2100 上把 Beat-F 从 0.133 提升到 0.432 并超过 1 秒前视的非因果参照,代价是参数量增加与分布保真度的轻微回落。

 · 更新于 2026-09-25 · 约 17 分钟 · 8370 字 阅读 →
论文解读

记忆即变换:LETHE 用能量判别与随机扰动让混响参数自己走

LETHE 把 3×3 反馈延迟网络当作可被改写的房间,用五特征线性判别器对照初始声音 DNA、以单样本扰动更新十一个参数,45 组 180 秒对照显示只有生成器开启时 c22 才会演化,但稳定工作点偏离经典纳什均衡且扰动先验仍待剥离。

 · 更新于 2026-09-25 · 约 16 分钟 · 7985 字 阅读 →
论文解读

用 125k 探针在 VAE 潜空间里拨动音高:扩散音乐生成的可控性不在自回归独占

针对 Stable Audio Open 的 VAE 潜空间可解码音高类别这一可验证性质,论文用冻结的微型卷积探针在去噪后 40% 窗口内以 RMS 归一化梯度轻推潜变量,在 27 次配对试验中将旋律一致性从 0.112 提升至 0.274 且未报告音质代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8971 字 阅读 →
论文解读

集中改四秒不等于识别器给全曲:MIDI-SAG 和弦条件传播的配对校准

在固定音轨、种子、上下文与评分窗下,中央 4 秒三全音破坏比完整 CNN-CRF 回放引发更大的伴奏特征偏移,而同时匹配改变支撑与关系构成的合成画像最接近回放响应,但它只缩小条件响应距离,不代表音质提升。

 · 更新于 2026-09-25 · 约 16 分钟 · 7968 字 阅读 →
论文解读

先分好组再混音:为什么两阶段不是技巧,而是分工

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9703 字 阅读 →
论文解读

把拉格从玄学拉回有限状态:当重建变成约束 MAP 的精确动态规划

音乐理解 | 6.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10255 字 阅读 →
论文解读

把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉

音乐检索 | 7.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12385 字 阅读 →
论文解读

在噪声里听见和弦:一次卷积如何让田野录音带上调性色彩

音乐生成 | 5.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10057 字 阅读 →
论文解读

文字比原声更懂情绪:把生成音乐放进效价-唤醒坐标系来称重

音乐生成 | 6.0/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11830 字 阅读 →
论文解读

别再比谁更像人:当生成音乐的评价回到音乐人的工作台

音乐生成 | 7.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9673 字 阅读 →
论文解读

把混音师的耳朵写成奖励:SPHERE 如何让 3B 音频语言模型学会摆位

音乐生成 | 6.9/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12674 字 阅读 →
论文解读

当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令

音乐生成 | 7.1/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13132 字 阅读 →
论文解读

把截断搬进频域:用 sinc 重采样让振荡器同步不再混叠

音乐生成 | 7.9/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3105 字 阅读 →
论文解读

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

音乐生成 | 8.7/10

 · 更新于 2026-09-25 · 约 3 分钟 · 1221 字 阅读 →
论文解读

From local kernels to global form: modeling the emergence of musical content

音乐理解 | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5260 字 阅读 →
论文解读

One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7660 字 阅读 →