论文解读

音乐幻觉不是一句话说错,而是五层感知逐层失守

论文把音乐幻觉定义为五层感知接地失败,用矛盾判定加三范式诊断九个模型,发现人声误听普遍而调性感知分化架构,两种免训练干预在辨别式探针有效却常不能迁移到自由生成。

 · 更新于 2026-09-24 · 约 22 分钟 · 11010 字 阅读 →
论文解读

连续自回归做钢琴渲染:全局作曲、局部演奏与全序列精修如何分工

针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8939 字 阅读 →
论文解读

从一个人跳到一屋人跳:Encypher 把集体律动写成音乐提示

Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。

 · 更新于 2026-09-24 · 约 18 分钟 · 8986 字 阅读 →
论文解读

缺口比模型阶数还短时,Etter 的双向自回归插值还能解吗

论文复活 Etter 双向自回归插值,用前后向预测残差能量最小导出线性方程组求缺口样本,并给出短缺口高阶模型和因果丢包隐藏两种扩展,在 80 毫秒内音乐缺口上与多数基线相当但弱于逐缺口 Janssen 迭代法且外插简化版更快。

 · 更新于 2026-09-24 · 约 18 分钟 · 8983 字 阅读 →
论文解读

葫芦丝高音为何更暗更不混乱:亮度、锐度与分形维度的聚类证据

该研究用 9 支葫芦丝的 81 个平均音和 7 个心理声学特征训练自组织映射,报告只有频谱质心、锐度和分形关联维能形成音高聚类,其中高音 fa、sol、la 混沌度最低且亮度反直觉偏低,代价是低音区无稳定聚类且录音未公开。

 · 更新于 2026-09-24 · 约 21 分钟 · 10057 字 阅读 →
论文解读

采样标注连成巨网时,按边切分为何必然泄漏

该工作从社区采样标注中挖掘出 9.2 万条标注并揭示按边随机切分会使 54% 测试音轨泄漏,提出基于连通分量切分并修剪巨型分量得到 11.4 万/0.6 万/1 万音轨的 WhoSampled130k,代价是丢弃 23% 节点并保留有界泄漏风险。

 · 更新于 2026-09-24 · 约 16 分钟 · 7623 字 阅读 →
论文解读

混合不分离直接估计合成参数:扩散先验如何压住时间抖动

针对和声乐器混合的逐帧合成参数估计易出现时间抖动的问题,该文用乐谱条件扩散模型学习参数轨迹分布并以多尺度频谱重构误差引导逆扩散,在木管与弦乐合奏上改善了响度与音色特征并保留可复述的实验条件。

 · 更新于 2026-09-24 · 约 24 分钟 · 11741 字 阅读 →
论文解读

同一首歌,不同找法:用指令把音乐检索的七种关系拆开诊断

该研究把参考音频加自然语言指令作为融合查询,用构造时就定义好的七种风格歌词旋律音色关系诊断表示的默认偏好,最强证据是五类模型在七个任务上最高点估计互相反转且声学编码器与文本对齐编码器互补,而轻量文本条件融合未能一致提升主干。

 · 更新于 2026-09-24 · 约 19 分钟 · 9047 字 阅读 →
论文解读

不存更多指纹,只在查询时多算一步:POLARIS 的显著性地标与查询侧扩展

针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9405 字 阅读 →
论文解读

段落是功能语境而非情绪模板:100 首中文流行歌的局部循环与全局累积

该研究把 1046 个手工段落与 0.5 秒步长的模型估计效价-唤醒轨迹对齐,显示段落差异主要在唤醒度上且高唤醒位置偏向后段,但进入副歌路径多样、重复段落并不回到初始水平,代价是情绪轨迹来自冻结教师模型而非人工连续标注。

 · 更新于 2026-09-24 · 约 19 分钟 · 9218 字 阅读 →
论文解读

以重建代替配对:SongCraft 用条件密度统一歌曲生成与细粒度编辑

论文把生成与编辑看作稀疏到稠密的条件谱,用同一潜在流匹配模型在生成分支与重建分支间随机切换训练,以词级音素对齐、节拍条件和变分自编码器表征对齐提升可懂度,并用残差瓶颈容量换取重建保真度与可编辑性,最强证据是分离人声词错误率做到 0.133 但感知质量仍落后于偏好优化基线。

 · 更新于 2026-09-24 · 约 23 分钟 · 11229 字 阅读 →
论文解读

先规划后演奏:StepAudio 3 Music 用单码本与 ABC 计划平衡长曲连贯与音质

StepAudio 3 Music 针对完整歌曲的长程结构与高保真渲染矛盾,采用 50 赫兹 65536 表项单码本离散表示加混合专家自回归组织音乐序列再由流匹配扩散渲染 48 千赫音频,并以 ABC 记谱作显式编曲计划,在 339 条歌词到歌曲与 316 条人声条件上取得内容享受 7.7086 与文本相似 0.4465 的最高均值,代价是自回归序列翻倍与符 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10836 字 阅读 →
论文解读

把多轮对话压缩成概念令牌,再用帧对齐参考流守住不改的部分

针对逐轮改歌时单轮编辑器记不住上文的问题,AURA 用多模态大模型把完整对话蒸馏成 9 个概念令牌并以帧对齐方式注入冻结的 MusicGen,在 Slakh 与 MoisesDB 上以 0.78 对 0.37 的 SSIM 和 +11.32 dB 的 SI-SDR 改善保持性,代价是抽取类任务仍弱于专用分离模型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8319 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

同室共奏更齐吗:用串音痕迹反推录音方式对合奏时值稳定性的影响

该研究以 391 首多轨录音为对象,用起音时间差与 Mel 谱相似度推断是否同室录音,报告有串音歌曲的时值波动中位数更低,但串音只是同室的非充分不必要指示且存在混淆。

 · 更新于 2026-09-24 · 约 23 分钟 · 11343 字 阅读 →
论文解读

先分析再说话:ScorePrompts 把乐谱解读固定在可检查的证据上

ScorePrompts 针对用自然语言探索 MusicXML 乐谱结构的问题,选择先用固定 MIR 组件栈构造音符、拍、小节、乐曲四级对齐表示再做受约束语言生成与确定性问答, demo 贯穿单谱四阶段流程,代价是只面向机器可读西方调性乐谱且未验证生成句与证据的语义忠实性与音乐学正确性。

 · 更新于 2026-09-24 · 约 18 分钟 · 8901 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

作曲家主导与实时约束之间:中心 2025-2026 四个系统的分工与可复述流程

该报告研究如何在作曲家可控与实时可演之间组织计算音乐流程,以分析—规划—实现分层、数据驱动合成与前向预测节拍为方法选择,以乐团读谱与现场演出等实际呈现为证据,代价是未报告受控定量比较与可运行系统的完整参数。

 · 更新于 2026-09-24 · 约 20 分钟 · 9548 字 阅读 →
论文解读

为全身舞蹈保留发声逻辑:1978 年 Terpsitone 的交互式数字孪生

论文以 1978-1979 年为 Lydia Kavina 制作的最后一台 Terpsitone 为对象,用实测建模的三维体、范德波尔振荡器差拍的声音引擎和头手质心映射的交互链做可演奏的虚拟现实孪生,历史考证显示至少四代形态而音量映射始终多变,当前原型已能走通动作到声音但精度与稳定性仍待验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10467 字 阅读 →