音乐幻觉不是一句话说错,而是五层感知逐层失守
论文把音乐幻觉定义为五层感知接地失败,用矛盾判定加三范式诊断九个模型,发现人声误听普遍而调性感知分化架构,两种免训练干预在辨别式探针有效却常不能迁移到自由生成。
论文把音乐幻觉定义为五层感知接地失败,用矛盾判定加三范式诊断九个模型,发现人声误听普遍而调性感知分化架构,两种免训练干预在辨别式探针有效却常不能迁移到自由生成。
针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。
Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。
论文复活 Etter 双向自回归插值,用前后向预测残差能量最小导出线性方程组求缺口样本,并给出短缺口高阶模型和因果丢包隐藏两种扩展,在 80 毫秒内音乐缺口上与多数基线相当但弱于逐缺口 Janssen 迭代法且外插简化版更快。
该研究用 9 支葫芦丝的 81 个平均音和 7 个心理声学特征训练自组织映射,报告只有频谱质心、锐度和分形关联维能形成音高聚类,其中高音 fa、sol、la 混沌度最低且亮度反直觉偏低,代价是低音区无稳定聚类且录音未公开。
该工作从社区采样标注中挖掘出 9.2 万条标注并揭示按边随机切分会使 54% 测试音轨泄漏,提出基于连通分量切分并修剪巨型分量得到 11.4 万/0.6 万/1 万音轨的 WhoSampled130k,代价是丢弃 23% 节点并保留有界泄漏风险。
针对和声乐器混合的逐帧合成参数估计易出现时间抖动的问题,该文用乐谱条件扩散模型学习参数轨迹分布并以多尺度频谱重构误差引导逆扩散,在木管与弦乐合奏上改善了响度与音色特征并保留可复述的实验条件。
该研究把参考音频加自然语言指令作为融合查询,用构造时就定义好的七种风格歌词旋律音色关系诊断表示的默认偏好,最强证据是五类模型在七个任务上最高点估计互相反转且声学编码器与文本对齐编码器互补,而轻量文本条件融合未能一致提升主干。
针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。
该研究把 1046 个手工段落与 0.5 秒步长的模型估计效价-唤醒轨迹对齐,显示段落差异主要在唤醒度上且高唤醒位置偏向后段,但进入副歌路径多样、重复段落并不回到初始水平,代价是情绪轨迹来自冻结教师模型而非人工连续标注。
论文把生成与编辑看作稀疏到稠密的条件谱,用同一潜在流匹配模型在生成分支与重建分支间随机切换训练,以词级音素对齐、节拍条件和变分自编码器表征对齐提升可懂度,并用残差瓶颈容量换取重建保真度与可编辑性,最强证据是分离人声词错误率做到 0.133 但感知质量仍落后于偏好优化基线。
StepAudio 3 Music 针对完整歌曲的长程结构与高保真渲染矛盾,采用 50 赫兹 65536 表项单码本离散表示加混合专家自回归组织音乐序列再由流匹配扩散渲染 48 千赫音频,并以 ABC 记谱作显式编曲计划,在 339 条歌词到歌曲与 316 条人声条件上取得内容享受 7.7086 与文本相似 0.4465 的最高均值,代价是自回归序列翻倍与符 …
针对逐轮改歌时单轮编辑器记不住上文的问题,AURA 用多模态大模型把完整对话蒸馏成 9 个概念令牌并以帧对齐方式注入冻结的 MusicGen,在 Slakh 与 MoisesDB 上以 0.78 对 0.37 的 SSIM 和 +11.32 dB 的 SI-SDR 改善保持性,代价是抽取类任务仍弱于专用分离模型。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该研究以 391 首多轨录音为对象,用起音时间差与 Mel 谱相似度推断是否同室录音,报告有串音歌曲的时值波动中位数更低,但串音只是同室的非充分不必要指示且存在混淆。
ScorePrompts 针对用自然语言探索 MusicXML 乐谱结构的问题,选择先用固定 MIR 组件栈构造音符、拍、小节、乐曲四级对齐表示再做受约束语言生成与确定性问答, demo 贯穿单谱四阶段流程,代价是只面向机器可读西方调性乐谱且未验证生成句与证据的语义忠实性与音乐学正确性。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该报告研究如何在作曲家可控与实时可演之间组织计算音乐流程,以分析—规划—实现分层、数据驱动合成与前向预测节拍为方法选择,以乐团读谱与现场演出等实际呈现为证据,代价是未报告受控定量比较与可运行系统的完整参数。
论文以 1978-1979 年为 Lydia Kavina 制作的最后一台 Terpsitone 为对象,用实测建模的三维体、范德波尔振荡器差拍的声音引擎和头手质心映射的交互链做可演奏的虚拟现实孪生,历史考证显示至少四代形态而音量映射始终多变,当前原型已能走通动作到声音但精度与稳定性仍待验证。