ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
针对多乐器混合中只改部分音符又要保留其余音色与 concurrent 内容的问题,该文用冻结 HeartCodec 的标量量化潜变量做流匹配生成,用 MIDI Span 把帧内时刻保留为连续属性并做置换不变池化,最强证据是转录与重建误差分解显示量化只带来约 0.45 个百分点损失而转录本身带来 21.60 个百分点损失,主要代价是对 1-5 ms 微小起音偏 …
论文用线性硬弦偏微分方程加三角拨弦初值约束多层感知机做正演,在第一振动周期内与有限差分和断线实验做对照,随机傅里叶特征尺度越大高频细节越好,但评估只限首周期且存在幅值偏差。
针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。
Encypher 研究陌生人如何一起跳舞并共同引导实时神经音频,用 11 人课堂研究显示协作感达 81.8% 认同而个人控制感仅 63.6%,代价是 2 秒生成延迟和屏幕分散注意力的双刃效应。
针对文本到音乐系统条件格式与访问方式不同难以直接比较的问题,TTM-Bench 用共享音乐规格加系统适配表达分别度量音乐内容对齐与计算效率,案例研究显示内容对齐更高并不系统性对应更低的计算需求。
论文用隐式求解的有限差分弓弦模型复现亥姆霍兹运动并修正最小弓压定律为一次方依赖,再以等容量的门控循环控制器在扰动下领先前馈控制器,但证明其稳态调节不超过查表教师,只在教师失效处反超。
StepAudio 3 Music 针对完整歌曲的长程结构与高保真渲染矛盾,采用 50 赫兹 65536 表项单码本离散表示加混合专家自回归组织音乐序列再由流匹配扩散渲染 48 千赫音频,并以 ABC 记谱作显式编曲计划,在 339 条歌词到歌曲与 316 条人声条件上取得内容享受 7.7086 与文本相似 0.4465 的最高均值,代价是自回归序列翻倍与符 …
针对逐轮改歌时单轮编辑器记不住上文的问题,AURA 用多模态大模型把完整对话蒸馏成 9 个概念令牌并以帧对齐方式注入冻结的 MusicGen,在 Slakh 与 MoisesDB 上以 0.78 对 0.37 的 SSIM 和 +11.32 dB 的 SI-SDR 改善保持性,代价是抽取类任务仍弱于专用分离模型。
该文以在 Max、gen~ 与 RNBO 中逐步建造现场循环器为教学方法,让学生在录音播放、叠加与去咔哒声等真实音乐任务中学习缓冲与时序,课堂观察显示参与度和迁移能力提升,但 gen~ 与 RNBO 的转换仍受单学期时间与代码畏难情绪限制。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
该报告研究如何在作曲家可控与实时可演之间组织计算音乐流程,以分析—规划—实现分层、数据驱动合成与前向预测节拍为方法选择,以乐团读谱与现场演出等实际呈现为证据,代价是未报告受控定量比较与可运行系统的完整参数。
针对临时拼凑的多智能体与单体黑盒难复用难实时的问题,论文用类型化共享黑板加需要与提供声明实现自动拓扑调度,并在纯 Python 加原生库加速的路线下给出模块化可增量扩展的工程方案,代价是暂无定量性能评测与图形化工具仍在开发中。
针对端到端生成把创作压缩到提示词层的问题,该文选择对神经音频编解码器的量化音频潜嵌入做带时变系数的加权求和感知 morphing,用作品《龢》三阶段与五种编解码器对照验证可行性,代价是解码器鲁棒性与实时性等条件仍未被系统测量。
该文把皮肤电、动作与面部表情当作可演奏的音乐材料,用 Python 中间件加 Pure Data 两阶段映射在键盘实践中检验,报告称离散受限映射更清晰、高层和声触发更连贯,代价是即时性下降与系统复杂、学习曲线陡峭。
针对管乐谱到音频缺少可控可复现数据的问题,论文用 311 首四部圣咏的 MEI 编码加规则表情模型加物理建模合成构建对齐的多轨数据,最强证据是 86 小时隔离音轨与 640000 种组合的完全对齐标注,代价是合成音色不及真实录音且不追求数据驱动最优音质。
针对舞蹈线索稀疏而作曲需要稠密结构的问题,CMA-OT 用 Jukebox 多尺度专家对 DiT 隐表示做由粗到细的课程对齐与尺度自适应 FGW 软对齐,并以流匹配生成损失联合训练,在 AIST++ 与 TikTok 上报告了节奏与质量提升,代价是训练侧引入多尺度 OT 与课程调度。
论文以七年四版 Bot Party 为线索,研究残障设计认识论如何把玩家间皮肤接触变成可检测、可奖励的核心机制,最强证据是触觉失效时参与迅速坍缩与触觉恢复后群体玩法的回升,代价是单设计师自述民族志与展览数据的可比性与泛化边界受限。
论文要解决肌电信号不可听不可判导致的生成模型难调试问题,选择先用含音频的七通道数据找架构再转六通道肌电的策略加两个残差向量量化变分自编码器与交叉注意力解码器 Transformer,最强证据是七通道实验中成功配置重建多样性恢复而过大隐维度配置坍缩,代价是六秒序列限制与推理仍需音频起始符。
该文用离线描述符分析加四种可堆叠查询在 Max/MSP 里动态形成空间化声音组,并以四组共用 150 个声源的固定媒体作品验证流程,其代价是离线分析耗时、堆叠与动态查询受限和空间化带来的 CPU 压力。