论文解读

复刻缺全流程代码的乐器分离模型:性能差距与能量代价从何而来

该文复刻频带切分循环网络用于人声贝斯鼓与其他四轨分离,在公开数据集上补齐预处理与训练细节并对比多种设计,结果显示大模型与替代增强可缩小与原报告的差距,但耐心延长与全项目试错带来数十倍于单次训练的能量开销。

 · 更新于 2026-09-24 · 约 23 分钟 · 11196 字 阅读 →
论文解读

混合不分离直接估计合成参数:扩散先验如何压住时间抖动

针对和声乐器混合的逐帧合成参数估计易出现时间抖动的问题,该文用乐谱条件扩散模型学习参数轨迹分布并以多尺度频谱重构误差引导逆扩散,在木管与弦乐合奏上改善了响度与音色特征并保留可复述的实验条件。

 · 更新于 2026-09-24 · 约 24 分钟 · 11741 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

没有总谱时如何度量对话:Paredes 人声—吉他合作的共性与偏离分析

针对无记谱口传合作录音,该研究用音源分离加拍级描述符刻画人声与吉他互动,以多尺度相关找共性、以稳健回归残差找偏离,在 8 首合作录音上显示组织以曲目特异为主而偏离多对齐段落边界,代价是依赖专家拍与结构标注且受分离质量限制。

 · 更新于 2026-09-24 · 约 24 分钟 · 11801 字 阅读 →
论文解读

装得进低功耗音频芯片的实时音乐分离:预算先行,深滤波补精度

针对嵌入式音频芯片同时卡住内存与单帧算力的问题,该研究用因果声谱分离主干加门控深滤波实现可部署分离,在芯片实测单帧 10.43 ms 内达到 4.70 dB cSDR,代价是比装不进芯片的最强基线低约 0.5 至 0.7 dB 且连续上下文训练不可省略。

 · 更新于 2026-09-24 · 约 21 分钟 · 10127 字 阅读 →
论文解读

先抹掉再贴上:用颤音匹配把齐奏混音藏成一个声源

该文研究齐奏混音中不同颤音模式暴露多声源的问题,提出先抑制目标颤音再从源信号迁移频率调制与分谐波幅度调制加残差谱包络调制的方法,以声谱图示例和同命运变换分离失效为证据,代价是尚无听音实验与客观分离指标量化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8865 字 阅读 →
论文解读

不用调音台,只看参考录音:笔记本如何告诉吉他手该调大还是调小

针对没有调音师的小场地演出调音问题,SoLAR 用参考录音学理想混音并给出吉他音量建议,仿真显示硬编码策略能把增益误差收敛到参考附近,代价是仅验证了吉他音量且现场只做了两人试用。

 · 更新于 2026-09-24 · 约 20 分钟 · 9640 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

近场麦克风串音:用输入通道随机置换逼模型学空间关系

针对小型弦乐重奏近场麦克风串音问题,论文把去串音做成 P 进 P 出的多通道分离,并在训练时对输入与目标施加同一随机置换以强制通道置换等变,在未见房间布局和真实 URMP 录音上提升 SDR,但低频与未见乐器上的增益仍然有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8178 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把拾音位置选择推迟到混音阶段:64 通道分弦多点吉他拾音系统

针对传统电吉他拾音位置在演奏时固定且混弦输出的问题,PolyMap 用 8 弦×8 位置共 64 个有源拾音胶囊在琴内数字化并经 MADI 输出,在 32 采样缓冲与 48 千赫兹条件下测得端到端 259 采样即 5.4 毫秒延迟,代价是拾音器主导的负 73 至负 67 分贝全刻度噪声与复杂的 64 通道后期混音负担。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
论文解读

把主唱和和声分开:VocalRep 用角色一致性重做人声表示

针对双轨分离把主唱与和声混为一轨导致的下游含混问题,VocalRep 用全局身份条件加排序约束做三轨分离,在保持可比分离分的同时以更干净的主唱提升歌声转换可懂度与音高稳定性和唇同步精度,代价是求和比较时累积误差与多人主唱假设受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8832 字 阅读 →
论文解读

混合一致性约束下为何需要多输入多输出的迭代精炼

针对混合一致性要求下单步回归难以迭代纠错的问题,论文将任意分离模型扩展为多输入多输出并配合投影与递增加权损失实现多轮互精炼,在 MUSDB18-HQ 上以 BS-RoFormer 与 SCNet 为骨干取得一致提升,但判别器与生成式扰动的收益依赖配置且迭代带来线性计算开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9669 字 阅读 →
论文解读

当所有声部都是人声:用主唱音素对齐区分主唱与伴唱的分离路径

针对六声部无伴奏合唱中主唱与伴唱音色高度相似、时域重叠的分离难题,论文在 BS-RoFormer 主干中以帧级主唱音素对齐经 FiLM 逐层调制中间表示,并在 jaCappella 上以理想对齐条件验证其对 Vo 与 Other 两路 SI-SDRi 的提升及随音素重叠度变化的增益边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9708 字 阅读 →
论文解读

SDR 相同的鼓声,听感位置却不同:分离模型如何重塑攻击与动态

论文用 50 首带真分轨的歌曲检验 4 代分离模型,显示 onset 位置随 SDR 变好而变准,但攻击斜率与动态包络的失真与 SDR 几乎无关,且固定片段的渲染会随输入长度漂移。

 · 更新于 2026-09-24 · 约 18 分钟 · 8813 字 阅读 →
论文解读

什么在挑选、什么在重建:当变形类能插值时选择为何失效

论文证明若变形类参数多于观测则残差选型只排正则项,据此把挑选限制为每原子一个复增益加纯时延、重建改用对齐原子的局部联合最小二乘,在 MUSDB18 上把准则与池内神谕的距离从 6.2–7.7 dB 压到 0.5–2.8 dB 但仅 0.9–1.2 dB 落到输出,并量化剩余 10.0 dB 锁来自对混合而非对目标的打分。

 · 更新于 2026-09-24 · 约 22 分钟 · 10720 字 阅读 →
论文解读

实增益掩蔽的天花板是投影,离开直线却赢不回平方误差

论文刻画单通道时频实增益掩蔽的正交投影上限,并用一个高斯混合后验均值估计器研究先验、读出与相位对称性:长窗留出设置下估计器距实测类上界 11.44 dB,校准分析中的约 70% 是分贝缺口之比,不是全部缺口或误差能量都由后验方差解释,更不是所有生成分离器的性能上限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8687 字 阅读 →
论文解读

在一条潜流里同时生成两条音轨:解耦语义与声学后的少步分离

音乐源分离 | 5.3/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11167 字 阅读 →