论文解读

跑调的人声如何借伴奏找回调:MIDIBack 的联合符号建模

MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。

 · 约 17 分钟 · 8452 字 阅读 →
论文解读

参数减三成而精度不掉:低秩频率卷积把噪声范围调对再谈边缘实时

针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9110 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

扎根又漂移:用实时检出的潜在音阶重调混合演出生态

该研究把演出中实时声音做音高检测并每轮生成 12 度动态音阶去重调键盘、合成与房间反馈,其最强证据是两年现场与房间反馈系统的可演奏性,代价是调音映射不稳定且无定量听感或稳定性评估。

 · 更新于 2026-09-24 · 约 22 分钟 · 10641 字 阅读 →
论文解读

把不可微的维特比变成可微模块:线性链条件随机场如何嵌入端到端流程

该文把线性链条件随机场中的硬维特比解码换成温度控制的软最大值近似得到可微模块 dCRF,并在双声部干扰下的音高类别估计中显示 Toeplitz 约束的 dCRF-T 接近双向长短期记忆网络精度但参数少得多,而全参数 dCRF 提升有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8360 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

无标注数据用不满:用分频带扩散扰动与全局-类别置信留住更多样本

针对半监督歌声旋律提取中频域增强敏感与一致性正则化丢弃约半数无标注数据的问题,论文提出分频带扩散增强、全局-类别置信筛选与通道交叉注意力三模块组合,在 ADC2004 等四套测试上相对 MCSSME 的 OA 提升 0.9% 至 7.7%,代价是引入扩散迭代与记忆库等额外结构与调参面。

 · 更新于 2026-09-24 · 约 21 分钟 · 10192 字 阅读 →