跑调的人声如何借伴奏找回调:MIDIBack 的联合符号建模
MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。
MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。
针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究把演出中实时声音做音高检测并每轮生成 12 度动态音阶去重调键盘、合成与房间反馈,其最强证据是两年现场与房间反馈系统的可演奏性,代价是调音映射不稳定且无定量听感或稳定性评估。
该文把线性链条件随机场中的硬维特比解码换成温度控制的软最大值近似得到可微模块 dCRF,并在双声部干扰下的音高类别估计中显示 Toeplitz 约束的 dCRF-T 接近双向长短期记忆网络精度但参数少得多,而全参数 dCRF 提升有限。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对半监督歌声旋律提取中频域增强敏感与一致性正则化丢弃约半数无标注数据的问题,论文提出分频带扩散增强、全局-类别置信筛选与通道交叉注意力三模块组合,在 ADC2004 等四套测试上相对 MCSSME 的 OA 提升 0.9% 至 7.7%,代价是引入扩散迭代与记忆库等额外结构与调参面。