论文解读

伪标签不可靠时,如何用左右可靠笔触给不确定片段加权

针对序列级塔布拉鼓点转录标注稀缺问题,该工作用教师模型生成伪标签、S-CEM 估计每个鼓点可信度、CMW-ATC 在不确定片段上按马尔可夫转移加权候选序列,在三组评测上把序列错误率降到 18.3、33.3 和 12.7,但仍需序列级标注和固定转移矩阵。

 · 更新于 2026-09-24 · 约 19 分钟 · 9066 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

对齐很粗时更要扣准起音:把 Snapping 做成按音高的全局分配

针对乐谱与真实录音只有粗对齐时标注不够准的问题,该文把逐音符的起音修正做成按音高独立的二分图匹配,并在 MusicNet 训练、多数据集测试中报告了对贪心修正的一致提升,代价是窗口越大越依赖后验质量与一对一约束是否成立。

 · 更新于 2026-09-24 · 约 18 分钟 · 8558 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

吉他没有力度真值时,如何让转录模型学会力度又不丢掉音高精度

针对吉他缺乏力度标注的问题,该工作用虚拟乐器渲染带力度标签的合成数据先学力度曲线,再把冻结的力度子模块拼到在真实录音上训练的音高转录模型中,合成集上平均绝对误差从约 32 降到约 7 但跨音色误差增大,而在 GuitarSet 与 EGDB 上的音符转录 F 值只提升约 0.1 个百分点。

 · 更新于 2026-09-24 · 约 17 分钟 · 8207 字 阅读 →
论文解读

从波形到可弹指法:TART 如何把音高、技巧与弦品分四步拼成谱

TART 把吉他音频转谱拆成音频转 MIDI、九类技巧分类、音频条件弦品指派和 MusicXML 生成四步,用 81.35% 的平均音频转 MIDI F50 与 71.8% 的弦品 Tab F1 实现零样本领先,代价是第一步误差会向后传播约 17.75 个百分点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9037 字 阅读 →
论文解读

多深度谐波卷积如何让乐器无关转录在小参数下仍保持高帧精度

针对单乐器身份未知的乐器无关转录,Harmonica 以 CQT 输入与多深度谐波卷积在多源温度采样训练下实现 26.3K 至 15.1M 的规模化,x-large 在多数测试集上取得最高帧 F1,medium 以 848.5 倍实时保持可比精度,nano 以 1622.5 倍实时仍显著超过同量级基线。

 · 更新于 2026-09-24 · 约 21 分钟 · 10282 字 阅读 →
论文解读

不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer

音乐转录 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11036 字 阅读 →
论文解读

同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹

音乐转录 | 8.2/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11909 字 阅读 →
论文解读

只给顺序不给时间:用会遗忘的节奏记忆补上塔布拉转录的弱监督缺口

音乐转录 | 6.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11985 字 阅读 →
论文解读

Automatic Transcription of Microtonal Free-Rhythm Vocal Music: A Case Study in Iranian Classical Music

音乐转录 | 7.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3026 字 阅读 →
论文解读

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

音乐转录 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5987 字 阅读 →
论文解读

A Dual Evaluation for Music Transcription

音乐转录 | 7.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8387 字 阅读 →
论文解读

Multi-Task Multi-Frame Visual Piano Transcription

音乐转录 | 8.8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6451 字 阅读 →
论文解读

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

音乐转录 | 6.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5561 字 阅读 →
论文解读

Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

音乐转录 | 6.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5320 字 阅读 →
论文解读

Music-JEPA: Learning a World Model of Sound from Action

音乐转录 | 6.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6393 字 阅读 →
论文解读

Fretiq: Browser-Native Electric Guitar String Classification via Engineered Spectral Features and Held-Out Free-Play Evaluation

音频分类 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5587 字 阅读 →
论文解读

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

音乐转录 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6381 字 阅读 →
论文解读

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

音乐转录 | 6.6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7041 字 阅读 →