混合音乐里谁是合成的:用合成概率图加能量掩码定位目标声部
针对人声与合成声部混合后全局检测失效的问题,该工作用分频段局部检测构成合成概率图再与目标声部能量掩码联合判断单个声部真伪,在人声鼓组吉他上表现较强而在贝斯上受限于分离质量。
针对人声与合成声部混合后全局检测失效的问题,该工作用分频段局部检测构成合成概率图再与目标声部能量掩码联合判断单个声部真伪,在人声鼓组吉他上表现较强而在贝斯上受限于分离质量。
针对语音模型泛化不到环境音、频谱模型保不住语音时序的问题,JASPER 在共享 Transformer 上联合预测时域伪标签与频域块标签,原文报告 2000 小时下平均准确率 81.74% 与 XARES-LLM 两轨 0.66 和 0.50 的领先均值,但频谱权重极偏向 0.01 且推理仍只用波形输入。
针对多人演唱与密集伴奏下的目标歌声分离,MambaVoice 用对数分频音频编码加面部动作门控做条件,再以先 Mamba 后 Transformer 的混合主干建模,报告在 Acappella 未见未闻测试上以 16.2M 参数取得 14.18 dB SDR,并在 URSing 跨域与推理耗时上给出对照,代价是强干扰下仍略低于 VoViT 基线且主观评测样本 …
MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。
该文在 Lyra 舞蹈子集上用音频、视频、骨架三模态做 28 标签自动打标,报告最强三模态门控融合宏 ROC-AUC 为 0.864,超过最强音频单模态 0.821,但骨架单模态仅 0.586 且约半数片段缺有效姿态。
针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。
该文把 AI 音乐检测当作评估治理问题,用内容摘要与血缘分组冻结 828 轨主队列并分离校准与密封测试,在 562 轨四模型公共成功交集上报告 ArtifactNet 以 0.982 AUROC 领先但 Udio 补充集回落至 0.650,而聚合 F1 掩盖的生成器与真音乐域偏移与缺失覆盖决定了排名是否可比。
针对多乐器混合中只改部分音符又要保留其余音色与 concurrent 内容的问题,该文用冻结 HeartCodec 的标量量化潜变量做流匹配生成,用 MIDI Span 把帧内时刻保留为连续属性并做置换不变池化,最强证据是转录与重建误差分解显示量化只带来约 0.45 个百分点损失而转录本身带来 21.60 个百分点损失,主要代价是对 1-5 ms 微小起音偏 …
针对多约束联合满足急剧下降的问题,论文用八族程序化验证器构造基准并以硬门加分级奖励做 GRPO,把 Qwen3-4B 在 Mixed 上的全满足率从 0.160 提升到 0.807,代价是奖励与评测共用同一套验证器且只度量合规不度量听感。
该文复刻频带切分循环网络用于人声贝斯鼓与其他四轨分离,在公开数据集上补齐预处理与训练细节并对比多种设计,结果显示大模型与替代增强可缩小与原报告的差距,但耐心延长与全项目试错带来数十倍于单次训练的能量开销。
该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。
该文针对采样识别中人工合成对难以模仿真实制作变换的问题,提出在真实采样对上全监督训练的 SIE 模型与训练配方,并在三个基准上报告优于前最优的结果,同时用对照实验说明数据替换与架构配方各自的贡献与代价。
论文用 124 位作曲家的旋律续写任务训练条件 Transformer,只以作曲家身份为监督,学到的 124×128 嵌入的第一主成分与出生年强相关并通过打乱检验,最强的向量算术例子同时暴露了旋律表征覆盖不了配器音色的代价。
针对序列级塔布拉鼓点转录标注稀缺问题,该工作用教师模型生成伪标签、S-CEM 估计每个鼓点可信度、CMW-ATC 在不确定片段上按马尔可夫转移加权候选序列,在三组评测上把序列错误率降到 18.3、33.3 和 12.7,但仍需序列级标注和固定转移矩阵。
论文把音乐语义定义为可测的检索任务能力,用冻结语义单码本加声学残差量化双流在混合信号上重建,报告显示完整配置在内容保持与重建上占优而纯声学配置虽重建略高却显著更难建模。
该研究针对可公开复现的大规模音乐与文本配对缺失问题,选择以互联网档案馆中声明为知识共享许可的音频为源、轻量音频语言模型初标加分类标签与档案元数据聚合精修为方法,最强证据是 1500 段抽样下与 JamendoMaxCaps 相当的参考无关分数与正确性完整性约 4.2 分以上的人评,主要代价是长时体裁欠采样与语言流畅性仍落后于人工标注。
论文用线性硬弦偏微分方程加三角拨弦初值约束多层感知机做正演,在第一振动周期内与有限差分和断线实验做对照,随机傅里叶特征尺度越大高频细节越好,但评估只限首周期且存在幅值偏差。
论文把考试式四部数字低音配写形式化为相邻事件上的硬约束与局部代价问题,用完整和声状态的分层图与动态规划证明固定声部数下可行性与最小代价可多项式求解,并以二拍、四拍、八拍实例展示合法性、贪心失效与复现步骤。
该研究把 8 类独奏谱面图像转成 bootleg score 词序列做文本分类,用无标注语言模型预训练把 RoBERTa 片段准确率从 34.5% 提升到 42.9%,再用移调式训练与测试增强推到 58.8%,代价是长片段整页推理退化和大偏移抹掉音域线索。
该综述把乐器建模中的逆问题统一为从声振观测反推物理量的框架并分为十类任务,强调病态性与噪声敏感是共同困难,正则化与建模假设是稳定求解的关键,但感知相似的声音匹配不等于物理一致的参数恢复。