Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation

📄 掩蔽走不到的地方:一条直线、一个夹角与均方误差的回拉 英文题目:Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation 一句话:单通道时频掩蔽的实增益格式把估计锁死在混合方向的直线上,论文用投影几何算出精确上限与四层算子类,再以非循环高斯混合后验证明均方准则会把估计拉回直线并在 MUSDB18 上测得 11.44 dB 量级的稳定缺口。 标签:#音乐源分离 | #生成模型 | #理论分析 | #基准测试 评分:7.9/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Maxime Baelde:organization=Independent researcher, city=Lille, country=France 💬 毒舌点评 亮点在于把时频掩蔽上限写成投影几何并证明均方准则把后验均值拉回实数线,理论链条完整且可证伪。短板是所测高斯混合先验远弱于当代分离器,整篇更像用弱模型验证强定理而非逼近上限本身。 📌 核心摘要 单通道时频掩蔽长期以理想比值掩蔽等特解作为上限,无法回答实增益格式本身禁止什么。本文把单频点估计看作复平面上的实线性算子,证明最优实增益是源向量向混合线上的正交投影,残差完全由源与混合夹角决定。作者建立实掩蔽、复掩蔽、宽线性与跨频耦合四层嵌套算子类,并对应先验零均值、循环对称与频率独立三条假设。构造堆叠实虚谱上的非循环高斯混合先验,其后验均值形式上离开最小类,但证明相位后验关于混合方向对称时均值落回实线,超额误差等于 oracle 增益的后验方差。在 MUSDB18 上人声与伴奏分离实验中,拟合估计器始终大幅低于逐帧上限,且增加分量数、训练量与全协方差均未弥合差距,约七成缺口可归因于后验方差。意义在于把突破上限的希望从更宽滤波器转向帧自适应先验与非均方准则。局限是测量取自较弱的浅层生成模型,且上限经重合成传输存在数值松弛。 🔗 开源与复现资源 代码:https://github.com/mbaelde/masking-ceiling,tag v1.0.0,separator 实现导入自 https://github.com/mbaelde/generative-audio-source-models 模型权重:论文中未提及 数据集:论文中未提及 Demo:论文中未提及 复现材料:论文说明全部 figure 和 table 可由 tag v1.0.0 复现,训练配置采用 diagonal 协方差并设置 floor 为 10-6,EM 迭代为 30 次,每种配置按 K 取 8,16,32 独立拟合且使用固定 seed,训练量按每源 20000 和 150000 frames 设置两档,堆叠维度在 L 为 1024 时是 1026,在 L 为 256 时是 258 论文中引用的开源项目:masking-ceiling https://github.com/mbaelde/masking-ceiling,generative-audio-source-models https://github.com/mbaelde/generative-audio-source-models 资源可达性验证:code=temporarily_unreachable;code=temporarily_unreachable;third_party=temporarily_unreachable;third_party=temporarily_unreachable 🧭 深度解读 单通道分离为何总在时频图上做乘法 想象你只拿到一轨混音,要从中捞出人声。最省事的办法是在短时傅里叶变换后的每个小格子上乘一个实数,把混合的幅度压一压、抬一抬,相位则原样保留。这就是理想比值掩蔽、维纳滤波和无数神经网络掩蔽器的共同格式,简单、稳定、易训练。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 915 words

Artificial Rosetta Stone: Constrained Maximum A Posteriori (MAP) Reconstruction of Symbolic Raga Sequences via Order-k Markov Models

📄 把拉格从玄学拉回有限状态:当重建变成约束 MAP 的精确动态规划 英文题目:Artificial Rosetta Stone: Constrained Maximum A Posteriori (MAP) Reconstruction of Symbolic Raga Sequences via Order-k Markov Models 一句话:论文把受损哼唱的符号补全定义为带观测一致与语法可行的约束 MAP 优化,用对称狄利克雷平滑的 k 阶马尔可夫核与有限记忆动态规划求全局最优,在真实 Yaman 录音衍生序列上二阶模型取得 0.470/0.414/0.371 的缺失准确率,代价是丢弃连续音高与甘马克且仅在 6 条测试序列的小样本流水线自洽意义上成立。 标签:#音乐理解 | #自回归模型 | #音乐生成 | #理论分析 评分:6.8/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Saanvi Raghavendran:Abstract Math Institute Abhishek Bhattacharjee:Abstract Math Institute 💬 毒舌点评 亮点在于把印度古典音乐中常被混为一谈的概率建模、硬约束满足与历史真实性做了清晰切割,并对有限记忆约束下的约束最大后验(Constrained Maximum A Posteriori, Constrained MAP)给出了可验证的动态规划最优性证明,数学写作比多数计算音乐学论文更自律。短板是实证部分仅基于 6 条测试序列的 Yaman 自动转录流水线,且符号真值本身由同一套基频跟踪与主音估计产生,所谓真实数据评估本质是流水线自洽性检验,离档案级重建的证据标准差距很大。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1374 words

A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances

📄 方差不该越过底线:用单峰约束重画 MOS 的容许区间 英文题目:A Mixed-Behavior Vote Model for Multimedia Subjective Quality Votes, Means, and Variances 一句话:针对 MOS 与方差的抛物线拟合总会跌破理论下界的问题,论文用单峰约束重定上下界并以四次多项式与混合投票模型实现区间内任意方差,在 16 个数据集上验证了拟合合规与行为可解释性,代价是仅建模一二阶矩且未触及个体与时序因素。 标签:#语音质量评估 #生成模型 #音频质量评估 #理论分析 #模型评估 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jaden Pieper:机构信息未在 arXiv HTML 中可靠披露 Stephen D. Voran:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用单峰性约束把教科书式的最大方差抛物线拉回现实,并用混合投票行为给出可解释的方差拟合与生成模型,数学闭环干净。短板是16个数据集的验证仍停留在曲线拟合层面,既无与主观实验预测或质量估计下游任务的关联,也无对投票者异质性与样本量有限性的严格统计检验,离NeurIPS/ICLR所要求的实证深度尚有距离。 📌 核心摘要 论文针对多媒体主观质量测试中平均意见得分(Mean Opinion Score,MOS)与投票方差之间的建模失配问题,指出传统缩放抛物线 \(v_d(X)=a(X-1)(5-X)\) 在拟合真实数据时几乎必然跌破理论最小方差曲线 \(v_{\min}(X)\)。方法核心是提出单峰方差区域(Unimodal Variance Region,UVR),以最大方差单峰(Maximum Variance Unimodal,MVU)投票概率质量函数(Probability Mass Function,PMF)替代全1与全5极端双峰对应的 \(v_{\max}(X)\) 作为上界,并以相邻两选项(Adjacent Two-Choice,ATC)PMF对应的 \(v_{\min}\) 作为下界;进而用四次多项式 \(v_r(Y)=(Y-1)(5-Y)(w_1(Y-3)^2+w_0)\) 重塑方差曲线,并构建混合二项投票(Mixed-BinoVotes,MBV)生成模型,通过混合参数 \(\alpha(y)\) 在BinoVotes与ATC/MVU之间插值以精确实现UVR内任意目标方差。相较于既有BinoVotes仅能产生 \(a=0.25\) 的固定抛物线方差,新模型首次实现方差形状可调且始终满足单峰与离散投票约束,并提供可解释的投票行为分解。在16个涵盖语音、图像、视频的数据集上,四次拟合均保持在UVR内,\(w_0\)在0.130至0.249之间,\(w_1\)在0.007至0.046之间,ITS2013接近纯BinoVotes行为而NISQA P501 MOS有28%文件方差落在最小方差曲线上。该框架为诊断主观实验设计缺陷与投票者行为提供了可量化工具,但局限在于仅建模一阶与二阶矩,未涉及投票者个体建模、时序依赖或与客观质量预测的联合验证。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 867 words

Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1

📄 当和声不再只谈音高:用搬运代价度量音色的几何 英文题目:Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1 一句话:论文把归一化频谱当作概率分布,用一维最优传输距离以赫兹为单位拆解音色差异,并以三角形面积与方差度量和弦的融合度,却只在少量自采录音上给出个案验证。 标签:#音乐理解 #生成模型 #可解释性 #理论分析 评分:5.5/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5 👥 作者与机构 Yusei Tamura:机构信息未在 arXiv HTML 中可靠披露 Shigekazu Ishihara:机构信息未在 arXiv HTML 中可靠披露 Ken Ito:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于将一维 Wasserstein 距离与频谱质心偏移解耦为可解释的音色差异量,并尝试把和声学从音高扩展到音色几何,概念上呼应了 Schönberg 的 Klangfarbenmelodie 命题。短板是全篇停留在 2 至 3 个音色的玩具示例与可视化热力图,没有可复现的基准、统计检验或与现有音色相似度度量的量化对比,更像一篇思辨性音乐学随笔而非可验证的信息几何模型。 ...

2026-08-31 · 更新于 2026-09-04 · 3 min · 582 words

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

📄 Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra 标签:#音乐生成 #音频生成 #实时处理 #理论分析 #开源工具 8.7/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐生成 | #音频生成 | #实时处理 #理论分析 | arxiv 👥 作者与机构 第一作者:Antonio Argentieri(Conservatorio Niccolò Piccinni di Bari) 通讯作者:Antonio Argentieri;Francesco Scagliola 作者列表:Antonio Argentieri、Francesco Scagliola(机构:Conservatorio Niccolò Piccinni di Bari, Bari, Italy) ...

2026-08-26 · 更新于 2026-09-04 · 1 min · 145 words

From local kernels to global form: modeling the emergence of musical content

📄 From local kernels to global form: modeling the emergence of musical content 标签:#音乐理解 #理论分析 #音乐生成 #可解释性 8.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.2/10 | 前25% | 文档类型:理论研究 | 评分置信度:高 | #音乐理解 | #理论分析 | #音乐生成 #可解释性 | arxiv 👥 作者与机构 第一作者:Francesco Vitucci(受控全文未说明) 通讯作者:受控全文未明确标注 作者列表:Francesco Vitucci、Michele Lorusso、Francesco Scagliola(机构:受控全文未说明) 📌 核心摘要 这篇论文的核心判断很明确:音乐形式不必靠更长的马尔可夫历史才进入模型;只要让同一符号在不同乐谱位置调用不同的转移核,1 阶链也能携带位置依赖的局部语法。它面对的矛盾是,齐次矩阵把全曲同一状态的所有后继混在一起,因而丢掉形式位置;而把窗口缩短以恢复位置,又会让转移计数稀疏、距离曲线受滑窗几何支配。作者的选择是从一首单声部 MusicXML 的重叠窗口估计局部核轨迹,分析时读相邻核的变化,生成时把局部行与全局回退核交给时间调度器。 ...

2026-08-26 · 更新于 2026-09-04 · 3 min · 490 words

A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels

📄 A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels 标签:#声源定位 #生成模型 #理论分析 #高效推理 9.8/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.8/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #生成模型 | #理论分析 #高效推理 | arxiv 👥 作者与机构 第一作者:Ashwani Koul(Linköping University, Linköping, Sweden) 通讯作者:正文未明确标注 作者列表:Ashwani Koul、Gustaf Hendeby、Isaac Skog(机构:Linköping University;KTH;FOI-Swedish Defence Research Agency, Sweden) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 400 words

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

📄 A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation 标签:#回声消除 #模型压缩 #高效推理 #实时处理 #理论分析 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #回声消除 | #模型压缩 | #高效推理 #实时处理 | arxiv 👥 作者与机构 第一作者:Ruibin Hou(The College of Computer Science and Technology, Inner Mongolia Minzu University, Tongliao, 028000, Inner Mongolia, China) 通讯作者:正文未明确标注 作者列表:Ruibin Hou、Chenggang Zhang、Yufeng Diao(机构:The College of Computer Science and Technology, Inner Mongolia Minzu University, Tongliao, 028000, Inner Mongolia, China) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 635 words

LipsAM: Lipschitz-continuous Neural Networks for Convergent Plug-and-Play Audio Signal Recovery

📄 LipsAM: Lipschitz-continuous Neural Networks for Convergent Plug-and-Play Audio Signal Recovery 标签:#音频修复 #CNN #语音增强 #理论分析 10.0/10 | 创新 2/2 | 严谨 1.5/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 10.0/10 | 前10% | 文档类型:理论研究 | 评分置信度:中 | #音频修复 | #CNN | #语音增强 #理论分析 | arxiv 👥 作者与机构 第一作者:Kazuki Matsumoto(Tokyo University of Agriculture and Technology,日本) 通讯作者:正文未明确标注 作者列表:Kazuki Matsumoto、Ren Uchida、Natsuki Yoshino、Kohei Yatabe(机构:Tokyo University of Agriculture and Technology,日本) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 450 words

Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations?

📄 Does Mapping Non-Maximal Probabilities to GMM Components Matter for S-JEPA Encoder Representations? 标签:#音频理解 #自监督学习 #理论分析 #模型评估 5.6/10 | 创新 1.3/2 | 严谨 1.4/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.3/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频理解 | #自监督学习 | #理论分析 #模型评估 | arxiv 👥 作者与机构 Wenxuan He、Yunpeng Li 为西交利物浦大学智能科学系研究生,Shan Liang(通信作者)任教于同一院系,机构位于中国苏州。研究使用公开的 LibriSpeech 数据,未收集人类被试数据,作者声明无利益冲突。 💡 毒舌点评 这是一篇问题意识清晰、实验纪律近乎苛刻的机制分析小品:为了回答「软 GMM 目标里非最大分量的映射到底重不重要」,作者构造了两个匹配对照,把数值概率结构与类别映射干净地解耦,还做了目标审计、说话人聚类自助法和分级暴露实验——方法论素养远超同类 SSL 分析工作。但也要泼两盆冷水。第一,效应量小得可怜:DeepTailCE 的降幅在千分之几到百分之几之间晃动,Seed B 对 FIXED-RANDPERM 的置信区间直接穿过零点,作者虽然诚实地报告了这一点,但「映射很重要」这一标题级结论的实际效应强度撑不起太大的理论野心。第二,外部效度几乎为零:20 小时 LibriSpeech 子集、51 个说话人、单一 S-JEPA 架构、100 分量固定 GMM、纯线性探针——所有结论都被锁死在这个微型设定里,与社区真正使用的大规模预训练 regime 相距甚远。此外全文没有提及任何代码发布,两个对照构造的实现细节又高度依赖工程选择,第三方想复现这套审计流程会相当吃力。 ...

2026-08-21 · 更新于 2026-09-04 · 3 min · 564 words