不靠听觉也能偏爱十二平均律:从任意唱名数出发重建转位等价
该文把声学放到一边,从任意个全音阶音出发构造半音与等价类,并以反射性和最大偶性解释为何标准十二音系统在纯句法意义下仍是可用选择,但非标准十九音等系统也能被同一语言描述。
该文把声学放到一边,从任意个全音阶音出发构造半音与等价类,并以反射性和最大偶性解释为何标准十二音系统在纯句法意义下仍是可用选择,但非标准十九音等系统也能被同一语言描述。
论文把 CosFace 证明为 Q-Margin 在 α 趋于 1 时的特例,并用大小模型与大小数据对照说明稀疏在小数据与大模型微调中有用,但小模型在大规模训练后易出现梯度饥饿。
针对短停顿标注松紧不一致会抬高日志误差率并掩盖真实模型误差的问题,论文保留标准 DER 不变并将其精确拆分为停顿归因部分与残余核心部分,最强证据是合成变换只把填充归为停顿而插入与移位仍留在核心,代价是核心误差不能单独优化且跨不同松紧参考不可直接比较。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对未知发射时间的单声源被动定位,论文把问题保持为 ToA 最小二乘并联合估计位置与发射时刻,用基于边的分布式 ADMM 给出闭式局部更新,仿真显示严格停止阈值下其趋势接近集中式求解器与 CRLB 参考,但宽松阈值出现高位平台且收敛只对平滑近似证明。
论文针对修复任务中全局时间 t 无法刻画样本相关退化程度的问题,提出以冻结判别编码器表示替代时间条件来驱动流匹配速度场,在语音增强上报告了可复核的提升,并以额外编码器开销和自适应推理换取计算节省。
论文证明若变形类参数多于观测则残差选型只排正则项,据此把挑选限制为每原子一个复增益加纯时延、重建改用对齐原子的局部联合最小二乘,在 MUSDB18 上把准则与池内神谕的距离从 6.2–7.7 dB 压到 0.5–2.8 dB 但仅 0.9–1.2 dB 落到输出,并量化剩余 10.0 dB 锁来自对混合而非对目标的打分。
针对语音/音乐/环境声的神经音频水印,DiffErase 在不查询检测器且不知水印方案的黑盒条件下,通过梅尔频谱的中间噪声扰动与预训练扩散去噪重生实现去除,并在五种水印系统上将检测 TPR 降至近 0 的同时以 t* 控制保真度代价。