能出声不等于算对了:八份合成器作业里 AI 到底改变了什么
八名研究生在同一减法合成器作业中对比有无 GitHub Copilot,报告显示助手主要改善代码组织而非振荡器抗混叠与滤波器拓扑等领域正确性,且口试表达未见明显受损,但样本极小只能作试点参考。
八名研究生在同一减法合成器作业中对比有无 GitHub Copilot,报告显示助手主要改善代码组织而非振荡器抗混叠与滤波器拓扑等领域正确性,且口试表达未见明显受损,但样本极小只能作试点参考。
论文指出波形误差是增益误差的带载波代理,易被次生效应淹没,用实测控制电压直接计算增益误差并训练灰盒模型后,直接监督在增益误差上明显优于波形代理,而波形指标对差异显著的模型给出相近分数,代价是需要同步采集控制电压并建设约 270 GB 的大规模数据集。
该文以同一 Transformer 比较六种从纯音符到全量表达的切分方式,最强证据是渲染音频的 FAD 均值中音符加速度加踏板为 1.76、全量为 1.97,均优于纯音符基线的 3.10,而节拍标注平均未带来增益且代价是类别间波动大。
针对 Fulltone OCD v2 中 MOSFET 加锗二极管构成的非对称削波级难以实时求解的问题,论文把三个非线性合并为单个等效一端口并用分段线性函数显式映射,在 1 V、1 kHz 正弦和 96 kHz 采样下时域误差低至千分之量级,而显式方法实时比 0.14 约为迭代方法 3.12 的二十二分之一。
该文不改滤波器设计,只把拉伸有限冲激响应级联做成块流加环形状态的串行基线,再用开放多处理任务流水线并行,在英伟达 Jetson Orin Nano 上以串行超每秒 118 万采样、6 线程加速超 4.5 倍为证据,代价是最小能耗点不在最高性能点。
论文针对双算子 FM 同时估计载波与调制频率易陷局部极小的问题,提出把频率比约束在相邻低阶有理边界之间的多起点梯度优化,在 90 组受控合成测试中把成功率提高到 96.7%,代价是每个用例要并行跑 9 个候选且真值恰在边界上仍会失败。
针对给定目标音色从预设库中找回最接近 DX7 预设的问题,论文用 SLAP 式音频参数联合嵌入加仿真调制信号流的 DX7-GNN 编码器,在未见拓扑上以 52.2% R@1 超过 Transformer 与 Highway 基线,代价是依赖算子交换增强与单音高单力度渲染条件。
针对拟音数据缺乏动作与材质细粒度标注的问题,论文用两层人工分类体系组织 10000 段拟音并给出可复现基线,最强证据是大类准确率 0.82 而 73 类降至 0.64,代价是长尾分布与单标注者带来的细类混淆。
论文把虚拟模拟看作固定时长区间上的算子学习,用傅里叶域参数化加帧重叠相加实现单采样率训练、多采样率推理,在 Big Muff Pi 输入级上上采样与基线相当且可直接下采样,代价是帧缓冲结构和内部上采样带来的计算量。
针对矩形房间镜像声源数量随维度指数增长的问题,论文把距离计数归约为高斯圆格点计数并用几何卷积逐维递推,在整数坐标与全向反射等限定下把复杂度降为随维度线性的拟线性量级,代价是丢失方向性并需用缩放与插值补偿小距离误差。
该文把 16 通道反馈延迟网络做成端到端可微并用梯度下降拟合实测房间脉冲响应,在 9 个房间上以更少参数和更快训练达到更低混响时间误差,但训练延迟线可能引入可闻染色。
该文把均匀波形约简为带时间戳的局部极值点并用其间距逐样本控制重叠相加的拼接时机与时长,在嵌入式算力下保住瞬态,代价是频谱对比度损失与三次样条谐波失真。
论文要解决环回频率调制带来持续基频偏移、使时变延迟函数随时间线性增长而无法装进环形缓冲的问题,选择用闭式解给出的解析相位和发声频率构造可回绕延迟并叠加整周期偏置,最强证据是回绕点相位连续且整周期偏置下波形不畸变,代价是必须预先知道发声频率且每隔 N 样本回绕一次。
论文用 Mores 实测的 65 把吉他桥柔量与桥到空气辐射驱动几何精确非线性弦,在连续级做标量辅助变量二次化并以两次 Sherman-Morrison 秩一更新实现每步显式推进,以全品格约 6240 个音展示乐器相关共鸣,代价是琴体与辐射仍为线性模态且跨琴响度依赖两遍归一化。
论文以二维波方程与商空间拼贴推导矩形、环面、莫比乌斯带、克莱因瓶与实射影平面的闭式模态,并用有限差分时域仿真验证频率误差约 0.02% 量级、模态置信接近 1,代价是不可嵌入三维的非定向拓扑只能在平面基本域加边界规则中间接实现。
该研究把 DiffRIR 从单声源扩展为多声源联合优化并把学习率调到 3×10-2,用 24 条 RIR 实现频谱误差下降,同时揭示空间不变晚期残响在多声源下存在时间衰减精度的结构性代价。
问题是用现成神经音频编解码器做可演奏的音色迁移,方法是不训练新生成器而检索调色板令牌颗粒并做连续性约束的序列选择与分组替换,最强证据是调色板扩展下中位实时系数仍低于实时,而代价是分块渲染与完整上下文不等价且缺乏听感验证。
针对立体声到 5.1 盲上混中环绕声缺乏可学习目标的问题,该工作用 CCD 加 ELAE 合成 PAEDB 主次对并训练 Mel-RoFormer 与 MLP 做氛围提取,最强证据是 VPA-Mel-RoFormer 主观总分 14.45 接近 VPA-ELAE 的 14.63,代价是客观重建分数偏低且训练目标受限于合成算法上限。
针对从单条合成脉冲响应估计薄板六参数的逆问题,论文用 PyTorch 可微模态合成器加多尺度谱损失做推理时优化,以 500 次短探测加 1500 步精修的两阶段策略应对非凸,在 8 条响应上把平均归一化均方误差降到 4.29×10-3 量级,代价是平均每条约 13.42 分钟的优化时间。
该文针对球形阵列测得的高阶 Ambisonics 空间房间脉冲响应,用 Herglotz 分析重建早期反射的方向与到达时间并显式仿真散射与空间混叠,用方向反馈延迟网络重建晚期混响的方向相关衰减,在 IRCAM Espro 厅 EM32 实测上以球面相关和能量衰减浮雕贴近测量,代价是保留单斜率指数衰减假设与阵列阶数限制。