检索与合成分开做会断流:QuAP 把找声音和造声音放进同一个插件
针对影视非语音非音乐音效在检索与程序化生成之间频繁切换的问题,QuAP 用混合检索加六个程序化模型加规则助手统一工作流,主证据是 16 人用户评估与 MUSHRA 在六类中五类显著改善和 FSD50K 上 MobileNetV3 检索占优,代价是 Rocket 与 Jet 等类别仍不够逼真且仅支持六类。
针对影视非语音非音乐音效在检索与程序化生成之间频繁切换的问题,QuAP 用混合检索加六个程序化模型加规则助手统一工作流,主证据是 16 人用户评估与 MUSHRA 在六类中五类显著改善和 FSD50K 上 MobileNetV3 检索占优,代价是 Rocket 与 Jet 等类别仍不够逼真且仅支持六类。
该研究在苹果 M3 上对比 BNNSGraph 等推理后端处理 LSTM、TCN、WaveNet 吉他音色模型的速度,核心证据是孤立实时系数很好但在真实混音回调下尾延迟爆表,而代价是平台绑定与状态实现差异需要逐项核对。
该工作把非线性模拟音频电路的状态空间微分代数方程改写为单步等式约束二次规划,用线性化后的器件约束残差作为局部缺陷指示器驱动多速率自适应步长,在二极管削波器、共射放大器和考毕兹振荡器上以 SPICE 为基准验证了一致性,代价是在强非线性段需要降到约 200 ns 量级的最小步长。
针对环境声语义描述粗疏而波形稠密、离散量化破坏连续性、非因果编解码拼接易产生边界伪影的问题,SCAPES 冻结 EnCodec 连续潜空间并用条件连续归一化流做段级自回归生成,在约 34 分钟 10 类数据上以约 36M 参数单卡约 1 小时训练实现长稳可控合成,代价是对语音音乐等长结构建模不足且部分类别指标未胜出。
该研究把五种近能量保持的非线性与时变操作放进反馈延迟网络的反馈回路来合成微光混响,在固定采样率与 8 通道长延迟条件下显示可产生偶次谐波与高八度并维持稳定,代价是混响时间不再严格保持且需直流阻塞与抗混叠补偿。
该研究把便携超声探头扫查手工食物明胶幻影得到的深度密度图像,经取样线重采样后送入逆傅里叶变换合成声音,探头推滑按压与材料雕刻共同作曲,代价是频率分辨率粗糙、低频表现弱且模具精度不可控。
论文把循环移位读成离散圆上的线丛转移映射,用绕行一周的单值性与回到恒等的缠绕数统一解释莫比乌斯波导的基频减半与延迟环混沌振荡器的次谐波,代价是只做解析构造与谱推演而无可运行的定量声学实验对照。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对反转式音频编辑必须用密集固定步数导致计算昂贵的问题,论文提出免训练的自适应轨迹外推框架 AdaTE,只在高曲率与高信息增益处做神经网络评估,其余用线性外推跳过,在 AudioLDM2 上以 12.8 次评估达到 3.9 倍加速且保真度基本不降,但激进阈值与极端不稳定轨迹仍会带来退化。
ControlAudio 把定时可控与可懂语音生成拆成文本、定时、音素三级条件,用结构化提示、三阶段训练和两段采样实现统一控制,在 AudioCondition 与 AC-Filtered 上提升时间精度与可懂度,代价是更依赖标注与仿真数据的分布假设和更长的多阶段训练。
针对巨型傅里叶变换改相位会破坏频率间时间关系并把离散事件抹成持续纹理的问题,论文把相位转成群延迟做谱峰分割与整组均匀搬移,用合成与实录四音逆序、振幅比例展开与正弦调制复制证明离散包络可保留,代价是共享频点的重叠事件无法独立重排。
针对一次指令只给一个预设、无法在已有参数上连续修改的问题,论文用大语言模型做效果选择与初始化、再用 CLAP 引导的优化做原地微调,在 SocialFX 均衡器词对上 10 组中有 9 组的最大均值差异低于重提词基线,但非可微效果与长时间优化仍不稳定且每轮需要秒级计算。
针对文本到音频中推理扩展不足与偏好错位问题,论文用连续掩码流匹配加迭代掩码重预测扩展推理计算,并用奖励加权微调对齐文本对应与审美,主证据是在 AudioCaps 上 FAD 为 1.10、KL 为 1.30、MOS-Q 为 78.87,代价是需要多步 ODE 求解与多轮掩码迭代。
针对流式与扩散式文本转音频需数十至数百步积分导致延迟高的问题,MeanAudio 以均值流回归区间平均速度并配合双文本编码与瞬时到平均课程,在 AudioCaps 上用 120M 参数实现单步 FD 14.30 与 RTF 0.013,代价是长音频与语音生成仍受限。
针对语音与音乐联合训练中的任务冲突和数据不均衡,论文用动态容量混合专家做按词元分配计算的三阶段课程训练,在语音内容一致性和音乐美学指标上报告了超越专用基线与稠密联合基线的结果,代价是更复杂的专家初始化与路由调参流程。
UniSonate 用指令与内容双流加动态音效令牌统一语音音乐音效生成,在语音可懂度和音乐连贯性上报告最优值,而音效保真度仍落后于专用模型并受短时长与推理开销限制。
针对流匹配语音生成中 ODE 反复调用神经网络导致推理慢的问题,WaveEx 用单层小波分解加一阶泰勒分频外推替代部分求解步骤,在四类任务上报告 2.75-5.73 倍加速,代价是早期高曲率段仍需保留少量 ODE 步且高频外推带来轻微波动。
该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。
针对潜扩散文本生成音频的归属问题,该文把水印映射为初始隐向量这一支点锚,用无引导扩散生成锚序列并以软动态时间规整优化反演轨迹,在保持生成流程不变下报告了更强的鲁棒性,但每步多轮优化带来了可观的提取时间代价。