论文解读

检索与合成分开做会断流:QuAP 把找声音和造声音放进同一个插件

针对影视非语音非音乐音效在检索与程序化生成之间频繁切换的问题,QuAP 用混合检索加六个程序化模型加规则助手统一工作流,主证据是 16 人用户评估与 MUSHRA 在六类中五类显著改善和 FSD50K 上 MobileNetV3 检索占优,代价是 Rocket 与 Jet 等类别仍不够逼真且仅支持六类。

 · 更新于 2026-09-24 · 约 20 分钟 · 9636 字 阅读 →
论文解读

孤立很快不等于混音中不爆音:苹果芯片上神经音频推理的竞争实测

该研究在苹果 M3 上对比 BNNSGraph 等推理后端处理 LSTM、TCN、WaveNet 吉他音色模型的速度,核心证据是孤立实时系数很好但在真实混音回调下尾延迟爆表,而代价是平台绑定与状态实现差异需要逐项核对。

 · 更新于 2026-09-24 · 约 21 分钟 · 10348 字 阅读 →
论文解读

用一次二次规划代替迭代求解:残差驱动的变步长非线性电路仿真

该工作把非线性模拟音频电路的状态空间微分代数方程改写为单步等式约束二次规划,用线性化后的器件约束残差作为局部缺陷指示器驱动多速率自适应步长,在二极管削波器、共射放大器和考毕兹振荡器上以 SPICE 为基准验证了一致性,代价是在强非线性段需要降到约 200 ns 量级的最小步长。

 · 更新于 2026-09-24 · 约 17 分钟 · 8478 字 阅读 →
论文解读

一次生成一小段连续潜块:SCAPES 如何用轻量流模型做语义可控的环境声

针对环境声语义描述粗疏而波形稠密、离散量化破坏连续性、非因果编解码拼接易产生边界伪影的问题,SCAPES 冻结 EnCodec 连续潜空间并用条件连续归一化流做段级自回归生成,在约 34 分钟 10 类数据上以约 36M 参数单卡约 1 小时训练实现长稳可控合成,代价是对语音音乐等长结构建模不足且部分类别指标未胜出。

 · 更新于 2026-09-24 · 约 18 分钟 · 8698 字 阅读 →
论文解读

把非线性放进反馈回路:用反馈延迟网络做可控衰减的微光混响

该研究把五种近能量保持的非线性与时变操作放进反馈延迟网络的反馈回路来合成微光混响,在固定采样率与 8 通道长延迟条件下显示可产生偶次谐波与高八度并维持稳定,代价是混响时间不再严格保持且需直流阻塞与抗混叠补偿。

 · 更新于 2026-09-24 · 约 19 分钟 · 9062 字 阅读 →
论文解读

把超声切面当乐谱:可触摸的明胶幻影如何决定声音

该研究把便携超声探头扫查手工食物明胶幻影得到的深度密度图像,经取样线重采样后送入逆傅里叶变换合成声音,探头推滑按压与材料雕刻共同作曲,代价是频率分辨率粗糙、低频表现弱且模具精度不可控。

 · 更新于 2026-09-24 · 约 25 分钟 · 12086 字 阅读 →
论文解读

绕一圈回不来:用圆形缓冲器讲清莫比乌斯带的单值性与缠绕数

论文把循环移位读成离散圆上的线丛转移映射,用绕行一周的单值性与回到恒等的缠绕数统一解释莫比乌斯波导的基频减半与延迟环混沌振荡器的次谐波,代价是只做解析构造与谱推演而无可运行的定量声学实验对照。

 · 更新于 2026-09-24 · 约 23 分钟 · 11028 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

反转轨迹并非处处关键:用曲率与信息增益决定何时跳过神经网络计算

针对反转式音频编辑必须用密集固定步数导致计算昂贵的问题,论文提出免训练的自适应轨迹外推框架 AdaTE,只在高曲率与高信息增益处做神经网络评估,其余用线性外推跳过,在 AudioLDM2 上以 12.8 次评估达到 3.9 倍加速且保真度基本不降,但激进阈值与极端不稳定轨迹仍会带来退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8605 字 阅读 →
论文解读

从文本到定时再到可懂语音:ControlAudio 为何要用渐进式扩散拆解控制

ControlAudio 把定时可控与可懂语音生成拆成文本、定时、音素三级条件,用结构化提示、三阶段训练和两段采样实现统一控制,在 AudioCondition 与 AC-Filtered 上提升时间精度与可懂度,代价是更依赖标注与仿真数据的分布假设和更长的多阶段训练。

 · 更新于 2026-09-24 · 约 20 分钟 · 9654 字 阅读 →
论文解读

把时间藏进相位的巨型频谱:用群延迟成组搬移保住音符包络

针对巨型傅里叶变换改相位会破坏频率间时间关系并把离散事件抹成持续纹理的问题,论文把相位转成群延迟做谱峰分割与整组均匀搬移,用合成与实录四音逆序、振幅比例展开与正弦调制复制证明离散包络可保留,代价是共享频点的重叠事件无法独立重排。

 · 更新于 2026-09-24 · 约 18 分钟 · 8688 字 阅读 →
论文解读

多轮修音不推倒重来:用大模型定方向、用听觉优化守住上一轮

针对一次指令只给一个预设、无法在已有参数上连续修改的问题,论文用大语言模型做效果选择与初始化、再用 CLAP 引导的优化做原地微调,在 SocialFX 均衡器词对上 10 组中有 9 组的最大均值差异低于重提词基线,但非可微效果与长时间优化仍不稳定且每轮需要秒级计算。

 · 更新于 2026-09-24 · 约 18 分钟 · 8855 字 阅读 →
论文解读

把推理也当训练来扩展:掩码流匹配如何一步步重写音频

针对文本到音频中推理扩展不足与偏好错位问题,论文用连续掩码流匹配加迭代掩码重预测扩展推理计算,并用奖励加权微调对齐文本对应与审美,主证据是在 AudioCaps 上 FAD 为 1.10、KL 为 1.30、MOS-Q 为 78.87,代价是需要多步 ODE 求解与多轮掩码迭代。

 · 更新于 2026-09-24 · 约 18 分钟 · 8555 字 阅读 →
论文解读

一步跨越整条轨迹:MeanAudio 以平均速度实现单步文本转音频

针对流式与扩散式文本转音频需数十至数百步积分导致延迟高的问题,MeanAudio 以均值流回归区间平均速度并配合双文本编码与瞬时到平均课程,在 AudioCaps 上用 120M 参数实现单步 FD 14.30 与 RTF 0.013,代价是长音频与语音生成仍受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8822 字 阅读 →
论文解读

语音要语义、音乐要结构:用动态容量专家缝合统一音频生成

针对语音与音乐联合训练中的任务冲突和数据不均衡,论文用动态容量混合专家做按词元分配计算的三阶段课程训练,在语音内容一致性和音乐美学指标上报告了超越专用基线与稠密联合基线的结果,代价是更复杂的专家初始化与路由调参流程。

 · 更新于 2026-09-24 · 约 21 分钟 · 10251 字 阅读 →
论文解读

把结构化语音与非结构化音效装进同一指令接口:UniSonate 的对齐与课程设计

UniSonate 用指令与内容双流加动态音效令牌统一语音音乐音效生成,在语音可懂度和音乐连贯性上报告最优值,而音效保真度仍落后于专用模型并受短时长与推理开销限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9402 字 阅读 →
论文解读

以小波分频外推替代部分 ODE 求解:WaveEx 的加速逻辑与适用边界

针对流匹配语音生成中 ODE 反复调用神经网络导致推理慢的问题,WaveEx 用单层小波分解加一阶泰勒分频外推替代部分求解步骤,在四类任务上报告 2.75-5.73 倍加速,代价是早期高曲率段仍需保留少量 ODE 步且高频外推带来轻微波动。

 · 更新于 2026-09-24 · 约 22 分钟 · 10760 字 阅读 →
论文解读

九成权重归零仍能弹:稀疏 WaveNet 音箱如何挤进 iPhone 中央处理器

该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。

 · 更新于 2026-09-24 · 约 17 分钟 · 8037 字 阅读 →
论文解读

把水印藏进起始噪声:锚定反演如何找回被波形转换打乱的归属

针对潜扩散文本生成音频的归属问题,该文把水印映射为初始隐向量这一支点锚,用无引导扩散生成锚序列并以软动态时间规整优化反演轨迹,在保持生成流程不变下报告了更强的鲁棒性,但每步多轮优化带来了可观的提取时间代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8615 字 阅读 →