用可微模态合成反推薄板参数:两阶段梯度搜索如何绕开非凸陷阱
针对从单条合成脉冲响应估计薄板六参数的逆问题,论文用 PyTorch 可微模态合成器加多尺度谱损失做推理时优化,以 500 次短探测加 1500 步精修的两阶段策略应对非凸,在 8 条响应上把平均归一化均方误差降到 4.29×10-3 量级,代价是平均每条约 13.42 分钟的优化时间。
针对从单条合成脉冲响应估计薄板六参数的逆问题,论文用 PyTorch 可微模态合成器加多尺度谱损失做推理时优化,以 500 次短探测加 1500 步精修的两阶段策略应对非凸,在 8 条响应上把平均归一化均方误差降到 4.29×10-3 量级,代价是平均每条约 13.42 分钟的优化时间。
该文冻结 LAION-CLAP 音频编码器,用线性、两层 MLP 和核岭回归三种探针在五类数据上回归 RT60、LUFS、频谱质心与相对音高,最强证据是非线性探针在全部属性上可靠恢复,而线性探针仅对 RT60、LUFS 和相对音高有效,代价是频谱质心需要非线性流形且相对音高方向高度依赖领域。
WildFX 针对 DAW 托管插件链缺乏成对音频与图标签的问题,用 REAPER 加容器化批量渲染生成带路由和参数标注的多轨数据,盲图估计实验显示浅层图比深层图更易估计但节点识别仍是主要失败模式,且受限于小规模插件库和短训练预算。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对大音频语言模型越狱评测只做文本转语音的问题,该工作先建 1495 条 10 类音频基线集,再用语义一致约束加贝叶斯优化组合时域频域混合扰动生成更强攻击,并在 7 个模型上报告攻击成功率等五项指标显示微小保义扰动仍显著降低安全性,同时以严格拒绝换可用性为代价。
该文用每幕重采样的九任务诊断音频任务学习,显示最强模型在非语音模式绑定上可学、但在时长测量与多规则组合上崩溃,而代价是人工构造任务与小样本精确匹配评估的生态距离。
论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。
论文把音频章节切分从句子序列搬到时间轴上,对比文本加声学特征、纯音频 AudioSeg 与多模态大模型,报告 AudioSeg 在 YTSeg 上显著领先而停顿是最有效的手工特征,同时揭示长音频与多说话人下的衰减与评估不可比问题。
该综述把印度语言 NLP 按六大组十七个细粒度任务重组,用 200 余数据集、50 余评测和 100 余模型工具的覆盖来暴露语言与任务的不均衡,并以可核对的资源清单支撑后续复用。
该挑战用阻尼 Kirchhoff-Love 板仿真器生成全部脉冲响应,要求从波形倒推 6 个物理量或数千个模态三元组,结果是任务 A 可用大样本网络或大量正演搜索做到机器精度而任务 B 连模态增益都难以逐个恢复且频域复评会改变排名。
针对语音、音乐、环境声混在一起导致共享适配器梯度互相打架的问题,论文用稀疏混合专家适配器把音频令牌分流到不同专家,在总参数约 94.4M、激活约 70.8M 的受控预算下把 MMSU 音频准确率从 35.03% 提升到 38.19%、OBQA 从 50.10% 提升到 53.85%、MMAU 从 59.79% 提升到 61.50%,代价是需要负载均衡约束来维 …
针对非归一化位移脉冲响应中数千个重叠平板模态难以逐个分辨的问题,该工作用匹配追踪锚定加原始与一阶二阶差分三视图子带自回归极点收割、饱和频带递归分裂与饱和指示补数,最后做全局岭最小二乘增益回填,其代价是相距不足 1 Hz 的邻近模态增益仍无法分离。
针对 DAFx 参数估计挑战 Task A 从未归一化位移脉冲响应恢复板混响物理参数的问题,论文用三层一维卷积加双向 GRU 的时域回归器直接预测六个可辨识参数,在 150 例开发测试集上以参数归一化均方误差 0.0499 优于粒子群优化基线的 0.0618,并把单条推理时间从 36.46 秒降到 1.10 秒,代价是面密度一项略差且最优检查点早在第 5 轮 …
针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。
该文以聚合 10.7M 字幕的 CaptionStew 为试验床,在冻结编码器条件下比较对比学习与字幕生成两种目标,发现在判别任务上对比更数据高效而生成式随规模追赶更快,但有监督初始化的增益随规模衰减且声音事件检测出现反向扩展。
论文用四种真实声景按 1 到 4 个干扰源叠加构造十万级评测,报告高阶推理在户外强干扰下功能性崩溃而性别感知相对稳定,且常用去噪反而加重词错误率等代价。
该研究把板混响辨识做成仿真推断问题,用多分辨率频谱摘要加神经样条流学习六维参数后验,再对每条测试脉冲响应做三轮定向仿真微调,最强可部署策略把全局误差降到 0.47×10-3,代价是每条约 2.5 h 的推理微调成本。
论文把音频地理定位做成音频语言模型基准,用四步声学过滤加正负类别加权的定位性分数筛出 1444 段录音,最强闭源模型仍只在部分样本上精确定位且高度依赖语言线索。
任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。