论文解读

用可微模态合成反推薄板参数:两阶段梯度搜索如何绕开非凸陷阱

针对从单条合成脉冲响应估计薄板六参数的逆问题,论文用 PyTorch 可微模态合成器加多尺度谱损失做推理时优化,以 500 次短探测加 1500 步精修的两阶段策略应对非凸,在 8 条响应上把平均归一化均方误差降到 4.29×10-3 量级,代价是平均每条约 13.42 分钟的优化时间。

 · 更新于 2026-09-24 · 约 15 分钟 · 7059 字 阅读 →
论文解读

CLAP 音频嵌入里藏着混响、响度和音高吗:用轻量探针检验线性与非线性编码

该文冻结 LAION-CLAP 音频编码器,用线性、两层 MLP 和核岭回归三种探针在五类数据上回归 RT60、LUFS、频谱质心与相对音高,最强证据是非线性探针在全部属性上可靠恢复,而线性探针仅对 RT60、LUFS 和相对音高有效,代价是频谱质心需要非线性流形且相对音高方向高度依赖领域。

 · 更新于 2026-09-24 · 约 20 分钟 · 9627 字 阅读 →
论文解读

在真实 DAW 里批量渲染效果图:WildFX 如何把插件链变成可学习数据

WildFX 针对 DAW 托管插件链缺乏成对音频与图标签的问题,用 REAPER 加容器化批量渲染生成带路由和参数标注的多轨数据,盲图估计实验显示浅层图比深层图更易估计但节点识别仍是主要失败模式,且受限于小规模插件库和短训练预算。

 · 更新于 2026-09-24 · 约 23 分钟 · 11462 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

声音没变意思却绕过拒绝:AJailBench 用语义守恒的信号扰动测大音频语言模型

针对大音频语言模型越狱评测只做文本转语音的问题,该工作先建 1495 条 10 类音频基线集,再用语义一致约束加贝叶斯优化组合时域频域混合扰动生成更强攻击,并在 7 个模型上报告攻击成功率等五项指标显示微小保义扰动仍显著降低安全性,同时以严格拒绝换可用性为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9915 字 阅读 →
论文解读

从认出任务到学出规则:AudioICL-Bench 把音频上下文学习拆成感知与操作两轴

该文用每幕重采样的九任务诊断音频任务学习,显示最强模型在非语音模式绑定上可学、但在时长测量与多规则组合上崩溃,而代价是人工构造任务与小样本精确匹配评估的生态距离。

 · 更新于 2026-09-24 · 约 16 分钟 · 7672 字 阅读 →
论文解读

转写之外还要听见什么:用统一音频模式补上感知的短板

论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8979 字 阅读 →
论文解读

不只看文字:用时间轴重新定义音频章节切分

论文把音频章节切分从句子序列搬到时间轴上,对比文本加声学特征、纯音频 AudioSeg 与多模态大模型,报告 AudioSeg 在 YTSeg 上显著领先而停顿是最有效的手工特征,同时揭示长音频与多说话人下的衰减与评估不可比问题。

 · 更新于 2026-09-24 · 约 18 分钟 · 8745 字 阅读 →
论文解读

从碎片到谱系:印度语言 NLP 资源为何要按任务重组

该综述把印度语言 NLP 按六大组十七个细粒度任务重组,用 200 余数据集、50 余评测和 100 余模型工具的覆盖来暴露语言与任务的不均衡,并以可核对的资源清单支撑后续复用。

 · 更新于 2026-09-24 · 约 16 分钟 · 7741 字 阅读 →
论文解读

板混响能从声音倒推出物理参数吗:一次只用合成数据的参数估计挑战

该挑战用阻尼 Kirchhoff-Love 板仿真器生成全部脉冲响应,要求从波形倒推 6 个物理量或数千个模态三元组,结果是任务 A 可用大样本网络或大量正演搜索做到机器精度而任务 B 连模态增益都难以逐个恢复且频域复评会改变排名。

 · 更新于 2026-09-24 · 约 22 分钟 · 10993 字 阅读 →
论文解读

声音太杂,一个投影器学不过来:用稀疏专家拆开梯度冲突

针对语音、音乐、环境声混在一起导致共享适配器梯度互相打架的问题,论文用稀疏混合专家适配器把音频令牌分流到不同专家,在总参数约 94.4M、激活约 70.8M 的受控预算下把 MMSU 音频准确率从 35.03% 提升到 38.19%、OBQA 从 50.10% 提升到 53.85%、MMAU 从 59.79% 提升到 61.50%,代价是需要负载均衡约束来维 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9268 字 阅读 →
论文解读

极点不动、留数会动:用三视图与饱和分裂收割密集平板模态

针对非归一化位移脉冲响应中数千个重叠平板模态难以逐个分辨的问题,该工作用匹配追踪锚定加原始与一阶二阶差分三视图子带自回归极点收割、饱和频带递归分裂与饱和指示补数,最后做全局岭最小二乘增益回填,其代价是相距不足 1 Hz 的邻近模态增益仍无法分离。

 · 更新于 2026-09-24 · 约 20 分钟 · 9674 字 阅读 →
论文解读

不做频谱,直接读波形:用 CNN-GRU 从板混响脉冲响应反推六个可辨识物理参数

针对 DAFx 参数估计挑战 Task A 从未归一化位移脉冲响应恢复板混响物理参数的问题,论文用三层一维卷积加双向 GRU 的时域回归器直接预测六个可辨识参数,在 150 例开发测试集上以参数归一化均方误差 0.0499 优于粒子群优化基线的 0.0618,并把单条推理时间从 36.46 秒降到 1.10 秒,代价是面密度一项略差且最优检查点早在第 5 轮 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7913 字 阅读 →
论文解读

不靠模态先验,把波形表征和可算特征拼起来反推薄板参数

针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。

 · 更新于 2026-09-24 · 约 17 分钟 · 8476 字 阅读 →
论文解读

用自然语言搭脚手架学通用音频表示:对比学得快,生成式走得远

该文以聚合 10.7M 字幕的 CaptionStew 为试验床,在冻结编码器条件下比较对比学习与字幕生成两种目标,发现在判别任务上对比更数据高效而生成式随规模追赶更快,但有监督初始化的增益随规模衰减且声音事件检测出现反向扩展。

 · 更新于 2026-09-24 · 约 17 分钟 · 8434 字 阅读 →
论文解读

真实现场压垮推理:RSA-Bench 用声学生态测出音频大模型的感知-认知断层

论文用四种真实声景按 1 到 4 个干扰源叠加构造十万级评测,报告高阶推理在户外强干扰下功能性崩溃而性别感知相对稳定,且常用去噪反而加重词错误率等代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9023 字 阅读 →
论文解读

从一条脉冲响应反推钢板参数:用仿真样本直接学后验分布

该研究把板混响辨识做成仿真推断问题,用多分辨率频谱摘要加神经样条流学习六维参数后验,再对每条测试脉冲响应做三轮定向仿真微调,最强可部署策略把全局误差降到 0.47×10-3,代价是每条约 2.5 h 的推理微调成本。

 · 更新于 2026-09-24 · 约 20 分钟 · 9520 字 阅读 →
论文解读

听声辨位:用可定位性把众包录音筛成组合推理考题

论文把音频地理定位做成音频语言模型基准,用四步声学过滤加正负类别加权的定位性分数筛出 1444 段录音,最强闭源模型仍只在部分样本上精确定位且高度依赖语言线索。

 · 更新于 2026-09-24 · 约 21 分钟 · 10407 字 阅读 →
论文解读

先猜五维再对波形:可微合成与粒子群如何把板混响参数推到近乎完全恢复

任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9470 字 阅读 →