aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
论文把问题定为给定干声吉他与目标效果标签、合成对应效果声并保留音乐内容,用同一事件序列配对的 EGFxSet 衍生数据比较四种谱变换模型,最强证据是 log 幅度 U-Net 相对复制输入基线平均改善 MSE 约 70.6% 与 FAD 约 31.8%,代价是延迟混响类 FAD 增益弱且域外真实演奏变换减弱。
任务是从合成板混响位移脉冲响应中恢复未知个数的频率、衰减和增益三元组,方法用 1/20 倍频程计数密度加固定槽位回归同时估计总数与属性,在 100 条独立脉冲的对比集上两个神经估计器的总相对误差约为 0.32,低于最强经典基线的约 1.10,但增益误差仍是主要误差来源。
针对非归一化位移脉冲响应中数千个重叠平板模态难以逐个分辨的问题,该工作用匹配追踪锚定加原始与一阶二阶差分三视图子带自回归极点收割、饱和频带递归分裂与饱和指示补数,最后做全局岭最小二乘增益回填,其代价是相距不足 1 Hz 的邻近模态增益仍无法分离。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
论文把短时傅里叶、Mel、倒谱和 Gammatone 直接搬到全同态加密上,用膨胀、贫民变换等近似降低累加器位宽,在 VocalSet 和 OxVoc 上把描述符统计错误率从常规方法的 5.9% 和 6.5% 降到膨胀 4 倍时的 4.7% 和 1.9%,代价是 64 毫秒音频加密计算约 12970 秒且高频谐波丢失。
该研究把板混响辨识做成仿真推断问题,用多分辨率频谱摘要加神经样条流学习六维参数后验,再对每条测试脉冲响应做三轮定向仿真微调,最强可部署策略把全局误差降到 0.47×10-3,代价是每条约 2.5 h 的推理微调成本。
任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。
针对流匹配语音生成中 ODE 反复调用神经网络导致推理慢的问题,WaveEx 用单层小波分解加一阶泰勒分频外推替代部分求解步骤,在四类任务上报告 2.75-5.73 倍加速,代价是早期高曲率段仍需保留少量 ODE 步且高频外推带来轻微波动。
针对语音能量集中而音乐音效需全频保真的问题,BSCodec 把频谱切成独立频带并行编码量化解码,在相同混合训练下以 2.55 kbps 和 3.83 kbps 对标 DAC 的 4.5 kbps 和 6 kbps,代价是编码器解码器数量随频带数增加且语音对切分粒度敏感。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
论文把信噪比失准归因于瞬时相位距离不可靠,用全向相位导数重写相关项得到 GOMPSNR,并在声码器与编解码器上验证其与听感指标更相关且导出损失能提升重建质量,但线性幅度等组合在小数据上存在过拟合代价。
针对梅尔声码器黑盒预测丢失频谱细节与相位包裹难监督的问题,SCNet 用低频子带先验耦合到逆变换主干并以幅度加权相位损失训练,在域内与跨说话人测试及 CosyVoice 合成中报告更高质量,但合成速度不及 Vocos 且通用音频能力待验证。
针对多人运动导致声学特征叠加与互反射延迟混叠的问题,SoundMHPE 用多尺度 STFT 编码器与每帧每人独立查询的时序解码器在 6 小时 AMP 数据集上实现多人 3D 姿态估计,并在 MPJPE 等指标上优于声学与 WiFi 基线,代价是需在受控室内采集与同步动捕数据。
论文证明若变形类参数多于观测则残差选型只排正则项,据此把挑选限制为每原子一个复增益加纯时延、重建改用对齐原子的局部联合最小二乘,在 MUSDB18 上把准则与池内神谕的距离从 6.2–7.7 dB 压到 0.5–2.8 dB 但仅 0.9–1.2 dB 落到输出,并量化剩余 10.0 dB 锁来自对混合而非对目标的打分。
音频深度伪造检测 | 7.4/10
音频深度伪造检测 | 6.5/10
音频分类 | 7.5/10
语音情感识别 | 8.0/10
音频问答 | 8.0/10