每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

保留弹奏、只换效果:Clean2FX 用标签条件让同一段干琴长出十种音色

论文把问题定为给定干声吉他与目标效果标签、合成对应效果声并保留音乐内容,用同一事件序列配对的 EGFxSet 衍生数据比较四种谱变换模型,最强证据是 log 幅度 U-Net 相对复制输入基线平均改善 MSE 约 70.6% 与 FAD 约 31.8%,代价是延迟混响类 FAD 增益弱且域外真实演奏变换减弱。

 · 更新于 2026-09-24 · 约 18 分钟 · 8747 字 阅读 →
论文解读

数模态个数再估计参数:计数密度网络如何把板混响脉冲变成模态三元组

任务是从合成板混响位移脉冲响应中恢复未知个数的频率、衰减和增益三元组,方法用 1/20 倍频程计数密度加固定槽位回归同时估计总数与属性,在 100 条独立脉冲的对比集上两个神经估计器的总相对误差约为 0.32,低于最强经典基线的约 1.10,但增益误差仍是主要误差来源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9053 字 阅读 →
论文解读

极点不动、留数会动:用三视图与饱和分裂收割密集平板模态

针对非归一化位移脉冲响应中数千个重叠平板模态难以逐个分辨的问题,该工作用匹配追踪锚定加原始与一阶二阶差分三视图子带自回归极点收割、饱和频带递归分裂与饱和指示补数,最后做全局岭最小二乘增益回填,其代价是相距不足 1 Hz 的邻近模态增益仍无法分离。

 · 更新于 2026-09-24 · 约 20 分钟 · 9674 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

加密音频也要算频谱:用近似短时傅里叶把量化误差让给比特预算

论文把短时傅里叶、Mel、倒谱和 Gammatone 直接搬到全同态加密上,用膨胀、贫民变换等近似降低累加器位宽,在 VocalSet 和 OxVoc 上把描述符统计错误率从常规方法的 5.9% 和 6.5% 降到膨胀 4 倍时的 4.7% 和 1.9%,代价是 64 毫秒音频加密计算约 12970 秒且高频谐波丢失。

 · 更新于 2026-09-24 · 约 17 分钟 · 8157 字 阅读 →
论文解读

从一条脉冲响应反推钢板参数:用仿真样本直接学后验分布

该研究把板混响辨识做成仿真推断问题,用多分辨率频谱摘要加神经样条流学习六维参数后验,再对每条测试脉冲响应做三轮定向仿真微调,最强可部署策略把全局误差降到 0.47×10-3,代价是每条约 2.5 h 的推理微调成本。

 · 更新于 2026-09-24 · 约 20 分钟 · 9520 字 阅读 →
论文解读

先猜五维再对波形:可微合成与粒子群如何把板混响参数推到近乎完全恢复

任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9470 字 阅读 →
论文解读

以小波分频外推替代部分 ODE 求解:WaveEx 的加速逻辑与适用边界

针对流匹配语音生成中 ODE 反复调用神经网络导致推理慢的问题,WaveEx 用单层小波分解加一阶泰勒分频外推替代部分求解步骤,在四类任务上报告 2.75-5.73 倍加速,代价是早期高曲率段仍需保留少量 ODE 步且高频外推带来轻微波动。

 · 更新于 2026-09-24 · 约 22 分钟 · 10760 字 阅读 →
论文解读

按频带分开压缩:BSCodec 用独立编解码应对语音音乐音效的谱差异

针对语音能量集中而音乐音效需全频保真的问题,BSCodec 把频谱切成独立频带并行编码量化解码,在相同混合训练下以 2.55 kbps 和 3.83 kbps 对标 DAC 的 4.5 kbps 和 6 kbps,代价是编码器解码器数量随频带数增加且语音对切分粒度敏感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8964 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

信噪比为何失准:从相位距离重写音频生成的度量与损失

论文把信噪比失准归因于瞬时相位距离不可靠,用全向相位导数重写相关项得到 GOMPSNR,并在声码器与编解码器上验证其与听感指标更相关且导出损失能提升重建质量,但线性幅度等组合在小数据上存在过拟合代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9170 字 阅读 →
论文解读

给黑盒声码器加先验:低频子带引导与按能量加权的相位监督

针对梅尔声码器黑盒预测丢失频谱细节与相位包裹难监督的问题,SCNet 用低频子带先验耦合到逆变换主干并以幅度加权相位损失训练,在域内与跨说话人测试及 CosyVoice 合成中报告更高质量,但合成速度不及 Vocos 且通用音频能力待验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8539 字 阅读 →
论文解读

多人声场叠加下如何用声音同时还原三维姿态:SoundMHPE 的多尺度与时序解耦

针对多人运动导致声学特征叠加与互反射延迟混叠的问题,SoundMHPE 用多尺度 STFT 编码器与每帧每人独立查询的时序解码器在 6 小时 AMP 数据集上实现多人 3D 姿态估计,并在 MPJPE 等指标上优于声学与 WiFi 基线,代价是需在受控室内采集与同步动捕数据。

 · 更新于 2026-09-24 · 约 23 分钟 · 11142 字 阅读 →
论文解读

什么在挑选、什么在重建:当变形类能插值时选择为何失效

论文证明若变形类参数多于观测则残差选型只排正则项,据此把挑选限制为每原子一个复增益加纯时延、重建改用对齐原子的局部联合最小二乘,在 MUSDB18 上把准则与池内神谕的距离从 6.2–7.7 dB 压到 0.5–2.8 dB 但仅 0.9–1.2 dB 落到输出,并量化剩余 10.0 dB 锁来自对混合而非对目标的打分。

 · 更新于 2026-09-24 · 约 22 分钟 · 10720 字 阅读 →
论文解读

MusicDET: Zero-Shot AI-Generated Music Detection

音频深度伪造检测 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7396 字 阅读 →
论文解读

Quantum Kernels for Audio Deepfake Detection Using Spectrogram Patch Features

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7805 字 阅读 →
论文解读

Hearing the Ocean: Bio-inspired Gammatone-CNN framework for Robust Underwater Acoustic Target Classification

音频分类 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4734 字 阅读 →
论文解读

Learnable Fractional Superlets with a Spectro-Temporal Emotion Encoder for Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5399 字 阅读 →
论文解读

Query-Guided Spatial–Temporal–Frequency Interaction for Music Audio–Visual Question Answering

音频问答 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4257 字 阅读 →