配准耳甲几何能压缩多少个性化 HRTF 信息:30 维 PCA 与多域损失的受控对照
该工作用共享拓扑的配准耳网格研究几何驱动的个性化 HRTF 合成,对比 30 维 PCA 几何与全分辨率网格、潜空间与全信号回归以及单域与多域损失,显示多域复合损失把时域表示的 LSD 从约 15 dB 降到约 9.4 dB,但全几何增益依赖表示且波形一致性仍有限。
该工作用共享拓扑的配准耳网格研究几何驱动的个性化 HRTF 合成,对比 30 维 PCA 几何与全分辨率网格、潜空间与全信号回归以及单域与多域损失,显示多域复合损失把时域表示的 LSD 从约 15 dB 降到约 9.4 dB,但全几何增益依赖表示且波形一致性仍有限。
针对循环脉冲网络中稠密循环矩阵参数平方增长的问题,该工作用核长为 3 的一维卷积替代全连接循环并保留每个神经元可学习的轴突延迟,在 SHD 上达到 91.51% 精度并把单层循环参数从 65792 降到 259,代价是在 SSC 上落后 DelRec 约 4 个百分点且 SSC 未做超参搜索。
针对短于两分钟与低信噪比录音中相关系数与归一化错位难以区分对齐与错位片段的问题,该工作用时域卷积编码器学习三谐波潜在表示并与原始相关分数线性融合做检索式时间戳估计,在跨电网训练与测试下把全部长度成功率从 77.63% 提升到 85.63%,短录音从 55.14% 提升到 73.14%,代价是仍依赖短时傅里叶提取与十五秒容差判定且长录音增益收窄。
该研究用同一卷积神经网络比较幅度与相位四类时频特征的全部小组合,报告显示域内语音用 ILD 加 IPD 在 0 度仰角达 4.5 度误差,而跨内容泛化需通道相位谱加 ILD 与 IPD 并在域外以 8.4 度误差超过更大 Transformer,代价是特征通道增多与对纯音等结构贫乏信号仍失效。
该工作把板混响脉冲响应转为降采样后的多分辨率幅度谱加相位通道并用改造残差网络回归物理参数,在 5000 条验证集上报告平均归一化均方误差为 0.02920,代价是主动舍弃高频段并依赖仿真条件。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
该文在 VoxCeleb2 上系统改变 ResNet 的深度、宽度和阶段分布并用节点级传感器实测训练与推理能耗,显示超过 ResNet-101-D/ResNet-200-D 后精度增益迅速收窄而能耗陡增,中型与中间阶段集中结构取得更优的性能与环境折中。
论文把问题定为给定干声吉他与目标效果标签、合成对应效果声并保留音乐内容,用同一事件序列配对的 EGFxSet 衍生数据比较四种谱变换模型,最强证据是 log 幅度 U-Net 相对复制输入基线平均改善 MSE 约 70.6% 与 FAD 约 31.8%,代价是延迟混响类 FAD 增益弱且域外真实演奏变换减弱。
任务是从合成板混响位移脉冲响应中恢复未知个数的频率、衰减和增益三元组,方法用 1/20 倍频程计数密度加固定槽位回归同时估计总数与属性,在 100 条独立脉冲的对比集上两个神经估计器的总相对误差约为 0.32,低于最强经典基线的约 1.10,但增益误差仍是主要误差来源。
针对单通道双人语音分离,eConv-TasNet 在保留编码器解码器基础上以组级早分离替代逐单元分离并以指数加权跨组聚合替代全量求和,在多基准上提升分离质量并降低参数与延迟,代价是峰值精度仍低于大参数 Transformer 路线。
该文研究原始波形语音伪造检测,用一维 ResNet34 把首层卷积扩大到 160 采样点,在 ASVspoof2019 LA 评估集上报告等错误率 1.37% 与最小串联检测代价 0.0429,代价是首层参数与优化负担增加且困难攻击仍集中出错。
针对 DAFx 参数估计挑战 Task A 从未归一化位移脉冲响应恢复板混响物理参数的问题,论文用三层一维卷积加双向 GRU 的时域回归器直接预测六个可辨识参数,在 150 例开发测试集上以参数归一化均方误差 0.0499 优于粒子群优化基线的 0.0618,并把单条推理时间从 36.46 秒降到 1.10 秒,代价是面密度一项略差且最优检查点早在第 5 轮 …
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。
该研究把板混响辨识做成仿真推断问题,用多分辨率频谱摘要加神经样条流学习六维参数后验,再对每条测试脉冲响应做三轮定向仿真微调,最强可部署策略把全局误差降到 0.47×10-3,代价是每条约 2.5 h 的推理微调成本。
针对脉冲神经网络在语音命令识别中时序建模弱的问题,论文提出多视角脉冲时间感知注意力与上下文精炼 MLP 构成的 SpikCommander,在 SHD、SSC、GSC 上以 100 时间步取得更高精度,代价是更长的时序展开与更复杂的分支结构。
共分析 42 篇语音/AI 论文
该文要解决厅堂在人员与声源变化下混响时间漂移的问题,选择用卷积神经网络估计当前混响时间再由强化学习调节面板吸声系数的闭环路线,给出的最强证据是动态条件下把混响时间维持在目标 0.15 秒以内,代价是全过程依赖仿真反馈且未报告真实厅堂部署的延迟与能耗实测。
针对传统降噪不分期望声与噪声一起压制的问题,该文把保向降噪写成降噪项与保持项加权优化,用方向调制的卷积网络从混合参考一次估计多通道 FIR 滤波器组,在 3300 个仿真场景以 22.8 dB 降噪和 -11.4 dB 期望失真取得折中,代价是近方向受阵列可分性限制且需按几何重训。
针对语音情感识别中时序依赖不稳定与计算冗余问题,SETEAB 在 TIM-Net 基础上引入深度可分离下采样、SE-Res2Block、TEAB 与全局加权双向融合,在 5 个库平均上以 0.06 - 0.12 GFLOPs 实现 47.69% UA 与 45.23% F1,并在跨库平均 WA 上达到 37.53% 且保持 0.4 - 0.5M 参数量级。