不存更多指纹,只在查询时多算一步:POLARIS 的显著性地标与查询侧扩展
针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。
针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。
针对前景与背景共现偏移导致的小样本音频分类失效,SampleSelect 在冻结编码器下为每个样本学习固定预算的特征掩码,在 SpurAudio 四个设置中取得相比方法的最高 OOD 准确率,并以 4.90-8.38 个百分点的提升超过匹配的 FullRep 对照,但选择预算与对比权重仍需按源域设定且诊断分析只建立关联而非因果。
论文针对日常录音下声音亲缘验证线索稀疏且跨库泛化难的问题,选择卷积局部编码加变换器长程聚合与注意力池化的两阶段度量学习路线,在自建普通话非受控库 ARKIN 上报告 CONVTRAP-TN 优于三元组基线,但从 KAN-AV 跨库到 ARKIN 时性能大幅下降且少量微调难以恢复。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。
该研究以二分类检测特发性帕金森病的运动性言语障碍为问题,用冻结的 Wav2Vec 2.0 XLS-R 加 128 维多层注意力分类头做跨库评估,最强证据是三库联合训练在未见过的 MDVR-KCL 上达到 85.3% AUC 并避免单库模型的跨库崩塌,代价是对低 UPDRS 评分和 OFF-DOPA 条件的患者仍明显更难检出且结果受随机划分影响大。
论文复现基于频谱的句级嗓音强度回归并在新录音条件下发现其失效,进而用 Wav2Vec 2.0 浅层表示训练回归器,在 VIC 上把决定系数维持在 0.83 左右,代价是跨条件差距仍未完全消除。
该研究把单语和多语语音基础模型放在同一微调与分类流程下比较伪造检测,报告显示多语模型在域内和野外数据上更稳健,但超大规模参数并未带来系统性增益且单语模型在未知压缩与信道下退化明显。
该研究以 LibriTTS 子集与 LibriTTS-R 对照比较 X-Vector 与 ECAPA-TDNN 在加噪、混响、加静音与神经声码器重建下的嵌入空间结构,报告 ECAPA-TDNN 更稳健但强混响与音频修复仍使类间可分性与最近说话人分类明显下降,而 X-Vector 对环境伪影更敏感。
针对语音激励、混响与噪声变化下的批量声学系统辨识,该工作把最小二乘加多重稀疏约束的参数化模型族用交替方向乘子法求解并展开为 ADMM-SysIDNet,在 Bar-Ilan 实测房间冲激响应与 LibriSpeech 激励下以归一化均方偏差为指标优于最小二乘和 ADMM-ℓ1,代价是依赖分混响条件的离线训练与批量观测流程。
针对多通道前馈主动噪声控制中次级扬声器到参考麦的声反馈在主噪声持续存在时难以标定的问题,论文提出用参考组到反馈组的相对传递矩阵加协方差相减来估计并扣除反馈分量,仿真报告显示其降噪接近理想无主噪声标定上界而直接估计与无补偿基线失稳或仅约负 2 分贝,代价是需要两次受控测量与额外反馈麦组。
针对增强现实眼镜耳处无误差麦克风导致无法直接做有源噪声控制的问题,论文验证辅助滤波器虚拟传感的必要性并推导其方向敏感性,用自由场仿真显示固定滤波器在方向失配时退化,而按声源方向从有限滤波器库中选择可在因果区内部分恢复性能,但仍不及逐方向重标定。
针对语言、视觉、声音互相冲突时融合不可靠的问题,CICA 先让每个单模态编码器输出置信度和不确定度,再用它们调制融合注意力,在 MOSI 上报告 MAE 0.630 和 Corr 0.855、在 MOSEI 上报告 MAE 0.489 和 Corr 0.856,代价是需要两阶段训练并保留互信息正则以防止文本主导时压垮其他模态。
针对可穿戴 6 自由度声音事件定位与检测中混响和噪声破坏声学空间线索的问题,该文用信噪比与混响时间辅助监督学场景嵌入并以此控制音频-运动融合门,在 6DoF SELD 数据集上把聚合误差降到 0.265、相对静态融合降低 5.69%,代价是增加 18.6K 参数和 37.4M 计算量。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对分布式子阵列间通信贵、难同步的问题,论文提出只在子阵列间共享非负矩阵分解变量的三种去中心化独立低秩矩阵分析,并报告基共享变体在混响与采样时间偏移下保持稳定分离的主要证据与建模代价。
针对 Conformer 在噪声下注意力分散导致上下文建模退化的问题,论文提出混合式修正差分门控注意力 Conformer,在保持参数量基本一致时于 Librispeech 干净与加噪测试上取得相对词错误率下降,但小模型增益有限且早期全量替换会损害表征。
针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。
该研究用受控仿真对比卷积噪声与加性噪声对房间脉冲响应表征的影响,显示在能量交点附近截断卷积噪声并在增强时加入加性噪声能改善潜空间可分性与混响时间估计,而把过长噪声尾保留进训练会损害向真实混响语音的泛化。