ICASSP 2026 语音/音频论文详细分析
共分析 898 篇 ICASSP 2026 论文
共分析 898 篇 ICASSP 2026 论文
针对稀疏测量到稠密 HRTF 的上采样受固定测量布局限制的问题,GeoAtt 用逐频点查询条件空间聚合加 Conformer 频率建模实现单个模型适配多种布局,在 SONICOM 四个 LAP 布局上报告了最低对数谱失真,但受限测量覆盖下误差仍明显上升且代码权重本次未能确认可达。
共分析 62 篇语音/AI 论文
该文用 16 层 Conformer 编码器加 CTC 解决英文短语音转写,在仅公开数据与三阶段训练下以 470M 参数进入 OpenASR 速度精度前沿,代价是依赖大幅降采样与 16K 子词建模。
共分析 36 篇语音/AI 论文
针对 Conformer 在噪声下注意力分散导致上下文建模退化的问题,论文提出混合式修正差分门控注意力 Conformer,在保持参数量基本一致时于 Librispeech 干净与加噪测试上取得相对词错误率下降,但小模型增益有限且早期全量替换会损害表征。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究用会话对齐加 Conformer 加 CTC 直接从皮层神经活动解码字符序列,在验证集上报告字符错误率为 23.80%,代价是跨会话信号漂移仍大且词边界错误集中。
该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对语音伪造检测中自监督表示难以同时捕捉长程与短程线索的问题,论文用并行全局注意力与局部卷积分支加解耦类令牌与 DWConv-SE 融合的 E-Branchformer,在 ASVspoof 2021 LA/DF 与 ITW 上取得 0.88%/1.85%/6.30% EER 并在 ASVspoof 5 上取得 5.44% EER,代价是四层编码器与细粒度融 …
共分析 44 篇语音/AI 论文
语音识别 | 5.5/10
共分析 83 篇语音/AI 论文
语音增强 | 7.1/10
共分析 36 篇语音/AI 论文
音频水印 | 7.5/10
语音伪造检测 | 8.0/10
音频分类 | 7.0/10
音频分类 | 8.0/10