会议总览

ICASSP 2026 语音/音频论文详细分析

共分析 898 篇 ICASSP 2026 论文

 · 更新于 2026-09-24 · 约 2150 分钟 · 1076787 字 阅读 →
论文解读

一个模型应对多种测量布局:把空间聚合与频率建模分开做 HRTF 上采样

针对稀疏测量到稠密 HRTF 的上采样受固定测量布局限制的问题,GeoAtt 用逐频点查询条件空间聚合加 Conformer 频率建模实现单个模型适配多种布局,在 SONICOM 四个 LAP 布局上报告了最低对数谱失真,但受限测量覆盖下误差仍明显上升且代码权重本次未能确认可达。

 · 约 19 分钟 · 9275 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 约 112 分钟 · 55814 字 阅读 →
论文解读

把帧率压到八分之一:TurboCTC 如何用块内降采样换速度

该文用 16 层 Conformer 编码器加 CTC 解决英文短语音转写,在仅公开数据与三阶段训练下以 470M 参数进入 OpenASR 速度精度前沿,代价是依赖大幅降采样与 16K 子词建模。

 · 更新于 2026-09-24 · 约 17 分钟 · 8333 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 67 分钟 · 33126 字 阅读 →
论文解读

注意力也会分心:用差分门控让 Conformer 在噪声中保持对比度

针对 Conformer 在噪声下注意力分散导致上下文建模退化的问题,论文提出混合式修正差分门控注意力 Conformer,在保持参数量基本一致时于 Librispeech 干净与加噪测试上取得相对词错误率下降,但小模型增益有限且早期全量替换会损害表征。

 · 更新于 2026-09-24 · 约 18 分钟 · 8592 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

不要语言模型改错,还能从皮层电流读出句子吗

该研究用会话对齐加 Conformer 加 CTC 直接从皮层神经活动解码字符序列,在验证集上报告字符错误率为 23.80%,代价是跨会话信号漂移仍大且词边界错误集中。

 · 更新于 2026-09-24 · 约 21 分钟 · 10166 字 阅读 →
论文解读

同一骨干跑通检测与分类:MEGConformer 靠归一化弥合保留集偏移

该研究用同一 Conformer 骨干同时做语音检测和音素分类,最强证据是标准赛道保留集上语音 88.9% 与音素 73.6% 的 F1-macro,主要代价是音素任务依赖 100 样本平均、多数投票集成和实例归一化才能跨分布泛化。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

并行解耦全局与局部:E-Branchformer 在音频伪造检测中的可复述设计

针对语音伪造检测中自监督表示难以同时捕捉长程与短程线索的问题,论文用并行全局注意力与局部卷积分支加解耦类令牌与 DWConv-SE 融合的 E-Branchformer,在 ASVspoof 2021 LA/DF 与 ITW 上取得 0.88%/1.85%/6.30% EER 并在 ASVspoof 5 上取得 5.44% EER,代价是四层编码器与细粒度融 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7822 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 93 分钟 · 46170 字 阅读 →
论文解读

Acoustic Landmark Detector based on Conformer and HuBERT

语音识别 | 5.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10238 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-23

共分析 83 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 224 分钟 · 112108 字 阅读 →
论文解读

QC-GAN: A Parameter-Efficient Quaternion Conformer GAN for High-Fidelity Speech Enhancement

语音增强 | 7.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6928 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 105 分钟 · 52107 字 阅读 →
论文解读

AURA: A Stegaformer-Based Scalable Deep Audio Watermark with Extreme Robustness

音频水印 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5484 字 阅读 →
论文解读

Fine-Grained Frame Modeling in Multi-Head Self-Attention for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4097 字 阅读 →
论文解读

Noise-Robust Contrastive Learning with an MFCC-Conformer for Coronary Artery Disease Detection

音频分类 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Non-Line-of-Sight Vehicle Detection via Audio-Visual Fusion

音频分类 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4086 字 阅读 →