每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 93 分钟 · 46170 字 阅读 →
论文解读

音频三路特征与视频时空建模为何需要注意力来对齐:多模态情绪识别的可复述路径

针对单模态易受噪声与信息缺失影响的问题,论文用 Wav2Vec2、MFCC 与统计声学特征经 BiLSTM 建模音频、用 ResNet50-BiLSTM 建模视频,并以多头交叉注意力做特征级融合,在 MELD 上微平均 93.7% 与 IEMOCAP 上 90.3% 准确率上验证效果,但未报告训练超参细节与统计显著性。

 · 更新于 2026-09-25 · 约 22 分钟 · 10959 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-09

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 2 分钟 · 1002 字 阅读 →
论文解读

多深度谐波卷积如何让乐器无关转录在小参数下仍保持高帧精度

针对单乐器身份未知的乐器无关转录,Harmonica 以 CQT 输入与多深度谐波卷积在多源温度采样训练下实现 26.3K 至 15.1M 的规模化,x-large 在多数测试集上取得最高帧 F1,medium 以 848.5 倍实时保持可比精度,nano 以 1622.5 倍实时仍显著超过同量级基线。

 · 更新于 2026-09-25 · 约 21 分钟 · 10282 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 72 分钟 · 35908 字 阅读 →
论文解读

先听见,再分清:两级级联如何把稀有虎鲸从海噪里捞出来

音频分类 | 6.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9076 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24532 字 阅读 →
论文解读

开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13172 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 69 分钟 · 34077 字 阅读 →
论文解读

在茶树里听见白蚁:当 81.5% 的准确率比 98% 更诚实

音频分类 | 5.1/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11553 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 66 分钟 · 32614 字 阅读 →
论文解读

一条咳嗽模型的跨国体检:高分为何更像设备在说话

音频分类 | 8.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5492 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 54 分钟 · 26637 字 阅读 →
论文解读

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

空间音频 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6952 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-26

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 68 分钟 · 33830 字 阅读 →
论文解读

AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS

音频水印 | 7.9/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →
论文解读

LipsAM: Lipschitz-continuous Neural Networks for Convergent Plug-and-Play Audio Signal Recovery

音频修复 | 10.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4404 字 阅读 →
论文解读

PolyChirp: Multi-Species Birdsong Classification Using TinyML on Low-Power Acoustic Sensors

音频分类 | 10.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4900 字 阅读 →
论文解读

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

音视频理解 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4759 字 阅读 →
论文解读

Simulation-to-Real First-Break Segmentation for Efficient Inversion in Musculoskeletal Ultrasound Tomography

音频事件检测 | 9.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4588 字 阅读 →