每日研究速递
语音/音乐/音频论文速递 2026-09-10
共分析 44 篇语音/AI 论文
共分析 44 篇语音/AI 论文
针对单模态易受噪声与信息缺失影响的问题,论文用 Wav2Vec2、MFCC 与统计声学特征经 BiLSTM 建模音频、用 ResNet50-BiLSTM 建模视频,并以多头交叉注意力做特征级融合,在 MELD 上微平均 93.7% 与 IEMOCAP 上 90.3% 准确率上验证效果,但未报告训练超参细节与统计显著性。
共分析 1 篇语音/AI 论文
针对单乐器身份未知的乐器无关转录,Harmonica 以 CQT 输入与多深度谐波卷积在多源温度采样训练下实现 26.3K 至 15.1M 的规模化,x-large 在多数测试集上取得最高帧 F1,medium 以 848.5 倍实时保持可比精度,nano 以 1622.5 倍实时仍显著超过同量级基线。
共分析 38 篇语音/AI 论文
音频分类 | 6.7/10
共分析 18 篇语音/AI 论文
语音增强 | 7.5/10
共分析 23 篇语音/AI 论文
音频分类 | 5.1/10
共分析 22 篇语音/AI 论文
音频分类 | 8.8/10
共分析 21 篇语音/AI 论文
空间音频 | 6.9/10
共分析 26 篇语音/AI 论文
音频水印 | 7.9/10
音频修复 | 10.0/10
音频分类 | 10.0/10
音视频理解 | 9.0/10
音频事件检测 | 9.8/10