论文解读

Whisper-FEST: Single-Channel Far-Field Enhanced Speech-to-text without Parallel Data

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4962 字 阅读 →
论文解读

Whisper-QF: Leveraging Dual Cross-Attention Q-Former for Speech Emotion Recognition With Multi-Task Learning

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5139 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 87 分钟 · 43144 字 阅读 →
论文解读

Explicit Dropout: Deterministic Regularization for Transformer Architectures

这篇论文旨在解决传统Dropout方法依赖随机掩码、正则化效果不透明且难以精确控制的问题。其核心方法是提出一种确定性公式,将Dropout重新表述为一个可直接加入训练损失函数的显式正则化项,并推导出了适用于Transformer架构中注意力机制(Q、K、V)和前馈网络的正则化表达式。与已有方法相比,

 · 更新于 2026-09-06 · 约 5 分钟 · 2497 字 阅读 →
论文解读

FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection

这篇论文针对全双工语音对话系统中需要低延迟、高精度判断用户是否结束发言(轮次检测)的难题,提出了FastTurn统一框架。其核心方法是将流式CTC解码提供的快速部分语义信息,与Conformer编码器提取的声学特征,通过适配器输入给大语言模型(LLM)进行推理,并最终融合声学与语义特征进行轮次预测。

 · 更新于 2026-09-06 · 约 10 分钟 · 4565 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-23

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 73 分钟 · 36076 字 阅读 →
论文解读

Incremental learning for audio classification with Hebbian Deep Neural Networks

本文针对音频分类中的增量学习(持续学习)问题,提出了一种受生物启发的解决方案。核心是解决深度学习模型在学习新任务时对旧知识的“灾难性遗忘”。作者首次将**Hebbian学习**(一种基于神经元同步激活的无监督、无反馈学习规则)与**增量学习**相结合,并设计了一个**核塑性**机制。该机制通过分析训

 · 更新于 2026-09-06 · 约 8 分钟 · 3781 字 阅读 →
论文解读

SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

本文旨在解决对话系统中情感识别(ERC)与情感表达能力受限于高质量标注数据稀缺且静态的问题。**核心贡献**是提出了一个心理学动机的自我进化框架 **SELF-EMO**。**关键方法**是构建一个角色扮演的自博弈范式,使模型同时充当“情绪识别者”和“对话响应者”,并通过一个“生成-筛选-重用”的数

 · 更新于 2026-09-06 · 约 8 分钟 · 3893 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-21

共分析 34 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 73 分钟 · 36177 字 阅读 →
论文解读

Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction

本文旨在解决音频-视觉导航(AVN)智能体在未见环境和未闻声音类别下泛化能力差的核心问题。作者指出,现有方法性能下降主要源于两个因素:一是音频表征混淆了语义与空间信息,导致对未闻声��定位不准;二是强化学习策略过拟合于训练环境的动态和布局。为此,本文提出了一个名为BDATP的即插即用框架。在感知层面

 · 更新于 2026-09-06 · 约 11 分钟 · 5221 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-20

共分析 24 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 50 分钟 · 24566 字 阅读 →