论文解读
STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs
语音识别 | 8.0/10
语音识别 | 8.0/10
音频生成 | 8.5/10
1. **问题**:训练一个既能高精度离线转录又能低延迟流式识别的统一ASR模型极具挑战性,传统方法在低延迟下性能会急剧下降。 2. **方法核心**:提出一个统一的Transducer框架,结合分块注意力(含右上下文)和动态块卷积(DCConv)来适配两种模式。核心创新是引入了模式一致性正则化损失
本文旨在解决训练单一自动语音识别(ASR)模型同时高效支持高精度离线转写和低延迟流式识别这一挑战。现有统一模型在低延迟流式模式下性能下降明显。作者提出了一个统一的RNN-Transducer (RNNT) 框架,其核心是结合了**带右上下文的chunk限制注意力**和**动态chunk卷积(DCCo
**核心贡献**:本文提出了首个专为全双工语音交互设计的统一音频前端大模型(UAF)。它打破了传统级联式前端处理的范式,将语音活动检测(VAD)、说话人识别(SR)、自动语音识别(ASR)、轮次检测(TD)和问答(QA)等多个任务,统一建模为一个自回归序列预测问题。 **关键方法**:模型采用“音
这篇论文旨在解决当前音频大语言模型(AudioLLMs)在细粒度声学感知任务上表现不佳的核心问题。作者指出,主流的以自动语音识别(ASR)为中心的训练范式,通过将音频映射到纯文本转录,系统性地丢弃了副
本文针对现有语音变分自编码器(VAE)在统一语音重建、理解和生成任务上表现不平衡的问题(尤其是理解能力差),系统性地研究了蒸馏损失函数的设计空间。作者探索了三种将自监督学习(SSL)模型知识蒸馏到VA