论文解读
Why Do You Say It Like That? A Phoneme-Level Framework for Explainable Speech Deepfake Detection
语音伪造检测 | 6.5/10
语音伪造检测 | 6.5/10
音频字幕生成 | 6.3/10
音频理解 | 6/10
音频理解 | 6.2/10
音频交互 | 6.8/10
音频生成 | 5.8/10
音频理解 | 6.2/10
音频理解 | 9.1/10
音频理解 | 6.4/10
音频理解 | 6.4/10
音频理解 | 8.4/10
音频理解 | 8.3/10
音频理解 | 5.3/10
音频理解 | 7.9/10
说话人验证 | 7/10
这篇论文旨在解决大型音频语言模型(LALMs)缺乏显式、高质量推理能力的问题。现有方法要么受限于监督数据的质量,要么使用粗糙的奖励,导致生成的思维链形式良好但缺乏声学依据。作者提出了**Audio-DeepThinker**框架,其核心贡献有三:1)设计了一种**混合推理相似度奖励**,结合LLM评
本文旨在解决现有自动化节拍提取工具在分析历史复调室内乐录音(特别是贝多芬钢琴与大提琴奏鸣曲)时出现的系统性失败问题。作者与一名VLSI工程师合作,设计并验证了一套形式化的手动逐小节速度测量协议。该协议
这篇论文旨在解决当前音频大语言模型(AudioLLMs)在细粒度声学感知任务上表现不佳的核心问题。作者指出,主流的以自动语音识别(ASR)为中心的训练范式,通过将音频映射到纯文本转录,系统性地丢弃了副
本文旨在解决心音信号(PCG)的多分类问题,以辅助心血管疾病的自动诊断。核心贡献在于提出了一套结合**优化Gabor字典**和**弹性网络正则化**的特征提取框架,并与**CNN-LSTM深度学习网络
**核心问题**:短时傅里叶变换(STFT)生成的谱图受制于不确定性原理,无法同时获得优异的时间和频率分辨率。传统融合方法(如几何平均)要求输入谱图网格对齐,且性能有限。 **核心方法**:本文提出一