论文解读

Why Do You Say It Like That? A Phoneme-Level Framework for Explainable Speech Deepfake Detection

语音伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6461 字 阅读 →
论文解读

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

音频字幕生成 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7179 字 阅读 →
论文解读

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

音频理解 | 6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7796 字 阅读 →
论文解读

Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings

音频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7745 字 阅读 →
论文解读

Unified Audio Intelligence Without Regressing on Text Intelligence

音频交互 | 6.8/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3294 字 阅读 →
论文解读

AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing

音频生成 | 5.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7545 字 阅读 →
论文解读

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

音频理解 | 6.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5673 字 阅读 →
论文解读

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

音频理解 | 9.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6965 字 阅读 →
论文解读

MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8593 字 阅读 →
论文解读

Multimodal Fact-Level Attribution for Verifiable Reasoning

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11220 字 阅读 →
论文解读

SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations

音频理解 | 8.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7325 字 阅读 →
论文解读

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard

音频理解 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6409 字 阅读 →
论文解读

Adaptive Perturbation Selection for Contrastive Audio Decoding

音频理解 | 5.3/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11109 字 阅读 →
论文解读

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

音频理解 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8254 字 阅读 →
论文解读

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

说话人验证 | 7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8893 字 阅读 →
论文解读

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)缺乏显式、高质量推理能力的问题。现有方法要么受限于监督数据的质量,要么使用粗糙的奖励,导致生成的思维链形式良好但缺乏声学依据。作者提出了**Audio-DeepThinker**框架,其核心贡献有三:1)设计了一种**混合推理相似度奖励**,结合LLM评

 · 更新于 2026-09-25 · 约 11 分钟 · 5355 字 阅读 →
论文解读

A Manual Bar-by-Bar Tempo Measurement Protocol for Polyphonic Chamber Music Recordings: Design, Validation, and Application to Beethoven's Piano and Cello Sonatas

本文旨在解决现有自动化节拍提取工具在分析历史复调室内乐录音(特别是贝多芬钢琴与大提琴奏鸣曲)时出现的系统性失败问题。作者与一名VLSI工程师合作,设计并验证了一套形式化的手动逐小节速度测量协议。该协议

 · 更新于 2026-09-25 · 约 9 分钟 · 4486 字 阅读 →
论文解读

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

这篇论文旨在解决当前音频大语言模型(AudioLLMs)在细粒度声学感知任务上表现不佳的核心问题。作者指出,主流的以自动语音识别(ASR)为中心的训练范式,通过将音频映射到纯文本转录,系统性地丢弃了副

 · 更新于 2026-09-25 · 约 10 分钟 · 4974 字 阅读 →
论文解读

Elastic Net Regularization and Gabor Dictionary for Classification of Heart Sound Signals using Deep Learning

本文旨在解决心音信号(PCG)的多分类问题,以辅助心血管疾病的自动诊断。核心贡献在于提出了一套结合**优化Gabor字典**和**弹性网络正则化**的特征提取框架,并与**CNN-LSTM深度学习网络

 · 更新于 2026-09-25 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Enhancing time-frequency resolution with optimal transport and barycentric fusion of multiple spectrogram

**核心问题**:短时傅里叶变换(STFT)生成的谱图受制于不确定性原理,无法同时获得优异的时间和频率分辨率。传统融合方法(如几何平均)要求输入谱图网格对齐,且性能有限。 **核心方法**:本文提出一

 · 更新于 2026-09-25 · 约 12 分钟 · 5832 字 阅读 →