论文解读

TinyMU: A Compact Audio-Language Model for Music Understanding

本文针对现有大型音频语言模型(LALM)参数庞大(数十亿级)、训练推理成本高、难以部署在边缘设备的问题,提出了 TinyMU——一个仅有 229M 参数的紧凑音乐语言模型。为此,作者构建了 MusicSkills-3.5M 数据集,包含 350 万个涵盖多选、二元判断和开放式格式的音乐问答样本,结合

 · 更新于 2026-10-02 · 约 9 分钟 · 4133 字 阅读 →
论文解读

VoxMind: An End-to-End Agentic Spoken Dialogue System

端到端语音对话模型在自然交互上进步迅速,但普遍缺乏处理复杂任务的agent能力(工具调用、规划、推理)。本文首先形式化定义了"端到端语音智能体"的四大维度——画像(Profile)、记忆(Memory)、规划(Planning)与执行(Action Execution),填补了该领域理论标准的空白。

 · 更新于 2026-10-02 · 约 16 分钟 · 8001 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-20

共分析 24 篇语音/AI 论文

 · 更新于 2026-10-02 · 约 50 分钟 · 24566 字 阅读 →
论文解读

A Manual Bar-by-Bar Tempo Measurement Protocol for Polyphonic Chamber Music Recordings: Design, Validation, and Application to Beethoven's Piano and Cello Sonatas

本文旨在解决现有自动化节拍提取工具在分析历史复调室内乐录音(特别是贝多芬钢琴与大提琴奏鸣曲)时出现的系统性失败问题。作者与一名VLSI工程师合作,设计并验证了一套形式化的手动逐小节速度测量协议。该协议

 · 更新于 2026-10-02 · 约 9 分钟 · 4486 字 阅读 →
论文解读

Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification

本文旨在解决零样本呼吸音频分类中“一刀切”的推理计算浪费问题。为此,提出了TRIAGE框架,这是一个三层自适应推理管道:第一层(Tier-L)进行快速的标签-文本相似度匹配;若置信度不足则升级至第二层

 · 更新于 2026-10-02 · 约 11 分钟 · 5023 字 阅读 →
论文解读

An Ultra-Low Latency, End-to-End Streaming Speech Synthesis Architecture via Block-Wise Generation and Depth-Wise Codec Decoding

这篇论文旨在解决实时交互式语音合成中**推理延迟高**与**声学质量(尤其是高频细节)易受损**的核心矛盾。传统流水线依赖计算密集的神经声码器进行波形重建,且基于连续回归的声学模型易导致频谱过平滑。为

 · 更新于 2026-10-02 · 约 10 分钟 · 4673 字 阅读 →
论文解读

Audio Source Separation in Reverberant Environments using $β$-divergence based Nonnegative Factorization

本文针对混响环境下的多通道音频源分离问题,提出了一种基于β-散度非负因子分解的参数估计新方法。传统方法依赖期望最大化(EM)算法估计源频谱方差和空间协方差矩阵,本文则利用包含源频谱先验信息的基矩阵(可

 · 更新于 2026-10-02 · 约 6 分钟 · 2800 字 阅读 →
论文解读

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务上能力不足且依赖昂贵闭源数据的问题。作者提出了一个名为**Audio-Cogito**的全开源解决方案,其核心是**Cogito-Pip

 · 更新于 2026-10-02 · 约 10 分钟 · 4834 字 阅读 →
论文解读

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

这篇论文旨在解决当前全模态大模型在音视频不一致性理解能力上缺乏系统性评估的问题。现有基准要么只关注音视频对齐事件,要么局限于检测深度伪造中的低级伪影,无法评估模型对长视频中语义级矛盾的理解。为此,作者

 · 更新于 2026-10-02 · 约 12 分钟 · 5790 字 阅读 →
论文解读

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

这篇论文旨在解决当前音频大语言模型(AudioLLMs)在细粒度声学感知任务上表现不佳的核心问题。作者指出,主流的以自动语音识别(ASR)为中心的训练范式,通过将音频映射到纯文本转录,系统性地丢弃了副

 · 更新于 2026-10-02 · 约 10 分钟 · 4974 字 阅读 →
论文解读

ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning

这篇论文旨在解决卫星、水下等极端带宽受限场景下(如200bps)语音通信清晰度严重下降的问题。传统编解码器以波形重建为目标,在超低比特率下会将宝贵的比特分配给不必要的声学细节,而非核心语义信息。为此,

 · 更新于 2026-10-02 · 约 11 分钟 · 5506 字 阅读 →
论文解读

Classical Machine Learning Baselines for Deepfake Audio Detection on the Fake-or-Real Dataset

本文旨在解决深度伪造音频检测领域缺乏透明、可解释基线的问题。研究团队采用经典机器学习方法,在Fake-or-Real (FoR) 数据集上构建了一个完整的检测流程。他们从高保真(44.1 kHz)和电

 · 更新于 2026-10-02 · 约 10 分钟 · 4970 字 阅读 →
论文解读

Comparison of window shapes and lengths in short-time feature extraction for classification of heart sound signals

本文针对心音信号(PCG)分类任务中,因信号非-stationarity而采用滑动窗口分段提取特征时,窗函数形状和长度选择缺乏系统性研究的问题,进行了一项实验性评估。作者使用双向长短期记忆网络(biL

 · 更新于 2026-10-02 · 约 7 分钟 · 3490 字 阅读 →
论文解读

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

这篇论文旨在解决语音大模型(SLLM)在识别训练数据中稀有或未见的“偏置词”时性能不佳的问题。传统方法依赖于为偏置词提供精确的音素序列(通过G2P系统生成),但这对用户有专业要求且工具兼容性差。为此,

 · 更新于 2026-10-02 · 约 11 分钟 · 5353 字 阅读 →
论文解读

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

本文提出了ControlFoley,一个统一且可控的视频到音频生成框架,旨在解决现有方法在跨模态冲突下文本控制力弱、以及参考音频控制中音色与时间信息纠缠的问题。其核心贡献包括:1)提出联合视觉编码范式

 · 更新于 2026-10-02 · 约 13 分钟 · 6198 字 阅读 →
论文解读

CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing

本文针对电影配音(视觉语音克隆)中音色保真度与唇形同步难以兼得的痛点,提出了一种基于流匹配的认知同步扩散Transformer(CoSyncDiT)框架。该方法受专业配音员认知过程启发,将噪声到语音的

 · 更新于 2026-10-02 · 约 12 分钟 · 5835 字 阅读 →
论文解读

Diffusion Language Models for Speech Recognition

这篇论文探索了将扩散语言模型(DLM)应用于自动语音识别(ASR)任务的新方法。其核心目标是利用扩散模型的双向注意和并行生成能力,来提升基于传统编码器(如CTC)生成的ASR候选假设的准确性。论文主要

 · 更新于 2026-10-02 · 约 9 分钟 · 4324 字 阅读 →
论文解读

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

本文旨在解决全双工语音对话模型(SDMs)实现类人交互的核心挑战。现有自动化评估指标流于表面(如统计行为或预测时机准确率),无法为强化学习提供可靠的奖励信号,而人工评估成本高昂且难以扩展。为此,作者提

 · 更新于 2026-10-02 · 约 12 分钟 · 5601 字 阅读 →
论文解读

Elastic Net Regularization and Gabor Dictionary for Classification of Heart Sound Signals using Deep Learning

本文旨在解决心音信号(PCG)的多分类问题,以辅助心血管疾病的自动诊断。核心贡献在于提出了一套结合**优化Gabor字典**和**弹性网络正则化**的特征提取框架,并与**CNN-LSTM深度学习网络

 · 更新于 2026-10-02 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Enhancing time-frequency resolution with optimal transport and barycentric fusion of multiple spectrogram

**核心问题**:短时傅里叶变换(STFT)生成的谱图受制于不确定性原理,无法同时获得优异的时间和频率分辨率。传统融合方法(如几何平均)要求输入谱图网格对齐,且性能有限。 **核心方法**:本文提出一

 · 更新于 2026-10-02 · 约 12 分钟 · 5832 字 阅读 →