论文解读

Classical Machine Learning Baselines for Deepfake Audio Detection on the Fake-or-Real Dataset

本文旨在解决深度伪造音频检测领域缺乏透明、可解释基线的问题。研究团队采用经典机器学习方法,在Fake-or-Real (FoR) 数据集上构建了一个完整的检测流程。他们从高保真(44.1 kHz)和电

 · 更新于 2026-09-11 · 约 10 分钟 · 4970 字 阅读 →
论文解读

Comparison of window shapes and lengths in short-time feature extraction for classification of heart sound signals

本文针对心音信号(PCG)分类任务中,因信号非-stationarity而采用滑动窗口分段提取特征时,窗函数形状和长度选择缺乏系统性研究的问题,进行了一项实验性评估。作者使用双向长短期记忆网络(biL

 · 更新于 2026-09-11 · 约 7 分钟 · 3490 字 阅读 →
论文解读

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

这篇论文旨在解决语音大模型(SLLM)在识别训练数据中稀有或未见的“偏置词”时性能不佳的问题。传统方法依赖于为偏置词提供精确的音素序列(通过G2P系统生成),但这对用户有专业要求且工具兼容性差。为此,

 · 更新于 2026-09-11 · 约 11 分钟 · 5353 字 阅读 →
论文解读

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

本文提出了ControlFoley,一个统一且可控的视频到音频生成框架,旨在解决现有方法在跨模态冲突下文本控制力弱、以及参考音频控制中音色与时间信息纠缠的问题。其核心贡献包括:1)提出联合视觉编码范式

 · 更新于 2026-09-11 · 约 13 分钟 · 6198 字 阅读 →
论文解读

CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing

本文针对电影配音(视觉语音克隆)中音色保真度与唇形同步难以兼得的痛点,提出了一种基于流匹配的认知同步扩散Transformer(CoSyncDiT)框架。该方法受专业配音员认知过程启发,将噪声到语音的

 · 更新于 2026-09-11 · 约 12 分钟 · 5835 字 阅读 →
论文解读

Diffusion Language Models for Speech Recognition

这篇论文探索了将扩散语言模型(DLM)应用于自动语音识别(ASR)任务的新方法。其核心目标是利用扩散模型的双向注意和并行生成能力,来提升基于传统编码器(如CTC)生成的ASR候选假设的准确性。论文主要

 · 更新于 2026-09-11 · 约 9 分钟 · 4324 字 阅读 →
论文解读

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

本文旨在解决全双工语音对话模型(SDMs)实现类人交互的核心挑战。现有自动化评估指标流于表面(如统计行为或预测时机准确率),无法为强化学习提供可靠的奖励信号,而人工评估成本高昂且难以扩展。为此,作者提

 · 更新于 2026-09-11 · 约 12 分钟 · 5601 字 阅读 →
论文解读

Elastic Net Regularization and Gabor Dictionary for Classification of Heart Sound Signals using Deep Learning

本文旨在解决心音信号(PCG)的多分类问题,以辅助心血管疾病的自动诊断。核心贡献在于提出了一套结合**优化Gabor字典**和**弹性网络正则化**的特征提取框架,并与**CNN-LSTM深度学习网络

 · 更新于 2026-09-11 · 约 10 分钟 · 4594 字 阅读 →
论文解读

Enhancing time-frequency resolution with optimal transport and barycentric fusion of multiple spectrogram

**核心问题**:短时傅里叶变换(STFT)生成的谱图受制于不确定性原理,无法同时获得优异的时间和频率分辨率。传统融合方法(如几何平均)要求输入谱图网格对齐,且性能有限。 **核心方法**:本文提出一

 · 更新于 2026-09-11 · 约 12 分钟 · 5832 字 阅读 →
论文解读

Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models

本文旨在解决非侵入式语音质量评估在标注数据有限场景下的性能瓶颈。作者提出了GatherMOS框架,其核心是将大语言模型(如GPT-5)作为一个元评估器,通过精心设计的文本提示,融合多类异构信号:包括手

 · 更新于 2026-09-11 · 约 10 分钟 · 4519 字 阅读 →
论文解读

Four Decades of Digital Waveguides

这篇论文旨在全面回顾数字波导物理建模技术自诞生以来四十年的发展历程、核心应用与最新进展。它要解决的核心问题是,如何在保证物理模拟准确性的同时,实现声波传播模拟的高效计算,以满足实时音频处理(如虚拟乐器

 · 更新于 2026-09-11 · 约 8 分钟 · 3950 字 阅读 →
论文解读

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

本文旨在解决当前语音代理评估中过度关注被动响应,而忽视其主动交互能力的问题。为此,作者提出了首个专门评估主动语音代理的基准测试框架 **ProVoice-Bench**。该框架包含四个新颖的任务,用以

 · 更新于 2026-09-11 · 约 8 分钟 · 3948 字 阅读 →
论文解读

Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery

这篇论文提出了一个名为 **Geo2Sound** 的新任务和框架,旨在从卫星图像生成地理上一致且逼真的声音景观。**要解决的问题**是现有图像到音频模型在处理自上而下的卫星视图时面临三大挑战:缺乏结

 · 更新于 2026-09-11 · 约 13 分钟 · 6095 字 阅读 →
论文解读

Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection

这篇论文揭示了针对音频大语言模型(LALM)的一种新型安全威胁:**上下文无关且不可感知的音频提示注入攻击**。攻击者仅需篡改输入音频数据(如会议录音、音乐片段),即可在用户不知情的情况下,劫持模型行

 · 更新于 2026-09-11 · 约 14 分钟 · 6905 字 阅读 →
论文解读

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

本文旨在解决大型音频语言模型在复杂音频场景中因感知错误导致的推理失败问题。受听觉场景分析启发,作者提出了一个感知接地的混合推理框架。首先,他们构建了一个名为PAQA的新数据集,通过层次化解耦策略(区分

 · 更新于 2026-09-11 · 约 13 分钟 · 6065 字 阅读 →
论文解读

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

本文首次提出了“聆听深度伪造检测”这一新任务,旨在识别视频中人物在倾听状态下(非说话时)的伪造反应,弥补了现有研究主要集中于“说话”场景的不足。为解决此任务数据稀缺的问题,作者构建了首个专门数据集Li

 · 更新于 2026-09-11 · 约 9 分钟 · 4253 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

本文提出了MoshiRAG,这是首个集成检索增强生成功能的全双工语音语言模型。**要解决的问题**是全双工语音模型在保持实时交互性的同时,事实准确性不足的挑战。**核心方法**是基于Moshi模型,设

 · 更新于 2026-09-11 · 约 11 分钟 · 5300 字 阅读 →
论文解读

On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation

本文针对现有语音变分自编码器(VAE)在统一语音重建、理解和生成任务上表现不平衡的问题(尤其是理解能力差),系统性地研究了蒸馏损失函数的设计空间。作者探索了三种将自监督学习(SSL)模型知识蒸馏到VA

 · 更新于 2026-09-11 · 约 10 分钟 · 4890 字 阅读 →
论文解读

ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks

这篇论文旨在解决当前语音深度伪造检测(SDD)系统在面对富有表现力和情感的合成语音攻击时泛化能力不足的核心问题。现有方法过度依赖伪造数据,容易学习数据集特定的伪影,而非自然语音的可迁移特征。为此,作者

 · 更新于 2026-09-11 · 约 10 分钟 · 4935 字 阅读 →
论文解读

Room compensation for loudspeaker reproduction using a supporting source

本文针对传统房间补偿技术仅能修正频谱(音色)而无法控制空间感知(如距离感)的局限,提出了一种创新的补偿方法。该方法通过引入一个延迟的、经过频谱滤波的辅助扬声器,选择性地向房间的混响声场中添加能量,从而

 · 更新于 2026-09-11 · 约 8 分钟 · 3648 字 阅读 →