论文解读

Where Do Self-Supervised Speech Models Become Unfair?

这篇论文旨在探究自监督语音模型(S3M)的不公平性究竟在模型的哪个层级产生。研究团队采用了一种轻量级的线性探针方法,在多个S3M(如WavLM, Wav2Vec2, BEST-RQ, Whisper)的每一层嵌入上,同时评估了说话人识别(SID)和自动语音识别(ASR)任务的整体性能及对不同说话人组

 · 更新于 2026-09-25 · 约 8 分钟 · 4007 字 阅读 →
论文解读

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

这篇论文针对阿拉伯语语音识别、方言识别和情感识别中通用多语言/英语模型性能不足、且大模型难以部署的问题,提出了 HArnESS——一个以阿拉伯语为中心的自监督语音模型家族。作者采用 HuBERT 风格的迭代自蒸馏框架,先在大规模阿拉伯语-英语双语数据(约 23K 小时)上训练 24 层的教师模型 H

 · 更新于 2026-09-25 · 约 12 分钟 · 5602 字 阅读 →
论文解读

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务上能力不足且依赖昂贵闭源数据的问题。作者提出了一个名为**Audio-Cogito**的全开源解决方案,其核心是**Cogito-Pip

 · 更新于 2026-09-25 · 约 10 分钟 · 4834 字 阅读 →
论文解读

On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation

本文针对现有语音变分自编码器(VAE)在统一语音重建、理解和生成任务上表现不平衡的问题(尤其是理解能力差),系统性地研究了蒸馏损失函数的设计空间。作者探索了三种将自监督学习(SSL)模型知识蒸馏到VA

 · 更新于 2026-09-25 · 约 10 分钟 · 4890 字 阅读 →
论文解读

ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks

这篇论文旨在解决当前语音深度伪造检测(SDD)系统在面对富有表现力和情感的合成语音攻击时泛化能力不足的核心问题。现有方法过度依赖伪造数据,容易学习数据集特定的伪影,而非自然语音的可迁移特征。为此,作者

 · 更新于 2026-09-25 · 约 10 分钟 · 4935 字 阅读 →
论文解读

Sky-Ear: An Unmanned Aerial Vehicle-Enabled Victim Sound Detection and Localization System

本文针对无人机搜救任务中视觉系统受遮蔽、能耗高的问题,提出了一个名为“Sky-Ear”的音频驱动受害者检测与定位系统。核心方法是设计了一个基于环形麦克风阵列的两阶段处理框架:在“哨兵阶段”,系统利用单

 · 更新于 2026-09-25 · 约 13 分钟 · 6117 字 阅读 →
论文解读

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations

这篇论文旨在解决通用语音增强(USE)中生成模型面临的“高感知质量”与“低内容幻觉”难以兼得的核心矛盾。作者提出了UniPASE框架,它扩展了其先前的低幻觉PASE模型,以处理包括噪声、混响、丢包、风

 · 更新于 2026-09-25 · 约 14 分钟 · 6902 字 阅读 →
论文解读

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

这篇论文旨在解决零样本语音转换中**高保真说话人迁移**与**低延迟流式推理**难以兼得的核心挑战。作者提出了**X-VC**系统,其核心创新在于**在预训练神经编解码器(SAC)的潜在空间中进行一步

 · 更新于 2026-09-25 · 约 10 分钟 · 4920 字 阅读 →