论文解读

Wave-Trainer-Fit: Neural Vocoder With Trainable Prior And Fixed-Point Iteration Towards High-Quality Speech Generation From SSL Features

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5135 字 阅读 →
论文解读

WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6181 字 阅读 →
论文解读

When Audio Matters: A Lightweight, Hierarchical Fusion Model for Speech and Non-Verbal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4926 字 阅读 →
论文解读

Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-Resource Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3795 字 阅读 →
论文解读

Speech Enhancement Based on Drifting Models

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5266 字 阅读 →
论文解读

Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5316 字 阅读 →
论文解读

Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis

发音错误检测 | 8.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6458 字 阅读 →
论文解读

Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4567 字 阅读 →
论文解读

DiariZen Explained: A Tutorial for the Open Source State-of-the-Art Speaker Diarization Pipeline

说话人分离 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4881 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5231 字 阅读 →
论文解读

Time vs. Layer: Locating Predictive Cues for Dysarthric Speech Descriptors in wav2vec 2.0

语音生物标志物 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4210 字 阅读 →
论文解读

Embedding-Based Intrusive Evaluation Metrics for Musical Source Separation Using MERT Representations

1. **问题**:音乐源分离(MSS)领域常用的客观评估指标(BSS-Eval)与人类感知评分相关性较低,导致模型评估不够准确。 2. **方法核心**:提出两种基于嵌入的侵入式评估指标:在预训练MERT模型的嵌入空间上计算目标与分离信号的均方误差(MSE_MERT)和一种逐曲目的Fréchet音

 · 更新于 2026-09-06 · 约 9 分钟 · 4089 字 阅读 →
论文解读

SAND: The Challenge on Speech Analysis for Neurodegenerative Disease Assessment

1. **解决的问题**:针对神经退行性疾病(特别是肌萎缩侧索硬化症ALS)的早期诊断和监测,缺乏大规模、有临床标注的语音数据集,以及标准化的算法评估框架。 2. **方法核心**:构建并发布了名为SAND的挑战赛,其核心是提供一个扩展的、包含纵向数据的ALS患者与健康对照语音数据集(VOC-A

 · 更新于 2026-09-06 · 约 9 分钟 · 4092 字 阅读 →
论文解读

Disentangling Damage from Operational Variability: A Label-Free Self-Supervised Representation Learning Framework for Output-Only Structural Damage Identification

本文针对结构健康监测中损伤信号易被环境与操作变异掩盖的核心挑战,提出了一种**无标签、自监督的解缠表示学习框架**。该框架采用双流自编码器架构,通过**时间序列重构损失**确保信息完整性,并利用**VICReg自监督损失**(基于假设损伤状态不变的基线期数据)强制损伤敏感表征(`z_dmg`)对操作

 · 更新于 2026-09-06 · 约 11 分钟 · 5106 字 阅读 →
论文解读

Incremental learning for audio classification with Hebbian Deep Neural Networks

本文针对音频分类中的增量学习(持续学习)问题,提出了一种受生物启发的解决方案。核心是解决深度学习模型在学习新任务时对旧知识的“灾难性遗忘”。作者首次将**Hebbian学习**(一种基于神经元同步激活的无监督、无反馈学习规则)与**增量学习**相结合,并设计了一个**核塑性**机制。该机制通过分析训

 · 更新于 2026-09-06 · 约 8 分钟 · 3781 字 阅读 →
论文解读

Neural Encoding Detection is Not All You Need for Synthetic Speech Detection

这篇综述论文的核心贡献在于**揭示并论证了当前合成语音检测领域的一个关键误区:过度依赖“神经编码检测”**。论文首先系统回顾了基于SincNet、自监督学习(SSL)和神经编码检测的三类数据驱动方法,指出当前性能最佳的SSL模型实际上主要捕捉的是声码器(vocoder)在波形生成阶段引入的痕迹,而非

 · 更新于 2026-09-06 · 约 9 分钟 · 4114 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

这篇论文旨在解决低资源多语言语音情感识别(SER)中标注数据稀缺的核心瓶颈。作者提出了一个颠覆性的范式:**将SER重新定义为无监督的“非言语到言语”迁移问题**。其核心假设是,非言语发声(如笑、哭)中蕴含的韵律情感线索比言语更纯粹、更跨语言,因此可以作为更好的监督源。为此,作者设计了**NOVA-

 · 更新于 2026-09-06 · 约 13 分钟 · 6176 字 阅读 →
论文解读

Where Do Self-Supervised Speech Models Become Unfair?

这篇论文旨在探究自监督语音模型(S3M)的不公平性究竟在模型的哪个层级产生。研究团队采用了一种轻量级的线性探针方法,在多个S3M(如WavLM, Wav2Vec2, BEST-RQ, Whisper)的每一层嵌入上,同时评估了说话人识别(SID)和自动语音识别(ASR)任务的整体性能及对不同说话人组

 · 更新于 2026-09-06 · 约 8 分钟 · 4007 字 阅读 →
论文解读

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

这篇论文针对阿拉伯语语音识别、方言识别和情感识别中通用多语言/英语模型性能不足、且大模型难以部署的问题,提出了 HArnESS——一个以阿拉伯语为中心的自监督语音模型家族。作者采用 HuBERT 风格的迭代自蒸馏框架,先在大规模阿拉伯语-英语双语数据(约 23K 小时)上训练 24 层的教师模型 H

 · 更新于 2026-09-06 · 约 12 分钟 · 5602 字 阅读 →
论文解读

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

这篇论文旨在解决大型音频语言模型(LALMs)在复杂音频推理任务上能力不足且依赖昂贵闭源数据的问题。作者提出了一个名为**Audio-Cogito**的全开源解决方案,其核心是**Cogito-Pip

 · 更新于 2026-09-06 · 约 10 分钟 · 4834 字 阅读 →