论文解读

Assessing the Impact of Speaker Identity in Speech Spoofing Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4764 字 阅读 →
论文解读

Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding

语音编码器 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4347 字 阅读 →
论文解读

Does the Pre-Training of an Embedding Influence its Encoding of Age?

语音生物标志物 | 7.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3128 字 阅读 →
论文解读

DPO-Regularized Regression for Age Prediction

说话人识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4470 字 阅读 →
论文解读

Erasing Your Voice Before it’s Heard: Training-Free Speaker Unlearning for Zero-Shot Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5260 字 阅读 →
会议任务专题

ICASSP 2026 - 说话人识别

共 1 篇 ICASSP 2026 说话人识别 方向论文

 · 更新于 2026-09-24 · 约 3 分钟 · 1222 字 阅读 →
论文解读

Improving the Speaker Anonymization Evaluation’s Robustness to Target Speakers with Adversarial Learning

语音匿名化 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5692 字 阅读 →
论文解读

PRSA: Preventing Malicious Speaker Recognition and Speech Synthesis Simultaneously with Adversarial Examples

语音匿名化 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4445 字 阅读 →
论文解读

UNet-Based Fusion and Exponential Moving Average Adaptation for Noise-Robust Speaker Recognition

说话人验证 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5394 字 阅读 →
论文解读

Explainable AI in Speaker Recognition -- Making Latent Representations Understandable

说话人识别 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3672 字 阅读 →
论文解读

Where Do Self-Supervised Speech Models Become Unfair?

这篇论文旨在探究自监督语音模型(S3M)的不公平性究竟在模型的哪个层级产生。研究团队采用了一种轻量级的线性探针方法,在多个S3M(如WavLM, Wav2Vec2, BEST-RQ, Whisper)的每一层嵌入上,同时评估了说话人识别(SID)和自动语音识别(ASR)任务的整体性能及对不同说话人组

 · 更新于 2026-09-24 · 约 8 分钟 · 4007 字 阅读 →
论文解读

SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model Fusion

本文旨在解决开放集说话人识别中的鲁棒性问题,即系统在仅有少量目标说话人注册样本的情况下,需同时准确识别已知说话人并可靠拒识未知说话人。作者在先前SpeakerRPL V1框架基础上提出了三项关键改进:

 · 更新于 2026-09-24 · 约 10 分钟 · 4758 字 阅读 →
论文解读

Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection

这篇论文的核心贡献在于系统性地揭示并量化了语音抑郁症检测模型中普遍存在的“说话人身份泄露”问题。作者指出,当前许多报告高准确率的模型,其性能可能严重依赖于对说话人身份(声纹)的记忆,而非对抑郁相关声学

 · 更新于 2026-09-24 · 约 11 分钟 · 5416 字 阅读 →