论文解读

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

说话人识别 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4860 字 阅读 →
论文解读

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11361 字 阅读 →
论文解读

LISE : Listenable Interpretable Speaker Embeddings

说话人验证 | 6.8/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5422 字 阅读 →
论文解读

Stabilizing Short Duration Speaker Verification through Neural Re-scoring with Hybrid Enrollment

说话人验证 | 7.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5781 字 阅读 →
论文解读

MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

说话人识别 | 9.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5703 字 阅读 →
论文解读

Multimodal Speaker Identification in Classroom Environments

说话人识别 | 6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5508 字 阅读 →
论文解读

Who Spoke When in Multi-Conversation: Target Speaker Tagging Task and Benchmark

说话人识别 | 8.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4749 字 阅读 →
论文解读

Missing-Token Prompted Reliability-Aware Fusion for Robust Polyglot Speaker Identification

说话人识别 | 8.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5723 字 阅读 →
论文解读

Speaker Group Encoding in Self-supervised Speech Recognition Models

语音识别 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5916 字 阅读 →
论文解读

G-MaP-SE: Guided Speech Enhancement via GMM-Based Prior Matching

语音增强 | 9.3/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5176 字 阅读 →
论文解读

A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization

语音匿名化 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5018 字 阅读 →
论文解读

Do speech foundation models perceive speaker similarity as humans do?

说话人识别 | 6.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6169 字 阅读 →
论文解读

To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

说话人识别 | 6.8/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13289 字 阅读 →
论文解读

Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report

说话人验证 | 5.5/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9548 字 阅读 →
论文解读

Evaluating voice anonymisation using similarity rank disclosure

Evaluating voice anonymisation using similarity rank disclosure

 · 更新于 2026-09-24 · 约 15 分钟 · 7465 字 阅读 →
论文解读

TARNet: A Temporal-Aware Multi-Scale Architecture for Closed-Set Speaker Identification

TARNet: A Temporal-Aware Multi-Scale Architecture for Closed-Set Speaker Identification

 · 更新于 2026-09-24 · 约 18 分钟 · 8941 字 阅读 →
论文解读

Multi-Axis Speech Similarity via Factor-Partitioned Embeddings

音频检索 | 6.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4834 字 阅读 →
论文解读

Spoken Language Identification with Pre-trained Models and Margin Loss

说话人识别 | 7.5/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3725 字 阅读 →
论文解读

Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

模型评估 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4999 字 阅读 →
论文解读

A Personalized Real-Time Proactive Voice Memory Assistant

实时处理 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4384 字 阅读 →