论文解读

AR&D: A Framework for Retrieving and Describing Concepts for Interpreting AudioLLMs

音频大模型 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4439 字 阅读 →
论文解读

Ara-BEST-RQ: Multi Dialectal Arabic SSL

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4587 字 阅读 →
论文解读

ARCHI-TTS: A Flow-Matching-Based Text-to-Speech Model with Self-Supervised Semantic Aligner and Accelerated Inference

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6329 字 阅读 →
论文解读

Assessing the Impact of Speaker Identity in Speech Spoofing Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4764 字 阅读 →
论文解读

Attention-Based Encoder-Decoder Target-Speaker Voice Activity Detection for Robust Speaker Diarization

说话人分离 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5395 字 阅读 →
论文解读

Automatic Music Sample Identification with Multi-Track Contrastive Learning

音频检索 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4382 字 阅读 →
论文解读

AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4987 字 阅读 →
论文解读

Auxiliary Multi-Label Training For Improving the Robustness of Audio Deepfake Detection on AI-Processed Data

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3885 字 阅读 →
论文解读

B-GRPO: Unsupervised Speech Emotion Recognition Based on Batched-Group Relative Policy Optimization

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4316 字 阅读 →
论文解读

BEST-RQ-based Self-Supervised Learning for Whisper Domain Adaptation

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5130 字 阅读 →
论文解读

BEST-STD 2.0: Balanced and Efficient Speech Tokenizer for Spoken Term Detection

音频检索 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5339 字 阅读 →
论文解读

BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4898 字 阅读 →
论文解读

Combining SSL Speech Features, Contextual Transformers and Mamba Models for Realistic Audio Spoofing Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4304 字 阅读 →
论文解读

Connecting Layer-Wise Representation of Wavlm with Spectro-Temporal Modulation on Speaker Verification

说话人验证 | 6.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4366 字 阅读 →
论文解读

Content-Preserving Speech Representation Learning Via Adaptive Segment-Level Alignment

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5415 字 阅读 →
论文解读

Cross-Architecture Knowledge Distillation of WavLM for Lightweight Speaker Verification

说话人验证 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6123 字 阅读 →
论文解读

CTC-DID: CTC-Based Arabic Dialect Identification for Streaming Applications

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4764 字 阅读 →
论文解读

Direct Transfer of Prosody in Speech-to-speech Translation using Disentangled Speech Tokens

语音翻译 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4896 字 阅读 →
论文解读

Discrete-Continuous Fusion With Adaptive Hierarchical Features For Audio Deepfake Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4332 字 阅读 →
论文解读

Do Foundational Audio Encoders Understand Music Structure?

音乐信息检索 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3755 字 阅读 →