论文解读

A Comparison of SSL-Based Feature Extractors and Back-End Classifiers for Spoofing Detection: A Multi-Corpus Training and Cross-Linguistic Analysis

自监督学习 | 5/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10637 字 阅读 →
论文解读

Cross-Modal Masking for Robust Silent Speech Synthesis Using sEMG and Lipreading

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7716 字 阅读 →
论文解读

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

多模态模型 | 8.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5464 字 阅读 →
论文解读

Exploring the Scale and Diversity of Speech Anti-spoofing Datasets: Experiments and Analysis

数据增强 | 7.4/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8394 字 阅读 →
论文解读

Few-shot Class-variable Incremental Audio Classification via Prototype Adaptation and Pseudo Class-variable Training

音频分类 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5750 字 阅读 →
论文解读

Liberating LLM Capabilities in Full-Duplex Speech Models

多模态模型 | 8.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8443 字 阅读 →
论文解读

MeanVC 2: Robust Low-Latency Streaming Zero-Shot Voice Conversion

语音转换 | 6.9/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11480 字 阅读 →
论文解读

Paediatric-HGNN: A Hybrid Heterogeneous Graph Neural Network for Detecting Disfluency in Children's Speech via Multiscale Acoustic Fusion

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7186 字 阅读 →
论文解读

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5503 字 阅读 →
论文解读

dots.tts Technical Report

语音合成 | 9/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3032 字 阅读 →
论文解读

Mitigating Proxy-to-Wild Domain Gap in Deepfake Speech

数据增强 | 8.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6757 字 阅读 →
论文解读

MyGardenBird: A Machine-Learning-Ready Bird Sound Dataset for Twelve Common Malaysian Birds

音频事件检测 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5600 字 阅读 →
论文解读

SpectCount: Spectrotemporal Counting via Synthetic Signals Improves Large Audio Language Models

数据增强 | 5.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4925 字 阅读 →
论文解读

Towards Event-Robust Acoustic Scene Classification

数据增强 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4996 字 阅读 →
论文解读

CoSTA: Cognitive-State-Conditioned TTS Data Augmentation Using ASR Transcripts for Alzheimer's Disease Detection

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1509 字 阅读 →
论文解读

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8421 字 阅读 →
论文解读

Channel-Oriented Design for EEG-to-Music Reconstruction

音乐生成 | 7.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4877 字 阅读 →
论文解读

Drift-Augmented Scoring: Text-Derived Noise Robustness for Zero-Shot Audio-Language Classification

音频分类 | 10/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4712 字 阅读 →
论文解读

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

语音识别 | 10/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6280 字 阅读 →
论文解读

A Training-Efficient Transformer-Based Anti-Spoofing Network for Logical Access in ASVspoof 5

Transformer | 6.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6690 字 阅读 →