论文解读

WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6181 字 阅读 →
论文解读

WaveSpikeNet: A Wavelet-Spiking Fusion Architecture for Audio Classification on Edge Devices

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6552 字 阅读 →
论文解读

WavLink: Compact Audio–Text Embeddings with a Global Whisper Token

音频检索 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4681 字 阅读 →
论文解读

What the student learns in knowledge distillation: A subspace view and evidence on Convolutional Recurrent Network

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4287 字 阅读 →
论文解读

When Audio Matters: A Lightweight, Hierarchical Fusion Model for Speech and Non-Verbal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4926 字 阅读 →
论文解读

When Children Talk and Machines Listen: Toward an Interpretable Speech-Based Screener for Dutch Developmental Language Disorder

语音生物标志物 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4304 字 阅读 →
论文解读

When Noise Lowers the Loss: Rethinking Likelihood-Based Evaluation in Music Large Language Models

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4847 字 阅读 →
论文解读

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4322 字 阅读 →
论文解读

When Voice Matters: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making

模型评估 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3980 字 阅读 →
论文解读

Whisper-FEST: Single-Channel Far-Field Enhanced Speech-to-text without Parallel Data

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4962 字 阅读 →
论文解读

Whisper-MLA: Reducing GPU Memory Consumption of ASR Models Based on MHA2MLA Conversion

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4484 字 阅读 →
论文解读

Whisper-QF: Leveraging Dual Cross-Attention Q-Former for Speech Emotion Recognition With Multi-Task Learning

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5139 字 阅读 →
论文解读

Whisper: Courtside Edition - Enhancing ASR Performance through LLM-Driven Context Generation

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3477 字 阅读 →
论文解读

Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective

语音生成 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4296 字 阅读 →
论文解读

Windowed SummaryMixing: An Efficient Fine-Tuning of Self-Supervised Learning Models for Low-Resource Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3795 字 阅读 →
论文解读

Z-Scores: A Metric for Linguistically Assessing Disfluency Removal

模型评估 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4710 字 阅读 →
论文解读

ZK-VSA: Zero-Knowledge Verifiable Speaker Anonymization Leveraging Phase Vocoder with Time-Scale Modification

语音匿名化 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4541 字 阅读 →
论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4244 字 阅读 →
论文解读

β-AVSDNET: A Novel End-To-End Neural Network Architecture For Audio-Visual Speaker Diarization

说话人分离 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5853 字 阅读 →