论文解读

VoXtream: Full-Stream Text-To-Speech With Extremely Low Latency

语音合成 | 8.5/10

 · 更新于 2026-09-17 · 约 13 分钟 · 6227 字 阅读 →
论文解读

VT-Heads: Voice Cloning and Talking Head Generation from Text Based on V-DiT

视频生成 | 6.5/10

 · 更新于 2026-09-17 · 约 8 分钟 · 3563 字 阅读 →
论文解读

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-17 · 约 8 分钟 · 3527 字 阅读 →
论文解读

WAV2LEV: Predicting Levenshtein Edit Operation Sequences For Fine-Grained Estimation of Automatic Speech Recognition Error

语音识别 | 7.5/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Wave-Trainer-Fit: Neural Vocoder With Trainable Prior And Fixed-Point Iteration Towards High-Quality Speech Generation From SSL Features

语音合成 | 7.0/10

 · 更新于 2026-09-17 · 约 11 分钟 · 5135 字 阅读 →
论文解读

Wavenext 2: Convnext-Based Fast Neural Vocoders with Residual Denoising and Sub-Modeling for Gan And Diffusion Models

语音合成 | 9.0/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4717 字 阅读 →
论文解读

WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-17 · 约 13 分钟 · 6181 字 阅读 →
论文解读

WaveSpikeNet: A Wavelet-Spiking Fusion Architecture for Audio Classification on Edge Devices

音频分类 | 7.5/10

 · 更新于 2026-09-17 · 约 14 分钟 · 6552 字 阅读 →
论文解读

WavLink: Compact Audio–Text Embeddings with a Global Whisper Token

音频检索 | 8.0/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4681 字 阅读 →
论文解读

What the student learns in knowledge distillation: A subspace view and evidence on Convolutional Recurrent Network

语音增强 | 6.5/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4287 字 阅读 →
论文解读

When Audio Matters: A Lightweight, Hierarchical Fusion Model for Speech and Non-Verbal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4926 字 阅读 →
论文解读

When Children Talk and Machines Listen: Toward an Interpretable Speech-Based Screener for Dutch Developmental Language Disorder

语音生物标志物 | 7.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4304 字 阅读 →
论文解读

When Noise Lowers the Loss: Rethinking Likelihood-Based Evaluation in Music Large Language Models

音乐生成 | 7.0/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4847 字 阅读 →
论文解读

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4322 字 阅读 →
论文解读

When Voice Matters: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making

模型评估 | 7.0/10

 · 更新于 2026-09-17 · 约 8 分钟 · 3980 字 阅读 →
论文解读

Whisper-FEST: Single-Channel Far-Field Enhanced Speech-to-text without Parallel Data

语音识别 | 7.5/10

 · 更新于 2026-09-17 · 约 10 分钟 · 4962 字 阅读 →
论文解读

Whisper-MLA: Reducing GPU Memory Consumption of ASR Models Based on MHA2MLA Conversion

语音识别 | 7.0/10

 · 更新于 2026-09-17 · 约 9 分钟 · 4484 字 阅读 →
论文解读

Whisper-QF: Leveraging Dual Cross-Attention Q-Former for Speech Emotion Recognition With Multi-Task Learning

语音情感识别 | 7.5/10

 · 更新于 2026-09-17 · 约 11 分钟 · 5139 字 阅读 →
论文解读

Whisper: Courtside Edition - Enhancing ASR Performance through LLM-Driven Context Generation

语音识别 | 6.5/10

 · 更新于 2026-09-17 · 约 7 分钟 · 3477 字 阅读 →
论文解读

WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-17 · 约 7 分钟 · 3139 字 阅读 →