论文解读

Vioptt: Violin Technique-Aware Transcription from Synthetic Data Augmentation

音乐信息检索 | 6.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4985 字 阅读 →
论文解读

Virtual Consistency for Audio Editing

音乐生成 | 8.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4718 字 阅读 →
论文解读

Visual Keys to Symphonies: Latent Diffusion for Multi-Scene Video-to-Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5068 字 阅读 →
论文解读

ViTex: Visual Texture Control for Multi-Track Symbolic Music Generation via Discrete Diffusion Models

音乐生成 | 7.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3841 字 阅读 →
论文解读

VividTalker: A Modular Framework for Expressive 3D Talking Avatars with Controllable Gaze and Blink

语音合成 | 7.5/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5244 字 阅读 →
论文解读

VM-UNSSOR: Unsupervised Neural Speech Separation Enhanced by Higher-SNR Virtual Microphone Arrays

语音分离 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4787 字 阅读 →
论文解读

VMSP: Video-to-Music Generation with Two-Stage Alignment and Synthesis

音乐生成 | 7.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4643 字 阅读 →
论文解读

Vocalnet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction

语音对话系统 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3960 字 阅读 →
论文解读

Voting-Based Pitch Estimation with Temporal and Frequential Alignment and Correlation Aware Selection

语音识别 | 8.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5178 字 阅读 →
论文解读

VoxMorph: Scalable Zero-Shot Voice Identity Morphing via Disentangled Embeddings

语音克隆 | 9.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5242 字 阅读 →
论文解读

VoXtream: Full-Stream Text-To-Speech With Extremely Low Latency

语音合成 | 8.5/10

 · 更新于 2026-09-16 · 约 13 分钟 · 6227 字 阅读 →
论文解读

VT-Heads: Voice Cloning and Talking Head Generation from Text Based on V-DiT

视频生成 | 6.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3563 字 阅读 →
论文解读

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

音频问答 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3527 字 阅读 →
论文解读

WAV2LEV: Predicting Levenshtein Edit Operation Sequences For Fine-Grained Estimation of Automatic Speech Recognition Error

语音识别 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Wave-Trainer-Fit: Neural Vocoder With Trainable Prior And Fixed-Point Iteration Towards High-Quality Speech Generation From SSL Features

语音合成 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5135 字 阅读 →
论文解读

Wavenext 2: Convnext-Based Fast Neural Vocoders with Residual Denoising and Sub-Modeling for Gan And Diffusion Models

语音合成 | 9.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4717 字 阅读 →
论文解读

WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-16 · 约 13 分钟 · 6181 字 阅读 →
论文解读

WaveSpikeNet: A Wavelet-Spiking Fusion Architecture for Audio Classification on Edge Devices

音频分类 | 7.5/10

 · 更新于 2026-09-16 · 约 14 分钟 · 6552 字 阅读 →
论文解读

WavLink: Compact Audio–Text Embeddings with a Global Whisper Token

音频检索 | 8.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4681 字 阅读 →
论文解读

What the student learns in knowledge distillation: A subspace view and evidence on Convolutional Recurrent Network

语音增强 | 6.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4287 字 阅读 →